Explorative Datenanalyse mit Python-Bibliotheken

Jan 03 2023
Hallo Benutzer, ich schreibe diesen Blog basierend auf meinen bisherigen Erkenntnissen zur Datenanalyse und -exploration mithilfe von Python-Bibliotheken, die Ihnen helfen können, Dateneinblicke programmgesteuert abzuleiten, ohne Excel zu verwenden. In der Welt der digitalen Transformation möchte jeder Kunde seine Geschäftsentscheidungen automatisieren auf der Grundlage ihrer Kundenbindungs- und Verhaltensdaten durch die Analyse ihres vergangenen Verhaltens. Dieses Verhalten wird mithilfe von Descriptive Analytics und Predictive Analytics analysiert.

Hallo Benutzer, ich schreibe diesen Blog basierend auf meinen bisherigen Erkenntnissen zur Datenanalyse und -exploration mit Python-Bibliotheken, die Ihnen helfen können, Dateneinblicke programmgesteuert ohne Excel abzuleiten

In der Welt der digitalen Transformation möchte jeder Kunde seine Geschäftsentscheidungen auf der Grundlage seiner Kundenbindungs- und Verhaltensdaten automatisieren, indem er sein vergangenes Verhalten analysiert.

Dieses Verhalten wird mithilfe von Descriptive Analytics und Predictive Analytics analysiert.

Descriptive Analytics ist der Prozess der Verwendung aktueller und historischer Daten zur Identifizierung von Trends und Zusammenhängen .

Hauptsächlich Data-Science-Ingenieure und ML-Ingenieure verwenden deskriptive Statistiken, um sich über die Daten zu informieren und sie zu analysieren, was der erste Prozess zum Erstellen eines Lernmodells oder Klassifizierungsmodells ist

Hier erwähne ich einige Python-Bibliotheken, die Ihnen beim Lesen und Analysieren der Datenstatistiken helfen können.

Der erste Schritt besteht darin, Python über diesen Link in Ihrem System zu installieren, wenn Sie Python noch nicht installiert haben

Ich würde vorschlagen, dass Sie Anaconda Navigator installieren und dafür den Jupyter-Kernel verwenden

Als nächstes müssen Sie Ihren Datensatz erstellen oder Sie können auch einen beliebigen Datensatz von herunterladenhttps://www.kaggle.com/

Bibliotheken laden

import numpy             as np
import pandas            as pd
import scipy.stats       as stats
import matplotlib.pyplot as plt
import seaborn as sns

df=pd.read_csv('basket.csv')
df.head()


df.shape

df.info()

Bedeuten

print("Data:",df.mean())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data:",df.median())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data:",df.mode())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data_quantile(25%):",df.quantile(q=0.25))

print("Data_quantile(50%):",df.quantile(q=0.5))

print("Data quantile(75%):",df.quantile(q=0.75))

print("Data standard deviation:",df.std())

print("Data variance :",df.var())

print("Data summary:",df.describe())

print("Data info:",df.info())

print("Data covariance:",df.cov())

print("Data correlation:",df.corr())

data_column = df['column_name']

Im nächsten Blog werde ich Teil 2 der explorativen Datenanalyse unter Verwendung der Graphbibliothek als SNS und maxplotlib erwähnen, wo Sie mehr über das Plotten der Analyse als univariat, bivariat und multivariat für die gegebenen Daten erfahren können.

Fazit

Nach dem Lesen dieses Blogs sollten Benutzer in der Lage sein, grundlegende Datenanalysen mit Python-APIs durchzuführen. Der Benutzer hat sich mit den beschreibenden Merkmalen von Daten vertraut gemacht und die Daten mithilfe der oben genannten API-Funktionen visualisiert.