Analyse exploratoire de données à l'aide de bibliothèques Python

Jan 03 2023
Bonjour les utilisateurs, j'écris ce blog sur la base de mes apprentissages antérieurs sur l'analyse et l'exploration de données à l'aide de bibliothèques python qui peuvent vous aider à obtenir des informations sur les données par programme sans utiliser Excel Dans le monde de la transformation numérique, chacun des clients souhaite automatiser ses décisions commerciales sur la base de leur engagement client et de données comportementales en analysant leurs comportements passés. Ce comportement est analysé à l'aide d'analyses descriptives et d'analyses prédictives.

Bonjour les utilisateurs, j'écris ce blog sur la base de mes apprentissages antérieurs sur l'analyse et l'exploration de données à l'aide de bibliothèques python qui peuvent vous aider à obtenir des informations sur les données par programmation sans utiliser Excel

Dans le monde de la transformation numérique, chacun des clients souhaite automatiser ses décisions commerciales sur la base de son engagement client et de données comportementales en analysant ses comportements passés.

Ce comportement est analysé à l'aide d'analyses descriptives et d'analyses prédictives.

L'analyse descriptive est le processus d'utilisation des données actuelles et historiques pour identifier les tendances et les relations .

Les ingénieurs en science des données et les ingénieurs ML utilisent principalement des statistiques descriptives pour lire les données et les analyser, ce qui est le premier processus de création d'un modèle d'apprentissage ou d'un modèle de classification.

Ici, je mentionne quelques bibliothèques python qui peuvent vous aider à lire et à analyser les statistiques de données.

La première étape consiste à installer python sur votre système en utilisant ce lien si vous n'avez pas encore installé python

Je vous suggère d'installer anaconda Navigator et d'utiliser le noyau Jupyter pour cela

Ensuite, vous devez créer votre ensemble de données ou vous pouvez également télécharger n'importe quel ensemble de données à partir dehttps://www.kaggle.com/

Charger les bibliothèques

import numpy             as np
import pandas            as pd
import scipy.stats       as stats
import matplotlib.pyplot as plt
import seaborn as sns

df=pd.read_csv('basket.csv')
df.head()


df.shape

df.info()

Moyenne

print("Data:",df.mean())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data:",df.median())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data:",df.mode())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data_quantile(25%):",df.quantile(q=0.25))

print("Data_quantile(50%):",df.quantile(q=0.5))

print("Data quantile(75%):",df.quantile(q=0.75))

print("Data standard deviation:",df.std())

print("Data variance :",df.var())

print("Data summary:",df.describe())

print("Data info:",df.info())

print("Data covariance:",df.cov())

print("Data correlation:",df.corr())

data_column = df['column_name']

Dans le prochain blog, je mentionnerai la partie 2 de l'analyse exploratoire des données à l'aide de la bibliothèque de graphes comme SNS et maxplotlib où vous pourrez en apprendre davantage sur le traçage de l'analyse en tant qu'analyse univariée, bivariée et multivariée pour les données données.

Conclusion

Après avoir lu ce blog, les utilisateurs devraient pouvoir effectuer une analyse de données de base à l'aide d'API Python. L'utilisateur s'est familiarisé avec les caractéristiques descriptives des données et a visualisé les données à l'aide des fonctions API ci-dessus.