Concepts de base que tout data scientist débutant devrait connaître !
Lorsque nous traitons des données, quel que soit leur volume, mieux elles sont cartographiées, plus il nous est facile de les gérer. En science des données, il existe un terme appelé estimations de localisation. Comme son nom l'indique, nous sommes en mesure de cartographier des données distinctes en fonction de leurs valeurs par rapport au reste. Une estimation courante de l'emplacement dans les statistiques quotidiennes serait la valeur moyenne d'une agrégation. La valeur moyenne se présente comme un point quelque part au milieu du reste de nos données. Gardant cela à l'esprit, voyons les EoL les plus importantes que tout data scientist devrait connaître.
Moyenne
La fin de vie la plus élémentaire de cette liste sera la valeur moyenne. La moyenne est la somme de toutes nos données divisée par le nombre total de nos données. La moyenne peut être considérée comme la valeur moyenne d'un ensemble de données.
Moyenne pondérée
Comme il est probablement évident, la moyenne pondérée est simplement une valeur moyenne pondérée. Cela signifie que la moyenne pondérée est la valeur moyenne mais qu'elle est davantage influencée par certaines données. Deux raisons principales expliquent cette discrimination. La première raison est la représentation inégale des groupes qui nous intéressent du fait des données collectées. Un poids plus élevé aux groupes sous-représentés serait une solution. La deuxième raison est que dans de nombreux scénarios réalistes de collecte de données, il pourrait y avoir des écarts dans nos données en raison de mesures erronées. Cela pourrait également être résolu en appliquant un poids inférieur à ces données. La moyenne pondérée est le produit de toutes les données multipliées (chacune) par un poids, puis leur somme divisée par la somme des poids que nous avons appliqués.
Médian
La valeur médiane peut être considérée comme la valeur médiane d'un ensemble de données. Il fait référence au point qui sépare l'ensemble en une moitié supérieure et une moitié inférieure. Personnellement, je pense que plus nous discutons de la médiane en tant que concept, plus cela pourrait devenir compliqué à comprendre. Alors sur le calcul de la médiane dans un ensemble de données. Nous trions d'abord les données par ordre croissant. S'il y a un nombre impair de données, la valeur médiane est celle du milieu de l'ensemble. Si le nombre de données est pair, la valeur médiane est égale à la somme des deux valeurs qui séparent l'ensemble en moitiés supérieure et inférieure, divisée par deux.
Valeurs aberrantes
Nous transformons certaines valeurs en valeurs aberrantes lorsqu'elles sont assez éloignées du reste des données. Ceci est tout à fait normal et peut être rencontré dans presque tous les scénarios et expériences de statistiques réelles. En pratique, des valeurs aberrantes peuvent être trouvées même dans un ensemble de données où les données ont été spécifiquement créées afin que ses données soient générées de manière uniforme. Ceci est le résultat d'un filtrage strict des données. Lorsque nous choisissons d'étiqueter nos valeurs aberrantes, plus nos règles sont strictes, plus nous allons rencontrer de valeurs aberrantes.
MAD (écart absolu moyen)
Bien que MAD ne fasse techniquement pas partie de la famille EoL, l'écart absolu moyen est un "outil" très utile qui peut nous aider à identifier et à étiqueter d'autres valeurs. Simplement, c'est la valeur moyenne de la distance de chaque point de données à la moyenne. Par exemple, MAD peut être utilisé pour identifier les valeurs aberrantes dans un ensemble de données. Nous pourrions dire que si la distance entre un point de données et la valeur moyenne est supérieure à la MAD, alors ce point de données est une valeur aberrante.
Ce ne sont qu'une fraction des concepts que nous utilisons en science des données, mais ce sont certainement parmi les plus remarquables que tout débutant en science des données devrait connaître. D'autres concepts célèbres et utiles sont : Trimmed Mean, Robust, Standard Deviation, Interquartile Range et bien d'autres. Si vous souhaitez en savoir plus sur la science des données, je vous suggère de jeter un œil au livre Practical Statistics for Data Scientists 50 Essential Concepts de Peter Bruce, Andrew Bruce et Peter Gedeck (les formules de cet article sont tirées de ce livre).
![Qu'est-ce qu'une liste liée, de toute façon? [Partie 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































