EDA-Ultimate-Leitfaden für Anfänger.
Was genau ist EDA?
In jedem Bereich möchte man neue Erkenntnisse gewinnen. Was können sie ändern und was können sie hinzufügen, um ihr Geschäft zu verbessern? Wir neigen dazu, während dieses Prozesses hübsche Visualisierungen, Grafiken und Ähnliches zu sehen.
Als Datenwissenschaftler möchten Sie sehen, wie Variablen miteinander in Beziehung stehen, und wenn ich ehrlich bin, ist es einfacher, einem Stakeholder zu erklären, was genau vor sich geht, wenn Sie Visualisierungen verwenden.
In diesem Beitrag werde ich mein Bestes geben, um detailliert zu sein. Wir beginnen von vorne mit einem Beispieldatensatz. Wir werden eine EDA an einem Wohnungsdatensatz durchführen.
- Laden Sie den Datensatz
2. Vorschau des Datensatzes.
Der Grund dafür, dass sich die Anzahl unserer Spalten verringert hat, liegt darin, dass (describe) nur auf numerische Spalten angewendet wird.
Haben wir Nullwerte? Oder irgendwelche doppelten Daten?
Wir haben die Regel: Wenn es Ihre Analyse nicht verbessert, ist es wirklich ein Rauschen für Ihre Daten. Wir prüfen jedoch, ob es Duplikate oder fehlende Werte gibt.
Der Code, den wir verwenden werden, ist:
#This is to get the total number of missing values.
ames_houses_df.isnull().sum()
#This is to get the sum of duplicates.
ames_houses_df.duplicated().sum()
Es gibt mehrere Python-Bibliotheken, die zur Erstellung von Visualisierungen verwendet werden können. In den Beispielen wird die Verwendung von Seaborn veranschaulicht. Hier ist die Dokumentation . Aber wenn Sie neugieriger sind, schauen Sie sich matplotlib an .
Kommen wir nun zum interessanteren Teil! In EDA gibt es zwei Arten der Analyse:
Univariate Analyse
Wenn Sie nur eine Variable analysieren, überprüft diese möglicherweise die Verteilung oder sogar die Anzahl.
Einige visuelle Methoden für die univariate Analyse umfassen:
- Histogramme: Balkendiagramme, in denen die Häufigkeit von Daten durch rechteckige Balken dargestellt wird.
- Boxplots: Hier werden die Informationen in Form von Boxen dargestellt.
Bivariate Analyse
In diesem Fall nehmen Sie zwei Variablen und vergleichen sie. Sie versuchen, ihre Beziehung zueinander bzw. ihre Beziehung (Korrelation) zu erfahren.
# scatter plot for Saleprice/Total rooms above ground.
sns.scatterplot( data= ames_houses_df, x="TotRms AbvGrd",y="SalePrice")
Es gibt so viele Aspekte, die in der Welt der EDA untersucht werden können, es reicht aus, mit den oben verlinkten Dokumentationen zu experimentieren. Es gibt diesbezüglich so viele Dinge, über die wir noch nicht gesprochen haben, aber dies ist ein Schritt in die richtige Richtung richtige Richtung.
Der verwendete Datensatz ist hier .
Ich hoffe, dass es Ihnen Spaß macht und Sie viel mehr lernen werden, wenn Sie es ausprobieren!

![Was ist überhaupt eine verknüpfte Liste? [Teil 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































