Pandas 2.0 ist da
Python Pandas 2.0 wurde gerade veröffentlicht und hier ist, was sie hinzugefügt und verbessert haben (das wird viele Dinge ändern)
Wenn Sie in der Datenbranche arbeiten (Data Engineering/Wissenschaft/ML), wissen Sie vielleicht bereits, was Pandas ist
Wenn es um Data Engineering geht, wurde Pandas früher oft gehasst, weil es bei der Arbeit mit großen Datenmengen keine optimale Leistung erbringt.
Pandas 2.0 ist ein Schritt in diese Richtung. Hier sind die drei wichtigsten Funktionen
Schnellere und speichereffizientere Vorgänge
Sie haben Unterstützung für Pyarrow im Backend hinzugefügt.
Das Pyarrow-Backend ist eine neue Funktion in Pandas 2.0, die es Benutzern ermöglicht, Apache Arrow als alternatives Datenspeicherformat für Pandas DataFrames und Series zu verwenden.
Dies bedeutet, dass beim Lesen oder Schreiben von Parquet-Dateien in Pandas 2.0 standardmäßig Pyarrow zum Verarbeiten der Daten verwendet wird, was zu schnelleren und speichereffizienteren Vorgängen führt.
Was ist eine Schafgarbe?
Pyarrow ist eine Bibliothek, die ein spaltenorientiertes Speicherformat bereitstellt. Dies ist eine Möglichkeit zum Organisieren von Daten, die das Lesen und parallele Verarbeiten erleichtert.
Zusammenfassend lässt sich sagen, dass die Verwendung des Pyarrow-Backends in Pandas 2.0 zu schnelleren und speichereffizienteren Datenoperationen führen kann, insbesondere bei der Arbeit mit großen Datensätzen.
Copy-on-Write-Optimierung
Ähnlich wie Spark und wie es Code ausführt
Dabei handelt es sich um eine Speicheroptimierungstechnik, die in Pandas verwendet wird, um die Leistung zu verbessern und die Speichernutzung bei der Arbeit mit großen Datensätzen zu reduzieren.
Die Idee dahinter ist, dass Pandas, wenn Sie eine Kopie eines Pandas-Objekts wie eines DataFrames oder einer Serie erstellen, statt sofort eine neue Kopie der Daten zu erstellen, einen Verweis auf die Originaldaten erstellt und die Erstellung einer neuen Kopie aufschiebt, bis Sie diese ändern Daten in irgendeiner Weise.
Das heißt, wenn Sie über mehrere Kopien derselben Daten verfügen, können diese alle auf denselben Speicher verweisen, bis Sie eine Änderung an einer davon vornehmen. Dies kann die Speichernutzung erheblich reduzieren und die Leistung verbessern, da Sie keine unnötigen Kopien der Daten erstellen müssen.
Insgesamt ist Copy-on-Write eine leistungsstarke Optimierungstechnik, die Ihnen dabei helfen kann, mit großen Datensätzen effizienter und mit weniger Speicher zu arbeiten.
Der Index kann jetzt numerische NumPy-Typen enthalten
Kurze Zusammenfassung: Bessere Indizes, schnellerer Zugriff und schnellere Berechnungen
Details: Mit
Pandas 2.0 kann Index jeden numerischen NumPy-D-Typ speichern, einschließlich int8, int16, int32, int64, uint8, uint16, uint32, uint64, float32 und float64.
Bisher wurden nur die Typen int64, uint64 und float64 unterstützt.
Dadurch können Vorgänge, die zuvor 64-Bit-Indizes erstellt haben, jetzt Indizes mit kleineren Bitgrößen erstellen, beispielsweise 32-Bit-Indizes.
TL;DR
1. Pyarrow im Backed hinzugefügt, was zu schnelleren und speichereffizienteren Vorgängen führt.
2. Copy-on-Write-Optimierung: Ähnlich wie Spark und wie es Code ausführt.
3. Der Index kann jetzt numerische NumPy-Typen enthalten, was zu schnelleren Vorgängen führt
Ich werde in meinem Python for Data Engineering-Kurs auch Tutorials zu diesen Funktionen hinzufügen.
Wenn Sie alles über Python für Data Engineering erfahren möchten, dann schauen Sie hier vorbei
https://learn.datawithdarshil.com/courses/Python-for-Data-Engineering

![Was ist überhaupt eine verknüpfte Liste? [Teil 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































