पांडा 2.0 यहाँ है

Feb 27 2023
पायथन पंडों 2.0 अभी जारी किया गया है और यहां उन्होंने जो जोड़ा और सुधार किया है (यह बहुत सी चीजों को बदलने जा रहा है) यदि आप डेटा उद्योग (डेटा इंजीनियरिंग/विज्ञान/एमएल) में काम करते हैं, तो आप पहले से ही जान सकते हैं कि पांडा विशेष रूप से डेटा के बारे में क्या बात कर रहे हैं इंजीनियरिंग, पंडों को बहुत नफरत मिलती थी क्योंकि यह बड़े डेटासेट के साथ काम करते समय इष्टतम प्रदर्शन नहीं देता था।

पायथन पंडास 2.0 अभी जारी किया गया है और यहां उन्होंने जो जोड़ा और सुधार किया है (यह बहुत सी चीजों को बदलने जा रहा है)

अनस्प्लैश पर पास्कल मुलर द्वारा फोटो

यदि आप डेटा उद्योग (डेटा इंजीनियरिंग/विज्ञान/एमएल) में काम करते हैं, तो आप पहले से ही जानते होंगे कि पांडा क्या हैं

विशेष रूप से डेटा इंजीनियरिंग की बात करें तो पंडों को बहुत नफरत मिलती थी क्योंकि यह बड़े डेटासेट के साथ काम करते समय एक इष्टतम प्रदर्शन नहीं देता था।

पांडा 2.0 इस दिशा में उठाया गया एक कदम है, यहां शीर्ष 3 विशेषताएं हैं

तेज़ और अधिक मेमोरी-कुशल संचालन

उन्होंने बैकएंड में पायरो के लिए समर्थन जोड़ा।

पंडास 2.0 में पाइरो बैकएंड एक नई सुविधा है जो उपयोगकर्ताओं को पांडा डेटाफ़्रेम और श्रृंखला के लिए वैकल्पिक डेटा संग्रहण प्रारूप के रूप में अपाचे एरो का उपयोग करने की अनुमति देती है।

इसका मतलब यह है कि जब आप पांडा 2.0 में Parquet फ़ाइलों को पढ़ते या लिखते हैं, तो यह डेटा को संभालने के लिए डिफ़ॉल्ट रूप से पायरो का उपयोग करेगा, जिसके परिणामस्वरूप तेज़ और अधिक मेमोरी-कुशल संचालन होता है।

पायरो क्या है?
पायरो एक पुस्तकालय है जो एक स्तंभ स्मृति प्रारूप प्रदान करता है, जो डेटा को व्यवस्थित करने का एक तरीका है जो समानांतर में पढ़ना और संसाधित करना आसान बनाता है।

संक्षेप में, पांडा 2.0 में पाइरो बैकएंड का उपयोग करने से डेटा संचालन तेज और अधिक मेमोरी-कुशल हो सकता है, खासकर जब बड़े डेटासेट के साथ काम कर रहे हों।

PyArrow समर्थित

कॉपी-ऑन-राइट ऑप्टिमाइज़ेशन

स्पार्क के समान और यह कोड कैसे निष्पादित करता है

यह एक मेमोरी ऑप्टिमाइज़ेशन तकनीक है जिसका उपयोग प्रदर्शन को बेहतर बनाने और बड़े डेटासेट के साथ काम करते समय मेमोरी उपयोग को कम करने के लिए पांडा में किया जाता है।

विचार यह है कि जब आप किसी पांडा ऑब्जेक्ट की कॉपी बनाते हैं, जैसे कि डेटाफ़्रेम या सीरीज़, तो तुरंत डेटा की एक नई कॉपी बनाने के बजाय, पांडा मूल डेटा के लिए एक संदर्भ बनाएंगे और एक नई कॉपी बनाना तब तक के लिए स्थगित कर देंगे जब तक आप संशोधित नहीं करते। किसी तरह डेटा।

इसका मतलब यह है कि यदि आपके पास एक ही डेटा की कई प्रतियां हैं, तो वे सभी एक ही मेमोरी को तब तक संदर्भित कर सकते हैं जब तक आप उनमें से किसी एक में बदलाव नहीं करते। यह स्मृति उपयोग को काफी कम कर सकता है और प्रदर्शन में सुधार कर सकता है क्योंकि आपको डेटा की अनावश्यक प्रतिलिपि बनाने की आवश्यकता नहीं है।

कुल मिलाकर, कॉपी-ऑन-राइट एक शक्तिशाली अनुकूलन तकनीक है जो आपको बड़े डेटासेट के साथ अधिक कुशलता से और कम मेमोरी के साथ काम करने में मदद कर सकती है।

लिखने पर नकल

अनुक्रमणिका अब NumPy सांख्यिक प्रकार धारण कर सकती है

त्वरित सारांश: बेहतर अनुक्रमणिका, तेज़ पहुँच और संगणनाएँ

विवरण:
पांडा 2.0 इंडेक्स को किसी भी NumPy न्यूमेरिक dtype को रखने की अनुमति देता है, जिसमें int8, int16, int32, int64, uint8, uint16, uint32, uint64, फ्लोट32 और फ्लोट64 शामिल हैं।

पहले, केवल int64, uint64, और float64 प्रकार समर्थित थे।

नतीजतन, पहले 64-बिट इंडेक्स बनाने वाले ऑपरेशन अब 32-बिट इंडेक्स जैसे निम्न-बिट आकार वाले इंडेक्स बना सकते हैं।

न्यूमपी इंडेक्स

टीएल; डीआर
1. समर्थित पायरो को तेजी से और अधिक मेमोरी-कुशल संचालन के परिणामस्वरूप जोड़ा गया।
2. कॉपी-ऑन-राइट ऑप्टिमाइज़ेशन: स्पार्क के समान और यह कोड को कैसे निष्पादित करता है
3. इंडेक्स अब NumPy न्यूमेरिक टाइप को होल्ड कर सकता है जिसके परिणामस्वरूप तेजी से संचालन होता है

मैं अपने पायथन फॉर डेटा इंजीनियरिंग कोर्स में भी इन सुविधाओं पर ट्यूटोरियल जोड़ने जा रहा हूं।

अगर आप डाटा इंजीनियरिंग के लिए पायथन के बारे में सब कुछ सीखना चाहते हैं तो चेक करें

https://learn.datawithdarshil.com/courses/Python-for-Data-Engineering