पांडा 2.0 यहाँ है
पायथन पंडास 2.0 अभी जारी किया गया है और यहां उन्होंने जो जोड़ा और सुधार किया है (यह बहुत सी चीजों को बदलने जा रहा है)
यदि आप डेटा उद्योग (डेटा इंजीनियरिंग/विज्ञान/एमएल) में काम करते हैं, तो आप पहले से ही जानते होंगे कि पांडा क्या हैं
विशेष रूप से डेटा इंजीनियरिंग की बात करें तो पंडों को बहुत नफरत मिलती थी क्योंकि यह बड़े डेटासेट के साथ काम करते समय एक इष्टतम प्रदर्शन नहीं देता था।
पांडा 2.0 इस दिशा में उठाया गया एक कदम है, यहां शीर्ष 3 विशेषताएं हैं
तेज़ और अधिक मेमोरी-कुशल संचालन
उन्होंने बैकएंड में पायरो के लिए समर्थन जोड़ा।
पंडास 2.0 में पाइरो बैकएंड एक नई सुविधा है जो उपयोगकर्ताओं को पांडा डेटाफ़्रेम और श्रृंखला के लिए वैकल्पिक डेटा संग्रहण प्रारूप के रूप में अपाचे एरो का उपयोग करने की अनुमति देती है।
इसका मतलब यह है कि जब आप पांडा 2.0 में Parquet फ़ाइलों को पढ़ते या लिखते हैं, तो यह डेटा को संभालने के लिए डिफ़ॉल्ट रूप से पायरो का उपयोग करेगा, जिसके परिणामस्वरूप तेज़ और अधिक मेमोरी-कुशल संचालन होता है।
पायरो क्या है?
पायरो एक पुस्तकालय है जो एक स्तंभ स्मृति प्रारूप प्रदान करता है, जो डेटा को व्यवस्थित करने का एक तरीका है जो समानांतर में पढ़ना और संसाधित करना आसान बनाता है।
संक्षेप में, पांडा 2.0 में पाइरो बैकएंड का उपयोग करने से डेटा संचालन तेज और अधिक मेमोरी-कुशल हो सकता है, खासकर जब बड़े डेटासेट के साथ काम कर रहे हों।
कॉपी-ऑन-राइट ऑप्टिमाइज़ेशन
स्पार्क के समान और यह कोड कैसे निष्पादित करता है
यह एक मेमोरी ऑप्टिमाइज़ेशन तकनीक है जिसका उपयोग प्रदर्शन को बेहतर बनाने और बड़े डेटासेट के साथ काम करते समय मेमोरी उपयोग को कम करने के लिए पांडा में किया जाता है।
विचार यह है कि जब आप किसी पांडा ऑब्जेक्ट की कॉपी बनाते हैं, जैसे कि डेटाफ़्रेम या सीरीज़, तो तुरंत डेटा की एक नई कॉपी बनाने के बजाय, पांडा मूल डेटा के लिए एक संदर्भ बनाएंगे और एक नई कॉपी बनाना तब तक के लिए स्थगित कर देंगे जब तक आप संशोधित नहीं करते। किसी तरह डेटा।
इसका मतलब यह है कि यदि आपके पास एक ही डेटा की कई प्रतियां हैं, तो वे सभी एक ही मेमोरी को तब तक संदर्भित कर सकते हैं जब तक आप उनमें से किसी एक में बदलाव नहीं करते। यह स्मृति उपयोग को काफी कम कर सकता है और प्रदर्शन में सुधार कर सकता है क्योंकि आपको डेटा की अनावश्यक प्रतिलिपि बनाने की आवश्यकता नहीं है।
कुल मिलाकर, कॉपी-ऑन-राइट एक शक्तिशाली अनुकूलन तकनीक है जो आपको बड़े डेटासेट के साथ अधिक कुशलता से और कम मेमोरी के साथ काम करने में मदद कर सकती है।
अनुक्रमणिका अब NumPy सांख्यिक प्रकार धारण कर सकती है
त्वरित सारांश: बेहतर अनुक्रमणिका, तेज़ पहुँच और संगणनाएँ
विवरण:
पांडा 2.0 इंडेक्स को किसी भी NumPy न्यूमेरिक dtype को रखने की अनुमति देता है, जिसमें int8, int16, int32, int64, uint8, uint16, uint32, uint64, फ्लोट32 और फ्लोट64 शामिल हैं।
पहले, केवल int64, uint64, और float64 प्रकार समर्थित थे।
नतीजतन, पहले 64-बिट इंडेक्स बनाने वाले ऑपरेशन अब 32-बिट इंडेक्स जैसे निम्न-बिट आकार वाले इंडेक्स बना सकते हैं।
टीएल; डीआर
1. समर्थित पायरो को तेजी से और अधिक मेमोरी-कुशल संचालन के परिणामस्वरूप जोड़ा गया।
2. कॉपी-ऑन-राइट ऑप्टिमाइज़ेशन: स्पार्क के समान और यह कोड को कैसे निष्पादित करता है
3. इंडेक्स अब NumPy न्यूमेरिक टाइप को होल्ड कर सकता है जिसके परिणामस्वरूप तेजी से संचालन होता है
मैं अपने पायथन फॉर डेटा इंजीनियरिंग कोर्स में भी इन सुविधाओं पर ट्यूटोरियल जोड़ने जा रहा हूं।
अगर आप डाटा इंजीनियरिंग के लिए पायथन के बारे में सब कुछ सीखना चाहते हैं तो चेक करें
https://learn.datawithdarshil.com/courses/Python-for-Data-Engineering

![क्या एक लिंक्ड सूची है, वैसे भी? [भाग 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































