GradientBoostingClassifier के हुड के तहत DecisionTreeRegressor
मैं अपने GradientBoostingClassifier मॉडल के कमजोर आकलनकर्ताओं का निरीक्षण कर रहा हूं। यह मॉडल बाइनरी क्लास डेटासेट पर फिट था।
मैंने देखा कि इस पहनावा वर्ग के तहत सभी कमजोर अनुमानक निर्णय ट्री रजिस्ट्रर ऑब्जेक्ट हैं। यह मुझे सहज ही अजीब लगता है।
मैंने पहनावे में पहला निर्णय पेड़ लिया और अपने संपूर्ण डेटासेट पर स्वतंत्र रूप से भविष्यवाणी करने के लिए इसका इस्तेमाल किया। डेटासेट के अद्वितीय उत्तर निम्नलिखित थे:
array([-2.74, -1.94, -1.69, ...])
मेरा प्रश्न है: ग्रेडिएंट बूस्टिंग क्लासिफायर क्यों और कैसे कमजोर आकलनकर्ताओं को रजिस्ट्रर कार्यों (वर्गीकरण कार्यों के बजाय) में बदल देता है जो 0 और 1 से बंधे नहीं हैं? अंततः GradientBoostingClassifier 0 और 1 के बीच एक छद्म संभावना का उत्पादन करता है: क्यों कमजोर आकलन करने वालों का पहनावा समान नहीं है?
जवाब
अधिक प्रलेखन के माध्यम से पढ़ने के बाद, मुझे वह खंड मिला जो वर्गीकरण मामले को कवर करता है। यह यहाँ पाया जा सकता है । इसके अतिरिक्त यह प्रतिमा बहुत उपयोगी थी।
1.11.4.5.2। वर्गीकरण
वर्गीकरण के लिए धीरज बढ़ाने का मामला प्रतिगमन मामले के समान है। हालांकि, पेड़ों का योग एक भविष्यवाणी के लिए सजातीय नहीं है: यह एक वर्ग नहीं हो सकता है, क्योंकि पेड़ निरंतर मूल्यों की भविष्यवाणी करते हैं।
किसी वर्ग या प्रायिकता के मान से मानचित्रण हानि-निर्भर है। अवमूल्यन (या लॉग-लॉस) के लिए, सकारात्मक वर्ग से संबंधित संभावना मॉडल की गई है जहां सिग्मॉइड फ़ंक्शन है। बहुरंगी वर्गीकरण के लिए, K पेड़ों (K कक्षाओं के लिए) प्रत्येक पुनरावृत्तियों पर बनाए जाते हैं। कक्षा k से संबंधित संभाव्यता को मानों के सॉफ्टमैक्स के रूप में चित्रित किया जाता है।
ध्यान दें कि एक वर्गीकरण कार्य के लिए भी, उप-अनुमानक अभी भी एक प्रतिगामी है, न कि एक क्लासिफायरियर। ऐसा इसलिए है क्योंकि उप-आकलनकर्ताओं को पूर्वानुमान (नकारात्मक) ग्रेडिएंट्स के लिए प्रशिक्षित किया जाता है, जो हमेशा निरंतर मात्रा में होते हैं।