onehotencoder random forest
Dalam konteks Random Forest, apakah saya perlu menyiapkan dummies / OnehotEncoder dalam kumpulan data di mana fitur / variabel bersifat numerik tetapi mengacu pada beberapa jenis kategori?
Katakanlah saya memiliki variabel berikut:
Di mana Yvariabel yang ingin saya prediksi. X'sadalah fitur.
Saya akan fokus pada X1. Ini numerik tetapi mengacu pada kategori tertentu (yaitu 1 mengacu pada matematika, 2 mengacu pada sastra dan 3 untuk sejarah). Apakah saya perlu menerapkan OnehotEncoder (atau pendekatan tiruan) untuk algoritme Random Forest?
Saya kira saya tidak perlu melakukannya, tetapi saya tidak yakin.
Jawaban
Secara teori, kategori itu sendiri dapat ditangani di pohon keputusan. Namun, sebagian besar implementasi python hanya akan berfungsi dengan angka, jadi Anda perlu mengonversinya. Sepertinya Anda sudah memilikinya. Encoding OneHot adalah salah satu cara untuk melakukan itu, tetapi sekarang setelah Anda melakukannya, itu tidak perlu. Anda dapat mencoba skema lain untuk mengubahnya menjadi 1 2 3, jika tidak ada alasan logis tentang bagaimana Anda memilikinya. Ini disebut Pengkodean Kategoris. Salah satu cara yang populer adalah dengan mengurutkan berdasarkan abjad dan menomori mereka. Cara lain, dalam urutan frekuensinya. Pada akhirnya, itu tidak akan menjadi masalah karena hutan acak akan menumpuk nomor sesuai dengan algoritmanya. Ini mungkin membuat perbedaan kecil, jadi mungkin coba cara yang berbeda. Tapi tidak, Anda tidak perlu OneHot menyandikan kategori Anda karena sudah berupa angka.