rừng ngẫu nhiên onehotencoder

Aug 31 2020

Trong bối cảnh Rừng ngẫu nhiên, tôi có cần thiết lập hình nộm / OnehotEncoder trong tập dữ liệu nơi các tính năng / biến thể là số nhưng tham chiếu đến một số loại danh mục không?

Giả sử tôi có các biến sau:

Đâu Ylà biến mà tôi muốn dự đoán. X'slà các tính năng.

Tôi sẽ tập trung vào X1. Số của nó nhưng đề cập đến một phạm trù cụ thể (tức là 1 đề cập đến toán học, 2 đề cập đến văn học và 3 đề cập đến lịch sử). Tôi có cần áp dụng OnehotEncoder (hoặc phương pháp tiếp cận giả) cho biệt danh Rừng Ngẫu nhiên không?

Tôi đoán tôi không cần phải làm điều đó, nhưng tôi không chắc.

Trả lời

1 Josh Aug 31 2020 at 10:44

Về lý thuyết, bản thân các danh mục có thể được xử lý trong cây quyết định. Tuy nhiên, hầu hết các triển khai python sẽ chỉ hoạt động với các số, vì vậy bạn cần phải chuyển đổi chúng. Có vẻ như bạn đã có. Mã hóa OneHot là một cách để làm điều đó, nhưng bây giờ bạn đã làm điều đó, nó không cần thiết. Bạn có thể thử các phương án khác để biến chúng thành 1 2 3, nếu không có lý do hợp lý để bạn có chúng theo cách này. Đây được gọi là Mã hóa phân loại. Một cách phổ biến là sắp xếp chúng theo thứ tự bảng chữ cái và đánh số. Một cách khác, theo thứ tự tần số của chúng. Vào cuối ngày, nó sẽ không có vấn đề gì cả vì khu rừng ngẫu nhiên sẽ phân loại số theo thuật toán của nó. Tuy nhiên, nó có thể tạo ra những khác biệt nhỏ, vì vậy có thể thử các cách khác nhau. Nhưng không, bạn sẽ không cần OneHot mã hóa các danh mục của mình vì chúng đã là số.