Kích thước và độ chệch của Train / Test
Tôi đang chạy trình phân loại (hồi quy logistic). Thông tin trên tập dữ liệu của tôi như sau:
dataset size= 279 observations
(Quy tắc 80/20)
train size= 233
test size = 56
# of events in train = 31
# of events in test = 8
Tôi nghĩ rằng trình phân loại và kết quả của tôi có thể bị ảnh hưởng do tỷ lệ không bằng nhau này. Có cách nào để tránh các vấn đề thiên vị và cải thiện độ chính xác không? Cá nhân bạn nghĩ gì về những dữ liệu đó?
Trả lời
Nếu bạn đang đề cập đến thực tế là tập dữ liệu của bạn nhỏ:
- Bạn nên sử dụng xác nhận chéo k-lần . Điều này sẽ cho phép bạn đánh giá mô hình của mình trên tất cả 279 trường hợp
Nếu bạn đang đề cập đến sự mất cân bằng lớp học là 31: 202 trong chuyến tàu và 8:48 trong bài kiểm tra:
- Sử dụng AUROC và PRC để loại bỏ sự sai lệch trong ngưỡng
- Cũng xem MCC
Tôi nghĩ trong trường hợp dữ liệu không đối xứng như vậy, nơi đầu ra nhiều hơn một trong các lớp. Nhớ lại sẽ là một lựa chọn tốt về thước đo hơn là độ chính xác. Việc thu hồi cung cấp cho chúng tôi tỷ lệ phần trăm của lớp có liên quan thực sự được dự đoán bởi mô hình.
Để hoàn thành câu trả lời @BenjiAlbert, trong trường hợp tập dữ liệu không cân bằng, bạn cũng nên sử dụng k-nếp gấp phân tầng để bảo toàn tần số lớp tương đối trong mỗi lần. Bạn có thể tìm thêm thông tin chi tiết trong sklearnhướng dẫn sử dụng tại đây .