Kích thước và độ chệch của Train / Test

Aug 31 2020

Tôi đang chạy trình phân loại (hồi quy logistic). Thông tin trên tập dữ liệu của tôi như sau:

dataset size= 279 observations 

(Quy tắc 80/20)

train size= 233
test size = 56

# of events in train = 31
# of events in test = 8

Tôi nghĩ rằng trình phân loại và kết quả của tôi có thể bị ảnh hưởng do tỷ lệ không bằng nhau này. Có cách nào để tránh các vấn đề thiên vị và cải thiện độ chính xác không? Cá nhân bạn nghĩ gì về những dữ liệu đó?

Trả lời

4 BenjiAlbert Aug 31 2020 at 07:08

Nếu bạn đang đề cập đến thực tế là tập dữ liệu của bạn nhỏ:

  • Bạn nên sử dụng xác nhận chéo k-lần . Điều này sẽ cho phép bạn đánh giá mô hình của mình trên tất cả 279 trường hợp

Nếu bạn đang đề cập đến sự mất cân bằng lớp học là 31: 202 trong chuyến tàu và 8:48 trong bài kiểm tra:

  • Sử dụng AUROC và PRC để loại bỏ sự sai lệch trong ngưỡng
  • Cũng xem MCC
1 Surya Aug 31 2020 at 07:07

Tôi nghĩ trong trường hợp dữ liệu không đối xứng như vậy, nơi đầu ra nhiều hơn một trong các lớp. Nhớ lại sẽ là một lựa chọn tốt về thước đo hơn là độ chính xác. Việc thu hồi cung cấp cho chúng tôi tỷ lệ phần trăm của lớp có liên quan thực sự được dự đoán bởi mô hình.

1 etiennedm Aug 31 2020 at 13:53

Để hoàn thành câu trả lời @BenjiAlbert, trong trường hợp tập dữ liệu không cân bằng, bạn cũng nên sử dụng k-nếp gấp phân tầng để bảo toàn tần số lớp tương đối trong mỗi lần. Bạn có thể tìm thêm thông tin chi tiết trong sklearnhướng dẫn sử dụng tại đây .