Đánh giá hồi quy logistic

Aug 30 2020

Vì vậy, tôi đang cố gắng xây dựng một mô hình hồi quy logistic trên một tập dữ liệu (Sổ ghi chép đầy đủ ở đây ).

Tôi vẫn đang tìm ra tập dữ liệu này, vì vậy tôi muốn điều chỉnh hồi quy logistic trên toàn bộ tập dữ liệu và sau đó đánh giá các phần dư để phân tích các mẫu mà mô hình của tôi không thể phân loại chính xác (Có thể kiểm tra xem chúng có phải là ngoại lệ hoặc hoặc đi đến kết luận rằng mô hình tuyến tính không phù hợp và tôi cần một cái gì đó như cây hoặc wtv).

Một trong những điều tôi muốn làm là xem phần dư thay đổi như thế nào với các yếu tố dự đoán, vì vậy tôi đã lập một biểu đồ cho các yếu tố dự đoán liên tục:

và cả các yếu tố dự đoán phân loại hoặc nhị phân cũng như nhãn (Đã thoát):

Ý tưởng của tôi là xác định những điểm có phần dư cao nhất và cố gắng hiểu tại sao chúng lại được phân loại như vậy (Có thể chúng là những điểm ngoại lệ?).

Vấn đề là, tôi không thể hiểu được giá trị của những phần dư này. Tại sao tôi có các giá trị phần dư lớn hơn 1 hoặc thấp hơn 0, vì những gì tôi đang cố gắng dự đoán là một cột nhị phân với số không và số một, và làm thế nào tôi có hai vùng riêng biệt trong các ô liên tục? Bạn sẽ giải thích những phần dư này như thế nào (nếu có)?

Ví dụ, trong các ô phân loại, tôi thấy rõ rằng Phụ nữ và cư dân ở Đức khó phân loại hơn (Họ có ô cao hơn).

Loại phân tích này có phải là một cái gì đó không bạn?

Tôi cũng tìm thấy gói này được gọi là các hiệu ứng có thể vẽ biểu đồ này:

Tuy nhiên, cho đến nay tôi vẫn không thể hiểu được làm thế nào mà những biểu đồ hiệu ứng này được tính toán. Có ai ở đây có thể giải thích cách thực hiện những âm mưu như vậy không và kết luận lớn nhất mà bạn có thể rút ra từ chúng là gì?

Nói chung, cách tiếp cận của bạn khi lắp bộ phân loại nhị phân như thế nào? Bạn làm theo một cái gì đó như thế này hay bạn làm theo một cách hoàn toàn khác?

Cảm ơn bạn!

Trả lời

3 MatthewDrury Aug 29 2020 at 23:35

Tại sao tôi có các giá trị phần dư lớn hơn 1 hoặc thấp hơn 0, cho rằng những gì tôi đang cố gắng dự đoán là một cột nhị phân với các số không và các số một?

Tôi nghi ngờ rằng các dự đoán của bạn là tỷ lệ cược đăng nhập.

Thông thường, bạn nghĩ về một mô hình hồi quy logistic là xuất ra một xác suất $p$, nằm trong khoảng từ 0 đến 1. Trong trường hợp này, phần còn lại của bạn sẽ nằm trong khoảng$-1 = 0 - 1$ và $1 = 1 - 0$.

Đôi khi, thay vào đó, lý do với tỷ lệ cược đăng nhập sẽ có ý nghĩa $log(\frac{p}{1-p})$và tôi nghi ngờ là mã của bạn có một lỗi đang tạo ra giá trị này khi bạn yêu cầu dự đoán từ mô hình của mình. Đây là một vấn đề phổ biến trong R, vì nó là (hoặc, ít nhất, là, đã một thời gian kể từ khi tôi sử dụng R) hành vi mặc định.

Làm thế nào mà tôi có hai khu vực riêng biệt trong các ô liên tục?

Bạn có ít nhất một công cụ dự đoán nhị phân có tác dụng rất mạnh (có vẻ như nó được đặt tên excited). tôi đoán là hành vi phân dải trong các lô còn lại của bạn là do tính năng này gây ra. Nếu bạn tô màu các ô còn lại của mình theo giá trị của excited, bạn có thể thử xác nhận điều này.

Nói chung, cách tiếp cận của bạn khi lắp bộ phân loại nhị phân như thế nào? Bạn làm theo một cái gì đó như thế này hay bạn làm theo một cách hoàn toàn khác?

Đây là tất cả những điều hợp lý để làm, nhưng tôi sẽ sửa lỗi tỷ lệ cược đăng nhập và lấy dự đoán của bạn trên thang xác suất, vì đây là thứ có thể so sánh trực tiếp với $y$ nhãn.