Multiitple Logistic Regression cho dữ liệu đếm bằng glm

Aug 24 2020

Tôi đang gặp một số khó khăn trong việc điều chỉnh mô hình hồi quy nhiều logistic cho dữ liệu của mình trông như thế này,

Như bạn có thể thấy từ ảnh chụp màn hình ở trên, có 4 biến giải thích là tuổi , giới tính , khuyết tật và chủng tộc có dạng nhị thức là 1 và 0. Dữ liệu có thể được trình bày dưới dạng dữ liệu đếm ,

trong đó Y là biến phản hồi nhị phân (1 cho Có và 0 cho Không).

Ví dụ có thể tái tạo dữ liệu :

set.seed(10)
age <- round(runif(186, 0,1))
gender <- round(runif(186, 0, 1))
disability <- round(runif(186, 0, 1))
race <- round(runif(186, 0, 1))

dat <- data.frame(age, gender, disability, race)

m <- cbind(table(dat$age), table(dat$gender), table(dat$disability), table(dat$race))

colnames(m) <- c("Age", "Gender", "Disability", "Race")

dt <- data.frame(m)
dt <- tibble::rownames_to_column(dt, "Y")
new_dt <- dt %>% select(Age, Gender, Disability, Race, Y)
new_dt

Đây có vẻ như là một vấn đề rất đơn giản nhưng tôi vẫn không thể tìm ra giải pháp thích hợp để phù hợp với một mô hình logistic nhiều sử dụng glm()cho loại dữ liệu này.

Nguồn

Hồi quy logistic trong r cho số lượng tổng hợp

Điều này không hoạt động vì nó chỉ có thể được áp dụng cho bảng dự phòng

Bất kỳ giúp đỡ hoặc tư vấn sẽ được đánh giá rất nhiều!!

Trả lời

1 StatsStudent Aug 24 2020 at 16:37

Vì vậy, tôi đã có cơ hội tạo lại tập dữ liệu thô và chạy hồi quy logistic. Trên thực tế, nó chạy trong R và SAS, nhưng bạn gặp vấn đề với cái được gọi là "sự phân tách gần như hoàn toàn các điểm dữ liệu." Điều này xảy ra khi sự kết hợp tuyến tính của các biến dự báo xác định hoặc tách biệt hoàn toàn biến kết quả, và do đó, khả năng tối đa không tồn tại các ước tính. Đây là kết quả từ SAS chỉ ra sự cố:

Probability modeled is Y='1'. 

Trạng thái hội tụ mô hình Đã phát hiện phân tách gần như hoàn toàn các điểm dữ liệu.

**Warning: The maximum likelihood estimate may not exist.** 

Warning: The LOGISTIC procedure continues in spite of the above warning. Results shown are based on the last maximum likelihood iteration. Validity of the model fit is questionable. 

Model Fit Statistics 
Criterion Intercept Only Intercept and
Covariates 
AIC 1032.865 982.586 
SC 1037.477 1005.646 
-2 Log L 1030.865 972.586 

Testing Global Null Hypothesis: BETA=0 
Test Chi-Square DF Pr > ChiSq 
Likelihood Ratio 58.2791 4 <.0001 
Score 42.0614 4 <.0001 
Wald 0.0543 4 0.9996 

Analysis of Maximum Likelihood Estimates 
Parameter DF Estimate Standard
Error Wald
Chi-Square Pr > ChiSq 
Intercept 1 0.0633 0.0863 0.5380 0.4633 
Age 1 -12.2182 119.4 0.0105 0.9185 
Gender 1 12.1913 182.3 0.0045 0.9467 
Disability 1 2.3E-11 152.7 0.0000 1.0000 
Race 1 -984E-13 205.7 0.0000 1.0000 

Odds Ratio Estimates 
Effect Point Estimate 95% Wald
Confidence Limits 
Age <0.001 <0.001 >999.999 
Gender >999.999 <0.001 >999.999 
Disability 1.000 <0.001 >999.999 
Race 1.000 <0.001 >999.999 

Bạn có thể đọc thêm về vấn đề này và có thể là các biện pháp khắc phục tại đây trên trang web IDRE của UCLA .