Multiitple Logistic Regression cho dữ liệu đếm bằng glm
Tôi đang gặp một số khó khăn trong việc điều chỉnh mô hình hồi quy nhiều logistic cho dữ liệu của mình trông như thế này,
Như bạn có thể thấy từ ảnh chụp màn hình ở trên, có 4 biến giải thích là tuổi , giới tính , khuyết tật và chủng tộc có dạng nhị thức là 1 và 0. Dữ liệu có thể được trình bày dưới dạng dữ liệu đếm ,
trong đó Y là biến phản hồi nhị phân (1 cho Có và 0 cho Không).
Ví dụ có thể tái tạo dữ liệu :
set.seed(10)
age <- round(runif(186, 0,1))
gender <- round(runif(186, 0, 1))
disability <- round(runif(186, 0, 1))
race <- round(runif(186, 0, 1))
dat <- data.frame(age, gender, disability, race)
m <- cbind(table(dat$age), table(dat$gender), table(dat$disability), table(dat$race))
colnames(m) <- c("Age", "Gender", "Disability", "Race")
dt <- data.frame(m)
dt <- tibble::rownames_to_column(dt, "Y")
new_dt <- dt %>% select(Age, Gender, Disability, Race, Y)
new_dt
Đây có vẻ như là một vấn đề rất đơn giản nhưng tôi vẫn không thể tìm ra giải pháp thích hợp để phù hợp với một mô hình logistic nhiều sử dụng glm()cho loại dữ liệu này.
Nguồn
Hồi quy logistic trong r cho số lượng tổng hợp
Điều này không hoạt động vì nó chỉ có thể được áp dụng cho bảng dự phòng
Bất kỳ giúp đỡ hoặc tư vấn sẽ được đánh giá rất nhiều!!
Trả lời
Vì vậy, tôi đã có cơ hội tạo lại tập dữ liệu thô và chạy hồi quy logistic. Trên thực tế, nó chạy trong R và SAS, nhưng bạn gặp vấn đề với cái được gọi là "sự phân tách gần như hoàn toàn các điểm dữ liệu." Điều này xảy ra khi sự kết hợp tuyến tính của các biến dự báo xác định hoặc tách biệt hoàn toàn biến kết quả, và do đó, khả năng tối đa không tồn tại các ước tính. Đây là kết quả từ SAS chỉ ra sự cố:
Probability modeled is Y='1'.
Trạng thái hội tụ mô hình Đã phát hiện phân tách gần như hoàn toàn các điểm dữ liệu.
**Warning: The maximum likelihood estimate may not exist.**
Warning: The LOGISTIC procedure continues in spite of the above warning. Results shown are based on the last maximum likelihood iteration. Validity of the model fit is questionable.
Model Fit Statistics
Criterion Intercept Only Intercept and
Covariates
AIC 1032.865 982.586
SC 1037.477 1005.646
-2 Log L 1030.865 972.586
Testing Global Null Hypothesis: BETA=0
Test Chi-Square DF Pr > ChiSq
Likelihood Ratio 58.2791 4 <.0001
Score 42.0614 4 <.0001
Wald 0.0543 4 0.9996
Analysis of Maximum Likelihood Estimates
Parameter DF Estimate Standard
Error Wald
Chi-Square Pr > ChiSq
Intercept 1 0.0633 0.0863 0.5380 0.4633
Age 1 -12.2182 119.4 0.0105 0.9185
Gender 1 12.1913 182.3 0.0045 0.9467
Disability 1 2.3E-11 152.7 0.0000 1.0000
Race 1 -984E-13 205.7 0.0000 1.0000
Odds Ratio Estimates
Effect Point Estimate 95% Wald
Confidence Limits
Age <0.001 <0.001 >999.999
Gender >999.999 <0.001 >999.999
Disability 1.000 <0.001 >999.999
Race 1.000 <0.001 >999.999
Bạn có thể đọc thêm về vấn đề này và có thể là các biện pháp khắc phục tại đây trên trang web IDRE của UCLA .