Transformasi log di GLM dan model fit

Sep 10 2020

Untuk GLM binomial negatif, apakah kita diperbolehkan untuk menulis transformasi log dengan cara berikut?

library(MASS)
nb.fit <- glm.nb(y~log(X1)+log(X2)+X3+X4+log(X5),maxit=1000, data=df)
chisq.p.value <- pchisq(deviance(nb.fit ), df.residual(nb.fit), lower = F)
chisq.p.value

Berikut X3dan X4memiliki nilai cukup rendah dibandingkan dengan X1, X2, dan X5. Yadalah respons hitungan dengan varian yang sangat tinggi tanpa respons nol. Bagaimana cara memeriksa apakah model saya sesuai dengan data?

Karena chisq.p.value = 0.22078(p> 0.05), dapatkah kita mengatakan model kita cocok dengan data?

Jawaban

1 gung-ReinstateMonica Sep 12 2020 at 03:40

Pertanyaan awal Anda ambigu. Saya rasa Anda bertanya apakah menggunakan log dalam rumus model mereplikasi fungsi tautan. Jika ya, jawabannya tidak . Fungsi tautan (dalam hal ini adalah log) adalah transformasi dari rata-rata yang diprediksi, bukan kovariat Anda. Meskipun ditulis dalam konteks yang berbeda, mungkin berguna untuk membaca jawaban saya untuk: Perbedaan antara model logit dan probit . Anda mungkin juga bertanya apakah diperbolehkan menggunakan transformasi, atau khususnya transformasi logaritmik, dari variabel prediktor. Jika ya, jawabannya adalah ya , tidak ada masalah dengan penggunaan log X's. Mengenai interpretasi mereka, Anda mungkin ingin membaca: Interpretasi log prediktor dan / atau respons yang diubah. Terakhir, jika Anda menanyakan apakah RAnda dapat menggunakan log()fungsi dalam argumen rumus ke fungsi model standar, jawabannya juga ya (setelah semua, Anda baru saja melakukannya dan berhasil).

Anda tidak dapat membandingkan nilai mentah dari koefisien taksiran untuk variabel yang tidak ditransformasi dan variabel yang ditransformasi log. Itu tidak berarti hal yang sama (lihat tautan di atas). Selain itu, Anda sebaiknya tidak membandingkan koefisien untuk variabel yang berbeda, karena biasanya dalam satuan yang tidak sebanding.

Terakhir, tes yang Anda lakukan secara manual pada akhirnya bukanlah tes goodness of fit dalam arti yang Anda pikirkan. Sebaliknya, ini adalah pengujian model secara keseluruhan (lihat: Menguji model GLM menggunakan null dan deviasi model ). Fakta bahwa itu tidak signifikan berarti model Anda tidak memiliki banyak informasi tentang responsnya. (Namun, itu tidak berarti itu kesesuaian yang buruk!) Untuk menguji kesesuaian, Anda perlu membandingkan model yang dipasang dengan model jenuh (lih., Uji model regresi logistik menggunakan penyimpangan sisa dan derajat kebebasan ). Namun secara umum, menurut saya cara terbaik untuk menilai kecocokan adalah dengan memplot data Anda dengan model dan overlay yang LOWESS, dan melihat bagaimana perbandingannya.