Comprendre la régression de Cox

Oct 12 2020

Je dois travailler avec la régression de Cox mais je ne comprends pas pleinement comment cela fonctionne. J'ai donc créé un faux échantillon de données très basique et essayé de l'adapter à un Python Lifelines CoxPHFitter .

Voici mon échantillon:

Je suppose que «l' alcool et les cigarettes prédisent davantage de décès, tandis que le sport aide à être en bonne santé et que la taille du corps n'a aucun impact », ce qui semble logique.

Mais quand je le lance avec:

cph = CoxPHFitter()
cph.fit(df, duration_col='survival', event_col='death')
cph.print_summary()
cph.plot()

Je ne comprends tout simplement pas la logique des résultats que j'obtiens:

N'importe qui pourrait expliquer comment interpréter cela? Surtout pourquoi l'alcool semble avoir un effet inverse de la cigarette , ce qui n'est pas ce que je déduis de mon jeu de données?

Surtout, pourriez-vous expliquer le coefrésultat et le log(HR) (95% CI).

Réponses

2 EdM Oct 29 2020 at 04:12

Votre résultat spécifique a peu à voir avec la régression de Cox elle-même, mais beaucoup à voir avec la régression en général, lorsque les prédicteurs sont corrélés. Comme le note @chl, dans vos données (et aussi dans la vie réelle), le comportement tabagique et la consommation d'alcool sont fortement corrélés.

Une recherche sur ce site pour " prédicteur corrélé " vient de trouver 2500 visites. C'est une situation très courante. En plus du message auquel @chl a lié dans un commentaire, vous pouvez consulter ce fil de discussion sur la façon dont l'ajout de prédicteurs peut faire en sorte qu'un prédicteur auparavant "significatif" semble devenir "insignifiant", ou ce fil sur un comportement apparemment opposé lorsque les prédicteurs sont ajoutés à un modèle.

Il y a quelques problèmes potentiellement en jeu ici. D'une part, le véritable effet d'un prédicteur n'est parfois visible que lorsque d'autres prédicteurs associés au résultat sont pris en compte. Pour un autre (peut-être plus pertinent dans votre cas), si deux prédicteurs sont fortement corrélés entre eux et avec le résultat, un modèle de régression ne saura pas lequel d’entre eux attribuer un «crédit» et choisira effectivement celui qui convient le mieux votre ensemble de données, ou bien les juger tous deux «insignifiants» dans certains cas s'ils sont trop étroitement liés. Pour une troisième possibilité, rappelez-vous qu'un modèle de régression linéaire peut être considéré comme un développement de Taylor d'une fonction, limité aux seuls termes du premier ordre dans votre exemple. Parfois, avec des prédicteurs corrélés, l'un d'entre eux pourrait obtenir trop de crédit en fonction de son approximation linéaire, et un coefficient de signe opposé pour l'autre pourrait apporter une correction à cette surestimation.

Comme votre question portait sur la régression de Cox, notez qu'il s'agit là d'un problème encore plus important que pour la régression linéaire standard. Dans la régression linéaire standard, les types de problèmes mentionnés ci-dessus surviennent lorsque vous omettez d'un modèle un prédicteur qui est à la fois associé au résultat et aux prédicteurs inclus. Dans la régression de Cox, comme dans la régression logistique , vous pouvez biaiser les résultats même si un prédicteur lié aux résultats n'est pas du tout corrélé aux prédicteurs inclus.