이진 분류 알고리즘

Sep 13 2020

엄청난 수의 기능 (약 3000 개)과 이진 대상 변수가있는 데이터 세트가 있습니다. 내가 너무 많은 기능을 갖는 이유는 내 데이터 세트에서 많은 범주 형 변수를 하나의 핫 인코딩하기 때문입니다.

로지스틱 회귀는 소수의 기능에서만 작동 할 수 있다고 생각합니다.

그래서, 내가 많은 기능을 가지고 있다면, 더 나은 분류 점수를 위해 어떤 알고리즘을 사용해야합니까?

내 목표는이 분류 작업에 대한 ROC-AUC 메트릭을 늘리는 것입니다.

SVM 또는 신경망을 사용하는 것이 더 낫습니까?

답변

1 CarlosMougan Sep 14 2020 at 21:45

내 마음에 가장 먼저 떠오르는 것은 다른 인코딩을 수행하는 것입니다. 라벨 인코딩 또는 유명한 대상 인코딩 과 같이 카디널리티가 높은 범주 데이터를 처리하는 몇 가지 방법이 있습니다 . 다른 것보다 먼저 인코딩 유형을 변경하는 것이 좋습니다.

그러나 작은 공간 데이터와 함께 사용하는 예측 변수에 대한 질문 이후. 로지스틱 회귀, 의사 결정 트리 또는 SVM을 계속 사용하겠습니다. 데이터가 작 으면 모든 알고리즘이 매우 유사하게 작동하는 경향이 있습니다.

Random Forest와 같은 것은 대체로 데이터를 샘플링하는 방법 인 경향이있는 부트 스트랩을 수행하기 때문에 잘 수행 될 수 있습니다.