Algoritmo per la classificazione binaria
Ho un set di dati con un numero enorme di funzioni (circa 3000) e una variabile di destinazione binaria. Il motivo per cui ho troppe funzionalità è a causa di una codifica a caldo di molte variabili categoriali nel mio set di dati.
Penso che la regressione logistica potrebbe funzionare solo con un numero limitato di funzionalità.
Quindi, dato che ho molte funzionalità, quale algoritmo dovrei usare per ottenere un punteggio di classificazione migliore?
Il mio scopo è aumentare la metrica ROC-AUC per questo compito di classificazione.
È meglio usare SVM o reti neurali?
Risposte
La prima cosa che mi viene in mente è fare codifiche diverse. Esistono alcuni modi per gestire dati categoriali ad alta cardinalità come: Codifica etichetta o la famosa codifica target . Prima di ogni altra cosa consiglierò di cambiare il tipo di codifica.
Ma, dalla tua domanda su quale predittore usare con dati piccoli e spaziali. Andrò ancora con regressione logistica, albero decisionale o SVM. Quando i dati sono piccoli, tutti gli algoritmi tendono a funzionare in modo abbastanza simile.
Cose come Random Forest potrebbero funzionare bene poiché eseguono il bootstrap di quello che tende ad essere un modo per campionare i dati con la sostituzione.