Clusterize Spectrum
J'ai un tableau de pandas qui contient des données sur différentes observations, chacune a été mesurée dans une longueur d'onde différente. Ces observations sont différentes les unes des autres dans le traitement qu'elles ont reçu. Le tableau ressemble à ceci:
>>>name treatment 410.1 423.2 445.6 477.1 485.2 ....
0 A1 0 0.01 0.02 0.04 0.05 0.87
1 A2 1 0.04 0.05 0.05 0.06 0.04
2 A3 2 0.03 0.02 0.03 0.01 0.03
3 A4 0 0.02 0.02 0.04 0.05 0.91
4 A5 1 0.05 0.06 0.04 0.05 0.02
...
Je voudrais classer les différentes observations en fonction de leur spectre (les colonnes numériques).
J'ai essayé d'exécuter PCA et de le peindre en fonction du traitement obtenu par les observations, et de le comparer aux résultats de classifications comme k-means et clustering spectral, mais je ne suis pas sûr de choisir les bonnes méthodes car il semble tout le temps comme les clusters ressemblent trop à la distance euclidienne et je ne suis pas sûr qu'ils prennent en compte le spectre (j'ai utilisé toutes les colonnes numériques pour la prédiction).
Voici par exemple la comparaison entre les couleurs PCA + et la classification spectrale:
PCA:
classification (les points situés selon PCA1 PCA2 mais les couleurs sont selon le classement:
comme vous pouvez le voir ici, il semble que la classification soit basée sur la distance réelle et j'aimerais quelque chose qui prenne en compte toutes les valeurs numériques.
Donc, je recherche des informations sur d'autres méthodes de classification qui pourraient me donner de meilleurs résultats ou peut-être d'autres idées sur la façon dont je peux vérifier s'il y a des grappes dans mes données en fonction des mesures dans différentes colonnes, comme si je pouvais prédire le traitement des clusters
Réponses
Cela ressemble à une tâche de classification supervisée normale.
Avez-vous essayé d'autres méthodes standard telles que Support Vector Machines, RandomForests, Gradient Boosting, kNN, Neural Networks, etc. ou y a-t-il une raison particulière pour laquelle vous n'avez essayé que les méthodes de clustering.
Les méthodes de clustering comme les kmeans ou le clustering spectral sont généralement utilisées dans un environnement non supervisé où les appartenances aux classes ne sont pas disponibles. Souvent, ils émettent certaines hypothèses sur les données qui pourraient être violées, par exemple kmeans suppose des clusters sphériques, ce qui n'est clairement pas le cas pour vos données.