Clusterize Spectrum
Tôi có bảng gấu trúc chứa dữ liệu về các quan sát khác nhau, mỗi quan sát được đo ở cường độ khác nhau. Những quan sát này khác nhau trong cách đối xử mà họ đã nhận được. Bảng trông giống như sau:
>>>name treatment 410.1 423.2 445.6 477.1 485.2 ....
0 A1 0 0.01 0.02 0.04 0.05 0.87
1 A2 1 0.04 0.05 0.05 0.06 0.04
2 A3 2 0.03 0.02 0.03 0.01 0.03
3 A4 0 0.02 0.02 0.04 0.05 0.91
4 A5 1 0.05 0.06 0.04 0.05 0.02
...
Tôi muốn phân loại các quan sát khác nhau dựa trên phổ của chúng (các cột số).
Tôi đã cố gắng chạy PCA và vẽ nó theo cách xử lý mà các quan sát nhận được và so sánh nó với kết quả của các phân loại như k-mean và Spectral clustering, nhưng tôi không chắc rằng mình chọn đúng phương pháp vì có vẻ như mọi lúc như các cụm quá giống khoảng cách euclide và tôi không chắc rằng chúng có tính đến phổ (tôi đã sử dụng tất cả các cột số để dự đoán).
Điều này là để so sánh exampel giữa PCA + Màu sắc so với cllasification Quang phổ:
PCA:
phân loại (các điểm nằm theo PCA1 PCA2 nhưng màu sắc theo phân loại:
như bạn có thể thấy ở đây, có vẻ như phân loại dựa trên khoảng cách thực và tôi muốn thứ gì đó có tính đến tất cả các giá trị số.
Vì vậy, tôi đang tìm kiếm bất kỳ thông tin chi tiết nào về các phương pháp phân loại khác có thể mang lại cho tôi kết quả tốt hơn hoặc có thể là các ý tưởng khác để tôi có thể kiểm tra xem có các cụm bên trong dữ liệu của mình hay không dựa trên các phép đo trong các cột khác nhau, chẳng hạn như liệu tôi có thể dự đoán cách xử lý từ các cụm
Trả lời
Điều này nghe giống như một nhiệm vụ phân loại có giám sát bình thường.
Bạn đã thử các phương pháp tiêu chuẩn khác như Support Vector Machines, RandomForests, Gradient Boosting, kNN, Neural Networks, v.v. chưa hay có lý do cụ thể nào khiến bạn chỉ thử các phương pháp phân cụm.
Các phương pháp phân cụm như kmeans hoặc phân cụm quang phổ thường được sử dụng trong môi trường không được giám sát, nơi không có tư cách thành viên trong lớp. Thường thì họ đưa ra các giả định nhất định về dữ liệu có thể bị vi phạm, ví dụ: kmeans giả định các cụm hình cầu, điều này rõ ràng không đúng với dữ liệu của bạn.