TF-IDF pour la modélisation de sujets
TF-IDF peut-il être utilisé comme une seule méthode pour la modélisation thématique? (Je sais qu'il existe de meilleures méthodes comme LDA, LSA, etc.)
Je veux juste comprendre si TF-IDF seul peut nous aider dans la modélisation de sujets. Si oui, quelqu'un peut-il expliquer comment fonctionne ce cadre simple?
Je veux comprendre l'application et les capacités de TF-IDF en tant que méthode unique de modélisation de sujet. Je n'ai trouvé cela nulle part ailleurs sur Internet.
Réponses
Formellement, le problème de la modélisation des sujets est un problème de clustering: étant donné une collection de documents texte, regroupez les documents qui sont topiquement similaires.
Donc, techniquement, cela peut être fait avec une représentation TF-IDF des documents comme suit:
- Rassemblez le vocabulaire global de tous les documents et calculez l'IDF pour chaque mot.
- Représenter chaque document comme un vecteur TF-IDF de la manière habituelle: pour chaque mot, obtenir le terme fréquence dans le document (TF) puis multiplier par l'IDF globale pour ce mot (IDF). Notez que chaque vecteur doit représenter le document sur le vocabulaire global.
- Utilisez n'importe quelle méthode de clustering sur les représentations vectorielles des documents: K-means , clustering hiérarchique , etc.
Notez que cette méthode est peu susceptible d'être aussi bonne que les méthodes de pointe pour la modélisation de sujets.