TF-IDF para modelagem de tópicos
O TF-IDF pode ser usado como um método único para modelagem de tópicos? (Eu sei que existem métodos melhores, como LDA, LSA, etc.)
Só quero entender se o TF-IDF sozinho pode nos ajudar na modelagem de tópicos. Se sim, alguém pode explicar como funciona essa estrutura simples?
Eu quero entender a aplicação e os recursos do TF-IDF como um único método para Modelagem de Tópicos. Não consegui encontrar isso em nenhum outro lugar da internet.
Respostas
Formalmente, o problema da modelagem de tópicos é um problema de agrupamento: dada uma coleção de documentos de texto, agrupe os documentos que são topicamente semelhantes.
Então, tecnicamente, isso pode ser feito com uma representação TF-IDF de documentos da seguinte forma:
- Colete o vocabulário global em todos os documentos e calcule o IDF para cada palavra.
- Represente cada documento como um vetor TF-IDF da maneira usual: para cada palavra, obtenha o termo frequência no documento (TF) e multiplique pelo IDF global para esta palavra (IDF). Observe que cada vetor deve representar o documento sobre o vocabulário global.
- Use qualquer método de agrupamento sobre as representações vetoriais dos documentos: K-médias , agrupamento hierárquico , etc.
Observe que é improvável que esse método seja tão bom quanto os métodos de última geração para modelagem de tópicos.