주제 모델링을위한 TF-IDF
Aug 27 2020
TF-IDF를 토픽 모델링을위한 유일한 방법으로 사용할 수 있습니까? (LDA, LSA 등과 같은 더 나은 방법이 있다는 것을 알고 있습니다)
TF-IDF만으로 토픽 모델링에 도움이 될 수 있는지 이해하고 싶습니다. 그렇다면 누군가 간단한 프레임 워크가 어떻게 작동하는지 설명 할 수 있습니까?
토픽 모델링을위한 유일한 방법으로서 TF-IDF의 적용과 기능을 이해하고 싶습니다. 나는 이것을 인터넷의 다른 곳에서 찾을 수 없었다.
답변
3 Erwan Aug 26 2020 at 23:42
공식적으로 주제 모델링의 문제는 클러스터링 문제입니다. 텍스트 문서 모음이 주어지면 주제가 비슷한 문서를 함께 그룹화합니다.
따라서 기술적으로 다음과 같이 문서의 TF-IDF 표현으로 실제로 수행 할 수 있습니다.
- 모든 문서에서 글로벌 어휘를 수집하고 모든 단어에 대한 IDF를 계산합니다.
- 모든 문서를 일반적인 방식으로 TF-IDF 벡터로 표시합니다. 모든 단어에 대해 문서 (TF)의 용어 빈도를 얻은 다음이 단어 (IDF)에 대한 전역 IDF를 곱합니다. 모든 벡터는 글로벌 어휘에 대한 문서를 나타내야합니다.
- 문서의 벡터 표현에 대해 클러스터링 방법을 사용합니다 : K- 평균 , 계층 적 클러스터링 등.
이 방법은 주제 모델링을위한 최첨단 방법만큼 좋지 않을 수 있습니다.