주제 모델링을위한 TF-IDF

Aug 27 2020

TF-IDF를 토픽 모델링을위한 유일한 방법으로 사용할 수 있습니까? (LDA, LSA 등과 같은 더 나은 방법이 있다는 것을 알고 있습니다)

TF-IDF만으로 토픽 모델링에 도움이 될 수 있는지 이해하고 싶습니다. 그렇다면 누군가 간단한 프레임 워크가 어떻게 작동하는지 설명 할 수 있습니까?

토픽 모델링을위한 유일한 방법으로서 TF-IDF의 적용과 기능을 이해하고 싶습니다. 나는 이것을 인터넷의 다른 곳에서 찾을 수 없었다.

답변

3 Erwan Aug 26 2020 at 23:42

공식적으로 주제 모델링의 문제는 클러스터링 문제입니다. 텍스트 문서 모음이 주어지면 주제가 비슷한 문서를 함께 그룹화합니다.

따라서 기술적으로 다음과 같이 문서의 TF-IDF 표현으로 실제로 수행 할 수 있습니다.

  1. 모든 문서에서 글로벌 어휘를 수집하고 모든 단어에 대한 IDF를 계산합니다.
  2. 모든 문서를 일반적인 방식으로 TF-IDF 벡터로 표시합니다. 모든 단어에 대해 문서 (TF)의 용어 빈도를 얻은 다음이 단어 (IDF)에 대한 전역 IDF를 곱합니다. 모든 벡터는 글로벌 어휘에 대한 문서를 나타내야합니다.
  3. 문서의 벡터 표현에 대해 클러스터링 방법을 사용합니다 : K- 평균 , 계층 적 클러스터링 등.

이 방법은 주제 모델링을위한 최첨단 방법만큼 좋지 않을 수 있습니다.