NER 문제의 일반성 이해
명명 된 개체 인식 (NER)은 NLP 문헌에서 잘 알려진 문제입니다.
일반적으로 텍스트에서 명명 된 엔티티를 찾아 분류하는 문제를 해결합니다 (예 : Organizations및 Products.
비슷한 문제를 해결하려고 노력하고 있지만 제 생각에는 좀 더 일반적입니다. 입력 텍스트가 주어지면 전체 텍스트에 포괄적으로 주석을 달 수 있기를 원합니다. 같은뿐만 아니라 특정 기관 Actors및 Organizations뿐만 아니라 같은 높은 수준의 개념 Conditions of Applicability과 Temporal Conditions, 예를 들면 :
추가 된 어려움은 예를 들어 (위에서) 중첩 된 "엔티티"가 있다는 것입니다.
<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>
이것이 여전히 NER 문제로 공식화 될 수 있습니까? 그렇다면 ~ 50K 예제의 데이터 세트를 가정하여이 작업을 해결하는 데 가장 좋은 모델 유형은 무엇입니까?
답변
설명 된 문제는 명명 된 엔터티 인식의 일반적인 버전이 아니라 구문 분석 이라는 다른 문제 입니다. 구문 분석은 텍스트의 구문 구조를 추출하는 것으로 구성되며 일반적으로 의미론을 더 잘 포착하기위한 목표입니다. 다양한 접근 방식이 있습니다.
- 얕은 구문 분석 은 문장의 구성 요소 만 식별합니다 (귀하의 예에 따라 귀하의 경우에 충분할 수 있음).
- 통계적 구문 분석 및 특히 종속성 구문 분석 은 구성 요소 간의 링크를 포함하여 문장의 전체 구조를 나타냅니다.
파싱을위한 다양한 라이브러리와 데이터 셋이 있습니다. 가장 유명한 것 중 하나는 아마도 Stanford 파서 일 것입니다. 그러나 OpenNLP 와 같은 NLP 툴킷에 종종 포함되는 다른 많은 것들이 있습니다. 유니버설 종속성 프로젝트는 파서를 양성하는 데 사용할 수있는 주석 텍스트의 광대 한 다국어 모음입니다.
SRL ( Semantic Role Labeling )은 술어 (동사)와 관련 구성 요소 (예 : 주제, 객체) 사이의 의미 관계를 식별하는 것으로 구성된 밀접하게 관련된 작업입니다.