Понимание общности проблемы NER
Распознавание именованных сущностей (NER) - хорошо известная проблема в литературе по НЛП.
Обычно он решает проблему поиска и классификации именованных объектов в тексте, например, Organizationsи Products.
Я пытаюсь решить аналогичную проблему, но, на мой взгляд, более общую. Учитывая введенный текст, я хочу иметь возможность полностью аннотировать весь текст; не только конкретные объекты, такие как Actorsи, Organizationsно и концепции более высокого уровня, такие как Conditions of Applicabilityи Temporal Conditions, например:
Дополнительная трудность заключается в том, что у нас есть вложенные «сущности», например (сверху):
<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>
Можно ли это все еще сформулировать как проблему NER? Если да, то какой тип модели лучше всего подходит для решения этой задачи, исходя из набора данных из ~ 50 000 примеров?
Ответы
Описанная проблема не является более общей версией распознавания именованных сущностей, это другая проблема, называемая синтаксическим анализом . Синтаксический анализ заключается в извлечении синтаксической структуры текста, обычно с целью лучшего улавливания его семантики. Есть разные подходы:
- Неглубокий синтаксический анализ определяет только составные части предложений (на основе вашего примера этого может быть достаточно в вашем случае)
- Статистический анализ и, в частности, анализ зависимостей представляют полную структуру предложения, включая связи между его составляющими.
Существуют различные библиотеки и наборы данных для синтаксического анализа: одним из самых известных, вероятно, является Стэнфордский синтаксический анализатор , но многие другие часто включаются в наборы инструментов НЛП, такие как OpenNLP . Проект Universal Dependencies - это обширная многоязычная коллекция аннотированного текста, которую можно использовать для обучения синтаксических анализаторов.
Маркировка семантических ролей (SRL) - это тесно связанная задача, которая состоит в идентификации семантических отношений между предикатом (глаголом) и его соответствующими составляющими (например, субъектом, объектом).