Compreender a generalidade do problema NER

Oct 27 2020

O reconhecimento de entidade nomeada (NER) é um problema bem conhecido na literatura da PNL.

Normalmente, trata do problema de localizar e classificar entidades nomeadas em texto, por exemplo, Organizationse Products.

Estou tentando resolver um problema semelhante, mas, a meu ver, um pouco mais geral. Dado um texto de entrada, desejo ser capaz de anotar de forma abrangente todo o texto; não apenas entidades específicas como Actorse, Organizationsmas também conceitos de nível superior como Conditions of Applicabilitye Temporal Conditions, por exemplo:

A dificuldade adicional é que temos "entidades" aninhadas, por exemplo (de cima):

<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>

Isso ainda pode ser formulado como um problema de NER? Em caso afirmativo, qual seria o melhor tipo de modelo para resolver essa tarefa assumindo um conjunto de dados de ~ 50 mil exemplos?

Respostas

1 Erwan Oct 27 2020 at 19:49

O problema descrito não é uma versão mais geral do Reconhecimento de Entidade Nomeada, é um problema diferente denominado análise . A análise consiste em extrair a estrutura sintática de um texto, geralmente com o objetivo de captar melhor sua semântica. Existem várias abordagens:

  • A análise superficial identifica apenas os constituintes das frases (com base no seu exemplo, isso pode ser suficiente no seu caso)
  • A análise estatística e, em particular, a análise de dependência representam a estrutura completa da frase, incluindo as ligações entre seus constituintes.

Existem várias bibliotecas e conjuntos de dados para análise: um dos mais famosos é provavelmente o analisador de Stanford , mas há muitos outros frequentemente incluídos em kits de ferramentas de PNL, como o OpenNLP . O projeto Dependências Universais é uma vasta coleção multilíngue de texto anotado que pode ser usado para treinar analisadores.

A etiquetagem de papéis semânticos (SRL) é uma tarefa intimamente relacionada que consiste em identificar as relações semânticas entre um predicado (verbo) e seus constituintes relacionados (por exemplo, sujeito, objeto).