Comprender la generalidad del problema NER

Oct 27 2020

El reconocimiento de entidades nombradas (NER) es un problema bien conocido en la literatura sobre PNL.

Por lo general, aborda el problema de localizar y clasificar entidades con nombre en texto, por ejemplo, Organizationsy Products.

Estoy tratando de resolver un problema similar pero, en mi opinión, un poco más general. Dado un texto de entrada, quiero poder realizar anotaciones completas en todo el texto; no solo entidades específicas como Actorsy, Organizationssino también conceptos de nivel superior como Conditions of Applicabilityy Temporal Conditions, por ejemplo:

La dificultad adicional es que hemos anidado "entidades", por ejemplo (desde arriba):

<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>

¿Se puede todavía formular esto como un problema de NER? Si es así, ¿cuál sería el mejor tipo de modelo para resolver esta tarea asumiendo un conjunto de datos de ~ 50 K ejemplos?

Respuestas

1 Erwan Oct 27 2020 at 19:49

El problema descrito no es una versión más general de Reconocimiento de entidades nombradas, es un problema diferente llamado análisis . El análisis consiste en extraer la estructura sintáctica de un texto, generalmente con el objetivo de capturar mejor su semántica. Hay varios enfoques:

  • El análisis superficial solo identifica los constituyentes de las oraciones (según su ejemplo, esto podría ser suficiente en su caso)
  • El análisis sintáctico estadístico y, en particular, el análisis de dependencias representan la estructura completa de la oración, incluidos los vínculos entre sus componentes.

Hay varias bibliotecas y conjuntos de datos para el análisis: uno de los más famosos es probablemente el analizador de Stanford , pero hay muchos otros que se incluyen a menudo en los kits de herramientas de PNL como OpenNLP . El proyecto Universal Dependencies es una vasta colección multilingüe de texto anotado que se puede utilizar para capacitar a los analizadores.

El etiquetado de roles semánticos (SRL) es una tarea estrechamente relacionada que consiste en identificar las relaciones semánticas entre un predicado (verbo) y sus constituyentes relacionados (por ejemplo, sujeto, objeto).