Comprendre la généralité du problème NER

Oct 27 2020

La reconnaissance d'entités nommées (NER) est un problème bien connu dans la littérature PNL.

Il résout généralement le problème de la localisation et de la classification des entités nommées dans le texte, par exemple Organizationset Products.

J'essaie de résoudre un problème similaire mais, à mon avis, un peu plus général. Étant donné un texte d'entrée, je veux pouvoir annoter de manière complète le texte entier; non seulement des entités spécifiques comme Actorset Organizationsmais aussi des concepts de niveau supérieur comme Conditions of Applicabilityet Temporal Conditions, par exemple:

La difficulté supplémentaire est que nous avons des "entités" imbriquées, par exemple (d'en haut):

<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>

Cela peut-il encore être formulé comme un problème NER? Si tel est le cas, quel serait le meilleur type de modèle pour résoudre cette tâche en supposant un ensemble de données d'environ 50 K exemples?

Réponses

1 Erwan Oct 27 2020 at 19:49

Le problème décrit n'est pas une version plus générale de la reconnaissance d'entités nommées, c'est un problème différent appelé analyse . L'analyse consiste à extraire la structure syntaxique d'un texte, généralement dans le but de mieux saisir sa sémantique. Il existe différentes approches:

  • L'analyse superficielle identifie uniquement les constituants des phrases (sur la base de votre exemple, cela pourrait être suffisant dans votre cas)
  • L'analyse statistique et en particulier l' analyse des dépendances représente la structure complète de la phrase, y compris les liens entre ses constituants.

Il existe différentes bibliothèques et ensembles de données pour l'analyse: l'un des plus connus est probablement l'analyseur de Stanford , mais il y en a beaucoup d'autres souvent inclus dans les toolkits NLP tels qu'OpenNLP . Le projet Universal Dependencies est une vaste collection multilingue de texte annoté qui peut être utilisé pour former des analyseurs.

L'étiquetage sémantique des rôles (SRL) est une tâche étroitement liée qui consiste à identifier les relations sémantiques entre un prédicat (verbe) et ses constituants associés (par exemple sujet, objet).