Verständnis der Allgemeinheit des NER-Problems

Oct 27 2020

Named Entity Recognition (NER) ist ein bekanntes Problem in der NLP-Literatur.

In der Regel wird das Problem behoben, benannte Entitäten im Text zu finden und zu klassifizieren, z . B. Organizationsund Products.

Ich versuche ein ähnliches Problem zu lösen, aber meiner Meinung nach etwas allgemeiner. Bei einem Eingabetext möchte ich in der Lage sein, den gesamten Text umfassend zu kommentieren. nicht nur bestimmte Entitäten wie Actorsund, Organizationssondern auch übergeordnete Konzepte wie Conditions of Applicabilityund Temporal Conditions, z.

Die zusätzliche Schwierigkeit besteht darin, dass wir verschachtelte "Entitäten" haben, z. B. (von oben):

<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>

Kann dies immer noch als NER-Problem formuliert werden? Wenn ja, welches wäre der beste Modelltyp, um diese Aufgabe unter der Annahme eines Datensatzes von ~ 50 K Beispielen zu lösen?

Antworten

1 Erwan Oct 27 2020 at 19:49

Das beschriebene Problem ist keine allgemeinere Version der Erkennung benannter Entitäten, sondern ein anderes Problem, das als Parsing bezeichnet wird . Das Parsen besteht darin, die syntaktische Struktur eines Textes zu extrahieren, normalerweise mit dem Ziel, seine Semantik besser zu erfassen. Es gibt verschiedene Ansätze:

  • Flaches Parsen identifiziert nur die Bestandteile der Sätze (basierend auf Ihrem Beispiel könnte dies in Ihrem Fall ausreichend sein)
  • Die statistische Analyse und insbesondere die Abhängigkeitsanalyse stellen die vollständige Struktur des Satzes dar, einschließlich der Verknüpfungen zwischen seinen Bestandteilen.

Es gibt verschiedene Bibliotheken und Datensätze zum Parsen: Eine der bekanntesten ist wahrscheinlich der Stanford-Parser , aber es gibt viele andere, die häufig in NLP-Toolkits wie OpenNLP enthalten sind . Das Universal Dependencies- Projekt ist eine umfangreiche mehrsprachige Sammlung kommentierter Texte, mit denen Parser trainiert werden können.

Semantic Role Labeling (SRL) ist eine eng verwandte Aufgabe, die darin besteht, die semantischen Beziehungen zwischen einem Prädikat (Verb) und seinen verwandten Bestandteilen (z. B. Subjekt, Objekt) zu identifizieren.