NER問題の一般性を理解する
固有表現抽出(NER)は、NLPの文献でよく知られている問題です。
これは通常、テキスト内の名前付きエンティティを見つけて分類する問題に対処します(例:Organizationsおよび)Products。
私は同様の問題を解決しようとしていますが、私の見解では、もう少し一般的です。入力テキストが与えられた場合、テキスト全体に包括的に注釈を付けることができるようにしたいと思います。以下のようなだけではなく、特定のエンティティActorsとOrganizationsだけでなく、のような高レベルの概念Conditions of ApplicabilityとTemporal Conditions、例えば:
追加の難しさは、たとえば(上から)「エンティティ」をネストしていることです。
<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>
これはまだNER問題として定式化できますか?もしそうなら、約5万の例のデータセットを想定して、このタスクを解決するための最良のタイプのモデルは何でしょうか?
回答
説明されている問題は、固有表現抽出のより一般的なバージョンではなく、解析と呼ばれる別の問題です。構文解析は、通常、テキストのセマンティクスをより適切にキャプチャすることを目的として、テキストの構文構造を抽出することで構成されます。さまざまなアプローチがあります。
- シャローパーサは文の構成要素のみを識別します(あなたの例に基づいて、これはあなたの場合には十分かもしれません)
- 統計的構文解析、特に依存関係の構文解析は、構成要素間のリンクを含む、文の完全な構造を表します。
解析用のさまざまなライブラリとデータセットがあります。最も有名なものの1つはおそらくスタンフォードパーサーですが、OpenNLPなどのNLPツールキットに含まれることが多い他の多くのものがあります。ユニバーサル依存関係のプロジェクトは、パーサを訓練するために使用することができる注釈付きテキストの膨大な多言語のコレクションです。
セマンティックロールラベリング(SRL)は、述語(動詞)とそれに関連する構成要素(主語、目的語など)の間のセマンティック関係を識別することからなる密接に関連するタスクです。