NER sorununun genelliğini anlamak
Adlandırılmış varlık tanıma (NER), NLP literatüründe iyi bilinen bir sorundur.
Tipik olarak, metindeki adlandırılmış varlıkları bulma ve sınıflandırma sorununu ele alır, örn. OrganizationsVe Products.
Benzer bir sorunu çözmeye çalışıyorum ama bence biraz daha genel. Bir giriş metni verildiğinde, metnin tamamına kapsamlı bir şekilde açıklama ekleyebilmek istiyorum; gibi sadece belirli kişiler Actorsve Organizationsaynı zamanda gibi üst düzey kavramları Conditions of Applicabilityve Temporal Conditions, örneğin:
Ek zorluk, "varlıkları" iç içe yerleştirmemizdir, örneğin (yukarıdan):
<denotic> must, <temporal> within the specified period </temporal>, notify ... </deontic>
Bu hala bir NER problemi olarak formüle edilebilir mi? Öyleyse, ~ 50 bin örneklik bir veri kümesini varsayarak bu görevi çözmek için en iyi model türü hangisidir?
Yanıtlar
Tanımlanan sorun, Adlandırılmış Varlık Tanıma'nın daha genel bir sürümü değil, ayrıştırma adı verilen farklı bir sorundur . Ayrıştırma, genellikle anlambilimini daha iyi yakalamak amacıyla bir metnin sözdizimsel yapısını çıkarmaktan ibarettir. Çeşitli yaklaşımlar vardır:
- Sığ ayrıştırma yalnızca cümlelerin bileşenlerini tanımlar (örneğinize göre bu sizin durumunuzda yeterli olabilir)
- İstatistiksel çözümleme ve özellikle Bağımlılık ayrıştırma , bileşenleri arasındaki bağlantılar da dahil olmak üzere cümlenin tüm yapısını temsil eder.
Ayrıştırmak için çeşitli kitaplıklar ve veri kümeleri vardır: en ünlülerinden biri muhtemelen Stanford ayrıştırıcısıdır , ancak OpenNLP gibi NLP araç setlerinde sıklıkla yer alan başka birçokları da vardır . Evrensel bağımlılıklar proje ayrıştırıcıları yetiştirmek için kullanılabilir açıklamalı metnin geniş dilli topluluğudur.
Anlamsal Rol Etiketleme (SRL), bir yüklem (fiil) ile ilgili bileşenleri (örneğin özne, nesne) arasındaki anlamsal ilişkileri tanımlamayı içeren yakından ilişkili bir görevdir.