Sentiment Analysis su testi lunghi e strutturati
Sto cercando di imparare come funziona l'analisi del sentiment basata su tecniche di machine learning leggendo guide online e articoli dal mondo accademico e sto lottando per capire quanto segue:
Perché le persone non eseguono - o, almeno, quasi mai - analisi del sentiment su testi lunghi e strutturati come articoli di giornale o trascrizioni di discorsi?
Ho notato che è abbastanza comune analizzare le recensioni e i titoli dei giornali perché sono brevi in termini di caratteri. Quindi ... mi chiedevo se fosse solo per la potenza di calcolo e il tempo necessari per addestrare gli algoritmi di ML (pensa alle reti neurali) o per altri motivi.
Qualcuno può aiutarmi a capire?
Risposte
Mi chiedevo se fosse solo per la potenza di calcolo e il tempo necessari per addestrare gli algoritmi di ML
Non è per questo; probabilmente è perché un testo lungo e strutturato può probabilmente contenere segmenti di sentimento "positivo" insieme a quelli "negativi", può essere infinitamente più sottile e sfumato, e in linea di principio cercare semplicemente di etichettarlo come "positivo / negativo" ( o anche aggiungere un altro paio di categorie di sentiment) è futile, improduttivo e alla fine della giornata difficilmente utile.
Andrew Ng ha notoriamente detto :
Se una persona tipica può svolgere un compito mentale con meno di un secondo di pensiero, probabilmente possiamo automatizzarlo utilizzando l'intelligenza artificiale ora o nel prossimo futuro.
e questa è esattamente l'idea alla base dell'analisi del sentiment: per brevi estratti di testo, e specialmente per i tipi di analisi del sentiment testuale per cui viene solitamente utilizzata (recensioni, tweet, ecc.), una persona tipica non ha difficoltà a classificarli in un elenco così breve di possibili sentimenti; inoltre, questo è un compito che vogliamo automatizzare, in modo da poterlo svolgere in modo massiccio e su larga scala senza dover sottoporre una persona a eseguirli uno per uno (non un approccio scalabile).
Questi sono requisiti che normalmente non si applicano a testi lunghi e strutturati, come articoli di giornale (lunghi), saggi ecc .; e in questi casi, non è raro che le persone che li leggano siano in disaccordo se, nel complesso, sono "positivi", "negativi", di supporto, contrarian ecc. (hai un'idea), quindi qualsiasi pensiero di delegare effettivamente un tale compito a un modello ML è in realtà oltre ogni considerazione, almeno per il momento, e non per mancanza di potenza di calcolo.
La ragione principale sarebbe la densità e la diversità dei sentimenti nei testi lunghi. Assumendo la presenza di un certo sentiment (positivo, negativo), può essere misurato più facilmente all'interno di un breve testo in quanto la probabilità di avere più di un soggetto o più di un sentimento specifico su un argomento, è minore.
Se leggi un testo lungo, potrebbero esserci diversi argomenti diversi e diversi sentimenti diversi su ciascun argomento da stimare.
Ad esempio, supponi un'opinione di un paragrafo su un film. Molto probabilmente riassumerà un'opinione generale sul film e sarà più facile da catturare.
Ma una critica di due pagine su un film potrebbe considerare un'ottima recitazione, musica così così e effetti speciali pessimi. Allora l'intero problema dell'analisi del sentiment cambierà qui. Stiamo parlando di ogni sentimento su ogni argomento o di un sentimento generale sull'intero film? Il sentimento generale sull'intero film è la media di tutti i sentimenti su argomenti o rileva il sentimento del paragrafo che riassume l'intero articolo?
Anche nelle recensioni quasi brevi quando lo scrittore scrive su diversi argomenti in revisione piuttosto che essere puntuale sull'argomento centrale, l'analisi del sentiment non è il compito più semplice.