Documenti minerari per sequenze nucleotidiche e peptidiche
La letteratura sull'estrazione del testo pone l'accento sull'identificazione e la normalizzazione di nomi di geni, mutazioni, percorsi, concetti e così via. Non sono stato in grado di trovare molto, tuttavia, sui metodi per estrarre sequenze di nucleotidi e peptidi dai documenti. Ho trovato questo bocconcino da Aerts et al. (2008) , enfasi mia:
Il testo è stato suddiviso in parole e le parole di lunghezza superiore a 10 caratteri con più del 40% di caratteri dell'alfabeto del DNA in maiuscolo [ACGT] sono state estratte utilizzando espressioni regolari per isolare sequenze di DNA putative. Tutte le presunte sequenze di DNA estratte da ciascuna carta sono state concatenate nell'ordine in cui apparivano nel testo in una singola sequenza fasta ed etichettate con il PMID corrispondente. La concatenazione di sequenze è stata eseguita per unire sequenze suddivise da interruzioni di riga nella conversione del testo e poiché abbiamo ritenuto che i join inappropriati sarebbero stati riconciliati a livello del genoma mediante procedure di allineamento locali . Le sequenze estratte e concatenate sono state utilizzate come query per BLAST Repeat Versioni mascherate di sequenze genomiche scaricate dal database genoma UCSC ...
Sono colpito da quanto sia semplice il metodo dell'autore per estrarre le sequenze di DNA. Ma immagino che con la complessità limitata dell'alfabeto del DNA, abbia senso. Questo approccio non funzionerebbe con l'alfabeto proteico molto più complesso.
Le espressioni regolari semplici sono lo stato dell'arte della comunità di text mining per trovare sequenze di DNA / RNA nei documenti? Quali metodi vengono utilizzati per identificare le sequenze proteiche?
Risposte
Non sono sicuro che ci sia uno stato dell'arte per questo.
Alcune possibili strategie a cui posso pensare:
- Applicare un dizionario per identificare le parole della lingua e scartarle.
- Utilizzando alcune informazioni di contesto come identificare alcune parole nella stessa frase rispetto alla sequenza.
- Immagino che il formato nei documenti per le sequenze non sarà lo stesso del testo. Forse puoi trovare uno schema.
Userei una strategia incrementale. Usa l'algoritmo più semplice e guarda cosa recupera. Se c'è spazzatura, trova una strategia per rimuovere alcuni rifiuti con uno schema comune. Ripeti finché non sei soddisfatto del risultato.
Disclaimer: ho una certa esperienza nell'elaborazione del linguaggio naturale.