WOCHE #5 Frageassistent Barlas

Dec 19 2022
Hey Leute, wir haben diese Woche angefangen, einen Fortschrittsbericht zu schreiben. Bevor wir mit dem Schreiben beginnen, versuchen wir, unseren Datensatz auf dem mT5-Modell [1] mit dem TQuAD-Datensatz [2] zu optimieren.

Hey Volk,

Wir haben in dieser Woche begonnen, einen Fortschrittsbericht zu schreiben. Bevor wir mit dem Schreiben beginnen, versuchen wir, unseren Datensatz auf dem mT5-Modell [1] mit dem TQuAD-Datensatz [2] zu optimieren. Beginnen wir mit der Erklärung des mT5-Modells.

T5 NLP-Modell

T5 ist ein umfangreiches vortrainiertes Sprachmodell, das von Google für NLP-Aufgaben entwickelt wurde. Es wurde in einem von Google Research im Jahr 2020 veröffentlichten Artikel vorgestellt, der es als „Text-zu-Text-Übertragungstransformator“ beschreibt, der für eine Vielzahl von NLP-Aufgaben feinabgestimmt werden kann. T5 basiert auf der Transformer-Architektur, die Aufmerksamkeitsmechanismen verwendet, um Eingabetext zu verarbeiten und Ausgabetext zu generieren. Im Gegensatz zu vielen früheren Sprachmodellen ist T5 darauf trainiert, Text als Reaktion auf eine bestimmte Eingabeaufforderung zu generieren, wodurch es für eine Vielzahl von NLP-Aufgaben feinabgestimmt werden kann, ohne dass aufgabenspezifische Architekturen erforderlich sind. Leider sind T5 und viele Sprachmodelle auf Englisch vortrainiert. \%80 der Welt spricht kein Englisch [3]. Das schränkt die Anzahl der Benutzer dieses Modells ein.

mT5 NLP-Modell

mT5 ist eine Variante des T5-Modells. Der Unterschied zum T5-Modell besteht darin, dass es mehrsprachig ist. mT5 enthält die meisten Funktionen von T5, wie z. B. sein universelles Text-zu-Text-Format, sein Design, das auf Erkenntnissen aus einer groß angelegten empirischen Studie basiert, und seinen Umfang. Sie verwendeten eine mehrsprachige Variante des C4-Datensatzes. Das ist mC4. Es besteht aus 101 verschiedenen Sprachen. Dieser Datensatz wird durch Web Scraping erstellt.

Das mT5-Modell besteht aus einer Reihe von Transformatorblöcken, von denen jeder mehrere Selbstaufmerksamkeitsschichten und Feedforward-Schichten enthält. Die Selbstaufmerksamkeitsschichten ermöglichen es dem Modell, sich zu unterschiedlichen Zeiten um verschiedene Teile der Eingabe zu kümmern, während die Feedforward-Schichten die Eingabe verarbeiten und die Ausgabe generieren.

Wir haben gerade das fein abgestimmte Modell an verschiedenen Texten getestet. Sie können die Kontexte und generierten Fragen unten sehen.

Beispieltest 1

Der Kontext des ersten Tests stammt aus den Validierungsdaten des TQuAD-Datensatzes. Alle generierten Fragen sehen sinnvoll aus.

Beispieltest 2
Beispieltest 3

Da unser Datensatz aus Abschnitten der türkischen und islamischen Wissenschaftsgeschichte besteht. Wir wollten unser Modell nur an nicht historischen Daten testen. Die Ergebnisse sind aussagekräftig.

Was werden wir als nächstes tun?

Wir werden versuchen, die Leistung des Modells durch Hyperparameter-Tuning zu steigern. Außerdem werden wir uns das mBERT-Modell ansehen. Danke fürs Lesen.

Nicht vergessen. Wenn Sie Hilfe brauchen, rufen Sie besser Barlas an.

Ich hoffe, wir sehen uns nächste Woche. Tschüss!

von Mehmet Berat Ersarı & Zeynep Hafsa Dilmaç

Verweise

[1] Xue, L., Constant, N., Roberts, A., Kale, M., Al-Rfou, R., Siddhant, A., Barua, A., und Raffel, C. mt5: A Massively Multilingual vortrainierter Text-zu-Text-Transformator. S. 483– 498, 01 2021. doi: 10.18653/v1/2021.naacl-main.41.

[2] TQuad (2019) Türkischer NLP-Q&A-Datensatzhttps://github.com/TQuad/turkish-nlp-qa-dataset[abgerufen am 11.09.2022]

[3] Crystal, D. Zweitausend Millionen? English Today, 24:3–6,
03.2008. doi: 10.1017/S0266078408000023