GPT-3-Übersetzungsfunktionen
Einführung
Am 28. November 2022 veröffentlichte OpenAI sein neuestes GPT-3-Modell, davinci-003, das als „GPT-3.5“ bezeichnet wird. In ihrem Newsletter beschrieben sie es wie folgt:
Wir freuen uns, die Veröffentlichung des neuesten Mitglieds der GPT-3-Modellfamilie bekannt zu geben: „text-davinci-003“. Dieses Modell baut auf unseren früheren InstructGPT- Modellen auf und verbessert eine Reihe von Verhaltensweisen, von denen wir gehört haben, dass sie für Sie als Entwickler wichtig sind.
„text-davinci-003“ enthält die folgenden Verbesserungen:
Es erzeugt eine höhere Schreibqualität. Dies trägt dazu bei, dass Ihre Anwendungen klarere, ansprechendere und überzeugendere Inhalte liefern.
Es kann komplexere Anweisungen verarbeiten, sodass Sie bei der Nutzung seiner Funktionen jetzt noch kreativer werden können.
Es eignet sich besser für die Inhaltsgenerierung in längerer Form, sodass Sie Aufgaben übernehmen können, die früher zu schwierig gewesen wären.
Wir bei Intento haben das neue Modell sofort ausprobiert, waren begeistert und fanden es hilfreich für verschiedene Aufgaben zur Quellqualitätsverbesserung und automatischen Nachbearbeitung in unseren Arbeitsabläufen.
Es bleiben noch ein paar Fragen offen:
- Kann GPT-3 als maschinelles Übersetzungsmodell verwendet werden?
- Wie schneidet die Übersetzungsleistung von GPT-3 im Vergleich zu engeren MT-Modellen wie Google und DeepL ab?
- Wie ist die Übersetzungsqualität für Fachinhaltsdomänen wie Gesundheitswesen oder Recht?
- Wie hoch wären die Kosten pro Million Zeichen für die GPT-3-Übersetzung?
Allgemeine Domänenübersetzung
Experimentelles Setting
Für die allgemeine Domain-Übersetzung haben wir die Richtungen Englisch-Spanisch und Englisch-Deutsch gewählt. Wir haben für jede Richtung 500-Segment-Stichproben mit Referenzübersetzungen aus unserem Benchmark „State of the Machine Translation 2022“ entnommen. Für reproduzierbare Ergebnisse haben wir GPT-3 verwendet, das von OpenAI gehostet wird, Modell davinci-003 , mit einer Temperatur von 0.
Wir haben beschlossen, verschiedene Eingabeaufforderungen zu bewerten, damit GPT-3 Übersetzungen erstellen kann.
PROMPT 1: Translate this from English to {TARGET_LANGUAGE}:\n"""{SEGMENT}"""
PROMPT 2: The following is the text """{SEGMENT}""" translated from English to {TARGET LANGUAGE}: """
PROMPT 3: English text: """{SEGMENT}"""\nTranslation into {TARGET_LANGUAGE}: """
PROMPT 4: English: """{SEGMENT}"""\n{TARGET_LANGUAGE}: """
PROMPT 5:
TARGET_LANGUAGE_LOCAL = "Español"
English: """{SEGMENT}"""\n{TARGET_LANGUAGE_LOCAL}: """
Wir haben GPT-3-Übersetzungen mit Übersetzungen bekannter Standard-MT-Engines wie Amazon, Apptek, Baidu, DeepL, Google, IBM, Microsoft, ModernMT, Niutrans, Systran und Ubiqus verglichen.
Zur Bewertung der MT-Qualität verwendeten wir dieselbe Version des referenzbasierten COMET-Scores wie in unserem September-Bericht. Es gibt eine neuere Version von COMET, die im Dezember 2022 veröffentlicht wurde, wir gehen jedoch nicht davon aus, dass die Ergebnisse wesentlich anders ausfallen werden.
Übersetzungsvariabilität
Bei einer Temperatureinstellung von 0 konnten wir für dieselbe Eingabeaufforderung keine Übersetzungsvariabilität feststellen. Wir haben auch eine umfassendere Studie zur Variabilität durchgeführt und nur einen Fall im Finanzbereich gefunden, in dem GPT-3 zufällig entweder „16 Millionen Euro und 139 Millionen Euro“ oder „16 Millionen Euro und 139 Millionen Euro“ ergab.
Zwischen verschiedenen Eingabeaufforderungen sind 35–45 % der Übersetzungen unterschiedlich. Insgesamt bestehen die Unterschiede in der Groß- und Kleinschreibung, der Wortreihenfolge, der DNT-Terminologie (zumeist ungerechtfertigt) und der Zeichensetzung. In den meisten Fällen, mit Ausnahme von DNT-Begriffen, hat dies keinen großen Einfluss auf die Gesamtqualität der Übersetzung. Im Deutschen sind die größten Probleme grammatikalische Fehler bei einigen Versuchen in einigen Aufforderungen und fragwürdige Verbwahlen, also einige lexikalische Fehler. Insgesamt ist die Qualität jedoch recht solide und wir konnten keine kritischen Probleme feststellen.
Übersetzungsleistung und Zuverlässigkeit
Die Übersetzung eines 500-Segment-Datensatzes dauerte normalerweise etwa 30 Minuten oder 3–4 Sekunden pro Segment, was etwa zehnmal langsamer ist als bei den meisten Standardmodellen für maschinelle Übersetzung. Während der Übersetzungen haben wir viele API-Fehler registriert, die mehrere Wiederholungsversuche erforderten. Wir planen zu prüfen, ob die Bereitstellung von GPT-3 in Azure weniger Fehler verursacht.
Übersetzungsqualität
Basierend auf der COMET-Bewertung gibt es keinen signifikanten Unterschied zwischen den oben genannten Eingabeaufforderungen.
Bei Englisch => Spanisch lag GPT-3 nahe an den Spitzenreitern (Google, Amazon, DeepL, Microsoft und ModernMT). Allerdings lag der durchschnittliche Score-Wert eher im unteren Bereich.
Für Englisch => Deutsch liegt GPT-3 in der zweiten Stufe, mit deutlich niedrigeren Werten als die Top-Läufer (DeepL, Google, Amazon und Microsoft).
Spezifische GPT-3-Übersetzungsfehler auf Spanisch
Bei der menschlichen LQA der spanischen Übersetzung durch GPT-3 wurden einige Probleme festgestellt: hauptsächlich einige Auslassungen, falsche DNTs, einige Terminologiefehler und einige fragwürdige Grammatik. Prompt 2 führte zu deutlich weniger kritischen Problemen.
Beispiel einer GPT-3-Fehlübersetzung für Englisch => Spanisch
Beispiel einer GPT-3-Übersetzung, falsches DNT-Problem für Englisch => Spanisch
Beispiel für ein GPT-3-Übersetzungsgrammatikproblem für Englisch => Spanisch
Beispiel für ein wörtliches GPT-3-Übersetzungsproblem für Englisch => Spanisch
Beispiel einer fehlenden GPT-3-Übersetzung für Englisch => Spanisch
Spezifische GPT-3-Übersetzungsfehler im Deutschen
Die GPT-3-Übersetzung vom Englischen ins Deutsche weist eine große Anzahl wörtlicher Übersetzungen, einige Fehlübersetzungen, DNT und Terminologieprobleme auf.
Beispiel einer GPT-3-Fehlübersetzung für Englisch => Deutsch
Beispiel einer GPT-3-Übersetzung. Falsches DNT-Problem für Englisch => Deutsch
Beispiel für ein GPT-3-Übersetzungsgrammatikproblem für Englisch => Deutsch
Beispiel für ein GPT-3-Übersetzungsterminologieproblem für Englisch => Deutsch
Beispiel für ein GPT-3-Übersetzungsauslassungsproblem für Englisch => Deutsch
In-Domain-Übersetzung
Hier haben wir uns für Deutsch (als eine Sprache, in der wir eine größere Herausforderung sehen) entschieden und die Rechts- und Gesundheitsdomänen (jeweils 500 Segmente) mit der kürzesten allgemeinen Domänenaufforderung unten (da sie ungefähr die gleiche Leistung erbrachten) und einigen Variationen domänenspezifischer Aufforderungen übersetzt .
Fordert zur domänenspezifischen Übersetzung auf
PROMPT 1: (non-domain-specifc prompt)
English: """{SEGMENT}"""\n{TARGET_LANGUAGE}: """
PROMPT 2:
Translate this from English to {TARGET_LANGUAGE}, topic - {DOMAIN}:\n"""{SEGMENT}"""
PROMPT 3:
English {DOMAIN} text: """{SEGMENT}"""\nTranslation into {TARGET_LANGUAGE}: """
PROMPT 4:
English text: """{SEGMENT}"""\nTranslation into {TARGET_LANGUAGE} using {DOMAIN} terminology: """
PROMPT 5:
English text with {DOMAIN} terminology: """{SEGMENT}"""\nTranslation into {TARGET_LANGUAGE}: """
PROMPT 6:
English ({DOMAIN}): """{SEGMENT}"""\n{TARGET_LANGUAGE} ({DOMAIN}): """
In Bezug auf die Variabilität der Eingabeaufforderung weist Eingabeaufforderung 2 eine Korrelation von 0 mit dem Rest auf, da sie unnötige \n\n hinzufügt. Die übrigen Eingabeaufforderungen stimmen einigermaßen überein, wobei 30–40 % der Übersetzungen gleich sind.
GPR-3-Übersetzungsqualität für domänenspezifische Texte
GPT-3 schnitt bei allen von uns getesteten Eingabeaufforderungen im Vergleich zu Standard-MT-Motoren für allgemeine Zwecke recht schlecht ab. Die domänenlose Eingabeaufforderung 1 ist die letzte unter allen Eingabeaufforderungen oder in der unteren Hälfte. Eingabeaufforderung 5 liefert die am höchsten bewerteten Übersetzungen.
Leistungsdiagramm für rechtliche Inhalte:
Leistungsdiagramm für Inhalte im Gesundheitswesen:
GPT-3-Übersetzungsfehler für domänenspezifische Texte
Im juristischen Bereich gibt es einen Satz, dessen erste Hälfte keinen Sinn ergibt, und mehrere Fehlübersetzungen, wörtliche Übersetzungen, Auslassungen, grammatikalische Probleme und Wiederholungen.
Im Gesundheitswesen ist die Situation etwas besser, mit weniger mittelschweren Problemen. Es gibt immer noch wörtliche Übersetzungen, Fehlübersetzungen, einige terminologische und einige grammatikalische Probleme. Insgesamt können wir zu dem Schluss kommen, dass es Probleme gibt, die jedoch die Bedeutung der Segmente nicht wesentlich beeinträchtigen.
GPT-3-Übersetzungskosten
Wir haben die in der OpenAI-Konsole angezeigten Gesamtkosten durch die Menge an Inhalten dividiert, die wir für dieses Experiment über das GPT-3-Davinci-Modell übersetzt haben (ohne Eingabeaufforderungsvorlagen) und die durchschnittlichen Übersetzungskosten auf 12 US-Dollar pro 1 Million Zeichen geschätzt.
Schlussfolgerungen
GPT-3 bietet eine Möglichkeit, Text mithilfe einer API zwischen Sprachen zu übersetzen. Es stehen einige verschiedene Eingabeaufforderungen zur Verfügung, die Übersetzungsergebnisse sind jedoch normalerweise ziemlich ähnlich.
Wir haben herausgefunden, dass GPT-3-Übersetzungen zu den besten kommerziellen MT-Engines für Englisch nach Spanisch gehören, für Englisch nach Deutsch fallen sie jedoch in die zweite Kategorie.
Wenn es um domänenspezifische Texte wie Recht und Gesundheitswesen geht, sind GPT-3-Übersetzungen nicht auf dem neuesten Stand, selbst wenn domänenspezifische Eingabeaufforderungen verwendet werden. In diesen Fällen sind serienmäßige Allzweck-MT-Motoren wesentlich leistungsfähiger. Sehen Sie sich unseren jährlichen State of the MT-Bericht an, um herauszufinden, welche Engines Sie für Ihre Sprachpaare und Domänen verwenden sollten.
Derzeit arbeitet GPT-3, das bei OpenAI für die Übersetzung eingesetzt wird, deutlich langsamer als kommerzielle MT-Engines, was zu einer beträchtlichen Anzahl von API-Fehlern führt.
Gleichzeitig fanden wir in unseren anderen Experimenten die Leistung von GPT-3 beim Umschreiben und Stilisieren von Texten in derselben Sprache recht bemerkenswert. Darüber hinaus lieferte die Erstellung mehrsprachiger Inhalte im Allgemeinen gute Ergebnisse. Die Übersetzungsaufgabe stellt wahrscheinlich eine einzigartige Herausforderung dar, da sie sowohl Kreativität als auch strenge Anforderungen an die Ausgabe erfordert, was sie für GPT-3 schwieriger macht als andere Aufgaben.
Wir planen, weiterhin Experimente mit den verfeinerten Versionen von GPT-3 sowie dem kommenden GPT-4 durchzuführen. Pass auf!

![Was ist überhaupt eine verknüpfte Liste? [Teil 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































