Testen von GPTZero: Ein trendiges ChatGPT-Erkennungstool

Jan 26 2023
Am 2. Januar veröffentlichte Edward Tian GPTZero – eine App, die erkennen soll, ob ChatGPT Inhalte geschrieben hat. Die App ging auf Twitter mit über 7 Millionen Aufrufen viral.

Am 2. Januar veröffentlichte Edward Tian GPTZero – eine App, die erkennen soll, ob ChatGPT Inhalte geschrieben hat. Die App ging auf Twitter mit über 7 Millionen Aufrufen viral. In diesem Artikel werde ich die Funktionsweise von GPTZero und die Genauigkeit des Tools analysieren.

Wie funktioniert es?

GPTZero verwendet zwei Maßnahmen, um festzustellen, ob ein Text von Menschen erstellt wurde:

  • Burstiness: Die Verteilung von Sätzen. Basierend auf der Idee, dass Menschen dazu neigen, lange und kurze Sätze zu vermischen, während KI-Sätze einheitlich sind.
  • Ratlosigkeit: Wie gut kann ein Modell wie GPT-2 das nächste Wort bzw. die nächsten Wörter vorhersagen?

Zum Zeitpunkt des Tests konnte ich die funktionierende Burstiness-Erkennung nicht reproduzieren. GPTZero bleibt auf diesem Bildschirm hängen:

Daher basieren alle Experimente in diesem Beitrag auf Ratlosigkeit.

Verwirrung

Beim Training neuronaler Netze wird Ratlosigkeit als Maß zur Minimierung eingesetzt.

Perplexität ist ein Maß dafür, wie gut ein Sprachmodell eine Textprobe vorhersagt. Beim Training besteht das Ziel darin, Verwirrung zu minimieren, damit der Text mit den Trainingsdaten übereinstimmt. GPTZero wertet die Verwirrung mithilfe des GPT2-Modells aus.

Eine geringere Ratlosigkeit bedeutet, dass der Text leicht vorhersehbar ist und daher eher wie eine Maschine klingt. Menschen sind unberechenbarer und neigen dazu, Texte mit größerer Ratlosigkeit zu schreiben.

So definiert GPTZero Ratlosigkeit:

GPTZero bietet außerdem eine Grafik für die Ratlosigkeit jedes Satzes. Die x-Achse repräsentiert die Satznummer und die y-Achse repräsentiert den entsprechenden Ratlosigkeitswert.

Ratlosigkeitswerte scheinen auch vom Kontext der Sätze abzuhängen. Hier sind einige Sätze aus Artikeln, die ich getestet habe und die zu hohen Ratlosigkeitswerten geführt haben:

  • Ich werde die Vorbestellungsdurchquerung verwenden ( 659 Ratlosigkeit )
  • Ich vermute, dass GPTZero den Ratlosigkeitsgrenzwert nach vorheriger Kritik gesenkt hat ( 3925 Ratlosigkeit ).
  • Der Ausgabedetektor hat alle 50 Papiere als echt befunden ( 1208 Ratlosigkeit )
  • Einige sind braun ( 2155 Ratlosigkeit )
  • Ein guter Einstieg besteht darin, so viel wie möglich zu üben und sich über die verschiedenen Datenstrukturen zu informieren ( 15 Ratlosigkeit ).
  • Das 19. Jahrhundert erlebte das Wachstum und die Entwicklung Kanadas, einschließlich der Hinzufügung neuer Provinzen und Territorien und der Bildung des Dominion of Canada im Jahr 1867 ( 11 Ratlosigkeit ) .
  • ChatGPT, auch bekannt als GPT-3.5 , ist ein Nachfolger von GPT-2 ( 14 Ratlosigkeit )

Ich habe GPTZero anhand von 40 Textbeispielen ausgeführt. Alle Beispiele waren mindestens 150 Wörter lang.

Ich konnte keine Fehlalarme finden – Beispiele, bei denen GPTZero von Menschen erstellten Text als Fälschung erkannte. Ich vermute, dass GPTZero nach vorheriger Kritik den Ratlosigkeitsgrenzwert gesenkt hat .

Ich habe jedoch nur Texte von einigen wenigen Autoren getestet, sodass es möglich ist, dass einige Leute auf eine Art und Weise schreiben, die zu niedrigen Ratlosigkeitswerten führt.

Von den 20 ChatGPT-Beispielen, die ich ausgeführt habe, wurden 6 Beispiele entweder als „weitere Informationen sind erforderlich“ oder als von Menschen erstellt eingestuft.

Hier ist ein Beispiel für ein solches Ergebnis, das zuvor mit dem GPT-2-Ausgabedetektor funktionierte .

GPTZero ist sich sicher, dass dieser Text von Menschen erstellt wurde:

Dies ist ein Beispiel, bei dem der Ratlosigkeitsgrenzwert zu niedrig zu sein scheint, um KI-Inhalte zu erkennen. Das Problem hierbei ist, dass GPTZero Wörter, mit denen es nicht vertraut ist, als hohe Ratlosigkeit einstuft.

Insgesamt scheint GPTZero jedoch eine ordentliche Genauigkeit zu haben. Möglicherweise entscheiden sich einige Plattformen für die Integration des Tools zur KI-Erkennung. Lassen Sie uns besprechen, wie viel Arbeit es erfordern würde, GPTZero zu umgehen.

GPTZero austricksen

Angenommen, eine Plattform wie Reddit integriert GPTZero als KI-Detektor.

Nehmen wir nun an, ich möchte einen KI-Werbebot erstellen, um diese Erkennung zu umgehen. Der Bot muss einen Thread lesen und Antworten senden, die zum aktuell diskutierten Thema passen, mit einem Link zu meinen Blogbeiträgen.

Hier ist der OpenAI-Spielplatz für diese Aufgabe. Ich habe das Modell text-davinci-003 verwendet, dessen Leistung der von ChatGPT ähnelt.

Konzentrieren wir uns auf den grünen Teil, die KI-generierte Botschaft. Einfügen dieser Nachricht in GPTZero:

GPTZero erkennt den Text als KI-generiert.

Wie schwierig wäre es nun für einen Entwickler, den Bot so zu modifizieren, dass er GPTZero austrickst? Wie können wir GPTZero glauben machen, dass dieser Inhalt von Menschen erstellt wurde?

Schauen wir uns einige Methoden an.

Methode Nr. 1: Text-Ofuscator

Wir lassen den Text mit einem Text Obfuscator laufen . Der Text Obfuscator ist ein Programm, das den Text wiederholt in verschiedene Sprachen und dann zurück ins Englische übersetzt.

Ich habe den Text in den Obfuscator eingefügt und ihn 50 Mal wiederholt. Der Detektor erzeugte folgenden Text:

Den Text habe ich dann in GPTZero eingefügt. GPTZero erkennt diesen Text nun als von Menschen erstellt.

Methode #2: Hohe Ratlosigkeit hinzufügen

Da GPTZero derzeit nur auf Perplexität angewiesen ist, besteht eine andere Möglichkeit, diesen Detektor zu umgehen, darin, Sätze mit hoher Perplexität hinzuzufügen.

Vielleicht könnte ich den Bot dazu bringen, am Ende der Nachricht einen zufälligen Satz mit hoher Ratlosigkeit hinzuzufügen. Mal sehen, welchen Unterschied das macht. Wir fügen mit 1208 Ratlosigkeit den folgenden Satz hinzu:

Der Ausgabedetektor stellte fest, dass alle 50 Papiere echt waren.

Und das ist es. Nur dieser eine Text mit hoher Verwirrung am Ende ermöglicht es dem Werbebot, GPTZero zu umgehen. Jetzt müssen Sie nur noch eine vernünftige Aussage dieser Art finden und den Bot veranlassen, sie in jede Nachricht einzufügen.

Methode Nr. 3: Autorenstil

Ich habe das KI-Modell gebeten, die Nachricht stattdessen im Stil von Douglas Adams zu schreiben. Hier ist das Ergebnis:

Einfügen dieses Textes in GPTZero:

Wenn man also einfach die KI auffordert, im Stil von Douglas Adams zu schreiben, scheint ChatGPT ebenfalls auszutricksen.

GPTZero vs. GPT-2-Ausgabedetektor

In meinem vorherigen Artikel habe ich überprüft, wie effektiv der GPT-2-Ausgabedetektor bei ChatGPT ist. Hier sind meine Gedanken zum Unterschied zwischen diesen beiden Tools:

  • Der GPT-2-Ausgangsdetektor erzeugt insgesamt eine bessere Genauigkeit. Es kann ChatGPT-Text sicher als Fälschung erkennen. Allerdings stellte sich heraus, dass alle von Menschen geschriebenen Texte, die ich auf GPTZero getestet habe, von Menschen erstellt wurden. Dies ist ein wichtiger Faktor zur Vermeidung von Fehlalarmen und ein Vorteil von GPTZero.
  • Es ist viel einfacher, GPTZero dazu zu bringen, zu glauben, dass ein Text echt ist. Die drei Methoden, die ich in diesem Artikel verwendet habe, funktionierten beim GPT-2-Ausgabedetektor nicht.
  • Bei GPTZero gibt es keine Begrenzung für die Textmenge, die Sie einfügen können. Der GPT-2-Ausgabedetektor ist auf 250 Token begrenzt.
  • GPTZero bietet eine detaillierte Aufschlüsselung der Perplexitätswerte pro Satz. Der GPT-2-Ausgabedetektor liefert nur eine prozentuale Gesamtwahrscheinlichkeit.
  • Beim Ausführen von Beispielen gegen GPTZero kam es zu vielen Verlangsamungen und Verbindungs-Timeouts. Dies ist sinnvoll, da es sich bei dem Tool noch um ein Demomodell handelt. Aufgrund dieser Verfügbarkeitsprobleme ist die Verwendung des Tools derzeit jedoch unpraktisch. Die GPT-2-Ausgabedetektor-Website weist eine geringere Latenz auf und ist besser verfügbar.

GPTZero ist ein neues KI-Tool zur Erkennung von Plagiaten. Die aktuelle Version nutzt Ratlosigkeit, um zu beurteilen, ob ein Text von Menschen erstellt wurde. Während GPTZero bei von Menschen erstellten Inhalten gut abschneidet, hat das Modell derzeit Probleme mit der Erkennung von KI-generierten Inhalten. Strategien wie das Hinzufügen eines Satzes mit hoher Ratlosigkeit, die Verwendung eines Tools zur Textverschleierung oder einfach die Anfrage an die KI nach einem bestimmten Autorenstil scheinen den Detektor zu umgehen.

Während der GPT-2 Output Detector derzeit GPTZero übertrifft, gab GPTZero kürzlich bekannt, dass sie an Version 2 arbeiten. Sie sind derzeit ein größeres Team und entwickeln Technologien für Pädagogen. Ich freue mich darauf, die neue Version auszuprobieren.