OpenAI hat angekündigt, das System textGrain zur Kennzeichnung von Texten bereitzustellen, die von seinen Modellen über die API erzeugt werden. Die Funktion bleibt jedoch standardmäßig deaktiviert. Kunden weltweit können sie ab heute für unterstützte Modelle aktivieren, entweder auf Projekt- oder Organisationsebene, ohne einzelne API-Anfragen ändern zu müssen.
Das System fügt dem Text ein «statistisches Signal» hinzu, indem es geeignete Wörter gegenüber anderen Alternativen bevorzugt, wenn beide Optionen im Kontext sinnvoll sind. Durch die Anhäufung dieser Auswahlentscheidungen in einem ausreichend langen Text soll der OpenAI-Detektor in der Lage sein, das Muster zu erkennen.
Eine andere Entscheidung als Anthropic
OpenAI gibt API-Kunden mehr Kontrolle als der Ansatz, den Anthropic im August für die Claude-Modelle angekündigt hat. Anthropic erklärte, dass die Kennzeichnung weltweit auf unterstützte Modelle und auf Modellebene angewendet werde, einschließlich der Produkte Claude und Claude Code sowie der API-Nutzung, ohne eine vergleichbare Möglichkeit für Entwickler zu nennen, sie zu deaktivieren.
OpenAI zufolge wird die Kennzeichnung in den kommenden Wochen automatisch auf geeignete Texte angewendet, die ChatGPT und Codex innerhalb der Europäischen Union erzeugen, als Reaktion auf die Transparenzanforderungen des europäischen KI-Gesetzes. Das Unternehmen hat noch nicht genau festgelegt, was bei Codex mit «geeigneten Ausgaben» gemeint ist.
Die Erkennungsleistung ist nicht konstant
OpenAI erklärt, dass sein Detektor etwa 80 % der gekennzeichneten Passagen mit einer Länge von 200 Token erfasst. Bei Passagen mit 400 Token steigt der Anteil in Bereichen wie der Psychologie auf 95 %, bei einer angestrebten Falsch-Positiv-Rate von 1 %. Die Erkennungsfähigkeit nimmt bei eingeschränkten Materialien wie Mathematik ab, da dem Modell weniger Möglichkeiten zur Auswahl von Wörtern zur Verfügung stehen.
Auch die Bearbeitung des Textes schwächt das Signal deutlich. In den Tests des Unternehmens senkte der Austausch von 10 % der Wörter einer 400-Token-Passage durch Synonyme die Erkennungsrate von etwa 92 % auf 66 %, während der Austausch von 25 % sie auf 17 % reduzierte. OpenAI warnt außerdem, dass kurze Passagen möglicherweise nicht genügend Material für eine zuverlässige Erkennung enthalten.
Code ist ein schwierigerer Testfall
OpenAI räumt ein, dass Code schwieriger zu kennzeichnen ist als gewöhnliche Prosa, weil syntaktische und logische Einschränkungen die Zahl sinnvoller Optionen für das nächste Wort oder Token verringern. Das Unternehmen erklärt, es habe das Astra-Modell mit aktiviertem und deaktiviertem textGrain anhand der Tests DeepSWE, AutomationBench und Terminal-Bench verglichen und keinen bedeutsamen Leistungsunterschied festgestellt. Diese Ergebnisse belegen jedoch nicht, wie zuverlässig gekennzeichneter Code nach seiner Bearbeitung oder Neuformatierung identifiziert werden kann.
Bislang erhalten API-Kunden, die textGrain aktivieren, nicht automatisch ein Erkennungstool. OpenAI beschränkt den anfänglichen Zugang zum Detektor auf zugelassene Forschungs- und akademische Einrichtungen, die die Herkunft von Texten und die Zuverlässigkeit der Erkennung untersuchen. The New Stack hat das Unternehmen um zusätzliche Einzelheiten zu den geeigneten Codex-Ausgaben und den Erkennungsraten für Code gebeten.
Warum ist diese Nachricht wichtig?
Die praktische Änderung für Entwickler besteht darin, dass die Textkennzeichnung zu einer steuerbaren Option geworden ist, anstatt ein für alle API-Ausgaben vorgeschriebenes Verhalten zu sein. Die veröffentlichten Zahlen zeigen jedoch, dass die Kennzeichnung allein kein schlüssiger Beweis ist: Kürzungen und Bearbeitungen verringern die Erkennbarkeit, und Code bietet möglicherweise nicht genügend Spielraum, um das Signal einzufügen. Daher bleiben der Anwendungsbereich des Detektors, der Zugang zu ihm und die Leistung des Systems bei tatsächlichem Code offene Fragen.