Künstliche Intelligenz

OpenAI ermöglicht die optionale Kennzeichnung generierter Texte über die API und warnt vor der Schwierigkeit ihrer Erkennung bei Code

OpenAI hat das textGrain-System gestartet, um über die API generierten Texten ein statistisches Signal hinzuzufügen. Die Funktion bleibt standardmäßig deaktiviert, und Kunden können sie auf Projekt- oder Organisationsebene aktivieren. Das Unternehmen erklärt, dass die Erkennungsleistung bei kurzen oder bearbeiteten Texten abnimmt und dass Code eine schwierigere Anwendung darstellt. In den kommenden Wochen soll die Kennzeichnung geeigneter Texte in ChatGPT und Codex innerhalb der Europäischen Union automatisch beginnen.

2026-10-05
3 Min. Lesezeit
2 Aufrufe
certi.news Editorial Team
OpenAI ermöglicht die optionale Kennzeichnung generierter Texte über die API und warnt vor der Schwierigkeit ihrer Erkennung bei Code

OpenAI hat angekündigt, das System textGrain zur Kennzeichnung von Texten bereitzustellen, die von seinen Modellen über die API erzeugt werden. Die Funktion bleibt jedoch standardmäßig deaktiviert. Kunden weltweit können sie ab heute für unterstützte Modelle aktivieren, entweder auf Projekt- oder Organisationsebene, ohne einzelne API-Anfragen ändern zu müssen.

Das System fügt dem Text ein «statistisches Signal» hinzu, indem es geeignete Wörter gegenüber anderen Alternativen bevorzugt, wenn beide Optionen im Kontext sinnvoll sind. Durch die Anhäufung dieser Auswahlentscheidungen in einem ausreichend langen Text soll der OpenAI-Detektor in der Lage sein, das Muster zu erkennen.

Eine andere Entscheidung als Anthropic

OpenAI gibt API-Kunden mehr Kontrolle als der Ansatz, den Anthropic im August für die Claude-Modelle angekündigt hat. Anthropic erklärte, dass die Kennzeichnung weltweit auf unterstützte Modelle und auf Modellebene angewendet werde, einschließlich der Produkte Claude und Claude Code sowie der API-Nutzung, ohne eine vergleichbare Möglichkeit für Entwickler zu nennen, sie zu deaktivieren.

OpenAI zufolge wird die Kennzeichnung in den kommenden Wochen automatisch auf geeignete Texte angewendet, die ChatGPT und Codex innerhalb der Europäischen Union erzeugen, als Reaktion auf die Transparenzanforderungen des europäischen KI-Gesetzes. Das Unternehmen hat noch nicht genau festgelegt, was bei Codex mit «geeigneten Ausgaben» gemeint ist.

Die Erkennungsleistung ist nicht konstant

OpenAI erklärt, dass sein Detektor etwa 80 % der gekennzeichneten Passagen mit einer Länge von 200 Token erfasst. Bei Passagen mit 400 Token steigt der Anteil in Bereichen wie der Psychologie auf 95 %, bei einer angestrebten Falsch-Positiv-Rate von 1 %. Die Erkennungsfähigkeit nimmt bei eingeschränkten Materialien wie Mathematik ab, da dem Modell weniger Möglichkeiten zur Auswahl von Wörtern zur Verfügung stehen.

Auch die Bearbeitung des Textes schwächt das Signal deutlich. In den Tests des Unternehmens senkte der Austausch von 10 % der Wörter einer 400-Token-Passage durch Synonyme die Erkennungsrate von etwa 92 % auf 66 %, während der Austausch von 25 % sie auf 17 % reduzierte. OpenAI warnt außerdem, dass kurze Passagen möglicherweise nicht genügend Material für eine zuverlässige Erkennung enthalten.

Code ist ein schwierigerer Testfall

OpenAI räumt ein, dass Code schwieriger zu kennzeichnen ist als gewöhnliche Prosa, weil syntaktische und logische Einschränkungen die Zahl sinnvoller Optionen für das nächste Wort oder Token verringern. Das Unternehmen erklärt, es habe das Astra-Modell mit aktiviertem und deaktiviertem textGrain anhand der Tests DeepSWE, AutomationBench und Terminal-Bench verglichen und keinen bedeutsamen Leistungsunterschied festgestellt. Diese Ergebnisse belegen jedoch nicht, wie zuverlässig gekennzeichneter Code nach seiner Bearbeitung oder Neuformatierung identifiziert werden kann.

Bislang erhalten API-Kunden, die textGrain aktivieren, nicht automatisch ein Erkennungstool. OpenAI beschränkt den anfänglichen Zugang zum Detektor auf zugelassene Forschungs- und akademische Einrichtungen, die die Herkunft von Texten und die Zuverlässigkeit der Erkennung untersuchen. The New Stack hat das Unternehmen um zusätzliche Einzelheiten zu den geeigneten Codex-Ausgaben und den Erkennungsraten für Code gebeten.

Warum ist diese Nachricht wichtig?

Die praktische Änderung für Entwickler besteht darin, dass die Textkennzeichnung zu einer steuerbaren Option geworden ist, anstatt ein für alle API-Ausgaben vorgeschriebenes Verhalten zu sein. Die veröffentlichten Zahlen zeigen jedoch, dass die Kennzeichnung allein kein schlüssiger Beweis ist: Kürzungen und Bearbeitungen verringern die Erkennbarkeit, und Code bietet möglicherweise nicht genügend Spielraum, um das Signal einzufügen. Daher bleiben der Anwendungsbereich des Detektors, der Zugang zu ihm und die Leistung des Systems bei tatsächlichem Code offene Fragen.

Nachrichtenquelle
The New Stack - Software Development
Originalquelle öffnen ↗
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen