Künstliche Intelligenz

Anthropic registriert in Kampagnen zur Extraktion von Fähigkeiten von KI-Modellen fast 200 Millionen Interaktionen

Anthropic erklärte, dass fünf mit chinesischen KI-Unternehmen verbundene Kampagnen versucht hätten, fortgeschrittene Fähigkeiten aus dem Claude-Modell über nahezu 200 Millionen Interaktionen zu extrahieren. Eine Kampagne wurde Alibaba und eine weitere Moonshot AI zugeschrieben. Nach Ansicht des Unternehmens könnten diese Methoden zur Erstellung von Trainingsdaten für konkurrierende Modelle genutzt werden, obwohl der Bericht die Vorwürfe des Unternehmens wiedergibt und der Artikel keine unabhängigen Belege dafür liefert.

2026-09-10
3 Min. Lesezeit
7 Aufrufe
فريق تحرير certi.news
Anthropic registriert in Kampagnen zur Extraktion von Fähigkeiten von KI-Modellen fast 200 Millionen Interaktionen

Anthropic erklärte in einem neuen Bericht, dass chinesische KI-Labore in den vergangenen Monaten zunehmend komplexe Kampagnen durchgeführt hätten, um Fähigkeiten aus fortgeschrittenen US-amerikanischen Modellen zu extrahieren. Dabei habe das Unternehmen nahezu 200 Millionen Interaktionen im Zusammenhang mit fünf getrennten Kampagnen festgestellt. Die Versuche zielten dem Unternehmen zufolge auf Claudes Fähigkeiten zum Betrieb von Agenten und zur Nutzung von Tools, auf Programmierung und Datenanalyse sowie auf logisches Schlussfolgern.

Anthropic bezeichnet diese Vorgänge als „Distillation-Angriffe“ (Distillation). Dabei werden Ausgaben eines großen Modells gesammelt und anschließend zum Training eines kleineren Modells für Schlussfolgerungsaufgaben verwendet. Das Unternehmen erklärt, die Angreifer hätten versucht, seine Schutzmaßnahmen zu umgehen, um das zu extrahieren, was es als Spuren des internen Denkens des Modells bezeichnet. Claude zeigt diese Spuren den Nutzern normalerweise nicht, sondern liefert „zusammengefasste Denkblöcke“, die einen allgemeinen Einblick in den Weg zur Antwort geben.

Eine Methode zur Umgehung des Schutzes der Denkspuren

Dem Bericht zufolge gelang es einigen Kampagnen, das Modell durch eine indirekte Formulierung der Anfragen dazu zu bringen, Denkspuren offenzulegen. Anthropic führt als Beispiel eine Anfrage an, die als Übersetzungsaufgabe präsentiert wurde und in der Claude aufgefordert wurde, den „vorherigen Arbeitsspeicher“ ausschließlich ins in Katakana geschriebenen Japanische zu übersetzen. Das Unternehmen erklärt, solche Methoden hätten den Zugriff auf Details ermöglicht, die in einer gewöhnlichen Antwort eigentlich nicht erscheinen sollten.

Die größte Kampagne wurde Alibaba zugeschrieben

Anthropic erklärte, die Alibaba zugeschriebene Kampagne sei der bislang größte von dem Unternehmen beobachtete Distillation-Vorgang in großem Umfang gewesen. Zwischen Mai und Juli 2026 registrierte das Unternehmen 151 Millionen Interaktionen; die Aktivität erreichte mit etwa drei Millionen Interaktionen pro Tag ihren Höhepunkt. Die Anfragen verteilten sich auf 3500 Konten. Die Verwendung einer einheitlichen Anfrage zur Extraktion von Denkspuren veranlasste Anthropic jedoch, sie als eine einzige Anstrengung zu bewerten, die nach seiner Einschätzung Trainingsmaterial für die zur Alibaba gehörende Modellfamilie Qwen erzeugen sollte.

Anfragen im Zusammenhang mit Moonshot AI

Zu einer weiteren Kampagne, die Moonshot AI, dem Entwickler des Modells Kimi, zugeschrieben wurde, erklärte Anthropic, sie habe den Eindruck erweckt, die Anfragen direkt vom chinesischen Militär zu steuern. Der Bericht erwähnt eine Anfrage zur Analyse einer Gruppe geschlossener Überwachungskameraaufnahmen, um festzustellen, ob sich eine Person „ungewöhnlich verhält“. Über einen Zeitraum von zehn Tagen registrierte Anthropic fast 300.000 Anfragen, die über ein Netzwerk von 5000 Konten an Claude weitergeleitet wurden und sich größtenteils gegen das Modell Opus richteten.

Warum ist diese Nachricht wichtig?

Sollten Anthropics Einschätzungen zutreffen, geht es in dem Fall über den Missbrauch einzelner Konten hinaus und um den organisierten Versuch, Ausgaben fortgeschrittener Modelle in großem Umfang zu sammeln, was die Kosten für die Entwicklung konkurrierender Modelle senken könnte. Die Zahlen zeigen außerdem, dass der Schutz von Fähigkeiten nicht nur die Verhinderung des direkten Zugriffs auf Modellgewichte betrifft, sondern auch die Kontrolle von Nutzungsmustern sowie die Erkennung ähnlicher Konten und Anfragen. Dennoch bleiben die Ergebnisse Vorwürfe von Anthropic: Der Artikel enthält keine unabhängige Überprüfung der Zuschreibung der Kampagnen an Alibaba oder Moonshot AI und liefert zu den drei übrigen Kampagnen außer der ihnen zugeschriebenen Gesamtzahl der Interaktionen keine Einzelheiten.

Nachrichtenquelle
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen