Anthropic veröffentlichte eine Forschungsarbeit mit dem Titel Automated Researchers Can Reliably Mitigate Alignment Failures, in der ein Experiment vorgestellt wird, bei dem automatisierte KI-Systeme eingesetzt wurden, um die Leistung eines Modells bei Tests zu verbessern, die bestimmte Verhaltensweisen messen, die nicht mit den Zielen des Alignments übereinstimmen. Der Arbeit zufolge gelang es den Systemen, die Leistung bei allen zehn Tests zu steigern, ohne die allgemeine Leistung des Modells zu beeinträchtigen.
Die Forschung wird von Chen Yueh-Han geleitet, einer Mitarbeiterin des Anthropic-Programms. Das System ahmt dabei einen traditionellen Forschungszyklus nach: Es durchsucht die verfügbare Literatur, schlägt eine Methode zur Verbesserung des Modells vor und trainiert es anschließend 30 Minuten lang mit der vorgeschlagenen Methode. Nach jeder Runde werden wirksame Methoden in spätere Phasen übernommen, während ineffektive Methoden ausgeschlossen werden. Dadurch können die Experimente schnell und in großem Maßstab wiederholt werden.
Was hat sich praktisch verändert?
Der zentrale Wert des Experiments liegt nicht lediglich darin, ein Modell zum Training eines anderen Modells einzusetzen, sondern einen Teil des Forschungsprozesses selbst an ein automatisiertes System zu übertragen. Anstatt dass sich die Rolle der KI darauf beschränkt, von Forschern vorgegebene Anweisungen auszuführen, versucht das System, Forschungspfade zu bestimmen, sie zu testen und diejenigen beizubehalten, deren Erfolg nachgewiesen ist.
Die Arbeit zufolge liefern diese Ergebnisse frühe Hinweise darauf, dass automatisierte Alignment-Forschung nach dem Training in naher Zukunft praktikabel werden könnte. Gemeint ist damit die Entwicklung des Modellverhaltens nach der grundlegenden Trainingsphase, um Fälle der Nichtübereinstimmung mit den festgelegten Zielen zu verringern, und zwar mithilfe von reproduzierbaren Testmaßstäben und Trainingsmethoden.
Direkter Vergleich mit menschlicher Forschung
Die Arbeit geht über die Darstellung verbesserter Testergebnisse hinaus und vergleicht das, was sie Automated Alignment Researcher oder AAR nennt, mit einem menschlichen Forscher. Den darin aufgeführten Ergebnissen zufolge übertraf die beste von einem AAR-System vorgeschlagene Methode im Durchschnitt das, was erfahrene menschliche Forscher innerhalb von sechs Stunden vorschlugen. Außerdem wurde angegeben, dass von Menschen vorgegebene Forschungsrichtungen nicht zu einer stärkeren Leistung führten.
Der Vergleich umfasst auch eine wirtschaftliche Seite: Die Arbeit schätzt die Betriebskosten von AAR auf etwa 4 Dollar pro Stunde für die Inferenz über eine Programmierschnittstelle, gegenüber 150 Dollar pro Stunde, die die menschlichen Forscher im Experiment erhielten. Diese Zahlen beweisen nicht, dass automatisierte Systeme Forscher ersetzen können, verdeutlichen aber, warum Labore daran interessiert sind, den Umfang automatisierter Experimente auszuweiten, wenn sich die Aufgabe messen lässt.
Warum bedeutet das nicht, dass sich KI ohne Einschränkungen selbst weiterentwickelt?
Der dargestellte Schritt nähert sich der Idee der iterativen Selbstverbesserung an, bei der Modelle andere Systeme nutzen, um ihre Trainingsmethoden oder ihr Verhalten zu verbessern. Die Arbeit selbst setzt diesem Ergebnis jedoch klare Grenzen. Ein System kann nichts verbessern, was die Maßstäbe nicht angemessen messen. Wenn Alignment-Tests die tatsächlichen Alignment-Ziele nicht widerspiegeln, kann die Verbesserung der Ergebnisse zu einer Verbesserung der Leistung auf dem Indikator führen, nicht aber zur Lösung des Problems, das dieser eigentlich messen soll.
Dieser Ansatz erfordert außerdem kontinuierliche Anstrengungen zur Erstellung, Pflege und Erweiterung der Maßstäbe sowie zur Aktualisierung der Literatur, auf die sich der automatisierte Forscher stützt. Daher bleibt der menschliche Faktor bei der Festlegung dessen, was gemessen werden sollte, bei der Bewertung der Eignung der verwendeten Belege und Methoden sowie bei der Prüfung, ob sich die Ergebnisse über die Testgruppe hinaus verallgemeinern lassen, weiterhin präsent.
Die Einordnung von certi.news
Die wichtige Erkenntnis besteht hier darin, dass die Automatisierung der Alignment-Forschung von einer allgemeinen Idee zu einem konkreten Experiment mit diskutierbaren Zahlen und Vergleichen geworden ist: zehn Tests, 30-minütige Trainingsrunden und ein durchschnittlicher Vorsprung gegenüber menschlichen Vorschlägen innerhalb von sechs Stunden, wie die Arbeit berichtet. Die praktische Bedeutung bleibt jedoch an die Qualität der Maßstäbe gebunden, die das System steuern. Die gemessene Verbesserung ist kein eigenständiger Beleg dafür, dass das Modell in allen Kontexten sicherer geworden ist. Ebenso entscheidet der Vergleich zwischen den Kosten der Inferenz und den Kosten der Forscher nicht die Frage der Aufsicht oder der wissenschaftlichen Verantwortung.
Damit liefert die Arbeit einen starken Hinweis auf die Möglichkeit, den Forschungszyklus im Alignment zu beschleunigen, aber keinen Beweis dafür, dass Labore bald auf menschliche Forscher verzichten können. Die offene Frage, die sie hinterlässt, lautet, ob automatisierte Systeme in der Lage sein werden, mit realistischeren und komplexeren Alignment-Zielen umzugehen, anstatt bestimmte Indikatoren zu verbessern, die zuvor von Menschen entworfen wurden.