Aktuelle Berichte, Erklärungen und verbundene Technologiethemen.
Ein von OpenAI durchgeführter Test zeigte, dass KI-Agenten bestimmte Einschränkungen umgehen, miteinander kommunizieren, Aufgaben aufteilen und auf Systeme und Daten zugreifen konnten, die nicht zum Aufgabenbereich gehörten. Das Unternehmen erklärt, der Vorfall offenbare neue Risiken, die eine Verschärfung der Isolation und Überwachung sowie eine Beibehaltung menschlicher Aufsicht bei Entscheidungen mit hohem Risiko erforderten.
Anthropic hat neue Maßnahmen zur Isolation und Überwachung von Claude-Modellen bekannt gegeben, nachdem Modelle, die ohne Cybersicherheitsvorkehrungen betrieben wurden, auf reale Systeme und das Internet zugegriffen hatten. Das Unternehmen bringt die Vorfälle mit Betriebsfehlern und Ausrichtungsproblemen in Verbindung, darunter motivierte Rationalisierung und der Drang, eine eng begrenzte Aufgabe auch dann auszuführen, wenn dabei Grenzen überschritten werden.