Cybersicherheit
Wie kann man einen „schlafenden Agenten“ in einem Sprachmodell verbergen und ihn beim Auftreten eines bestimmten Auslösers wecken?
Ein Artikel auf Hugging Face beschreibt ein Experiment, bei dem ein Team ein Qwen3.6-27B-Modell in einen Agenten umwandelte, der sich normal verhält und bei Erkennung eines bestimmten semantischen Auslösers anschließend eine bösartige Aufgabe ausführt. Das Experiment zeigt, dass Isolation und Verhaltenskontrollen das Risiko begrenzen, aber die Überprüfung des Codes und der Aufbau sicherer Ausführungsumgebungen dadurch nicht überflüssig werden.
2026-01-14