Das AX-Ray-Projekt präsentiert einen öffentlich dokumentierten Diagnosefall, der nach eigenen Angaben zunächst Mängel beim Kausal-Leakage in den beiden öffentlichen KI-Modellen Zyphra/Zamba2-1.2B und nvidia/Nemotron-H-8B-Base-8K aufdeckte und anschließend reproduzierbar nachwies. Beide Modelle erscheinen im AX-Ray-Board als Fälle von Causal-LEAK, während das Framework bestätigtes Kausal-Leakage unabhängig von der Modellleistung bei allgemeinen Fähigkeitstests als bereitstellungsverhindernden Mangel behandelt.
Der auf dem Hugging-Face-Blog veröffentlichte Beitrag geht von einer grundlegenden These aus: Die korrekte Beantwortung standardisierter Testfragen reicht nicht aus, um die Einsatzbereitschaft eines Modells für die praktische Nutzung zu beurteilen. Die von VIDRAFT dargestellte Bereitstellungssicherheit umfasst die Korrektheit kausaler Beziehungen, die Konsistenz des Servicepfads, die Robustheit gegenüber adversarialen Bedingungen oder langen Kontexten, die Datensicherheit, die Sicherheit der Infrastruktur, die regulatorische Bereitschaft und die Risiken agentischer Systeme.
Was ist mit Kausal-Leakage gemeint?
Bei einem autoregressiven Sprachmodell wird vorausgesetzt, dass Repräsentationen oder das Verhalten von Wahrscheinlichkeitswerten an einer früheren Position in der Sequenz nicht von zukünftigen Tokens beeinflusst werden, die an dieser Position nicht verfügbar sind. Kausal-Leakage tritt auf, wenn spätere oder kontextuell nachfolgende Informationen die Maskierungszustände, Wahrscheinlichkeitswerte oder bewertungsbezogenes Verhalten im früheren Teil der Sequenz verändern.
AX-Ray unterscheidet dieses Problem von Halluzinationen, dem Versagen von Verweigerungen, Prompt-Injection und Testkontamination. Dies sind wichtige Probleme, beschreiben jedoch nicht denselben Fehler; Kausal-Leakage betrifft die Korrektheit des Rechenpfads des Modells. Laut dem Beitrag kann sich dieser Fehler auf die Stabilität des Präfixes, die Korrektheit verborgener Zustände, die Konsistenz von Wahrscheinlichkeitswerten, die Verarbeitung von Sequenzen in Batches oder auf hybride Weise, die Zuverlässigkeit von Caching und Serving, das Vertrauen in lange Kontexte, die Korrektheit der Bewertung und die Sicherheit agentischer Ausführung auswirken.
Warum wird es durch Fähigkeitstests möglicherweise nicht entdeckt?
Die meisten öffentlichen Bestenlisten konzentrieren sich darauf, wie häufig ein Modell eine richtige Antwort liefert. Das ist ein notwendiges Signal, deckt jedoch nicht alle Eigenschaften des internen Verhaltens ab. Kausal-Leakage kann bei Frage-Antwort-, Mathematik-, Programmier- und Instruktionsbefolgungstests unsichtbar bleiben, weil diese Tests üblicherweise nur die endgültige Antwort beobachten.
AX-Ray untersucht dagegen tiefere Eigenschaften, darunter die Konstanz des Präfixes, die Konsistenz der Servicepfade und die Frage, ob kritische Fehler das Gesamtergebnis der Fähigkeiten überwiegen sollten. Der Beitrag fasst das Prinzip eindeutig zusammen: Höhere Fähigkeiten bedeuten nicht automatisch Bereitstellungsreife.
Ein Diagnose-Framework mit mehreren Achsen
AX-Ray organisiert seine Arbeit entlang von drei Diagnoseachsen und 11 operativen Kategorien mit einem öffentlichen Katalog, der 117 Diagnoseeinträge umfasst. Diese Einträge behandeln technische, evidenzbezogene Fragen, den Schweregrad des Problems, die Erkennungsrichtung, die Behebungsrichtung und den Governance-Kontext.
- MODEL-SCAN: Untersucht die Korrektheit, Zuverlässigkeit, Robustheit, Sicherheit, Datensicherheit, Effizienz und interne Architektur des Modells sowie die Ausrichtung der Behebung.
- AX-SCAN: Konzentriert sich auf Service, Infrastruktur, Sicherheit, Compliance und Betriebsrisiken.
- AGENT-SCAN: Behandelt Risiken agentischer Bereitstellungen, etwa Tool-Berechtigungen, Hijacking, Schleifen, Speicherkontamination, Löschverhalten und die Governance von Autonomie.
Zu den weiteren Kategorien gehören kausale Sicherheit und Serviceintegrität, Zuverlässigkeit, Robustheit und lange Kontexte, Sicherheit, Schutz und Alignment, Datenintegrität und Bewertungsmethodik, Effizienz, Quantisierung und Architektur, inspizierbare interne Architektur sowie Behebung. Die operative Achse umfasst außerdem Kategorien für Serviceabweichungen zwischen Engines, Infrastruktursicherheit und regulatorische Compliance.
Unterscheidung zwischen einem Modellfehler und einem Serviceproblem
AX-Ray verzeichnet außerdem ein Ergebnis, das über die Modell-API des Modells upstage/Solar-Open2-250B bei Ausführung mit FP8 vLLM geprüft wurde. Die Ausführung zeigte eine reproduzierbare Anomalie bei der Aufzeichnung von Token-Wahrscheinlichkeiten innerhalb des Service- oder API-Pfads, doch das Framework stellt sie nicht als bestätigtes Kausal-Leakage auf Modellebene dar.
Dem Beitrag zufolge sind die intern inspizierbaren Tests D1 und D7 weiterhin ausstehend. Daher wurde die Zeile mit official_dhs=false gekennzeichnet, verbunden mit dem Hinweis, dass sie einem API-Audit unterzogen wurde, die interne Prüfung jedoch noch nicht abgeschlossen ist. Diese Trennung ist ein zentraler Bestandteil der Methodik: Eine Serviceanomalie, ein Problem bei der Bewertungsaufzeichnung über die API und ein Leakage verborgener Zustände auf Modellebene sind nicht dieselbe Behauptung.
Transparenz und Grenzen der Offenlegung
AX-Ray zufolge legt das Projekt Zeilen der Bestenliste, Diagnosezusammenfassungen auf Modellebene, übergeordnete Kategoriewerte, die Klassifizierung der Elemente, die Struktur der Zuordnung zu Rechtsordnungen und einige öffentliche Berichte offen, außerdem die ausdrücklich identifizierten Fälle von Kausal-Leakage. Es veröffentlicht jedoch keine privaten Testrezepte, Details zu operativen Schwellenwerten, rohen sensiblen Prompts, rohen schädlichen Ausgaben, durch Patentrechte geschützten Implementierungsdetails, internen Bewertungsbefehlen oder Verfahren, die sich in Exploit-Methoden umwandeln lassen.
Das Projekt stellt dieses Gleichgewicht als einen Versuch dar, Sicherheitsdiagnosen nachvollziehbar zu machen, ohne sie in eine Anleitung zum Umgehen von Modellen oder zur Reproduktion schädlichen Verhaltens zu verwandeln. Außerdem verknüpft es den Katalog mit Governance-Kontexten in Korea, der Europäischen Union, den Vereinigten Staaten, Japan, China, den Vereinigten Arabischen Emiraten und Saudi-Arabien und betont zugleich, dass AX-Ray eine diagnostische Orientierungshilfe und kein offizieller Rechtsstandard ist.
Die Bedeutung des veröffentlichten Falls liegt darin, dass er eine zusätzliche Ebene über Fähigkeitstests hinaus aufzeigt: Die Bewertung fragt nicht nur, ob das Modell gute Antworten gibt, sondern auch, ob sein Modell, sein Servicepfad und seine agentische Umgebung bei Bereitstellung, Betrieb und Governance vertrauenswürdig sind. Das Projekt stellt seine öffentlichen Daten und seinen Diagnosebereich über FINAL-Bench/AX-RAY bereit, während die Einzelheiten der privaten Tests unveröffentlicht bleiben.