El proyecto AX-Ray presenta un caso diagnóstico público que, según afirmó, reveló y posteriormente reprodujo de forma demostrable defectos de filtración causal en dos modelos públicos de inteligencia artificial: Zyphra/Zamba2-1.2B y nvidia/Nemotron-H-8B-Base-8K. Ambos modelos aparecen en el panel de AX-Ray como casos de Causal-LEAK, mientras que el marco considera la filtración causal confirmada un defecto que impide el despliegue, independientemente de la puntuación del modelo en pruebas de capacidades generales.
El material publicado en el blog de Hugging Face parte de una tesis fundamental: responder correctamente a las preguntas de las pruebas estandarizadas no basta para juzgar la preparación de un modelo para el uso práctico. Según la presentación de VIDRAFT, la seguridad del despliegue incluye la corrección de las relaciones causales, la coherencia del canal de servicio, la resistencia frente a condiciones adversarias o contextos largos, la integridad de los datos, la seguridad de la infraestructura, la preparación regulatoria y los riesgos de los sistemas agénticos.
¿Qué significa filtración causal?
En un modelo lingüístico autorregresivo, se supone que las representaciones o el comportamiento de los valores de probabilidad en una posición anterior de la secuencia deben permanecer sin verse afectados por los tokens futuros que no están disponibles en esa posición. La filtración causal ocurre cuando información posterior o posterior al contexto cambia los estados ocultos, los valores de probabilidad o un comportamiento relacionado con la evaluación en la parte anterior de la secuencia.
AX-Ray distingue este problema de las alucinaciones, los fallos de rechazo, la inyección de instrucciones y la contaminación de las pruebas. Se trata de problemas importantes, pero no describen el mismo defecto, ya que la filtración causal se refiere a la corrección del recorrido computacional del modelo. Según el material, este defecto puede afectar a la estabilidad del prefijo, la corrección de los estados ocultos, la coherencia de los valores de probabilidad, el procesamiento de secuencias por lotes o de forma híbrida, la fiabilidad del almacenamiento en caché y del servicio, la confianza en contextos largos, la validez de la evaluación y la seguridad de la ejecución agéntica.
¿Por qué podrían no detectarla las pruebas de capacidades?
La mayoría de los marcadores públicos se centran en la frecuencia con la que el modelo proporciona una respuesta correcta. Es una señal necesaria, pero no cubre todas las propiedades del comportamiento interno. La filtración causal puede permanecer invisible en pruebas de preguntas y respuestas, matemáticas, programación y seguimiento de instrucciones, porque estas pruebas suelen observar únicamente la respuesta final.
En cambio, AX-Ray examina propiedades más profundas, entre ellas la permanencia del prefijo, la coherencia de los recorridos de servicio y si los fallos críticos deberían prevalecer sobre el resultado general de las capacidades. El material resume claramente el principio: una capacidad elevada no implica automáticamente preparación para el despliegue.
Marco diagnóstico de múltiples ejes
AX-Ray organiza su trabajo en torno a tres ejes diagnósticos y 11 categorías operativas, con un catálogo público que contiene 117 registros diagnósticos. Estos registros abarcan preguntas técnicas vinculadas a la evidencia, la gravedad del problema, la dirección de detección, la dirección de mitigación y el contexto de gobernanza.
- MODEL-SCAN: examina la corrección, la fiabilidad, la resistencia, la seguridad, la integridad de los datos, la eficiencia, la estructura interna y las tendencias de procesamiento del modelo.
- AX-SCAN: se centra en el servicio, la infraestructura, la seguridad, el cumplimiento y los riesgos operativos.
- AGENT-SCAN: aborda los riesgos del despliegue agéntico, como los permisos de las herramientas, el secuestro, los bucles, la contaminación de la memoria, el comportamiento de eliminación y la gobernanza de la autonomía.
Las demás categorías incluyen la seguridad causal y la integridad del servicio, la fiabilidad, la resistencia y los contextos largos, la seguridad, la protección y la alineación, la integridad de los datos y la metodología de evaluación, la eficiencia, la cuantización y la arquitectura, la arquitectura interna inspeccionable y el procesamiento. El eje operativo también incluye categorías específicas para la divergencia del servicio entre motores, la seguridad de la infraestructura y el cumplimiento normativo.
Diferenciar un defecto del modelo de un problema del servicio
AX-Ray también registra un resultado auditado mediante la interfaz de programación de aplicaciones del modelo upstage/Solar-Open2-250B al ejecutarlo mediante FP8 vLLM. La ejecución mostró una anomalía reproducible en el registro de probabilidades de los tokens dentro del canal de servicio o de la interfaz, pero el marco no la presenta como una filtración causal confirmada a nivel del modelo.
Según el material, las pruebas D1 y D7, de carácter interno e inspeccionable, siguen pendientes. Por ello, la fila fue marcada como official_dhs=false, indicando que se sometió a una auditoría de la interfaz de programación de aplicaciones, pero que la inspección interna no se ha completado. Esta separación es un componente central de la metodología: una anomalía del servicio, un problema de registro de puntuaciones a través de la interfaz y una filtración de estados ocultos a nivel del modelo no constituyen una sola afirmación.
Transparencia y límites de la divulgación
AX-Ray afirma que divulga las filas del marcador, los resúmenes diagnósticos a nivel del modelo, las puntuaciones de alto nivel de las categorías, la clasificación de los elementos, la estructura de vinculación con las jurisdicciones y algunos informes públicos, además de los casos específicos de filtración causal. Sin embargo, no publica recetas de pruebas privadas, detalles de los umbrales operativos, estímulos sensibles sin procesar, salidas dañinas sin procesar, detalles de implementación protegidos por derechos de patente, instrucciones internas de evaluación ni procedimientos que puedan convertirse en métodos de explotación.
El proyecto presenta este equilibrio como un intento de hacer que los diagnósticos de seguridad sean auditables sin convertirlos en una guía para eludir los modelos o reproducir comportamientos dañinos. También vincula el catálogo con contextos de gobernanza de Corea, la Unión Europea, Estados Unidos, Japón, China, los Emiratos Árabes Unidos y Arabia Saudita, haciendo hincapié en que AX-Ray es una guía diagnóstica y no un estándar jurídico oficial.
La importancia del caso publicado radica en que plantea una capa adicional sobre las pruebas de capacidades: la evaluación no pregunta únicamente si el modelo responde bien, sino también si su modelo, su canal de servicio y su entorno agéntico son confiables durante el despliegue, la operación y la gobernanza. El proyecto ofrece sus datos públicos y su espacio diagnóstico a través de FINAL-Bench/AX-RAY, mientras que los detalles de las pruebas privadas permanecen sin publicar.