Искусственный интеллект

AX-Ray выявляет дефекты каузальной утечки в двух общедоступных моделях искусственного интеллекта

Проект VIDRAFT AX-Ray предлагает метод оценки моделей, выходящий за рамки показателей производительности, после выявления и повторного подтверждения дефектов, охарактеризованных как каузальная утечка, в моделях Zyphra/Zamba2-1.2B и nvidia/Nemotron-H-8B-Base-8K. Фреймворк относит эти случаи к дефектам, препятствующим развертыванию, отличая их от проблем серверного пути или API.

2026-08-13
5 мин. чтения
7 просмотров
فريق تحرير certi.news
AX-Ray выявляет дефекты каузальной утечки в двух общедоступных моделях искусственного интеллекта

Проект AX-Ray представляет общий диагностический случай, который, по его утверждению, выявил и затем повторно подтвердил дефекты каузальной утечки в двух общедоступных моделях искусственного интеллекта: Zyphra/Zamba2-1.2B и nvidia/Nemotron-H-8B-Base-8K. Обе модели представлены на панели AX-Ray как случаи Causal-LEAK, тогда как фреймворк рассматривает подтверждённую каузальную утечку как дефект, препятствующий развертыванию, независимо от результата модели в тестах общих способностей.

Опубликованный материал в блоге Hugging Face исходит из основного тезиса: правильных ответов на вопросы стандартизированных тестов недостаточно для оценки готовности модели к практическому использованию. Согласно представлению VIDRAFT, безопасность развертывания включает корректность причинно-следственных связей, согласованность серверного пути, устойчивость к враждебным условиям или длинным контекстам, безопасность данных, безопасность инфраструктуры, регуляторную готовность и риски агентных систем.

Что такое каузальная утечка?

В авторегрессионной языковой модели предполагается, что представления или поведение значений вероятности в более ранней позиции последовательности не должны зависеть от будущих токенов, недоступных в этой позиции. Каузальная утечка возникает, когда последующая или находящаяся за пределами контекста информация изменяет состояния скрытых представлений, значения вероятности или поведение, связанное с оцениванием, в предыдущей части последовательности.

AX-Ray отличает эту проблему от галлюцинаций, отказа в отклонении, инъекций команд и загрязнения тестов. Это важные проблемы, но они не описывают тот же дефект: каузальная утечка касается корректности вычислительного пути модели. Согласно материалу, этот дефект может отражаться на стабильности префикса, корректности скрытых состояний, согласованности значений вероятности, обработке последовательностей пакетным или гибридным способом, надёжности кэширования и сервинга, доверии к длинным контекстам, корректности оценки и безопасности агентного выполнения.

Почему её могут не выявить тесты способностей?

Большинство общедоступных таблиц лидеров сосредоточено на том, насколько часто модель даёт правильный ответ. Это необходимый сигнал, но он не охватывает все характеристики внутреннего поведения. Каузальная утечка может оставаться незаметной в тестах вопросов и ответов, математики, программирования и следования инструкциям, поскольку такие тесты обычно наблюдают только за окончательным ответом.

Вместо этого AX-Ray изучает более глубокие свойства, включая сохранение стабильности префикса, согласованность серверных путей и вопрос о том, должны ли критические сбои перевешивать общий результат по способностям. Материал ясно формулирует принцип: высокая способность не означает автоматически готовность к развертыванию.

Многоосевой диагностический фреймворк

AX-Ray организует свою работу вокруг трёх диагностических осей и 11 операционных категорий, а его общий каталог включает 117 диагностических записей. Эти записи охватывают технические вопросы, связанные с доказательствами, серьёзностью проблемы, направлением выявления, направлением устранения и контекстом управления.

  • MODEL-SCAN: проверяет корректность, надёжность, устойчивость, безопасность модели, безопасность её данных, эффективность, внутреннюю структуру и направления обработки.
  • AX-SCAN: сосредоточен на сервинге, инфраструктуре, безопасности, соответствии требованиям и операционных рисках.
  • AGENT-SCAN: рассматривает риски агентного развертывания, такие как разрешения инструментов, захват, циклы, загрязнение памяти, поведение при удалении и управление автономностью.

К другим категориям относятся каузальная безопасность и целостность сервиса, надёжность, устойчивость и длинные контексты, безопасность, защищённость и согласование, целостность данных и методология оценки, эффективность, квантование и архитектура, проверяемая внутренняя архитектура и обработка. Операционная ось также включает категории, посвящённые расхождению сервинга между движками, безопасности инфраструктуры и регуляторному соответствию.

Различие между дефектом модели и проблемой сервиса

AX-Ray также фиксирует результат, проверенный через API модели upstage/Solar-Open2-250B при её запуске через FP8 vLLM. Запуск показал воспроизводимую аномалию в регистрации вероятностей токенов в рамках серверного пути или интерфейса, однако фреймворк не представляет её как подтверждённую каузальную утечку на уровне модели.

Согласно материалу, проверяемые тесты D1 и D7 внутреннего характера по-прежнему приостановлены, поэтому строка помечена как official_dhs=false с указанием на то, что она прошла аудит API, тогда как внутренняя проверка не завершена. Это разделение является центральной частью методологии: аномалия сервиса, проблема регистрации оценок через интерфейс и утечка скрытых состояний на уровне модели — не одно и то же утверждение.

Прозрачность и ограничения раскрытия информации

AX-Ray заявляет, что раскрывает строки таблицы лидеров, сводки диагностики на уровне модели, высокоуровневые оценки категорий, классификацию элементов, структуру привязки к юрисдикциям и некоторые общедоступные отчёты, а также конкретные случаи каузальной утечки. Однако он не публикует специальные тестовые рецепты, сведения об операционных порогах, необработанные чувствительные промпты, необработанные вредоносные выходные данные, защищённые патентными правами исполнительные детали, внутренние команды оценки или процедуры, которые можно преобразовать в методы эксплуатации.

Проект представляет этот баланс как попытку сделать диагностику безопасности подотчётной, не превращая её в руководство по обходу моделей или воспроизведению вредного поведения. Он также связывает каталог с контекстами управления в Корее, Европейском союзе, США, Японии, Китае, Объединённых Арабских Эмиратах и Саудовской Аравии, подчёркивая, что AX-Ray является диагностическим руководством, а не официальным правовым стандартом.

Значение опубликованного случая заключается в том, что он предлагает дополнительный уровень поверх тестов способностей: оценка спрашивает не только о том, хорошо ли модель отвечает, но и о том, заслуживают ли доверия её модель, серверный путь и агентная среда при развертывании, эксплуатации и управлении. Проект предоставляет свои общедоступные данные и диагностическое пространство через FINAL-Bench/AX-RAY, тогда как подробности специальных тестов остаются неопубликованными.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости