인공지능

AX-Ray, 두 공개 인공지능 모델에서 인과적 누출 결함 발견

VIDRAFT의 AX-Ray 프로젝트는 성능 점수를 넘어서는 모델 평가 방법을 제시한다. 이 프로젝트는 Zyphra/Zamba2-1.2B와 nvidia/Nemotron-H-8B-Base-8K 모델에서 인과적 누출이라고 설명한 결함을 식별하고 반복적으로 재현했다. 이 프레임워크는 이러한 사례를 배포를 막는 결함으로 분류하며, 서비스 경로나 API 문제와 구분한다.

2026-08-13
4 분 읽기
7 조회수
فريق تحرير certi.news
AX-Ray, 두 공개 인공지능 모델에서 인과적 누출 결함 발견

AX-Ray 프로젝트는 Zyphra/Zamba2-1.2Bnvidia/Nemotron-H-8B-Base-8K라는 두 공개 인공지능 모델에서 인과적 누출 결함을 발견한 뒤 반복적으로 입증했다고 밝힌 일반 진단 사례를 제시한다. 두 모델은 AX-Ray 대시보드에서 Causal-LEAK 사례로 표시되며, 이 프레임워크는 일반 능력 테스트에서 모델이 받은 점수와 관계없이 확인된 인과적 누출을 배포를 막는 결함으로 취급한다.

Hugging Face 블로그에 게시된 자료는 기본적인 논지에서 출발한다. 표준화된 테스트 질문에 정답을 제시하는 것만으로는 모델의 실제 사용 준비 여부를 판단하기에 충분하지 않다는 것이다. VIDRAFT가 제시하는 배포 안전성에는 인과 관계의 정확성, 서비스 경로의 일관성, 적대적 조건이나 긴 맥락에 대한 견고성, 데이터 무결성, 인프라 보안, 규제 준비도, 에이전트 시스템의 위험이 포함된다.

인과적 누출이란 무엇인가?

자기회귀 언어 모델에서는 시퀀스의 이전 위치에 있는 표현이나 확률값의 동작이 해당 위치에서 이용할 수 없는 미래 토큰의 영향을 받지 않아야 한다. 인과적 누출은 이후 정보 또는 맥락의 후속 정보가 시퀀스의 앞부분에 있는 은닉 상태, 확률값 또는 평가와 관련된 동작을 변화시킬 때 발생한다.

AX-Ray는 이 문제를 환각, 거부 실패, 프롬프트 인젝션, 테스트 오염과 구분한다. 이러한 문제도 중요하지만 동일한 결함을 설명하는 것은 아니다. 인과적 누출은 모델의 계산 경로가 올바른지와 관련되기 때문이다. 자료에 따르면 이 결함은 접두사의 안정성, 은닉 상태의 정확성, 확률값의 일관성, 배치 또는 하이브리드 방식의 시퀀스 처리, 캐싱 및 서비스의 신뢰성, 긴 맥락에 대한 신뢰, 평가의 정확성, 에이전트 실행의 안전성에 영향을 줄 수 있다.

능력 테스트로 왜 발견되지 않을 수 있는가?

대부분의 공개 리더보드는 모델이 정답을 제시하는 빈도에 초점을 맞춘다. 이는 필요한 신호이지만 내부 동작의 모든 특성을 포괄하지는 않는다. 이러한 테스트는 일반적으로 최종 답변만 관찰하기 때문에 질문과 답변, 수학, 프로그래밍, 지시 따르기 테스트에서 인과적 누출이 드러나지 않을 수 있다.

반면 AX-Ray는 접두사의 고정성, 서비스 경로의 일관성, 중대한 실패가 전체 능력 결과보다 우선해야 하는지 여부 등 더 깊은 특성을 검사한다. 자료는 이 원칙을 명확히 요약한다. 능력이 높다고 해서 자동으로 배포 준비가 된 것은 아니다.

다축 진단 프레임워크

AX-Ray는 세 가지 진단 축과 11개 운영 범주를 중심으로 작업하며, 117개의 진단 기록을 포함한 공개 카탈로그를 제공한다. 이 기록은 증거와 연결된 기술적 질문, 문제의 심각도, 발견 방향, 처리 방향, 거버넌스 맥락을 다룬다.

  • MODEL-SCAN: 모델의 정확성, 신뢰성, 견고성, 안전성, 데이터 무결성, 효율성, 내부 구조 및 처리 방향을 검사한다.
  • AX-SCAN: 서비스, 인프라, 보안, 규정 준수 및 운영 위험에 초점을 맞춘다.
  • AGENT-SCAN: 도구 권한, 하이재킹, 루프, 메모리 오염, 삭제 동작, 자율성 거버넌스 등 에이전트 배포 위험을 다룬다.

다른 범주에는 인과적 안전성과 서비스 무결성, 신뢰성, 견고성과 긴 맥락, 보안·안전·정렬, 데이터 무결성과 평가 방법론, 효율성·양자화·아키텍처, 검사 가능한 내부 구조, 처리가 포함된다. 또한 운영 축에는 엔진 간 서비스 편차, 인프라 보안, 규제 준수와 관련된 별도 범주가 포함된다.

모델 결함과 서비스 문제의 구분

AX-Ray는 FP8 vLLM을 통해 실행할 때 모델 API upstage/Solar-Open2-250B에서 감사된 결과도 기록한다. 해당 실행에서는 서비스 경로 또는 인터페이스의 토큰 확률 기록에서 재현 가능한 이상이 나타났지만, 프레임워크는 이를 모델 수준에서 확인된 인과적 누출로 제시하지 않는다.

자료에 따르면 내부적으로 검사 가능한 성격의 D1 및 D7 테스트는 아직 보류 중이다. 따라서 해당 행에는 official_dhs=false가 표시되어 있으며, API 감사를 받았지만 내부 검사가 완료되지 않았음을 나타낸다. 이러한 구분은 방법론의 핵심 요소다. 서비스 이상, 인터페이스를 통한 점수 기록 문제, 모델 수준의 은닉 상태 누출은 하나의 주장이 아니다.

투명성과 공개의 한계

AX-Ray는 리더보드의 행, 모델 수준의 진단 요약, 범주별 고수준 점수, 항목 분류, 관할권 연결 구조, 일부 공개 보고서와 함께 특정 인과적 누출 사례를 공개한다고 말한다. 그러나 비공개 테스트 레시피, 실행 임계값의 세부 정보, 민감한 원시 프롬프트, 유해한 원시 출력, 특허권으로 보호되는 구현 세부 사항, 내부 평가 명령, 악용 기법으로 전환할 수 있는 절차는 공개하지 않는다.

프로젝트는 이러한 균형을 모델 우회나 유해한 동작의 재현을 위한 지침으로 전환하지 않으면서 안전 진단을 책임 있게 검토할 수 있도록 하는 시도로 제시한다. 또한 카탈로그를 한국, 유럽연합, 미국, 일본, 중국, 아랍에미리트, 사우디아라비아의 거버넌스 맥락과 연결하지만, AX-Ray는 진단 지침일 뿐 공식적인 법적 기준은 아니라고 강조한다.

공개된 사례의 중요성은 능력 테스트 위에 추가적인 계층을 제시한다는 데 있다. 평가는 모델이 답변을 잘하는지만 묻는 것이 아니라, 배포·운영·거버넌스 상황에서 모델과 서비스 경로, 에이전트 환경을 신뢰할 수 있는지도 묻는다. 이 프로젝트는 FINAL-Bench/AX-RAY를 통해 공개 데이터와 진단 공간을 제공하며, 비공개 테스트의 세부 사항은 공개하지 않는다.

뉴스 출처
Hugging Face Blog
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기