Artificial Intelligence Underwriting Company(약칭 AIUC)는 기업 내부에서 사용되거나 모델 및 애플리케이션 기업이 개발한 AI 에이전트의 안전성을 독립적으로 감사하고 인증하는 계층을 구축하기 위해, Ribbit Capital이 주도하고 First Harmonic이 참여한 Series A 투자 라운드에서 4천만 달러를 조달했다.
이 회사는 Anthropic의 초기 직원 출신인 Rune Kvist와, 2024년부터 2025년까지 AI 안전 연구기관 METR에서 최고운영책임자를 지냈으며 현재도 이사회 구성원으로 활동하는 Rajiv Dattani가 이끌고 있다. AIUC는 Cursor, Lovable, Harvey, ElevenLabs가 고객이라고 밝혔다.
사이버보안 감사에서 영감을 얻은 표준
AIUC는 사이버보안에서 익숙한 모델을 AI 에이전트의 위험에 적용하는 방식을 추진하고 있다. 이 회사는 AIUC-1이라는 표준과 함께 에이전트가 얼마나 안전하고 신뢰성 있게 행동하는지를 측정하는 테스트 및 감사 서비스를 개발했다. 이 구상은 기술 기업의 통제를 평가할 때 널리 사용되는 SOC 2 표준에 기반하지만, 자료에는 AIUC-1이 회사와 고객 범위를 넘어 공인되었거나 널리 채택된 표준이라는 언급은 없다.
표준을 마련하기 위해 회사는 에이전트를 구매하거나 배포 여부를 결정하는 계층인 보안 및 위험관리 책임자 약 250명으로 구성된 연합체를 모았다. AIUC는 이 참여자들의 의견을 활용해 테스트가 다뤄야 할 질문과 위험을 정하고 있다.
약 5,000개의 테스트와 최종 인간 검증
회사는 장벽 우회 시도, 환각, 데이터 유출을 포함한 시나리오 약 5,000개로 구성된 테스트를 에이전트에 수행한다. 이 과정에서 에이전트가 안전하고 신뢰성 있게 행동하는 영역과 취약점 또는 우려가 나타나는 영역을 설명하는 약 100쪽 분량의 보고서가 작성된다.
AIUC는 테스트를 실행하고 데이터를 분석하는 데 AI 에이전트를 사용하지만, Rune Kvist는 인간 감사관이 최종 감사 결과를 검증한다고 말했다. 이 보고서는 기관이 에이전트 구매 또는 배포를 결정하기 전에 독립적인 정보를 제공하는 것을 목표로 하며, 모든 상황에서 시스템이 안전하다는 절대적 보장을 제공하는 것은 아니다.
METR의 평가와 무엇이 다른가?
METR도 자율성과 평가 측면에서 유사한 테스트를 수행하지만, 지금까지는 에이전트의 성능과 특정 작업을 신뢰성 있게 완료하는 능력에 더 큰 초점을 맞춰왔다. 반면 AIUC는 데이터 유출과 원치 않는 행동처럼 실제 사용 과정에서 기관이 중요하게 여기는 위험을 중심으로 평가를 유도하려 한다.
certi.news의 분석
여기서 가장 중요한 발전은 자금 조달 자체가 아니라, 구매 전에 AI 에이전트의 안전성을 비교 가능한 외부 감사 절차로 전환하려는 시도다. 이는 모델 제공업체의 안전성 주장만으로는 충분하지 않은 기관에 도움이 될 수 있지만, AIUC-1 표준을 시장이 어느 정도 인정할지, 에이전트가 업데이트될 때 테스트 결과가 어떻게 변할지, 5,000개의 테스트가 실제 운영 환경을 대표하는지에 대한 의문은 여전히 남아 있다. 또한 테스트와 분석의 일부를 AI 자체에 의존한다는 점에서 최종 인간 검증은 서비스의 신뢰성에 결정적인 요소가 된다.
AIUC의 두 공동 창업자는 기관이 고객에게 시스템 행동의 한계를 보장할 수 없는 상황에서 은행, 병원, 정부, 군 기관 내부에 더 지능적인 시스템을 배포하기 어려운 현실과 이 모델을 연결한다. 이는 Anthropic의 최고경영자 Dario Amodei가 첨단 모델 개발을 늦추고 독립 평가자를 활용해 안전성을 모니터링하고 검증하자고 촉구한 내용과도 맞닿아 있으며, 그는 가능한 선택지 중 하나로 METR을 언급했다.