Circuit Breaker Labs는 적대적인 방식으로 시스템을 공격하는 시도에만 초점을 맞추지 않고, 사용자와의 자연스러운 상호작용 중 나타날 수 있는 심리적 위험에 집중하는 인공지능 테스트 계층을 구축하고 있다. 이 회사는 서로 다른 연령, 배경, 언어, 문화를 가진 사용자를 표현하기 위해, 스스로를 디지털 «충돌 시험용 인형»과 비슷하다고 설명하는 시뮬레이션 에이전트를 사용한다.
이 아이디어는 인공지능 기업들이 심리적 위기나 자살 생각을 겪는 미성년 사용자에게 챗봇이 미치는 영향과 관련한 소송에 직면한 시점에 나왔다. 회사 공동 창업자인 형제 Shirali Nigam과 Arul Nigam은 일부 위험 요소가 사용자가 시스템을 속이려 할 때가 아니라, 사용자가 정상적인 방식으로 시스템을 사용하면서 자신의 말이나 맥락이 잘못 해석될 때 나타난다고 말한다.
사람들이 실제로 사용하는 언어 테스트
Circuit Breaker Labs는 현실적인 말투, 구어적 표현, 암호화된 언어, 철자 오류, 해당 언어의 원어민과 제2언어로 사용하는 사람 사이의 차이를 포함하는 사용자 시뮬레이션을 구축하기 위해 인간 전문가에게 의존한다. 이 회사는 모델이 표준어는 잘 처리할 수 있지만, 여러 대화에 걸쳐 맥락이 누적될 때 짧은 표현이나 구어체 용어를 잘못 이해할 수 있다고 본다.
이 플랫폼은 취약점을 발견하도록 설계된 «레드팀» 테스트를 수행하며, 매일 수만 건에서 수십만 건에 이르는 시뮬레이션 상호작용을 진행한다. 이후 회사는 감사 가능하고 해석 가능하다고 주장하는 점수를 산출하기 위해 자체적인 평가 메커니즘을 사용한다.
실제로 무엇이 달라지는가?
이 플랫폼은 개별 응답을 확인하는 데 그치지 않고, 여러 대화에 걸쳐 위험한 상호작용이 점진적으로 전개될 때 모델이 적절하게 대응하는지를 테스트하려 한다. 이는 특히 인공지능 기반 교육 애플리케이션, 일기 작성, 심리 지원 분야에서 중요하다. 사용자는 한계를 시험하려는 목적이 아니라 도움을 받기 위해 시스템을 찾을 수 있기 때문이다.
회사는 향후 플랫폼의 범위가 «직장 동료» 에이전트와 사용자와 대화 프로그램 사이에 유사 사회적 관계를 형성할 수 있는 다른 애플리케이션으로 확장될 수 있다고 말한다. 그러나 이러한 확장은 아직 미래의 구상이다. 현재 Circuit Breaker Labs는 고위험 인공지능 애플리케이션을 위한 테스트 연구소로 운영되고 있으며, 주요 고객의 이름은 공개하지 않았다.
현재 단계와 한계
이 회사는 작동하는 제품을 보유하고 있지만 아직 매우 초기 단계에 있으며, 형제인 Nigam 두 사람을 포함해 직원 수는 5명에 불과하다. 또한 이 자료는 자체 평가 방법론의 세부 사항, 독립적인 비교 결과, 고객 이름을 제시하지 않는다. 따라서 현재 회사의 설명을 넘어 플랫폼의 효과를 평가하는 데에는 한계가 있다.
certi.news의 분석: 이 이니셔티브는 모델 안전성 테스트의 중요한 변화를 보여준다. 위험은 명확한 유해 요청뿐 아니라 방언, 연령 또는 문화적 맥락에 대한 오해에서 비롯될 수도 있다. 이 접근법의 가치는 시뮬레이션이 얼마나 현실적인지, 시간의 흐름에 따른 피해를 발견할 수 있는지, 그리고 산출하는 점수가 얼마나 투명한지에 달려 있다. 신뢰 구축에 관한 회사의 발언만으로는 안전성이 향상되었다는 사실을 입증하기에 충분하지 않으며, 향후에는 검증 가능한 데이터와 고객 또는 독립 기관의 결과가 필요하다.