인공지능

Anthropic, 첨단 연구소 내부에서 AI 발전 속도를 측정하기 위한 공개 지표 제안

Anthropic은 2026년 9월 17일 AI 연구가 Claude에 얼마나 의존하는지, 에이전트 모니터링 메커니즘과 안전 연구에 할당된 컴퓨팅 비중을 측정하기 위한 실험적 프레임워크를 발표했다. 수치에 따르면 Claude는 회사 연구개발 업무의 26%를 주도하지만, 2026년 8월까지 측정된 어떤 영역에서도 완전한 자율성으로 작동하지 않았다. 회사는 측정에 통일된 방법론과 독립적인 검증이 필요하다고 강조했다.

2026-09-18
5 분 읽기
12 조회수
فريق تحرير certi.news
Anthropic, 첨단 연구소 내부에서 AI 발전 속도를 측정하기 위한 공개 지표 제안

Anthropic은 2026년 9월 17일 첨단 연구소 내부의 AI 개발 속도를 측정하기 위한 제안을 발표했다. 이는 대중과 정부가 현재 다음과 같은 격차를 관찰할 수 없다는 회사의 판단에서 출발했다. 즉, 이러한 연구소 내부에서 실제로 무슨 일이 일어나고 있으며, 모델이 후속 세대 모델 구축을 얼마나 지원하기 시작했는가 하는 문제다. 이 보고서는 새로운 모델이나 제품을 발표하는 것이 아니라, 세 가지 실험적 지표군과 2026년 Anthropic 내부 운영의 한 시점에 대한 모습을 제시한다.

지표는 연구개발이 AI에 의존하는 정도, 준자율적인 작업을 수행하는 에이전트를 회사가 감독할 수 있는 능력, 그리고 역량 개발과 안전 연구 사이의 컴퓨팅 자원 배분 방식에 초점을 맞춘다. Anthropic은 이러한 지표가 Responsible Scaling Policy에 따라 발표된 역량 테스트와 위험 보고서를 보완하며, 향후 연구소 간 비교 가능한 투명성 약속을 구축하는 데 도움이 될 수 있다고 본다.

AI 개발에서 Claude에 얼마나 의존하는가?

Anthropic은 모델과 관련된 연구개발 업무를 모두 파악한 뒤 각 작업의 자동화 정도를 평가하고, 해당 작업에 배정된 인간의 시간을 기준으로 가중치를 계산하는 방식으로 Anthropic R&D Automation Index라는 초기 지표를 만들었다. 평가는 AI가 참여하지 않는 AL0부터 인간의 개입 없이 시스템이 완전히 자율적으로 작동하는 AL5까지 이어지는 Epoch AI가 개발한 척도에 기반한다.

2026년 8월 기준으로 Claude는 측정된 연구개발 업무의 어떤 그룹에서도 완전한 자율성으로 작동하지 않았다. 그러나 AL4의 정의에 따르면 이러한 업무의 약 26%를 주도했다. 즉, 일반적인 지시와 인간의 감독을 바탕으로 처음부터 끝까지 대부분의 작업을 수행할 수 있었다. 또한 AI가 AL3 이상 수준으로 참여하는 업무의 비중, 즉 시스템이 긴밀한 인간의 지시에 따라 작업의 큰 부분을 맡는 업무의 비중은 90%를 넘었다.

이 지표를 만들기 위해 회사는 2026년 7월의 업무 기록과 내부 문서를 바탕으로 약 15,000개의 세부 작업으로 구성된 지도를 만든 다음, 이를 542개 노드로 이루어진 트리로 정리했다. 이 가운데 378개는 말단 노드였다. 방법론 부록에 따르면 평가 모델의 판단과 인간의 판단은 59%의 사례에서 완전히 일치했으며, 인간 간 판단의 일치율은 35%였다. 또 97%의 사례에서 판단은 서로 한 단계 이내로 일치했다. 그러나 Anthropic은 ‘협력한다’와 ‘주도한다’의 경계는 여전히 의견 차이가 있을 수 있다고 인정한다.

약 30,000개 에이전트 모니터링

회사에 따르면 2026년 8월, 가장 많이 사용된 내부 플랫폼에서 약 30,000개의 에이전트가 언제든 연구 및 엔지니어링 업무를 수행하고 있었다. 이 시스템에는 작업 실행 전에 실시간으로 수행하는 모니터링과, 작업이 발생한 뒤 행동을 분석하는 사후 모니터링이 포함된다. 이러한 에이전트의 작업은 100% 실행 전에 실시간 모니터를 거쳤으며, 일반적으로 몇 초 안에 처리되었다. 또한 작업의 100%가 사후 모니터링에 입력되었다.

Anthropic은 8월 한 달 동안 연구 및 엔지니어링 에이전트가 내린 10억 건 이상의 결정을 분석했다. 그 결과 실시간 모니터는 결정의 0.002%, 즉 약 47,000건당 한 건을 차단했다. 사후 모니터링에서는 대화 또는 활동 1,000건당 약 한두 건에 추가 검토가 필요하다는 표시가 붙었다. 대부분의 표시는 분류기 시스템이 처리했으며, 매주 약 50건이 인간 검토자에게 상향 조정되었다. 회사는 차단된 작업에 대한 인간 검토가 일주일 이내에 진행된다고 말한다.

이 수치가 위험이 사라졌다는 뜻은 아니다. 이는 특정 내부 플랫폼과 제한된 모니터링 기간을 측정한 것이며, 에이전트 수가 증가할수록 희귀한 행동을 발견하는 일이 더욱 중요해진다. Anthropic은 모니터링 실험이 수년이 아니라 수개월 동안 진행되었으며, 알려지지 않은 행동에 대해 완전한 그림을 확보할 수 있다고 보장하지 않는다고 인정한다.

안전에 할당된 컴퓨팅

Anthropic은 2026년 7월 13일부터 20일까지 컴퓨팅 사용량을 조사하고, 작업 부하를 여러 범주로 분류한 다음 연구개발에 사용된 컴퓨팅 중 안전 연구가 차지하는 비중을 추정했다. 이 기간 연구개발 컴퓨팅의 약 6%가 안전 업무에 사용되었으며, AI가 주도하는 연구개발에 할당된 컴퓨팅만을 보면 그 비율은 약 12%로 높아졌다.

회사는 이러한 추정치가 보수적이라고 설명한다. 역량과 안전에 동일하게 기여하는 업무는 집계하지 않았고, 보장성 분류기의 컴퓨팅도 포함하지 않았기 때문이다. 또한 이 비중은 안전에 투입된 노력을 완전히 측정하는 지표가 아니라고 강조한다. 안전 연구는 컴퓨팅 집약적인 실험을 실행하는 것보다 연구자의 시간에 더 많이 의존할 수 있기 때문이다. 아울러 이 측정은 한 주를 반영할 뿐이며 시간에 따른 추세를 입증하지도 않는다.

이 프레임워크가 중요한 이유는 무엇인가?

이 제안의 핵심 가치는 현재 수치 자체에만 있는 것이 아니다. 연구소만 볼 수 있는 주제였던 AI의 발전을 비교 가능한 지표로 추적할 수 있는 과정으로 바꾸려는 시도에 있다. 연구소들이 연구 자동화 비율, 모니터링 범위, 검토 시간, 상향 조정률, 안전에 투입된 컴퓨팅 비중을 공개한다면 시간이 지나면서 변화하는 양상을, 나아가 기업 간 차이까지 비교할 수 있게 될 것이다.

그러나 Anthropic은 스스로 몇 가지 근본적인 한계를 제시한다. 아직 공통 방법론이 없고, 일부 평가는 회사 자체의 모델에 의존하며, ‘판정자’가 자신이 검토하는 시스템의 오류를 반복할 수 있다. 또한 안전 업무의 분류는 정의에 의존하기 때문에 연구소나 규제 기관마다 경계를 다르게 설정할 수 있다. 한편 일부 컴퓨팅 태그는 완전히 검증되지 않은 자동 데이터나 사용자 입력에 기반한다.

회사는 안전 관행을 검증하고 사고와 지표를 모니터링할 수 있도록 여러 독립 평가 기관에 비교 가능한 접근 권한을 제공할 계획이라고 말한다. 따라서 실제로 달라진 것은 투명성을 위한 초기 모델과 논의 가능한 내부 데이터가 마련되었다는 점이지, 세계적으로 구속력 있는 표준이 이미 수립되었다는 뜻은 아니다. 이 아이디어의 성공 여부는 정의를 통일하고, 외부 검증을 가능하게 하며, 경쟁에 민감한 데이터를 공개하지 않고도 무엇을 발표할 수 있는지 명확히 하는 데 달려 있다.

뉴스 출처
Anthropic Newsroom
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기