Reflection AI가 회사 최초의 오픈 웨이트 인공지능 모델인 Beam을 발표했다. Beam은 프로그래밍, 추론 및 AI 에이전트가 수행하는 작업에 뚜렷한 초점을 맞춘다. 이 모델은 희소 혼합 전문가(Sparse Mixture-of-Experts) 구조를 기반으로 하며, 전체 매개변수는 5010억 개지만 각 토큰을 처리할 때 활성화되는 매개변수는 230억 개에 불과하다.
회사에 따르면 Beam은 웹 콘텐츠와 허가받은 독점 데이터 세트에서 수집한 23조 8000억 개의 토큰을 사용해 사전 학습됐다. 또한 100만 토큰의 컨텍스트 창을 제공하며, 이는 장문의 문서와 작업을 처리하기 위한 용량이다. 사전 학습과 함께 Reflection AI는 모델 성능을 개선하기 위해 대규모 강화 학습을 사용했다.
집중적인 학습과 추론 비용에 대한 초점
강화 학습 단계에서 회사는 Nvidia GB300 그래픽처리장치 10,500개를 4주 동안 가동했으며, 1억 건이 넘는 롤아웃을 생성했다. 학습과 평가에 사용된 샌드박스 작업 수는 약 13억 건에 달했다.
Reflection AI는 Beam에 관한 메시지에서 추론 효율성을 최우선으로 내세운다. 회사의 테스트에 따르면 이 모델은 고급 추론 테스트에서 Z.ai의 GLM-5.2에 가까운 성능을 제공하면서, 추론 과정에서 3~4배 적은 컴퓨팅 자원을 사용한다. 그러나 이러한 결과는 아직 독립적인 검증을 거치지 않았으며, 회사도 Kimi K3와 같은 더 큰 오픈 모델이 일부 경우 원시 성능에서 Beam을 앞선다는 점을 인정한다.
프로그래밍 결과와 추론 노력 제어
Reflection AI는 Beam이 SWE Bench Pro v2-Hard에서 77.2점, Terminal Bench v2.1에서 80.1점, SWE Bench Verified에서 80.9점을 기록했다고 밝혔다. 회사는 이 모델이 GLM-5.2와 경쟁하고 일부 작업에서는 더 큰 Qwen 모델에 근접한다고 말하지만, 모든 테스트에서 경쟁 모델을 앞선다고 주장하지는 않는다.
Beam에는 사용자가 추론에 할당되는 컴퓨팅 시간을 지정할 수 있는 reasoning effort 매개변수가 포함되어 있다. 낮은 수준에서는 더 낮은 비용으로 더 짧은 답변이 생성되며, 높은 수준에서는 모델이 복잡한 작업을 처리하기 위해 더 많은 토큰을 사용할 수 있다.
실제로 무엇이 달라지는가?
이 설계는 Beam의 가치가 단순히 모델의 규모나 최고 벤치마크 점수에만 좌우되는 것이 아니라, 답변의 품질과 답변을 생성하는 데 사용되는 자원 사이의 균형에 달려 있다는 것을 의미한다. 이는 프로그래밍 작업이나 모델 호출에 의존하는 에이전트를 반복적으로 실행하는 개발자와 기관에 도움이 될 수 있다. 그러나 실제 효용은 독립적인 결과, 인프라 비용, 가중치와 도구의 제공 조건에 계속 좌우될 것이다.
Beam은 텍스트 전용 모델이며 멀티모달 모델은 아니다. 도구 사용 및 웹 접근 기능을 제공하면 여러 출처를 검색하고 외부 도구가 제공하는 정보를 활용할 수 있다. Reflection AI에 따르면 이 모델은 학습 과정에서 다른 언어 모델을 사용하는 방법과 웹 접근이 제공될 때 문서를 읽기 위해 OCR 인터페이스를 활용하는 방법을 배웠다.
제공 방식과 더 넓은 전략
회사는 기관, 개발자 및 정부 기관을 대상으로 하며 Beam을 일상적인 업무 부하에서 사용할 수 있는 실용적인 모델로 설명한다. 이 계획은 기관이 자체 데이터로 작동하는 시스템을 맞춤화하고 이를 온프레미스로 운영할 수 있도록 하겠다는 Reflection AI의 이른바 ‘인공지능 공장’ 구축 방향에 포함된다.
Reflection AI는 2024년 Google DeepMind 출신 연구자들이 설립했으며, Nvidia, Sequoia Capital, Lightspeed Venture Partners가 참여한 가운데 약 47억 달러의 투자를 유치했다. 마지막 투자 라운드에서 회사의 투자 전 기업가치는 약 250억 달러에 달했다. 회사는 안전성 테스트와 최종 평가를 마친 뒤 10월 중 Beam의 가중치, 기술 보고서, 모델 카드 및 개발자 도구를 공개할 예정이다.