인공지능

Microsoft, OpenAI 모델 대신 Qwen 기반의 Foundry 의사결정 모델 출시

Microsoft는 애플리케이션과 에이전트 및 워크플로에서 의사결정을 수행하기 위한 Microsoft-Decision-1 모델을 출시했다. 이 모델은 Alibaba의 Qwen3.5-9B를 기반으로 학습됐으며, 입력 토큰 100만 개당 0.042달러, 출력은 무료인 가격으로 제공된다. 다만 현재 이미지와 공개 가중치를 지원하지 않는다.

2026-10-10
3 분 읽기
5 조회수
certi.news Editorial Team
Microsoft, OpenAI 모델 대신 Qwen 기반의 Foundry 의사결정 모델 출시

Microsoft는 OpenAI가 개발자에게 Decisions API를 공개 베타 버전으로 제공한 지 불과 3일 만에 Foundry 플랫폼 내에서 Microsoft-Decision-1 모델을 출시했다. 두 회사의 긴밀한 관계를 고려하면 의외일 수 있지만, Microsoft의 모델은 처음에 Alibaba의 Qwen3.5-9B를 기반으로 학습됐으며, 회사는 향후 자체 MAI 모델과 OpenAI 모델을 기반으로 다시 구축할 계획이라고 밝혔다.

이 모델은 기존 애플리케이션과 에이전트 및 워크플로에 의사결정 기능을 추가하는 것을 목표로 한다. 예를 들어 출력 결과를 평가하거나, 적절한 모델을 선택하거나, 자동화된 프로세스에서 다음 단계를 결정하는 데 활용할 수 있다. Microsoft는 Foundry에서 이 모델을 입력 토큰 100만 개당 0.042달러에 제공하며, 출력 토큰은 무료다. 이는 TypeSafe가 Jev 모델에 부과하는 가격과 동일하다.

Microsoft의 내부 테스트

Microsoft는 이 모델의 첫 번째 사용자가 자사라고 밝혔다. Xbox Research는 게이머 의견 메모 1만 건 이상을 분류하는 데 이 모델을 테스트했으며, Copilot 팀은 대화와 에이전트 응답을 평가하는 데 사용했다. 또한 온콜 엔지니어들은 실시간 사고 발생 중 맥락을 추출하는 데 활용했다. Microsoft Discovery는 에이전트가 작업을 다시 계획하기 전에 실험을 평가하는 데 이 모델을 사용했다.

회사 수치에 따르면 Decision-1은 Xbox 관련 테스트에서 GPT-6 Sol보다 14배 이상 빨랐고, Discovery 테스트에서는 일관성이 46배 더 높았다. 하지만 이 비교의 방법론에 대한 세부 내용은 공개되지 않았으므로, 해당 수치를 특정 시나리오를 벗어난 모델의 전반적인 성능에 대한 판단으로 볼 수는 없다.

이 소식이 중요한 이유

의사결정 모델은 대규모 생성 모델과 애플리케이션 사이에서 저비용 제어 계층 역할을 하는 방향으로 나아가고 있다. 에이전트가 모델이나 도구 또는 실행 경로를 반복해서 선택해야 할 때 이러한 계층은 중요해진다. 각 의사결정의 비용이 그에 수반되는 생성 요청의 처리량과 함께 누적될 수 있기 때문이다.

Microsoft는 특히 GitHub Copilot이 일부 작업을 기기에서 실행할지 클라우드 모델로 보낼지 결정하도록 하는 계획을 추진하고 있어, 이러한 유형의 모델을 내부적으로 개발할 추가 동기가 있다. 그러나 회사는 Decision-1이 실제로 Copilot의 의사결정에 참여할지 여부를 확인하지 않았으며, 무엇이 클라우드로 전송되는지도 공개하지 않았다.

호환성과 미디어 지원의 한계

Foundry 목록에 따르면 Decision-1은 최대 32,768개의 텍스트 토큰을 입력받고 결과를 JSON 형식으로 반환하지만, 이미지는 지원하지 않는다. 이 때문에 광학 인코더를 사용하는 Cloudflare의 Clef와 OpenAI의 Decisions API보다 지원 범위가 좁다.

Microsoft는 모델 가중치를 제공한다고 발표하지도 않았다. 반면 Cloudflare는 Apache 2.0 라이선스로 Clef 모델을 공개했다. AWS와 Upstage 및 Ollama는 이 분야에서 TypeSafe의 System One이라는 인터페이스를 공통 인터페이스로 채택했지만, Microsoft는 Decision-1이 이 인터페이스와 완전히 호환되는지 확인하지 않았다. 다만 Foundry의 코드 예시는 /systemone이라는 이름의 엔드포인트를 호출한다.

신뢰도가 허위 정보에 대한 견고함을 의미하지는 않는다

Microsoft는 모델의 확률이 보정돼 있다고 밝혔다. 즉 90%의 확률을 제시하는 예측은 대표적인 사례에서 10건 중 약 9건이 맞아야 한다는 뜻이다. 하지만 회사는 고객에게 자체 데이터를 사용해 보정을 검증할 것을 권고한다.

JevOut 연구는 이러한 유보가 중요한 이유를 보여준다. 짧고 자연스럽게 작성된 추가 문구가 Jev 모델에서 처음에는 올바르던 508개의 결정 중 312개를 뒤집었으며, 이 가운데 229건에서는 모델이 오답에 70% 이상의 확률을 부여했다. Microsoft의 자사 모델 테스트에는 선택지 순서 변경과 설명 재작성 등 8가지 유형의 변경이 포함됐고, 평균적으로 답변의 1.3%가 바뀌었다. 그러나 JevOut 연구는 Decision-1을 테스트하지 않았으므로, 이 결과가 허위 정보를 유도하도록 설계된 입력에 모델이 어떻게 대응할지를 입증하는 것은 아니다.

뉴스 출처
The New Stack - Software Development
원문 보기 ↗
c
작성자

certi.news Editorial Team

같은 카테고리

추천 기사

모든 뉴스 보기