인공지능

Meta, 프로그래밍과 에이전트 작업에 더 집중한 Muse Spark 1.3 출시

Meta가 Muse Spark 1.2 출시 약 한 달 만에 프로그래밍, 장기 작업, 다단계 워크플로 개선을 포함한 Muse Spark 1.3을 발표했다. 이 모델은 Muse Code와 Meta Model API를 통해 이용할 수 있으며, max reasoning 옵션이나 가중치의 공개 제공 여부는 아직 확정되지 않았다.

2026-09-03
3 분 읽기
4 조회수
certi.news
Meta, 프로그래밍과 에이전트 작업에 더 집중한 Muse Spark 1.3 출시

Meta가 인공지능 모델 Muse Spark 1.3을 발표했다. 이번 모델의 주요 개선 사항은 프로그래밍, 장기 에이전트 작업, 복잡한 다단계 워크플로에 초점을 맞췄다. 이 모델은 Muse Spark 1.2 출시 약 한 달 후인 2026년 9월 3일부터 프로그래밍 도구 Muse Code와 Meta Model API를 통해 이용할 수 있다.

Meta는 이번 버전을 지금까지 자사의 가장 뛰어난 모델이라고 설명하지만, 이러한 표현은 회사가 제시한 평가에 불과하며 모든 테스트나 사용 사례에서 우수하다는 의미는 아니다.

장기 작업 관리 능력 향상

Muse Spark 1.3은 하나의 긴 대화 안에서 여러 작업을 처리하도록 설계됐다. 개방형 목표를 제공하면 필요한 맥락을 구축하기 위해 도구를 사용하고, 작업 계획의 부족한 부분을 발견해 수정한 뒤, 실행 중 습득한 정보를 최종 결과에 반영할 수 있다.

Meta는 또한 이 모델이 모호한 지시를 받았을 때 곧바로 가정에 의존하지 않고 더 능숙하게 대응한다고 밝혔다. 작업을 수행할 수 없을 때 명확한 질문을 제시하거나 사용자에게 도움을 요청할 수 있으며, 되돌릴 수 없거나 중요한 결과를 초래할 수 있는 작업을 수행하기 전에 사전 승인을 받을 수도 있다. 회사는 긴 지시문 안의 제약 조건을 유지하고, 동일한 대화에서 이전 요청과 새로운 요청을 연결하는 능력도 향상됐다고 강조했다.

Meta에 따르면 이 모델은 자신의 능력을 더 정확하게 평가해 실제로 수행할 수 없는 작업을 완료했다고 암시하는 경우를 줄이는 데 초점을 맞췄다.

프로그래밍 및 리소스 사용 개선

Meta 엔지니어들이 실시한 비교에 따르면 Muse Spark 1.3은 Muse Spark 1.2와 유사한 작업을 수행하면서 도구 호출은 약 20%, 토큰은 25% 적게 사용한다. 이러한 개선은 불필요한 대화 라운드를 줄이고, 회사의 설명에 따르면 더 깔끔하지만 세부 사항은 적은 코드를 생성하는 것과도 관련이 있다.

장기 소프트웨어 개발 작업을 대상으로 하는 DeepSWE v1.1 테스트에서 이 모델은 75.4점을 기록했다. 이 테스트는 TypeScript, Go, Python, JavaScript, Rust로 작성된 91개 소프트웨어 저장소의 113개 작업을 다룬다. Meta의 표에 따르면 이 점수는 GPT-5.6 Sol과 Claude Opus 5를 앞섰지만, 다른 평가에서는 여전히 경쟁 모델 중 일부가 더 높은 성능을 보였다.

수치가 실제로 입증하는 것은 무엇인가?

DeepSWE 결과는 해당 테스트에서 측정 가능한 개선이 있었음을 보여주지만, 이것만으로 Meta가 모든 사용 시나리오에서 OpenAI와 Anthropic의 격차를 좁혔다고 입증하기에는 충분하지 않다. 회사 자체도 다른 기관의 모델에 대한 테스트가 각 모델에 맞게 최적화되지 않았을 수 있으므로, 해당 모델이 낼 수 있는 최고 성능을 반영하지 않을 수 있다고 경고했다.

또한 Artificial Analysis 플랫폼은 모델의 max 버전에 Intelligence Index 62점을 부여했으며, Muse Spark 1.3이 100만 토큰의 컨텍스트 창을 보유하고 텍스트, 이미지, 동영상 입력을 지원한다고 밝혔다. 실제 비교 결과는 사용된 테스트, 평가 방식, 모델을 둘러싼 에이전트 구조에 따라 달라진다.

이용 가능 여부, 가격 및 미해결된 제한 사항

Meta는 성능 개선을 발표했지만 API 가격은 변경하지 않았다. 표준 가격은 토큰 100만 개당 입력 1.25달러, 캐시된 입력 0.15달러, 출력 4.25달러다.

회사는 모델이 지시문 주입 공격과 악성 입력에 대응하는 능력을 강화했으며, 되돌릴 수 없는 작업을 실행하기 전에 더 신중하게 판단하도록 학습시켰다고 밝혔다. 현재 이용 가능한 reasoning 모드를 제공하고 있으며, 추가 안전성 테스트를 완료한 뒤 max reasoning 옵션을 출시할 계획이다.

로드맵에는 더 큰 Muse Spark 모델과 오픈 웨이트 버전이 포함되어 있지만, Meta는 Muse Spark 1.3 자체의 가중치를 공개할지 명확히 밝히지 않았다. 따라서 이번 버전의 실질적인 가치는 독립적인 사용 결과, 추가 reasoning 기능의 출시 시점, 그리고 개방 계획이 이 특정 모델에도 적용되는지 여부에 달려 있다.

뉴스 출처
c
작성자

certi.news

같은 카테고리

추천 기사

모든 뉴스 보기