Alibaba는 금요일 Hugging Face 플랫폼에 Qwen3.8-27B 모델을 오픈 소스 Apache 2.0 라이선스로 출시했다. 이에 따라 개발자는 모델 가중치를 다운로드하고 검사·수정하며, 클라우드 모델 인터페이스와 분리된 환경에서 실행할 수 있다. 이번 출시의 중요성은 270억 개의 매개변수뿐 아니라 이미지와 동영상 이해, 최대 262,144토큰의 컨텍스트, 조정 가능한 추론, 프로그래밍 작업 및 소프트웨어 에이전트 워크플로 지원을 결합했다는 데 있다.
소식통은 이 모델을 Qwen3.8 세대의 기능을 압축하고 쉽게 배포할 수 있는 버전으로 설명한다. 16비트 정밀도 버전은 약 56GB의 GPU 메모리가 필요한 반면, FP8 버전은 약 28GB가 필요하다. 4비트로 압축하면 모델 자체의 크기가 약 17GB로 줄어들어 강력한 게이밍 컴퓨터나 사양이 높은 노트북 같은 고급 소비자 기기에서도 실행할 수 있다.
더 작은 크기에 담긴 대규모 기능
성능과 크기의 결합은 개발자와 고급 인공지능 사용자 사이에서 폭넓은 반응을 이끈 주요 이유였다. Alibaba는 출시 당시 여러 테스트에서 강력한 수치를 제시했다. 이 모델은 SWE-bench Pro에서 61.7, LiveCodeBench v6에서 90.3, CoWorkBench에서 70.7, OSWorld-Verified에서 84.3을 기록했다.
회사가 공개한 비교표에서 Qwen3.8-27B는 SWE-bench Pro와 LiveCodeBench 테스트에서 Claude Opus 4.6 Max에 대해 기재된 점수를 앞섰으며, Claude는 Terminal-Bench, GPQA Diamond, Humanity’s Last Exam에서는 여전히 앞섰다. 그러나 이러한 결과만으로 종합적인 승자를 선언하기는 어렵다. Alibaba의 일부 평가는 내부 평가이며, 테스트 도구와 측정 방식이 모든 모델에서 반드시 동일한 것은 아니기 때문이다.
이후의 독립적인 결과는 이번 출시의 동력을 더욱 강화했다. Artificial Analysis는 프로그래밍, 과학, 추론, 전문 작업에 대한 9개 평가를 포함하는 복합 지표인 Intelligence Index에서 이 모델에 52점을 부여했다. 이 점수는 현재 해당 지표가 OpenAI의 GPT-5.6 Luna에 최고 추론 설정을 적용했을 때 부여하는 점수와 같았다. GPT-5.6 Luna는 클라우드를 통해서만 이용할 수 있는 독점 모델이다. Qwen3.8-27B는 Agentic Index에서도 51점을 받아, 최대 추론 성능을 적용한 Claude Opus 4.8을 앞섰다.
이러한 비교가 모델들이 완전히 동등하다는 뜻은 아니지만, 개발자들이 관심을 보이는 이유를 설명해 준다. 오픈 소스 소프트웨어 에이전트인 Cline은 이번 결과를 로컬 모델이 최고 수준 모델에 가까운 능력을 기록한 최초의 사례라고 평가했다. Joshua “Xenova” Lochner는 전용 WebGPU 커널을 사용해 모델을 실행하는 방법도 테스트했으며, 이는 다양한 실행 환경에 통합할 수 있음을 시사한다.
로컬 실행은 실제로 무엇을 가능하게 하는가?
Simon Willison은 M5 Max 프로세서가 탑재된 MacBook Pro와 Nvidia DGX Spark에서 약 17GB 크기의 Q4_K_M 압축 버전을 테스트했다. 그의 실험에서 이 모델은 코드를 작성하고 이미지를 이해하며 Pi agent 프레임워크를 통해 소프트웨어 에이전트 루프를 실행할 수 있었다. 또한 코드베이스를 탐색해 인증 작동 방식을 설명하고, JSONL 형식의 에이전트 로그를 Markdown으로 변환하는 Python 도구를 작성하고 테스트했다.
이러한 실험은 API를 통해서만 접근할 수 있는 모델과 워크스테이션에 보관할 수 있는 파일 사이의 실질적인 차이를 보여 준다. 개발자는 데이터를 외부 제공업체로 보내는 대신 자체 인프라 안에서 모델을 실행하고 수정하며 유지할 수 있다. 이는 개인정보 보호, 정보 보안, 거버넌스, 배포 통제와 관련된 선택지를 넓혀 주지만, 모델이 모든 작업에 적합하거나 실행 속도가 빠르다는 뜻은 아니다.
사용량에서도 관심이 나타났다. Cybernews에 따르면 이 모델은 Hugging Face에서 출시 첫 3일 동안 300만 회 이상의 다운로드를 기록했으며, 로컬 추론 도구와 호환되는 압축 버전도 빠르게 등장했다. Reddit의 LocalLLaMA 커뮤니티는 테스트 결과, 압축 버전, 설정 지침, 비교 자료를 모으기 위한 전용 게시물을 만들었다.
품질에는 시간 비용이 따른다
Qwen3.8-27B의 가장 뚜렷한 제약은 지나치게 깊이 생각하는 경향이다. Artificial Analysis에 따르면 이 모델은 Intelligence Index 테스트 중 1억 6,000만 개의 출력 토큰을 생성했으며, 비슷한 오픈 웨이트 모델의 중앙값은 4,300만 토큰이었다. 소식통은 이를 기본 추론 설정인 xhigh와 연결한다. Willison의 실험에서는 자전거를 타는 백조의 SVG를 만드는 데 21분이 걸렸고 추론 토큰이 2만 2,000개 이상 사용됐다. 따라서 그는 일반적인 사용을 낮은 추론 설정 또는 추론을 사용하지 않는 상태에서 시작할 것을 권장했다.
Tomasz Tunguz도 DeepSeek V4 Flash와 비교한 9개 작업의 소규모 테스트에서 비슷한 절충을 기록했다. 추론을 활성화했을 때 Qwen은 그가 사용한 에이전트 시스템에서 품질 면으로 약간 앞섰지만, 약 30배 느렸고 비용은 4.5배 더 높았다. 다만 그는 9개 작업만으로는 결과를 확정하기에 충분하지 않다고 지적했다.
추론 소프트웨어가 격차를 줄이는 데 도움이 될 수 있다. 이 모델에는 Multi-Token Prediction 기술이 포함되어 있으며, Willison은 llama.cpp를 통해 이 기능을 활성화한 뒤 LM Studio의 기본 설정과 비교했을 때 DGX Spark에서 성능이 약 72% 향상됐다고 전했다. 그럼에도 LM Studio를 통한 일반적인 실행에서는 초당 15~30토큰이 생성됐으며, 이는 여러 호스팅 모델의 응답 속도보다 훨씬 느리다.
기업에는 무엇을 의미하는가?
기업에 더 중요한 비교는 270억 개의 매개변수를 가진 모델이 단일 표에서 Claude나 GPT를 앞서는지가 아니라, 프로그래밍, 문서 분석, 비전 이해, 에이전트 작업을 충분히 로컬에서 수행해 실무의 특정 업무 범주에서 API 호출을 대체할 수 있는지 여부다. Apache 2.0 라이선스 덕분에 가중치를 검사하고 수정하며 기업의 통제 체계 뒤에서 호스팅할 수 있고, Alibaba는 vLLM, SGLang, TokenSpeed 프레임워크와의 호환성을 문서화했다.
Alibaba는 관리형 Qwen Cloud 버전이 추후 출시되며, 기본 컨텍스트가 100만 토큰이고 내장 도구를 제공할 것이라고 밝혔다. 그러나 현재 Qwen3.8-27B의 가치는 클라우드 인프라 의존도가 낮은 로컬 배포 옵션에 있다. 성능 결과에 대한 독립적인 추가 검증은 여전히 필요하며, 느린 추론 속도는 실시간 상호작용에서의 유용성을 제한할 수 있다. 따라서 이번 출시는 로컬 모델이 선도 모델과 전반적으로 동등해졌다는 사실을 입증하지는 않지만, 최근까지 고가 서비스와 연결돼 있던 기능을 사용자가 소유한 하드웨어에서 더 작은 파일로 실행할 수 있게 됐다는 점을 보여 준다.