Alibaba выпустила модель Qwen3.8-27B на платформе Hugging Face в пятницу по открытой лицензии Apache 2.0, что позволяет разработчикам скачивать её веса, изучать, изменять и запускать независимо от интерфейсов облачных моделей. Значимость релиза связана не только с количеством параметров — 27 миллиардов, — но и со способностью сочетать понимание изображений и видео, контекст объёмом до 262 144 токенов, настраиваемое рассуждение, поддержку задач программирования и рабочих процессов программных агентов.
Источник описывает модель как компактную и удобную для развёртывания версию возможностей поколения Qwen3.8. Версия с точностью 16 бит требует около 56 ГБ памяти GPU, тогда как версии FP8 необходимо примерно 28 ГБ. После сжатия до 4 бит размер самой модели сокращается примерно до 17 ГБ, что делает её пригодной для запуска на продвинутых потребительских устройствах, таких как мощный игровой компьютер или хорошо оснащённый ноутбук.
Большие возможности в меньшем размере
Сочетание производительности и размера стало одной из главных причин широкого отклика со стороны разработчиков и продвинутых пользователей ИИ. При запуске Alibaba представила высокие показатели в нескольких тестах: модель набрала 61,7 в SWE-bench Pro, 90,3 в LiveCodeBench v6, 70,7 в CoWorkBench и 84,3 в OSWorld-Verified.
В опубликованной компанией сравнительной таблице Qwen3.8-27B превзошла указанное для Claude Opus 4.6 Max значение в тестах SWE-bench Pro и LiveCodeBench, тогда как Claude сохранил преимущество в Terminal-Bench, GPQA Diamond и Humanity’s Last Exam. Однако этих результатов недостаточно, чтобы объявить общего победителя: некоторые оценки Alibaba являются внутренними, а инструменты тестирования и методы измерения не обязательно идентичны для всех моделей.
Последующие независимые результаты придали релизу дополнительный импульс. Artificial Analysis присвоила ему 52 балла в Intelligence Index — составном показателе, включающем девять оценок программирования, естественных наук, рассуждения и профессиональных задач. Этот результат совпал с показателем, который индекс в настоящее время приписывает GPT-5.6 Luna от OpenAI при максимальной настройке рассуждения; это закрытая модель, доступная только через облако. Qwen3.8-27B также получила 51 балл в Agentic Index, опередив Claude Opus 4.8 при максимальном уровне усилий рассуждения.
Эти сравнения не означают полной эквивалентности моделей, но объясняют интерес разработчиков. Cline, программный агент с открытым исходным кодом, назвал результат первым случаем, когда локальная модель продемонстрировала возможности, близкие к возможностям лидирующих моделей. Joshua “Xenova” Lochner также протестировал запуск модели с использованием специализированных ядер WebGPU, что указывает на возможность её интеграции в различные среды выполнения.
Что локальный запуск даёт на практике?
Simon Willison протестировал сжатую версию Q4_K_M размером около 17 ГБ на MacBook Pro с процессором M5 Max и на Nvidia DGX Spark. В его экспериментах модель могла писать код, понимать изображения и выполнять цикл программного агента через фреймворк Pi agent. Она также перемещалась по кодовой базе, чтобы объяснить механизм аутентификации, и написала и протестировала инструмент на Python для преобразования журнала агента в формате JSONL в Markdown.
Эти эксперименты показывают практическую разницу между моделью, доступной только через API, и файлом, который можно хранить на рабочей станции. Разработчик может запускать модель, изменять её и сохранять внутри собственной инфраструктуры вместо отправки данных внешнему поставщику. Это открывает возможности с точки зрения конфиденциальности, информационной безопасности, управления и контроля развёртывания, но автоматически не означает, что модель подходит для каждой задачи или будет работать быстро.
Интерес проявился и в показателях использования: Cybernews сообщила, что модель превысила 3 миллиона скачиваний с Hugging Face за первые три дня, а совместимые с инструментами локального вывода сжатые версии стали появляться вскоре после этого. Сообщество LocalLLaMA на Reddit создало отдельную тему для сбора результатов тестирования, сжатых версий, инструкций по настройке и сравнений.
Качество сопровождается временными затратами
Наиболее очевидное ограничение Qwen3.8-27B — склонность к чрезмерному обдумыванию. По данным Artificial Analysis, во время тестов Intelligence Index модель сгенерировала 160 миллионов выходных токенов против медианного значения в 43 миллиона токенов у сопоставимых моделей с открытыми весами. Источник связывает это с настройкой рассуждения по умолчанию xhigh: в эксперименте Willison создание SVG-изображения лебедя, едущего на велосипеде, заняло 21 минуту и потребовало более 22 тысяч токенов рассуждения. Поэтому он рекомендовал начинать обычное использование с низким уровнем рассуждения или вовсе без него.
Tomasz Tunguz зафиксировал аналогичный компромисс в небольшом тесте из девяти задач в сравнении с DeepSeek V4 Flash. При включённом рассуждении Qwen немного превзошла его по качеству в использованной агентской системе, но работала примерно в 30 раз медленнее и была в 4,5 раза дороже; при этом он отметил, что девяти задач недостаточно для окончательного вывода.
Программное обеспечение для вывода может помочь сократить разрыв. Модель включает технологию Multi-Token Prediction, а Willison сообщил о повышении производительности примерно на 72% на DGX Spark после её активации через llama.cpp по сравнению с настройками LM Studio по умолчанию. Тем не менее при обычном запуске через LM Studio его система выдавала от 15 до 30 токенов в секунду — значительно ниже скорости отклика многих размещённых моделей.
Что это означает для компаний?
Для организаций важнее не то, превосходит ли модель с 27 миллиардами параметров Claude или GPT в одной таблице, а то, способна ли она локально выполнять достаточный объём программирования, анализа документов, визуального понимания и агентских задач, чтобы заменить вызовы API в практических категориях работы. Благодаря лицензии Apache 2.0 веса можно изучать, изменять и размещать за корпоративными средствами контроля, а Alibaba документирует совместимость модели с фреймворками vLLM, SGLang и TokenSpeed.
Alibaba заявляет, что управляемая версия Qwen Cloud появится позднее с контекстом по умолчанию в 1 миллион токенов и встроенными инструментами. Однако текущая ценность Qwen3.8-27B заключается в возможности локального развёртывания с меньшей зависимостью от облачной инфраструктуры. По-прежнему необходима дополнительная независимая проверка её результатов, а медленный вывод может ограничить её полезность в интерактивных сценариях. Поэтому релиз не доказывает, что локальные модели достигли общего паритета с ведущими моделями, но показывает, что возможности, ещё недавно связанные с дорогостоящими сервисами, теперь можно запускать из небольшого файла на оборудовании, принадлежащем пользователю.