JetBrains объявила о выпуске Mellum2.1 — открытой модели для программных агентов и субагентов, которым необходимо быстро выполнять задачи на устройствах пользователя или его собственной инфраструктуре. Версия представляет следующее поколение модели Mellum2 с 12 миллиардами параметров, сохраняя ту же архитектуру смеси экспертов, в которой используются 2,5 миллиарда активных параметров, и распространяется по лицензии Apache 2.0.
Главное улучшение связано не с изменением архитектуры, а с этапом последующего обучения. JetBrains заявляет, что в большей степени опиралась на обучение с подкреплением и запустила миллионы изолированных выполнений в тысячах программных сред, чтобы обучить модель задачам, более близким к реальной работе внутри репозиториев кода.
От ответов к работе внутри репозитория
Mellum2 была быстрой, но, по словам JetBrains, недостаточно хорошо работала с программными репозиториями. Mellum2.1 теперь способна исследовать кодовую базу, изменять файлы и проверять внесённые изменения. Это позволяет использовать её для выполнения различных этапов плана программного агента, например для определения первопричины неудачного теста, подготовки исправления и его проверки.
Обучение на более строгих данных и в более строгих средах
Новые обучающие задачи включали математику, соревновательное программирование, естественные науки, использование инструментов и разработку программного обеспечения. JetBrains объединила открытые данные с задачами, разработанными внутри компании, но отметила, что открытые данные могут содержать неисправные тесты, непроверяемые ответы, а также слишком простые или невозможные задачи; поэтому перед включением в обучение источники подвергались фильтрации.
Компания также сосредоточилась на создании сред обучения с подкреплением, способных внутренне запускать тысячи сред, что позволило проводить во время обучения миллионы изолированных экспериментов.
Повышение производительности и скорости
JetBrains сравнила Mellum2.1 с предыдущей версией, а также с моделями Qwen3.5-9B и Gemma 4 E4B, используя единый набор настроек оценки. Наибольшее улучшение наблюдалось в агентном программировании, а дополнительные приросты — в программировании, соревновательном программировании, математике, вызове инструментов и общих знаниях.
Поскольку этап последующего обучения не изменил архитектуру, модель сохранила скорость Mellum2, а многотокенное предсказание (MTP) способствует ускорению вывода. JetBrains заявляет, что при высокой нагрузке модель обслуживает примерно вдвое больше токенов, чем Qwen3.5-9B, а MTP делает её примерно в 1,6 раза быстрее в одном запросе.
Что меняется на практике?
Mellum2.1 предоставляет командам разработки открытый вариант с возможностью самостоятельного запуска для создания программных агентов или субагентов, сохраняя код и данные под контролем оператора. Однако приведённые показатели отражают сравнительные тесты JetBrains и не содержат в материале независимых подробностей о требованиях к оборудованию или ограничениях производительности в реальных проектах.
Модель уже доступна на Hugging Face. Версии GGUF для llama.cpp, Ollama и LM Studio, а также головная часть MTP, используемая для спекулятивного декодирования через vLLM, должны появиться позднее.