JetBrains a annoncé le lancement de Mellum2.1, un modèle ouvert destiné aux agents de programmation et aux agents secondaires qui doivent exécuter rapidement des tâches sur les appareils de l’utilisateur ou sur sa propre infrastructure. Cette version représente la génération suivante du modèle Mellum2 doté de 12 milliards de paramètres, tout en conservant la même architecture à mélange d’experts, qui utilise 2,5 milliards de paramètres actifs, sous licence Apache 2.0.
L’amélioration principale ne provient pas d’une modification de l’architecture, mais de la phase de post-entraînement. JetBrains affirme avoir davantage misé sur l’apprentissage par renforcement et avoir exécuté des millions d’exécutions isolées dans des milliers d’environnements logiciels, afin d’entraîner le modèle à des tâches plus proches du travail réel au sein de dépôts de code.
De la réponse au travail au sein du dépôt
Mellum2 était rapide, mais ne gérait pas les dépôts de code au niveau requis, selon JetBrains. Mellum2.1 est désormais capable d’explorer la base de code, de modifier les fichiers et d’examiner les changements qu’il effectue. Cela permet de l’utiliser pour exécuter différentes étapes du plan d’un agent logiciel, comme déterminer la cause racine d’un test défaillant, puis préparer un correctif et le vérifier.
Un entraînement fondé sur des données et des environnements plus rigoureux
Les nouvelles tâches d’entraînement couvraient les mathématiques, la programmation compétitive, les sciences, l’utilisation d’outils et l’ingénierie logicielle. JetBrains a combiné des données ouvertes avec des tâches développées en interne, mais a indiqué que les données ouvertes pouvaient contenir des tests défectueux, des réponses invérifiables, ainsi que des problèmes trop faciles ou impossibles ; les sources ont donc été filtrées avant leur intégration à l’entraînement.
L’entreprise s’est également concentrée sur la création d’environnements d’apprentissage par renforcement capables d’exécuter des milliers d’environnements en interne, ce qui a permis de mener des millions d’expériences isolées pendant l’entraînement.
Amélioration des performances et de la vitesse
JetBrains a comparé Mellum2.1 à la version précédente ainsi qu’aux modèles Qwen3.5-9B et Gemma 4 E4B, en utilisant une configuration d’évaluation unifiée. La plus forte amélioration concernait la programmation agentique, avec des gains supplémentaires en programmation, en programmation compétitive, en mathématiques, en appel d’outils et en connaissances générales.
Comme la phase de post-entraînement n’a pas modifié l’architecture, le modèle conserve la vitesse de Mellum2, tandis que la prédiction multi-jetons (MTP) contribue à accélérer l’inférence. JetBrains affirme que, sous forte charge, le modèle sert un nombre de jetons proche du double de celui de Qwen3.5-9B, et que le MTP le rend environ 1,6 fois plus rapide par requête.
Qu’est-ce qui change concrètement ?
Mellum2.1 offre aux équipes de développement une option ouverte et auto-hébergeable pour créer des agents de programmation ou des agents secondaires, tout en gardant le code et les données sous le contrôle de l’entité qui l’exploite. Toutefois, les chiffres présentés reflètent les tests comparatifs de JetBrains et ne fournissent pas, dans le document, de détails indépendants sur les exigences matérielles ou les limites de performance dans des projets réels.
Le modèle est actuellement disponible sur Hugging Face. Les versions GGUF destinées à llama.cpp, Ollama et LM Studio, ainsi que la tête MTP utilisée pour le décodage spéculatif via vLLM, devraient arriver ultérieurement.