A JetBrains anunciou o lançamento do Mellum2.1, um modelo aberto destinado a agentes de programação e subagentes que precisam executar tarefas rapidamente nos dispositivos do usuário ou em sua própria infraestrutura. A versão representa a próxima geração do modelo Mellum2, com 12 bilhões de parâmetros, mantendo a mesma arquitetura de mistura de especialistas que utiliza 2,5 bilhões de parâmetros ativos, sob a licença Apache 2.0.
A principal melhoria não veio de uma mudança na arquitetura, mas da etapa de pós-treinamento. A JetBrains afirma ter recorrido mais intensamente à aprendizagem por reforço e executado milhões de operações isoladas em milhares de ambientes de software, com o objetivo de treinar o modelo em tarefas mais próximas do trabalho real dentro de repositórios de código.
Da resposta ao trabalho dentro do repositório
O Mellum2 era rápido, mas não lidava com repositórios de software no nível necessário, segundo a JetBrains. Já o Mellum2.1 tornou-se capaz de explorar a base de código, modificar arquivos e examinar as alterações realizadas. Isso permite utilizá-lo para executar diferentes etapas do plano de um agente de software, como identificar a causa-raiz de um teste com falha, preparar uma correção e validá-la.
Treinamento com dados e ambientes mais rigorosos
As novas tarefas de treinamento abrangeram matemática, programação competitiva, ciências, uso de ferramentas e engenharia de software. A JetBrains combinou dados abertos com tarefas desenvolvidas internamente, mas observou que os dados abertos podem incluir testes quebrados, respostas não verificáveis ou problemas fáceis demais ou impossíveis; por isso, as fontes foram filtradas antes de serem incorporadas ao treinamento.
A empresa também se concentrou na criação de ambientes de aprendizagem por reforço capazes de executar milhares de ambientes internamente, o que permitiu realizar milhões de experimentos isolados durante o treinamento.
Melhorias no desempenho e na velocidade
A JetBrains comparou o Mellum2.1 com a versão anterior e com os modelos Qwen3.5-9B e Gemma 4 E4B, usando uma configuração de avaliação unificada. A maior melhoria ocorreu na programação por agentes, com ganhos adicionais em programação, programação competitiva, matemática, chamada de ferramentas e conhecimento geral.
Como a etapa de pós-treinamento não alterou a arquitetura, o modelo manteve a velocidade do Mellum2, enquanto a previsão de múltiplos tokens (MTP) contribui para acelerar a inferência. A JetBrains afirma que, sob carga elevada, o modelo atende a uma quantidade de tokens próxima do dobro da atendida pelo Qwen3.5-9B, e que o MTP o torna cerca de 1,6 vez mais rápido por solicitação.
O que muda na prática?
O Mellum2.1 oferece às equipes de desenvolvimento uma opção aberta e passível de execução autônoma para criar agentes de programação ou subagentes, mantendo o código e os dados sob o controle da entidade operadora. No entanto, os números apresentados refletem os testes comparativos da JetBrains e o material não inclui detalhes independentes sobre os requisitos de hardware ou os limites de desempenho em projetos reais.
O modelo está atualmente disponível no Hugging Face. Já as versões GGUF para llama.cpp, Ollama e LM Studio, além do cabeçalho MTP usado na decodificação especulativa por meio do vLLM, devem chegar posteriormente.