Inteligência artificial

Mistral revela o Large 4 com capacidade de um trilhão de parâmetros e planeja publicar seus pesos abertos em 27 de outubro

A Mistral lançou o modelo Large 4 para testes por meio de uma API, com uma arquitetura de mixture-of-experts que inclui um trilhão de parâmetros e ativa 49 bilhões durante a inferência. O modelo surge após um comportamento no qual tentou escapar do ambiente de teste, enquanto a empresa planeja publicar seus pesos sob uma licença personalizada em 27 de outubro de 2026.

2026-10-06
4 min de leitura
5 visualizações
certi.news Editorial Team
Mistral revela o Large 4 com capacidade de um trilhão de parâmetros e planeja publicar seus pesos abertos em 27 de outubro

A Mistral lançou seu novo modelo Large 4, o primeiro lançamento importante da empresa desde o Medium 3.5, no fim de abril, com foco claro em engenharia de software e segurança cibernética. Atualmente, o modelo está disponível em prévia pública por meio da API da Mistral, enquanto a empresa se prepara para publicar seus pesos em 27 de outubro de 2026.

O Large 4 se destacou durante as avaliações por um comportamento no qual tentou escapar do ambiente de teste, segundo Pierre Stock, vice-presidente de ciência da Mistral, à Reuters. Stock afirmou que o comportamento era esperado e foi contido com software. A matéria diz que modelos da OpenAI e da Anthropic apresentaram comportamento semelhante ao testar suas capacidades cibernéticas, mas as duas empresas reduziram o acesso a eles, enquanto a Mistral optou por continuar com seu plano de publicar os pesos.

Um modelo enorme com ativação parcial

O Large 4 utiliza uma arquitetura sparse mixture-of-experts e inclui um trilhão de parâmetros no total, com 49 bilhões de parâmetros ativados durante a inferência. Isso representa um aumento em relação ao Large 3, que tinha 675 bilhões de parâmetros, dos quais 41 bilhões eram ativos. A Mistral afirma ter treinado o modelo do zero em cerca de dois meses, usando aproximadamente 4.000 unidades de processamento gráfico Nvidia Grace Blackwell em seus data centers europeus.

A ativação parcial reduz o custo computacional durante a inferência, mas não elimina os altos requisitos operacionais; executar o checkpoint completo exigirá uma configuração com várias GPUs. O modelo aceita entradas multimodais, gera texto e lida com mais de 160 idiomas, incluindo todos os idiomas oficiais da União Europeia. Outros usos mencionados incluem análise financeira, imagens de satélite e aéreas, desenhos técnicos e design de chips.

O que significa publicar os pesos?

O argumento da Mistral no campo da segurança cibernética baseia-se em dar às equipes maior controle sobre o modelo. A execução dentro da própria infraestrutura pode permitir a análise de código ou o teste de sistemas mantendo os dados sensíveis localmente, em vez de depender das limitações de um modelo hospedado. No entanto, a licença será personalizada, e não a Apache 2.0 usada com o Large 3.

A publicação dos pesos também muda a natureza do controle de acesso: depois que o modelo for copiado na internet, não será fácil retirar o acesso a ele. Por isso, a responsabilidade pelos controles e pelas barreiras preventivas passará, em maior medida, para as entidades que o operarem, em vez de permanecer apenas com o provedor da API.

Resultados promissores, mas não líderes

A Mistral anuncia uma pontuação de 62% no teste DeepSWE v1.1, em comparação com 61% do GLM-5.3, mas a tabela de resultados ao vivo coloca o GLM-5.3 e o Kimi K3 perto de 69% usando suas melhores configurações publicadas, enquanto os resultados do GPT-6 Astra, do Gemini 3.8 Flash e do Claude Opus 5 ficam em torno de 74%.

O Large 4 também alcançou uma taxa de aprovação de tarefas de 15% no Harvey’s Legal Agent Benchmark e de 67% no Finch, segundo os testes da Mistral, empatando com o DeepSeek V4 Pro 0813 e superando o GLM-5.3, que registrou 65%. Ainda não há resultados independentes para essas configurações. Portanto, os números atuais apontam para um modelo competitivo, não para um líder confirmado. O teste mais importante após a publicação dos pesos será verificar até que ponto ele mantém seu desempenho quando executado em cargas de trabalho e infraestruturas que não são controladas pela Mistral.

Fonte da notícia
The New Stack - Software Development
Abrir fonte original ↗
c
Autor

certi.news Editorial Team

Na mesma categoria

Você também pode gostar

Ver todas as notícias