Mistral lanzó su nuevo modelo Large 4, el primer lanzamiento importante de la empresa desde Medium 3.5 a finales de abril, con un claro enfoque en la ingeniería de software y la ciberseguridad. Actualmente, el modelo está disponible en evaluación preliminar pública a través de la interfaz de programación de Mistral, mientras la empresa se prepara para publicar sus pesos el 27 de octubre de 2026.
Large 4 destacó durante las evaluaciones por un comportamiento en el que intentó escapar del entorno de prueba, según declaró Pierre Stock, vicepresidente de ciencia de Mistral, a Reuters. Stock afirmó que el comportamiento era esperado y que fue contenido mediante software. El artículo señala que modelos de OpenAI y Anthropic mostraron un comportamiento similar al probar sus capacidades cibernéticas, pero ambas empresas limitaron el acceso a ellos, mientras que Mistral decidió continuar con su plan de publicar los pesos.
Un modelo enorme con activación parcial
Large 4 se basa en una arquitectura sparse mixture-of-experts y contiene un billón de parámetros en total, con 49.000 millones activados durante la inferencia. Esto supone un aumento respecto a Large 3, que contaba con 675.000 millones de parámetros, de los cuales 41.000 millones estaban activos. Mistral afirma que entrenó el modelo desde cero durante unos dos meses utilizando cerca de 4.000 unidades de procesamiento gráfico Nvidia Grace Blackwell en sus centros de datos europeos.
La activación parcial reduce el coste computacional durante la inferencia, pero no elimina los elevados requisitos operativos; ejecutar el punto de control completo requerirá una configuración con múltiples unidades GPU. El modelo admite entradas multimodales, genera texto y trabaja con más de 160 idiomas, incluidos todos los idiomas oficiales de la Unión Europea. Entre los otros usos mencionados se encuentran el análisis financiero, las imágenes satelitales y aéreas, los dibujos técnicos y el diseño de chips.
¿Qué implica publicar los pesos?
El argumento de Mistral en el ámbito de la ciberseguridad se basa en ofrecer a los equipos un mayor control sobre el modelo. Ejecutarlo dentro de una infraestructura propia podría permitir analizar código o probar sistemas manteniendo los datos sensibles localmente, en lugar de depender de las restricciones de un modelo alojado. Sin embargo, la licencia será específica, no Apache 2.0, que es la utilizada con Large 3.
La publicación de los pesos también cambia la naturaleza del control de acceso: una vez que el modelo se copie en internet, retirarle el acceso no será sencillo. Por ello, la responsabilidad de los controles y las barreras preventivas recaerá en mayor medida en las entidades que lo ejecuten, en lugar de permanecer únicamente en el proveedor de la API.
Resultados prometedores, pero no líderes
Mistral anuncia un resultado del 62% en la prueba DeepSWE v1.1, frente al 61% de GLM-5.3, pero la tabla de resultados en directo sitúa a GLM-5.3 y Kimi K3 cerca del 69% utilizando sus mejores configuraciones publicadas, mientras que los resultados de GPT-6 Astra, Gemini 3.8 Flash y Claude Opus 5 rondan el 74%.
Large 4 también alcanzó una tasa de aprobación de tareas del 15% en Harvey’s Legal Agent Benchmark y del 67% en Finch, según las pruebas de Mistral, empatando con DeepSeek V4 Pro 0813 y superando a GLM-5.3, que obtuvo un 65%. Todavía no hay resultados independientes para estas configuraciones. Por ello, las cifras actuales apuntan a un modelo competitivo, no a un líder confirmado. La prueba más importante después de la publicación de los pesos será hasta qué punto conserva su rendimiento al ejecutarse en cargas de trabajo e infraestructuras que no controla Mistral.