Mistral AI hat Mistral Large 4 vorgestellt, das Unternehmen zufolge bislang sein größtes und leistungsfähigstes Modell ist. Das intern unter dem Codenamen „Le Chonk“ bekannte Modell verfügt insgesamt über eine Billion Parameter, wobei bei jeder Verarbeitung 49 Milliarden aktive Parameter verwendet werden. Das Unternehmen stellt es über Mistral Studio als öffentliche Vorschau bereit und will die Modellgewichte vor Ende Oktober veröffentlichen.
Multimodales Modell für den Unternehmenseinsatz
Mistral Large 4 verarbeitet Texte und Bilder. Nach Angaben des Unternehmens wurde es für Programmierung, agentenbasierte Arbeitsabläufe, Bildverständnis, Finanzwesen, Recht und Cybersicherheit entwickelt. Mistral behauptet, dass das Modell in einer Reihe von Unternehmensszenarien eine der höchsten Leistungen im Vergleich zu Modellen mit offenen Gewichten erzielt.
Im Test Dense 200 zum Bildverständnis erreichte das Modell 42 % gegenüber 41 % beim Modell GPT-6 Astra. Zudem soll es komplexe Dokumente, Grafiken und technische Diagramme analysieren, bestimmte Elemente in großen Satellitenbildern finden und die Position von Elementen in visuellen Daten bestimmen können.
Leistungsindikatoren in Sicherheit und Programmierung
Mistral Large 4 erreichte 82 % in einem Test, der Schwachstellen in echter Software reproduziert und anschließend ihre Behebung zum Ziel hat. Außerdem absolvierte es 93 % der 40 Aufgaben des Cybench-Tests. Nach Angaben des Unternehmens umfassen die Sicherheitsanwendungen die Analyse von Schadsoftware, die Priorisierung von Schwachstellen und die Erstellung von Erkennungsregeln.
In Programmierungstests erzielte das Modell 61,7 % bei DeepSWE v1.1, 59,4 % bei SWE-Atlas-QnA, 28,3 % bei Terminal-Bench 4 und 49,8 % beim Coding Agent Index. Mistral zufolge übertraf es DeepSeek V4 Pro und Qwen3.8 Max im Gesamtindex, während es in einer von professionellen Entwicklern durchgeführten Blindbewertung hinter Claude Opus 5 den zweiten Platz belegte.
Agenten und europäische Infrastruktur
Das Modell konzentriert sich außerdem auf die Ausführung langwieriger Aufgaben durch die Nutzung mehrerer Tools und Anwendungen. Bei AutomationBench, das 657 Unternehmensarbeitsabläufe über Gmail, Google Sheets, Slack und Salesforce abdeckt, erreichte es 59,9 %. Zudem erzielte es 1.393 Elo-Punkte im AA-Briefcase-Test zur Erstellung von Tabellenkalkulationen, Präsentationen und PDF-Dateien.
Das Modell wurde von Grund auf in europäischen Rechenzentren von Mistral mit 3.800 Nvidia-Grace-Blackwell-GPUs trainiert. Nach Angaben des Unternehmens unterstützt es mehr als 160 Sprachen, darunter alle Amtssprachen der Europäischen Union. Es soll außerdem in Europa über eine von Mistral betriebene und europäischen Rechtsvorschriften unterliegende Infrastruktur gehostet werden. Nach der Veröffentlichung der Gewichte sollen Unternehmen diese in ihren eigenen Clouds oder innerhalb ihrer lokalen Infrastruktur betreiben können.
Was ändert sich praktisch?
Mistral Large 4 verbindet ein großes multimodales Modell mit Agentenfähigkeiten und einer erwarteten Option für offene Gewichte. Dadurch erhalten Unternehmen möglicherweise einen Weg, ihre Abhängigkeit von externen Programmierschnittstellen zu verringern und eine größere Kontrolle über Daten und Nutzungsrichtlinien zu erlangen. Einzelheiten zur Architektur, zu den Trainingsmethoden und zu zusätzlichen Testergebnissen wurden jedoch noch nicht veröffentlicht. Außerdem stützen sich die meisten genannten Leistungsindikatoren auf unternehmenseigene Daten; für einen unabhängigen Vergleich muss daher die Veröffentlichung der Gewichte und detaillierter Informationen abgewartet werden.
Der Preis für die Programmierschnittstelle beträgt 1,36 US-Dollar pro einer Million Eingabetoken und 4,18 US-Dollar pro einer Million Ausgabetoken. Mistral zufolge ist das Modell das erste bedeutende Modell innerhalb der Roadmap nach einer Series-D-Finanzierungsrunde im Wert von 3 Milliarden Euro. Außerdem soll es als Grundlage für branchenspezifische und optimierte Modelle dienen, die später entwickelt werden.