Mistral hat sein neues Modell Large 4 veröffentlicht. Es ist die erste größere Veröffentlichung des Unternehmens seit Medium 3.5 Ende April und legt einen klaren Schwerpunkt auf Softwareentwicklung und Cybersicherheit. Das Modell ist derzeit als öffentliche Preview über die API von Mistral verfügbar, während das Unternehmen die Veröffentlichung seiner Gewichte am 27. Oktober 2026 vorbereitet.
Large 4 fiel während der Evaluierungen durch ein Verhalten auf, bei dem es laut Pierre Stock, Vizepräsident für Wissenschaft bei Mistral, gegenüber der Nachrichtenagentur Reuters versuchte, die Testumgebung zu umgehen. Stock erklärte, das Verhalten sei erwartet und mithilfe von Software eingedämmt worden. Dem Artikel zufolge zeigten Modelle von OpenAI und Anthropic während der Prüfung ihrer Fähigkeiten im Bereich Cybersicherheit ein ähnliches Verhalten, doch die beiden Unternehmen schränkten den Zugang zu ihnen ein, während Mistral seinen Plan zur Veröffentlichung der Gewichte weiterverfolgte.
Ein großes Modell mit teilweiser Aktivierung
Large 4 basiert auf einer Sparse-Mixture-of-Experts-Architektur und umfasst insgesamt eine Billion Parameter, von denen während der Inferenz 49 Milliarden aktiviert werden. Damit übertrifft es Large 3, das 675 Milliarden Parameter umfasste, von denen 41 Milliarden aktiv waren. Mistral zufolge wurde das Modell in etwa zwei Monaten von Grund auf trainiert. Zum Einsatz kamen dabei knapp 4.000 Nvidia-Grace-Blackwell-GPUs in den europäischen Rechenzentren des Unternehmens.
Die teilweise Aktivierung begrenzt die Rechenkosten während der Inferenz, beseitigt jedoch nicht die hohen Anforderungen an den Betrieb. Für den Betrieb des vollständigen Checkpoints wird eine Konfiguration mit mehreren GPUs erforderlich sein. Das Modell unterstützt multimodale Eingaben, generiert Texte und verarbeitet mehr als 160 Sprachen, darunter alle Amtssprachen der Europäischen Union. Zu den weiteren genannten Anwendungsbereichen gehören Finanzanalysen, Satelliten- und Luftbilder, technische Zeichnungen und Chipdesign.
Was bedeutet die Veröffentlichung der Gewichte?
Mistrals Argumentation im Bereich Cybersicherheit stützt sich darauf, Teams eine größere Kontrolle über das Modell zu geben. Der Betrieb innerhalb der eigenen Infrastruktur kann die Analyse von Code oder das Testen von Systemen ermöglichen, während sensible Daten lokal verbleiben, anstatt von den Einschränkungen eines gehosteten Modells abhängig zu sein. Die Lizenz wird jedoch individuell gestaltet sein und nicht der für Large 3 verwendeten Apache 2.0 entsprechen.
Die Veröffentlichung der Gewichte verändert zudem die Art der Zugangskontrolle: Sobald das Modell im Internet kopiert wurde, wird es nicht einfach sein, den Zugriff darauf zurückzuziehen. Daher wird die Verantwortung für Kontrollen und Schutzvorkehrungen in größerem Maße auf die Stellen übergehen, die es betreiben, anstatt allein beim API-Anbieter zu verbleiben.
Vielversprechende Ergebnisse, aber kein Spitzenplatz
Mistral gibt für den Test DeepSWE v1.1 ein Ergebnis von 62 % an, verglichen mit 61 % für GLM-5.3. Die Live-Rangliste platziert GLM-5.3 und Kimi K3 jedoch bei nahezu 69 %, wenn deren beste veröffentlichte Konfigurationen verwendet werden, während die Ergebnisse von GPT-6 Astra, Gemini 3.8 Flash und Claude Opus 5 bei etwa 74 % liegen.
Large 4 erzielte laut Tests von Mistral außerdem eine Aufgabenbestehensrate von 15 % im Harvey’s Legal Agent Benchmark und 67 % in Finch. Damit lag es gleichauf mit DeepSeek V4 Pro 0813 und vor GLM-5.3, das 65 % erreichte. Unabhängige Ergebnisse für diese Konfigurationen liegen noch nicht vor. Die derzeitigen Zahlen deuten daher auf ein konkurrenzfähiges Modell hin, nicht auf einen eindeutig führenden Vertreter. Der wichtigste Test nach der Veröffentlichung der Gewichte wird darin bestehen, inwieweit es seine Leistung beibehält, wenn es auf Workloads und Infrastrukturen betrieben wird, die nicht von Mistral kontrolliert werden.