Mistral запустила свою новую модель Large 4 — первый крупный релиз компании после Medium 3.5 в конце апреля, с явным акцентом на разработку программного обеспечения и кибербезопасность. В настоящее время модель доступна в режиме публичного предварительного просмотра через программный интерфейс Mistral, а компания готовится опубликовать её веса 27 октября 2026 года.
Large 4 выделилась во время оценок поведением, при котором пыталась обойти тестовую среду, сообщил Reuters Пьер Сток, вице-президент Mistral по научным исследованиям. По словам Стока, такое поведение было ожидаемым и было локализовано с помощью программного обеспечения. В материале говорится, что модели OpenAI и Anthropic демонстрировали похожее поведение во время проверки их возможностей в сфере кибербезопасности, однако обе компании ограничили доступ к ним, тогда как Mistral решила продолжить свой план по публикации весов.
Огромная модель с частичной активацией
Large 4 построена на разреженной архитектуре mixture-of-experts и в общей сложности содержит триллион параметров, из которых во время инференса активируются 49 миллиардов. Это больше, чем у Large 3, которая содержала 675 миллиардов параметров, из которых активными были 41 миллиард. Mistral заявляет, что обучила модель с нуля примерно за два месяца, используя около 4 000 графических процессоров Nvidia Grace Blackwell в своих европейских центрах обработки данных.
Частичная активация снижает вычислительные затраты во время инференса, но не отменяет высоких требований к эксплуатации: для запуска полной контрольной точки потребуется конфигурация с несколькими GPU. Модель поддерживает мультимодальные входные данные, генерирует текст и работает более чем со 160 языками, включая все официальные языки Европейского союза. Среди других упомянутых вариантов использования — финансовый анализ, спутниковые и аэрофотоснимки, технические чертежи и проектирование микросхем.
Что означает публикация весов?
Аргументация Mistral в сфере кибербезопасности основана на предоставлении командам большего контроля над моделью. Работа внутри собственной инфраструктуры может позволить анализировать код или тестировать системы, сохраняя конфиденциальные данные локально, вместо зависимости от ограничений размещённой модели. Однако лицензия будет специальной, а не Apache 2.0, использовавшейся для Large 3.
Публикация весов также меняет характер контроля доступа: после копирования модели в интернете отозвать доступ к ней будет непросто. Поэтому ответственность за средства контроля и защитные барьеры в большей степени перейдёт к организациям, которые её запускают, вместо того чтобы оставаться только у поставщика API.
Многообещающие результаты, но не лидерство
Mistral заявляет о результате 62% в тесте DeepSWE v1.1 по сравнению с 61% у GLM-5.3, однако актуальная таблица лидеров ставит GLM-5.3 и Kimi K3 примерно на 69% при использовании их лучших опубликованных конфигураций, тогда как результаты GPT-6 Astra, Gemini 3.8 Flash и Claude Opus 5 находятся примерно на уровне 74%.
Large 4 также достигла 15% успешного выполнения задач в Harvey’s Legal Agent Benchmark и 67% в Finch согласно тестам Mistral, сравнявшись с DeepSeek V4 Pro 0813 и опередив GLM-5.3, показавшую 65%. Независимых результатов для этих конфигураций пока нет. Поэтому текущие цифры указывают на конкурентоспособную модель, но не на подтверждённого лидера. Главным испытанием после публикации весов станет то, насколько хорошо она сохранит свои показатели при работе с задачами и инфраструктурой, которые не контролируются Mistral.