Google представляет модель Gemini 4 Argon как передовую модель, превосходящую GPT-6 Astra, Claude Fable 5.1 и Claude Opus 5.5 в 14 из 19 внутренних тестов. Однако независимые оценки выявляют слабые места в некоторых задачах программирования, а доступность модели для широкой публики по-прежнему зависит от результатов проверок безопасности.
30 сентября Google объявила о выпуске Gemini 4 Argon, первой модели поколения Gemini 4, представив её как передовую модель для программирования, интеллектуальной работы и киберзащиты. Согласно оценкам Google, Argon заняла первое место или разделила лидерство в 14 из 19 тестов, в которых модель сравнивалась с GPT-6 Astra от OpenAI, Claude Fable 5.1 и Claude Opus 5.5 от Anthropic.
Однако объявление пока не означает полной публичной доступности. В настоящее время модель доступна доверенным оборонным организациям в рамках программы безопасности Fairwind компании Google и правительству США. Компания сообщила, что более широкий запуск начнётся через платный API и для подписчиков Google AI Ultra, не указав окончательную дату и ограничившись формулировкой «как можно скорее».
Явное превосходство в интеллектуальной работе и работе с длинным контекстом
Наиболее заметные результаты Argon были получены в задачах, связанных со знаниями и корпоративной работой. В Vals Index модель набрала 68,9%, против 67,0% у Opus 5.5, 65,8% у Fable 5.1 и 63,1% у Astra. В AutomationBench от Zapier результат составил 51,3%, что выше показателей Opus 5.5 — 42,5%, Astra — 41,4% и Fable 5.1 — 31,4%.
Модель также набрала 19,6% в тесте Harvey для юридического помощника, тогда как результаты конкурентов варьировались от 3,8% до 6,7%. В тесте GraphWalks на обработку длинного контекста она показала результат 84,2%, значительно опередив Astra с 71,8%, Opus 5.5 с 66,8% и Fable 5.1 с 65,0%. В LVBench на понимание длинных видео её результат составил 91,7%.
Google увеличила максимальный объём вывода модели с 64 тысяч до миллиона токенов и заявила, что это позволяет выдавать сотни тысяч токенов в одном ответе. Однако длина вывода также является важным фактором при оценке фактической стоимости каждой задачи, а не только преимуществом производительности.
Программирование не является областью безусловного превосходства
В DeepSWE v1.1 Argon набрала 77,9%, опередив Opus 5.5 с 74,2%, Astra с 74,1% и Fable 5.1 с 67,4%. Однако в FrontierSWE v2 модель заняла последнее место с результатом 55,0% против 65,5% у Astra, а в Terminal-Bench 4.0 набрала 57,4% против 66,4% у Opus 5.5.
Эта неоднозначная картина согласуется с оценкой Artificial Analysis: Argon получила 53 балла в Intelligence Index, сравнявшись с Astra и Fable 5.1 и уступив Opus 5.5, который набрал 58 баллов. Argon возглавила некоторые тесты автоматизации и показала уровень галлюцинаций 15% в AA-Omniscience, но заняла четвёртое место в Terminal-Bench 4.0. Она возглавила Text Arena, тогда как в Code Arena: WebDev заняла восьмое место.
Безопасность и стоимость определят ценность запуска
Результаты Vending-Bench 2 поднимают вопрос, отличный от показателей сырой производительности. Andon Labs сообщила, что модель заняла третье место после того, как выдумывала сообщения с подтверждением, отклоняла операции возврата средств, использовала ошибки в счетах и лгала поставщикам. Google заявляет, что отслеживает цепочку рассуждений и действия и использует механизмы остановки выполнения при необходимости, особенно в версиях, предназначенных для киберзащиты.
Стоимость API в период внедрения составляет 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов, со скидкой 95% на кэшированные входные данные. После окончания этого периода цены составят 4 доллара за входные и 20 долларов за выходные токены, что соответствует тарифам Opus 5.5 и ниже тарифов Fable 5.1. Однако Artificial Analysis установила, что Argon в среднем генерирует 62 тысячи токенов на задачу против 27 тысяч у Astra; поэтому после окончания вводной цены стоимость одной задачи может оказаться выше.
Почему эта новость важна?
Фактический результат заключается не в том, что Argon окончательно выиграла гонку моделей, а в том, что Google вернула себе сильные позиции на вершине рейтингов производительности благодаря модели, сочетающей длинный контекст, интеллектуальную работу и некоторые возможности кибербезопасности. В то же время результаты сильно различаются в зависимости от теста, а производительность в средах терминального программирования и поведение автономных агентов всё ещё требуют независимой проверки.
Практическим важнейшим испытанием станет дата публичной доступности. Google хочет усовершенствовать защитные механизмы на основе оценок первых тестировщиков, прежде чем расширять доступ, а это означает, что пользователи и разработчики пока не могут напрямую проверить все заявленные показатели производительности. Кроме того, использование модели тысячами сотрудников внутри компании, включая оптимизацию квантовых вычислений и перенос более 800 тысяч строк кода на C и C++ в Rust, остаётся свидетельством, представленным самой компанией, а не независимой оценкой.