21 сентября по местному времени SpaceXAI объявила о выпуске модели искусственного интеллекта Grok 4.7, которую представляет компаниям и разработчикам как свою самую мощную модель для программирования и интеллектуальной работы. Модель доступна по той же цене и с той же скоростью, что и Grok 4.6, при этом компания заявляет, что она вдвое быстрее и в два раза дешевле моделей того же класса.
Что изменилось в Grok 4.7?
Модель основана на более крупной базовой модели, обучалась дольше с использованием обучения с подкреплением и на составных задачах, предназначенных для решения вопросов, выполнение которых может занимать часы. По данным SpaceXAI, это повысило способность модели проверять собственную работу и обрабатывать длинные контексты. Кроме того, модель обучали нативному пониманию принципов работы программного агента компании Grok Bot, чтобы повысить её эффективность в диалоговых задачах и общей интеллектуальной работе.
Улучшения включают создание документов и презентаций, а также выполнение специализированных задач, имитирующих работу юристов, медсестёр и финансовых аналитиков. В тесте GDPval Grok 4.7 получила результат Elo 1695, опередив Grok 4.6 с результатом 1605 и GPT-6 Astra с результатом 1542, но уступив Fable 5.1, которая набрала 1735.
Высокие результаты в некоторых тестах, но не во всех
В CursorBench 4.0 для длительных программных задач Grok 4.7 набрала 46,3% против 40,4% у Grok 4.6 и 41,7% у GPT-5.6 Sol, тогда как Fable 5.1 возглавила рейтинг с результатом 51,8%. Модель также показала самый высокий результат среди сопоставляемых моделей в EEBench по электротехнике — 64,0%, и в Harvey Legal Agent Benchmark по юридическим задачам — 19,6%.
Однако превосходство не было всеобъемлющим: в Terminal-Bench 4.0 для длительных задач с терминалом модель набрала 38,0% против 57,9% у Fable 5.1. В HealthBench Professional для клинического рассуждения результат составил 56,7%, что ниже показателей GPT-5.6 Sol — 60,5% — и Fable 5.1 — 62,1%. Эти результаты означают, что выбор модели по-прежнему будет зависеть от типа задачи, а не только от общего рейтинга или цены.
Цена и доступность
Цена интерфейса Grok API начинается с двух долларов за миллион входных токенов и шести долларов за миллион выходных токенов. Для сравнения, цена GPT-5.6 Sol составляет четыре доллара за входные токены и 20 долларов за выходные, тогда как цена Fable 5.1 — 10 долларов за входные и 50 долларов за выходные токены. SpaceXAI предлагает также более быструю версию, скорость которой вдвое выше базовой, при этом цена также удваивается.
Grok 4.7 стала доступна в тот же день через Cursor и инструмент программирования Grok Build, а также через Grok API, сторонние инструменты программирования, маршрутизаторы моделей и облачные вычислительные платформы.
Безопасность и доступ к инструментам тестирования
SpaceXAI заявила, что полностью переработала механизмы защиты, улучшив устойчивость к попыткам обхода ограничений и отказам от опасных запросов. Модель набрала 62,4% в тесте безопасности LatchBio в области биологии — это самый высокий результат среди моделей, сравнивавшихся компанией. В HackerBench v0.3 модель пропустила лишь 3,3% запросов с двойным назначением и кибернетическими рисками; при этом компания заявляет, что она не блокирует большинство законных задач в сфере безопасности.
SpaceXAI также начала предоставлять некоторым партнёрам по кибербезопасности доступ по приглашениям к функциям красной команды для целей оборонных исследований. Эти заявления по-прежнему связаны с тестами, выбранными компанией, и её методиками, а различия в результатах между областями требуют от команд разработчиков и бизнеса оценивать модель с учётом фактических сценариев использования.