SpaceXAIは現地時間9月21日、AIモデル「Grok 4.7」を発表した。同社は企業や開発者に対し、プログラミングと知的業務に特化した最も強力なモデルとして提供する。モデルはGrok 4.6と同じ価格と速度で利用できる一方、同社によれば、同じカテゴリーのモデルと比べて2倍速く、コストは半分である。
Grok 4.7で何が変わったのか?
このモデルは、より大規模な基盤モデルを採用し、完了まで数時間かかる可能性のある問題に対処するために設計された、より長時間の強化学習と複合タスクによって訓練されている。SpaceXAIによれば、これによりモデルの自己作業レビュー能力と長いコンテキストへの対応能力が向上した。また、同社のソフトウェアエージェント「Grok Bot」の動作メカニズムを本質的に理解するよう訓練され、対話型タスクと一般的な知的業務での性能向上が図られた。
改善には、文書やプレゼンテーションの作成に加え、弁護士、看護師、金融アナリストの業務を模した専門タスクの遂行能力も含まれる。GDPvalテストでは、Grok 4.7は1695のEloスコアを記録し、Grok 4.6の1605およびGPT-6 Astraの1542を上回ったが、1735を記録したFable 5.1には及ばなかった。
一部のテストでは先進的な結果、すべてではない
長時間のコーディングタスクを対象とするCursorBench 4.0では、Grok 4.7が46.3%を記録したのに対し、Grok 4.6は40.4%、GPT-5.6 Solは41.7%だった。一方、Fable 5.1が51.8%で首位となった。また、電気工学向けEEBenchでは64.0%、法律タスク向けHarvey Legal Agent Benchmarkでは19.6%を記録し、比較対象モデルの中で最高成績を収めた。
しかし、優位性は全面的なものではなかった。長時間のターミナルタスク向けTerminal-Bench 4.0では38.0%にとどまり、Fable 5.1の57.9%を下回った。臨床推論向けHealthBench Professionalでは56.7%で、GPT-5.6 Solの60.5%とFable 5.1の62.1%に後れを取った。これらの結果は、モデルの選択が総合順位や価格だけでなく、タスクの種類にも左右され続けることを意味する。
価格と提供状況
Grok APIの料金は、入力100万トークン当たり2ドル、出力100万トークン当たり6ドルから始まる。比較すると、GPT-5.6 Solは入力が4ドル、出力が20ドルで、Fable 5.1は入力が10ドル、出力が50ドルである。SpaceXAIは、基本版の2倍の速度で動作する高速版も提供しており、価格も同じく2倍になる。
Grok 4.7は同日、CursorとコーディングツールのGrok Buildで利用可能になったほか、Grok API、外部企業のコーディングツール、モデルルーター、クラウドコンピューティングプラットフォームでも利用できる。
安全性とテストツールへのアクセス
SpaceXAIは、安全保護の仕組みを全面的に再設計し、制約を破ろうとする試みへの耐性と危険な要求の拒否能力を向上させたと述べた。生物学分野の安全性に関するLatchBioテストでは62.4%を記録し、同社が比較したモデルの中で最高の成績となった。HackerBench v0.3では、デュアルユースの要求およびサイバーリスクを含む要求を通過させた割合はわずか3.3%だったが、同社は正当なセキュリティ業務の大半を遮断していないと述べている。
SpaceXAIはまた、防御研究を目的として、一部のサイバーセキュリティパートナーにレッドチーム機能への招待制アクセスを提供し始めた。これらの主張は、同社が選択したテストとその方法論に関連するものであり、分野間で結果にばらつきがあることから、開発チームや企業は実際のユースケースに基づいてモデルを評価する必要がある。