Intelligence artificielle

SpaceXAI dévoile Grok 4.7 pour la programmation et le travail cognitif au prix du modèle précédent

SpaceXAI a annoncé Grok 4.7, présenté comme son modèle le plus puissant pour la programmation et le travail cognitif, tout en conservant le prix et la vitesse de Grok 4.6. Le modèle surpasse certains modèles concurrents dans des tests de programmation, d’ingénierie et de droit, mais il est devancé dans les tâches de terminal et le raisonnement clinique.

2026-09-22
4 min de lecture
77 vues
certi.news
SpaceXAI dévoile Grok 4.7 pour la programmation et le travail cognitif au prix du modèle précédent

SpaceXAI a annoncé le 21 septembre, selon l’heure locale, le modèle d’intelligence artificielle Grok 4.7, qu’elle propose aux entreprises et aux développeurs comme son modèle le plus puissant destiné à la programmation et au travail cognitif. Le modèle est disponible au même prix et à la même vitesse que Grok 4.6, tandis que l’entreprise affirme qu’il est deux fois plus rapide et deux fois moins coûteux que des modèles de la même catégorie.

Qu’est-ce qui a changé dans Grok 4.7 ?

Le modèle repose sur un modèle de base plus grand, avec un entraînement plus long par apprentissage par renforcement et des tâches complexes conçues pour traiter des problèmes dont la résolution peut prendre des heures. Selon SpaceXAI, cela a amélioré la capacité du modèle à vérifier son propre travail et à gérer de longs contextes. Il a également été entraîné à comprendre nativement le fonctionnement de l’agent logiciel de l’entreprise, Grok Bot, afin d’améliorer ses performances dans les tâches conversationnelles et le travail cognitif général.

Les améliorations concernent la création de documents et de présentations, ainsi que l’exécution de tâches spécialisées simulant le travail des avocats, des infirmiers et des analystes financiers. Dans le test GDPval, Grok 4.7 a obtenu un score Elo de 1695, devant Grok 4.6 avec 1605 et GPT-6 Astra avec 1542, mais il est resté derrière Fable 5.1, qui a obtenu 1735.

Des résultats avancés dans certains tests, mais pas dans tous

Dans CursorBench 4.0, consacré aux tâches de programmation longues, Grok 4.7 a obtenu 46,3 %, contre 40,4 % pour Grok 4.6 et 41,7 % pour GPT-5.6 Sol, tandis que Fable 5.1 est arrivé en tête avec 51,8 %. Le modèle a également obtenu le meilleur résultat parmi les modèles comparés dans EEBench pour l’ingénierie électrique, avec 64,0 %, et dans le Harvey Legal Agent Benchmark pour les tâches juridiques, avec 19,6 %.

Mais cette supériorité n’était pas générale : dans Terminal-Bench 4.0, consacré aux tâches de terminal longues, il a obtenu 38,0 %, contre 57,9 % pour Fable 5.1. Dans HealthBench Professional, consacré au raisonnement clinique, il a atteint 56,7 %, derrière GPT-5.6 Sol à 60,5 % et Fable 5.1 à 62,1 %. Ces résultats signifient que le choix du modèle restera lié au type de tâche, et non au classement général ou au seul prix.

Prix et disponibilité

Le prix de l’API Grok commence à deux dollars par million de tokens d’entrée et six dollars par million de tokens de sortie. À titre de comparaison, GPT-5.6 Sol coûte quatre dollars pour l’entrée et 20 dollars pour la sortie, tandis que Fable 5.1 coûte dix dollars pour l’entrée et 50 dollars pour la sortie. SpaceXAI propose une version plus rapide, dont la vitesse est deux fois supérieure à celle de la version de base, avec un prix également doublé.

Grok 4.7 est devenu disponible le même jour via Cursor et l’outil de programmation Grok Build, ainsi que via l’API Grok, les outils de programmation de fournisseurs tiers, les routeurs de modèles et les plateformes de cloud computing.

Sécurité et accès aux outils de test

SpaceXAI a déclaré avoir entièrement repensé les mécanismes de protection et amélioré la résistance aux tentatives de contournement des restrictions ainsi que le refus des demandes dangereuses. Le modèle a obtenu 62,4 % au test de sécurité biologique de LatchBio, soit le meilleur résultat parmi les modèles comparés par l’entreprise. Dans HackerBench v0.3, le modèle n’a autorisé que 3,3 % des demandes à double usage et présentant des risques cybernétiques, l’entreprise affirmant toutefois qu’il ne bloque pas la majorité des tâches de sécurité légitimes.

SpaceXAI a également commencé à accorder à certains partenaires de la cybersécurité un accès sur invitation aux fonctions de l’équipe rouge à des fins de recherche défensive. Ces affirmations restent liées aux tests choisis par l’entreprise et à ses méthodologies, tandis que la variation des résultats entre les domaines impose aux équipes de développement et aux entreprises d’évaluer le modèle en fonction des cas d’utilisation réels.

Source de l’actualité
ITmedia NEWS Japan
Ouvrir la source originale ↗
c
Auteur

certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités