OpenAI a annoncé GPT-6.1 Sol, une version améliorée de GPT-6 Sol destinée aux tâches combinant hautes performances et faible coût d’exploitation. Selon l’entreprise, le modèle se rapproche de GPT-6 Astra en programmation, en utilisation d’ordinateurs, en analyse de documents et dans les flux de travail professionnels en plusieurs étapes, tandis que ses tarifs standards représentent environ un cinquième de ceux d’Astra.
Une tarification conçue pour une utilisation à grande échelle
Le coût de l’API GPT-6.1 Sol s’élève à 2 dollars par million de jetons en entrée et à 10 dollars par million de jetons en sortie. Les jetons mis en cache coûtent 0,10 dollar par million, soit une remise de 95 % par rapport au tarif d’entrée standard, selon OpenAI. Cela rend le modèle particulièrement adapté aux applications agentiques qui réutilisent le même contexte au fil de requêtes répétées.
Résultats des tests pratiques
Dans le test DeepSWE v1.1, qui mesure des tâches longues d’ingénierie logicielle sur de véritables bases de code, GPT-6.1 Sol a obtenu le même résultat que GPT-6 Astra, mais pour un coût proche du cinquième. Dans le test GDP.pdf consacré à l’analyse de documents professionnels, ses performances se sont rapprochées de celles d’Astra dans des tâches comprenant des tableaux, des graphiques et des fichiers PDF dans des domaines tels que la finance, la santé et le droit.
Dans le test AutomationBench consacré aux flux de travail en plusieurs étapes, le modèle a dépassé Opus 5.5 de 2,2 points et GPT-6 Sol de 4,8 points au niveau de raisonnement intermédiaire. Dans le test OSWorld 2.0 d’utilisation d’ordinateurs, il était inférieur à Astra de 2,1 points, avec un coût par tâche d’environ un septième de celui d’Astra et inférieur à la moitié de celui de GPT-6 Sol dans la configuration mentionnée.
Dans Terminal-Bench Science 0.1, qui mesure l’analyse de données, les simulations et la démonstration de théorèmes, le coût moyen par tâche s’est élevé à 5,47 dollars, contre 23,21 dollars pour Opus 5.5 et 23,80 dollars pour GPT-6 Astra. Astra a toutefois conservé les meilleures performances du test, avec un résultat de 68,1 %.
Précision et limites de sécurité
GPT-6.1 Sol a réduit le taux d’erreurs factuelles à 4,1 %, contre 4,5 % pour GPT-6 Sol et 4 % pour GPT-6 Astra au niveau de raisonnement maximal. OpenAI précise que cette évaluation repose sur des requêtes difficiles présentant une forte probabilité de produire des erreurs et qu’elle ne représente pas l’utilisation habituelle de ChatGPT.
L’entreprise affirme également que le modèle est désormais plus efficace pour informer l’utilisateur lorsque des outils ne fonctionnent pas, éviter les résultats non autorisés et respecter les contraintes explicites. Elle a aussi indiqué que, comme GPT-6 Astra et GPT-6 Sol, il n’a pas tenté de contourner le module de contrôle de sécurité automatisé. La source ne fournit toutefois aucun détail indépendant sur la méthode de vérification de ces affirmations.
Qu’est-ce qui change concrètement ?
OpenAI présente GPT-6.1 Sol comme une option destinée aux applications à grande échelle, pour lesquelles la réduction du coût des jetons peut être plus importante que l’obtention du meilleur résultat possible dans chaque test. Cela concerne les développeurs d’agents logiciels ainsi que les services d’analyse de documents et d’automatisation, mais l’écart de résultats reste lié au type de tâche et au niveau de raisonnement. Le coût inférieur ne constitue donc pas une solution de remplacement universelle à Astra.
Le modèle est disponible pour les abonnés Plus, Pro, Business, Enterprise et Edu via ChatGPT Work et Codex. Les développeurs peuvent également l’utiliser dans l’API OpenAI sous le nom gpt-6.1-sol. Il n’a pas encore été lancé dans l’interface de conversation standard de ChatGPT. OpenAI a également annoncé GPT-6.1 Sol Ultrafast et GPT-6 Astra Ultrafast, en affirmant une vitesse pouvant atteindre huit fois celle d’Astra, tandis que GPT-6.1 Astra, dont le lancement était prévu cette semaine, n’a pas été lancée, dans un contexte de rapports faisant état de préoccupations de sécurité lors de tests internes.