Anthropic et OpenAI ont lancé de nouveaux modèles destinés aux usages professionnels, en combinant amélioration des performances et réduction du coût d’exploitation des modèles. Cette annonce intervient alors que l’efficacité économique et la fiabilité des modèles pour la programmation et les tâches d’entreprise gagnent en importance, parallèlement au débat persistant sur la sécurité des modèles avancés.
Opus 5.5 se concentre sur les tâches complexes
Anthropic a dévoilé le modèle Opus 5.5, qui, selon l’entreprise, améliore la gestion des tâches complexes, la détection et la correction des défauts logiciels, ainsi que l’analyse financière et l’exécution des tâches professionnelles. Les tests de l’entreprise indiquent que le modèle surpasse GPT-6 Astra dans les tâches de programmation agentique des tests Terminal-Bench 4.0 et FrontierCode v1.1 (Main).
Anthropic affirme que le modèle produit des textes plus clairs et qu’il est 85 % moins susceptible de tenter de contourner les limites et les contrôles que les modèles précédents. L’entreprise a également réduit le prix d’un million de jetons d’entrée à 4 dollars, et celui d’un million de jetons de sortie à 20 dollars, contre respectivement 5 dollars et 25 dollars pour le modèle Opus 5.
Trois niveaux de coût différents chez OpenAI
OpenAI a lancé les modèles GPT-6 Sol et GPT-6 Luna, avec des améliorations dans le travail professionnel, la programmation et l’utilisation des ordinateurs. L’entreprise affirme que le coût des deux modèles est inférieur de jusqu’à 50 % aux prix promotionnels des modèles GPT-5.6.
Le prix d’un million de jetons d’entrée de GPT-6 Sol est de 2 dollars, contre 10 dollars pour la sortie. Quant à GPT-6 Luna, le prix d’un million de jetons d’entrée est de 10 cents, et celui d’un million de jetons de sortie de 50 cents. Selon OpenAI, GPT-6 Sol commet environ deux fois moins d’erreurs que le modèle précédent et atteint, en programmation, un niveau de performance comparable à celui de Fable 5.1, à moindre coût.
Les améliorations comprennent également une communication plus claire et la prise en charge du stockage temporaire du contexte des instructions, ce qui permet de réutiliser une plus grande quantité de contexte et d’accélérer les réponses.
Qu’est-ce qui change concrètement ?
Les nouveaux prix offrent aux développeurs et aux entreprises une plus grande latitude pour utiliser les modèles dans des tâches répétitives ou nécessitant de nombreux appels, tandis que les modèles les plus performants ciblent les travaux de programmation, d’analyse et d’exécution agentique. Cependant, les chiffres fournis concernant la supériorité, la précision et la sécurité proviennent des propres tests des entreprises et ne suffisent donc pas, à eux seuls, à établir une supériorité générale dans tous les usages ou environnements.
Améliorations de la sécurité et disponibilité
OpenAI affirme que les modèles GPT-6 sont moins susceptibles de fournir des informations incorrectes sur les résultats des tâches de programmation et qu’ils refusent davantage les tentatives de contournement des mesures de protection lorsqu’ils reçoivent des instructions dangereuses. Les deux entreprises travaillent à proposer des normes que des organismes d’évaluation externes pourraient utiliser pour mesurer l’évolution et la sécurité des modèles, mais on ne sait pas encore si ces propositions deviendront une norme unifiée.
Opus 5.5 est disponible via Claude, ainsi que par l’intermédiaire d’Amazon Web Services, de Google Cloud et de Microsoft Azure. GPT-6 Sol et GPT-6 Luna sont disponibles via ChatGPT Work et Codex pour les clients des forfaits Plus, Pro, Business et Enterprise, tandis que les utilisateurs de l’offre gratuite et les abonnés Go bénéficient uniquement de GPT-6 Luna via l’application de bureau de l’entreprise.