Intelligence artificielle

OpenAI ouvre l’interface Decisions API et ajoute l’analyse d’images pour prendre des décisions rapides

OpenAI a fait passer l’interface Decisions API en phase de test public, avec la prise en charge des images et la production de décisions structurées sous forme de probabilités, de choix ou de scores. Cette initiative intervient dans un contexte de concurrence avec Perplexity, Cloudflare et Amazon, avec une différence essentielle : plusieurs alternatives permettent d’exécuter les modèles localement.

2026-10-07
4 min de lecture
1 vues
certi.news Editorial Team
OpenAI ouvre l’interface Decisions API et ajoute l’analyse d’images pour prendre des décisions rapides

OpenAI a ouvert l’interface Decisions API aux développeurs dans le cadre d’une phase de test public et lui a ajouté la capacité de recevoir des images afin de prendre rapidement des décisions à partir de contenus visuels. La version publique fonctionne avec le modèle GPT-6 Luna et permet de convertir des textes ou des images en trois types de sorties structurées : des probabilités concernant la véracité d’une affirmation donnée, un choix parmi une liste définie et un score numérique indiquant la position de l’entrée dans une plage.

OpenAI facture l’interface 0,10 dollar par million de tokens d’entrée, sans frais pour les tokens de sortie ni pour les opérations de lecture et d’écriture de la mémoire cache. Ce modèle place le service dans une catégorie différente de celle des modèles de raisonnement généralistes : l’interface se concentre sur la production rapide d’une décision précise plutôt que sur la génération d’une réponse détaillée.

Des jeux aux robots

Dans une démonstration présentée par OpenAI, l’interface analyse des images d’un jeu vidéo montrant une voiture se déplaçant dans la circulation, puis détermine si la voiture doit changer de voie ou continuer. L’entreprise affirme que la prise de ces décisions ne demande qu’une fraction du temps qu’un modèle de raisonnement pourrait nécessiter pour accomplir la même tâche.

L’entreprise montre également l’utilisation de l’interface avec des images capturées par la caméra d’un robot bipède programmable de Hugging Face appelé Microduck. En combinant Decisions API avec le modèle vocal en temps réel GPT-Live, le système peut déterminer la position d’un fruit dans l’image et guider le robot vers celui-ci en réponse à une instruction telle que « suis la pomme ». Il peut également gérer une instruction plus ambiguë comme « suis le fruit ». Parmi les autres exemples figure la sélection d’expressions pour un personnage animé au cours d’une conversation vocale.

Une concurrence entre modèles hébergés et modèles ouverts

L’initiative d’OpenAI ne survient pas dans le vide. Perplexity a lancé sur Hugging Face le modèle pplx-decider-v1-27b, sous licence Apache 2.0. Il s’agit d’un modèle affiné à partir de Qwen3.8-27B. Selon la fiche du modèle, il a obtenu 85,71 % sur 11 critères, contre 84,51 % pour le modèle Jev de TypeSafe, Jev ayant pris l’avantage sur six des 11 critères, notamment WinoGrande, BBH et TruthfulQA binary.

Amazon a présenté le modèle téléchargeable Strands Decider 2B, fondé sur Qwen3.5-2B, et a déclaré qu’il occupait la deuxième place parmi les modèles publics d’environ deux milliards de paramètres sur l’ensemble public JevBench. Cloudflare a pour sa part lancé les deux modèles Clef et Clef-flash, avec des poids ouverts et une licence Apache 2.0, tout en proposant également Clef par l’intermédiaire du service Workers AI. Clef et l’interface d’OpenAI prennent en charge les images, tandis que Jev et Strands Decider restent consacrés aux textes.

Qu’est-ce qui compte pour les développeurs ?

Le changement le plus important ne concerne pas uniquement l’ajout des images, mais aussi la manière de déployer le modèle. L’interface d’OpenAI est disponible sous la forme d’un service hébergé, tandis que Perplexity, Amazon et Cloudflare permettent de télécharger les poids et d’exécuter les modèles sur l’infrastructure privée du développeur. Le choix d’un modèle de décision prendra donc en compte le lieu d’exécution, le contrôle des données et le coût d’exploitation, en plus de la précision et de la rapidité.

Les résultats présentés restent liés aux critères évalués par chaque acteur, et l’article ne fournit pas de comparaison indépendante et exhaustive du temps de réponse, du coût d’exploitation ou des performances visuelles. Au vu des données disponibles, Decisions API étend l’utilisation des modèles de décision aux applications visuelles et interactives, mais il n’est pas encore établi que la simplicité d’un service hébergé l’emportera sur la flexibilité de l’exécution locale.

Source de l’actualité
The New Stack - Software Development
Ouvrir la source originale ↗
c
Auteur

certi.news Editorial Team

Dans la même catégorie

À lire également

Voir toutes les actualités