OpenAI ha abierto la interfaz Decisions API a los desarrolladores en fase de prueba pública y le ha añadido la capacidad de recibir imágenes para tomar decisiones rápidas a partir de contenido visual. La versión pública funciona con el modelo GPT-6 Luna y permite convertir textos o imágenes en tres tipos de salidas estructuradas: probabilidades sobre la veracidad de una afirmación determinada, una selección de una lista definida y una puntuación numérica que determina la posición de la entrada dentro de un rango.
OpenAI fija el precio de la interfaz en 0,10 dólares por cada millón de tokens de entrada, sin cargos por los tokens de salida ni por las operaciones de lectura y escritura de la memoria caché. Este modelo sitúa el servicio en una posición diferente de la de los modelos de razonamiento generales, ya que la interfaz se centra en emitir rápidamente una decisión concreta en lugar de producir una respuesta extensa.
De los videojuegos a los robots
En una demostración presentada por OpenAI, la interfaz analiza fotogramas de un videojuego en los que aparece un coche desplazándose entre el tráfico y, a continuación, decide si el coche debe cambiar de carril o continuar. La empresa afirma que tomar estas decisiones requiere una fracción del tiempo que un modelo de razonamiento podría necesitar para realizar la misma tarea.
La empresa también muestra el uso de la interfaz con imágenes de cámara de un robot bípedo programable de Hugging Face llamado Microduck. Al combinar Decisions API con el modelo de voz en tiempo real GPT-Live, el sistema puede determinar la posición de una fruta en la imagen y dirigir el robot hacia ella en respuesta a una orden como «sigue la manzana». También puede gestionar una orden más ambigua, como «sigue la fruta». Otros ejemplos incluyen la selección de expresiones para un personaje animado durante una conversación de voz.
Competencia entre modelos alojados y abiertos
El paso de OpenAI no se produce en el vacío. Perplexity ha lanzado el modelo pplx-decider-v1-27b en Hugging Face con licencia Apache 2.0, un modelo ajustado a partir de Qwen3.8-27B. Según la ficha del modelo, obtuvo un 85,71 % en 11 pruebas de referencia, frente al 84,51 % del modelo Jev de TypeSafe, aunque Jev superó a este en seis de las 11 pruebas, entre ellas WinoGrande, BBH y TruthfulQA binary.
Amazon presentó el modelo descargable Strands Decider 2B, basado en Qwen3.5-2B, y afirmó que ocupa el segundo lugar entre los modelos públicos con aproximadamente 2.000 millones de parámetros en el conjunto de datos público JevBench. Por su parte, Cloudflare lanzó los modelos Clef y Clef-flash con pesos abiertos y licencia Apache 2.0, y también ofrece Clef a través del servicio Workers AI. Clef y la interfaz de OpenAI admiten imágenes, mientras que Jev y Strands Decider siguen estando dedicados a los textos.
¿Qué les importa a los desarrolladores?
El cambio más importante no está relacionado únicamente con la incorporación de imágenes, sino también con la forma de desplegar el modelo. La interfaz de OpenAI está disponible como servicio alojado, mientras que Perplexity, Amazon y Cloudflare permiten descargar los pesos y ejecutar los modelos en la infraestructura propia del desarrollador. Por ello, los factores relativos al lugar de ejecución, el control de los datos y el coste operativo se sumarán a la precisión y la velocidad a la hora de elegir un modelo de decisión.
Los resultados presentados siguen estando vinculados a las pruebas de referencia que examinó cada entidad, y el material tampoco ofrece una comparación independiente exhaustiva del tiempo de respuesta, el coste operativo o el rendimiento visual. Según los datos disponibles, Decisions API amplía el uso de los modelos de decisión a aplicaciones visuales e interactivas, pero todavía no determina si la facilidad de un servicio alojado prevalecerá sobre la flexibilidad de la ejecución local.