A OpenAI abriu a interface Decisions API aos desenvolvedores em fase de teste público e acrescentou a capacidade de receber imagens para tomar decisões rápidas a partir de conteúdo visual. A versão pública funciona com o modelo GPT-6 Luna e permite transformar textos ou imagens em três tipos de saídas estruturadas: probabilidades sobre a veracidade de uma determinada afirmação, uma escolha em uma lista definida e uma pontuação numérica que determina a posição da entrada dentro de um intervalo.
A OpenAI cobra 0,10 dólar por milhão de tokens de entrada pelo uso da interface, sem cobrar pelos tokens de saída nem pelas operações de leitura e gravação da memória temporária. Esse modelo coloca o serviço em uma posição diferente da dos modelos gerais de raciocínio, pois a interface se concentra em emitir rapidamente uma decisão específica, em vez de produzir uma resposta extensa.
Dos jogos aos robôs
Em uma demonstração apresentada pela OpenAI, a interface analisa quadros de um videogame que mostra um carro se deslocando em meio ao trânsito e, em seguida, escolhe se o carro deve mudar de faixa ou continuar. A empresa afirma que tomar essas decisões leva uma fração do tempo que um modelo de raciocínio poderia precisar para executar a mesma tarefa.
A empresa também demonstra o uso da interface com imagens de câmera de um robô bípede programável da Hugging Face chamado Microduck. Ao combinar a Decisions API com o modelo de voz em tempo real GPT-Live, o sistema consegue determinar a posição de uma fruta na imagem e orientar o robô até ela em resposta a um comando como «siga a maçã». Ele também pode lidar com um comando mais ambíguo, como «siga a fruta». Outros exemplos incluem a escolha de expressões para um personagem animado durante uma conversa por voz.
Concorrência entre modelos hospedados e abertos
A iniciativa da OpenAI não ocorre em um vácuo. A Perplexity lançou o modelo pplx-decider-v1-27b no Hugging Face sob a licença Apache 2.0. Trata-se de um modelo ajustado a partir do Qwen3.8-27B. De acordo com o cartão do modelo, ele alcançou 85,71% em 11 critérios, contra 84,51% do modelo Jev, da TypeSafe, embora o Jev tenha superado o outro modelo em seis dos 11 critérios, incluindo WinoGrande, BBH e TruthfulQA binary.
A Amazon apresentou o modelo Strands Decider 2B, que pode ser baixado e é baseado no Qwen3.5-2B. A empresa afirmou que ele ocupa o segundo lugar entre os modelos públicos com cerca de dois bilhões de parâmetros no conjunto público JevBench. Já a Cloudflare lançou os modelos Clef e Clef-flash, com pesos abertos e licença Apache 2.0, além de disponibilizar o Clef pelo serviço Workers AI. O Clef e a interface da OpenAI oferecem suporte a imagens, enquanto o Jev e o Strands Decider permanecem voltados para textos.
O que importa para os desenvolvedores?
A mudança mais importante não está apenas na adição de imagens, mas também na forma de implantação do modelo. A interface da OpenAI está disponível como um serviço hospedado, enquanto Perplexity, Amazon e Cloudflare permitem baixar os pesos e executar os modelos na infraestrutura própria do desenvolvedor. Por isso, aspectos como local de execução, controle dos dados e custo operacional passarão a fazer parte da escolha do modelo de decisão, ao lado da precisão e da velocidade.
Os resultados apresentados continuam vinculados aos critérios testados por cada entidade, e o material também não oferece uma comparação independente abrangente do tempo de resposta, do custo operacional ou do desempenho visual. Com base nos dados disponíveis, a Decisions API amplia o uso de modelos de decisão para aplicações visuais e interativas, mas ainda não determina se a facilidade de um serviço hospedado prevalecerá sobre a flexibilidade da execução local.