Inteligência artificial

A Microsoft lança um modelo de decisão no Foundry baseado no Qwen em vez de um modelo da OpenAI

A Microsoft lançou o modelo Microsoft-Decision-1 para tomar decisões em aplicações, agentes e fluxos de trabalho, após treiná-lo com o Qwen3.5-9B, da Alibaba. O modelo está disponível por 0,042 dólar por milhão de tokens de entrada, com saídas gratuitas, mas atualmente não oferece suporte a imagens nem pesos abertos.

2026-10-10
4 min de leitura
5 visualizações
certi.news Editorial Team
A Microsoft lança um modelo de decisão no Foundry baseado no Qwen em vez de um modelo da OpenAI

A Microsoft lançou o modelo Microsoft-Decision-1 na plataforma Foundry, apenas três dias depois de a OpenAI disponibilizar a API Decisions para desenvolvedores em versão beta pública. Ao contrário do que a proximidade entre as duas empresas poderia sugerir, o modelo da Microsoft foi inicialmente treinado com o Qwen3.5-9B, da Alibaba, e a empresa anunciou que pretende reconstruí-lo posteriormente com seus próprios modelos MAI e com modelos da OpenAI.

O modelo tem como objetivo adicionar capacidades de tomada de decisão a aplicações existentes, agentes e fluxos de trabalho, como avaliar resultados, escolher o modelo adequado ou determinar a próxima etapa de um processo automatizado. A Microsoft o disponibiliza no Foundry por 0,042 dólar por milhão de tokens de entrada, enquanto os tokens de saída são gratuitos; esse é o mesmo preço cobrado pela TypeSafe pelo modelo Jev.

Testes internos da Microsoft

A Microsoft afirma que o primeiro usuário do modelo é a própria empresa. O Xbox Research o testou para classificar mais de 10 mil itens de feedback de jogadores, a equipe do Copilot o utilizou para avaliar conversas e respostas de agentes, enquanto engenheiros de plantão recorreram a ele para extrair contexto durante incidentes em andamento. A Microsoft Discovery também o utilizou para avaliar experimentos antes que um agente replanejasse sua tarefa.

Segundo os números da empresa, o Decision-1 foi mais de 14 vezes mais rápido que o GPT-6 Sol em um teste relacionado ao Xbox e alcançou uma consistência 46 vezes maior em um teste da Discovery. O material não esclarece os detalhes metodológicos dessas comparações; portanto, não é possível considerar os números um julgamento geral sobre o desempenho do modelo fora desses cenários.

Por que esta notícia é importante?

Os modelos de decisão estão caminhando para desempenhar o papel de uma camada de controle de baixo custo entre a aplicação e os modelos generativos maiores. Essa camada se torna importante quando o agente precisa escolher um modelo, uma ferramenta ou um caminho de execução muitas vezes, pois o custo de cada decisão pode se acumular com o tráfego das solicitações generativas associadas.

A Microsoft tem um incentivo adicional para desenvolver internamente esse tipo de modelo, especialmente com os planos do GitHub Copilot de decidir se algumas tarefas devem ser executadas no dispositivo ou enviadas para modelos na nuvem. No entanto, a empresa não confirmou se o Decision-1 participará efetivamente das decisões do Copilot, nem revelou o que é enviado para a nuvem.

Limitações de compatibilidade e mídia

A lista do Foundry informa que o Decision-1 recebe até 32.768 tokens de texto e retorna os resultados no formato JSON, mas não oferece suporte a imagens. Isso o coloca em um escopo mais limitado que a Decisions API da OpenAI e o Clef, da Cloudflare, que utiliza um tokenizador visual.

A Microsoft também não anunciou a disponibilização dos pesos do modelo, enquanto a Cloudflare lançou o modelo Clef sob a licença Apache 2.0. AWS, Upstage e Ollama adotaram a interface da TypeSafe chamada System One como uma interface comum nesse campo, mas a Microsoft não confirmou que o Decision-1 seja totalmente compatível com ela, embora seu exemplo de código no Foundry chame um endpoint denominado /systemone.

Confiança não significa resistência à desinformação

A Microsoft afirma que as probabilidades do modelo são calibradas; isto é, uma previsão com probabilidade de 90% deveria estar correta em aproximadamente nove de cada dez casos representativos. No entanto, recomenda que os clientes verifiquem a calibração usando seus próprios dados.

O estudo JevOut indica por que essa ressalva é importante: adições curtas e redigidas de forma natural fizeram o modelo Jev inverter 312 de 508 decisões inicialmente corretas, enquanto o modelo atribuiu uma probabilidade de pelo menos 70% à resposta incorreta em 229 casos. Já o teste da Microsoft com seu modelo incluiu oito tipos de alterações, como reordenar as opções e reformular a descrição, e modificou 1,3% das respostas em média. Contudo, o estudo JevOut não testou o Decision-1; portanto, esse resultado não comprova como o modelo lidará com entradas concebidas para induzi-lo ao erro.

Fonte da notícia
The New Stack - Software Development
Abrir fonte original ↗
c
Autor

certi.news Editorial Team

Na mesma categoria

Você também pode gostar

Ver todas as notícias