A Snowflake adicionou o recurso de roteamento dinâmico de modelos ao Cortex AI Gateway, permitindo que as equipes corporativas escolham o modo «auto» em vez de fixar um único modelo para todas as tarefas. Quando essa opção é ativada, a plataforma tenta identificar o modelo que oferece o equilíbrio mais adequado entre a qualidade e o custo da resposta para cada consulta, em vez de enviar sempre as perguntas simples ao modelo mais potente e caro.
A Snowflake afirmou que esse mecanismo reduziu o custo dos tokens em até três vezes em algumas cargas de trabalho, com base em testes internos realizados pela empresa. O resultado não representa uma garantia geral para todos os ambientes, mas esclarece o problema que o recurso pretende resolver: executar um grande número de agentes inteligentes pode tornar a seleção manual de modelos uma fonte acumulada de custos, especialmente quando modelos avançados assumem tarefas que modelos mais simples poderiam executar.
Como o sistema determina o modelo adequado?
O mecanismo de roteamento, segundo explicou Baris Gultekin, vice-presidente de inteligência artificial da Snowflake, baseia-se em dois caminhos. No primeiro, um modelo pequeno é usado inicialmente dentro do que a empresa chama de «modo consultor». Se o modelo não conseguir concluir a tarefa, ele chama um modelo maior como ferramenta e continua o trabalho a partir daí.
O segundo caminho usa um classificador treinado com o histórico de consultas anteriores para identificar perguntas diretas e encaminhá-las automaticamente a modelos mais simples. O roteamento automático continua sendo opcional; o cliente pode fixar um modelo específico ou limitar a seleção a um único modelo ou a um conjunto definido de modelos. A Snowflake não cobra uma tarifa separada pela decisão de roteamento, porque a precificação de seus serviços de inteligência artificial é baseada no uso de tokens. Assim, escolher um modelo de menor custo reduz a fatura.
O roteamento está ligado à governança e ao contexto
O Cortex AI Gateway, lançado pela Snowflake em julho de 2026, oferece uma camada de governança para o tráfego de modelos e agentes. A empresa afirma que os controles de acesso não se aplicam apenas aos dados, mas também aos modelos e agentes: as funções determinam quais modelos são permitidos, e o agente pode ser limitado a permissões mais restritas que as do usuário que o invoca.
Também é possível executar modelos abertos na região do cliente para atender aos requisitos de residência de dados. Segundo Gultekin, as operações de inferência, tanto para modelos abertos quanto proprietários, permanecem dentro dos limites de segurança da Snowflake, em vez de serem encaminhadas a um provedor externo. Esse ponto se destaca ao usar modelos de origem não americana, como DeepSeek-V4-Flash e GLM-5.3, ambos desenvolvidos na China.
A aquisição da Natoma pela Snowflake acrescenta mais de 100 conectores para MCP, com acesso controlado e governado. Isso permite, por exemplo, conceder a um agente apenas permissão de leitura de e-mails, em vez de conceder permissões mais amplas sobre a ferramenta conectada.
Por que esse desenvolvimento é importante?
A Snowflake considera que fornecer o contexto antecipadamente torna os modelos mais baratos capazes de executar tarefas que antes exigiam um modelo mais potente. Sem contexto suficiente, o modelo pode precisar explorar os dados, escrever consultas SQL, testá-las, pesquisar e tentar novamente. Já as ferramentas Horizon Context e Cortex Sense preparam esse contexto antecipadamente, enquanto a memória do agente é integrada às consultas posteriores, reduzindo a necessidade de resolver o mesmo problema desde o início a cada vez.
A iniciativa ocorre em meio a uma concorrência mais ampla que inclui a Databricks, com o Smart Routing no Unity AI Gateway; a Nvidia, com o Switchyard, anunciado em 11 de agosto; além de OpenRouter, LiteLLM, Portkey e gateways de provedores de serviços de nuvem, como o Azure AI Foundry.
Segundo Sanjeev Mohan, fundador da SanjMo, o diferencial da Snowflake não está apenas no roteamento, mas em mantê-lo dentro dos limites dos dados governados e conectá-lo aos controles de acesso, às etiquetas de uso e à atribuição de custos às equipes. Na prática, essa abordagem pode ser mais adequada para empresas cujos dados e cuja governança estão centrados na Snowflake, enquanto equipes que operam em várias plataformas podem preferir gateways neutros que ofereçam uma gama mais ampla de modelos e reduzam a dependência de um único provedor.