Snowflake ha añadido la función de enrutamiento dinámico de modelos a la puerta de enlace Cortex AI Gateway, lo que permite a los equipos empresariales elegir el modo «auto» en lugar de fijar un único modelo para todas las tareas. Al activar esta opción, la plataforma intenta determinar el modelo que ofrece el equilibrio más adecuado entre la calidad de la respuesta y su coste para cada consulta, en lugar de enviar siempre las preguntas sencillas al modelo más potente y caro.
Snowflake afirmó que este mecanismo redujo el coste de los tokens hasta tres veces en algunas cargas de trabajo, según pruebas internas realizadas por la empresa. El resultado no representa una garantía general para todos los entornos, pero ilustra el problema que pretende abordar la función: ejecutar un gran número de agentes inteligentes puede hacer que la selección manual de modelos se convierta en una fuente acumulativa de costes, especialmente cuando los modelos avanzados se encargan de tareas que modelos más sencillos podrían realizar.
¿Cómo determina el sistema el modelo adecuado?
El mecanismo de enrutamiento, según explicó Baris Gultekin, vicepresidente de inteligencia artificial de Snowflake, se basa en dos vías. En la primera, se utiliza inicialmente un modelo pequeño dentro de lo que la empresa denomina «modo asesor». Si el modelo no puede completar la tarea, invoca un modelo más grande como herramienta y continúa trabajando a partir de ahí.
La segunda vía utiliza un clasificador entrenado con el historial de consultas anteriores para identificar las preguntas directas y dirigirlas automáticamente a modelos más sencillos. El enrutamiento automático sigue siendo opcional: el cliente puede fijar un modelo concreto o limitar la selección a un único modelo o a un conjunto específico de modelos. Snowflake no cobra una tarifa independiente por la decisión de enrutamiento, porque el precio de sus servicios de inteligencia artificial depende del uso de tokens; por tanto, elegir un modelo menos costoso reduce la factura.
El enrutamiento está vinculado a la gobernanza y al contexto
Cortex AI Gateway, que Snowflake lanzó en julio de 2026, proporciona una capa de gobernanza para el tráfico de modelos y agentes. La empresa afirma que los controles de acceso no se aplican únicamente a los datos, sino también a los modelos y agentes: los roles determinan qué modelos están permitidos, y un agente puede quedar restringido a permisos más limitados que los del usuario que lo invoca.
Los modelos abiertos también pueden ejecutarse desde la región del cliente para cumplir los requisitos de residencia de datos. Según Gultekin, las operaciones de inferencia, tanto para modelos abiertos como propietarios, permanecen dentro de los límites de seguridad de Snowflake en lugar de dirigirse a un proveedor externo. Este punto cobra relevancia al utilizar modelos de origen no estadounidense, como DeepSeek-V4-Flash y GLM-5.3, ambos desarrollados en China.
La adquisición de Natoma por parte de Snowflake añade más de 100 conectores para MCP con acceso controlado y gobernado. Esto permite, por ejemplo, conceder a un agente permiso únicamente para leer el correo electrónico en lugar de otorgarle permisos más amplios sobre la herramienta conectada.
¿Por qué importa este avance?
Snowflake considera que proporcionar el contexto de antemano permite a los modelos más baratos completar tareas que antes requerían un modelo más potente. Sin suficiente contexto, el modelo puede verse obligado a explorar los datos, escribir y probar consultas SQL, buscar y volver a intentarlo. En cambio, las herramientas Horizon Context y Cortex Sense preparan este contexto de antemano, y la memoria del agente también se integra en las consultas posteriores, lo que reduce la necesidad de resolver el mismo problema desde cero cada vez.
El paso se produce en el marco de una competencia más amplia que incluye a Databricks mediante Smart Routing en Unity AI Gateway, a Nvidia mediante Switchyard, anunciado el 11 de agosto, además de OpenRouter, LiteLLM y Portkey, así como las puertas de enlace de proveedores de servicios en la nube como Azure AI Foundry.
Según Sanjeev Mohan, fundador de SanjMo, el elemento diferenciador de Snowflake no reside únicamente en el enrutamiento, sino en mantenerlo dentro de los límites de los datos sujetos a gobernanza y vincularlo a los controles de acceso, las etiquetas de uso y la asignación de costes a los equipos. En la práctica, este enfoque puede ser más adecuado para las empresas cuyos datos y gobernanza se centran en Snowflake, mientras que los equipos multiplataforma pueden preferir puertas de enlace neutrales que ofrezcan una gama más amplia de modelos y reduzcan la dependencia de un único proveedor.