Snowflake 向 Cortex AI Gateway 添加了动态模型路由功能,使企业团队可以选择“auto”模式,而不是为所有任务固定使用同一个模型。启用该选项后,平台会尝试针对每次查询确定在回答质量与成本之间实现最佳平衡的模型,而不是始终将简单问题发送给最强大、最昂贵的模型。
Snowflake 表示,根据公司开展的内部测试,该机制在部分工作负载下将令牌成本降低了最多三倍。这一结果并不代表适用于所有环境的普遍保证,但它说明了该功能所针对的问题:运行大量智能代理可能使手动选择模型成为不断累积的成本来源,尤其是在高级模型承担了简单模型也能完成的任务时。
系统如何确定合适的模型?
根据 Snowflake 人工智能副总裁 Baris Gultekin 的介绍,这套路由机制依靠两条路径。第一条路径是在公司称为“顾问模式”的机制中,初始使用一个小型模型。如果该模型无法完成任务,就会将更大的模型作为工具调用,并从那里继续工作。
第二条路径使用一个根据过往查询记录训练的分类器,用于识别直接的问题,并自动将其路由至更简单的模型。自动路由仍然是可选项;客户可以固定使用某个模型,或将选择范围限制为一个模型或一组指定模型。Snowflake 不会针对路由决策单独收费,因为其人工智能服务的定价依据是令牌使用量,因此选择成本更低的模型会降低账单。
路由与治理及上下文相关
Snowflake 于 2026 年 7 月推出的 Cortex AI Gateway,为模型和代理流量提供治理层。该公司表示,访问控制不仅涉及数据,也延伸至模型和代理:角色会确定允许使用的模型,代理的权限可以被限制得比调用它的用户权限更窄。
此外,还可以从客户所在区域运行开放模型,以满足数据驻留要求。Gultekin 表示,无论是开放模型还是专有模型,其推理操作都会保留在 Snowflake 的安全边界内,而不是被路由至外部供应商。当使用来源并非美国的模型时,这一点尤为突出,例如 DeepSeek-V4-Flash 和 GLM-5.3,二者均由中国开发。
Snowflake 对 Natoma 的收购交易还增加了 100 多个 MCP 连接器,并提供受控且经过治理的访问权限。例如,这可以让代理仅获得读取电子邮件的权限,而不是获得对已连接工具的更广泛权限。
为什么这一进展很重要?
Snowflake 认为,预先提供上下文能够让成本更低的模型完成过去需要更强大模型才能完成的任务。没有足够上下文时,模型可能需要探索数据、编写并尝试 SQL 查询、进行搜索以及重新尝试。而 Horizon Context 和 Cortex Sense 工具会预先准备这些上下文;同时,代理记忆也会被整合到后续查询中,从而减少每次都从头解决同一问题的需要。
这一步属于更广泛竞争的一部分,参与者包括通过 Unity AI Gateway 中的 Smart Routing 提供相关功能的 Databricks,以及在 8 月 11 日宣布 Switchyard 的 Nvidia,此外还有 OpenRouter、LiteLLM、Portkey,以及 Azure AI Foundry 等云服务供应商的网关。
据 SanjMo 创始人 Sanjeev Mohan 称,Snowflake 的差异化优势并不只在于路由本身,还在于将路由保留在受治理的数据边界内,并将其与访问控制、使用标签以及团队成本占比联系起来。实际上,这种方式可能更适合数据和治理以 Snowflake 为中心的企业;而多平台团队可能更倾向于使用中立网关,以获得更广泛的模型范围并减少对单一供应商的绑定。