Snowflake hat dem Cortex AI Gateway eine Funktion für dynamisches Modell-Routing hinzugefügt. Dadurch können Unternehmen den Modus „auto“ auswählen, anstatt für alle Aufgaben ein einziges Modell festzulegen. Wenn diese Option aktiviert ist, versucht die Plattform, für jede Abfrage das Modell zu bestimmen, das das geeignetste Gleichgewicht zwischen Antwortqualität und Kosten erreicht, anstatt einfache Fragen stets an das leistungsstärkste und teuerste Modell zu senden.
Snowflake zufolge senkte dieser Mechanismus die Token-Kosten bei einigen Workloads um bis zum Dreifachen, basierend auf internen Tests des Unternehmens. Das Ergebnis stellt keine allgemeine Garantie für jede Umgebung dar, verdeutlicht jedoch das Problem, auf das die Funktion abzielt: Der Betrieb einer großen Zahl intelligenter Agenten kann die manuelle Modellauswahl zu einer sich kumulierenden Kostenquelle machen, insbesondere wenn fortschrittliche Modelle Aufgaben übernehmen, die auch einfachere Modelle erledigen könnten.
Wie bestimmt das System das geeignete Modell?
Der Routing-Mechanismus basiert laut Baris Gultekin, Vice President of AI bei Snowflake, auf zwei Pfaden. Beim ersten wird zunächst ein kleines Modell im sogenannten „Beratermodus“ des Unternehmens eingesetzt. Wenn das Modell die Aufgabe nicht abschließen kann, ruft es ein größeres Modell als Werkzeug auf und setzt die Arbeit von dort aus fort.
Der zweite Pfad verwendet einen anhand früherer Abfrageprotokolle trainierten Klassifikator, um direkte Fragen zu erkennen und sie automatisch an einfachere Modelle weiterzuleiten. Das automatische Routing bleibt optional: Kunden können ein bestimmtes Modell festlegen oder die Auswahl auf ein einzelnes Modell beziehungsweise eine bestimmte Modellgruppe beschränken. Snowflake erhebt keine separate Gebühr für die Routing-Entscheidung, da die Preise seiner KI-Dienste auf der Token-Nutzung basieren und die Auswahl eines kostengünstigeren Modells somit die Rechnung senkt.
Routing ist mit Governance und Kontext verknüpft
Das im Juli 2026 von Snowflake eingeführte Cortex AI Gateway stellt eine Governance-Schicht für den Datenverkehr von Modellen und Agenten bereit. Nach Angaben des Unternehmens beziehen sich Zugriffskontrollen nicht nur auf Daten, sondern auch auf Modelle und Agenten: Rollen legen fest, welche Modelle zulässig sind, und ein Agent kann auf engere Berechtigungen beschränkt werden als der Benutzer, der ihn aufruft.
Außerdem können offene Modelle aus der Region des Kunden betrieben werden, um Anforderungen an den Datenstandort zu erfüllen. Laut Gultekin bleiben Inferenzvorgänge sowohl für offene als auch für proprietäre Modelle innerhalb der Sicherheitsgrenzen von Snowflake, statt an einen externen Anbieter weitergeleitet zu werden. Dieser Punkt ist bei der Verwendung von Modellen mit nicht US-amerikanischer Herkunft relevant, etwa DeepSeek-V4-Flash und GLM-5.3, die beide in China entwickelt wurden.
Die Übernahme von Natoma durch Snowflake bringt außerdem mehr als 100 MCP-Konnektoren mit kontrolliertem und verwaltetem Zugriff. Dadurch kann einem Agenten beispielsweise nur die Berechtigung zum Lesen von E-Mails erteilt werden, anstatt ihm umfassendere Berechtigungen für das verbundene Tool zu geben.
Warum ist diese Entwicklung wichtig?
Snowflake ist der Ansicht, dass die vorherige Bereitstellung von Kontext günstigere Modelle in die Lage versetzt, Aufgaben zu erledigen, für die zuvor ein leistungsfähigeres Modell erforderlich war. Ohne ausreichenden Kontext muss das Modell möglicherweise Daten untersuchen, SQL-Abfragen schreiben und testen, suchen und es erneut versuchen. Die Tools Horizon Context und Cortex Sense bereiten diesen Kontext hingegen im Voraus auf. Außerdem wird das Gedächtnis des Agenten in nachfolgende Abfragen integriert, wodurch die Aufgabe nicht jedes Mal von Grund auf neu gelöst werden muss.
Der Schritt erfolgt im Rahmen eines umfassenderen Wettbewerbs, an dem Databricks mit Smart Routing im Unity AI Gateway, Nvidia mit Switchyard, das am 11. August angekündigt wurde, sowie OpenRouter, LiteLLM, Portkey und Gateways von Cloud-Anbietern wie Azure AI Foundry beteiligt sind.
Laut Sanjeev Mohan, Gründer von SanjMo, liegt Snowflakes Differenzierung nicht im Routing allein, sondern darin, das Routing innerhalb von Governance unterliegenden Datengrenzen zu halten und es mit Zugriffskontrollen, Nutzungs-Tags und der Zuordnung von Kosten zu Teams zu verbinden. In der Praxis könnte dieser Ansatz für Unternehmen geeigneter sein, deren Daten und Governance auf Snowflake ausgerichtet sind. Plattformübergreifend arbeitende Teams könnten dagegen neutrale Gateways bevorzugen, die eine größere Modellvielfalt bieten und die Bindung an einen einzelnen Anbieter verringern.