Intelligence artificielle

Snowflake ajoute le routage automatique des modèles à Cortex AI Gateway pour réduire le coût des requêtes

Snowflake a ajouté le routage dynamique des modèles à Cortex AI Gateway, afin que le système sélectionne le modèle le mieux adapté à chaque tâche en fonction d’un compromis entre qualité et coût. L’entreprise affirme que cette fonctionnalité a réduit les coûts des jetons jusqu’à trois fois pour certaines charges de travail lors de tests internes.

2026-08-18
5 min de lecture
17 vues
فريق تحرير certi.news
Snowflake ajoute le routage automatique des modèles à Cortex AI Gateway pour réduire le coût des requêtes

Snowflake a ajouté une fonctionnalité de routage dynamique des modèles à la passerelle Cortex AI Gateway, permettant aux équipes d’entreprise de sélectionner le mode « auto » au lieu d’imposer un seul modèle à toutes les tâches. Lorsque cette option est activée, la plateforme tente de déterminer, pour chaque requête, le modèle offrant le meilleur équilibre entre la qualité de la réponse et son coût, plutôt que d’envoyer systématiquement les questions simples au modèle le plus puissant et le plus coûteux.

Snowflake a déclaré que ce mécanisme avait réduit le coût des jetons jusqu’à trois fois pour certaines charges de travail, sur la base de tests internes menés par l’entreprise. Ce résultat ne constitue pas une garantie générale pour tous les environnements, mais il illustre le problème ciblé par la fonctionnalité : l’exécution d’un grand nombre d’agents intelligents peut faire du choix manuel des modèles une source cumulative de coûts, notamment lorsque des modèles avancés prennent en charge des tâches que des modèles plus simples pourraient accomplir.

Comment le système détermine-t-il le modèle approprié ?

Selon les explications de Baris Gultekin, vice-président de l’intelligence artificielle chez Snowflake, le mécanisme de routage repose sur deux voies. Dans la première, un petit modèle est utilisé initialement, dans ce que l’entreprise appelle le « mode conseiller ». Si le modèle ne parvient pas à accomplir la tâche, il fait appel à un modèle plus grand comme outil et poursuit le travail à partir de là.

La deuxième voie utilise un classificateur entraîné sur l’historique des requêtes, afin d’identifier les questions directes et de les orienter automatiquement vers des modèles plus simples. Le routage automatique reste facultatif : le client peut imposer un modèle précis ou limiter le choix à un seul modèle ou à un ensemble défini de modèles. Snowflake ne facture pas séparément la décision de routage, car la tarification de ses services d’intelligence artificielle repose sur l’utilisation des jetons. Le choix d’un modèle moins coûteux entraîne donc une réduction de la facture.

Le routage est lié à la gouvernance et au contexte

Cortex AI Gateway, lancée par Snowflake en juillet 2026, fournit une couche de gouvernance pour le trafic des modèles et des agents. L’entreprise affirme que les contrôles d’accès ne concernent pas uniquement les données, mais aussi les modèles et les agents : les rôles déterminent les modèles autorisés, et un agent peut être limité à des autorisations plus restreintes que celles de l’utilisateur qui l’appelle.

Les modèles ouverts peuvent également être exécutés depuis la région du client afin de répondre aux exigences de résidence des données. Selon Gultekin, les opérations d’inférence, qu’elles concernent des modèles ouverts ou propriétaires, restent dans les limites de sécurité de Snowflake au lieu d’être acheminées vers un fournisseur externe. Ce point est particulièrement important lors de l’utilisation de modèles d’origine non américaine, tels que DeepSeek-V4-Flash et GLM-5.3, tous deux développés en Chine.

L’acquisition de Natoma par Snowflake ajoute plus de 100 connecteurs MCP avec un accès contrôlé et gouverné. Cela permet, par exemple, d’accorder à un agent l’autorisation de lire uniquement les e-mails, plutôt que de lui donner des autorisations plus larges sur l’outil connecté.

Pourquoi cette évolution est-elle importante ?

Snowflake estime que la fourniture préalable du contexte permet aux modèles moins coûteux d’accomplir des tâches qui nécessitaient auparavant un modèle plus puissant. Sans contexte suffisant, le modèle peut être obligé d’explorer les données, d’écrire et de tester des requêtes SQL, d’effectuer des recherches et de réessayer. Les outils Horizon Context et Cortex Sense préparent ce contexte à l’avance. La mémoire de l’agent est également intégrée aux requêtes ultérieures, ce qui réduit la nécessité de résoudre le même problème depuis le début à chaque fois.

Cette initiative s’inscrit dans une concurrence plus large, qui comprend Databricks avec Smart Routing dans Unity AI Gateway, Nvidia avec Switchyard, annoncé le 11 août, ainsi qu’OpenRouter, LiteLLM, Portkey et les passerelles de fournisseurs de services cloud telles qu’Azure AI Foundry.

Selon Sanjeev Mohan, fondateur de SanjMo, la différenciation de Snowflake ne réside pas dans le routage seul, mais dans le fait de maintenir le routage dans les limites des données soumises à la gouvernance, tout en le reliant aux contrôles d’accès, aux balises d’utilisation et à l’imputation des coûts aux équipes. En pratique, cette approche peut être mieux adaptée aux entreprises dont les données et la gouvernance sont centrées sur Snowflake, tandis que les équipes utilisant plusieurs plateformes peuvent préférer des passerelles neutres offrant une gamme plus large de modèles et réduisant la dépendance à un fournisseur unique.

Source de l’actualité
VentureBeat Startups & Funding
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités