GitHub se prépare à ajouter une orientation automatique à GitHub Copilot afin de déterminer si une tâche de programmation sera exécutée sur un modèle local ou envoyée à un modèle cloud, avec un déploiement prévu d’ici fin octobre 2026. Le projet laisse une question fondamentale sans réponse : quelle quantité de l’historique de conversation et du contexte du dépôt pourrait être transférée vers le cloud lors du choix du parcours cloud ?
Microsoft a dévoilé ce projet dans une publication corédigée par Patrick Nikoletich, directeur produit chez GitHub, et Stuart Schaefer, ingénieur chargé des partenariats pour la plateforme Windows. L’annonce a coïncidé avec la disponibilité générale des nouveaux contrôles de sandboxing dans GitHub Copilot, mais le niveau de protection varie selon les outils utilisés.
Une orientation fondée sur la tâche et son contexte
GitHub étend le projet HydraFusion, qui sélectionne les modèles adaptés aux tâches de programmation, afin de déterminer également le lieu d’exécution de l’inférence. Selon l’entreprise, Copilot prendra en compte le contexte de la tâche et l’état du cache lors du passage entre l’inférence locale et cloud, y compris pendant les sessions à plusieurs tours.
Les développeurs utilisant Copilot CLI, l’application Copilot et Visual Studio Code pourront employer le mode Auto ou sélectionner manuellement un modèle local. Les options comprennent le modèle MAI Code 1.1 Flash via Windows ML, ainsi que des points de terminaison locaux compatibles avec OpenAI.
Qu’est-ce qui reste flou ?
Microsoft reconnaît que « l’inférence locale ne rend pas la session hors ligne ». L’entreprise n’a pas précisé quelle quantité de contexte du dépôt ou d’historique de conversation le mode Auto envoie aux modèles cloud, ni si les développeurs pourront examiner les décisions d’orientation ou empêcher totalement l’utilisation du cloud.
Cette incertitude est importante pour les équipes qui imposent des politiques strictes concernant le traitement du code et des données. Le choix d’un modèle local maintient le processus d’inférence sur l’appareil, mais n’empêche pas l’agent d’accéder à des services externes ou d’exécuter des requêtes réseau via ses outils. Pour obtenir une session entièrement locale, les développeurs devront également limiter les autorisations de ces outils.
Un grand modèle local et des exigences matérielles élevées
Le parcours local repose sur MAI Code 1.1 Flash, un modèle de type mixture-of-experts comprenant au total 137 milliards de paramètres, dont 6,8 milliards sont activés. Microsoft a utilisé une quantification à précision mixte d’environ 3,3 bits par poids, réduisant le modèle à 53 gigaoctets, soit 80 % de moins que la version cloud au format bfloat16. Elle a également utilisé le speculative decoding pour accélérer l’inférence locale.
Le premier déploiement cible les appareils Windows équipés de processeurs NVIDIA RTX Spark, tels que le Surface Laptop Ultra, qui offrent jusqu’à 128 gigaoctets de mémoire unifiée. Le pic de consommation mémoire a été mesuré à 75,5 gigaoctets avec un contexte de 256 000 tokens. Cette valeur ne concerne pas uniquement le modèle : le système, les applications, l’environnement d’exécution et la mémoire KV cache nécessitent un espace supplémentaire, tandis que le cache augmente avec la lecture des fichiers et la réception des résultats des outils.
Performances et isolation de sécurité
Le modèle quantifié a obtenu 70,8 % à SWE-Bench Verified, contre 72,6 % pour la version en pleine précision. Dans Terminal-Bench 2.1, il a obtenu 66,29 %, contre 62,9 % pour le modèle original, sur un ensemble de 89 tâches : l’écart observé dans ce petit test équivaut donc à environ trois tâches.
Copilot utilise la bibliothèque open source Execution Containers (MXC) pour appliquer les politiques d’isolation : la couche BaseContainer de ProcessContainer sous Windows, Seatbelt sous macOS et bubblewrap sous Linux. Les commandes shell, ainsi que certains serveurs MCP locaux et serveurs de langage lorsque la prise en charge est disponible, sont soumis aux restrictions imposées par le système d’exploitation, qu’un modèle local ou cloud soit utilisé.
En revanche, les outils de fichiers intégrés s’exécutent au sein du processus de l’agent et reposent sur des contrôles de l’environnement d’exécution, tandis que les serveurs MCP distants restent en dehors de l’isolation locale. Même la démonstration que Microsoft a décrite comme un flux de travail hors ligne n’a pas établi si les données GitHub utilisées avaient été récupérées via le réseau ou stockées localement.
Pourquoi cette actualité est-elle importante ?
Le changement ne se limite pas à exécuter un modèle plus petit sur l’appareil du développeur : il transfère à un mécanisme d’orientation automatique une décision sensible concernant le lieu de traitement du code. En pratique, les développeurs bénéficieront d’une plus grande flexibilité entre la rapidité des modèles cloud et la confidentialité de l’exécution locale, mais les équipes ne pourront pas évaluer pleinement les risques avant que GitHub précise les données envoyées par le mode Auto, la possibilité d’auditer ses décisions et l’option d’imposer l’exécution locale. L’annonce ne prouve donc pas encore que Copilot fournit réellement une session locale hors ligne, ni que les exigences actuelles en matière de mémoire conviennent à la plupart des appareils de développement.