Künstliche Intelligenz

GitHub Copilot entscheidet automatisch zwischen lokaler und Cloud-Ausführung

GitHub beabsichtigt, Copilot zu erweitern, damit Programmi tasks automatisch an lokale oder Cloud-Modelle weitergeleitet werden. Microsoft hat jedoch noch nicht klargestellt, wie viel Repository-Kontext das Gerät des Entwicklers verlassen könnte oder wie sich diese Weiterleitung einschränken lässt.

2026-10-08
5 Min. Lesezeit
10 Aufrufe
certi.news Editorial Team
GitHub Copilot entscheidet automatisch zwischen lokaler und Cloud-Ausführung

GitHub bereitet die Einführung einer automatischen Weiterleitung für GitHub Copilot vor, die bestimmt, ob eine Programmieraufgabe auf einem lokalen Modell ausgeführt oder an ein Cloud-Modell gesendet wird. Die Funktion soll voraussichtlich bis Ende Oktober 2026 verfügbar sein. Der Plan lässt eine grundlegende Frage unbeantwortet: Wie viel Gesprächsverlauf und Repository-Kontext könnte bei der Auswahl des Cloud-Pfads in die Cloud übertragen werden?

Microsoft legte den Plan in einem gemeinsam von Patrick Nikoletich, einem Produktmanager bei GitHub, und Stuart Schaefer, einem Partnerschaftsingenieur für die Windows-Plattform, verfassten Beitrag offen. Die Ankündigung fiel mit der allgemeinen Verfügbarkeit der neuen Sandboxing-Kontrollen in GitHub Copilot zusammen, doch das Schutzniveau unterscheidet sich je nach verwendeten Werkzeugen.

Aufgabe und Kontext bestimmen die Weiterleitung

GitHub erweitert das Projekt HydraFusion, das geeignete Modelle für Programmieraufgaben auswählt, sodass es auch den Ausführungsort der Inferenz bestimmt. Nach Angaben des Unternehmens berücksichtigt Copilot beim Wechsel zwischen lokaler und Cloud-Inferenz den Aufgabenkontext und den Cache-Zustand, auch während Sitzungen mit mehreren Gesprächsrunden.

Entwickler in Copilot CLI, der Copilot-App und Visual Studio Code können den Auto-Modus verwenden oder manuell ein lokales Modell auswählen. Zu den Optionen gehört das Modell MAI Code 1.1 Flash über Windows ML sowie lokale OpenAI-kompatible Endpunkte.

Was bleibt unklar?

Microsoft räumt ein, dass „lokale Inferenz die Sitzung nicht offline macht“. Das Unternehmen hat weder festgelegt, wie viel Repository-Kontext oder Gesprächsverlauf der Auto-Modus an Cloud-Modelle sendet, noch ob Entwickler die Weiterleitungsentscheidungen prüfen oder die Cloud-Nutzung vollständig verhindern können.

Diese Unklarheit ist für Teams wichtig, die strenge Richtlinien für den Umgang mit Code und Daten durchsetzen. Die Auswahl eines lokalen Modells hält den Inferenzprozess auf dem Gerät, verhindert jedoch nicht, dass der Agent auf externe Dienste zugreift oder über seine Werkzeuge Netzwerkanfragen ausführt. Für eine vollständig lokale Sitzung müssen Entwickler daher zusätzlich die Berechtigungen dieser Werkzeuge einschränken.

Großes lokales Modell und hohe Hardwareanforderungen

Der lokale Pfad basiert auf MAI Code 1.1 Flash, einem Mixture-of-Experts-Modell mit insgesamt 137 Milliarden Parametern, von denen 6,8 Milliarden aktiviert werden. Microsoft verwendete eine Quantisierung mit gemischter Genauigkeit von etwa 3,3 Bit pro Gewicht, um das Modell auf 53 Gigabyte zu verkleinern – 80 Prozent weniger als die Cloud-Version im bfloat16-Format. Außerdem setzte Microsoft speculative decoding ein, um die lokale Inferenz zu beschleunigen.

Die erste Veröffentlichung richtet sich an Windows-Geräte mit NVIDIA-RTX-Spark-Prozessoren, etwa das Surface Laptop Ultra, die bis zu 128 Gigabyte gemeinsamen Speicher bereitstellen. Der Spitzenverbrauch des Arbeitsspeichers wurde bei einem Kontext von 256.000 Token mit 75,5 Gigabyte gemessen. Dieser Wert umfasst nicht nur das Modell: System und Anwendungen, Laufzeitumgebung und der KV-Cache benötigen zusätzlichen Speicher, während der Cache durch das Lesen von Dateien und den Empfang von Werkzeugergebnissen wächst.

Leistung und Sicherheitsisolierung

Das quantisierte Modell erreichte im SWE-Bench Verified 70,8 Prozent gegenüber 72,6 Prozent für die Version mit voller Genauigkeit. Im Terminal-Bench 2.1 erzielte es 66,29 Prozent gegenüber 62,9 Prozent für das ursprüngliche Modell, und zwar in einem Set von 89 Aufgaben; der Unterschied in diesem kleinen Test entspricht somit etwa drei Aufgaben.

Copilot verwendet die Open-Source-Bibliothek Execution Containers (MXC), um Isolierungsrichtlinien umzusetzen: die BaseContainer-Schicht von ProcessContainer unter Windows, Seatbelt unter macOS und bubblewrap unter Linux. Shell-Befehle sowie einige lokale MCP-Server und Sprachserver, sofern unterstützt, unterliegen unabhängig davon, ob ein lokales oder ein Cloud-Modell verwendet wird, den vom Betriebssystem auferlegten Einschränkungen.

Die integrierten Dateiverarbeitungswerkzeuge laufen innerhalb des Agentenprozesses und stützen sich auf Prüfungen der Laufzeitumgebung, während entfernte MCP-Server außerhalb der lokalen Isolierung bleiben. Selbst die von Microsoft als Offline-Workflow bezeichnete Demonstration klärte nicht, ob die darin verwendeten GitHub-Daten über das Netzwerk abgerufen oder lokal gespeichert wurden.

Warum ist diese Nachricht wichtig?

Die Änderung beschränkt sich nicht darauf, ein kleineres Modell auf dem Gerät des Entwicklers auszuführen; sie verlagert eine sensible Entscheidung über den Ort der Codeverarbeitung auf einen automatischen Weiterleitungsmechanismus. In der Praxis erhalten Entwickler mehr Flexibilität zwischen der Geschwindigkeit von Cloud-Modellen und der Privatsphäre lokaler Ausführung. Teams können die Risiken jedoch nicht vollständig bewerten, bevor GitHub die von Auto gesendeten Daten, die Möglichkeit zur Prüfung seiner Entscheidungen und eine Option zur Erzwingung lokaler Ausführung erläutert. Die Ankündigung belegt daher noch nicht, dass Copilot tatsächlich eine lokale Offline-Sitzung ermöglicht oder dass die aktuellen Speicheranforderungen für die meisten Entwicklungsgeräte geeignet sind.

Nachrichtenquelle
The New Stack - Software Development
Originalquelle öffnen ↗
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen