GitHub готовится добавить в GitHub Copilot автоматическую маршрутизацию, которая будет определять, должна ли задача программирования выполняться на локальной модели или отправляться в облачную модель. Ожидается, что функция появится к концу октября 2026 года. План оставляет без ответа ключевой вопрос: какой объём истории разговора и контекста репозитория может передаваться в облако при выборе облачного пути?
Microsoft раскрыла план в публикации, соавторами которой стали Patrick Nikoletich, менеджер по продукту в GitHub, и Stuart Schaefer, инженер по партнёрствам платформы Windows. Объявление совпало с общедоступным выпуском новых средств sandboxing в GitHub Copilot, однако уровень защиты зависит от используемых инструментов.
Маршрутизация с учётом задачи и её контекста
GitHub расширяет проект HydraFusion, который выбирает подходящие модели для задач программирования, чтобы он также определял место выполнения вывода. По словам компании, при переключении между локальным и облачным выводом Copilot будет учитывать контекст задачи и состояние кэширования, в том числе во время многораундовых сеансов.
Разработчики в Copilot CLI, приложении Copilot и Visual Studio Code смогут использовать режим Auto или вручную выбирать локальную модель. Среди вариантов будет модель MAI Code 1.1 Flash через Windows ML, а также локальные конечные точки, совместимые с OpenAI.
Что всё ещё неясно?
Microsoft признаёт, что «локальный вывод не делает сеанс автономным». Компания не указала, какой объём контекста репозитория или истории разговора режим Auto отправляет облачным моделям, а также смогут ли разработчики проверять решения маршрутизации или полностью запретить использование облака.
Эта неопределённость важна для команд, которые применяют строгие политики обращения с кодом и данными. Выбор локальной модели сохраняет процесс вывода на устройстве, однако не мешает агенту обращаться к внешним службам или выполнять сетевые запросы через свои инструменты. Чтобы получить полностью локальный сеанс, разработчикам также потребуется ограничить права этих инструментов.
Крупная локальная модель и высокие требования к оборудованию
Локальный путь использует MAI Code 1.1 Flash — модель mixture-of-experts, включающую в общей сложности 137 миллиардов параметров, из которых активируются 6,8 миллиарда. Microsoft применила смешанное квантование с точностью около 3,3 бита на вес, сократив размер модели до 53 гигабайт — на 80% меньше облачной версии в формате bfloat16. Для ускорения локального вывода также использовалось speculative decoding.
Первый выпуск рассчитан на устройства Windows с процессорами NVIDIA RTX Spark, например Surface Laptop Ultra, которые обеспечивают до 128 гигабайт унифицированной памяти. Пиковое потребление памяти составило 75,5 гигабайта при контексте в 256 тысяч токенов. Это значение относится не только к самой модели: системе, приложениям, среде выполнения и KV cache требуется дополнительное пространство, а объём кэша растёт по мере чтения файлов и получения результатов работы инструментов.
Производительность и изоляция безопасности
Квантованная модель набрала 70,8% в SWE-Bench Verified против 72,6% у версии с полной точностью. В Terminal-Bench 2.1 она набрала 66,29% против 62,9% у исходной модели в наборе из 89 задач; то есть в этом небольшом тесте разница составляет примерно три задачи.
Copilot использует библиотеку Execution Containers (MXC) с открытым исходным кодом для применения политик изоляции: уровень BaseContainer из ProcessContainer в Windows, Seatbelt в macOS и bubblewrap в Linux. Команды shell, а также некоторые локальные серверы MCP и языковые серверы, где поддержка доступна, подчиняются ограничениям операционной системы независимо от того, используется локальная или облачная модель.
Встроенные инструменты работы с файлами выполняются внутри процесса агента и полагаются на проверки среды выполнения, тогда как удалённые серверы MCP остаются за пределами локальной изоляции. Даже демонстрация, которую Microsoft описала как автономный рабочий процесс, не прояснила, были ли использованные в ней данные GitHub получены по сети или хранились локально.
Почему эта новость важна?
Изменение не сводится к запуску меньшей модели на устройстве разработчика: оно передаёт чувствительное решение о месте обработки кода автоматическому механизму маршрутизации. На практике разработчики получат больше гибкости, выбирая между скоростью облачных моделей и конфиденциальностью локального выполнения, однако команды не смогут полностью оценить риски, пока GitHub не уточнит, какие данные отправляет режим Auto, можно ли проверять его решения и существует ли возможность принудительно использовать локальный режим. Поэтому объявление пока не доказывает, что Copilot действительно предоставляет полностью автономный локальный сеанс, и не подтверждает, что текущие требования к памяти подходят для большинства устройств разработки.