A GitHub está se preparando para adicionar um direcionamento automático ao GitHub Copilot que determinará se uma tarefa de programação será executada em um modelo local ou enviada a um modelo em nuvem, com previsão de chegada do recurso até o fim de outubro de 2026. O plano deixa uma questão fundamental sem resposta: quanto do histórico da conversa e do contexto do repositório poderá ser transferido para a nuvem quando o caminho em nuvem for escolhido?
A Microsoft revelou o plano em uma publicação coescrita por Patrick Nikoletich, gerente de produtos da GitHub, e Stuart Schaefer, engenheiro de parcerias da plataforma Windows. O anúncio coincidiu com a disponibilização geral dos novos controles de sandboxing no GitHub Copilot, mas o nível de proteção varia conforme as ferramentas utilizadas.
Direcionamento baseado na tarefa e em seu contexto
A GitHub está expandindo o projeto HydraFusion, que escolhe os modelos adequados para tarefas de programação, para determinar também onde a inferência será executada. Segundo a empresa, o Copilot levará em conta o contexto da tarefa e o estado do cache ao alternar entre a inferência local e na nuvem, inclusive durante sessões com várias rodadas.
Os desenvolvedores no Copilot CLI, no aplicativo Copilot e no Visual Studio Code poderão usar o modo Auto ou escolher manualmente um modelo local. As opções incluem o modelo MAI Code 1.1 Flash por meio do Windows ML, além de endpoints locais compatíveis com OpenAI.
O que ainda não está claro?
A Microsoft reconhece que “a inferência local não torna a sessão offline”. A empresa não especificou quanto do contexto do repositório ou do histórico da conversa o modo Auto envia aos modelos em nuvem, nem se os desenvolvedores poderão examinar as decisões de direcionamento ou impedir completamente o uso da nuvem.
Essa ambiguidade é importante para equipes que impõem políticas rigorosas de tratamento de código e dados. A escolha de um modelo local mantém o processo de inferência no dispositivo, mas não impede que o agente acesse serviços externos ou execute solicitações de rede por meio de suas ferramentas. Para obter uma sessão totalmente local, os desenvolvedores também precisarão restringir as permissões dessas ferramentas.
Um modelo local grande e requisitos elevados de hardware
O caminho local depende do MAI Code 1.1 Flash, um modelo de mixture-of-experts com 137 bilhões de parâmetros no total, dos quais 6,8 bilhões são ativados. A Microsoft usou quantização de precisão mista de aproximadamente 3,3 bits por peso, reduzindo o modelo a 53 gigabytes, ou 80% menos que a versão em nuvem no formato bfloat16. Ela também usou speculative decoding para acelerar a inferência local.
O lançamento inicial tem como alvo dispositivos Windows equipados com processadores NVIDIA RTX Spark, como o Surface Laptop Ultra, que oferecem até 128 gigabytes de memória unificada. O pico de consumo de memória foi medido em 75,5 gigabytes com um contexto de 256 mil tokens. Esse valor não inclui apenas o modelo; o sistema e os aplicativos, o ambiente de execução e a memória do KV cache precisam de espaço adicional, enquanto o cache cresce à medida que os arquivos são lidos e os resultados das ferramentas são recebidos.
Desempenho e isolamento de segurança
O modelo quantizado registrou 70,8% no SWE-Bench Verified, contra 72,6% da versão de precisão total. No Terminal-Bench 2.1, registrou 66,29%, contra 62,9% do modelo original, em um conjunto de 89 tarefas; ou seja, a diferença nesse pequeno teste equivale a cerca de três tarefas.
O Copilot usa a biblioteca de código aberto Execution Containers (MXC) para aplicar políticas de isolamento: a camada BaseContainer do ProcessContainer no Windows, o Seatbelt no macOS e o bubblewrap no Linux. Comandos shell e alguns servidores MCP locais e de linguagem, quando houver suporte, estão sujeitos a restrições impostas pelo sistema operacional, independentemente de ser usado um modelo local ou em nuvem.
Já as ferramentas de arquivos integradas são executadas dentro do processo do agente e dependem de verificações do ambiente de execução, enquanto os servidores MCP remotos ficam fora do isolamento local. Até mesmo a demonstração descrita pela Microsoft como um fluxo de trabalho offline não esclareceu se os dados do GitHub usados nela foram obtidos pela rede ou estavam armazenados localmente.
Por que esta notícia é importante?
A mudança não se limita a executar um modelo menor no dispositivo do desenvolvedor; ela transfere uma decisão sensível relacionada ao local de processamento do código para um mecanismo de direcionamento automático. Na prática, os desenvolvedores terão mais flexibilidade entre a velocidade dos modelos em nuvem e a privacidade da execução local, mas as equipes não poderão avaliar completamente os riscos antes que a GitHub esclareça quais dados o modo Auto envia, se suas decisões poderão ser auditadas e se haverá uma opção para impor a execução local. Portanto, o anúncio ainda não comprova que o Copilot oferece uma sessão local realmente offline, nem que os requisitos atuais de memória sejam adequados para a maioria dos dispositivos de desenvolvimento.