A Google anunciou o modelo Gemini 4 Argon, um modelo de inteligência artificial voltado para tarefas profissionais de longo prazo que exigem reasoning em várias etapas, como engenharia de software, pesquisa financeira, redação jurídica e defesa cibernética. A empresa afirma que o modelo eleva o limite de saída para um milhão de tokens, em comparação com 64 mil tokens anteriormente, permitindo processar fluxos de trabalho longos e produzir resultados amplos em uma única tarefa.
Lançamento limitado antes da disponibilidade geral
A Google começou a disponibilizar o Argon a um grupo de defensores confiáveis de segurança cibernética por meio do programa Fairwind. A empresa também afirma que participa do processo voluntário do governo dos Estados Unidos relativo ao acesso a modelos antes de seu lançamento e pretende ampliar gradualmente o acesso após coletar feedback dos avaliadores e aprimorar os mecanismos de proteção.
O preço introdutório começará em 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de tokens de saída, com desconto de 95% sobre os tokens de entrada armazenados em cache. Após o fim do período introdutório, o preço subirá para 4 dólares por entrada e 20 dólares por saída a cada milhão de tokens. A Google afirma que a disponibilidade mais ampla começará pelos clientes pagantes da API e assinantes do Google AI Ultra, seguidos por desenvolvedores, empresas e consumidores.
Desempenho em programação e trabalho empresarial
A Google afirma que o Argon alcançou 77,9% no benchmark DeepSWE v1.1 para tarefas de engenharia de software de longo prazo e liderou o índice Vals, que mede o impacto econômico nas áreas de finanças, programação, direito e impostos. Também liderou o benchmark AutomationBench da Zapier, com 51,3%, e alcançou 91,7% no LVBench para compreensão de vídeos longos.
Dentro da Google, o modelo foi usado para aprimorar algoritmos de computação quântica, analisar dados de consumo de memória em data centers e migrar bases de código de C e C++ para Rust. A empresa afirma que as otimizações de memória liberaram mais de 300 terabytes após sua aplicação, com uma estimativa de economia total entre 500 terabytes e 1 petabyte. Na biblioteca libgav1, o Argon substituiu cerca de 32 mil linhas de código SIMD, resultando em uma versão Rust 2,7 vezes mais rápida que a implementação Rust anterior, mantendo as mesmas saídas de vídeo. A Google enfatiza que os processos de migração passam por auditoria, testes e revisão antes de serem publicados em produção.
Foco especial na defesa cibernética
A Google treinou o Argon para detectar, verificar e corrigir vulnerabilidades de software de forma autônoma. A empresa afirma que a Wiz o utiliza na iniciativa Scan for Good para proteger a infraestrutura pública e que, em um teste inicial, o modelo detectou uma vulnerabilidade crítica que expunha dados pessoais sensíveis em softwares de saúde usados por hospitais em todo o mundo. No benchmark CWE-bench v1 para correção de vulnerabilidades, o Argon empatou em primeiro lugar, com 68%.
O que muda na prática?
O Argon representa uma transição do uso do modelo para respostas curtas para a execução de fluxos de trabalho profissionais prolongados que incluem análise, execução e revisão. No entanto, os resultados mencionados são provenientes da Google ou de seus parceiros e de benchmarks específicos, e não significam necessariamente desempenho equivalente em todos os ambientes de produção. A disponibilidade atual também é limitada, e a Google mantém o acesso público condicionado a testes de segurança e ao aprimoramento da resistência ao uso indevido, à injeção indireta de instruções e aos riscos de desalinhamento.
A empresa afirma que monitora o comportamento e as ações do modelo e reforça o isolamento dos ambientes usados em treinamentos e avaliações de alto risco. Também disponibilizará inicialmente o Argon sem algumas barreiras cibernéticas para defensores confiáveis e suas equipes internas, uma decisão que aumenta o potencial de defesa, mas torna a seleção dos usuários e a supervisão operacional partes essenciais da segurança do lançamento.