Quando as organizações passam de experimentar com um número limitado de agentes de IA para operar dezenas ou centenas deles ininterruptamente, a qualidade do modelo deixa de ser o único fator decisivo. Na segunda parte do diálogo Leaders of Code, publicado pelo Stack Overflow, Andy Gutmann, do Google, discutiu com Peter O'Connor, diretor de engenharia de plataformas do Stack Overflow, a economia dessa transição: a quantidade de contexto necessária, o custo dos tokens, a medição do retorno sobre o investimento e o que as equipes de engenharia de plataformas devem construir para poder gerenciar os agentes na prática.
A tese central do diálogo é que o problema passou a ser o de um sistema integrado, não o de um modelo isolado. O desempenho final depende do modelo, do mecanismo de operação, do contexto fornecido a ele, do grau de personalização e das ferramentas que ele invoca. Segundo Gutmann, o objetivo não é usar o modelo mais avançado em todas as tarefas, mas escolher o modelo menos complexo que alcance o resultado desejado pelo menor custo. Modelos leves, como o Gemini 3.5 Flash, podem ser suficientes para alguns usos, enquanto outros casos exigem um modelo Gemini Pro.
O contexto adequado é mais importante do que o número de tokens
Gutmann critica o que chama de «maximização de tokens»; aumentar o tamanho das entradas ou prolongar os ciclos de raciocínio não significa necessariamente um resultado melhor. A direção prática, segundo sua apresentação, é reduzir o contexto às informações que realmente influenciam o resultado e melhorar a precisão dos fluxos de execução para que o agente precise de menos ciclos de pensamento. Isso relaciona o custo diretamente à qualidade da pesquisa e da recuperação de dados, e não apenas ao preço do modelo.
Mas determinar o «menor contexto utilizável» não é uma tarefa simples. Gutmann afirma que os dados e o modelo devem ser avaliados em conjunto para saber qual parte do contexto realmente melhora o resultado. Por isso, mostrou-se cético em relação às entidades que afirmam ter resolvido completamente o problema do contexto, enfatizando que o próprio Google não o resolveu por completo e depende de avaliações, do rastreamento das trajetórias dos agentes, da melhoria da pesquisa e do enriquecimento dos dados para determinar o que merece ser incluído em cada tarefa.
Esse ponto é importante para as equipes de IA porque alerta contra transformar o conhecimento curado ou os esquemas de dados em um objetivo independente. O fato de os seres humanos considerarem uma informação útil não prova que ela levará a um resultado melhor para o agente. A medição deve partir das saídas e das trajetórias efetivas, mantendo o ser humano no circuito quando a autoridade decisória ou o julgamento humano forem necessários.
A escala muda a equação de custo e retorno
Em um ambiente de trabalho tradicional, é possível estimar aproximadamente o volume de uso pelo número de funcionários e pelas horas trabalhadas. Já os agentes trabalham em velocidade maior e ininterruptamente, e um único funcionário pode ter dezenas de agentes, ou a organização pode ter milhões de agentes, dependendo do cenário apresentado por Gutmann. Assim, o uso e o custo podem se expandir de maneira não linear, o que exige uma governança clara do consumo e o conhecimento do retorno gerado por cada uso.
Gutmann não considera que o retorno sobre o investimento deva ser medido pelo número de tokens processados. O critério é saber se a organização está alcançando um resultado diferente ou melhor em comparação com o que alcançava anteriormente. Ele citou usos como suporte ao cliente, melhoria das operações de site e da confiabilidade e gerenciamento autônomo de redes na Deutsche Telekom, incluindo manutenção proativa. Esses continuam sendo exemplos mencionados no diálogo, não resultados quantitativos nem um estudo comparativo publicado como parte do material.
Um dos aspectos práticos apresentados pelo diálogo é a redução do custo da experimentação. Gutmann mencionou que construiu, durante um fim de semana, um protótipo de uma ideia que anteriormente poderia levar de três a quatro meses de trabalho de um engenheiro. Explicou que o modelo não era código pronto para produção, mas ajudou a revelar riscos de design antecipadamente e a reduzir a probabilidade de investir em uma direção errada durante vários meses. O valor aqui não é substituir o desenvolvimento para produção, mas acelerar o teste de hipóteses antes de comprometer mais recursos.
O agente é uma nova personalidade para a plataforma
Gutmann propõe que as equipes de plataforma tratem o agente como uma personalidade que precisa ser atendida, ao lado de desenvolvedores, cientistas de dados, engenheiros de dados e usuários das áreas de negócios. Isso significa que as ferramentas atuais não serão necessariamente transferidas exatamente como são para a era dos agentes, mas alguns de seus eixos continuam essenciais: segurança e governança, custo, disponibilidade e escalabilidade, além do monitoramento operacional específico dos agentes.
Na prática, a organização precisa saber o que o agente faz no ambiente de produção, quais ferramentas e dados ele invoca, quanto isso custa e se ele está avançando em direção ao resultado desejado. Também precisa de habilidades e controles que impeçam o uso indiscriminado. O diálogo indica que a infraestrutura deve assumir uma parcela maior da responsabilidade por evitar erros, em vez de deixar cada decisão operacional para o usuário ou para o agente.
Gutmann considera que incluir cientistas de dados e engenheiros de dados nas equipes de plataforma pode ser útil, mesmo que seu número não seja grande. A engenharia de dados continua sendo necessária para garantir que dados corretos, governados e acionáveis cheguem ao local adequado, enquanto aplicações como detecção de fraude e previsão continuam se beneficiando do aprendizado de máquina tradicional. Isso confirma que «IA em primeiro lugar» não elimina a necessidade de qualidade dos dados nem de julgamento especializado.
O que os novos profissionais devem aprender?
Ao final do diálogo, Gutmann enfatizou a importância contínua dos fundamentos da ciência da computação, incluindo matemática, arquitetura de sistemas e a compreensão de como as tecnologias são construídas, mencionando também o retorno da importância do hardware após anos de foco no software. Ele acrescentou, porém, que a competência em programação com agentes e em alcançar resultados por meio deles se tornará uma habilidade requisitada, juntamente com a compreensão dos problemas de negócios.
A leitura editorial da certi.news: a mudança efetiva descrita pelo material não é o lançamento de uma nova plataforma ou modelo, mas a transferência do ponto de estrangulamento de «o modelo é capaz?» para «como projetamos, controlamos e medimos o sistema?». No entanto, a entrevista não apresenta números independentes sobre economias de custo nem métricas de desempenho comparáveis, e seus exemplos vêm da experiência e das percepções dos entrevistados. Portanto, ela deve ser tratada como uma análise prática e uma direção de design, não como evidência quantitativa de que toda organização reduzirá seus custos simplesmente ao aumentar o uso de agentes.