Em sistemas que lidam com transferências de dinheiro, cuidados de saúde ou infraestrutura, não basta que o agente de inteligência artificial tenha sucesso na maioria das vezes. A ideia central do primeiro nível de um modelo de maturidade de seis níveis para operar sistemas de modelos de linguagem em produção é conter o modelo dentro de um único nó, de modo que o que estiver ao redor permaneça como código comum que possa ser testado, revisado e auditado.
O material apresenta essa abordagem como uma «camada de determinismo»: o sistema mantém a capacidade do modelo de julgar entradas complexas, mas impede que ele tenha autoridade direta sobre o estado do negócio ou execute ações sensíveis.
O agente propõe, mas não executa
O agente funciona como uma função pura que transforma o contexto em uma decisão proposta. Ele produz o identificador da decisão, a capacidade necessária, a alteração proposta, o grau de confiança, o caminho de roteamento, os motivos e as evidências, mas não altera o estado do negócio. O resultado passa para um componente separado, chamado no material de substrate, que só o aplica depois de obter a aprovação necessária.
Essa separação confere ao sistema três características práticas: a possibilidade de testar o agente sem simular o mundo externo, a redução do impacto de saídas incorretas a uma proposta que pode ser rejeitada e a prevenção de cadeias de efeitos colaterais ocultos entre agentes. Assim, a pergunta auditável passa a ser: o que o modelo propôs, quem aprovou e o que foi efetivamente aplicado?
Um fluxo fixo em vez de um loop livre
Em vez de deixar um modelo ReAct decidir o próximo passo a cada vez, o material propõe um fluxo fixo para cada capacidade. De acordo com o exemplo, a solicitação passa por nós de entrada da decisão, verificação das entradas e carregamento do contexto; depois, por um único nó de inferência linguística; em seguida, por barreiras de saída e verificação, arbitragem opcional, agregação da confiança, roteamento, preparação da proposta e gravação da memória e do registro da decisão.
Essa estrutura torna o caminho de execução conhecido antecipadamente, limita o tempo e o custo de execução e permite testar cada nó separadamente. O nó não determinístico é llm_decision, que recebe uma entrada estruturada e produz uma saída estruturada, enquanto código especializado verifica os valores permitidos, a conformidade com o esquema e as regras de negócio.
Saídas estruturadas não significam decisão correta
O material alerta contra a dependência de texto livre seguida de uma tentativa de extrair a decisão dele. A alternativa é usar um esquema JSON, chamadas de ferramentas ou geração restrita por gramáticas, e então verificar o resultado e tentar novamente quando não houver conformidade, com um número limitado de tentativas e uma falha fechada, em vez de passar uma suposição às etapas seguintes.
Mas esse procedimento controla o formato da saída, não a correção do julgamento. Um objeto JSON pode estar correto do ponto de vista sintático e ainda assim conter uma decisão errada. Por isso, a verificação das regras de negócio, a avaliação e os sinais independentes de confiança devem permanecer em camadas posteriores.
Confiança, escalonamento e registro imutável
A confiança é composta pelo sinal do modelo, pelos resultados da verificação e pela revisão de um segundo modelo ao realizar amostragem de decisões sensíveis. Em seguida, o sistema encaminha a decisão para execução automática, recomenda uma revisão humana, torna essa revisão obrigatória ou rejeita a decisão. O material enfatiza que o grau de confiança não deve ser um campo definido pelo próprio agente, mas um resultado calculado a partir de sinais independentes, com limiares inicialmente conservadores e reduzidos apenas quando os dados demonstrarem que isso é seguro.
Também é necessário registrar cada decisão em um registro adicional imutável, contendo a versão do modelo e do prompt, um resumo das entradas da decisão, a decisão, a confiança e o caminho de roteamento. As correções não alteram os registros anteriores; elas são adicionadas como novos registros que apontam para a decisão que substituem. O material recomenda armazenar um hash das entradas sensíveis em vez dos dados brutos, sem deixar de gravar nem mesmo sob pressão, pois o registro é a referência principal, e não apenas dados de monitoramento.
Quando o loop iterativo é permitido?
A metodologia não rejeita completamente os loops ReAct, mas os limita aos casos em que o número e a ordem das etapas dependem do que o modelo descobre durante a pesquisa. Mesmo quando utilizados, deve-se impor um limite explícito de iterações, uma lista de ferramentas permitidas para cada capacidade e o registro de cada etapa, além de devolver a saída às mesmas barreiras, verificações, camadas de confiança e roteamento. Se o limite terminar antes de se chegar a um resultado, o caminho deve ser uma revisão humana, e não um loop infinito.
Leitura editorial: a verdadeira mudança aqui não é escolher um modelo melhor, mas transferir o centro da confiança da «autonomia do agente» para a engenharia dos limites ao seu redor. Esse projeto não resolve automaticamente o problema da correção do julgamento ou da calibração da confiança, mas torna as falhas isoláveis, reproduzíveis e revisáveis. Por isso, ele serve como base para sistemas de alto impacto, não como substituto da avaliação contínua ou da verificação especializada de cada capacidade.