A Anthropic lançou o modelo Claude Opus 5.5 como o primeiro lançamento da família Claude 5.5 e afirmou que seu desempenho se aproxima do Claude Fable 5.1 na maioria das tarefas, com um custo operacional 40% menor que o do Opus 5. O modelo está atualmente disponível pela Claude Platform, além da Amazon Web Services, Google Cloud e Microsoft Azure.
Salto na programação e no trabalho cognitivo
A Anthropic posiciona o novo modelo na liderança de seus modelos para tarefas de programação agentiva, uso de computadores e trabalho cognitivo. Segundo os testes da empresa, o Opus 5.5 conseguiu executar a migração de uma base de código com 680 mil linhas em menos de um dia, enquanto a auditoria e a correção de uma base de código de 200 mil linhas levaram menos de três horas, em comparação com mais de 20 horas para o modelo Opus 5.
Em um teste de tradução do programa HAProxy da linguagem C para Rust, os dois modelos passaram pela maioria dos testes de regressão do projeto, mas o Opus 5.5 concluiu a tarefa em 9,5 horas, contra 12 horas do Claude Fable 5.1, e com custo 51% menor. A Anthropic também afirmou que o modelo conseguiu melhorar os tempos de carregamento das páginas de uma aplicação web em 39 de 40 tentativas.
A empresa afirma que o Opus 5.5 supera outros modelos em vários testes de programação e trabalho empresarial, mas alerta que as diferenças entre os modelos avançados nos benchmarks padrão se tornaram menos indicativas das diferenças práticas no uso real. A empresa considera a eficiência econômica a vantagem mais clara, pois o modelo usa menos tokens por tarefa, além de ter um preço por token menor.
Preços e velocidade
O custo de um milhão de tokens de entrada é de 4 dólares, e o de um milhão de tokens de saída é de 20 dólares, enquanto a leitura do cache custa 0,20 dólar e a gravação do cache custa 5 dólares. Em comparação com o Opus 5, esses preços representam uma redução de 20% para entrada e saída e de 60% para a leitura do cache. O Opus 5.5 também gera saídas a uma velocidade mais de 30% superior à do Opus 5.
O modo Fast mode está disponível no Claude Code e na Claude Platform com velocidade de até 2,5 vezes maior, ao preço de 8 dólares por milhão de tokens de entrada e 40 dólares por milhão de tokens de saída. A Anthropic também aumentou os limites de uso de cinco horas nos planos Pro, Max, Team e Enterprise baseados em assentos, e adicionou a possibilidade de salvar a redefinição do limite de taxa para seus assinantes.
Segurança e restrições operacionais
A Anthropic afirma que o Opus 5.5 alcançou os melhores resultados de um modelo da empresa em um teste comportamental automatizado que abrange cerca de dois mil cenários, mostrando menor tendência a tomar medidas difíceis de reverter ou a ultrapassar os limites estabelecidos para ele. O modelo também foi mais resistente a ataques de injeção de comandos que o Opus 5 e tentou ultrapassar os limites de contenção a uma taxa cerca de 85% menor que a do Opus 5 e do Claude Mythos 5.1 em um novo teste.
Ainda assim, a empresa reconhece que os testes de alinhamento não capturam todas as possíveis falhas antes do lançamento e que o modelo pode perceber, às vezes, que está sendo avaliado. Por isso, o Opus 5.5 é lançado com controles semelhantes aos usados com o Claude Fable 5.1 em cibersegurança e biologia. A maioria das tarefas de cibersegurança será direcionada novamente ao Opus 4.8, enquanto as organizações que passarem pela verificação poderão avançar para o Life Sciences Verification Program, com posterior expansão do Cyber Verification Program.
O que muda na prática?
A importância prática do lançamento não se limita ao aumento dos resultados nos testes; a redução do custo operacional e do número de etapas e tokens pode afetar diretamente a viabilidade de executar agentes de software por longos períodos. Por outro lado, a melhoria do desempenho não significa que as tarefas autônomas tenham deixado de exigir revisão, especialmente em programação, pesquisa e análise financeira. Além disso, as restrições impostas aos usos biológicos e de segurança deixam claro que o acesso às capacidades mais avançadas continuará ligado ao grau de risco e à natureza da entidade usuária.
O modelo está disponível com retenção zero de dados e oferece suporte a procedimentos de marca d’água relacionados à Lei Europeia de Inteligência Artificial, enquanto não está mais disponível com o modo de raciocínio desativado. A Anthropic pretende lançar o Claude Sonnet 5.5 e o Claude Haiku 5.5 nas próximas semanas, com melhorias semelhantes em desempenho, eficiência e segurança.