A Anthropic e a OpenAI lançaram novos modelos destinados a usos profissionais, combinando melhorias de desempenho com a redução do custo de operação dos modelos. Isso ocorre em um momento em que a eficiência econômica e a confiabilidade dos modelos em programação e tarefas empresariais ganham importância, juntamente com o debate contínuo sobre a segurança dos modelos avançados.
Opus 5.5 se concentra em tarefas complexas
A Anthropic revelou o modelo Opus 5.5, que, segundo a empresa, melhora o tratamento de tarefas complexas, a detecção e correção de falhas de software, a análise de dados financeiros e a execução de tarefas empresariais. Os testes da empresa indicam que o modelo supera o GPT-6 Astra em tarefas de programação agentiva nos testes Terminal-Bench 4.0 e FrontierCode v1.1 (Main).
A Anthropic afirma que o modelo produz textos mais claros e se tornou 85% menos propenso a tentar contornar limites e controles em comparação com os modelos anteriores. A empresa também reduziu o preço de um milhão de tokens de entrada para 4 dólares e de um milhão de tokens de saída para 20 dólares, ante 5 dólares e 25 dólares, respectivamente, no modelo Opus 5.
Três níveis diferentes de custo na OpenAI
A OpenAI lançou os modelos GPT-6 Sol e GPT-6 Luna, com melhorias no trabalho profissional, na programação e no uso do computador. A empresa afirma que o custo dos dois modelos é até 50% menor em comparação com os preços promocionais dos modelos GPT-5.6.
O preço de um milhão de tokens de entrada no GPT-6 Sol é de 2 dólares, contra 10 dólares para a saída. Já o GPT-6 Luna custa 10 centavos por um milhão de tokens de entrada e 50 centavos por um milhão de tokens de saída. Segundo a OpenAI, o GPT-6 Sol comete cerca de metade dos erros cometidos pelo modelo anterior e alcança, em programação, um nível de desempenho semelhante ao do Fable 5.1, a um custo menor.
As melhorias também incluem maior clareza na comunicação e suporte ao armazenamento temporário do contexto das instruções, permitindo reutilizar uma quantidade maior de contexto e acelerar as respostas.
O que muda na prática?
Os novos preços dão a desenvolvedores e empresas mais margem para usar os modelos em tarefas repetitivas ou que exigem muitas chamadas, enquanto os modelos de maior capacidade têm como alvo trabalhos de programação, análise e execução agentiva. No entanto, os números apresentados sobre superioridade, precisão e segurança são provenientes de testes das próprias empresas e, por isso, não comprovam, por si só, uma superioridade geral em todos os usos ou ambientes.
Melhorias de segurança e disponibilidade
A OpenAI afirma que os modelos GPT-6 se tornaram menos propensos a fornecer informações incorretas sobre os resultados de tarefas de programação e mais propensos a recusar tentativas de contornar procedimentos de proteção ao receber instruções inseguras. As duas empresas trabalham em propostas de padrões que entidades de avaliação externas possam usar para medir a evolução e a segurança dos modelos, mas ainda não está claro se essas propostas se transformarão em um padrão unificado.
O Opus 5.5 está disponível pelo Claude, além de Amazon Web Services, Google Cloud e Microsoft Azure. O GPT-6 Sol e o GPT-6 Luna estão disponíveis pelo ChatGPT Work e pelo Codex para clientes dos planos Plus, Pro, Business e Enterprise, enquanto os usuários do plano gratuito e os assinantes do Go têm acesso apenas ao GPT-6 Luna pelo aplicativo da empresa para computador.