A OpenAI anunciou o GPT-6.1 Sol, uma versão aprimorada do GPT-6 Sol voltada para tarefas que combinam alto desempenho e baixo custo operacional. A empresa afirma que o modelo se aproxima do GPT-6 Astra em programação, uso do computador, análise de documentos e fluxos de trabalho profissionais de várias etapas, enquanto seus preços padrão correspondem a cerca de um quinto dos preços do Astra.
Preços projetados para uso em larga escala
O GPT-6.1 Sol API custa dois dólares por milhão de tokens de entrada e 10 dólares por milhão de tokens de saída. Já os tokens armazenados em cache custam 0,10 dólar por milhão de tokens, um desconto de 95% em comparação com o preço padrão de entrada, segundo a OpenAI. Isso torna o modelo especialmente adequado para aplicações agentivas que reutilizam o mesmo contexto em solicitações repetidas.
Resultados dos testes práticos
No teste DeepSWE v1.1, que mede tarefas prolongadas de engenharia de software em bases de código reais, o GPT-6.1 Sol alcançou o mesmo resultado que o GPT-6 Astra, mas com um custo próximo de um quinto. No teste GDP.pdf de análise de documentos profissionais, seu desempenho se aproximou do Astra em tarefas que envolvem tabelas, gráficos e arquivos PDF em áreas como finanças, saúde e direito.
No teste AutomationBench de fluxos de trabalho de várias etapas, o modelo superou o Opus 5.5 em 2,2 pontos e o GPT-6 Sol em 4,8 pontos no nível médio de raciocínio. Já no teste OSWorld 2.0 de uso do computador, ficou 2,1 pontos abaixo do Astra, com um custo por tarefa de aproximadamente um sétimo do custo do Astra e inferior à metade do custo do GPT-6 Sol na configuração mencionada.
No Terminal-Bench Science 0.1, que mede análise de dados, simulações e provas de teoremas, o custo médio por tarefa foi de 5,47 dólares, contra 23,21 dólares do Opus 5.5 e 23,80 dólares do GPT-6 Astra. Ainda assim, o Astra manteve o melhor desempenho no teste, com resultado de 68,1%.
Precisão e limitações de segurança
O GPT-6.1 Sol reduziu a taxa de erros factuais para 4,1%, em comparação com 4,5% do GPT-6 Sol e 4% do GPT-6 Astra no nível máximo de raciocínio. A OpenAI alerta que essa avaliação se baseia em prompts difíceis, com alta probabilidade de gerar erros, e não representa o uso habitual do ChatGPT.
A empresa também afirma que o modelo melhorou ao informar o usuário sobre ferramentas que não funcionam, evitar resultados não permitidos e cumprir restrições explícitas. Também declarou que, assim como o GPT-6 Astra e o GPT-6 Sol, ele não tentou contornar a unidade de controle de segurança automatizada. A fonte não apresenta detalhes independentes sobre a metodologia de verificação dessas alegações.
O que muda na prática?
A OpenAI apresenta o GPT-6.1 Sol como uma opção para aplicações de grande volume, nas quais reduzir o custo dos tokens pode ser mais importante do que obter a maior pontuação possível em cada teste. Isso é relevante para desenvolvedores de agentes de software e serviços de análise de documentos e automação, mas a diferença nos resultados continua relacionada ao tipo de tarefa e ao nível de raciocínio; portanto, o custo menor não significa uma substituição abrangente do Astra.
O modelo está disponível para assinantes Plus, Pro, Business, Enterprise e Edu por meio do ChatGPT Work e do Codex, e os desenvolvedores também podem utilizá-lo na OpenAI API com o nome gpt-6.1-sol. Ele ainda não foi lançado na interface de conversação padrão do ChatGPT. A OpenAI também anunciou o GPT-6.1 Sol Ultrafast e o GPT-6 Astra Ultrafast, alegando velocidade de até oito vezes a do Astra, enquanto não lançou o GPT-6.1 Astra, cujo lançamento era esperado para esta semana, em meio a relatos de preocupações de segurança nos testes internos.