OpenAI объявила о выпуске GPT-6.1 Sol — усовершенствованной версии GPT-6 Sol, предназначенной для задач, сочетающих высокую производительность и низкую стоимость эксплуатации. Компания заявляет, что модель приближается к GPT-6 Astra в программировании, использовании компьютера, анализе документов и профессиональных многоэтапных рабочих процессах, тогда как её стандартные цены составляют примерно пятую часть цен Astra.
Ценообразование для масштабного использования
Стоимость GPT-6.1 Sol API составляет 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов. Кэшированные токены стоят 0,10 доллара за миллион токенов — это скидка 95% по сравнению со стандартной ценой входных токенов, согласно OpenAI. Благодаря этому модель особенно подходит для агентных приложений, которые повторно используют один и тот же контекст в последовательных запросах.
Результаты практических тестов
В тесте DeepSWE v1.1, измеряющем выполнение длительных задач по разработке программного обеспечения на реальных кодовых базах, GPT-6.1 Sol показала тот же результат, что и GPT-6 Astra, но при стоимости примерно в пять раз ниже. В тесте GDP.pdf для анализа профессиональных документов её производительность приблизилась к Astra в задачах с таблицами, графиками и PDF-файлами в таких областях, как финансы, здравоохранение и право.
В тесте AutomationBench для многоэтапных рабочих процессов модель на среднем уровне рассуждения превзошла Opus 5.5 на 2,2 балла, а GPT-6 Sol — на 4,8 балла. В тесте OSWorld 2.0 на использование компьютера она уступила Astra 2,1 балла, при этом стоимость одной задачи составила примерно одну седьмую стоимости Astra и менее половины стоимости GPT-6 Sol в указанной конфигурации.
В Terminal-Bench Science 0.1, измеряющем анализ данных, моделирование и доказательство теорем, средняя стоимость задачи составила 5,47 доллара против 23,21 доллара у Opus 5.5 и 23,80 доллара у GPT-6 Astra. Тем не менее Astra сохранила высший результат в тесте — 68,1%.
Точность и ограничения безопасности
GPT-6.1 Sol снизила долю фактических ошибок до 4,1% по сравнению с 4,5% у GPT-6 Sol и 4% у GPT-6 Astra при максимальном уровне рассуждения. OpenAI предупреждает, что эта оценка основана на сложных запросах с высокой вероятностью возникновения ошибок и не отражает обычное использование ChatGPT.
Компания также заявляет, что модель стала лучше сообщать пользователю о неработающих инструментах, избегать неразрешённых результатов и соблюдать явные ограничения. Кроме того, OpenAI сообщила, что, как и GPT-6 Astra и GPT-6 Sol, модель не пыталась обойти автоматизированный модуль безопасности. Источник не приводит независимых подробностей о методике проверки этих утверждений.
Что меняется на практике?
OpenAI представляет GPT-6.1 Sol как вариант для приложений с большим объёмом использования, где снижение стоимости токенов может быть важнее получения максимально высокого результата в каждом тесте. Это важно для разработчиков программных агентов, сервисов анализа документов и автоматизации, однако разница в результатах по-прежнему зависит от типа задачи и уровня рассуждения, поэтому более низкая стоимость не означает универсальную замену Astra.
Модель доступна подписчикам Plus, Pro, Business, Enterprise и Edu через ChatGPT Work и Codex, а разработчики могут использовать её в OpenAI API под именем gpt-6.1-sol. В стандартном интерфейсе чата ChatGPT она пока не запущена. OpenAI также объявила о выпуске GPT-6.1 Sol Ultrafast и GPT-6 Astra Ultrafast, заявив о скорости до восьми раз выше, чем у Astra, тогда как GPT-6.1 Astra, выпуск которой ожидался на этой неделе, пока не была запущена на фоне сообщений о проблемах безопасности во внутренних тестах.