Anthropic и OpenAI запустили новые модели, ориентированные на профессиональное использование, объединив повышение производительности со снижением стоимости эксплуатации моделей. Это происходит в период, когда экономическая эффективность и надежность моделей в программировании и корпоративных задачах приобретают все большее значение, наряду с продолжающимися спорами о безопасности передовых моделей.
Opus 5.5 ориентирован на сложные задачи
Anthropic представила модель Opus 5.5, которая, по словам компании, лучше справляется со сложными задачами, обнаружением и исправлением программных ошибок, анализом финансовых данных и выполнением бизнес-задач. Тесты компании указывают на превосходство модели над GPT-6 Astra в задачах агентного программирования в тестах Terminal-Bench 4.0 и FrontierCode v1.1 (Main).
Anthropic заявляет, что модель создает более понятные тексты и на 85% реже пытается обходить ограничения и средства контроля по сравнению с предыдущими моделями. Компания также снизила цену за миллион входных токенов до 4 долларов, а за миллион выходных токенов — до 20 долларов, тогда как для модели Opus 5 эти цены составляли соответственно 5 и 25 долларов.
Три разных уровня стоимости у OpenAI
OpenAI запустила модели GPT-6 Sol и GPT-6 Luna с улучшениями в профессиональной работе, программировании и использовании компьютера. Компания заявляет, что стоимость обеих моделей до 50% ниже по сравнению с рекламными ценами моделей GPT-5.6.
Цена миллиона входных токенов в GPT-6 Sol составляет 2 доллара, а выходных — 10 долларов. Для GPT-6 Luna миллион входных токенов стоит 10 центов, а миллион выходных токенов — 50 центов. По данным OpenAI, GPT-6 Sol совершает примерно вдвое меньше ошибок, чем предыдущая модель, а в программировании достигает уровня производительности, сопоставимого с Fable 5.1, при более низкой стоимости.
Улучшения также включают более ясное общение и поддержку временного хранения контекста команд, что позволяет повторно использовать больший объем контекста и ускорять ответы.
Что меняется на практике?
Новые цены дают разработчикам и компаниям больше возможностей использовать модели в повторяющихся задачах или задачах с большим числом обращений, тогда как более мощные модели предназначены для программирования, анализа и агентного выполнения задач. Однако приведенные данные о превосходстве, точности и безопасности получены в тестах самих компаний и поэтому сами по себе не доказывают общего превосходства во всех случаях использования или средах.
Улучшения безопасности и доступность
OpenAI заявляет, что модели GPT-6 стали реже предоставлять недостоверную информацию о результатах программных задач и чаще отклоняют попытки обойти защитные процедуры при получении небезопасных команд. Обе компании работают над предложением стандартов, которые внешние оценочные организации смогут использовать для измерения развития и безопасности моделей, однако пока неясно, превратятся ли эти предложения в единый стандарт.
Opus 5.5 доступна через Claude, а также через Amazon Web Services, Google Cloud и Microsoft Azure. GPT-6 Sol и GPT-6 Luna доступны через ChatGPT Work и Codex клиентам тарифных планов Plus, Pro, Business и Enterprise, тогда как пользователи бесплатного плана и подписчики Go получают только GPT-6 Luna через настольное приложение компании.