Reflection AI объявила о Beam — первой модели искусственного интеллекта компании с открытыми весами, ориентированной прежде всего на программирование, рассуждения и задачи, выполняемые ИИ-агентами. Модель основана на разреженной архитектуре смеси экспертов (Sparse Mixture-of-Experts) и насчитывает 501 миллиард параметров в общей сложности, однако при обработке каждого токена активными являются лишь 23 миллиарда из них.
Компания заявляет, что Beam предварительно обучалась на 23,8 триллиона токенов, полученных из веб-контента и лицензированных частных наборов данных. Модель также предоставляет контекстное окно размером в миллион токенов — такая ёмкость предназначена для работы с длинными документами и задачами. Помимо предварительного обучения, Reflection AI широко применяла обучение с подкреплением для повышения производительности модели.
Интенсивное обучение и акцент на стоимости инференса
На этапе обучения с подкреплением компания использовала 10 500 графических процессоров Nvidia GB300 на протяжении четырёх недель и выполнила более 100 миллионов операций rollout. Количество операций sandbox, использованных в обучении и оценивании, составило около 1,3 миллиарда.
Reflection AI ставит эффективность инференса во главу своего описания Beam. Согласно тестам компании, модель демонстрирует результаты, близкие к GLM-5.2 от Z.ai в тестах на продвинутые рассуждения, используя при этом в три-четыре раза меньше вычислительных ресурсов во время инференса. Однако эти результаты пока не прошли независимую проверку, а компания признаёт, что более крупные открытые модели, такие как Kimi K3, в некоторых случаях превосходят Beam по показателям необработанной производительности.
Результаты в программировании и управление усилиями при рассуждении
Reflection AI сообщила, что Beam набрала 77,2 балла в SWE Bench Pro v2-Hard, 80,1 — в Terminal Bench v2.1 и 80,9 — в SWE Bench Verified. Компания утверждает, что модель конкурирует с GLM-5.2 и в некоторых задачах приближается к более крупным моделям Qwen, однако не заявляет о превосходстве над конкурентами во всех тестах.
Beam включает параметр reasoning effort, позволяющий пользователю задавать объём вычислительного времени, выделяемого на рассуждение. Низкие уровни дают более короткие ответы с меньшими затратами, тогда как высокие уровни позволяют модели использовать большее количество токенов для обработки сложных задач.
Что это меняет на практике?
Такая конструкция означает, что ценность Beam зависит не только от размера модели или наивысшего результата в бенчмарках, но и от баланса между качеством ответа и ресурсами, затрачиваемыми на его получение. Это может быть полезно разработчикам и организациям, которые запускают программные задачи или агентов, регулярно обращающихся к модели. Однако практическая польза по-прежнему будет зависеть от независимых результатов, стоимости инфраструктуры, а также условий предоставления весов и инструментов.
Beam — исключительно текстовая модель, а не мультимодальная. При наличии доступа к инструментам и вебу она может искать информацию в различных источниках и использовать сведения, предоставляемые внешними инструментами. Reflection AI заявляет, что в ходе обучения модель научилась использовать другие языковые модели и обращаться к интерфейсам OCR для чтения документов при наличии доступа к вебу.
Доступность и более широкая стратегия
Компания ориентируется на организации, разработчиков и государственные структуры, описывая Beam как практичную модель, пригодную для использования в повседневных рабочих нагрузках. Этот план соответствует более широкому направлению Reflection AI по созданию того, что компания называет «фабриками искусственного интеллекта», позволяющими организациям адаптировать системы под свои данные и запускать их локально.
Reflection AI была основана в 2024 году бывшими исследователями Google DeepMind и привлекла около 4,7 миллиарда долларов инвестиций при участии Nvidia, Sequoia Capital и Lightspeed Venture Partners. Её оценка до привлечения средств в последнем раунде финансирования составила около 25 миллиардов долларов. Компания намерена опубликовать веса Beam, технический отчёт, карточку модели и инструменты для разработчиков в течение октября после завершения проверок безопасности и итоговых оцениваний.