Reflection AI a annoncé Beam, le premier modèle d’intelligence artificielle à poids ouverts de l’entreprise, avec un accent clair sur la programmation, le raisonnement et les tâches exécutées par des agents d’intelligence artificielle. Le modèle repose sur une architecture de mélange parcimonieux d’experts (Sparse Mixture-of-Experts) et compte au total 501 milliards de paramètres, dont seulement 23 milliards sont actifs lors du traitement de chaque jeton.
L’entreprise affirme que Beam a été préentraîné sur 23,8 billions de jetons provenant de contenus web et d’ensembles de données privés sous licence. Il offre également une fenêtre de contexte d’un million de jetons, une capacité destinée au traitement de documents et de tâches de longue durée. En plus du préentraînement, Reflection AI a largement utilisé l’apprentissage par renforcement pour améliorer les performances du modèle.
Un entraînement intensif axé sur le coût de l’inférence
Au cours de la phase d’apprentissage par renforcement, l’entreprise a fait fonctionner 10 500 unités de traitement graphique Nvidia GB300 pendant quatre semaines et a produit plus de 100 millions d’opérations de rollout. Le nombre d’opérations sandbox utilisées pour l’entraînement et l’évaluation a atteint environ 1,3 milliard.
Reflection AI place l’efficacité de l’inférence au cœur de son discours sur Beam. Selon les tests de l’entreprise, le modèle offre des performances proches de celles de GLM-5.2 de Z.ai dans les tests de raisonnement avancé, tout en utilisant trois à quatre fois moins de capacités de calcul pendant l’inférence. Ces résultats n’ont toutefois pas encore fait l’objet d’une vérification indépendante, et l’entreprise reconnaît que des modèles ouverts plus grands, comme Kimi K3, surpassent Beam en performances brutes dans certains cas.
Résultats en programmation et contrôle de l’effort d’inférence
Reflection AI a indiqué que Beam avait obtenu 77,2 points sur SWE Bench Pro v2-Hard, 80,1 sur Terminal Bench v2.1 et 80,9 sur SWE Bench Verified. L’entreprise affirme que le modèle rivalise avec GLM-5.2 et se rapproche, dans certaines tâches, de modèles Qwen plus grands, mais elle ne revendique pas de supériorité sur ses concurrents dans tous les tests.
Beam comprend un paramètre d’effort de raisonnement qui permet à l’utilisateur de définir le temps de calcul consacré au raisonnement. Les niveaux faibles produisent des réponses plus courtes à moindre coût, tandis que les niveaux élevés permettent au modèle d’utiliser un plus grand nombre de jetons pour traiter des tâches complexes.
Qu’est-ce qui change concrètement ?
Cette conception signifie que la valeur de Beam ne dépend pas uniquement de la taille du modèle ou de son meilleur score de référence, mais aussi de l’équilibre entre la qualité de la réponse et les ressources utilisées pour la produire. Cela pourrait être utile aux développeurs et aux organisations qui exécutent des tâches de programmation ou des agents faisant appel fréquemment au modèle. Toutefois, l’utilité pratique restera liée aux résultats indépendants, au coût de l’infrastructure et aux conditions de mise à disposition des poids et des outils.
Beam est un modèle uniquement textuel, et non multimodal. Lorsqu’il dispose de la possibilité d’utiliser des outils et d’accéder au web, il peut effectuer des recherches dans différentes sources et exploiter les informations fournies par des outils externes. Reflection AI affirme que le modèle a appris pendant son entraînement à utiliser d’autres modèles de langage et à recourir à des interfaces OCR pour lire des documents lorsque l’accès au web est disponible.
Disponibilité et stratégie plus large
L’entreprise cible les organisations, les développeurs et les administrations, et décrit Beam comme un modèle pratique utilisable dans les charges de travail quotidiennes. Ce projet s’inscrit dans l’orientation de Reflection AI visant à construire ce qu’elle appelle des « usines d’intelligence artificielle », permettant aux organisations de personnaliser des systèmes fonctionnant sur leurs données et de les exploiter localement.
Reflection AI a été fondée en 2024 par d’anciens chercheurs de Google DeepMind et a levé environ 4,7 milliards de dollars d’investissements, avec la participation de Nvidia, Sequoia Capital et Lightspeed Venture Partners. Sa valorisation pré-investissement lors de son dernier tour de financement s’élevait à environ 25 milliards de dollars. L’entreprise prévoit de publier les poids de Beam, son rapport technique, sa fiche de modèle et ses outils pour développeurs au cours du mois d’octobre, après l’achèvement des tests de sécurité et des évaluations finales.