Reflection AI hat Beam vorgestellt, das erste Modell des Unternehmens mit offenen Gewichten. Es konzentriert sich klar auf Programmierung, Schlussfolgerungen und Aufgaben, die von KI-Agenten ausgeführt werden. Das Modell basiert auf einer Sparse-Mixture-of-Experts-Architektur und umfasst insgesamt 501 Milliarden Parameter, von denen bei der Verarbeitung jedes Tokens jedoch nur 23 Milliarden aktiv sind.
Nach Angaben des Unternehmens wurde Beam vorab mit 23,8 Billionen Tokens trainiert, die aus Webinhalten und lizenzierten privaten Datensätzen stammen. Außerdem bietet es ein Kontextfenster von einer Million Tokens, das auf die Verarbeitung langer Dokumente und Aufgaben ausgerichtet ist. Zusätzlich zum Vortraining setzte Reflection AI in großem Umfang Reinforcement Learning ein, um die Leistung des Modells zu verbessern.
Intensives Training und Fokus auf Inferenzkosten
Während der Reinforcement-Learning-Phase betrieb das Unternehmen 10.500 Nvidia-GB300-Grafikprozessoren vier Wochen lang und erzeugte mehr als 100 Millionen Rollouts. Die Zahl der im Training und in der Bewertung verwendeten Sandbox-Vorgänge belief sich auf etwa 1,3 Milliarden.
Reflection AI stellt die Inferenz effizienz in den Mittelpunkt seiner Darstellung von Beam. Nach Unternehmensangaben erzielt das Modell bei Tests zu fortgeschrittenen Schlussfolgerungen eine Leistung nahe an GLM-5.2 von Z.ai und benötigt während der Inferenz drei- bis viermal weniger Rechenkapazität. Diese Ergebnisse wurden jedoch noch nicht unabhängig überprüft. Das Unternehmen räumt außerdem ein, dass größere offene Modelle wie Kimi K3 Beam in einigen Fällen bei der reinen Leistung übertreffen.
Programmierergebnisse und Steuerung des Inferenzaufwands
Reflection AI zufolge erzielte Beam 77,2 Punkte bei SWE Bench Pro v2-Hard, 80,1 bei Terminal Bench v2.1 und 80,9 bei SWE Bench Verified. Nach Angaben des Unternehmens konkurriert das Modell mit GLM-5.2 und nähert sich bei einigen Aufgaben größeren Qwen-Modellen an. Einen Vorsprung gegenüber den Wettbewerbern in sämtlichen Tests beansprucht das Unternehmen jedoch nicht.
Beam verfügt über einen Parameter für den reasoning effort, mit dem Nutzer den für Schlussfolgerungen vorgesehenen Rechenaufwand festlegen können. Niedrige Stufen erzeugen kürzere Antworten zu geringeren Kosten, während höhere Stufen dem Modell erlauben, für die Verarbeitung komplexer Aufgaben eine größere Anzahl von Tokens zu verwenden.
Was ändert sich in der Praxis?
Dieses Design bedeutet, dass der Wert von Beam nicht allein von der Modellgröße oder dem besten Benchmark-Ergebnis abhängt, sondern vom Ausgleich zwischen Antwortqualität und den für ihre Erstellung eingesetzten Ressourcen. Dies könnte Entwicklern und Organisationen zugutekommen, die Programmieraufgaben oder Agenten betreiben, die wiederholt auf das Modell zugreifen. Der praktische Nutzen wird jedoch weiterhin von unabhängigen Ergebnissen, den Infrastrukturkosten sowie den Bedingungen für die Bereitstellung der Gewichte und Werkzeuge abhängen.
Beam ist ein reines Textmodell und kein multimodales Modell. Wenn es mit Werkzeugnutzung und Webzugriff ausgestattet wird, kann es in verschiedenen Quellen recherchieren und die von externen Werkzeugen bereitgestellten Informationen nutzen. Reflection AI zufolge lernte das Modell während des Trainings, andere Sprachmodelle einzusetzen und bei verfügbarem Webzugriff auf OCR-Schnittstellen zum Lesen von Dokumenten zurückzugreifen.
Verfügbarkeit und die umfassendere Strategie
Das Unternehmen richtet sich an Organisationen, Entwickler und staatliche Stellen und beschreibt Beam als ein praxistaugliches Modell, das sich für alltägliche Arbeitslasten einsetzen lässt. Der Plan ist Teil der Ausrichtung von Reflection AI auf den Aufbau dessen, was das Unternehmen als „KI-Fabriken“ bezeichnet. Dies soll Organisationen ermöglichen, Systeme an ihre Daten anzupassen und lokal zu betreiben.
Reflection AI wurde 2024 von ehemaligen Forschern von Google DeepMind gegründet und sammelte rund 4,7 Milliarden US-Dollar an Investitionen ein, unter Beteiligung von Nvidia, Sequoia Capital und Lightspeed Venture Partners. Die Bewertung vor der letzten Finanzierungsrunde belief sich auf etwa 25 Milliarden US-Dollar. Das Unternehmen beabsichtigt, die Gewichte von Beam, seinen technischen Bericht, die Modellkarte und die Entwicklerwerkzeuge im Oktober zu veröffentlichen, nachdem die Sicherheitstests und abschließenden Bewertungen abgeschlossen sind.