Reflection AI anunció Beam, el primer modelo de inteligencia artificial de pesos abiertos de la empresa, con un enfoque claro en la programación, el razonamiento y las tareas ejecutadas por agentes de inteligencia artificial. El modelo se basa en una arquitectura de mezcla dispersa de expertos (Sparse Mixture-of-Experts) y cuenta con 501.000 millones de parámetros en total, aunque solo 23.000 millones están activos al procesar cada token.
La empresa afirma que Beam fue preentrenado con 23,8 billones de tokens obtenidos de contenido web y conjuntos de datos privados con licencia. También ofrece una ventana de contexto de un millón de tokens, una capacidad destinada a trabajar con documentos y tareas extensos. Además del preentrenamiento, Reflection AI utilizó aprendizaje por refuerzo a gran escala para mejorar el rendimiento del modelo.
Entrenamiento intensivo y enfoque en el coste de inferencia
Durante la fase de aprendizaje por refuerzo, la empresa utilizó 10.500 unidades de procesamiento gráfico Nvidia GB300 durante cuatro semanas y generó más de 100 millones de operaciones de rollout. El número de operaciones de sandbox utilizadas en el entrenamiento y la evaluación fue de aproximadamente 1.300 millones.
Reflection AI sitúa la eficiencia de inferencia en el centro de su propuesta sobre Beam. Según las pruebas de la empresa, el modelo ofrece un rendimiento cercano al de GLM-5.2 de Z.ai en pruebas de razonamiento avanzado, utilizando entre tres y cuatro veces menos capacidad computacional durante la inferencia. Sin embargo, estos resultados aún no han sido verificados de forma independiente, y la empresa reconoce que modelos abiertos más grandes, como Kimi K3, superan a Beam en rendimiento bruto en algunos casos.
Resultados en programación y control del esfuerzo de inferencia
Reflection AI informó de que Beam obtuvo 77,2 puntos en SWE Bench Pro v2-Hard, 80,1 en Terminal Bench v2.1 y 80,9 en SWE Bench Verified. La empresa afirma que el modelo compite con GLM-5.2 y se acerca en algunas tareas a modelos Qwen más grandes, pero no sostiene que supere a sus competidores en todas las pruebas.
Beam incluye un parámetro de esfuerzo de razonamiento que permite al usuario determinar la cantidad de tiempo computacional destinada al razonamiento. Los niveles bajos producen respuestas más breves a menor coste, mientras que los niveles altos permiten al modelo utilizar un mayor número de tokens para procesar tareas complejas.
¿Qué cambia en la práctica?
Este diseño significa que el valor de Beam no depende únicamente del tamaño del modelo o de la puntuación máxima en una prueba de referencia, sino del equilibrio entre la calidad de la respuesta y los recursos utilizados para producirla. Esto puede beneficiar a desarrolladores y organizaciones que ejecutan tareas de programación o agentes que dependen de invocar el modelo de forma repetida. Sin embargo, el beneficio práctico seguirá estando vinculado a resultados independientes, al coste de la infraestructura y a las condiciones de disponibilidad de los pesos y las herramientas.
Beam es un modelo exclusivamente textual, no multimodal. Al dotarlo de la capacidad de utilizar herramientas y acceder a la web, puede buscar en distintas fuentes y aprovechar la información proporcionada por herramientas externas. Reflection AI afirma que el modelo aprendió durante el entrenamiento a utilizar otros modelos lingüísticos y recurrir a interfaces de OCR para leer documentos cuando se le proporciona acceso a la web.
Disponibilidad y estrategia más amplia
La empresa se dirige a instituciones, desarrolladores y organismos gubernamentales, y describe Beam como un modelo práctico que puede utilizarse en cargas de trabajo diarias. El plan se enmarca en la orientación de Reflection AI hacia la construcción de lo que denomina «fábricas de inteligencia artificial», lo que permitiría a las organizaciones personalizar sistemas que funcionen con sus propios datos y ejecutarlos localmente.
Reflection AI se fundó en 2024 por antiguos investigadores de Google DeepMind y ha recaudado aproximadamente 4.700 millones de dólares en inversiones, con la participación de Nvidia, Sequoia Capital y Lightspeed Venture Partners. Su valoración premoney en la última ronda de financiación fue de aproximadamente 25.000 millones de dólares. La empresa tiene previsto publicar los pesos de Beam, su informe técnico, la tarjeta del modelo y las herramientas para desarrolladores durante octubre, tras completar las pruebas de seguridad y las evaluaciones finales.