La inteligencia artificial destinada a robots y vehículos autónomos está experimentando una transición desde modelos que vinculan la visión con el lenguaje o las acciones hacia arquitecturas que intentan modelar el comportamiento en sí mismo. Esta tendencia recibe el nombre de «modelo de comportamiento grande» (Large Behavior Model), o LBM, un concepto que MONOist considera que podría convertirse en un eje importante del desarrollo de sistemas de conducción autónoma y robots.
El LBM no consiste en añadir una capacidad limitada a un modelo existente, sino en replantear la manera en que el sistema aprende a comportarse dentro de un entorno físico cambiante. En lugar de limitarse a analizar textos o imágenes o a producir código, el modelo pretende generar comportamientos directamente relacionados con el movimiento y la interacción con el mundo real.
De los modelos de extremo a extremo a la modelización del comportamiento
Durante mucho tiempo, la investigación sobre conducción autónoma se basó en el enfoque «de extremo a extremo» (End-to-End), en el que una red neuronal recibe datos de sensores, como cámaras y LiDAR, y después los procesa mediante etapas de análisis, planificación y control para producir salidas que conducen o dirigen el vehículo.
Este enfoque permite al sistema aprender de los datos de forma unificada, pero afronta dificultades para interpretar sus decisiones y para manejar situaciones poco frecuentes o cambiantes. Según el artículo, el LBM intenta resolver esta brecha mediante el aprendizaje de representaciones más amplias que incluyen la predicción del estado futuro, la comprensión de los cambios en el entorno y la selección de la acción óptima en distintas circunstancias.
Este enfoque difiere de los conocidos modelos de inteligencia artificial generativa, como los modelos grandes de lenguaje (LLM) y los modelos de generación de imágenes, y también de los modelos de inteligencia artificial utilizados en programación, como GitHub Copilot y Claude Code. En el caso del LBM, las salidas principales no son texto, imágenes ni código, sino comportamientos ejecutables en el mundo físico.
Los inicios del concepto en la investigación robótica
El artículo señala que Toyota Research Institute (TRI) fue una de las primeras entidades en presentar el concepto de forma sistemática en el ámbito de la robótica. En 2025, TRI anunció una investigación conjunta con Boston Dynamics y presentó un artículo de investigación titulado «Pretrained Large Behavior Models Accelerate Robot Learning».
MONOist citó a Russ Tedrake, del Instituto de Tecnología de Massachusetts, quien describió el LBM como un modelo integral del comportamiento robótico y lo consideró un concepto general que puede incluir modelos de «visión, lenguaje y acción», o VLA. Esto indica que el LBM no necesariamente elimina los modelos anteriores, sino que puede funcionar como un marco más amplio que los integre y se centre en transformar la comprensión en comportamiento.
XPeng lleva el concepto a los vehículos
Otra aplicación aparece en la empresa china XPeng, que está ampliando su actividad desde los automóviles hacia los robots y la conducción autónoma. La empresa había anunciado en 2024 un modelo VLA que vinculaba la percepción y el control directo del vehículo, pero concluyó que el modelo VLA por sí solo no ofrecía suficiente flexibilidad para afrontar todas las condiciones de la conducción autónoma.
El 24 de abril de 2026, XPeng anunció durante Auto China 2026 el inicio de la producción en masa del sistema de conducción autónoma VLA 2.0, del que afirmó que reflejaba la incorporación del LBM al sistema de conducción. Posteriormente, el 3 de junio de 2026, durante la conferencia CVPR 2026, la empresa presentó investigaciones sobre el desarrollo y el uso de VLA 2.0 y del «modelo del mundo» (World Model), que, según el artículo, es uno de los componentes de la arquitectura LBM.
El modelo del mundo se utiliza para simular el entorno y comprender cómo cambia, lo que permite al sistema evaluar las posibles consecuencias de las acciones antes de ejecutarlas. En la teoría del LBM, esta capacidad ayuda a elegir el comportamiento más adecuado en lugar de responder directamente a una señal de un sensor o a una situación aislada.
¿Por qué es importante esta noticia?
El cambio real no es tanto el lanzamiento de un producto independiente como una transición en el nivel de reflexión arquitectónica de los sistemas robóticos y de conducción autónoma. Si los modelos LBM tienen éxito, los sistemas de control podrían depender menos de reglas separadas para cada situación y tener mayor capacidad para generalizar lo aprendido a situaciones nuevas.
Sin embargo, el artículo no demuestra que el LBM se haya convertido en un estándar maduro ni que haya superado efectivamente a los modelos VLA o a los modelos de extremo a extremo. El concepto sigue vinculado a programas de investigación y aplicaciones iniciales, y operar un comportamiento seguro y explicable en el mundo físico impone requisitos que no aparecen en los modelos que solo producen textos o imágenes. Por ello, las cuestiones abiertas siguen relacionadas con la capacidad de estos modelos para verificar sus decisiones, afrontar situaciones imprevistas y alcanzar una fiabilidad suficiente para su uso comercial a gran escala.
La participación de Toyota Research Institute y XPeng indica que la competencia no gira únicamente en torno al tamaño del modelo, sino también en torno a los datos de comportamiento, la simulación del mundo y la conexión del modelo con los sistemas de control reales. Esto convierte al LBM en una tendencia que merece seguimiento en los robots y los vehículos autónomos, sin considerarlo por ahora una solución definitiva al problema.