L’intelligence artificielle destinée aux robots et aux véhicules autonomes connaît une transition : elle passe de modèles reliant la vision au langage ou aux actions à des architectures qui tentent de modéliser le comportement lui-même. Cette tendance est appelée « Large Behavior Model », ou LBM, un concept que MONOist considère comme susceptible de devenir un axe important du développement des systèmes de conduite autonome et des robots.
Le LBM ne consiste pas à ajouter une capacité limitée à un modèle existant, mais à repenser la manière dont le système apprend à agir dans un environnement physique changeant. Au lieu de se limiter à analyser des textes ou des images, ou à produire du code, le modèle vise à générer des comportements directement liés au mouvement et à l’interaction avec le monde réel.
Des modèles de bout en bout à la modélisation du comportement
Les recherches sur la conduite autonome se sont longtemps appuyées sur une approche « de bout en bout » (End-to-End), dans laquelle un réseau neuronal reçoit les données des capteurs, tels que les caméras et le LiDAR, puis les fait passer par des étapes d’analyse, de planification et de contrôle afin de produire des sorties qui conduisent ou dirigent le véhicule.
Cette approche permet au système d’apprendre uniformément à partir des données, mais elle rencontre des difficultés pour expliquer ses décisions et gérer les situations rares ou changeantes. Selon l’article, le LBM tente de combler cette lacune en apprenant des représentations plus larges comprenant la prédiction de l’état futur, la compréhension des changements dans l’environnement et la sélection de l’action optimale dans différentes conditions.
Cette approche se distingue des modèles d’intelligence artificielle générative connus, tels que les grands modèles de langage (LLM) et les modèles de génération d’images. Elle diffère également des modèles d’intelligence artificielle utilisés pour la programmation, comme GitHub Copilot et Claude Code. Dans le cas du LBM, les sorties principales ne sont ni du texte, ni une image, ni du code, mais un comportement exécutable dans le monde physique.
Les débuts du concept dans la recherche en robotique
L’article indique que le Toyota Research Institute (TRI) a été l’un des premiers organismes à présenter systématiquement le concept dans le domaine de la robotique. En 2025, le TRI a annoncé une recherche conjointe avec Boston Dynamics et présenté un article de recherche intitulé « Pretrained Large Behavior Models Accelerate Robot Learning ».
MONOist a cité Russ Tedrake, du Massachusetts Institute of Technology, qui décrit le LBM comme un modèle général du comportement des robots, tout en le considérant comme un concept général pouvant inclure des modèles de « vision, langage et action », ou VLA. Cela indique que le LBM n’élimine pas nécessairement les modèles précédents, mais peut servir de cadre plus large les englobant et mettant l’accent sur la transformation de la compréhension en comportement.
XPeng étend le concept aux véhicules
Une autre application apparaît chez l’entreprise chinoise XPeng, qui étend ses activités des voitures aux robots et à la conduite autonome. L’entreprise avait annoncé en 2024 un modèle VLA reliant la perception et le contrôle direct du véhicule, mais elle est parvenue à la conclusion que le modèle VLA seul n’offrait pas une flexibilité suffisante pour gérer toutes les conditions de la conduite autonome.
Le 24 avril 2026, XPeng a annoncé lors d’Auto China 2026 le lancement de la production en série du système de conduite autonome VLA 2.0, qui, selon l’entreprise, reflète l’intégration du LBM dans le système de conduite. Le 3 juin 2026, lors de la conférence CVPR 2026, l’entreprise a ensuite présenté des recherches sur le développement et l’utilisation de VLA 2.0 et du « modèle du monde » (World Model), qui constitue l’un des composants de l’architecture LBM selon l’article.
Le modèle du monde est utilisé pour simuler l’environnement et comprendre la manière dont il évolue, ce qui permet au système d’évaluer les conséquences potentielles des actions avant de les exécuter. Dans la théorie du LBM, cette capacité aide à sélectionner le comportement le plus approprié au lieu de réagir directement à un signal de capteur ou à une situation isolée.
Pourquoi cette information est-elle importante ?
Le changement réel ne réside pas tant dans le lancement d’un produit indépendant que dans une transition au niveau de la réflexion architecturale des systèmes robotiques et de conduite autonome. Si les modèles LBM réussissent, les systèmes de contrôle pourraient devenir moins dépendants de règles distinctes pour chaque situation et davantage capables de généraliser ce qu’ils ont appris à de nouvelles situations.
Cependant, l’article ne prouve pas que le LBM soit devenu une norme mature ni qu’il ait effectivement surpassé les modèles VLA ou les modèles de bout en bout. Le concept reste lié à des programmes de recherche et à des applications précoces. En outre, l’exécution d’un comportement sûr et explicable dans le monde physique impose des exigences qui n’apparaissent pas dans les modèles produisant uniquement du texte ou des images. Les questions ouvertes restent donc liées à la capacité de ces modèles à vérifier leurs décisions, à gérer les situations imprévues et à atteindre une fiabilité suffisante pour une utilisation commerciale à grande échelle.
La participation du Toyota Research Institute et de XPeng indique que la concurrence ne porte pas uniquement sur la taille du modèle, mais aussi sur les données comportementales, la simulation du monde et la connexion du modèle aux systèmes de contrôle réels. Cela fait du LBM une tendance qui mérite d’être suivie dans les domaines de la robotique et des véhicules autonomes, sans toutefois le considérer pour l’instant comme une solution définitive au problème.