Die für Roboter und autonome Fahrzeuge bestimmte künstliche Intelligenz erlebt einen Wandel: weg von Modellen, die Wahrnehmung mit Sprache oder Aktionen verbinden, hin zu Architekturen, die versuchen, das Verhalten selbst zu modellieren. Diese Entwicklung wird als „Large Behavior Model“ oder LBM bezeichnet. MONOist zufolge könnte es zu einem wichtigen Schwerpunkt bei der Entwicklung autonomer Fahrsysteme und Roboter werden.
Beim LBM geht es nicht darum, einem bestehenden Modell eine begrenzte Fähigkeit hinzuzufügen, sondern die Art und Weise neu zu betrachten, wie ein System lernt, sich in einer sich verändernden physischen Umgebung zu verhalten. Statt lediglich Texte oder Bilder zu analysieren oder Code zu erzeugen, zielt das Modell darauf ab, Verhaltensweisen zu generieren, die unmittelbar mit der Bewegung und der Interaktion mit der realen Welt verbunden sind.
Von End-to-End-Modellen zur Verhaltensmodellierung
Die Forschung zum autonomen Fahren stützte sich lange auf den „End-to-End“-Ansatz, bei dem ein neuronales Netzwerk Sensordaten wie Kamerabilder und LiDAR empfängt und sie anschließend über Analyse-, Planungs- und Steuerungsphasen weiterleitet, um Ausgaben zu erzeugen, die das Fahrzeug lenken oder führen.
Dieser Ansatz ermöglicht es dem System, einheitlich aus Daten zu lernen, steht jedoch vor Herausforderungen bei der Nachvollziehbarkeit seiner Entscheidungen sowie beim Umgang mit seltenen oder wechselnden Situationen. Dem Artikel zufolge versucht das LBM, diese Lücke zu schließen, indem es umfassendere Repräsentationen erlernt, die die Vorhersage des künftigen Zustands, das Verständnis von Veränderungen in der Umgebung und die Auswahl des optimalen Verhaltens unter verschiedenen Bedingungen umfassen.
Dieser Ansatz unterscheidet sich von bekannten generativen KI-Modellen wie Large Language Models (LLM) und Modellen zur Bilderzeugung. Ebenso unterscheidet er sich von KI-Modellen, die beim Programmieren eingesetzt werden, etwa GitHub Copilot und Claude Code. Die grundlegenden Ausgaben eines LBM sind kein Text, kein Bild und kein Code, sondern in der physischen Welt ausführbares Verhalten.
Die Anfänge des Konzepts in der Roboterforschung
Der Artikel weist darauf hin, dass das Toyota Research Institute (TRI) zu den ersten Organisationen gehörte, die das Konzept im Bereich der Robotik systematisch vorstellten. Im Jahr 2025 kündigte das TRI eine gemeinsame Forschung mit Boston Dynamics an und legte eine Forschungsarbeit mit dem Titel „Pretrained Large Behavior Models Accelerate Robot Learning“ vor.
MONOist zitierte Russ Tedrake vom Massachusetts Institute of Technology, der das LBM als umfassendes Modell für das Verhalten eines Roboters beschrieb und es als allgemeines Konzept betrachtete, das Modelle für „Vision, Sprache und Aktion“ oder VLA einschließen kann. Dies deutet darauf hin, dass das LBM frühere Modelle nicht zwangsläufig ersetzt, sondern als umfassenderer Rahmen dienen kann, der sie einbindet und sich darauf konzentriert, Verständnis in Verhalten umzusetzen.
XPeng bringt das Konzept in Fahrzeuge
Eine weitere Anwendung findet sich beim chinesischen Unternehmen XPeng, das seine Aktivitäten von Autos auf Roboter und autonomes Fahren ausweitet. Das Unternehmen hatte 2024 ein VLA-Modell angekündigt, das Wahrnehmung und die direkte Steuerung des Fahrzeugs verbindet. Es kam jedoch zu dem Schluss, dass ein VLA-Modell allein nicht genügend Flexibilität für den Umgang mit sämtlichen Bedingungen des autonomen Fahrens bietet.
Am 24. April 2026 kündigte XPeng während der Auto China 2026 den Beginn der Massenproduktion des autonomen Fahrsystems VLA 2.0 an. Das Unternehmen erklärte, dieses spiegele die Einführung eines LBM in das Fahrsystem wider. Anschließend präsentierte das Unternehmen am 3. Juni 2026 während der CVPR 2026 Forschung zur Entwicklung und Nutzung von VLA 2.0 sowie eines „World Model“, das dem Artikel zufolge zu den Komponenten einer LBM-Architektur gehört.
Das World Model wird verwendet, um die Umgebung zu simulieren und zu verstehen, wie sie sich verändert. Dadurch kann das System die möglichen Folgen von Aktionen bewerten, bevor es sie ausführt. In der Theorie des LBM hilft diese Fähigkeit dabei, das geeignetste Verhalten auszuwählen, anstatt unmittelbar auf ein Sensorsignal oder eine einzelne Situation zu reagieren.
Warum ist diese Nachricht wichtig?
Die tatsächliche Veränderung besteht hier weniger in der Einführung eines eigenständigen Produkts als in einem Wandel der architektonischen Denkweise bei Robotik- und autonomen Fahrsystemen. Wenn LBM-Modelle erfolgreich sind, könnten Steuerungssysteme weniger auf getrennte Regeln für jede Situation angewiesen sein und besser in der Lage werden, das Gelernte auf neue Situationen zu übertragen.
Der Artikel belegt jedoch nicht, dass LBM bereits ein ausgereifter Standard ist oder VLA- beziehungsweise End-to-End-Modelle tatsächlich übertroffen hat. Das Konzept steht weiterhin im Zusammenhang mit Forschungsprogrammen und frühen Anwendungen. Zudem stellt der Betrieb eines sicheren und erklärbaren Verhaltens in der physischen Welt Anforderungen, die bei Modellen, die ausschließlich Texte oder Bilder erzeugen, nicht sichtbar werden. Daher beziehen sich die offenen Fragen weiterhin auf die Fähigkeit dieser Modelle, ihre Entscheidungen zu überprüfen, mit unerwarteten Situationen umzugehen und eine für den kommerziellen Einsatz in großem Maßstab ausreichende Zuverlässigkeit zu erreichen.
Die Beteiligung des Toyota Research Institute und von XPeng deutet darauf hin, dass der Wettbewerb nicht nur die Modellgröße betrifft, sondern auch Verhaltensdaten, die Simulation der Welt und die Verbindung des Modells mit tatsächlichen Steuerungssystemen. Dadurch wird LBM zu einer Entwicklung, die in der Robotik und bei autonomen Fahrzeugen beobachtet werden sollte, ohne es bislang als endgültige Lösung des Problems zu betrachten.