Ricoh gab am 31. August 2026 die Entwicklung einer Technologie für physische künstliche Intelligenz (Physical AI) bekannt, die darauf abzielt, Robotern anhand von Bilddaten menschliche Arbeitsabläufe beizubringen, anstatt das Modell direkt an eine bestimmte Roboterstruktur oder Steuerungsarchitektur zu binden. Das Unternehmen erklärte, es habe die Wirksamkeit der Technologie in einer auf physikalischen Bedingungen aufgebauten Simulationsumgebung überprüft. Damit soll das Training von der Simulation auf reale Roboter übertragen werden.
Dieser Schritt steht im Rahmen von Ricohs Bestrebungen, sein Geschäft im Bereich der künstlichen Intelligenz auszubauen, und erfolgt parallel zur Teilnahme am AWS-Japan-Programm zur Beschleunigung der Entwicklung von Physical AI, das Rechenressourcen und Cloud-Dienste zur Unterstützung des Trainings und der Erprobung von Modellen bereitstellt.
Aus Handlungen lernen, statt Roboterbefehle zu speichern
Die Technologie basiert auf einem Latent Action Model (LAM), also einem Modell für latente Handlungen. Das Modell lernt aus Veränderungen in Bildern oder Videos, die während der Ausführung aufgezeichnet wurden, und leitet daraus Handlungen wie das Greifen, Bewegen oder Wegbewegen eines Gegenstands sowie das Bewegen eines Zielelements ab. Nach der Beschreibung von Ricoh konzentriert sich das LAM darauf, das tatsächliche Verhalten zu erlernen, das in der Szene stattfindet, selbst wenn nicht alle Bewegungsdetails oder Befehle in den Beobachtungsdaten ausdrücklich beschrieben sind.
Das Unternehmen weist darauf hin, dass dieser Ansatz die Abhängigkeit des Lernens von den Spezifikationen eines bestimmten Roboters verringern kann, da das Modell eine allgemeine Darstellung der Handlung erlernt, anstatt sich auf Anweisungen zu beschränken, die mit bestimmten Gelenken oder Steuerungsmechanismen verbunden sind. Für das Training des Modells können außerdem Daten menschlicher Handlungen und Roboterhandlungen verwendet werden. Seine Ausgaben können anschließend zur Entwicklung von Vision Language Action-Modellen genutzt werden, die Sehen, Sprache und Handlung miteinander verbinden.
Was ändert sich in der Praxis?
Das Problem, auf das Ricoh abzielt, sind die Kosten für die Erfassung von Trainingsdaten. Da sich die Struktur jedes Roboters und seine spezifische Steuerungsmechanik unterscheiden, müssen üblicherweise für jedes Gerät separat Daten erfasst werden. Bei menschenähnlichen Robotern wird dies noch komplexer. Nach Ansicht des Unternehmens könnte die Trennung der Darstellung einer Handlung von der Roboterstruktur eine umfassendere Wiederverwendung der Daten ermöglichen und die Anpassung von Modellen an mehrere Aufgaben und Roboter unterstützen.
Das bedeutet jedoch nicht, dass die Technologie den Bedarf an roboterspezifischen Daten beseitigt hat. Der Artikel erläutert, dass Ricoh Simulationsumgebungen zum Lernen verwendet und anschließend Sim2Real-Techniken einsetzt, um die Ergebnisse auf reale Roboter zu übertragen. Gleichzeitig wird weiter überprüft, ob die Lösungen für unterschiedliche Roboter und vielfältige Arbeitsumgebungen geeignet sind.
Die Rolle von AWS beim Training und bei der Simulation
Ricoh nutzt AWS-Cloud-Dienste, darunter Amazon EC2 und Amazon S3, um eine skalierbare Lernumgebung aufzubauen, Daten zu speichern und das Training der Modelle auszuführen. Nach Angaben des Unternehmens trägt die Kombination aus Simulation und Cloud-Diensten dazu bei, die Kosten für die Erfassung physischer Daten zu senken, und ermöglicht außerdem ein effizienteres Training mit großen Datenmengen.
Die Initiative ist Teil von Ricohs angekündigter Vision für die Transformation durch künstliche Intelligenz. Diese umfasst Ebenen, die bei KI-Dokumenten, generativer künstlicher Intelligenz und KI-Agenten beginnen und bis zu Physical-AI-Agenten reichen, die mit der physischen Welt interagieren können. Dem Artikel zufolge arbeitet das Unternehmen an möglichen Anwendungen in Büros, Fabriken, der Logistik und der Pflege.
Warum ist diese Nachricht wichtig?
Die Bedeutung dieser Entwicklung liegt in dem Versuch, ein praktisches Hindernis bei Robotern auf Basis künstlicher Intelligenz zu bewältigen: Wie lässt sich der Bedarf verringern, für jeden Roboter oder jede Aufgabe erneut Daten zu erfassen und das Modell zu trainieren? LAM bietet einen Ansatz, um Handlungen aus allgemeineren visuellen Daten zu erlernen, beweist jedoch allein noch nicht die Produktionsreife der Technologie für den großflächigen Einsatz.
Die veröffentlichten Ergebnisse sind weiterhin an Simulationsumgebungen und Validierungstests gebunden. Ricoh weist darauf hin, dass das Unternehmen Proof-of-Concept-Anwendungen für menschenähnliche Roboter in Fabriken begonnen hat und schrittweise zu weiterführenden Validierungsphasen übergeht. Daher bleiben Fragen hinsichtlich des Erfolgs der Übertragung von der Simulation in die Realität, des erforderlichen Datenumfangs und der Stabilität der Leistung bei unterschiedlichen Robotern, Aufgaben und Betriebsumgebungen offen.