Ricoh anunció el 31 de agosto de 2026 el desarrollo de una tecnología de inteligencia artificial física (Physical AI) destinada a enseñar a los robots acciones relacionadas con el trabajo humano mediante datos de imágenes, en lugar de vincular el modelo directamente a una arquitectura robótica o a un mecanismo de control específico. La empresa afirmó que verificó la eficacia de la tecnología dentro de un entorno de simulación construido sobre la base de condiciones físicas, en un paso orientado a trasladar el entrenamiento de la simulación a robots reales.
Este paso forma parte de la estrategia de Ricoh para ampliar sus actividades en inteligencia artificial y se desarrolla paralelamente a su participación en el programa AWS Japan para acelerar el desarrollo de Physical AI, que proporciona recursos informáticos y servicios en la nube para apoyar el entrenamiento y las pruebas de modelos.
Aprender de las acciones en lugar de memorizar órdenes del robot
La tecnología se basa en el modelo Latent Action Model (LAM), o modelo de acciones latentes. El modelo aprende a partir de cambios en imágenes o vídeos grabados durante el trabajo, para inferir acciones como agarrar un objeto, moverlo, apartarlo o desplazar un elemento objetivo. Según la descripción de Ricoh, el LAM se centra en aprender el comportamiento real que ocurre en la escena, incluso cuando no todos los detalles del movimiento o las órdenes están descritos explícitamente en los datos de observación.
La empresa señala que este enfoque puede reducir la dependencia del aprendizaje respecto a las especificaciones de un robot concreto, porque el modelo aprende una representación general de la acción en lugar de limitarse a instrucciones vinculadas a articulaciones o mecanismos de control específicos. También pueden utilizarse datos de acciones humanas y robóticas para entrenar el modelo y, posteriormente, aprovechar sus resultados para desarrollar modelos de Vision Language Action que combinen visión, lenguaje y acción.
¿Qué cambia en la práctica?
El problema que Ricoh pretende abordar es el coste de recopilar datos de entrenamiento. Las diferencias en la arquitectura de cada robot y en su mecanismo de control suelen obligar a recopilar datos para cada dispositivo por separado, algo que se vuelve más complejo en los robots humanoides. La empresa considera que separar la representación de la acción de la arquitectura del robot podría permitir reutilizar los datos en mayor medida y facilitar la adaptación de los modelos a múltiples tareas y robots.
Esto no significa que la tecnología haya eliminado la necesidad de datos específicos de los robots. El artículo explica que Ricoh utiliza entornos de simulación para el aprendizaje y después recurre a técnicas de Sim2Real para trasladar los resultados a robots reales, mientras continúa verificando la adecuación de las soluciones a distintos robots y entornos de trabajo.
El papel de AWS en el entrenamiento y la simulación
Ricoh utiliza servicios en la nube de AWS, entre ellos Amazon EC2 y Amazon S3, para construir un entorno de aprendizaje escalable, almacenar datos y ejecutar el entrenamiento de modelos. La empresa afirma que la combinación de la simulación y los servicios en la nube ayuda a reducir el coste de recopilar datos físicos y permite realizar el entrenamiento con grandes volúmenes de datos de forma más eficiente.
La iniciativa se enmarca en la visión anunciada por Ricoh para la transformación mediante inteligencia artificial, que incluye capas que comienzan con la documentación de inteligencia artificial, la inteligencia artificial generativa y los agentes de inteligencia artificial, hasta llegar a agentes de Physical AI capaces de interactuar con el mundo físico. Según el artículo, la empresa trabaja en posibles aplicaciones para oficinas, fábricas, logística y atención.
¿Por qué es importante esta noticia?
La importancia del desarrollo reside en el intento de abordar un obstáculo práctico de los robots basados en inteligencia artificial: ¿cómo reducir la necesidad de volver a recopilar datos y entrenar el modelo para cada robot o tarea? El LAM ofrece una vía para aprender acciones a partir de datos visuales más generales, pero por sí solo no demuestra que la tecnología esté preparada para una producción a gran escala.
Los resultados anunciados siguen vinculados a entornos de simulación y a pruebas de verificación, mientras que Ricoh señala que ha comenzado aplicaciones de prueba de concepto para robots humanoides en fábricas y trabaja en avanzar gradualmente hacia fases de verificación más avanzadas. Por ello, siguen abiertas las preguntas relacionadas con el grado de éxito de la transferencia de la simulación a la realidad, la cantidad de datos necesaria y la estabilidad del rendimiento cuando cambian los robots, las tareas y los entornos operativos.