La empresa china de inteligencia artificial encarnada X Square Robot plantea una visión clara para construir robots generales capaces de pasar de una tarea y una plataforma a otra: un stack integrado que comienza con los datos de interacción, pasa por un modelo del mundo físico y termina en un modelo de acciones que combina percepción, planificación, razonamiento y toma de decisiones para producir un comportamiento ejecutable. Esta propuesta llega en un momento en que los robots todavía dependen en gran medida de componentes separados que no necesariamente producen una capacidad general transferible de una tarea a otra o de una máquina a otra.
A diferencia de los grandes modelos de lenguaje, que se beneficiaron de una receta basada en el preentrenamiento con datos amplios, todavía no existe un consenso en el campo de la robótica sobre la receta equivalente para construir una inteligencia encarnada general. X Square Robot apuesta por que esta receta no consiste en un único modelo integral, sino en capas interconectadas que funcionan dentro de un enfoque más amplio que la empresa denomina World Unified Model, el cual reúne visión, lenguaje, acción y predicción de cambios físicos.
Interacción en lugar de trayectoria de movimiento
La visión de la empresa se basa en tres principios principales. El primero es que la unidad básica de los datos robóticos debe ser la interacción, no solo la trayectoria de movimiento; una demostración no se considera exitosa simplemente porque las articulaciones se hayan movido, sino cuando cambia el mundo de la manera prevista. El segundo es que el preentrenamiento debe producir una capacidad utilizable, no solo un punto de partida que requiera un ajuste fino intensivo. El tercer principio consiste en organizar el comportamiento en torno a eventos físicos, no a segmentos temporales fijos.
Estos principios hacen que las capas del stack estén interconectadas. Los datos sin robot utilizados para entrenar el modelo de acciones también se organizan para alimentar el modelo del mundo. No obstante, la empresa aclara que el modelo del mundo y el modelo de acciones son dos familias de modelos independientes y complementarias que comparten una base de software dentro de la arquitectura más amplia World Unified Model.
Datos menos costosos y mejor controlados
X Square Robot considera que el cuello de botella para los robots generales no está tanto relacionado con el número de parámetros como con el coste y la calidad de los datos de interacción. Por ello desarrolló el sistema de recopilación de datos QUANXTA Zero Series, una interfaz para interactuar con robots que consiste en que las personas lleven una plataforma equipada con dos pinzas, en lugar de controlar a distancia un robot durante la grabación de las demostraciones.
La diferencia más destacada es la incorporación de la verificación física en el circuito de control de calidad. La plataforma registra las trayectorias, después una muestra de ellas se reproduce en un robot real y solo se contabilizan las demostraciones que completan la tarea efectivamente. Cerrar la pinza una fracción de segundo antes de tiempo puede parecer en los datos una acción de agarre exitosa, pero en la realidad puede empujar el objeto. Según la empresa, la proporción de datos válidos en su canalización alcanzó aproximadamente el 85 %.
La empresa también combina una gran cantidad de demostraciones humanas grabadas sin robot con una pequeña cantidad de datos de robots reales para ajustar el modelo a la dinámica de una máquina específica. Afirma que este método logra un rendimiento cercano al de un conjunto de datos basado completamente en robots, con una reducción del coste de recopilación de aproximadamente 20 veces, principalmente debido al menor coste de la plataforma portátil frente a las configuraciones de control remoto. Sin embargo, los resultados más sólidos mencionados se midieron en los robots y las líneas de recopilación de datos de la empresa, por lo que son necesarias pruebas independientes más amplias para verificar la generalización.
Un modelo del mundo basado en eventos
El modelo del mundo de la empresa se llama WALL-WM y adopta como unidad básica los eventos semánticos relacionados con la acción. Esta unidad incluye un comportamiento coherente, como alcanzar un objeto, agarrarlo o colocarlo; acciones que pueden describirse mediante el lenguaje, verse en un vídeo y ejecutarse como movimiento.
Este enfoque critica la división del comportamiento en ventanas temporales fijas, ya que los límites de la ventana pueden situarse en mitad de un único movimiento o agrupar dos movimientos diferentes. Por ello, WALL-WM coloca los eventos en segmentos de longitud variable adecuados para razonar sobre tareas de largo plazo, y también ofrece un modo de longitud fija para producir salidas inmediatas y estables que pueda utilizar el módulo de control.
Para conservar el conocimiento visual existente en los grandes modelos de vídeo, el diseño conecta un modelo de texto a vídeo con una red de acciones recientemente adaptada que lee las características del vídeo sin sobrescribirlas. La empresa afirma que sus experimentos incluyeron una prueba de generalización en tareas largas y configuraciones no observadas durante el entrenamiento, y que el modelo superó a modelos de referencia ajustados con datos relevantes en el marco de evaluación de robots reales de la empresa. Sin embargo, según el artículo, estos resultados todavía se han medido con un criterio interno, mientras que la publicación del código permite a la comunidad probarlos y reproducirlos.
Un modelo de acciones desplegable y una codificación semántica
Wall-OSS-0.5 es el modelo de visión, lenguaje y acción de la empresa. X Square Robot se impone un criterio estricto: el modelo preentrenado debe funcionar en un robot real antes de realizar cualquier ajuste fino específico para una tarea determinada.
El modelo entrena conjuntamente tres objetivos: tokens de acciones discretas, alineación del lenguaje con la acción y generación de acciones continuas, manteniendo los gradientes fluyendo a través de estos componentes en lugar de congelar partes de la red. La empresa cita un comportamiento no ajustado previamente que incluye aproximación, agarre y recuperación, incluida una tarea con objetos deformables que no estaban presentes en sus datos de entrenamiento.
Por su parte, la interfaz de acciones X-Tokenizer redefine la conversión del movimiento continuo en tokens como el aprendizaje de una interfaz semántica. El token de nivel superior expresa la intención del movimiento, mientras que los tokens de nivel inferior contienen los detalles precisos, con estas representaciones alineadas con las características del modelo de lenguaje. Según la descripción de la empresa, introducir ruido en la acción solo modifica ligeramente el token de intención, lo que ayuda a reutilizar el tokenizador entre robots diferentes sin volver a ajustarlo.
¿Qué queda por demostrar?
El artículo considera que la combinación del control de calidad de los datos mediante la reproducción física, el modelado basado en eventos y el criterio de capacidad de despliegue antes del ajuste fino confiere al enfoque de X Square Robot una coherencia distintiva. Sin embargo, esto todavía no resuelve la cuestión de la escalabilidad fuera del ecosistema de la empresa. La valoración de la empresa superó los 20.000 millones de yuanes, aproximadamente 2.900 millones de dólares, lo que indica la confianza de los inversores en la importancia de la infraestructura de datos, los modelos fundamentales y los sistemas de entrenamiento escalables para la inteligencia artificial encarnada, pero no constituye por sí mismo una prueba del rendimiento técnico.
La empresa invita a los investigadores a poner a prueba tres aspectos: hasta qué punto las representaciones basadas en eventos se generalizan entre tareas, escenas, objetos, robots y distintas condiciones de fallo; si el preentrenamiento sigue siendo eficaz en robots que el modelo no haya visto durante el entrenamiento; y si es posible construir una evaluación común para robots reales que no compare únicamente las tasas de éxito, sino que también identifique las causas de los fallos, como una mala comprensión de las instrucciones, un fallo de la percepción o una recuperación deficiente.
Según la visión de X Square Robot, la llegada de los robots a los hogares requiere más que aumentar la tasa de éxito en una sola tarea. Un robot doméstico fiable debe reconocer su incertidumbre, ralentizarse cuando sea necesario, pedir ayuda y devolver el entorno a un estado seguro después de dejar caer un objeto o interpretar mal una petición. También necesita una personalización prudente que aprenda las rutinas y preferencias de la familia, haciendo de la seguridad y la confianza una prioridad. A la luz de que las pruebas actuales dependen en gran medida de los robots y los criterios de la empresa, esta visión sigue siendo una tesis técnica importante a la espera de una validación más amplia por parte de la comunidad investigadora.