تطرح شركة X Square Robot الصينية العاملة في مجال الذكاء الاصطناعي المتجسد تصوراً واضحاً لبناء روبوتات عامة قادرة على الانتقال بين المهام والمنصات: مكدس متكامل يبدأ من بيانات التفاعل، ويمر عبر نموذج للعالم الفيزيائي، وينتهي بنموذج أفعال يجمع الإدراك والتخطيط والاستدلال واتخاذ القرار لإنتاج سلوك قابل للتنفيذ. ويأتي هذا الطرح في وقت لا تزال فيه الروبوتات تعتمد غالباً على مكونات منفصلة لا تنتج بالضرورة قدرة عامة قابلة للنقل من مهمة إلى أخرى أو من آلة إلى أخرى.
وعلى خلاف نماذج اللغة الكبيرة، التي استفادت من وصفة تقوم على التدريب المسبق على بيانات واسعة، لا يوجد حتى الآن اتفاق في مجال الروبوتات حول الوصفة المقابلة لبناء ذكاء متجسد عام. وتراهن X Square Robot على أن هذه الوصفة لا تتمثل في نموذج واحد شامل، بل في طبقات مترابطة تعمل ضمن توجه أوسع تسميه الشركة World Unified Model، يجمع الرؤية واللغة والفعل والتنبؤ بالتغيرات الفيزيائية.
التفاعل بدلاً من المسار الحركي
تقوم رؤية الشركة على ثلاثة مبادئ رئيسية. أولها أن الوحدة الأساسية لبيانات الروبوت يجب أن تكون التفاعل، لا المسار الحركي وحده؛ فالعرض لا يعد ناجحاً لمجرد تحرك المفاصل، بل عندما يغير العالم بالطريقة المقصودة. وثانيها أن التدريب المسبق ينبغي أن ينتج قدرة قابلة للاستخدام، لا مجرد نقطة بداية تحتاج إلى ضبط دقيق مكثف. أما المبدأ الثالث فيتمثل في تنظيم السلوك حول الأحداث الفيزيائية، لا حول مقاطع زمنية ثابتة.
وتجعل هذه المبادئ طبقات المكدس مترابطة. فالبيانات الخالية من الروبوت التي تستخدم لتدريب نموذج الأفعال تُنظم أيضاً لتغذية نموذج العالم. ومع ذلك، توضح الشركة أن نموذج العالم ونموذج الأفعال عائلتان مستقلتان ومتكاملتان من النماذج، وتشتركان في قاعدة برمجية، ضمن بنية World Unified Model الأوسع.
بيانات أقل كلفة وأكثر ضبطاً
ترى X Square Robot أن عنق الزجاجة أمام الروبوتات العامة لا يرتبط بعدد المعاملات بقدر ارتباطه بكلفة بيانات التفاعل وجودتها. ولهذا طورت نظام جمع البيانات QUANXTA Zero Series، وهو واجهة للتعامل مع الروبوتات تعتمد على ارتداء أشخاص منصة مزودة بملقطين بدلاً من التحكم عن بعد بروبوت أثناء تسجيل العروض.
ويتمثل الاختلاف الأبرز في إدخال التحقق الفيزيائي ضمن حلقة ضبط الجودة. تسجل المنصة المسارات، ثم تُعاد عينة منها على روبوت حقيقي، ولا تُحتسب إلا العروض التي تنجز المهمة فعلياً. فإغلاق الملقط قبل الموعد بجزء من الثانية قد يبدو في البيانات كأنه عملية إمساك ناجحة، لكنه قد يدفع الجسم بعيداً في الواقع. وبحسب الشركة، بلغت نسبة صلاحية البيانات في خط أنابيبها نحو 85%.
كما تجمع الشركة بين كمية كبيرة من عروض البشر المسجلة من دون روبوت، وكمية صغيرة من بيانات الروبوت الحقيقي لتثبيت النموذج على ديناميكيات آلة محددة. وتقول إن هذا الأسلوب يحقق أداءً يقارب أداء مجموعة بيانات تعتمد بالكامل على الروبوت، مع خفض كلفة الجمع بنحو 20 مرة، ويرجع ذلك أساساً إلى انخفاض كلفة المنصة القابلة للارتداء مقارنة بإعدادات التحكم عن بعد. غير أن أقوى النتائج المذكورة قيسَت على روبوتات الشركة وخطوط جمع بياناتها، ما يجعل الاختبارات المستقلة الأوسع ضرورية للتحقق من قابلية التعميم.
نموذج عالم يعتمد على الأحداث
يحمل نموذج العالم لدى الشركة اسم WALL-WM، ويتبنى الأحداث الدلالية المرتبطة بالفعل كوحدة أساسية. وتشمل هذه الوحدة سلوكاً متماسكاً مثل الوصول إلى جسم أو إمساكه أو وضعه؛ وهي أفعال يمكن وصفها باللغة، ورؤيتها في الفيديو، وتنفيذها كحركة.
تنتقد هذه المقاربة تقسيم السلوك إلى نوافذ زمنية ثابتة، لأن حدود النافذة قد تقع في منتصف حركة واحدة أو تجمع حركتين مختلفتين. لذلك يعمل WALL-WM في وضع الأحداث ضمن مقاطع ذات أطوال متغيرة تناسب الاستدلال على المهام طويلة الأمد، كما يوفر وضعاً ثابت الطول لإنتاج مخرجات آنية مستقرة يمكن لوحدة التحكم استخدامها.
وللحفاظ على المعرفة البصرية الموجودة في نماذج الفيديو الكبيرة، يربط التصميم نموذج تحويل النص إلى فيديو بشبكة أفعال مهيأة حديثاً، تقرأ خصائص الفيديو من دون الكتابة فوقها. وتقول الشركة إن تجاربها شملت اختباراً للتعميم على مهام طويلة في إعدادات غير مرئية أثناء التدريب، وإن النموذج تفوق على نماذج أساسية ضُبطت على بيانات ذات صلة ضمن معيار الشركة للروبوتات الحقيقية. لكن هذه النتائج، وفق المادة، ما تزال مقاسة على معيار داخلي، فيما يتيح نشر الشيفرة للمجتمع اختبارها وإعادة إنتاجها.
نموذج أفعال قابل للنشر وترميز دلالي
يمثل Wall-OSS-0.5 نموذج الشركة للرؤية واللغة والفعل. وتضع X Square Robot معياراً صارماً لنفسها: ينبغي أن يعمل النموذج المدرب مسبقاً على روبوت حقيقي قبل إجراء أي ضبط دقيق خاص بمهمة معينة.
يدرب النموذج ثلاثة أهداف معاً، هي رموز الأفعال المنفصلة، وربط اللغة بالفعل، وتوليد الأفعال المستمرة، مع إبقاء التدرجات تمر عبر هذه المكونات بدلاً من تجميد أجزاء من الشبكة. وتستشهد الشركة بسلوك غير مضبوط مسبقاً يشمل الاقتراب والإمساك والتعافي، بما في ذلك مهمة بأجسام قابلة للتشوه لم تدخل بيانات تدريبها.
أما واجهة الأفعال X-Tokenizer فتعيد تعريف تحويل الحركة المستمرة إلى رموز باعتباره تعلم واجهة دلالية. يعبّر الرمز الأعلى عن نية الحركة، بينما تحمل الرموز الأدنى التفاصيل الدقيقة، مع مواءمة هذه التمثيلات مع خصائص نموذج اللغة. ووفق وصف الشركة، لا يؤدي إدخال ضوضاء إلى الفعل إلا إلى تغيير طفيف في رمز النية، وهو ما يساعد على إعادة استخدام أداة الترميز بين روبوتات مختلفة من دون إعادة ضبطها.
ما الذي يحتاج إلى إثبات؟
ترى المادة أن الجمع بين ضبط جودة البيانات عبر إعادة التشغيل الفيزيائي، والنمذجة القائمة على الأحداث، ومعيار قابلية النشر قبل الضبط الدقيق، يمنح نهج X Square Robot تماسكاً مميزاً. إلا أن ذلك لا يحسم بعد سؤال قابلية التوسع خارج منظومة الشركة. فقد ارتفعت قيمة الشركة إلى أكثر من 20 مليار يوان، أي نحو 2.9 مليار دولار، في مؤشر على ثقة المستثمرين بأهمية البنية التحتية للبيانات والنماذج الأساسية وأنظمة التدريب القابلة للتوسع في الذكاء الاصطناعي المتجسد، لكنه لا يمثل دليلاً بحد ذاته على الأداء التقني.
وتدعو الشركة الباحثين إلى اختبار ثلاثة أمور: مدى تعميم التمثيلات القائمة على الأحداث عبر مهام ومشاهد وأجسام وروبوتات وظروف فشل مختلفة؛ استمرار فاعلية التدريب المسبق على روبوتات لم يرها النموذج أثناء التدريب؛ وإمكان بناء تقييم مشترك للروبوتات الحقيقية لا يقارن معدلات النجاح فقط، بل يحدد أيضاً أسباب الإخفاق، مثل سوء فهم التعليمات أو تعطل الإدراك أو ضعف التعافي.
وبحسب رؤية X Square Robot، فإن وصول الروبوتات إلى المنازل يتطلب أكثر من رفع معدل النجاح في مهمة واحدة. فالروبوت المنزلي الموثوق يجب أن يدرك عدم يقينه، ويبطئ عند الحاجة، ويطلب المساعدة، ويعيد البيئة إلى حالة آمنة بعد إسقاط جسم أو إساءة فهم طلب. كما يحتاج إلى تخصيص حذر يتعلم روتين الأسرة وتفضيلاتها مع جعل السلامة والثقة أولوية. وتبقى هذه الرؤية، في ضوء اعتماد الأدلة الحالية بدرجة كبيرة على روبوتات الشركة ومعاييرها، أطروحة تقنية مهمة تنتظر تحققاً أوسع من المجتمع البحثي.