Somutlaştırılmış yapay zekâ alanında faaliyet gösteren Çinli X Square Robot şirketi, görevler ve platformlar arasında geçiş yapabilen genel robotlar geliştirmek için net bir vizyon ortaya koyuyor: Etkileşim verileriyle başlayan, fiziksel dünyaya ilişkin bir modelden geçen ve algı, planlama, akıl yürütme ile karar vermeyi bir araya getirerek uygulanabilir davranış üreten bir eylem modeliyle sona eren entegre bir yığın. Bu yaklaşım, robotların hâlâ çoğunlukla, bir görevden diğerine veya bir makineden diğerine aktarılabilir genel bir yetenek üretmesi zorunlu olmayan ayrı bileşenlere dayandığı bir dönemde geliyor.
Geniş kapsamlı veriler üzerinde ön eğitimden oluşan bir reçeteden yararlanan büyük dil modellerinin aksine, robotik alanında genel somutlaştırılmış zekâ geliştirmek için buna karşılık gelen reçete konusunda henüz bir uzlaşma bulunmuyor. X Square Robot, bu reçetenin tek ve kapsamlı bir modelden değil, şirketin World Unified Model olarak adlandırdığı daha geniş bir yaklaşım içinde çalışan bağlantılı katmanlardan oluştuğunu savunuyor. Bu yaklaşım görme, dili, eylemi ve fiziksel değişimlerin öngörülmesini bir araya getiriyor.
Hareket yörüngesi yerine etkileşim
Şirketin vizyonu üç temel ilkeye dayanıyor. İlki, robot verilerinin temel biriminin yalnızca hareket yörüngesi değil, etkileşim olması gerektiği; çünkü bir gösterimin yalnızca eklemlerin hareket etmesiyle değil, dünyayı amaçlanan şekilde değiştirmesiyle başarılı sayılacağı düşüncesi. İkincisi, ön eğitimin yalnızca yoğun ve kapsamlı ince ayar gerektiren bir başlangıç noktası değil, kullanılabilir bir yetenek üretmesi gerektiği. Üçüncü ilke ise davranışın sabit zaman aralıkları etrafında değil, fiziksel olaylar etrafında düzenlenmesi.
Bu ilkeler yığının katmanlarını birbirine bağlıyor. Eylem modelini eğitmek için kullanılan robotsuz veriler, dünya modelini besleyecek şekilde de düzenleniyor. Bununla birlikte şirket, dünya modeli ile eylem modelinin, daha geniş World Unified Model mimarisi içinde ortak bir yazılım tabanını paylaşan, bağımsız ve birbirini tamamlayan iki model ailesi olduğunu açıklıyor.
Daha düşük maliyetli ve daha kontrollü veriler
X Square Robot, genel robotların önündeki darboğazın parametre sayısından çok etkileşim verilerinin maliyeti ve kalitesiyle ilişkili olduğunu düşünüyor. Bu nedenle şirket, uzaktan kumandayla bir robotu kontrol ederek gösterimleri kaydetmek yerine, insanların iki kıskaçla donatılmış bir platformu giyerek robotlarla etkileşime girdiği bir arayüz olan QUANXTA Zero Series veri toplama sistemini geliştirdi.
En belirgin fark, fiziksel doğrulamanın kalite kontrol döngüsüne dâhil edilmesi. Platform yörüngeleri kaydediyor, ardından bunların bir örneği gerçek bir robot üzerinde yeniden oynatılıyor ve yalnızca görevi gerçekten tamamlayan gösterimler hesaba katılıyor. Kıskaçların bir saniyenin küçük bir bölümü kadar erken kapanması, verilerde başarılı bir kavrama gibi görünebilir; ancak gerçekte nesneyi uzağa itebilir. Şirkete göre veri hattındaki verilerin geçerlilik oranı yaklaşık %85'e ulaştı.
Şirket ayrıca robotsuz kaydedilmiş çok sayıda insan gösterimini, modeli belirli bir makinenin dinamiklerine sabitlemek için az miktarda gerçek robot verisiyle birleştiriyor. Bu yaklaşımın, tamamen robot tabanlı bir veri kümesinin performansına yakın sonuç verdiğini ve toplama maliyetini yaklaşık 20 kat azalttığını belirtiyor; bunun temel nedeni, giyilebilir platformun uzaktan kumanda düzeneklerine kıyasla daha düşük maliyetli olması. Ancak belirtilen en güçlü sonuçlar şirketin robotları ve veri toplama hatları üzerinde ölçüldü; bu da genellenebilirliği doğrulamak için daha kapsamlı bağımsız testleri gerekli kılıyor.
Olaylara dayalı dünya modeli
Şirketin dünya modelinin adı WALL-WM ve temel birim olarak eylemle ilişkili anlamsal olayları benimsiyor. Bu birim; bir nesneye uzanma, onu kavrama veya yerine koyma gibi tutarlı davranışları kapsıyor. Bunlar dille tanımlanabilen, videoda görülebilen ve hareket olarak uygulanabilen eylemler.
Bu yaklaşım, davranışın sabit zaman pencerelerine bölünmesini eleştiriyor; çünkü pencerenin sınırları tek bir hareketin ortasına denk gelebilir veya iki farklı hareketi bir araya getirebilir. Bu nedenle WALL-WM, uzun vadeli görevler üzerinde çıkarım yapmaya uygun, değişken uzunluklu bölümlerde olaylarla çalışırken kontrol biriminin kullanabileceği istikrarlı anlık çıktılar üretmek için sabit uzunluklu bir mod da sunuyor.
Büyük video modellerinde bulunan görsel bilgiyi korumak amacıyla tasarım, metinden videoya dönüştürme modelini, video özelliklerini üzerine yazmadan okuyan yeni uyarlanmış bir eylem ağına bağlıyor. Şirket, deneylerinin eğitim sırasında görülmeyen ayarlarda uzun görevlerde genelleme testini de kapsadığını ve modelin gerçek robotlara ilişkin şirket ölçütünde, ilgili veriler üzerinde ayarlanan temel modellerden daha iyi performans gösterdiğini belirtiyor. Ancak metne göre bu sonuçlar hâlâ kurum içi bir ölçüt üzerinde ölçülmüş durumda; kodun yayımlanması ise topluluğun modeli test etmesine ve sonuçları yeniden üretmesine olanak tanıyor.
Dağıtıma hazır eylem modeli ve anlamsal kodlama
Wall-OSS-0.5, şirketin görme, dil ve eylem modelini temsil ediyor. X Square Robot kendisi için katı bir ölçüt belirliyor: Önceden eğitilmiş model, belirli bir göreve özgü herhangi bir ince ayar yapılmadan önce gerçek bir robot üzerinde çalışabilmeli.
Model üç hedefi birlikte eğitiyor: ayrık eylem belirteçleri, dil ile eylem arasındaki bağlantı ve sürekli eylem üretimi. Bileşenleri dondurmak yerine gradyanların bu bileşenlerden geçmesine izin veriliyor. Şirket, önceden ayarlanmamış davranışlar arasında yaklaşma, kavrama ve toparlanmanın bulunduğunu; bunlara eğitim verilerinde yer almayan deforme olabilir nesneler içeren bir görevin de dâhil olduğunu belirtiyor.
Eylem arayüzü X-Tokenizer ise sürekli hareketi belirteçlere dönüştürmeyi anlamsal bir arayüz öğrenimi olarak yeniden tanımlıyor. Üst düzey belirteç hareketin niyetini ifade ederken, alt düzey belirteçler ince ayrıntıları taşıyor ve bu temsiller dil modelinin özellikleriyle hizalanıyor. Şirketin açıklamasına göre eyleme gürültü eklemek yalnızca niyet belirtecinde küçük bir değişikliğe yol açıyor; bu da kodlayıcının farklı robotlar arasında yeniden ayarlama yapılmadan yeniden kullanılmasına yardımcı oluyor.
Neyin kanıtlanması gerekiyor?
Metin, fiziksel yeniden oynatma yoluyla veri kalite kontrolünün, olay tabanlı modellemenin ve ince ayardan önce dağıtılabilirlik ölçütünün bir araya gelmesinin X Square Robot'un yaklaşımına ayırt edici bir bütünlük kazandırdığını düşünüyor. Ancak bu durum, şirket ekosisteminin dışına ölçeklenebilirlik sorusunu henüz çözmüyor. Şirketin değeri, yatırımcıların somutlaştırılmış yapay zekâda veri altyapısı, temel modeller ve ölçeklenebilir eğitim sistemlerinin önemine duyduğu güvenin bir göstergesi olarak 20 milyar yuanın, yani yaklaşık 2,9 milyar doların üzerine çıktı; ancak bu, kendi başına teknik performans kanıtı oluşturmuyor.
Şirket araştırmacıları üç konuyu test etmeye davet ediyor: Olay tabanlı temsillerin farklı görevler, sahneler, nesneler, robotlar ve hata koşulları arasında ne ölçüde genellendiği; ön eğitimin eğitim sırasında görülmemiş robotlarda etkili olmaya devam edip etmediği; ayrıca gerçek robotlar için yalnızca başarı oranlarını karşılaştırmakla kalmayıp talimatların yanlış anlaşılması, algının başarısız olması veya toparlanmanın zayıf kalması gibi başarısızlık nedenlerini de belirleyen ortak bir değerlendirme oluşturulup oluşturulamayacağı.
X Square Robot'un vizyonuna göre robotların evlere girmesi, tek bir görevdeki başarı oranını artırmaktan fazlasını gerektiriyor. Güvenilir bir ev robotu belirsizliğini algılamalı, gerektiğinde yavaşlamalı, yardım istemeli ve bir nesneyi düşürdükten veya bir isteği yanlış anladıktan sonra ortamı güvenli bir duruma geri getirmeli. Ayrıca güvenliği ve güveni önceliklendirerek ailenin rutinlerini ve tercihlerini öğrenen temkinli bir kişiselleştirmeye ihtiyaç duyuyor. Mevcut kanıtların büyük ölçüde şirketin robotlarına ve ölçütlerine dayanması ışığında bu vizyon, araştırma topluluğundan daha geniş bir doğrulama bekleyen önemli bir teknik tez olmayı sürdürüyor.