NVIDIA, SIGGRAPH 2025 konferansı sırasında fiziksel yapay zekânın geliştirilmesini destekleyen ve nöral grafikler, sentetik veri üretimi, fiziğe dayalı simülasyon, pekiştirmeli öğrenme ve çıkarım yeteneklerini bir araya getiren bir dizi yazılım ve araştırma yeniliğini tanıttı. Şirket, bu teknolojilerin robotları, otonom araçları, akıllı alanları ve içerik oluşturma uygulamalarını destekleyebileceğini belirtiyor.
SIGGRAPH konferansı 14 Ağustos’a kadar Vancouver’da düzenleniyor. Bu kapsamda NVIDIA Research liderleri, fiziksel ve mekânsal yapay zekâyı mümkün kılan grafik ve simülasyon yenilikleri üzerine özel bir konuşma gerçekleştiriyor. NVIDIA Yapay Zekâ Araştırmaları Başkan Yardımcısı Sanja Fidler, yapay zekânın simülasyon yeteneklerini geliştirdiğini, simülasyonun da yapay zekâ sistemlerini geliştirdiğini söyledi ve iki alan arasındaki ilişkiyi güçlü ve ayırt edici bir birliktelik olarak nitelendirdi.
Fiziksel yapay zekâ geliştirmeye yönelik kütüphaneler ve modeller
NVIDIA, konferansta fiziksel yapay zekâya yönelik yeni yazılım kütüphanelerini duyurdu. Bunlar arasında, 3D Gaussian splatting teknolojisini kullanarak dünyaları geniş ölçekte yeniden yapılandırmaya yönelik NVIDIA Omniverse NuRec kütüphaneleri de bulunuyor. Şirket ayrıca görsel zekâya yönelik NVIDIA Metropolis platformu için güncellemelerin yanı sıra, çıkarım modelleri olan NVIDIA Cosmos ve NVIDIA Nemotron’u da tanıttı.
Duyurular arasında fiziksel yapay zekâya yönelik yeni bir görsel-dil çıkarım modeli olan Cosmos Reason da yer alıyor. NVIDIA’ya göre model, robotların ve görsel zekâ ajanlarının önceden edinilmiş bilgiye, fizik anlayışına ve sağduyuya dayanarak insanlara benzer biçimde çıkarım yapmasını sağlıyor.
Eğitim için sanal dünyalar oluşturmak
NVIDIA, fiziksel yapay zekânın geliştirilmesinin yüksek çözünürlüklü ve fizik yasalarına bağlı 3B ortamların oluşturulmasıyla başladığını düşünüyor. Bu ortamlar, insansı robotlar gibi gelişmiş sistemlerin simülasyon içinde güvenli biçimde eğitilmesini ve edinilen becerilerin gerçek dünyaya aktarılma olasılığının artırılmasını sağlıyor.
NVIDIA Araştırma Başkan Yardımcısı Ming-Yu Liu, bu sanal dünyaların gerçek zamanlı oluşturma, bilgisayarlı görü, fiziksel hareket simülasyonu, 2B ve 3B üretken yapay zekâ ve ayrıca çıkarım yeteneklerine ihtiyaç duyduğunu söyledi. Liu, NVIDIA Research’ün bu alanlarda yaklaşık yirmi yıldır çalıştığını da ekledi.
Ekibin çalışmaları arasında, kameralar veya sensörler tarafından yakalanan verileri gerçekçi 3B temsillere dönüştürmek için yapay zekâ kullanan nöral yeniden yapılandırma ve nöral oluşturma da bulunuyor. Fidler’ın Spatial Intelligence laboratuvarı ayrıca Dynamic Vision Lab ve NVIDIA Isaac ekibiyle iş birliği içinde geliştirilen, videolara 3B geometrik açıklamalar eklemeye yönelik bir işlem hattı olan ViPE’yi (Video Pose Engine) sundu. Araç, kamera hareketini tahmin ediyor ve amatör kayıtlar, araç kameraları ve sinematik çekimlerden yola çıkarak ayrıntılı derinlik haritaları oluşturuyor.
SIGGRAPH’da 12’den fazla araştırma makalesi
NVIDIA Research, konferansta nöral oluşturma, gerçek zamanlı ışın izleme, sentetik veri üretimi ve pekiştirmeli öğrenme konularında 12’den fazla araştırma makalesi sunuyor. Makalelerden biri, görüntülerden veya videolardan fiziği dikkate alan 3B geometriyi yeniden yapılandırmayı ele alıyor. Amaç, görsel olarak doğru görünen ancak simülasyon içinde yapısal dayanıklılıktan yoksun şekillerin üretilmesini önlemek.
Bir başka makale, bir hareket oluşturucuyu fiziğe dayalı bir takip kontrol birimiyle birleştirerek simüle edilmiş karakterlere fiziksel açıdan hassas hareketler kazandıran bir yöntem sunuyor. Ortaya çıkan veriler, sanal karakterlerin geliştirilmesinde veya insansı robotların parkur hareketleri ve zorlu arazilerde ilerleme gibi karmaşık hareketler için eğitilmesinde kullanılabilir.
Diğer araştırmalar ışık ve malzeme simülasyonlarını da ele alıyor. NVIDIA ekibi, malzeme doku haritalarını metin komutlarıyla değiştirmek için difüzyon modellerini ve fiziğe dayalı diferansiyellenebilir bir oluşturucuyu kullanan bir yapay zekâ asistanı tanıttı. Bu, 3B modellere hava koşullarının veya eskimenin izleri gibi ayrıntıların eklenmesine yardımcı oluyor. Başka bir makale ise görüntülerden ve videolardan 3B geometriyi yeniden yapılandırmayı hızlandırmayı ve doğruluğunu artırmayı amaçlayan diferansiyellenebilir bir görsel sorgulama yöntemini inceliyor.
Bu çalışmalar, 3B modelleri 2B görüntülere dönüştüren ileri oluşturma ile görüntülerden 3B modeller çıkaran ters oluşturma arasında bağlantı kuruyor. NVIDIA, bu bütünleşmenin fiziksel yapay zekâ sistemlerinin eğitilmesinde kullanılabilecek sanal dünyalar ve sentetik veriler oluşturmak için temel unsurlar sağladığını düşünüyor.