RobotikModeller 🇨🇳 12.08.2026 06:01

Robot Beyin Yarışı Derin Sulara Giriyor: Fiziksel Dünya, Modellerin Sıfırdan Tasarlanmasını Gerektiriyor

2025 WAIC'de, gömülü yapay zekâ merkez sahneye çıktı ve 200'den fazla şirket sergilendi; odak noktası performans robotlarından taşıma ve denetim gibi pratik uygulamalara kaydı. Ant Lingbo'nun baş bilim insanı Shen Yujun, dijital dünya video modellerini ince ayar yoluyla robotlara uyarlamanın yol bağımlı bir kısayol olduğunu ve nihai çözüm olmadığını, fiziksel gerçeklik için sıfırdan tasarlanmış modellerle 'gömülü-yerli' bir yaklaşımı savunuyor. Şirket, sektörde ilk kez gömülü-yerli dünya-eylem modeli de dahil olmak üzere altı model içeren tam yığın Brain 2.0'ı tanıttı ve 1,5 milyar yuan toplamayı hedefleyen bir finansman turu duyurdu.
WAIC (Dünya Yapay Zeka Konferansı) kapsamında gerçekleştirilen bir röportajda Ant Lingbo'nun baş bilim insanı Shen Yujun, somutlaşmış (embodied) zekânın karşılaştığı zorlukları ele aldı ve teknik yol haritasının henüz netleşmemesi nedeniyle veri standartlarının bir türlü ortak bir noktada birleşmediğini vurguladı; modaliteler, hassasiyet düzeyi ya da veri kalitesi konusunda sektörde henüz bir fikir birliği bulunmuyor. Shen, özellikle robotlardan elde edilen uzaktan operasyon (teleoperation) verileri ile insanlardan toplanan birinci şahıs verilerinin, genel amaçlı robotlar için simülasyon verilerinden çok daha kritik olduğunu belirtti; çünkü simülasyonlar, insanların bilinçaltı düzeyde gerçekleştirdiği hareketleri yeniden üretmekte zorlanıyor. Lingbo'nun stratejisi, tek bir uçtan uca (end-to-end) modeli vaktinden önce hayata geçirmeye çalışmak yerine, belirli teknik sorunları çözmeye odaklanan birden çok modelin (LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA ve LingBot-VA gibi) geliştirilmesine dayanıyor. Bu modeller; modaliteleri birbiriyle hizalamak, dinamikleri öngörmek ve MoE (Uzmanlar Karışımı) mimarilerinde yük dengelemesini sağlamak gibi görevleri üstleniyor. Shen, 'somutlaşmış-doğal' (embodied-native) model kavramını ortaya attı; bu yaklaşım, fiziksel dünya görevlerine özgü doğal verileri, gerçek zamanlı etkileşime uygun model yeteneklerini ve sıfırdan eğitim yapabilme kapasitesini gerektiriyor. Bu bağlamda, DINO gibi kendi kendine denetimli (self-supervised) görsel modellerin yeniden üretilmesindeki güçlüklere ve tek yönlü dikkat mekanizması için nedensel modellemenin (causal modeling) uygulanmasındaki zorluklara dikkat çekti. Güvenlik konusunda ise 'çit tabanlı' güvenliğin (yani yalnızca eylemleri kısıtlamanın) yeterli olmadığını, bunun yerine insan içgüdülerine benzer şekilde ön eğitim (pretraining) aşamasında sisteme gömülen 'doğal güvenlik' yaklaşımının benimsenmesi gerektiğini savundu. Shen ayrıca, somutlaşmış yapay zekâ için 'ChatGPT anı'nın, sıradan insanların veri toplama sürecine kolayca katılabildiği noktada gerçekleşeceğini öngördü; bu sayede robotlar gerçek anlamda faydalı hale gelip günlük yaşama entegre olabilecek.
Kaynak: InfoQ 中国 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler