30.000 uur aan tastgegevens geven belichaamde AI een tastzin
NeoteAI en Fudan Universiteit hebben een reeks van drie rapporten en modellen uitgebracht onder de N0-serie, met als doel tactiele feedback als kerncomponent van belichaamde AI te integreren. Het project omvat een dataset van 30.000 uur aan tactiele interactie, een visie-taal-actiemodel N0-VTLA en een wereldmodel N0-TWAM, allemaal open source beschikbaar gesteld.
NeoteAI (Shanghai New Intelligent Embodied AI Technology Co., Ltd.) heeft in samenwerking met het Trustworthy Embodied AI Research Institute van de Fudan Universiteit drie technische rapporten gepubliceerd voor de N0-serie modellen. De Neodata-dataset bevat meer dan 30.000 uur aan visueel-tactiele interactiegegevens, 1,4 miljoen actiesegmenten, 33 miljard tijdstappen, 8 miljard RGB-frames en 10 miljard tactiele afbeeldingen, verzameld van 6 robotplatforms (Franka, Piper, UR5e, enz.) die 450 langdurige taken bestrijken, uitgevoerd door 90 operators. N0-VTLA is een tactiel-verbeterde Vision-Language-Action (VLA) die 50 stappen vooruit tactiele toestanden voorspelt, met een succespercentage van 85% bij het inpluggen (tegenover 60% voor alleen visie) en 99% bij het verwijderen van sleutels (tegenover 35%). N0-TWAM is een wereldmodel met 7,2 miljard parameters dat gebruik maakt van een mixture-of-experts architectuur en tegelijkertijd video-, tactiele- en actiesequenties voorspelt; het gemiddelde simulatierendement is 84,5% (basislijn 36%), in de echte wereld gemiddeld 46,3% (LingBot-VA 21,9%). Het project is open source beschikbaar op research.neoteai.com.
Bron: QbitAI 量子位 —
origineel
