RoboticaModellen 🇨🇳 28.07.2026 10:03

BeingBeyond onthult Being-H0.8, het eerste impliciete tactiele wereld-actiemodel getraind op 500.000 uur video

Het Chinese AI-bedrijf BeingBeyond (智在无界) heeft Being-H0.8 uitgebracht, het eerste impliciete tactiele wereld-actiemodel op basis van menselijke videogegevens. Het model, getraind op meer dan 500.000 uur aan eersteklasvideo, integreert tactiele feedback in de voorspellings-uitvoerings-aanpassingslus, waardoor robots contact kunnen anticiperen en acties in realtime kunnen aanpassen. Het systeem voerde met succes taken met hoge precisie uit, zoals het ophalen van voorwerpen uit een tas, schrijven met een penseel, tandpasta uitknijpen en chips oppakken met een robotarm.
BeingBeyond heeft Being-H0.8 onthuld, het eerste impliciete tactiele wereld-actiemodel dat is gebouwd met menselijke videogegevens. Het model integreert tactiele modaliteit in een latente ruimte-representatie, waarmee het eerdere Being-H0.7 visuele wereldmodel wordt uitgebreid. Het maakt gebruik van een Mixture of Transformers (MoT) om interactieresultaten te voorspellen, een slow-fast actie-expert voor uitvoering en real-time aanpassing, een Universal Tactile Encoder om tactiele signalen te verenigen, en TopoHand om de actieruimtes van mens en robot op elkaar af te stemmen. De trainingsdatapool overschrijdt 500.000 uur aan first-person video, opgeschoond en verwerkt tot de UniHand-3.0-dataset. Om het gebrek aan tactiele labels in video aan te pakken, ontwikkelde BeingBeyond TactoHand om contact en nabijheid uit visuele gegevens af te leiden, aangevuld met echte drukhandschoengegevens. Het model werd getest op twee-armige robots die taken uitvoerden zoals het terughalen van objecten uit een tas, schrijven met een penseel, tandpasta knijpen en chips oppakken, wat het vermogen aantoont om delicate manipulaties uit te voeren die tactiele feedback vereisen. BeingBeyond werd in mei 2025 opgericht door Lu Zongqing, een universitair hoofddocent aan de Peking Universiteit, en heeft drie fasen doorlopen: het bewijzen van de haalbaarheid van training met menselijke video (Being-H0 tot H0.5), het opschalen (H0.5 tot H0.7), en nu het verbeteren van de gegevenskwaliteit (H0.8).
Bron: QbitAI 量子位 — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws