Chinese Academie van Wetenschappen lost het meest gênante probleem van AI op: sociale intelligentie
Институт вычислительных технологий Китайской академии наук (Institute of Computing Technology, Chine
De Chinese Academie van Wetenschappen (CAS) heeft een sociaal intelligentiesysteem genaamd Zhijing onthuld, dat de SoMBench-benchmark, het Zing-trainingssysteem en de Actio-implementatiearchitectuur omvat. Het systeem is bedoeld om het gat in sociale perceptie van grote taalmodellen te vullen, waardoor ze empathischer en betrouwbaarder worden.
Het team Zhijing van het Institute of Computing Technology van de Chinese Academie van Wetenschappen heeft officieel het sociale intelligentiesysteem Zhijing gepresenteerd, bedoeld om het tekort aan sociale cognitie (social cognition) bij grote taalmodellen aan te vullen. Het systeem omvat drie kerncomponenten: de benchmark SoMBench (Social Mind Benchmark), het trainingssysteem Zing en de implementatiearchitectuur Actio. SoMBench verdeelt het abstracte begrip 'mensen begrijpen' in 3 dimensies, 17 subdimensies en 71 taken, gebruikmakend van 3481 zorgvuldig geselecteerde en door experts gevalideerde voorbeelden; het kan niet alleen een totaalscore geven, maar ook specifieke fouten van het model aanwijzen (bijvoorbeeld het verbreken van de redeneerketen of het raden op basis van oppervlakkige patronen). Tests van 20 toonaangevende LLM's toonden aan dat het beste model slechts 72,08% scoorde, geen enkel model de drempel van 90% haalde, wat de moeilijkheid van de taak bevestigt. Het trainingssysteem Zing gebruikt drie kernmechanismen: FLARE - een 'vliegend datawiel' dat nieuwe trainingsvoorbeelden genereert die gericht zijn op specifieke lacunes van het model; tweefasige training (eerst algemene sociale intelligentie via distillatie en GRPO met dynamische beloningen, daarna versterking van gespecialiseerde vaardigheden via SFT en kalibratie met complexe voorbeelden); en OPD (On-Policy Distillation) - het behouden van oude kennis bij het aanleren van nieuwe, om catastrofaal vergeten te voorkomen. De resultaten zijn indrukwekkend: het multimodale model Zing-27B overtrof GPT-5.5 qua gemiddelde van vijf internationale benchmarks (79,80 versus 78,44), met de grootste voorsprong in HiToM (+4,08 procentpunt) en EmoBench (+5,62 procentpunt). Het tekstmodel Zing-32B overtrof DeepSeek-V4-Pro licht (76,32 versus 75,90), vooral in EmoBench (78,13 versus 71,88). De kleine modellen Zing-8B en Zing-14B vertoonden een significante verbetering in HiToM ten opzichte van de basismodellen en overtroffen zelfs modellen met veel meer parameters. De Actio-implementatiearchitectuur zorgt voor selectieve activering van vier soorten ondersteuning (PRISM, Starling Memory, SAGE, Gated RAG) afhankelijk van de taak, waardoor het model niet alleen 'denkt', maar ook correct handelt in echte scenario's. Het systeem kan worden toegepast in belichaamde intelligentie (robotassistenten, metgezellen), complexe besluitvorming (politiek, crisisbeheer) en mens-machine-interactie (uniform protocol voor sociaal bewustzijn voor meerdere agenten). Het team is van plan de benchmark en de modelgewichten als open source op GitHub te publiceren.
Bron: QbitAI 量子位 —
origineel
