OnderzoekMediageneratie 🇺🇸 27.07.2026 02:04

Real World VoiceEQ geïntroduceerd: een nieuwe benchmark voor het beoordelen van Voice AI-kwaliteit

Hume AIHume AI
Hume AI lanceert Real World VoiceEQ, een benchmark voor het evalueren van mensachtige spraakinteractie. Gebaseerd op meer dan één miljoen menselijke beoordelingen, bestrijkt het 40+ modellen in 60+ metrieken, waaronder ASR, TTS, S2S en spraakbegrip. De benchmark toonde aan dat geen enkel model in alle categorieën uitblinkt en benadrukte de zwakke punten van huidige systemen op het gebied van emotie- en contextherkenning.
Het team achter Hume AI heeft de Real World VoiceEQ-benchmark geïntroduceerd, ontworpen om de kwaliteit van stem-AI vanuit menselijk perspectief te evalueren. Het beoordeelt meer dan 40 toonaangevende propriëtaire en open-source stem-AI-modellen op meer dan 15 belangrijke dimensies en 60+ metrieken, waaronder automatische spraakherkenning (ASR), tekst-naar-spraak (TTS), spraak-naar-spraak (S2S) en spraakbegrip. De benchmark is gebaseerd op meer dan 1 miljoen individuele menselijke evaluaties, verzameld uit diverse demografische groepen, spraakstijlen en akoestische omgevingen. De huidige versie bevat 785.000 TTS-evaluaties en 48.000 S2S-evaluaties, waarmee het een van de grootste human-in-the-loop-studies naar stem-AI-kwaliteit is. De evaluaties zijn uitgevoerd op het Kairos-platform. Volgens de resultaten staat geen enkel systeem in de top vijf van alle acht capaciteitsgroepen, wat benadrukt dat er geen enkel "beste" stemmodel is. Spraak-naar-spraak-modellen vertoonden de grootste variatie: sommige presteerden goed bij het herkennen van emoties, maar konden niet natuurlijk reageren. Het bleek dat toegang tot audio niet garandeert dat agenten paralinguale informatie gebruiken; veel systemen blijven afhankelijk van transcripties en negeren toon, pauzes, aarzelingen, intonatie en volume. De benchmark onthulde ook dat modellen slechter presteren bij spraak met een accent, overlappende stemmen, emoties, achtergrondgeluid en lange dialogen. Woordfoutenpercentages voor ruisachtige spraak waren ongeveer vier keer hoger dan voor muziekachtergrond. Daarnaast lijken sommige modellen geoptimaliseerd voor standaardbenchmarks en reproduceren ze bekende fouten uit referentietranscripties. Een vergelijking van toonaangevende spraaktaalmodellen met getrainde menselijke beoordelaars toonde aan dat de overeenstemming het hoogst is bij taken met duidelijke juiste antwoorden, maar afneemt bij subjectieve evaluaties—bijvoorbeeld het matchen van een stem aan een acteerrol of het behouden van identiteit. Geautomatiseerde beoordelaars zijn nog niet in staat om mensen te vervangen wanneer het oordeel afhankelijk is van akoestische context en sociale interpretatie.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws