ModèlesAgents 🇺🇸 10.08.2026 03:03

NVIDIA dévoile NemotronLabs VoiceChat 11B, un modèle vocal full-duplex open source avec prise de parole en 450 ms et appel d'outils en direct

NVIDIANVIDIA
NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle de conversion vocale full-duplex open source qui effectue la compréhension et la génération de parole en streaming dans un seul réseau, atteignant une latence de prise de parole de 448 ms. C'est le premier modèle full-duplex open source à prendre en charge l'appel d'outils pendant la conversation, en utilisant un canal latéral et des messages d'attente définis par l'opérateur. Le modèle est disponible uniquement pour des projets pilotes de recherche, nécessite un GPU de 80 Go, et ne dispose pas encore d'API hébergée.
NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle de conversion parole-à-parole open source de 11B pour des conversations en duplex intégral et en temps réel. Contrairement aux systèmes en cascade, il unifie la compréhension et la génération de la parole dans un seul réseau, éliminant l'orchestration multi-modèles et réduisant la latence à 448 ms sur Full-Duplex-Bench 1.0. Le modèle permet l'interruption, avec un taux de prise en charge de 1,00 à 480 ms. Il innove également en intégrant l'appel d'outils dans un modèle duplex intégral open source, émettant des scripts <TOOLCALL> sur un canal séparé et utilisant des lignes d'attente définies par l'opérateur pour éviter le silence pendant l'exécution des API. Le modèle combine un encodeur de parole Fast Conformer de Nemotron-Speech-Streaming-En-0.6b, le backbone LLM Nemotron Nano v2 et un décodeur TTS NVIDIA, entraîné sur environ 550 000 heures d'audio. Cependant, il est destiné uniquement à la recherche, avec des modes de défaillance documentés comme une limite de contexte audio de deux minutes et une dégradation après plusieurs tours. Il nécessite un GPU de 80 Go (par exemple, A100, H100, RTX 6000 Pro ou B200) et ne dispose pas d'API hébergée. Les contraintes incluent un maximum de cinq outils par session et des invites système en ASCII uniquement. Les scores de performance incluent 58,5 % d'appel d'outils simple sur AU Harness BFCL-v3 et 82,5 % de sélection d'outils sur Full-Duplex-Bench v3. Le modèle se classe deuxième parmi les modèles duplex intégral open source sur VoiceBench et Full-Duplex-Bench 1.0.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches