NVIDIA, 450ms 턴테이킹과 실시간 도구 호출을 지원하는 오픈 풀듀플렉스 음성 모델 'NemotronLabs VoiceChat 11B' 공개
NVIDIA
NVIDIA가 NemotronLabs VoiceChat 11B를 공개했습니다. 이는 단일 네트워크에서 스트리밍 음성 이해와 생성을 수행하는 오픈 풀듀플렉스(전이중) 음성-음성 모델로, 448ms의 턴테이킹 지연 시간을 달성합니다. 대화 중 도구 호출을 지원하는 최초의 오픈 풀듀플렉스 모델로, 사이드 채널과 운영자 정의 대기 메시지를 사용합니다. 이 모델은 연구용 파일럿 프로젝트에만 제공되며, 80GB GPU가 필요하고, 아직 호스팅 API는 없습니다.
NVIDIA는 NemotronLabs VoiceChat 11B를 출시했습니다. 이는 실시간 전이중 대화를 위한 오픈 11B 엔드투엔드 음성-음성 모델입니다. 캐스케이드 시스템과 달리 음성 이해와 생성을 하나의 네트워크로 통합하여 다중 모델 오케스트레이션을 제거하고 Full-Duplex-Bench 1.0에서 대기 시간을 448ms로 줄였습니다. 이 모델은 barge-in(끼어들기)을 지원하며, 480ms에서 1.00의 점유율(테이크오버율)을 보입니다. 또한 오픈 풀듀플렉스 모델 중 최초로 도구 호출을 지원하며, <TOOLCALL> 스크립트를 별도 채널로 출력하고 API 실행 중 침묵을 피하기 위해 운영자가 정의한 대기 음성(홀드 라인)을 사용합니다. 이 모델은 Nemotron-Speech-Streaming-En-0.6b의 Fast Conformer 음성 인코더, Nemotron Nano v2 LLM 백본, NVIDIA TTS 디코더를 결합하여 약 55만 시간의 오디오로 학습되었습니다. 그러나 연구 목적으로만 제공되며, 2분 오디오 컨텍스트 제한, 여러 턴 후 성능 저하 등의 문서화된 한계가 있습니다. 하나의 80GB GPU(예: A100, H100, RTX 6000 Pro, B200)가 필요하며 호스팅 API는 제공되지 않습니다. 제약 사항으로는 세션당 최대 5개의 도구, ASCII 전용 시스템 프롬프트가 있습니다. 성능 점수는 AU Harness BFCL-v3에서 단순 도구 호출 58.5%, Full-Duplex-Bench v3에서 도구 선택 82.5%입니다. 이 모델은 VoiceBench 및 Full-Duplex-Bench 1.0에서 오픈 풀듀플렉스 모델 중 2위를 차지했습니다.
출처: MarkTechPost —
원문
