PolyAI Memperkenalkan Dialog-RSN-1: Model Dialog Audio-Natif yang Menggabungkan Manajemen Percakapan, Pengenalan Ucapan, Pemanggilan Fungsi, dan Generasi Respons
PolyAI
OpenAI
Google/DeepMind
Alibaba/Qwen
Mistral
PolyAI telah meluncurkan Dialog-RSN-1, model dialog audio-natif yang memproses audio secara langsung, menggabungkan manajemen percakapan, pengenalan ucapan, pemanggilan fungsi, dan generasi respons. Model ini telah digunakan dalam produksi, memberikan respons dalam waktu kurang dari 300 ms dan meningkatkan metrik sebesar 11% untuk kontrol dan 37% untuk latensi. Model ini hanya tersedia melalui platform PolyAI, tanpa bobot terbuka atau API publik.
PolyAI memperkenalkan Dialog-RSN-1, model dialog yang mendengarkan audio penelepon secara langsung, bukan membaca transkrip. Model ini menggabungkan manajemen giliran bicara, pengenalan ucapan, pemanggilan fungsi, dan pembuatan respons dalam satu model native-audio dan sudah menangani panggilan produksi langsung. Input model adalah audio, tetapi TTS tetap terpisah, sehingga suara dapat dikontrol. Model bekerja berdasarkan permintaan, bukan sebagai aliran terus-menerus, sehingga tidak membebani GPU secara konstan. Token output pertama adalah keputusan giliran bicara: EMPTY, ONGOING, atau COMPLETE. PolyAI melaporkan waktu respons di bawah 300 ms, peningkatan relatif dalam penahanan sebesar 11% di grup restoran, dan pengurangan latensi sebesar 37% di perusahaan asuransi. Model ini hanya tersedia melalui platform PolyAI, tanpa bobot terbuka atau API publik, dalam bahasa Inggris. Arsitekturnya mencakup pasca-pelatihan model multimodal bobot terbuka menggunakan fine-tuning terawasi dan pembelajaran penguatan pada data milik sendiri. PolyAI mengevaluasi Gemma, GPT-OSS, Qwen, dan Mistral. Optimasi latensi meliputi pra-pengisian cache perhatian, template prompt dengan penambahan, merutekan setiap penelepon ke GPU yang sama, draf spekulatif dengan rata-rata penerimaan 3,9 token, dan penalaran otomatis yang dipelajari selama RFT. Transkripsi dilakukan terakhir, paralel dengan pembuatan ucapan. PolyAI mengevaluasi model pada benchmark internal Dialog-Eval, yang direncanakan akan dibuka. Untuk bahasa non-Inggris, disarankan menggunakan Raven 3.5. Laporan teknis dan artikel tentang Dialog-Eval direncanakan.
Sumber: MarkTechPost —
asli
