ModelleGeschäft & Markt 🇺🇸 31.07.2026 09:02

PolyAI stellt Dialog-RSN-1 vor: ein Audio-natives Dialogmodell, das Repliksteuerung, Spracherkennung, Funktionsaufruf und Antwortgenerierung vereint

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
PolyAI hat Dialog-RSN-1 veröffentlicht, ein Audio-natives Dialogmodell, das Audio direkt verarbeitet und Repliksteuerung, Spracherkennung, Funktionsaufruf und Antwortgenerierung vereint. Das Modell wird bereits in der Produktion eingesetzt, liefert Antworten in weniger als 300 ms und verbessert die Kennzahlen zur Gesprächskontrolle um 11 Prozent und zur Latenz um 37 Prozent. Es ist nur über die PolyAI-Plattform verfügbar, ohne offene Gewichte und ohne öffentliche API.
PolyAI hat Dialog-RSN-1 vorgestellt, ein Dialogmodell, das das Audio des Anrufers direkt wahrnimmt, anstatt ein Transkript zu lesen. Es vereint Gesprächssteuerung, Spracherkennung, Funktionsaufruf und Antwortgenerierung in einem einzigen audio-nativen Modell und verarbeitet bereits Live-Produktionsanrufe. Der Modelleingang ist Audio, aber die Text-to-Speech-Ausgabe bleibt separat, was die Kontrolle über die Stimme ermöglicht. Das Modell arbeitet auf Anfrage und nicht als kontinuierlicher Stream, was die GPU nicht dauerhaft belastet. Das erste Ausgabetoken ist die Entscheidung über die Replik: EMPTY, ONGOING oder COMPLETE. PolyAI berichtet über Antwortzeiten von unter 300 Millisekunden, eine relative Verbesserung der Gesprächsführung um 11 Prozent in einer Restaurantgruppe und eine Reduzierung der Latenz um 37 Prozent bei einem Versicherer. Das Modell ist nur über die PolyAI-Plattform verfügbar, ohne offene Gewichte und öffentliche API, auf Englisch. Die Architektur umfasst das Nachbearbeiten offener multimodaler Modelle mit kontrollierter und verstärkungslernender Feinabstimmung auf eigenen Daten. PolyAI hat Gemma, GPT-OSS, Qwen und Mistral evaluiert. Die Latenzoptimierung umfasst das Vorausfüllen des Aufmerksamkeits-Caches, ein Prompt-Muster mit Hinzufügung, die Weiterleitung jedes Anrufers an dieselbe GPU, einen spekulativen Entwurf mit einer durchschnittlichen Akzeptanz von 3,9 Token und Auto-Reasoning, das während der RFT erlernt wurde. Die Transkription erfolgt zuletzt, parallel zur Sprachgenerierung. PolyAI hat das Modell anhand des internen Benchmarks Dialog-Eval evaluiert, dessen Veröffentlichung geplant ist. Für nicht-englische Sprachen wird Raven 3.5 empfohlen. Ein technischer Bericht und ein Artikel über Dialog-Eval sind geplant.
Quelle: MarkTechPost — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten