ByteDance Seed stellt SeedRealtime vor: Ein Vollduplex-Audio-Visuelles LLM, das in einem Modell sieht, hört und spricht
ByteDance
Das Seed-Team von ByteDance hat SeedRealtime eingeführt, ein natives audio-visuelles Vollduplex-LLM, das Audio, Video und Text in einer einheitlichen Architektur für Echtzeit- und kontinuierliche multimodale Interaktion vereint. Es zielt darauf ab, kaskadierte ASR-, VLM- und TTS-Pipelines durch ein einziges End-to-End-Modell zu ersetzen, das proaktives Sprechen und natürlichen Sprecherwechsel ermöglicht. Das Modell ist derzeit in der Doubao-App von ByteDance eingesetzt, aber es wurden weder ein technischer Bericht noch Parameter, Gewichte oder eine API veröffentlicht.
Das Seed-Team von ByteDance hat SeedRealtime vorgestellt, ein natives audiovisuelles Vollduplex-Sprachmodell, das Audio, Video und Text in einer einzigen Ende-zu-Ende-Architektur integriert. Im Gegensatz zu herkömmlichen Kaskadensystemen, die Module für automatische Spracherkennung (ASR), visuelle Sprachmodelle (VLM) und Text-zu-Sprache (TTS) miteinander verketten, führt SeedRealtime Wahrnehmung, Verständnis, Entscheidungsfindung und Ausdruck parallel aus und übernimmt auch die Gesprächssteuerung intern, wodurch ein externer Sprachaktivitätsdetektor überflüssig wird. Das Unternehmen beansprucht drei wichtige Durchbrüche: gemeinsames audiovisuelles Verständnis, proaktive Interaktion und natürliches Gesprächs-Timing. In Demonstrationen ordnete das Modell erfolgreich Namen Gesichtern in lauten Umgebungen zu, erinnerte Benutzer proaktiv, wenn ein bestimmtes Objekt im Kamerabild erschien, korrigierte Espresso-Zubereitungsschritte basierend auf dem visuellen Zustand und unterdrückte unzusammenhängendes Geplauder, während es Informationen außerhalb des Bildschirms abrief. SeedRealtime ist derzeit in ByteDances Doubao-App eingesetzt, aber das Unternehmen hat weder einen technischen Bericht, die Parameteranzahl, offene Gewichte noch eine API veröffentlicht, was eine Integration durch Dritte unmöglich macht. ByteDances interne Bewertungen berichten, dass Timing-Probleme im Vergleich zu Kaskaden-Stapeln halbiert werden, aber es wurden keine Benchmarks oder Latenzzeiten angegeben.
Quelle: MarkTechPost —
Original
