ByteDance Seed dévoile SeedRealtime : un modèle de langage multimédia en duplex intégral qui regarde, écoute et parle en un seul modèle
ByteDance
L'équipe Seed de ByteDance a présenté SeedRealtime, un modèle de langage de grande taille (LLM) en duplex intégral, natif audiovisuel, qui fusionne l'audio, la vidéo et le texte dans une architecture unifiée pour une interaction multimodale continue en temps réel. Il vise à remplacer les chaînes de traitement en cascade composées de systèmes de reconnaissance vocale automatique (ASR), de modèles de vision-langage (VLM) et de synthèse vocale (TTS) par un modèle unique de bout en bout, permettant une prise de parole proactive et une alternance naturelle des tours de parole. Le modèle est actuellement déployé dans l'application Doubao de ByteDance, mais aucun rapport technique, paramètres, poids ou API n'ont été publiés.
L'équipe Seed de ByteDance a dévoilé SeedRealtime, un grand modèle de langage natif audio-visuel en full-duplex qui intègre l'audio, la vidéo et le texte dans une architecture unifiée de bout en bout. Contrairement aux systèmes en cascade traditionnels qui enchaînent les modules de reconnaissance automatique de la parole (ASR), de modèles vision-langage (VLM) et de synthèse vocale (TTS), SeedRealtime effectue la perception, la compréhension, la prise de décision et l'expression en parallèle, et gère également la gestion des tours de parole en interne, éliminant ainsi le besoin d'un détecteur d'activité vocale externe. L'entreprise revendique trois avancées clés : la compréhension conjointe audio-visuelle, l'interaction proactive et un rythme de conversation naturel. Dans les démonstrations, le modèle a réussi à associer des noms à des visages dans des environnements bruyants, a rappelé proactivement aux utilisateurs lorsqu'un objet spécifique apparaissait dans le champ de la caméra, a corrigé les étapes de préparation de l'espresso en fonction de l'état visuel, et a supprimé les conversations parasites tout en se souvenant d'informations hors écran. SeedRealtime est actuellement déployé dans l'application Doubao de ByteDance, mais l'entreprise n'a pas publié de rapport technique, de nombre de paramètres, de poids ouverts ou d'API, ce qui le rend indisponible pour une intégration par des tiers. Les évaluations internes de ByteDance indiquent que les problèmes de rythme sont réduits de moitié par rapport aux empilements en cascade, mais aucun chiffre de référence ou de latence n'a été fourni.
Source: MarkTechPost —
original
