ByteDance Seed presenta SeedRealtime: un modelo de lenguaje multimodal de dúplex completo que ve, escucha y habla en un único modelo
ByteDance
El equipo Seed de ByteDance ha presentado SeedRealtime, un modelo de lenguaje multimodal de dúplex completo de audio y vídeo que fusiona audio, vídeo y texto en una arquitectura unificada para una interacción multimodal continua y en tiempo real. Su objetivo es sustituir los flujos de trabajo en cascada de reconocimiento automático de voz, modelo de lenguaje visual y síntesis de voz por un único modelo de extremo a extremo, lo que permite un habla proactiva y una alternancia natural de turnos. El modelo se ha implementado actualmente en la aplicación Doubao de ByteDance, pero no se han publicado informes técnicos, parámetros, pesos ni interfaz de programación de aplicaciones.
El equipo Seed de ByteDance ha presentado SeedRealtime, un modelo de lenguaje de gran tamaño de audio-visual full-duplex nativo que integra audio, vídeo y texto en una única arquitectura de extremo a extremo. A diferencia de los sistemas en cascada tradicionales que encadenan módulos de reconocimiento automático del habla (ASR), modelos de lenguaje visual (VLM) y síntesis de texto a voz (TTS), SeedRealtime realiza percepción, comprensión, toma de decisiones y expresión en paralelo, y también gestiona el turno de palabra internamente, eliminando la necesidad de un detector de actividad de voz externo. La compañía afirma tres avances clave: comprensión audiovisual conjunta, interacción proactiva y ritmo conversacional natural. En las demostraciones, el modelo logró asociar nombres con rostros en entornos ruidosos, recordó de manera proactiva al usuario cuando aparecía un objeto específico en la vista de la cámara, corrigió los pasos para hacer espresso según el estado visual y suprimió conversaciones irrelevantes mientras recordaba información fuera de pantalla. SeedRealtime está actualmente desplegado en la aplicación Doubao de ByteDance, pero la compañía no ha publicado un informe técnico, el número de parámetros, los pesos abiertos ni una API, por lo que no está disponible para integración de terceros. Las evaluaciones internas de ByteDance reportan que los problemas de ritmo se reducen a la mitad en comparación con los sistemas en cascada, pero no se proporcionaron cifras de referencia ni de latencia.
Fuente: MarkTechPost —
original
