ByteDance Seed apresenta SeedRealtime: um LLM audiovisual full-duplex que vê, ouve e fala em um único modelo
ByteDance
A equipe Seed da ByteDance apresentou o SeedRealtime, um LLM audiovisual full-duplex nativo que integra áudio, vídeo e texto em uma arquitetura unificada para interação multimodal contínua em tempo real. O objetivo é substituir pipelines em cascata de ASR, VLM e TTS por um único modelo de ponta a ponta, permitindo fala proativa e alternância natural de turnos. O modelo está atualmente implantado no aplicativo Doubao da ByteDance, mas nenhum relatório técnico, parâmetros, pesos ou API foram divulgados.
A equipe Seed da ByteDance apresentou o SeedRealtime, um modelo de linguagem de grande porte nativo audiovisual full-duplex que integra áudio, vídeo e texto em uma única arquitetura ponta a ponta. Ao contrário dos sistemas em cascata tradicionais, que encadeiam módulos de reconhecimento automático de fala (ASR), modelos de visão-linguagem (VLM) e síntese de texto para fala (TTS), o SeedRealtime realiza percepção, compreensão, tomada de decisão e expressão em paralelo, além de gerenciar internamente a alternância de turnos, eliminando a necessidade de um detector externo de atividade de voz. A empresa afirma três avanços principais: compreensão conjunta audiovisual, interação proativa e ritmo natural de conversação. Nas demonstrações, o modelo associou nomes a rostos em ambientes ruidosos, lembrou proativamente os usuários quando um objeto específico aparecia na visão da câmera, corrigiu etapas de preparo de café expresso com base no estado visual e suprimiu conversas irrelevantes enquanto recuperava informações fora da tela. O SeedRealtime está atualmente implantado no aplicativo Doubao da ByteDance, mas a empresa não publicou um relatório técnico, nem a contagem de parâmetros, os pesos abertos ou uma API, o que impossibilita a integração por terceiros. As avaliações internas da ByteDance relatam que os problemas de ritmo são reduzidos pela metade em comparação com as pilhas em cascata, mas nenhum benchmark ou número de latência foi fornecido.
Fonte: MarkTechPost —
original
