模型 🇺🇸 10.08.2026 09:01

字节跳动Seed团队发布SeedRealtime:集观看、聆听与说话于一体的全双工音视频大语言模型

ByteDanceByteDance
字节跳动Seed团队推出了SeedRealtime,这是一个原生音视频全双工大语言模型,在统一架构中融合了音频、视频和文本,支持实时、连续的多模态交互。其目标是取代由自动语音识别(ASR)、视觉语言模型(VLM)和文本转语音(TTS)串联而成的传统流水线,采用单一端到端模型,实现主动说话和自然的轮流对话。该模型目前已部署在字节跳动的豆包应用中,但尚未发布技术报告、参数、权重或应用程序编程接口(API)。
字节跳动的Seed团队发布了SeedRealtime,这是一个原生音视频全双工大语言模型,在一个端到端架构中集成了音频、视频和文本。与传统的级联系统(将自动语音识别(ASR)、视觉语言模型(VLM)和文本到语音(TTS)模块串联起来)不同,SeedRealtime并行执行感知、理解、决策和表达,并内部处理话轮转换,无需外部语音活动检测器。该公司声称取得了三项关键突破:音视频联合理解、主动交互和自然的对话节奏。在演示中,该模型在嘈杂环境中成功将姓名与面孔匹配,当特定物体出现在摄像头视野中时主动提醒用户,根据视觉状态纠正制作浓缩咖啡的步骤,并在回忆屏幕外信息的同时抑制无关的闲聊。SeedRealtime目前部署在字节跳动的豆包应用中,但该公司尚未发布技术报告、参数数量、开放权重或API,因此无法用于第三方集成。字节跳动的内部评估报告称,与级联堆栈相比,节奏问题减少了一半,但未提供基准测试或延迟数据。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻