Модели 🇺🇸 10.08.2026 09:01

ByteDance Seed представляет SeedRealtime: полнодуплексная аудиовизуальная LLM, которая видит, слышит и говорит в одной модели

ByteDance
Команда Seed из ByteDance представила SeedRealtime — нативную аудиовизуальную полнодуплексную LLM (большую языковую модель), объединяющую аудио, видео и текст в единой архитектуре для реального времени непрерывного мультимодального взаимодействия. Модель призвана заменить каскадные конвейеры ASR (автоматическое распознавание речи), VLM (визуально-языковая модель) и TTS (синтез речи) единой сквозной моделью, обеспечивая упреждающую речь и естественный обмен репликами. В настоящее время модель развернута в приложении Doubao от ByteDance, однако технический отчет, параметры, веса и API не были опубликованы.
Команда Seed компании ByteDance представила SeedRealtime — нативную аудиовизуальную полнодуплексную большую языковую модель (large language model, LLM), которая объединяет аудио, видео и текст в единой сквозной архитектуре. В отличие от традиционных каскадных систем, соединяющих цепочкой модули автоматического распознавания речи (automatic speech recognition, ASR), визуально-языковые модели
Показать ещё ↓
Источник: MarkTechPost — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости