바이트댄스 Seed, 풀 듀플렉스 AV LLM 'SeedRealtime' 공개: 하나의 모델로 보고, 듣고, 말한다
ByteDance
바이트댄스(ByteDance)의 Seed 팀이 SeedRealtime을 공개했습니다. SeedRealtime은 오디오, 비디오, 텍스트를 통합된 아키텍처로 융합하여 실시간 연속 멀티모달 상호작용을 가능하게 하는 네이티브 오디오-비주얼 풀 듀플렉스 LLM입니다. 이 모델은 단계적으로 연결된 ASR(자동 음성 인식), VLM(비전 언어 모델), TTS(텍스트 음성 변환) 파이프라인을 단일 엔드투엔드 모델로 대체하여 능동적 발화와 자연스러운 턴테이킹을 가능하게 하는 것을 목표로 합니다. 현재 바이트댄스의 Doubao 앱에서 배포되었지만, 기술 보고서, 파라미터, 가중치, API는 공개되지 않았습니다.
바이트댄스의 시드 팀이 오디오, 비디오, 텍스트를 단일 엔드투엔드 아키텍처로 통합한 네이티브 오디오-비주얼 풀 듀플렉스 대규모 언어 모델인 시드리얼타임을 공개했습니다. 자동 음성 인식(ASR), 비전-언어 모델(VLM), 텍스트-음성 변환(TTS) 모듈을 연결하는 전통적인 계단식 시스템과 달리, 시드리얼타임은 인식, 이해, 의사 결정, 표현을 병렬로 수행하며, 턴테이킹을 내부적으로 처리하여 외부 음성 활동 감지기가 필요 없습니다. 회사는 세 가지 주요 돌파구를 주장하고 있습니다: 오디오-비주얼 통합 이해, 능동적 상호 작용, 자연스러운 대화 타이밍. 시연에서 모델은 시끄러운 환경에서 이름과 얼굴을 성공적으로 매칭했고, 카메라 뷰에 특정 객체가 나타날 때 능동적으로 사용자에게 알렸으며, 시각적 상태에 따라 에스프레소 추출 단계를 수정하고, 화면 밖 정보를 회상하면서 관련 없는 대화를 억제했습니다. 시드리얼타임은 현재 바이트댄스의 두바오 앱에 배포되어 있지만, 회사는 기술 보고서, 매개변수 수, 오픈 가중치 또는 API를 공개하지 않아 타사 통합이 불가능합니다. 바이트댄스의 내부 평가에 따르면 페이싱 문제가 계단식 스택에 비해 절반으로 줄었지만, 벤치마크나 지연 시간 수치는 제공되지 않았습니다.
출처: MarkTechPost —
원문
