ByteDance Seed ने पेश किया SeedRealtime: एक फुल-डुप्लेक्स ऑडियो-विज़ुअल LLM जो देखता, सुनता और बोलता है एक ही मॉडल में
ByteDance
ByteDance की Seed टीम ने SeedRealtime पेश किया है, एक नेटिव ऑडियो-विज़ुअल फुल-डुप्लेक्स LLM जो एकीकृत आर्किटेक्चर में ऑडियो, वीडियो और टेक्स्ट को मिलाकर रियल-टाइम, निरंतर मल्टीमॉडल इंटरैक्शन सक्षम बनाता है। इसका उद्देश्य कैस्केडेड ASR (Automatic Speech Recognition), VLM (Vision Language Model) और TTS (Text-to-Speech) पाइपलाइनों को एक ही एंड-टू-एंड मॉडल से बदलना है, जिससे सक्रिय भाषण और स्वाभाविक टर्न-टेकिंग संभव हो सके। यह मॉडल वर्तमान में ByteDance के Doubao ऐप में तैनात है, लेकिन कोई तकनीकी रिपोर्ट, पैरामीटर, वेट या API जारी नहीं किया गया है।
बाइटडांस की सीड टीम ने सीडरियलटाइम का अनावरण किया है, जो एक मूल ऑडियो-विज़ुअल फुल-डुप्लेक्स बड़ा भाषा मॉडल है जो ऑडियो, वीडियो और टेक्स्ट को एक ही एंड-टू-एंड आर्किटेक्चर में एकीकृत करता है। पारंपरिक कैस्केड सिस्टम के विपरीत, जो स्वचालित भाषण पहचान, विज़न-भाषा मॉडल और टेक्स्ट-टू-स्पीच मॉड्यूल को जोड़ते हैं, सीडरियलटाइम धारणा, समझ, निर्णय लेने और अभिव्यक्ति को समानांतर में करता है, और आंतरिक रूप से बारी-बारी से बोलने की प्रक्रिया भी संभालता है, जिससे बाहरी आवाज गतिविधि डिटेक्टर की आवश्यकता समाप्त हो जाती है। कंपनी तीन प्रमुख सफलताओं का दावा करती है: संयुक्त ऑडियो-विज़ुअल समझ, सक्रिय बातचीत, और स्वाभाविक संवाद समय। प्रदर्शनों में, मॉडल ने शोर वाले वातावरण में नामों को चेहरों से मिलाया, जब कैमरे के दृश्य में कोई विशिष्ट वस्तु दिखाई दी तो उपयोगकर्ताओं को सक्रिय रूप से याद दिलाया, दृश्य स्थिति के आधार पर एस्प्रेसो बनाने के चरणों को ठीक किया, और ऑफ-स्क्रीन जानकारी को याद करते हुए असंबंधित बातचीत को दबा दिया। सीडरियलटाइम वर्तमान में बाइटडांस के डौबाओ ऐप में तैनात है, लेकिन कंपनी ने कोई तकनीकी रिपोर्ट, पैरामीटर संख्या, खुले वजन या एपीआई प्रकाशित नहीं किया है, जिससे यह तीसरे पक्ष के एकीकरण के लिए अनुपलब्ध है। बाइटडांस के आंतरिक मूल्यांकन में बताया गया है कि कैस्केड स्टैक की तुलना में गति संबंधी समस्याएं आधी हो गई हैं, लेकिन कोई बेंचमार्क या विलंबता आंकड़े प्रदान नहीं किए गए हैं।
स्रोत: MarkTechPost —
मूल
