初创企业追逐大语言模型的下一件大事
Liquid AI
一批初创企业正试图克服Transformer架构的局限性,该架构是当今大语言模型的基石。它们提出新的架构和技术,旨在让模型更快、更高效,并可能更智能,力图挑战AI巨头的地位。
Transformer架构,源自2017年谷歌发表的一篇论文,支撑着所有主流大语言模型,但其密集注意力机制计算成本高昂,且在长上下文处理上力不从心。初创公司正着手解决这些缺陷:Subquadratic声称其稀疏注意力模型SubQ能与主流大语言模型相媲美;Manifest AI用“幂保留”取代注意力机制,已发布PowerCoder和Brumby模型;Liquid AI将Transformer与液态神经网络相结合,打造出更小、更节能的混合液态基础模型(LFM);Inception利用扩散模型一次性生成整段文本,其Mercury 2模型声称比GPT-4快10倍;Pathway的“龙雏”模型擅长解数独谜题,暗示着向语言之外的领域拓展。这些初创公司看到了改变大语言模型构建方式的机会,有望在速度、效率和能力上实现显著提升。
来源: MIT Technology Review —
原文
