Liquid AI 发布开源权重双向编码器 LFM2.5-Encoder-230M 和 350M
Liquid AI
Liquid AI 发布了两个开源权重双向编码器:LFM2.5-Encoder-230M 和 350M,它们基于 LFM2 混合骨干网络,支持 8192 个 token 的上下文。其中 350M 模型在 17 个任务上的 14 个模型中排名第四,性能优于 XLM-R XL 等更大模型。这两个编码器针对 CPU 部署进行了优化,230M 模型在 8K 上下文下的速度显著快于 ModernBERT-base。
Liquid AI 发布了两个开源双向编码器 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,基于 LFM2 混合骨干网络。两者均支持 8192 token 的上下文长度。它们通过将 LFM2.5 解码器骨干中的因果注意力替换为双向注意力、使短卷积非因果化,并采用 30% 的掩码语言建模目标进行训练而得到。训练分为两个阶段:首先在 1024 token 下学习通用语言能力,然后将上下文扩展到 8192 token。350M 模型在 17 个任务上的平均得分为 81.02,在 14 个模型中排名第四,仅次于 XLM-R XL(3.5B)、ModernBERT-large(395M)和 XLM-R large(560M)。230M 模型得分为 79.29,优于 ModernBERT-base 和所有 EuroBERT 模型。在 CPU 上处理 8K token 时,230M 模型单次前向传播耗时约 28 秒,而 ModernBERT-base 超过 90 秒。这些编码器面向边缘设备、受监管的本地系统和批量处理流水线。它们通过 transformers 加载,需设置 trust_remote_code=True,并需要微调。Liquid AI 还在 Hugging Face Spaces 上提供了五个 CPU 专用演示。
来源: MarkTechPost —
原文
