开源模型 🇨🇳 28.07.2026 16:03

阿里开源 Qwen2.5-1M,支持高达 100 万 Token 的上下文

Alibaba/QwenAlibaba/Qwen
阿里巴巴发布了开源模型 Qwen2.5-7B-Instruct-1M 和 Qwen2.5-14B-Instruct-1M,上下文长度可达 100 万 Token,并基于 vLLM 提供了优化的推理框架。这些模型在长上下文任务中优于之前的版本和 GPT-4o-mini,同时在短文本上保持了性能。
阿里巴巴通义千问发布了开源模型Qwen2.5-7B-Instruct-1M和Qwen2.5-14B-Instruct-1M,能够处理长达100万个token的上下文。为了部署这些模型,公司完全开源了基于vLLM的推理框架,该框架采用稀疏注意力(sparse attention)机制,将处理100万token的速度提升了3到7倍。模型采用渐进式训练:首先在最长256K token的序列上进行训练,然后通过长度外推(双块注意力,即Dual Chunk Attention)扩展到100万token。在密码检索(Passkey Retrieval)测试以及复杂任务(如RULER、LV-Eval、LongBench)中,这些模型显著超越了128K版本和GPT-4o-mini。推理时建议使用基于安培(Ampere)或霍珀(Hopper)架构的GPU,7B模型至少需要120GB显存,14B模型则需要320GB。此外,还推出了支持长上下文的AI助手Qwen Chat。
来源: Alibaba Qwen — 原文
我们之前关于此话题的帖子 ↓
最新新闻