阿里巴巴将Qwen2.5-Turbo上下文长度扩展至100万tokens
Alibaba/Qwen
OpenAI
阿里巴巴发布Qwen2.5-Turbo,上下文长度从128K扩展至100万tokens。该模型在100万tokens的密码检索任务中达到100%准确率,在RULER基准测试中获得93.1分,超越GPT-4。通过稀疏注意力机制,推理速度最高提升4.3倍,而成本保持在每百万tokens 0.3元人民币。
阿里巴巴发布了Qwen2.5-Turbo模型,将其上下文长度从128K扩展到1M tokens,相当于约100万英文单词或150万汉字。该模型在1M长度的钥匙检索任务中实现了100%的准确率,并在长文本评估基准RULER上获得93.1分,优于GPT-4的91.6分和GLM4-9B-1M的89.9分。采用稀疏注意力机制后,处理1M token上下文的首次输出时间从4.9分钟降至68秒,提速4.3倍。价格维持在每100万 tokens 0.3元人民币,使得Qwen2.5-Turbo在相同成本下能处理的 tokens 数是GPT-4o-mini的3.6倍。该模型保持了竞争性的短序列能力,与GPT-4o-mini相当。用户可通过阿里云百炼API、HuggingFace演示页面和ModelScope演示页面使用该模型。
来源: Alibaba Qwen —
原文
