アリババ、Qwen2.5-Turboのコンテキスト長を100万トークンに拡張
Alibaba/Qwen
OpenAI
アリババは、Qwen2.5-Turboのコンテキスト長を128Kトークンから100万トークンに拡張しました。本モデルは、100万トークンのパスキー検索タスクで100%の精度を達成し、RULERベンチマークで93.1点を獲得してGPT-4を上回りました。スパースアテンションにより推論速度が最大4.3倍向上し、コストは100万トークンあたり0.3人民元のままです。
Alibabaは、コンテキスト長を128Kから1Mトークン(約100万英単語、あるいは150万中国語文字に相当)に拡張したQwen2.5-Turboモデルを発表しました。このモデルは、1M長のPasskey Retrievalタスクで100%の精度を達成し、長文評価ベンチマークRULERでは93.1をスコアして、GPT-4の91.6やGLM4-9B-1Mの89.9を上回っています。スパースアテンション機構を採用することで、1Mトークンのコンテキストに対する最初のトークン生成時間(time to first token)を4.9分から68秒に短縮し、4.3倍の高速化を実現しました。価格は100万トークンあたり0.3人民元と変わらず、Qwen2.5-Turboは同じコストでGPT-4o-miniの3.6倍のトークンを処理できます。また、ショートシーケンス性能も競争力を維持しており、GPT-4o-miniと同等です。このモデルは、Alibaba Cloud Model Studio API、HuggingFaceデモ、ModelScopeデモを通じて利用可能です。
出典: Alibaba Qwen —
原文
