Alibaba mở mã nguồn Qwen2.5-1M với ngữ cảnh lên đến 1 triệu token
Alibaba/Qwen
Alibaba đã phát hành các mô hình mã nguồn mở Qwen2.5-7B-Instruct-1M và Qwen2.5-14B-Instruct-1M với ngữ cảnh lên đến 1 triệu token, cùng với framework suy luận tối ưu dựa trên vLLM. Các mô hình vượt trội hơn các phiên bản trước và GPT-4o-mini trong các tác vụ có ngữ cảnh dài, đồng thời duy trì hiệu suất trên các văn bản ngắn.
Alibaba Qwen đã công bố các mô hình mã nguồn mở Qwen2.5-7B-Instruct-1M và Qwen2.5-14B-Instruct-1M, có khả năng xử lý ngữ cảnh lên tới 1 triệu token. Để triển khai chúng, công ty đã mở hoàn toàn framework suy luận dựa trên vLLM, sử dụng cơ chế chú ý thưa (sparse attention) và tăng tốc xử lý 1 triệu token lên 3–7 lần. Các mô hình được huấn luyện theo phương pháp tiến bộ: đầu tiên trên chuỗi dài tới 256K token, sau đó mở rộng lên 1 triệu bằng cách ngoại suy độ dài (Dual Chunk Attention). Trong các bài kiểm tra truy xuất mật khẩu (Passkey Retrieval) và các tác vụ phức tạp (RULER, LV-Eval, LongBench), các mô hình vượt trội đáng kể so với phiên bản 128K và GPT-4o-mini. Để suy luận, khuyến nghị sử dụng GPU kiến trúc Ampere hoặc Hopper, với tối thiểu 120 GB VRAM cho mô hình 7B và 320 GB cho mô hình 14B. Ngoài ra, còn có Qwen Chat - trợ lý AI hỗ trợ ngữ cảnh dài.
Nguồn: Alibaba Qwen —
bản gốc
