AMD ra mắt Instella-MoE-16B-A3B: Mô hình ngôn ngữ hỗn hợp chuyên gia hoàn toàn mở với 2,8 tỷ tham số hoạt động được huấn luyện trên GPU Instinct
AMD giới thiệu Instella-MoE-16B-A3B, một mô hình ngôn ngữ hỗn hợp chuyên gia hoàn toàn mở với tổng cộng 16 tỷ tham số và 2,8 tỷ tham số hoạt động trên mỗi token, được huấn luyện từ đầu trên GPU Instinct MI300X và MI325X. Bản phát hành bao gồm trọng số, công thức dữ liệu, cấu hình huấn luyện và mã nguồn suy luận, với các tính năng sáng tạo như Gated Multi-head Latent Attention và kết nối FarSkip-Collective.
AMD đã công bố Instella-MoE-16B-A3B, một mô hình ngôn ngữ Mixture-of-Experts hoàn toàn mở, được huấn luyện từ đầu trên GPU Instinct MI300X và MI325X. Mô hình có tổng cộng 16 tỷ tham số nhưng chỉ kích hoạt 2,8 tỷ tham số cho mỗi token, sử dụng 2 expert dùng chung và 6 expert được định tuyến, được chọn từ 64 expert trong mỗi lớp MoE. AMD đang công bố trọng số từ mọi giai đoạn huấn luyện, cùng với hỗn hợp dữ liệu, cấu hình huấn luyện và mã nguồn suy luận. Hai lựa chọn cấu trúc chính là Gated Multi-head Latent Attention (bổ sung một cổng đầu ra nhẹ được học) và FarSkip-Collective (chồng lấn giao tiếp song song giữa các expert với tính toán). AMD báo cáo tốc độ tiền huấn luyện tăng 12,7% và giảm thời gian đến token đầu tiên lên tới 39,2% khi phục vụ với song song expert. Mô hình được tiền huấn luyện trên 7,1 nghìn tỷ token từ các kho ngữ liệu mở, với giai đoạn giữa sử dụng Dolma3 Dolmino 100B, và giai đoạn ngữ cảnh dài mở rộng cửa sổ từ 4K lên 64K bằng YaRN. Hậu huấn luyện bao gồm SFT, DPO và RL trong khung Miles. Điểm trung bình của checkpoint cơ sở là 76,7, mạnh nhất trong số các mô hình hoàn toàn mở, vượt qua Moonlight-16B-A3B (76,2) và các mô hình khác. Trọng số được cấp phép theo giấy phép ResearchRAIL, chỉ dành cho mục đích học thuật và nghiên cứu, trong khi mã nguồn huấn luyện được cấp phép MIT.
Nguồn: MarkTechPost —
bản gốc
