Mô hình khuếch tán tác tử đầu tiên trên thế giới: Tự sửa lỗi khi hành động, ngữ cảnh 128K ngang bằng mô hình tự hồi quy
Nhóm inclusionAI của Tập đoàn Ant đã phát hành LLaDA 2.2, mô hình khuếch tán tác tử quy mô lớn đầu tiên trên thế giới với ngữ cảnh gốc 128K. Mô hình tích hợp chỉnh sửa Levenshtein, học tăng cường từ phản hồi môi trường và kiến trúc BlockRouting, đạt hiệu suất gần bằng các mô hình tự hồi quy hàng đầu trên các chuẩn đánh giá tác tử, đồng thời cung cấp thông lượng cao hơn.
Nhóm AI tổng hợp (inclusionAI) của Tập đoàn Ant Group đã công bố mã nguồn mở LLaDA 2.2, một mô hình ngôn ngữ khuếch tán (diffusion) dựa trên kiến trúc hỗn hợp chuyên gia (MoE) với 100 tỷ tham số, hỗ trợ ngữ cảnh gốc lên đến 128K. Đây là mô hình khuếch tán tác tử quy mô lớn đầu tiên, cho phép mô hình đồng thời tạo và chỉnh sửa đầu ra. Mô hình sử dụng mô hình biên tập Levenshtein với bốn phép toán nguyên tử (GIỮ LẠI, THAY THẾ, XÓA, CHÈN) để sửa đổi nội dung đã tạo một cách linh hoạt. Nó cũng giới thiệu L-EBPO (Levenshtein Editing Evidence Lower Bound Policy Optimization) để coi các quyết định biên tập nhiều lượt như các bài toán học tăng cường dựa trên phản hồi từ môi trường. Để xử lý các ngữ cảnh dài, mô hình sử dụng BlockRouting, chọn một nhóm chuyên gia cố định ở cấp khối trước khi định tuyến ở cấp token, giảm lưu lượng Bộ nhớ băng thông cao (HBM) và chi phí truyền thông. Trên bảy điểm chuẩn tác tử, LLaDA 2.2-flash đạt 53,83 điểm so với 55,74 của Ling-2.6-flash, cho thấy hiệu suất tương đương, đồng thời đạt thông lượng trung bình gấp 1,64 lần ở định dạng BF16 và cải thiện thêm 18,6% với lượng tử hóa FP8. Điều này chứng minh rằng các mô hình khuếch tán có thể sánh ngang với các mô hình tự hồi quy trong các tác vụ tác tử và sẽ cùng tồn tại trong các hệ thống tác tử trong tương lai.
Nguồn: QbitAI 量子位 —
bản gốc
