Kimi K3 trên PAC1 và ECOM1: kết quả 204 tác vụ và phân tích lỗi
Moonshot AI
Moonshot AI đã phát hành mã nguồn mở Kimi K3 vào tháng Bảy. Mô hình được kiểm tra trên hai chuẩn BitGN (PAC1 và ECOM1) với 204 dấu vết mở. Kết quả cho thấy hiệu suất mạnh trên các tác vụ truy xuất và tính toán đơn giản, nhưng thường xuyên thất bại trên các thao tác nguyên tử đa tệp, kiểm tra đầu vào không đáng tin cậy và tính nhất quán trên bảng dài.
Ngày 27 tháng 7, Moonshot AI đã công bố trọng số mở cho Kimi K3 kèm báo cáo kỹ thuật. Để độc lập xác minh hiệu suất, mô hình đã được chạy trên hai bộ tác vụ BitGN: PAC1 (tài liệu, hóa đơn, hộp thư đến, thay đổi tệp hàng loạt) và ECOM1 (danh mục, tồn kho, giỏ hàng, thanh toán, trả hàng, hậu cần). PAC1 đạt 61 trên 104 (nhị phân), ECOM1 đạt 44,75 trên 100 (tín dụng một phần). 204 dấu vết mở cho phép kiểm tra từng lệnh và thay đổi trạng thái. Trên PAC1, các tác vụ tìm kiếm và tính toán đơn giản đạt tỷ lệ thành công 90-92%, nhưng xuất hiện ba dạng lỗi chính: vi phạm lược đồ chính xác (ghi tên trường tương tự nhưng sai), thao tác hàng loạt không nguyên tử (thay đổi tệp một phần trước khi xác thực toàn bộ tập hợp), và kiểm tra đầu vào không đáng tin cậy không chặn (nội dung nguy hiểm được phát hiện nhưng hành động vẫn được thực thi). Trên ECOM1, tìm kiếm Mã hàng hóa (Stock Keeping Unit - SKU) chính xác và thanh toán tiêu chuẩn hoạt động tốt, nhưng các lỗi bao gồm mất trạng thái giữa các dòng trong báo cáo nhiều dòng, cảnh báo bất thường quá mức, thiếu kiểm tra danh tính trước khi đọc dữ liệu riêng tư, và thay đổi trạng thái do đầu vào không đáng tin cậy. Các tác vụ tối ưu hóa (lập lịch phân phối) tạo ra các phương án khả thi nhưng chưa tối ưu. So sánh với các lần chạy BitGN công khai khác cho thấy Kimi K3 cạnh tranh trên các tác vụ đơn giản nhưng kém hơn trên các ràng buộc đa bước phức tạp.
Nguồn: Habr — хаб ИИ —
bản gốc
