Tác tửNghiên cứu 🇺🇸 28.07.2026 23:03

Nhà nghiên cứu từ PSU và Duke giới thiệu phương pháp tự động quy lỗi cho hệ thống đa tác tử

Google DeepMindGoogle DeepMind MetaMeta OpenAIOpenAI DeepSeekDeepSeek
Các nhà nghiên cứu từ Đại học Penn State và Đại học Duke, hợp tác với Google DeepMind và các bên khác, đã chính thức hóa bài toán quy lỗi tự động trong hệ thống đa tác tử dựa trên mô hình ngôn ngữ lớn. Họ đã tạo ra bộ dữ liệu chuẩn đầu tiên có tên Who&When và đánh giá một số phương pháp, kết quả cho thấy ngay cả cách tiếp cận tốt nhất cũng chỉ đạt độ chính xác 53,5% trong việc xác định tác tử chịu trách nhiệm.
Một nhóm nghiên cứu từ Đại học Penn State và Đại học Duke, cùng với các nhà nghiên cứu từ Google DeepMind, Đại học Washington, Meta, Đại học Công nghệ Nanyang và Đại học Bang Oregon, đã định nghĩa một bài toán nghiên cứu mới: tự động gán lỗi trong các hệ thống đa tác tử dựa trên LLM. Họ xây dựng bộ dữ liệu điểm chuẩn đầu tiên, có tên Who&When, chứa các bản ghi lỗi từ 127 hệ thống đa tác tử với chú thích của con người về tác tử chịu trách nhiệm, bước lỗi quyết định và giải thích bằng ngôn ngữ tự nhiên. Nhóm nghiên cứu đã phát triển và đánh giá ba phương pháp gán lỗi: All-at-Once, Step-by-Step và Binary Search. Các thử nghiệm sử dụng GPT-4o cho thấy phương pháp đơn lẻ tốt nhất chỉ đạt độ chính xác 53,5% trong việc xác định tác tử chịu trách nhiệm và 14,2% trong việc xác định chính xác bước lỗi. Các phương pháp kết hợp cải thiện hiệu suất nhưng tốn nhiều chi phí tính toán hơn. Bài báo đã được chấp nhận trình bày tại hội nghị ICML 2025 dưới dạng Spotlight, và mã nguồn cùng bộ dữ liệu đã được công khai.
Nguồn: Synced — bản gốc
Bài viết liên quan trước đây ↓
Tin mới