Tác tửNghiên cứu 🇩🇪 02.08.2026 14:01

Meta AI đề xuất một tác tử AI thứ hai để giữ cho các tác vụ dài không bị chệch hướng

MetaMeta AnthropicAnthropic
Các nhà nghiên cứu Meta AI đã phát triển một mô-đun bộ nhớ sử dụng một 'tác tử bộ nhớ' riêng biệt để tiêm nhắc nhở một cách có chọn lọc vào một 'tác tử hành động' trong suốt các tác vụ dài, ngăn chặn 'suy giảm trạng thái hành vi'. Các bài kiểm tra trên Terminal-Bench 2.0 và τ2-Bench cho thấy sự cải thiện đáng kể, đặc biệt đối với các tác tử yếu hơn, và mã nguồn đã được mở trên GitHub.
Trong bài báo của mình, các nhà nghiên cứu tại Meta AI mô tả một vấn đề lặp đi lặp lại, trong đó các agent AI (tác nhân AI) dần mất dấu các yêu cầu hoặc lặp lại những hành động đã thất bại trong các tác vụ kéo dài, hiện tượng mà họ gọi là 'sự suy giảm trạng thái hành vi' (behavioral state decay). Họ đề xuất một mô-đun bộ nhớ dạng cắm-và-chạy (plug-and-play), vận hành một 'agent bộ nhớ' (memory agent) riêng biệt song song với một 'agent hành động' (action agent) không thay đổi, quan sát các bước gần nhất theo những khoảng thời gian cố định, cập nhật một ngân hàng bộ nhớ có cấu trúc, và quyết định xem có nên chèn một lời nhắc ngắn gọn dựa trên bộ nhớ vào lệnh gọi hành động tiếp theo hay giữ im lặng. Ngân hàng bộ nhớ được chia thành bộ nhớ trạng thái riêng tư (private status), bộ nhớ kiến thức (knowledge) và bộ nhớ thủ tục (procedural memory), và agent quản lý ngân hàng này thông qua các lệnh gọi công cụ (tool calls) được định nghĩa trước, thay vì viết lại tự do. Các thử nghiệm được tiến hành trên Terminal-Bench 2.0 và τ2-Bench với Claude Opus 4.6 đóng vai trò agent bộ nhớ. Khi sử dụng Claude Sonnet 4.5 làm agent hành động, hệ thống giải được 46% các tác vụ của Terminal-Bench ngay trong lần thử đầu tiên, tăng so với mức 38% trước đó, và cải thiện điểm trung bình có trọng số theo tác vụ (task-weighted average) của τ2-Bench từ 55% lên 62%, với sự khác biệt đáng chú ý giữa các lĩnh vực: Airline và Retail đều cải thiện khoảng 10 điểm phần trăm, trong khi Telecom chỉ cải thiện 3 điểm phần trăm. Mô hình Opus 4.6 mạnh hơn cũng được cải thiện, nhưng ở mức độ thấp hơn, cho thấy lợi ích của phương pháp này không chỉ đơn thuần là bù đắp cho năng lực hạn chế. Các thử nghiệm loại bỏ thành phần (ablation) cho thấy việc can thiệp có chọn lọc và duy trì một ngân hàng bộ nhớ được cập nhật liên tục là những yếu tố then chốt, và phương pháp này vượt trội hơn lớp bộ nhớ sản xuất (productive memory layer) Mem0. Nhóm nghiên cứu cũng thử nghiệm huấn luyện một mô hình mở, Qwen3.5-27B, để đóng vai trò agent bộ nhớ, và phát hiện rằng cần có cả tinh chỉnh có giám sát (supervised fine-tuning) và học tăng cường (reinforcement learning) để hiệu chỉnh đúng mức các can thiệp. Meta AI đã công bố mã nguồn trên GitHub.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới