Tác nhân AI: Xử lý song song công việc mà không nhân đôi sai sót
OpenAI
Anthropic
Một nghiên cứu của các nhà khoa học bao gồm Anthropic giới thiệu một tiêu chuẩn đánh giá có tên Horizon và phân tích hơn 3.100 lộ trình tác nhân. Kết quả cho thấy hiệu suất của tác nhân AI có thể sụp đổ đột ngột vượt quá độ phức tạp nhiệm vụ nhất định, với 72,5% lỗi được quy cho các rủi ro liên quan đến quy trình. Anthropic khuyến nghị tách các dự án độc lập thay vì chia các giai đoạn.
Các nhà nghiên cứu đã phát triển một điểm chuẩn có tên Horizon và phân tích hơn 3.100 quỹ đạo tác nhân trong nhiều môi trường khác nhau, bao gồm web, hệ điều hành, cơ sở dữ liệu và môi trường nhập vai. Các thí nghiệm liên quan đến các tác nhân sử dụng mô hình từ OpenAI và Anthropic. Kết quả cho thấy hiệu suất không suy giảm dần dần khi nhiệm vụ kéo dài mà có thể duy trì ổn định và sau đó sụp đổ đột ngột vượt quá một ngưỡng nhất định. Bảy loại lỗi chính đã được xác định, được nhóm thành hai nhóm: 72,5% lỗi liên quan đến rủi ro quy trình và 27,5% liên quan đến rủi ro thiết kế tác nhân. Anthropic nhấn mạnh một hiện tượng gọi là 'ô nhiễm ngữ cảnh', trong đó thông tin trung gian tích lũy làm lộn xộn ngữ cảnh của tác nhân và làm suy giảm khả năng phán đoán. Nghiên cứu gợi ý rằng việc chia một nhiệm vụ thành các nhiệm vụ con độc lập do các tác nhân riêng biệt xử lý có hiệu quả, trong khi việc chia các giai đoạn như thiết kế, triển khai và kiểm thử, vốn chia sẻ quá nhiều ngữ cảnh, dẫn đến mất thông tin giống như trò chơi điện thoại. Đối với các nhà điều hành, bốn câu hỏi chính là: ai đã đưa ra quyết định, dựa trên thông tin nào, với chi phí bao nhiêu và liệu một bước thất bại duy nhất có thể được phát lại một cách độc lập hay không. Nếu không có khả năng phát lại, sự cố sẽ khởi động lại mọi thứ và việc chia tách không đúng cách có thể tốn kém gấp 3 đến 10 lần so với một tác nhân duy nhất.
Nguồn: Le Monde Informatique — IA —
bản gốc
