Tác tử 🇷🇺 30.07.2026 17:01

Tại sao AI Agent thực ra lại rẻ hơn RAG

Mặc dù trợ lý RAG cổ điển có chi phí mỗi truy vấn rẻ hơn, nhưng các chi phí ẩn như người dùng hỏi tiếp và sự can thiệp của nhân viên vận hành khiến nó đắt hơn về tổng thể. Một agent sử dụng vòng lặp ReAct tự động tìm kiếm nhiều tài liệu cho đến khi tìm được câu trả lời đầy đủ, biến quy trình 3 lần thử trong 27 phút thành một câu trả lời duy nhất trong 4 phút. Dữ liệu thí điểm thực tế từ một dự án hỗ trợ xác nhận rằng các agent giải quyết câu hỏi với chi phí bằng một phần ba so với trợ lý RAG.
Bài báo lập luận rằng việc so sánh chi phí một cách ngây thơ giữa một trợ lý RAG và một agent là sai lệch. Một trợ lý RAG cổ điển thực hiện một lần gọi LLM và dựa vào người dùng để tinh chỉnh truy vấn nếu câu trả lời sai. Trên thực tế, người dùng thường bỏ cuộc sau 2–3 lần thử, chuyển sang nhân viên hỗ trợ, người dành 10–15 phút để giải quyết vấn đề. Điều này cộng lại nhiều hơn một lần gọi LLM. Một agent dựa trên vòng lặp ReAct tự động lặp lại qua các công cụ tìm kiếm, đưa ra giả thuyết, truy xuất các đoạn và tổng hợp câu trả lời cuối cùng mà không cần can thiệp của người dùng. Agent ISTOK của tác giả sử dụng năm công cụ: VectorSearch (kết hợp dense + BM25 qua Milvus), Search (toàn văn PostgreSQL), OpenChunk để đọc toàn bộ đoạn tài liệu, GetDocumentChunks cho mục lục và CallOperator như là phương án cuối cùng sau 2–3 lần tự thử. Để quản lý giới hạn cửa sổ ngữ cảnh, agent ban đầu thử tóm tắt bằng LLM nhưng thấy đắt và không đáng tin cậy; hiện tại nó sử dụng cửa sổ trượt (giữ 6 tin nhắn cuối, loại bỏ các tin nhắn công cụ cũ nhất) với tóm tắt làm phương án dự phòng (tối đa 2 lần mỗi phiên). Các lần gọi LLM cũng được phân biệt: embedding và reranking giá rẻ, sinh văn bản nhẹ cho các bước đơn giản, trung bình cho suy luận điển hình và nặng chỉ cho tổng hợp cuối cùng hoặc tóm tắt. Trong một thử nghiệm thực tế với khoảng 1200 tài liệu và 1800 yêu cầu hàng tháng, trợ lý trung bình 1 lần gọi LLM, 2,3 lần theo dõi người dùng, tỷ lệ chuyển tiếp 34%, 27 phút để đóng và khoảng 18.000 token mỗi câu hỏi đã đóng. Agent trung bình 6,4 lần gọi LLM, 0,3 lần theo dõi, tỷ lệ chuyển tiếp 11%, 4 phút để đóng và khoảng 15.500 token. Về chi phí trực tiếp, một câu hỏi đã đóng của trợ lý tốn khoảng 52 RUB (bao gồm chi phí nhân viên), trong khi agent tốn khoảng 17 RUB, giảm ba lần. Lợi thế của agent biến mất đối với các câu hỏi thực tế đơn giản hoặc khi cơ sở kiến ​​thức trống, vì nó lãng phí các lần lặp. Agent ghi lại mức sử dụng token của mỗi lần gọi và lịch sử công cụ, với theo dõi qua Arize Phoenix để phân tích chi tiết từng lần lặp.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới