Từ tác tử LLM trò chuyện đến hệ thống có thể quản trị: Hướng dẫn kiến trúc
OpenAI
Google/DeepMind
Microsoft
Anthropic
LangChain
Mastra
CrewAI
KaibanJS
Bài viết cung cấp hướng dẫn toàn diện về tác tử LLM và hệ thống đa tác tử, bao gồm các chiến lược từ ReAct đến đồ thị, thực thi bền vững, sandbox, bộ nhớ, đánh giá và bảo mật trong sản xuất. Nó giúp các nhà phát triển hiểu khi nào một tác tử là đủ, khi nào cần nhiều tác tử và cách chọn kiến trúc tối thiểu khả thi. Hướng dẫn nhấn mạnh rằng các hệ thống tác tử hiện đại là các ngăn xếp đa lớp chứ không phải là các thư viện đơn lẻ.
Bài viết này là một hướng dẫn dành cho các nhà phát triển nhằm hiểu rõ về các hệ thống agentic (hệ thống dựa trên tác nhân): nó làm rõ sự khác biệt giữa một agent (tác nhân) và một quy trình làm việc (workflow) thông thường, cũng như khi nào nên sử dụng một hoặc nhiều agent. Bài viết chỉ ra rằng một agent được định nghĩa bởi: mô hình (model) + vòng lặp xử lý công việc (work loop) + công cụ (tools) + trạng thái (state) + các quy tắc và ràng buộc (rules and constraints).
Bài viết truy ngược lại quá trình phát triển từ phương pháp ReAct (2022) - phương pháp giới thiệu chu trình suy nghĩ - hành động - quan sát (thought-action-observation), đến kiến trúc hội thoại được phổ biến bởi AutoGen vào năm 2023, và sau đó là các cấu trúc dựa trên đồ thị (graph-based) như LangGraph vào năm 2024. Bài viết nhấn mạnh rằng một agent duy nhất thường đã đủ cho nhiều ứng dụng, và các thiết lập đa agent (multi-agent) chỉ mang lại lợi ích khi các vai trò thực sự khác nhau về ngữ cảnh, công cụ, hoặc quyền hạn.
Bài viết cũng thảo luận về nhiều chiến lược khác nhau (ReAct, Plan-and-Solve, ReWOO, Tree of Thoughts, RAP, LATS, Self-Refine, Reflexion, MRKL) và lưu ý rằng các bước càng được xác định trước nhiều thì mô hình càng cần ít sự tự do hơn. Bài viết giới thiệu khái niệm "sân khấu agent" (agent theater), nơi các lệnh gọi mô hình ngôn ngữ lớn (Large Language Model - LLM) giống hệt nhau giả vờ như là một đội nhóm, đồng thời nhấn mạnh việc tách biệt logic tất định (deterministic logic - mã code) khỏi logic xác suất (probabilistic logic - các quyết định của LLM).
Cuối cùng, bài viết trình bày một ngăn xếp công nghệ agent (agent stack) hiện đại với các lớp bao gồm Agent SDK (bộ công cụ phát triển phần mềm dành cho agent), graph runtime (môi trường thực thi dựa trên đồ thị), bộ nhớ (memory), cơ chế cách ly an toàn (sandboxing), và khả năng giám sát (observability), đồng thời liệt kê các ví dụ như OpenAI Agents SDK, Google ADK, LangGraph, Mastra, và nhiều công cụ khác.
Nguồn: Habr — хаб ИИ —
bản gốc
