Tác tử 🇨🇳 07.08.2026 11:02

Microsoft công bố kiến trúc định tuyến tác tử LLM trên AKS, cắt giảm chi phí tới 85%

MicrosoftMicrosoft OpenAIOpenAI RouteLLMRouteLLM
Microsoft đã công bố một kiến trúc tham chiếu cho việc định tuyến lưu lượng tác tử trên Azure Kubernetes Service (AKS), kết hợp RouteLLM để định tuyến ngữ nghĩa, agentgateway cho quản trị, và Kubernetes Gateway API Inference Extension để cân bằng tải có nhận biết GPU. Thiết kế này nhắm đến các khối lượng công việc tác tử, nơi nhiều lời gọi LLM không yêu cầu các mô hình tiên tiến, có thể tiết kiệm tới 85% chi phí. Tuy nhiên, mức tiết kiệm phụ thuộc vào việc hiệu chỉnh cặp mô hình và độ trưởng thành của các thành phần.
Microsoft đã công bố kiến trúc tham chiếu để định tuyến lưu lượng agent trên Azure Kubernetes Service (AKS), chia bài toán thành ba lựa chọn chính: mô hình nào trả lời cuộc gọi, cách quản lý cuộc gọi đó, và bản sao GPU nào xử lý nó. Thiết kế này kết hợp Kubernetes Gateway API Inference Extension để cân bằng tải, agentgateway như một proxy AI, và RouteLLM để định tuyến ngữ nghĩa, tất cả được kết nối với một endpoint tương thích OpenAI. Kiến trúc này được thiết kế riêng cho các khối lượng công việc agentic thay vì chỉ trò chuyện đơn giản, vì một tác vụ agent duy nhất có thể kích hoạt hàng trăm cuộc gọi LLM trong vòng lặp lập kế hoạch-hành động-quan sát, hầu hết trong số đó (điền tham số công cụ, quyết định có/không, tóm tắt) không yêu cầu mô hình tiên tiến. RouteLLM kiểm tra prompt và dự đoán liệu một mô hình rẻ hơn có thể đạt chất lượng tương đương với một mô hình mạnh hơn hay không, sử dụng bộ định tuyến phân rã ma trận được huấn luyện trên dữ liệu ưu tiên của con người. Agentgateway, một proxy mã nguồn mở tương thích OpenAI, quản lý xác thực, giới hạn tốc độ theo agent, theo dõi chi phí, và các cơ chế bảo vệ mà không kiểm tra nội dung prompt. Endpoint Picker của Gateway API Inference Extension kiểm tra trạng thái GPU theo thời gian thực, bao gồm mức sử dụng bộ nhớ cache KV của vLLM và độ sâu hàng đợi, để quyết định bản sao nào của mô hình đã chọn sẽ xử lý yêu cầu. Đối với các đường dẫn tự lưu trữ, agentgateway gọi Endpoint Picker thông qua ext-proc, bỏ qua một cổng Gateway API riêng. KAITO cung cấp các nhóm nút GPU theo nhu cầu và chạy vLLM, hiển thị các số liệu như vllm:num_requests_waiting và vllm:kv_cache_usage_perc. Đường dẫn mô hình mạnh đi qua backend AI của agentgateway đến Azure OpenAI, trong khi đường dẫn mô hình yếu được định tuyến qua backend dịch vụ đến các pod phục vụ bởi KAITO. Prometheus và Grafana do Azure quản lý thu thập dữ liệu định tuyến, chi phí, và số liệu GPU để có cái nhìn thống nhất. Một con số quan trọng là ngưỡng nâng cấp của RouteLLM: trên các cặp mô hình được thử nghiệm, bộ định tuyến mf đạt được khoảng 95% chất lượng của GPT-4 trên MT-Bench trong khi chỉ gửi khoảng 26% cuộc gọi đến GPT-4, tiết kiệm tới 85% chi phí. Microsoft cảnh báo rằng con số này không tự động và phụ thuộc vào cặp mô hình được sử dụng để huấn luyện RouteLLM; người dùng phải hiệu chỉnh ngưỡng dựa trên lưu lượng thực tế. Bộ nhớ đệm prompt làm phức tạp chi phí token, vì các lần truy cập bộ nhớ đệm được giảm giá, và việc chuyển đổi mô hình làm mất hiệu lực bộ nhớ đệm ở cả hai phía. Bài viết cảnh báo rằng các thành phần này còn mới; các trường thay đổi giữa các phiên bản - Inference Extension đã đổi tên và cấu trúc lại CRD trước phiên bản v1. Tất cả đã được xác minh end-to-end vào giữa năm 2026 trên AKS với Inference Extension v1.0.0 và agentgateway v1.3.1. Các nhóm có thể áp dụng kiến trúc này theo từng giai đoạn: với các mô hình được quản lý và ít agent, chỉ cần quản trị agentgateway; với mô hình tự lưu trữ đơn lẻ, chỉ cần KAITO và Inference Extension mà không cần định tuyến ngữ nghĩa; RouteLLM đáng giá khi có khoảng cách giá rõ ràng giữa mô hình mạnh và mô hình yếu và lưu lượng đơn giản đáng kể, điều này áp dụng cho gần như tất cả các agent lặp.
Nguồn: InfoQ 中国 — bản gốc
Bài viết liên quan trước đây ↓
Tin mới