Tác tửNghiên cứu 🇺🇸 27.07.2026 02:04

Định tuyến mô hình: Đơn giản? Cho đến khi bạn chạm vào thực tế

OpenAIOpenAI AnthropicAnthropic
Định tuyến giữa các mô hình AI không chỉ là vấn đề phân loại mà còn là thách thức tối ưu hóa hệ thống. Các yếu tố thực tế như bộ nhớ đệm (caching), hạ tầng, độ trễ và tuân thủ chi phối, khiến bảng giá và độ khó của nhiệm vụ trở thành công cụ hướng dẫn kém hiệu quả.
Việc định tuyến giữa các mô hình AI phức tạp hơn so với vẻ ngoài. Trong các thử nghiệm với 417 tác vụ trên AppWorld Test Challenge sử dụng tác tử CodeAct, GPT-4.1 tiêu tốn 155 đô la (0,37 đô la/tác vụ) trong khi Claude Sonnet tiêu tốn 79 đô la (0,19 đô la/tác vụ), mặc dù GPT-4.1 có giá mỗi token thấp hơn. Sự khác biệt đến từ bộ nhớ đệm: giá đọc bộ nhớ đệm thấp hơn của Sonnet mang lại lợi thế lớn trong các khối lượng công việc tác vụ có ngữ cảnh được tái sử dụng. Độ khó của tác vụ thường không thể thấy rõ tại thời điểm định tuyến, và các bộ định tuyến phải cân bằng đồng thời giữa chi phí, chất lượng, độ trễ, tuân thủ và độ tin cậy. Độ trễ phụ thuộc vào các yếu tố cơ sở hạ tầng như phần cứng và trạng thái bộ nhớ đệm, không chỉ kích thước mô hình. Các tác giả đã xây dựng một bộ định tuyến coi việc định tuyến là một bài toán tối ưu hóa, chứ không phải phân loại, tạo ra một đường biên chi phí - độ chính xác. Cấu hình 1 đạt độ chính xác 84% với chi phí 93 đô la và 83 giây, giảm chi phí 21% và độ trễ 9% so với chạy riêng Opus, chỉ giảm 4% độ chính xác. Một bộ định tuyến dựa trên độ khó tiêu chuẩn (hình thoi xanh lam) có độ chính xác tương tự nhưng chi phí cao hơn. Quá trình tối ưu hóa nhẹ: khoảng 6 mili giây và 2 kB bộ nhớ mỗi tác vụ.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới