Tác tửPhần cứng & Suy luận 🇷🇺 05.08.2026 17:02

Ai Thực Sự Dẫn Đầu Trong Phát Triển Tác Nhân? Không Phải Như Bạn Nghĩ

AnthropicAnthropic DeepSeekDeepSeek OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Một thí nghiệm sản xuất kéo dài hai tuần bởi một nhà phát triển duy nhất sử dụng mã hóa tác nhân dưới một ngăn xếp quản trị đã tiêu thụ 8,8 tỷ token trên 30.993 yêu cầu. Chi phí cho thấy khoảng cách giá gấp 72 lần giữa các mô hình của Anthropic và DeepSeek, được thúc đẩy bởi công nghệ nén KV-cache 93%, khiến quản trị chỉ có thể chi trả được với kiến trúc của DeepSeek.
Bài báo đưa tin rằng một thử nghiệm sản xuất kéo dài hai tuần vào tháng 6 năm 2026, trong đó một nhà phát triển sử dụng các công cụ mã hóa đại lý với một ngăn xếp quản trị, đã tiêu thụ 8,82 tỷ token trong 30.993 yêu cầu, với tỷ lệ trúng bộ nhớ đệm là 99,38%. Chi phí chung cho quản trị (chính sách, kỹ năng, lời nhắc đánh giá) dao động từ 70.000 đến 90.000 token cho mỗi lần gọi. Chi phí thay đổi đáng kể tùy theo mô hình: Sonnet 4.6 của Anthropic sẽ tiêu tốn 4.770 đô la cho cùng một khối lượng công việc với tỷ lệ trúng bộ nhớ đệm thực tế là 92%, trong khi DeepSeek V4 Pro chỉ tốn 66,17 đô la, chênh lệch gấp 72 lần. Khoảng cách này bắt nguồn từ cơ chế Chú ý tiềm ẩn đa đầu (MLA) của DeepSeek, giúp nén bộ nhớ đệm KV tới 93,3%, cho phép đọc bộ nhớ đệm gần như miễn phí và bộ nhớ đệm có thể tồn tại trong nhiều ngày trên ổ cứng thể rắn thông thường thông qua 3FS, trong khi Anthropic, OpenAI và Google sử dụng GQA/MHA với bộ nhớ đệm hết hạn trong vòng một giờ do giới hạn bộ nhớ băng thông cao (HBM). Bài báo cũng trích dẫn các sự cố tại Uber, Microsoft, Amazon, Pinterest và một doanh nghiệp không được nêu tên, cho thấy chi phí tăng vọt do việc sử dụng đại lý không kiểm soát, và lập luận rằng lựa chọn kiến trúc của DeepSeek khiến việc quản trị trở nên khả thi về mặt kinh tế, trái ngược với các lựa chọn đắt đỏ hơn buộc các nhóm phải cắt giảm các biện pháp an toàn.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới