Tác nhân chỉ một đô la: Kinh tế học của sự kết hợp Hermes Agent và DeepSeek V4 Flash
DeepSeek
Một ảnh chụp màn hình lan truyền cho rằng hàng trăm triệu token đã được xử lý chỉ với hơn một đô la nhờ sử dụng Hermes Agent mã nguồn mở trên DeepSeek V4 Flash. Tin tức này giải thích cơ chế đằng sau chi phí thấp như vậy, tập trung vào bộ nhớ đệm tiền tố tự động, đồng thời nêu rõ điều gì phá vỡ bộ nhớ đệm và các tuyên bố của nhà cung cấp.
Vào đầu tháng 8, một ảnh chụp màn hình lan truyền trên X cho thấy một bảng điều khiển hiển thị hàng trăm triệu token đã xử lý và hóa đơn chỉ hơn một đô la, được cho là từ việc sử dụng Hermes Agent mã nguồn mở trên mô hình DeepSeek V4 Flash. Hermes Agent, do Nous Research phát triển theo giấy phép MIT, hoạt động với mọi điểm cuối tương thích OpenAI và có vòng lặp học tập khép kín, lưu các kỹ năng đã học dưới dạng tệp markdown. DeepSeek V4 Flash, đang trong giai đoạn thử nghiệm công khai từ ngày 31 tháng 7, sử dụng cùng kiến trúc với bản xem trước tháng 4 nhưng có cải thiện khả năng tác tử sau khi tinh chỉnh. Khoản tiết kiệm chính không đến từ mức giá cơ bản thấp mà từ bộ nhớ đệm tiền tố tự động: các tiền tố lặp lại được tính phí thấp hơn hàng chục lần. Vòng lặp tác tử phù hợp gần như hoàn hảo với cơ chế này, vì mỗi lần gọi gửi lại cùng một lời nhắc hệ thống và lịch sử, chỉ thêm vài dòng mới. Tuy nhiên, khoản tiết kiệm sẽ bị phá vỡ nếu các phần tử trong phần đầu lời nhắc thay đổi, chẳng hạn như dấu thời gian, mã định danh phiên hoặc danh sách công cụ được sắp xếp lại động. Nhà cung cấp tuyên bố rằng mô hình nhỏ hơn vượt trội mô hình xem trước lớn hơn trên các điểm chuẩn tác tử, nhưng khuyến nghị sử dụng V4-Pro cho các khối suy luận nặng. Phụ phí giờ cao điểm đã được công bố nhưng chưa có hiệu lực và điều phối lai với chuyển lên Pro sẽ đặt lại bộ nhớ đệm. Bài viết cung cấp mức giá, liệt kê các yếu tố phá vỡ bộ nhớ đệm phổ biến, và đưa ra lời khuyên về kế hoạch và các cân nhắc vận hành như giới hạn tốc độ và phạm vi bảo mật.
Nguồn: Habr — хаб ИИ —
bản gốc
