Tiết kiệm chi phí LLM: Mô hình Trung Quốc bất ngờ viết bằng chữ Hán

TencentTencent DeepSeekDeepSeek
Một bot tổng hợp tin tức AI đã chuyển sang mô hình Trung Quốc rẻ hơn (ling-2.6-flash) với chi phí thấp hơn 8 lần, nhưng phát hiện mô hình thường xuyên tạo ra chữ Hán trong đầu ra tiếng Nga. Nhà phát triển đã thêm tính năng phát hiện CJK và dự phòng sang mô hình đắt hơn để làm sạch, dẫn đến tiết kiệm ròng khoảng 42%.
Một nhà phát triển đang vận hành bot tin tức song ngữ thực hiện khoảng 936 cuộc gọi LLM mỗi ngày đã tìm kiếm các mô hình rẻ hơn trên OpenRouter. Trong số 17 mô hình miễn phí, chỉ có 3 mô hình khả dụng, và chúng gặp các vấn đề như tốc độ chậm hoặc thiếu hỗ trợ JSON. Sau đó, nhà phát triển tìm thấy mô hình trả phí của Trung Quốc inclusionai/ling-2.6-flash với giá $0,010 mỗi triệu token đầu vào, rẻ hơn 8 lần và nhanh hơn 4 lần so với mô hình deepseek-v4-flash ($0,098) từng được sử dụng. Tuy nhiên, sau khi triển khai, bot bắt đầu xuất ra các ký tự Trung Quốc trong các tiêu đề tin tức tiếng Nga. Thử nghiệm cho thấy 17% bản tóm tắt ngắn và 57% phân tích dài có chứa văn bản tiếng Trung. Giải pháp là thêm một bộ phát hiện biểu thức chính quy (regex) cho CJK: nếu phát hiện ký tự Trung Quốc, yêu cầu tương tự sẽ được gửi lại đến mô hình deepseek-v4-flash sạch. Sau khi sửa lỗi, tỷ lệ nhiễm giảm xuống 0% (0/8). Nhà phát triển cũng rút ra ba bài học bất ngờ: chi phí được quyết định bởi nguồn tin, không phải số lượng người dùng; các mô hình miễn phí ngừng hoạt động khi số dư tài khoản âm ngay cả với các mô hình $0; và thiếu tham số max_tokens gây ra việc dự trữ token lớn. Đường ống cuối cùng sử dụng ling-2.6-flash làm mô hình chính, deepseek-v4-flash làm dự phòng cho việc làm sạch CJK, và gemma:free làm phương án cuối cùng. Chi phí hàng tháng giảm từ $14,8 xuống còn khoảng $8,6, tiết kiệm được 42% thay vì 8 lần như kỳ vọng do phải trả tiền gấp đôi cho các phân tích dài.
Nguồn: Habr — хаб ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới