Tác tửỨng dụng 🇷🇺 11.08.2026 16:02

Vì sao mạng nơ-ron "ăn" token: Điều gì xảy ra trong các cuộc trò chuyện dài và cách cắt giảm chi phí

AnthropicAnthropic SYNTX.AISYNTX.AI
Các cuộc trò chuyện AI dài với ngữ cảnh khổng lồ làm tăng chi phí token và có thể làm giảm hiệu suất mô hình. Một người dùng Reddit cho biết đã tiêu tốn hơn một tỷ token đầu vào với Claude, trong khi một người khác đã chi khoảng 6.000 USD cho một tác nhân AI không được giám sát. Các nghiên cứu như 'Context Rot' cho thấy hiệu suất giảm khi ngữ cảnh tăng lên, và các chuyên gia khuyến nghị chia nhỏ nhiệm vụ, nén lịch sử và sử dụng bộ nhớ đệm lời nhắc để tiết kiệm chi phí.
Bài viết bàn về lý do vì sao các mô hình AI "ngốn" quá nhiều token trong các cuộc trò chuyện dài, cũng như cách cắt giảm chi phí. Tác giả dẫn ra vài giai thoại từ Reddit: một người dùng đã đốt tới 1,156 tỷ token đầu vào khi dùng Claude; một người khác thì quên tắt một agent Claude Code đang tự động kiểm tra pull request (yêu cầu hợp nhất mã nguồn) mỗi 30 phút, chạy liên tục suốt 26 giờ, tổng cộng 46 lần, tiêu tốn khoảng 6.000 USD. Nguyên nhân kỹ thuật khiến chi phí tăng vọt là do mỗi yêu cầu mới đều phải kèm theo toàn bộ ngữ cảnh (context) đã tích lũy từ trước, và con số này có thể phình lên tới 800.000 token. Anthropic cũng cảnh báo trong tài liệu của mình rằng chi phí sẽ tăng theo kích thước ngữ cảnh, đồng thời khuyến nghị người dùng nên xóa lịch sử trò chuyện hoặc sử dụng cơ chế nén (compaction). Các nghiên cứu từ Chroma ("Context Rot" - Sự Suy Thoái Ngữ Cảnh) và một nghiên cứu năm 2026 ("Diagnosing and Mitigating Context Rot" - Chẩn Đoán và Giảm Thiểu Sự Suy Thoái Ngữ Cảnh) cho thấy hiệu suất mô hình sẽ giảm dần khi đầu vào càng dài, thậm chí trước cả khi chạm giới hạn cửa sổ ngữ cảnh (context window), đặc biệt là khi có những thông tin gây nhiễu. Cơ chế lưu đệm prompt (prompt caching) chỉ giúp giảm chi phí cho các phần tiền tố (prefix) lặp lại, chứ không giải quyết được vấn đề dư thừa ngữ cảnh nói chung. Đối với các AI agent, chi phí thường bị "giấu kín" vì chúng tự động thực hiện rất nhiều thao tác công cụ (tool operations) mà người dùng không trực tiếp thấy. Một số mẹo thực tế được đưa ra bao gồm: tách các tác vụ độc lập thành từng phần riêng, sử dụng lệnh /clear và /compact trong Claude Code, chỉ cung cấp những phần tài liệu thực sự liên quan, lưu đệm (cache) các chỉ dẫn ổn định không thay đổi, và lựa chọn đúng cấp độ mô hình phù hợp - ví dụ Sonnet cho việc lập trình, Opus cho các tác vụ suy luận phức tạp, còn Haiku cho các subagent (agent con) làm việc đơn giản. Tác giả cũng giới thiệu LLM Studio của SYNTX.AI, nền tảng cung cấp hơn 100 mô hình AI và cho phép chuyển đổi mô hình ngay trong cùng một cuộc hội thoại, kèm mã khuyến mãi CTRLAI giảm 20%. Bài viết kết luận rằng kỹ thuật viết prompt (prompt engineering) giờ đây cần phải bao gồm cả việc chủ động loại bỏ những thông tin không cần thiết.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới