AgenAplikasi 🇷🇺 11.08.2026 16:02

Mengapa Jaringan Saraf Memakan Token: Apa yang Terjadi dalam Obrolan Panjang dan Cara Mengurangi Biaya

AnthropicAnthropic SYNTX.AISYNTX.AI
Obrolan AI yang panjang dengan jendela konteks yang besar meningkatkan biaya token dan dapat menurunkan performa model. Seorang pengguna Reddit melaporkan menghabiskan lebih dari satu miliar token input dengan Claude, sementara pengguna lain menumpuk biaya sekitar 6.000 dolar AS pada agen AI yang tidak diawasi. Studi seperti 'Context Rot' menunjukkan bahwa performa menurun seiring bertambahnya konteks, dan para ahli merekomendasikan untuk memecah tugas, memadatkan riwayat, dan menggunakan cache prompt untuk menghemat biaya.
Artikel ini membahas mengapa model AI mengonsumsi token secara berlebihan dalam percakapan panjang dan bagaimana mengurangi biayanya. Artikel ini mengutip anekdot dari Reddit: seorang pengguna menghabiskan 1,156 miliar token input dengan Claude, pengguna lain lupa menghentikan agen Claude Code yang memeriksa pull request setiap 30 menit selama 26 jam, total 46 kali berjalan dan menghabiskan biaya sekitar $6000. Alasan teknis biaya tinggi adalah setiap permintaan baru menyertakan seluruh konteks yang terakumulasi, yang dapat tumbuh hingga 800 ribu token. Anthropic memperingatkan dalam dokumennya bahwa biaya meningkat seiring ukuran konteks dan merekomendasikan untuk membersihkan riwayat atau menggunakan kompaksi. Penelitian oleh Chroma ('Context Rot') dan studi tahun 2026 ('Diagnosing and Mitigating Context Rot') menunjukkan bahwa kinerja menurun dengan input yang lebih panjang, bahkan sebelum batas jendela konteks, terutama dengan informasi yang mengganggu. Caching prompt hanya mengurangi biaya untuk prefiks yang berulang, bukan masalah konteks yang tidak perlu. Untuk agen AI, biaya tersembunyi karena mereka melakukan banyak operasi alat secara otonom. Tips praktis termasuk memisahkan tugas independen, menggunakan /clear dan /compact di Claude Code, memberikan hanya bagian dokumen yang relevan, caching instruksi yang stabil, dan memilih tingkat model yang tepat (Sonnet untuk coding, Opus untuk penalaran kompleks, Haiku untuk tugas subagen sederhana). Penulis juga mempromosikan LLM Studio dari SYNTX.AI, yang menawarkan lebih dari 100 model AI dan kemampuan untuk mengganti model dalam dialog, dengan kode promo CTRLAI untuk diskon 20%. Artikel ini menyimpulkan bahwa rekayasa prompt sekarang harus mencakup pembuangan informasi yang tidak perlu.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru