AgenModel 🇷🇺 05.08.2026 13:03

Agen seharga satu Dolar: Ekonomi Kombinasi Hermes Agent + DeepSeek V4 Flash

DeepSeekDeepSeek
Sebuah tangkapan layar yang viral mengklaim ratusan juta token diproses hanya dengan lebih dari satu dolar menggunakan Hermes Agent sumber terbuka di DeepSeek V4 Flash. Berita ini menjelaskan mekanisme di balik biaya rendah tersebut, dengan fokus pada caching awalan otomatis, serta menguraikan apa yang memutus cache dan klaim vendor.
Pada awal Agustus, sebuah tangkapan layar beredar di X yang menampilkan dasbor dengan ratusan juta token yang diproses dan tagihan hanya sedikit di atas satu dolar, yang dilaporkan berasal dari penggunaan Hermes Agent yang terbuka pada model DeepSeek V4 Flash. Hermes Agent, yang dikembangkan oleh Nous Research di bawah lisensi MIT, bekerja dengan endpoint apa pun yang kompatibel dengan OpenAI dan memiliki loop pembelajaran tertutup, menyimpan keterampilan yang dipelajari dalam file markdown. DeepSeek V4 Flash, yang berada dalam beta publik sejak 31 Juli, menggunakan arsitektur yang sama dengan pratinjau April tetapi dengan kemampuan agen yang lebih baik setelah penyetelan halus. Penghematan biaya utama tidak berasal dari tarif dasar yang rendah, tetapi dari caching awalan otomatis: awalan prompt yang berulang ditagih dengan tarif yang puluhan kali lebih rendah. Loop agen hampir sempurna sesuai dengan mekanisme ini, karena setiap panggilan mengirim ulang prompt sistem dan riwayat yang sama dengan hanya beberapa baris baru yang ditambahkan. Namun, penghematan tersebut hilang jika elemen di header prompt berubah, seperti stempel waktu, pengidentifikasi sesi, atau daftar alat yang diurutkan ulang secara dinamis. Vendor mengklaim bahwa model yang lebih kecil mengungguli model pratinjau yang lebih besar pada tolok ukur agen, tetapi merekomendasikan penggunaan V4-Pro untuk penalaran yang berat. Biaya tambahan jam sibuk diumumkan tetapi belum aktif, dan perutean hibrida dengan eskalasi ke Pro mengatur ulang cache. Artikel ini menyediakan tarif harga, mendaftar pemecah cache yang umum, dan menyarankan perencanaan dan pertimbangan operasional seperti batas kecepatan dan perimeter keamanan.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru