AgentenModelle 🇷🇺 05.08.2026 13:03

Agent für einen Dollar: Die Ökonomie der Kombination aus Hermes Agent und DeepSeek V4 Flash

DeepSeekDeepSeek
Ein viraler Screenshot behauptete, dass mit dem Open-Source-Agenten Hermes auf DeepSeek V4 Flash Hunderte Millionen Tokens für etwas mehr als einen Dollar verarbeitet wurden. Diese Nachricht erklärt die Mechanik hinter solch geringen Kosten, konzentriert sich auf das automatische Präfix-Caching und erläutert, was den Cache zerstört und welche Behauptungen der Anbieter aufstellt.
Anfang August kursierte auf X ein Screenshot, der ein Dashboard mit Hunderten Millionen verarbeiteter Tokens und einer Rechnung von etwas mehr als einem Dollar zeigte, angeblich von der Nutzung des offenen Hermes Agent auf dem Modell DeepSeek V4 Flash. Der Hermes Agent, entwickelt von Nous Research unter der MIT-Lizenz, funktioniert mit jedem OpenAI-kompatiblen Endpunkt und verfügt über eine geschlossene Lernschleife, die erlernte Fähigkeiten in Markdown-Dateien speichert. DeepSeek V4 Flash, seit dem 31. Juli in öffentlicher Betaphase, verwendet dieselbe Architektur wie die April-Vorschau, jedoch mit verbesserten Agent-Fähigkeiten nach dem Feintuning. Die Hauptkostenersparnis ergibt sich nicht aus dem niedrigen Basistarif, sondern aus automatischem Präfix-Caching: Wiederholte Prompt-Präfixe werden zu einem Tarif abgerechnet, der um ein Vielfaches niedriger ist. Die Agent-Schleife passt fast perfekt zu dieser Mechanik, da jeder Aufruf denselben System-Prompt und dieselbe Historie erneut sendet, wobei nur wenige neue Zeilen angehängt werden. Die Ersparnis bricht jedoch ein, wenn sich Elemente im Prompt-Header ändern, wie Zeitstempel, Sitzungskennungen oder dynamisch neu angeordnete Tool-Listen. Der Anbieter behauptet, dass das kleinere Modell bei Agent-Benchmarks besser abschneidet als das größere Vorschaumodell, empfiehlt jedoch für intensive Denkaufgaben die Verwendung des V4-Pro. Stoßzeitenaufschläge wurden angekündigt, sind aber noch nicht aktiv, und Hybrid-Routing mit Eskalation zum Pro setzt den Cache zurück. Der Artikel enthält Preistarife, listet häufige Cache-Breaker auf und gibt Hinweise zu Planung und betrieblichen Überlegungen wie Ratengrenzen und Sicherheitsperimeter.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten