ModelleAgenten 🇺🇸 01.08.2026 02:01

DeepSeek aktualisiert V4-Flash-0731: deutliche Fortschritte beim agentischen Programmieren und API-Beta

DeepSeekDeepSeek AnthropicAnthropic
DeepSeek hat DeepSeek-V4-Flash-0731 veröffentlicht, ein offizielles Upgrade seiner Vorschauversion, mit deutlichen Verbesserungen bei Benchmarks für agentisches und kodierendes Verhalten. Das Modell behält die gleiche Architektur bei, profitiert jedoch von einem erneuten Post-Training, und die API ist nun in der öffentlichen Beta mit Unterstützung für das Responses-API-Format und die Codex-Adaption. Die Gewichte sind MIT-lizenziert und ohne Zugangsbeschränkung, was vielfältige Einsatzmöglichkeiten ermöglicht.
DeepSeek hat DeepSeek-V4-Flash-0731 auf Hugging Face veröffentlicht und die offizielle V4-Flash-API am 31. Juli 2026 in die öffentliche Beta-Phase überführt. Das Modellblatt besagt, dass es sich um die offizielle Version handelt, die die Vorschauversion ersetzt, mit unveränderter Architektur und Größe; die Verbesserungen stammen aus einem erneuten Post-Training. Das Checkpoint enthält das DSpark-Spekulations-Dekodierungsmodul, und Hugging Face meldet 304 Milliarden Parameter einschließlich des Entwurfsmoduls zusätzlich zur Basis mit 284 Milliarden Parametern. Die API unterstützt nun nativ das Responses-API-Format und ist für Codex angepasst, jedoch wurden die V4-Pro-API und die App-/Web-Modelle nicht aktualisiert. Die Bereitstellung ist über die API zu geringen Kosten möglich (etwa ein Drittel des Pro-Ausgabepreises) oder über Selbsthosting, das erhebliche Ressourcen erfordert: Die Gewichte sind unter MIT-Lizenz verfügbar, aber jeder Experte bleibt im Arbeitsspeicher resident. Ein vLLM-Beispiel bedient es auf einem Knoten mit 4×GB300; Unsloth-dynamische GGUFs passen bei aggressiver Quantisierung in etwa 110 Gigabyte Arbeitsspeicher. Die Architektur umfasst 284 Milliarden Parameter mit 13 Milliarden aktiven Parametern pro Token, einen Kontext von 1 Million Token, hybride Aufmerksamkeit mit CSA und HCA sowie durch Mannigfaltigkeiten eingeschränkte Hyperverbindungen. Benchmarks zeigen, dass V4-Flash-0731 bei allen agentischen Benchmarks besser abschneidet als V4-Pro (Vorschau), aber alle Zahlen stammen von DeepSeek und wurden mit einem nicht veröffentlichten Harness erstellt. DSpark wird über ein vLLM-Flag aktiviert, und das Modell verwendet einen Encodierungsordner anstelle einer Jinja-Chat-Vorlage.
Quelle: MarkTechPost — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten