DeepSeek 升级 V4-Flash-0731:智能体编码和 API 测试版迎来重大进展
DeepSeek
Anthropic
DeepSeek 发布了 DeepSeek-V4-Flash-0731,这是对其预览版的官方升级,在智能体和编码基准测试方面取得了显著改进。该模型保持相同的架构,但受益于重新训练,API 现已进入公开测试阶段,支持 Responses API 格式和 Codex 适配。权重采用 MIT 许可证且无需门控,提供了广泛的部署选项。
DeepSeek于2026年7月31日在Hugging Face上发布了DeepSeek-V4-Flash-0731,并将官方V4-Flash API升级为公开测试版(public beta)。模型卡(model card)说明,这是取代此前预览版的正式发布版本,架构和规模保持不变,性能提升主要来自重新训练后的post-training优化。该检查点(checkpoint)包含DSpark推测解码(speculative decoding)模块,Hugging Face显示,在284B基础参数之上加入草稿模块(draft module)后,总参数量达到304B。API现已原生支持Responses API格式,并针对Codex进行了适配,但V4-Pro API以及应用端/网页端模型均未同步更新。
该模型可通过API以较低成本部署(输出价格约为Pro版的三分之一),也可选择自托管(self-hosting),但后者对资源要求极高:虽然权重采用MIT许可协议开放,但每个专家(expert)模块都必须常驻内存。官方给出的vLLM示例中,该模型在一个配备4×GB300的节点上运行;而Unsloth提供的动态GGUF版本在采用激进量化(aggressive quantization)的情况下,内存占用可控制在约110GB。
在架构方面,该模型拥有284B参数,其中每个token激活13B参数,支持100万token的上下文长度,并采用了结合CSA(压缩稀疏注意力,Compressed Sparse Attention)与HCA(分层压缩注意力,Hierarchical Compressed Attention)的混合注意力机制,以及流形约束超连接(manifold-constrained hyper-connections)结构。
基准测试(benchmark)显示,V4-Flash-0731在所有代理型(agentic)基准测试中的表现均优于V4-Pro(预览版),不过所有数据均为DeepSeek自行公布,测试所用评测框架(harness)尚未对外公开。DSpark功能可通过vLLM的一个参数标志(flag)启用,该模型使用编码文件夹(encoding folder)而非Jinja聊天模板(chat template)。
来源: MarkTechPost —
原文
