DeepSeek 发布 V4-Flash-0731:Agent 能力升级,开放部署继续推进
DeepSeek 于 7 月 31 日发布 DeepSeek-V4-Flash-0731 并开启 API 公测,官方称本次为 V4-Flash 的正式重发,重点提升 agent 执行能力和代码/工具调用场景,同时支持本地部署与 MIT 许可。更新带来自报 benchmark 提升、1M 上下文与 384K 最大输出等技术细节,并公布了更明确的定价与自托管示例。
DeepSeek 于 7 月 31 日发布 DeepSeek-V4-Flash-0731 并开启 API 公测,官方称本次为 V4-Flash 的正式重发,重点提升 agent 执行能力和代码/工具调用场景,同时支持本地部署与 MIT 许可。更新带来自报 benchmark 提升、1M 上下文与 384K 最大输出等技术细节,并公布了更明确的定价与自托管示例。
DeepSeek 在 7 月 31 日把 DeepSeek-V4-Flash-0731 推上 Hugging Face,并同步把同名版本切入 API 公测。按照官方说法,这不是一次新的大规模模型换代,而是 V4-Flash 的正式版本重发:模型架构保持不变,仍沿用带 speculative decoding 模块的 V4-Flash-DSpark 结构,但后训练流程更明显地朝着 Agent、代码和工具调用场景倾斜。
DeepSeek 的官方主页也直接把这次更新描述为“DeepSeek-V4-Flash 的正式 API 已进入 public beta,agent capabilities 明显增强”,而 V4-Pro 版本暂时没有变化。对于一直在看前沿模型如何从“会回答”走向“会做事”的开发者来说,这种表述比单纯的参数规模更值得注意。
Agent 能力成了这次更新的重点
在 Hugging Face 模型卡上,DeepSeek 把 V4-Flash-0731 描述为“official release”,并列出一组自报 benchmark:Terminal Bench 2.1 为 82.7,NL2Repo 为 54.2,Cybergym 为 76.7,DeepSWE 为 54.4,Toolathlon-Verified 为 70.3,Agents’ Last Exam 为 25.2,AutomationBench Public 为 25.1,DSBench-FullStack 为 68.7,DSBench-Hard 为 59.6。和 Preview 版相比,这些分数在代理任务和代码任务上都有明显提升;和 DeepSeek 自己的 V4-Pro Preview 相比,V4-Flash-0731 在 Terminal Bench 2.1 上也更高。
DeepSeek 在模型卡里进一步强调,这一版“superseding the preview version”,并且“with substantially enhanced agentic capabilities”。换句话说,官方希望外界把它理解为一次围绕执行能力、而不是单纯规模竞争的升级。
不过,这些数字目前仍主要来自厂商自报,第三方独立复测还不多。对于一款被明确放进 Agent 工作流里的模型来说,后续能否在真实环境中稳定复现这些分数,仍是外界最关心的问题之一。
开放部署与价格也同步落地
DeepSeek API 文档把该版本标成 deepseek-v4-flash,对应的版本号是 DeepSeek-V4-Flash-0731,并写明它支持 1M 上下文,最大输出长度为 384K。文档同时指出,Responses API 现在只支持 deepseek-v4-flash,而 deepseek-v4-pro 仍未纳入该接口。
价格表也给出了更清晰的部署成本:deepseek-v4-flash 的每百万 token cache hit 输入价格为 0.0028 美元,cache miss 输入为 0.14 美元,输出为 0.28 美元;DeepSeek 还预告,未来会引入峰谷定价机制。对于要把模型接进生产系统的团队来说,这些数字通常比 benchmark 表更直接。
Hugging Face 页面则给出了 vLLM 和 SGLang 的本地部署示例,说明这次更新并不只面向云端 API,也在为自托管和私有化部署留出口。页面同时标注了 MIT 许可证,进一步强化了“可下载、可部署、可改造”的外部印象。
参数口径有一点小差异
需要注意的是,公开资料里关于参数规模的口径并不完全一致。Hugging Face 页面里的模型元数据显示为 304B params;而 arXiv 论文摘要写的是 DeepSeek-V4-Flash 拥有 284B parameters、13B activated。官方资料没有解释两者为何不同,外界推测这可能与 speculative decoding 模块的统计方式有关,但目前只能先把它当作一个待确认细节。
为什么这次更新更像一次路线声明
DeepSeek 这次最值得注意的地方,不是“又大了多少”,而是它把重心放到了 Agent 执行和本地部署上。这个方向和 AIFlux 早前关于 OpenAI 说,科学计算进入 agentic AI 时代,但真正的瓶颈是验证 的判断是同一条线:当模型越来越会做事,真正稀缺的反而是验证、审查和责任边界。
软件工程侧的变化也在朝这个方向收敛。Anthropic 在 把更多代码审查交给 AI,Bun 11 天完成 53.5 万行 Rust 迁移 里展示的,已经不是“模型帮你写几行代码”,而是把 AI 放进审查、迁移和质量闸门里。DeepSeek 现在强调的 agentic capabilities、Responses API 和本地推理脚本,本质上也是在争夺同一类工作流入口。
而在开放权重这一侧,Moonshot 正式放出 Kimi K3 开放权重 的动作说明,中国前沿模型的竞争已经不只是“谁的模型更强”,而是“谁更容易被下载、验证、部署和再次改造”。DeepSeek 这次把 MIT 许可、本地部署示例和 API 公测放在一起,实际上是在把选择权交给开发者:到底是直接接 API,还是把模型带回自己的环境里跑。
从更大的行业背景看,这种路线也更接近今天真正重要的问题:模型是否能在长任务、复杂工具链和现实约束下持续工作,而不是只在榜单上赢一次。DeepSeek、OpenAI 和 Anthropic 的几条产品线,正在把这个问题放到同一个答案里。
DeepSeek 官方主页、Hugging Face 模型页、API 文档更新、价格页 和 arXiv 论文 构成了目前最完整的公开信息链。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

