DeepSeek V4 Flash转正

DeepSeek-V4-Flash 正式版 API 于 7 月 31 日上线公测,后训练升级将 9 项 Agent 基准推至新高,并原生支持 Responses API、针对 Codex 完成适配。
DeepSeek 先把更快的 V4-Flash 推向正式版
DeepSeek 在 2026 年 7 月 31 日更新 API 日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测,当前版本标识为 DeepSeek-V4-Flash-0731。与此前的 Flash Preview 相比,新版本没有扩大参数规模,也没有更换模型结构,而是通过重新后训练,集中补强 Agent 任务的执行能力。
这次更新不是一次常规的模型改名。DeepSeek 一口气公布了 Terminal Bench 2.1、NL2Repo、Cybergym、DeepSWE、Toolathlon verified、Agent Last Exam、Automation Bench、DSBench-FullStack 和 DSBench-Hard 共 9 项 Agent 基准成绩,并强调正式版在这些测试中整体超过 V4-Pro-Preview。
Agent 是能够围绕目标自主规划步骤、调用工具、读取反馈并持续执行任务的 AI 系统。它和普通聊天模型的区别,不在于能不能回答“怎么做”,而在于能不能真的进入终端、代码仓库或业务系统,把一串相互依赖的动作做完。

从产品定位看,DeepSeek-V4-Flash 是 V4 系列中偏向速度、并发与成本效率的轻量版本。此前的 V4-Flash Preview 已提供 1M,也就是 1,048,576 tokens 的上下文窗口;正式版沿用相同结构与尺寸,意味着开发者不需要把这次升级理解成一次底座换代,更准确的说法是:DeepSeek 保留了 Flash 的推理成本和响应速度,通过后训练重新校准了模型使用工具、操作终端和处理长链路任务的方式。
9 项成绩指向同一个变化:Flash 开始接管复杂执行任务
DeepSeek-V4-Flash-0731 的核心变化是 Agent 交付能力提升,而不是知识问答跑分继续膨胀。根据 DeepSeek 更新日志公布、并由IT之家报道的数据,正式版在 9 项 Agent 基准中的成绩如下。
| 基准测试 | V4-Flash-0731 成绩 | 主要考察能力 | 更接近的真实场景 | |---|---:|---|---| | Terminal Bench 2.1 | 82.7 | 终端操作、命令执行与环境修复 | 配置开发环境、排查服务故障、完成系统任务 | | NL2Repo | 54.2 | 从自然语言需求生成或修改代码仓库 | 按需求实现跨文件功能、维护现有项目 | | Cybergym | 76.7 | 网络安全环境中的分析与操作 | 漏洞验证、安全排查、靶场任务 | | DeepSWE | 54.4 | 软件工程问题理解与代码修复 | 定位 Issue、修改代码、运行测试并提交结果 | | Toolathlon verified | 70.3 | 多工具选择、编排和可靠调用 | 在搜索、文件、数据库等工具之间完成工作流 | | Agent Last Exam | 25.2 | 高难度综合 Agent 推理与执行 | 长链路、低容错的复杂任务 | | Automation Bench(Public) | 25.1 | 自动化工作流执行 | 表单处理、数据整理、跨应用操作 | | DSBench-FullStack | 68.7 | 全栈开发任务 | 同时修改前端、后端、接口和测试 | | DSBench-Hard | 59.6 | 高难度开发与执行任务 | 复杂代码库中的多步骤工程问题 |
Terminal Bench 2.1 的 82.7 是这组数据中最醒目的结果。Terminal Bench 2.1 是一套评估 AI Agent 能否在真实终端环境中完成多步骤任务的基准,它要求模型处理命令反馈、环境状态和执行错误,而不是只生成一段看起来合理的 Shell 命令。
82.7 分意味着 V4-Flash-0731 已不只是“会写代码”的模型,而是明显向“能操作开发环境”的模型靠拢。对开发者而言,这种能力差异很具体:普通代码助手可能给出五条安装命令,Agent 模型则需要自己运行命令,看到依赖冲突后调整版本,再验证程序能否启动。
Toolathlon verified 的 70.3 同样具有产品价值。Toolathlon verified 是强调工具选择与调用正确性的 Agent 测试,verified 版本通常更看重结果能否被环境验证,而不是仅凭模型或裁判判断输出是否像一个正确答案。对于生产环境,工具调用的稳定性往往比回答是否漂亮更重要,因为一次参数错误就可能让整条自动化链路中断。
NL2Repo 54.2、DeepSWE 54.4 和 DSBench-FullStack 68.7 则共同指向软件工程能力。软件工程 Agent 的难点从来不是生成一个函数,而是先理解陌生仓库,再找到正确文件、遵循既有架构、修改多个模块、运行测试,并根据报错继续修复。单轮代码生成可以靠模式匹配拿到不错结果,仓库级任务却会持续暴露模型的状态管理和错误恢复能力。
Agent Last Exam 25.2 与 Automation Bench 25.1 看起来不高,却可能比八九十分的单项指标更值得关注。综合型 Agent 基准通常任务更长、工具更多、容错率更低,任何一步偏离都可能导致整项失败;因此 25 分不能直接理解为“只有四分之一能力”,而应结合测试任务、成功判定和对照模型成绩分析。
目前最大的证据缺口是,DeepSeek 没有在这次简短更新中同步列出 V4-Pro-Preview 在同一设置下的逐项分数。官方使用了“远超 V4-Pro-Preview”的结论,但开发者暂时无法从公开信息中计算每项提升的绝对值和百分比,也无法确认不同版本是否采用完全相同的 Agent 框架、工具配置、推理强度与最大执行预算。因此,这组数字足以证明 Flash 正在向复杂 Agent 倾斜,却还不足以单独完成严格的跨模型性价比判断。
没换架构,为什么能力还能明显变化
DeepSeek-V4-Flash-0731 的模型结构和尺寸与 V4-Flash-preview 保持一致,这使后训练成为本次升级的关键变量。后训练是基础预训练结束后,通过指令数据、偏好优化、强化学习或工具轨迹训练,让模型更符合特定任务目标的训练阶段。
对 Agent 来说,后训练影响的不是模型“知道多少”,而是模型“怎么行动”。同一个底座可能已经理解 Git、Linux 和软件工程,但如果没有学会根据终端反馈修正计划,它仍会重复失败命令;如果没有接受足够的工具调用训练,它也可能选对工具却填错参数。
这次升级更像是给同一名工程师重新做了一轮高强度实战训练。人的知识储备和脑容量没有改变,但排障顺序、工具习惯、任务拆解和复盘方式变得更成熟,最终交付率就会提高。对于模型厂商,这条路线也比扩大参数更容易维持服务速度和单位推理成本。
V4-Flash 的底层优势仍然来自 V4 系列对长上下文效率的设计。DeepSeek 此前披露,V4 采用 token 维度压缩并结合 DSA 稀疏注意力,以降低超长上下文带来的计算与显存压力;V4 系列将 1M 上下文作为官方服务的重要规格,Flash 则通过更小的模型规模和激活开销,承担高频任务。
1M 上下文是最多可在一次模型请求中容纳约 100 万个 token 的输入与历史信息窗口。它不等于模型可以无损记住每个细节,但对仓库级代码分析、长文档审阅和多轮 Agent 轨迹尤其重要,因为模型不必频繁裁剪早期日志、代码文件和工具反馈。
长上下文与 Agent 能力并不是简单相加的关系。把完整仓库和几十轮终端输出塞进上下文,只是让信息“在场”;模型还要判断哪些错误最关键、哪些文件值得读取、哪些历史步骤已经失效。V4-Flash-0731 重新后训练的意义,就在于尝试让模型更有效地使用这些已经能够容纳的信息。
原生支持 Responses API,并针对 Codex 适配
DeepSeek-V4-Flash 正式版原生支持 Responses API 格式,并针对 Codex 使用场景进行了适配。Responses API 是一种面向多轮推理、工具调用和结构化输出的统一交互格式,它比传统的单次聊天补全更适合承载 Agent 的连续执行过程。
这项适配对开发者的价值,可能不亚于跑分提升。Agent 产品的实际效果并不只由模型权重决定,工具描述、消息角色、推理内容传递、函数返回格式、上下文压缩和错误重试都会影响最终成功率。一个模型即使基础能力很强,如果和 Agent 客户端的消息协议不匹配,也可能出现工具调用被截断、状态无法延续或参数结构错误。
针对 Codex 的适配意味着 V4-Flash-0731 明确瞄准了编码 Agent 工作流。这里的重点并不是让 DeepSeek 变成 Codex 本身,而是让支持相应协议和流程的客户端更顺畅地使用 V4-Flash,包括理解工具结果、继续修改代码、读取测试反馈以及保持多轮任务状态。
DeepSeek 此前还提到 V4 系列针对 Claude Code、OpenClaw、OpenCode 和 CodeBuddy 等主流 Agent 产品进行了优化。把这些产品放在一起看,DeepSeek 的策略已经非常清楚:不只争夺聊天窗口里的默认模型,还要进入开发者每天使用的终端、IDE 和自动化工作流。
本文不提供调用代码,因为 DeepSeek 属于开放模型生态,且本次重点是模型正式版和 Agent 基准更新。开发者在迁移生产任务前,更应该先核对官方文档中的模型标识、Responses API 字段兼容范围、推理模式、限流规则以及公测期变更说明,避免把“格式兼容”误解为所有客户端行为完全一致。
Flash 与 Pro 的分工正在发生变化
V4-Flash 原本承担的是更快、更便宜的轻量任务,但这次后训练正在缩小它与 Pro 在 Agent 场景中的边界。此前 DeepSeek 对两者的定位是:Flash 在世界知识储备上略逊于 Pro,推理能力接近 Pro,并在相对简单的 Agent 任务上与 Pro 相当;如今官方进一步宣称正式版 Flash 的 Agent 基准全面超过 V4-Pro-Preview。
| 维度 | V4-Flash-0731 | V4-Flash-preview | V4-Pro-Preview / 当前 Pro API | |---|---|---|---| | 当前状态 | 正式版 API 公测 | 被 0731 版本迭代 | 本次未升级 | | 模型结构与尺寸 | 与 Flash Preview 相同 | 原始预览版本 | 更偏旗舰能力 | | 本次变化 | 重新后训练,重点增强 Agent | 对照版本 | 未随本次日志变更 | | Agent 表现 | 官方称 9 项基准全面超过 Pro Preview | 低于重新后训练版本 | 官方未公布本次逐项对照分数 | | 接口适配 | 原生支持 Responses API,针对 Codex 适配 | 既有接口能力 | 本次未宣布变化 | | 适合场景 | 高频编码、终端操作、自动化和多工具 Agent | 早期测试与兼容验证 | 更重知识、复杂推理及旗舰任务 | | 正式版进度 | 已进入公测 | 已完成阶段使命 | DeepSeek 表示将尽快发布 |
这并不意味着 Flash 已经全面取代 Pro。Agent 基准只是模型能力的一部分,世界知识、复杂推理上限、长文本稳定性、事实准确率、指令遵循以及高难任务成功率,仍可能体现模型规模差异。尤其在法律研究、科研分析和需要大量隐性知识的复杂项目中,Pro 仍有潜在优势。
Flash 真正可能改写的是默认选择顺序。过去团队通常先选最大模型,再为成本和延迟寻找降级方案;如果 V4-Flash-0731 在真实 Agent 任务中确实保持较高完成率,那么更合理的架构会变成:Flash 处理大部分常规任务,只在多次失败、知识密集或高难推理时升级到 Pro。
这种分层方式可以直接影响 Agent 产品的单位经济模型。Agent 一次任务往往包含几十轮模型推理、工具调用和错误修复,成本不是单轮对话价格,而是“单次成功交付的总成本”。一个单轮价格较低但经常返工的模型未必便宜,一个成功率更高却稍慢的模型也未必昂贵;V4-Flash-0731 需要证明的是,在完整任务维度上同时降低耗时和失败率。
DeepSeek 本次没有公布 V4-Flash-0731 的新增定价信息,也没有披露各项测试的 token 消耗、执行轮数和墙钟时间。缺少这些数据时,外界还不能计算每个成功任务的实际成本,更不能仅凭“Flash”名称判断其在所有 Agent 场景中都更经济。
这次只更新 API,App 和网页端没有变化
DeepSeek 明确表示,本次升级只涉及 DeepSeek-V4-Flash 的 API 接口,DeepSeek-V4-Pro API 以及 App、Web 端模型均未更改。普通用户即使今天打开 DeepSeek 客户端,也不应默认自己已经在使用 V4-Flash-0731。
这个范围说明 DeepSeek 仍在用开发者公测验证模型。API 场景更容易收集结构化反馈,包括工具调用失败类型、任务成功率、延迟、上下文长度和客户端兼容问题;等模型在真实 Agent 流程中稳定后,再推向大规模聊天产品,风险更低。
“正式版上线公测”看似矛盾,实际上描述了两个不同层级。正式版指模型已经结束 Preview 阶段并形成明确版本,公测则表示对应 API 服务仍处在开放验证期,限流、兼容行为和服务策略仍可能调整。生产团队不应因为“正式版”三个字跳过灰度测试。
更稳妥的迁移方式是先选择可回放、可验证的内部任务。代码 Agent 可以从自动修复测试、更新依赖和生成文档开始;运维 Agent 可以先处理只读诊断,再逐步开放写操作;涉及删除数据、修改权限和部署生产环境的动作,仍应设置人工确认与最小权限边界。
V4-Pro 正式版才是下一场硬仗
DeepSeek 已确认 DeepSeek-V4-Pro 正式版将“尽快”发布,但截至 2026 年 7 月 31 日尚未给出准确日期。Flash 正式版先行,意味着 DeepSeek 很可能先验证新的 Agent 后训练方法和接口适配,再把相关经验应用到更大的 Pro 模型上。
V4-Pro 正式版的观察重点不只是跑分能否重新超过 Flash。更重要的问题是,它能否在高难 Agent 任务中拉开足够差距,并让这部分差距覆盖更高的推理成本和延迟。如果 Pro 只在少量知识测试中领先,而 Flash 在终端、代码仓库和多工具任务中更稳定,那么大量开发者会直接把 Flash 设为默认模型。
这次更新也反映出 2026 年模型竞争的评价标准正在改变。参数规模、知识问答和单轮代码生成仍然重要,但开发者更关心模型能否在真实环境里连续工作半小时,能否从失败中恢复,以及最终能否交付一个通过测试的结果。
我们的判断是,V4-Flash-0731 是一次比“结构不变”看上去更重要的更新。它说明 Agent 能力并不完全依赖更大的底座,通过有针对性的后训练、工具轨迹和客户端协议适配,轻量模型同样可能在执行型任务上超过更大的预览模型。
不过,官方基准领先还不能自动转化为生产环境领先。下一步需要关注三类数据:第三方在相同框架下的复测结果、真实代码仓库的任务成功率,以及包含 token 消耗和执行时间的单任务成本。只有这三项同时成立,V4-Flash 才真正从“更快的 V4”变成“更适合 Agent 的默认 V4”。
参考来源
- IT之家:DeepSeek-V4-Flash 正式版 API 上线公测:整理了 DeepSeek 7 月 31 日更新日志、9 项 Agent 基准成绩、Responses API 支持范围及 V4-Pro 发布计划。



