DeepSeek V4 Pro上国家超算网

国家超算互联网上线 DeepSeek-V4-Pro-0813 与开源智能体框架 DeepSeek Harness,覆盖模型获取、私有化部署、分布式推理和 Agent 二次开发,但价格、实测吞吐与 SLA 仍待公布。
DeepSeek V4 Pro上国家超算网
国家超算互联网在 8 月 14 日上线 DeepSeek V4 Pro 正式版和 DeepSeek Harness,试图把模型部署、推理服务与 Agent 开发压缩到同一套国产算力平台内完成。 根据国家超算互联网发布的信息,本次上线的模型版本为 DeepSeek-V4-Pro-0813,配套工具则是刚刚开放测试的 DeepSeek Harness v0.1;平台用户可以获取 DeepSeek 系列模型与源码,并完成私有化部署、分布式推理、编译调试和智能体二次开发。
这次更新的重点不是国家超算互联网“多上了一个模型”,而是它开始同时提供模型和 Agent 运行框架。 对企业开发团队而言,前者解决模型能力与推理服务问题,后者负责把模型接入终端、浏览器、代码仓库和其他外部工具。两者放在同一个算力与开发环境内,能减少跨平台搬运权重、适配推理框架和配置工具权限的工作量。

上线的不只是一份模型权重
DeepSeek-V4-Pro-0813 是 DeepSeek V4 Pro 在 2026 年 8 月 13 日形成的正式版本标识,核心定位是面向复杂推理、代码生成和工具调用的高性能模型。 国家超算互联网称,这一版本强化了 Agent 能力,并重点改善了生产环境表现;相关报道还提到,它原生支持 OpenAI Responses API,并针对 Codex 类型的编码工作流进行适配。
DeepSeek Harness 是一套用于组织模型、工具和执行环境的智能体框架。 Harness 可以理解为 Agent 的“任务调度层”:模型负责判断下一步做什么,Harness 负责把判断变成文件读写、终端命令、代码修改、网页操作或其他工具调用,再将执行结果送回模型,直到任务完成或触发终止条件。
Harness 与普通聊天界面的差别在于,它管理的是一条可连续执行的任务轨迹。 例如,开发者要求 Agent 修复一个 GitHub 项目中的缺陷时,模型不仅要回答修改建议,还需要检索仓库、读取依赖、定位报错、编辑文件、运行测试,并在失败后重新规划。模型决定行动,Harness 则负责保存上下文、执行动作、处理异常和约束权限。
DeepSeek Harness v0.1 已于 8 月 13 日以开发者预览版形式开放测试,并按 MIT 协议开放源代码。 国家超算互联网 AI 社区已经收录其完整工程文件,开发者可以拉取源码进行编译、调试、二次迭代和项目部署。MIT 协议对商业使用和修改较为宽松,但需要注意,Harness 的开源许可不等于模型权重、训练数据和平台算力也采用相同许可,三者必须分别确认。
| 项目 | DeepSeek-V4-Pro-0813 | DeepSeek Harness v0.1 | |---|---|---| | 产品类型 | 大语言模型 | Agent 开发与执行框架 | | 发布时间 | 2026 年 8 月 13 日版本 | 2026 年 8 月 13 日开放预览 | | 核心作用 | 推理、编码、规划、工具调用决策 | 管理任务循环、工具执行与上下文 | | 国家超算互联网支持 | 模型获取、私有化部署、分布式推理 | 源码拉取、编译调试、二次开发、部署 | | 已披露许可 | 本次材料未明确说明模型许可细节 | MIT License | | 当前阶段 | 正式版 | v0.1 开发者预览版 | | 价格信息 | 尚未公布 | 源代码开放,算力费用尚未披露 |
“一站式”真正省掉的是系统拼接
国家超算互联网是面向科研机构、科技企业和开发者提供跨地域算力与软件服务的国家级计算基础设施平台。 官方将其描述为全国首个十万卡级超智融合算力资源池,可为大模型训练、微调、评测、部署和推理提供全生命周期算力支撑。
大模型落地最麻烦的环节通常不是下载权重,而是让模型在目标硬件上稳定、持续且低成本地运行。 一个完整的生产系统至少涉及权重存储、推理引擎、张量或专家并行、批处理调度、KV Cache 管理、鉴权、日志、监控和故障恢复;如果还要运行 Agent,就会再增加工具权限、沙箱隔离、任务状态和审计记录等模块。
国家超算互联网此次提供的价值,是把模型仓库、国产算力、分布式推理和 Agent 工程环境放进同一条交付链路。 开发者不必先在一个平台下载模型,再把数百 GB 甚至更大的权重同步到另一处集群,随后单独寻找 Harness 运行环境。对于需要内网部署、数据不出域或依赖国产硬件的机构,这种整合比单纯增加一个在线模型入口更实用。
所谓“一站式”仍不等于任何项目都能一键上线。 企业仍需要自行处理业务数据、工具权限、安全策略、评测集和服务容量规划;模型能调用终端,也不意味着应该获得无限制的系统权限。尤其在代码、财务和科研场景中,Harness 必须与容器沙箱、网络白名单、凭证隔离及人工审批机制配合使用。
一个较完整的落地流程可以被压缩为五个阶段:
- 在平台获取 DeepSeek-V4-Pro-0813 模型资源,并确认模型许可与使用边界;
- 根据国产加速卡和集群拓扑选择单机或分布式推理方案;
- 部署推理服务,并验证上下文长度、并发吞吐和工具调用稳定性;
- 拉取 DeepSeek Harness v0.1,将业务工具、代码仓库或内部知识库接入 Agent;
- 通过离线评测、灰度测试和审计系统验证效果,再进入生产环境。
Agent 能力增强,但正式版跑分仍不够透明
DeepSeek-V4-Pro-0813 被官方描述为重点增强 Agent 能力的生产版本,但目前公开材料没有给出与上一版本直接可比的量化增幅。 “生产环境表现提升”至少应拆成任务成功率、平均执行轮数、端到端延迟、工具调用错误率和单位任务成本几项指标,否则开发者无法判断升级收益来自模型本身、Harness 优化,还是推理基础设施变化。
现有 DeepSeek V4 技术资料可以作为能力坐标,但不能直接当作 0813 正式版的独立测评结果。 此前针对 V4 技术报告的整理数据显示,相关版本在 SWE-bench Verified、Terminal-Bench 2.0、BrowseComp 和 MCPAtlas Public 等评测上取得较高成绩;这些数字能够说明 V4 系列的训练方向,却不能替代对 DeepSeek-V4-Pro-0813 的复测。
| 评测项目 | 已公开整理成绩 | 主要测试能力 | 解读限制 | |---|---:|---|---| | SWE-bench Verified | 80.6 | 真实软件仓库问题修复 | 需确认 Harness、采样次数和推理预算 | | Terminal-Bench 2.0 | 67.9 | 终端环境中的连续操作 | 对执行框架和环境配置较敏感 | | BrowseComp | 83.4 | 浏览、检索与多步信息获取 | 搜索工具与网页环境会影响结果 | | MCPAtlas Public | 73.6 | 外部工具协议与调用能力 | 更能反映跨工具栈泛化能力 | | MRCR 1M MMR | 83.5 | 100 万 Token 长上下文检索 | 长上下文准确率不等于有效生成质量 | | CorpusQA 1M ACC | 62.0 | 百万级上下文问答 | 需要结合延迟和显存成本评估 |
国家超算互联网转述称,V4 Pro 正式版整体性能可与国外闭源模型 Claude Fable 5、Opus-4.8 相媲美。 这一结论目前缺少统一测试集、推理预算、模型版本和完整测试日志支撑,而且相关模型命名也需要以对应厂商公开文档为准,因此更适合被视为官方定位,而不是已经完成第三方验证的性能结论。
开发者真正应该关注的是 V4 Pro 在外部工具栈中的成功率,而不只是单轮问答跑分。 Agent 可能连续执行几十次操作,只要每一步成功率为 95%,连续 20 步全部成功的理论概率就只有约 35.8%;如果单步成功率提高到 99%,同样 20 步任务的理论成功率约为 81.8%。这也是 Agent 模型强调规划、纠错和工具调用稳定性的原因。
Responses API 兼容降低迁移成本,但不会自动兼容所有 Agent
OpenAI Responses API 是一种统一承载文本生成、工具调用和多轮任务状态的接口范式。 DeepSeek-V4-Pro 对这一接口形态的原生支持,有利于已经围绕 Responses API 构建应用的团队迁移模型,也方便 Harness 复用现有工具描述和事件处理逻辑。
接口兼容只能减少请求格式改造,不能保证不同模型的行为完全一致。 工具参数生成、并行调用策略、错误重试、思考预算和上下文裁剪方式都可能不同;同一个 Agent 工作流更换模型后,仍需要重新测试任务完成率、Token 消耗、响应延迟和异常分支。
本次上线没有必要用一段简单调用示例来概括,因为它的重点是私有化部署和完整 Agent 工程链路。 对开发团队来说,是否支持流式事件、工具调用结果回传、长任务恢复、并发调度和可观测性,比“能否返回一段文本”更值得检查。
国产算力底座是亮点,也是下一阶段的考题
国家超算互联网为 DeepSeek 提供国产算力底座,是这次合作最具产业价值的部分。 大模型规模越大,部署越依赖推理引擎与硬件之间的深度适配;在国产加速卡集群上稳定运行 V4 Pro,需要解决通信拓扑、算子优化、显存分配、并行策略和故障恢复等问题。
十万卡级资源池代表的是总体资源组织能力,并不意味着单个用户可以即时获得十万张加速卡。 实际可用容量还取决于节点型号、地域、排队策略、网络带宽和资源配额。平台后续如果希望吸引企业从测试走向生产,需要进一步公开可用硬件规格、部署模板、冷启动时间、吞吐数据和服务等级协议。
价格仍是当前信息中最明显的空白。 截至 2026 年 8 月 15 日,公开报道尚未披露 DeepSeek-V4-Pro-0813 在国家超算互联网上的训练、推理和专属部署价格,也没有公布按卡时、Token 或实例计费的具体标准。没有成本数据,企业就难以将其与自建集群或其他云平台做完整比较。
Harness v0.1 的预览属性同样意味着它暂时更适合验证,而不是直接承载关键业务。 v0.1 通常代表接口、插件机制和运行时行为仍可能快速变化,团队需要锁定版本、保留测试集,并为升级准备回滚方案。MIT 开源降低了二次开发门槛,却不会自动解决框架成熟度和长期维护问题。
这次上线对谁最有用
科研院所是本次整合最直接的受益者。 这类机构往往需要处理不能离开内网的数据,同时缺少长期维护大规模推理集群的工程团队;如果平台能提供稳定的国产算力适配和私有部署模板,其价值会明显高于单纯的在线模型服务。
科创企业可以借助这套组合缩短 Agent 原型到部署之间的距离。 代码助手、科研检索、设备运维和内部数据分析都需要模型连续调用工具,Harness 提供了可修改的执行框架,国家超算互联网则承担底层计算资源,两者组合可以减少重复搭建基础设施的投入。
已经拥有成熟 AI 平台的大型企业不会仅因为“一站式”就立即迁移。 它们更看重推理吞吐、故障恢复、审计能力、硬件利用率和总体拥有成本,而这些关键数据目前尚未完整披露。国家超算互联网需要拿出可复现的基准测试和明确 SLA,才能把平台便利性转化为生产吸引力。
判断:方向比跑分更重要,兑现还要看运营数据
DeepSeek-V4-Pro-0813 与 Harness 同时登陆国家超算互联网,是一次从“提供模型”向“提供 Agent 生产环境”的升级。 模型、推理框架、算力资源和智能体工具链被放到同一平台后,开发者可以少做一部分系统拼接工作,尤其适合强调私有部署与国产算力的项目。
这套组合目前最大的优势是交付链路完整,最大的短板则是生产数据不够完整。 官方已经给出十万卡级资源池、MIT 开源和全生命周期支持等明确信息,但正式版相对旧版本提升多少、每秒可处理多少 Token、并发延迟如何、故障率多少以及成本几何,仍没有可核验的公开数字。
最终决定它能否进入企业核心系统的,不会是“媲美某个闭源模型”的一句话,而是连续运行数周后的任务成功率和账单。 如果国家超算互联网后续能够公开不同国产硬件上的吞吐、延迟、资源利用率和 Agent 端到端成功率,这次上线才会从一次模型上新,真正变成可复制的国产 Agent 基础设施方案。
参考来源
- IT之家:DeepSeek V4 Pro 正式版、Harness 上线国家超算互联网——本次上线时间、平台能力、Harness 开源与部署范围的主要信息来源。
- 知乎:DeepSeek-V4 技术报告解读——整理 V4 系列架构、Agent 评测与百万 Token 长上下文数据;相关成绩不应直接等同于 0813 正式版独立实测。



