DeepSeek V4 Pro不下线了

DeepSeek今日宣布,原定于9月14日下线的V4 Pro API将继续提供调用,计费方式维持不变。此前已部署V4 Pro的开发者无需被迫迁移到V4.1 Flash,但两者的价格与能力差异仍值得重新评估。
DeepSeek撤回V4 Pro API下线计划
DeepSeek今天(2026年9月11日)宣布,原定于北京时间9月14日12:00之后停止独立提供的 DeepSeek V4 Pro API,将继续开放调用,原有计费方式保持不变。
这意味着,已经把 deepseek-v4-pro 接入生产环境的开发者,暂时不需要在下周一之前重构模型路由,也不会因为模型被强制切换到 V4.1 Flash 而自动按照 Flash 价格结算。对于依赖固定模型行为、提示词格式和输出风格的 Agent、代码生成及自动化工作流来说,这比单纯省下一部分调用成本更重要。
**DeepSeek V4 Pro API继续服务,是DeepSeek在V4.1 Flash上线后对开发者需求做出的最新调整。**此前官方已经连续两次调整下线节奏,今天则直接取消原定的下线安排。

三天内连续改变安排
这次变更并不是一次孤立的价格公告,而是三天内连续调整模型生命周期计划的结果。
- 9月9日:DeepSeek宣布,在V4.1 Pro上线之前,访问V4 Pro的请求将全部路由到V4.1 Flash,并按照V4.1 Flash的单价计费。
- 9月10日:DeepSeek将V4 Pro的处理时间推迟到北京时间9月14日12:00之后,给开发者留出更多迁移时间。
- 9月11日:DeepSeek进一步宣布,9月14日之后仍继续提供V4 Pro API调用,计费方式维持原方案。
**从“自动路由”到“延后下线”,再到“继续保留”,DeepSeek实际上把一次强制迁移改成了并行保留。**这对于已经在生产环境中验证过V4 Pro的团队是利好,但也说明V4.1 Flash的上线和V4 Pro的产品定位仍在调整中。
需要注意的是,V4.1 Flash并没有因此失去意义。DeepSeek此前表示,经多方测试,V4.1 Flash在性能、费用、速度和总用时等维度都超过V4 Pro,并且是V4系列中首次原生支持多模态视觉理解的模型。现在的变化更像是:Flash继续承担默认的新一代模型角色,V4 Pro则暂时作为稳定的高能力选项保留。
V4 Pro原计费到底是多少
**“维持原计费”指V4 Pro继续按照当前V4 Pro价目表结算,而不是按V4.1 Flash的低价结算。**目前两款模型都采用峰谷定价:工作日北京时间9:00—12:00、14:00—18:00为高峰时段,其余时间为闲时;闲时价格是高峰价格的一半。
| 模型 | 输入价格(缓存命中) | 输入价格(缓存未命中) | 输出价格 | 并发限制 | 视觉理解 |
|---|---:|---:|---:|---:|---|
| deepseek-flash(V4.1 Flash)闲时 | 0.02元/百万Tokens | 1元/百万Tokens | 4元/百万Tokens | 2500 | 支持 |
| deepseek-flash(V4.1 Flash)高峰 | 0.04元/百万Tokens | 2元/百万Tokens | 8元/百万Tokens | 2500 | 支持 |
| deepseek-v4-pro 闲时 | 0.15元/百万Tokens | 4.5元/百万Tokens | 13.5元/百万Tokens | 500 | 不支持 |
| deepseek-v4-pro 高峰 | 0.30元/百万Tokens | 9元/百万Tokens | 27元/百万Tokens | 500 | 不支持 |
从价格上看,V4 Pro并没有因为继续保留而与Flash拉平。以闲时价格计算,V4 Pro的缓存命中输入价格是Flash的7.5倍,缓存未命中输入价格是4.5倍,输出价格则是3.375倍。高峰时段的倍率相同。
**V4 Pro真正昂贵的部分主要在输出Token,而不是缓存命中的输入Token。**如果一个应用大量复用固定系统提示词、工具定义和上下文,缓存命中输入成本差异相对可控;但如果任务需要长篇推理、代码修改或多轮Agent执行,输出成本会很快成为主要开支。
举个简单的账:一个工作日高峰时段的任务,如果消耗100万Tokens未命中输入和100万Tokens输出,V4 Pro成本为36元,V4.1 Flash成本为10元。若输入全部缓存命中,同样规模的任务,V4 Pro成本为27.3元,Flash成本为8.04元。
这也是为什么,V4 Pro继续提供调用并不等于开发者应该继续优先使用V4 Pro。它保留的是兼容性和模型确定性,Flash则在单位成本、速度和多模态能力上更有吸引力。
V4.1 Flash为什么能替代,却又没有完全替代
**DeepSeek V4.1 Flash是DeepSeek新一代模型结构中的轻量级模型,支持原生视觉理解、思考模式和最高1M上下文长度。**官方资料显示,V4.1 Flash最大输出长度达到384K,并支持JSON输出、Tool Calls、Responses API、Anthropic API以及对话前缀续写等能力。
它的产品逻辑很清楚:让更小、更快、更便宜的模型覆盖绝大多数日常开发任务,再通过思考模式处理复杂问题。对于代码问答、文档分析、批量分类、网页截图理解和轻量级Agent,Flash已经不是传统意义上只负责简单任务的“小模型”。
| 对比维度 | DeepSeek V4 Pro | DeepSeek V4.1 Flash | |---|---|---| | 模型版本 | DeepSeek-V4-Pro-0813 | DeepSeek-V4.1-Flash | | 定位 | 高能力、稳定兼容的旗舰模型 | 新一代轻量级通用模型 | | 原生多模态 | 不支持 | 支持视觉理解 | | 上下文长度 | 以现有文档标注为准 | 1M Tokens | | 最大输出长度 | 以现有文档标注为准 | 384K Tokens | | 思考模式 | 支持 | 支持非思考与思考模式 | | 工具调用 | 支持 | 支持 | | Responses API | 支持 | 支持 | | 闲时输出价格 | 13.5元/百万Tokens | 4元/百万Tokens | | 高峰输出价格 | 27元/百万Tokens | 8元/百万Tokens | | 并发限制 | 500 | 2500 |
**Flash的优势不是某一个跑分特别高,而是性能、速度、价格和并发能力同时达到可用区间。**这对于线上应用尤其关键:模型慢几百毫秒,可能只是聊天体验变差;但在一个包含数十次模型调用的Agent流程里,每一步的延迟都会被放大,最终决定整个任务是否能在用户等待范围内完成。
不过,“全面超越”目前主要来自DeepSeek官方披露和测试结论,不能简单理解为所有任务上V4.1 Flash都稳定优于V4 Pro。对于强依赖既有提示词、特定代码风格、长链路工具调用或严格输出格式的应用,模型切换仍然需要回归测试。模型名称相同或请求接口兼容,并不代表生成结果、工具选择和推理路径完全一致。
对开发者意味着什么
1. 已接入V4 Pro的项目获得缓冲期
**取消下线让V4 Pro用户避免了一次没有明确截止日期的生产迁移。**尤其是企业内部自动化、代码审查、数据清洗和长文本处理系统,模型迁移往往不仅是修改一个模型名,还涉及提示词、上下文拼接、结构化输出校验、工具参数和失败重试策略。
现在这些团队可以把迁移从“必须马上做”变成“有数据再做”。建议至少记录以下指标,再决定是否切换到Flash:
- 任务成功率和结构化输出通过率;
- 首Token延迟、完整响应耗时和超时比例;
- 工具调用次数、错误率以及Agent任务完成率;
- 平均输入、输出Token数量和缓存命中率;
- 高峰与闲时的实际成本差异。
2. 新项目不必默认选择V4 Pro
**对于今天才开始搭建的新应用,V4.1 Flash更像是默认起点,V4 Pro则适合被当作对照组。**原因并不复杂:Flash的并发上限是2500,V4 Pro为500;Flash支持视觉输入,输出价格也明显更低。只要任务不是明显依赖V4 Pro的特定能力,先用Flash做基准测试通常更合理。
但这不等于所有请求都应该交给Flash。一个更实际的分层方式是:
- 用Flash处理分类、摘要、视觉解析、代码补全和常规工具调用;
- 对低置信度结果、复杂规划和多轮失败任务保留升级到V4 Pro的路径;
- 对高价值任务固定使用V4 Pro,并锁定提示词和评测集;
- 记录不同模型的真实成本,而不是只比较每百万Tokens单价。
**模型路由的核心不再只是“大小模型分工”,而是“任务价值与失败成本分工”。**当V4 Pro的单价已经足够低时,维护一套复杂的多模型编排系统,可能比直接使用更强模型更贵。相反,在高并发批处理场景里,Flash较低的价格和更高的并发上限又会明显占优。
3. 需要警惕后续版本变化
**V4 Pro本次只是取消当前下线计划,并不代表它会永久保留。**DeepSeek仍然在推进V4.1 Pro,未来V4.1 Pro上线后,V4 Pro的定位、价格和服务期限仍可能发生变化。
生产系统最好不要把模型名称、价格和上下文能力写死在业务逻辑里。至少应该做到:模型配置可热更新,关键任务有备用模型,版本升级前有固定评测集,费用监控能够区分缓存命中、缓存未命中和输出Token。
如果团队此前已经针对9月14日下线做了迁移,也不建议因为今天的公告就立刻回滚。更稳妥的做法是保留Flash迁移分支,以小流量方式比较两个模型,再决定是否恢复V4 Pro作为主模型。毕竟,API继续可用解决的是供应连续性问题,不会自动解决模型效果和成本问题。
这次反复调整透露了什么
**DeepSeek撤回下线计划,说明模型生命周期管理正在从“技术版本更新”变成“生态兼容性管理”。**从厂商角度看,V4.1 Flash如果在综合测试中已经超过V4 Pro,继续维护旧旗舰似乎会增加资源和运营成本;但从开发者角度看,线上模型不是一个可以随时替换的按钮,而是整个软件系统的一部分。
模型越多、调用链越长,迁移风险越高。一次看似简单的路由变化,可能造成JSON字段变化、工具调用参数变化、上下文截断策略变化,甚至让原本能完成的Agent任务出现循环调用。DeepSeek今天选择保留V4 Pro,本质上是在性能进步与生态稳定之间做折中。
对市场而言,这也进一步压低了模型调用的价格门槛。V4 Pro在闲时每百万Tokens输出13.5元,V4.1 Flash只有4元;再加上Flash支持1M上下文、原生视觉和更高并发,传统“先用轻量模型筛选,再把少数请求交给旗舰模型”的架构,已经需要重新算账。
**真正值得开发者关注的不是V4 Pro有没有下线,而是同等任务的总完成成本是否下降。**如果Flash一次完成任务的概率更低,反复重试会抵消低单价;如果V4 Pro虽然更贵,却能减少工具调用次数和人工介入,它的总成本可能仍然更低。接下来最有价值的测试,不是单独看基准分数,而是把真实业务链路跑完整。
结论
DeepSeek今天给出的最新答案很明确:V4 Pro API在9月14日之后继续提供,计费方式保持不变,不再按原计划切换到V4.1 Flash价格。
对老用户,这是一次兼容性利好;对新项目,V4.1 Flash仍然是更值得优先评估的默认选项;对需要高稳定性、高复杂度推理和既有行为一致性的生产系统,V4 Pro则暂时保留了现实价值。
短期内,开发者不必因为截止日期临近而仓促迁移;中期看,最好同时完成Flash的兼容性测试和成本基准。等V4.1 Pro上线后,DeepSeek的模型分层和价格体系大概率还会继续调整,现在更适合保留选择,而不是押注某一个模型会永久存在。
参考来源
- IT之家:DeepSeek将继续提供V4 Pro API调用服务:报道DeepSeek于2026年9月11日宣布取消V4 Pro API下线计划,并列出两款模型的价格信息。
- DeepSeek API官方文档及更新日志:用于核对V4.1 Flash的模型名称、峰谷计费规则、上下文长度、功能支持和此前的下线安排;因本文参考来源链接限制,未附站外链接。



