AI 快讯DeepSeek Flash再降价,输出每百万Token 4元
产品更新

DeepSeek Flash再降价,输出每百万Token 4元

2026-09-09T00:04:11.504Z
DeepSeek Flash再降价,输出每百万Token 4元

DeepSeek宣布,Flash系列将于2026年9月10日12时起执行新价格:空闲时段输入缓存命中降至每百万Token 0.02元,输出降至4元。此次调整重点压低缓存与输入成本,继续瞄准长上下文和Agent工作流。

DeepSeek Flash再降价,输出每百万Token 4元

DeepSeek宣布,Flash系列将于北京时间2026年9月10日12时起执行新价格,空闲时段输出价格降至每百万Token 4元,输入缓存命中价格降至0.02元。

这不是一次模型能力升级,而是一次直接影响开发者账单的价格调整。对偶尔调用模型的个人用户来说,单次对话省下的钱并不明显;但对持续运行的Agent、代码审查、文档问答、批量内容处理和多轮工作流而言,真正有价值的是缓存命中价格已经压到每百万Token 2分钱,重复发送上下文的成本几乎被打穿。

DeepSeek Flash系列新旧价格对比信息图

一句话看懂这次调价

DeepSeek Flash系列是面向高并发、长上下文和大规模调用场景的低成本模型系列,目前包括deepseek-v4-flash和deepseek-v4-flash-vision-exp两款模型。

DeepSeek开放平台公告显示,新价格自9月10日12时起生效。空闲时段的输入缓存命中价格为每百万Token 0.02元,输入缓存未命中为1元,输出为4元;高峰时段各项价格翻倍。

| 计费项目 | 空闲时段新价格 | 高峰时段新价格 | |---|---:|---:| | 输入,缓存命中 | 0.02元/百万Token | 0.04元/百万Token | | 输入,缓存未命中 | 1元/百万Token | 2元/百万Token | | 输出 | 4元/百万Token | 8元/百万Token |

这里的空闲与高峰并不是开发者自行选择的套餐,而是按平台规定的时间段计费。DeepSeek文档显示,高峰时段为北京时间周一至周五9:00—12:00、14:00—18:00,其余时间为闲时。换句话说,开发者如果把批处理、离线评估或大规模索引任务安排在工作日午间和晚间之外,账单仍有进一步下降空间。

两款Flash模型同步降价,降幅并不平均

缓存命中价格是本次调价中降幅最大的部分,原价每百万Token 0.05元降至0.02元,降幅达到60%。

根据公开价格信息,deepseek-v4-flash和deepseek-v4-flash-vision-exp的调价幅度完全一致。两款模型原有价格相同,新价格也相同,区别主要在于是否支持视觉输入,而不是价格层级。

| 模型 | 项目 | 原价:闲时 | 新价:闲时 | 原价:高峰 | 新价:高峰 | 降幅 | |---|---|---:|---:|---:|---:|---:| | deepseek-v4-flash | 输入缓存命中 | 0.05元 | 0.02元 | 0.10元 | 0.04元 | 60% | | deepseek-v4-flash | 输入缓存未命中 | 1.5元 | 1元 | 3元 | 2元 | 33.33% | | deepseek-v4-flash | 输出 | 4.5元 | 4元 | 9元 | 8元 | 11.11% | | deepseek-v4-flash-vision-exp | 输入缓存命中 | 0.05元 | 0.02元 | 0.10元 | 0.04元 | 60% | | deepseek-v4-flash-vision-exp | 输入缓存未命中 | 1.5元 | 1元 | 3元 | 2元 | 33.33% | | deepseek-v4-flash-vision-exp | 输出 | 4.5元 | 4元 | 9元 | 8元 | 11.11% |

从结构上看,DeepSeek这次并没有把降价平均分配到所有计费项,而是把最激进的折扣放在缓存命中输入上。输出价格只下降11.11%,未命中输入下降33.33%。这传递出一个明确的产品信号:平台希望开发者采用更高效的上下文复用方式,而不是无差别地重复发送完整Prompt。

对Agent开发者,便宜的不是一次回答,而是持续运行

Token缓存是模型服务保存并复用重复输入上下文的机制,适合系统提示词、工具定义、历史文档和固定规则反复出现的工作流。

传统聊天应用通常只关心一次请求的输入和输出,但Agent的成本结构完全不同。一个执行任务的Agent可能需要反复携带以下内容:

  • 长篇系统提示词和角色设定;
  • 工具列表、函数参数和权限规则;
  • 企业知识库检索结果;
  • 前几轮对话和任务状态;
  • 代码仓库说明、接口文档或项目约束。

这些内容在多轮调用中往往变化不大。如果每次都按未命中输入计费,长上下文会不断重复产生费用;如果能够命中缓存,输入成本就会从每百万Token 1元降至0.02元,价格降低98%。

举个更接近实际的例子:一个代码Agent每天处理1000个任务,每个任务平均携带100万Token可复用上下文,并产生10万Token输出。假设这些上下文全部命中缓存,且调用发生在空闲时段,那么每天的输入成本约为20元,输出成本约为4000元,总计约4020元。若输出规模只有1万Token,则每天总成本约420元。

这个例子也说明,对于生成量很大的任务,输出仍然是账单主体,缓存降价并不能替代输出控制。 开发者需要同时优化上下文复用、输出长度和任务拆分,否则只关注0.02元的缓存价格,容易低估模型长篇输出带来的成本。

1M上下文和384K最大输出,决定了它的使用边界

上下文长度是模型一次请求能够处理的输入信息上限,deepseek-v4-flash的上下文长度为1M Token,最大输出长度为384K Token。

对于长文档分析、代码库问答、合同审阅和持续型Agent任务,1M Token上下文意味着开发者可以在一次任务中放入更大规模的材料,而不必频繁切片。相比只支持几十万Token上下文的模型,Flash更适合处理“先读完整资料,再连续执行多步任务”的场景。

不过,上下文窗口大不等于模型会自动有效利用所有信息。上下文越长,检索、排序、摘要和缓存策略越重要。把整套代码仓库或全部历史对话无差别塞给模型,可能增加延迟,也可能让关键信息被噪声淹没。更合理的做法是:固定规则和工具定义尽量复用缓存,变化内容通过检索或状态摘要动态注入。

从模型能力配置看,deepseek-v4-flash支持思考模式和非思考模式,支持JSON输出、工具调用和Responses API,并采用OpenAI格式的接口兼容方式。对于需要结构化结果或自动执行动作的开发者,这些能力比单纯的聊天接口更重要,因为它们直接决定模型能否进入生产工作流。

Vision版本不是简单的图片加成

deepseek-v4-flash-vision-exp是支持视觉输入的Flash实验版本,图片会按照尺寸换算为Token,并与文本Token一起计费。

这意味着,视觉模型的实际成本不能只看文字输入价格。图片分辨率、数量以及请求中附带的文本都会影响最终用量。对发票识别、截图分析、UI测试、商品审核和图表理解等任务,开发者需要把图片Token纳入预算,而不是把视觉输入当成免费附件。

视觉版本的价值在于,它可以把图像理解接入同一套长上下文和工具调用流程。例如,UI测试Agent可以先读取页面截图,再调用浏览器工具执行操作;文档Agent可以同时处理扫描件、表格和文字说明。价格下调后,这类多模态批处理的试错成本会下降,但生产环境仍应设置图片尺寸上限、单任务最大轮数和输出长度限制。

与此前价格相比,真正的看点是什么

这次调价的核心不是把输出价格降到行业最低,而是进一步强化DeepSeek在高频调用和长上下文场景中的成本优势。

如果只看输出价格,空闲时段从4.5元降至4元,降幅为11.11%,并不算颠覆性变化。高峰时段从9元降至8元,也更像是价格微调。但输入缓存命中从0.05元降到0.02元,才是对Agent架构更有实际影响的部分。

此前DeepSeek已经通过低缓存价格吸引开发者把固定上下文沉淀到模型调用链中。此次进一步降价,相当于把价格杠杆从“偶发调用”推向“持续运行”:

  1. 对聊天产品,边际收益有限。 单轮问答的上下文较短,缓存命中次数有限,输出成本占比通常更高。
  2. 对代码和知识库Agent,收益更直接。 固定系统提示、工具描述和项目资料可以反复命中缓存。
  3. 对批量任务,调度策略变得更重要。 在空闲时段运行离线任务,价格可比高峰时段低50%。
  4. 对视觉任务,成本核算更复杂。 图片换算后的Token会与文本一起计费,需要纳入调用监控。

与其他模型比较时,不能只拿一个“每百万Token输出价格”下结论。上下文长度、思考模式、工具调用、视觉能力、限流策略、稳定性和缓存命中率,都会影响最终的单位任务成本。对企业而言,真正应该比较的是“完成一次有效任务需要多少钱”,而不是单独比较模型报价。

开发者现在应该检查三件事

降价能否转化为真实成本下降,取决于应用是否正确利用缓存、时段和输出控制。

第一,检查固定Prompt是否稳定。系统提示词、工具定义和格式约束频繁改动,会降低缓存命中率。可以把经常变化的用户输入、检索结果和任务状态放在上下文后部,减少固定前缀被破坏的概率。

第二,检查高峰时段占比。工作日9:00—12:00和14:00—18:00属于高峰时段,价格是闲时的两倍。对于实时聊天无法完全避开高峰,但离线评测、数据清洗、批量摘要和代码扫描可以安排在闲时执行。

第三,检查输出是否失控。新价格下,输出仍然是最贵的主要项目之一。应通过结构化输出、最大输出长度、分步任务和结果截断,避免模型为了“解释充分”生成大量重复内容。对Agent尤其要监控循环调用、失败重试和工具调用后的无效复述。

判断:价格战进入工作流阶段

DeepSeek这次降价的意义,在于它把模型价格竞争从单次对话进一步推进到Agent工作流和长上下文基础设施。

过去开发者比较模型,常问的是“哪个模型回答更好”;现在更现实的问题是“哪个模型能以可控成本连续工作”。一个模型即使单次输出便宜,如果缓存利用率低、上下文受限、工具调用不稳定,最终账单和维护成本仍可能很高。反过来,拥有1M Token上下文、结构化输出和工具调用能力的低价模型,更容易成为企业工作流里的默认执行层。

DeepSeek Flash这次没有通过夸张的输出折扣制造噱头,而是继续压低缓存和输入价格。这对已经拥有长上下文Agent架构的团队更友好,也会迫使竞品重新审视缓存计费和高峰定价。可以预见,未来模型服务的竞争指标不会只有基准测试分数,还会包括缓存命中率、每小时有效任务数、失败重试成本以及单位任务总价。

但开发者也不应把低价等同于无限使用。DeepSeek官方文档仍提示,并发限制、隔离策略和价格规则可能发生变化,实际成本应以平台最新页面和用量记录为准。对于生产系统,建议在切换模型前做一轮真实流量评估:固定输入占比是多少、缓存命中率是多少、平均输出Token是多少、峰值并发是否会触发限制,以及同一任务在不同模型上的成功率如何。

综合来看,deepseek-v4-flash的新价格更适合高频、长上下文、可缓存的生产工作流,而不是单纯追求最强单轮回答的场景。 输出每百万Token 4元并非所有模型服务中的绝对最低价,但结合0.02元的缓存命中输入、1M上下文、思考模式和工具调用,它仍然是当前开发者构建低成本Agent时值得优先测试的方案之一。新价格将于9月10日12时正式执行,已经在使用Flash系列的团队,可以从缓存命中率和高峰调用占比开始重新核算账单。

相关推荐

查看全部