DeepSeek Flash 系列模型降价:输出每百万 Token 降至 4 元
DeepSeek 调整 Flash 系列模型定价
2026 年 9 月 9 日,DeepSeek 开放平台发布公告,宣布将于次日(9 月 10 日)中午 12 点起,对 Flash 系列大模型的 API 调用价格进行新一轮调整。这次调价并非全面涨价,而是针对特定使用场景做了明显降价,尤其是对高频复用提示词的用户更为友好。

目前 Flash 系列包含两款模型:deepseek-v4-flash(纯文本)和 deepseek-v4-flash-vision-exp(支持图像理解)。两款模型的调价幅度完全一致,均按统一标准执行新费率。
新价格结构:分时段、看缓存
DeepSeek 的定价策略延续了“空闲时段 vs 高峰时段”+“缓存命中与否”的双重维度。简单来说:
- 空闲时段:通常指非工作高峰或服务器负载较低的时间段;
- 高峰时段:各项价格均为空闲时段的 2 倍;
- 缓存命中:指用户重复提交相同或高度相似的输入内容,系统可直接返回缓存结果,不重新计算;
- 缓存未命中:每次请求都需模型重新推理,成本更高。
调整后,空闲时段的具体价格如下:
- 输入(缓存命中):0.02 元 / 百万 Token
- 输入(缓存未命中):1 元 / 百万 Token
- 输出:4 元 / 百万 Token
高峰时段则分别为 0.04 元、2 元和 8 元。
降幅最大的是“缓存命中”场景
对比此前价格,这次调价最显著的变化出现在缓存命中的输入部分:
- 空闲时段从 0.05 元 降至 0.02 元,降幅达 60%;
- 高峰时段从 0.10 元 降至 0.04 元,同样降了 60%。
这意味着,如果你的应用大量使用固定提示词(prompt),比如客服问答模板、结构化数据提取指令等,只要内容不变,后续调用几乎可以忽略不计成本。
输入未命中的部分也有下调:
- 空闲时段从 1.5 元 → 1 元(降 33.3%)
- 高峰时段从 3.0 元 → 2 元(降 33.3%)
而输出价格的降幅相对温和:
- 空闲时段从 4.5 元 → 4 元(降约 11.1%)
- 高峰时段从 9.0 元 → 8 元(同样降 11.1%)
以输出为例,现在每生成 100 万 Token 的文本,空闲时段只需 4 元。按中文平均 1 Token ≈ 1.5 字估算,相当于生成约 150 万字的内容花费 4 元——对轻量级应用或初创团队来说,门槛进一步降低。
为何此时降价?
值得注意的是,这并非 DeepSeek 近期首次调整 API 价格。就在几个月前,其主力模型曾因算力成本压力小幅上调费率。而此次对 Flash 系列的降价,可能反映出几个信号:
首先,Flash 系列定位明确为“高吞吐、低延迟”的推理优化模型,适合对响应速度敏感但精度要求适中的场景,如实时聊天、批量摘要、简单代码生成等。通过降价,DeepSeek 或在与同类竞品(如阿里通义千问 Turbo、百度 ERNIE Speed)争夺市场份额。
其次,缓存机制的强化暗示其基础设施已能高效复用计算结果。大幅降低缓存命中价格,本质上是在鼓励开发者设计可复用的 prompt 结构,从而提升整体资源利用率。
最后,视觉扩展版 deepseek-v4-flash-vision-exp 同步降价,说明多模态能力正从“高端选项”转向“基础配置”。图像理解不再只是旗舰模型的特权,轻量级应用也能低成本接入。
对开发者意味着什么?
如果你正在使用或考虑接入 DeepSeek Flash 系列,这次调价带来几个实际影响:
- 固定 prompt 场景成本骤降:例如,一个电商客服机器人每天重复回答“退货流程是什么”,只要问题表述一致,第二次及之后的调用几乎免费。
- 高峰时段仍需谨慎:虽然空闲时段便宜,但高峰价格翻倍。建议在非核心业务中设置调用时间窗口,避开下午 2–5 点等典型高峰。
- 输出仍是主要成本项:尽管降了 11%,输出仍占总费用大头。若应用对生成长度敏感(如长报告生成),仍需优化输出控制逻辑。
- 视觉模型性价比提升:带图理解的调用现在和纯文本模型同价,适合需要处理截图、表格图片或简单视觉问答的场景。
不过也要注意,DeepSeek 并未公布缓存命中的具体判定规则。是否区分大小写?标点变化是否算新请求?这些细节可能影响实际成本,建议开发者在测试阶段监控账单明细。
行业背景下的价格战
过去一年,国内大模型 API 价格战愈演愈烈。从百川、零一万物到智谱、月之暗面,各家纷纷推出“低价快模型”抢占市场。DeepSeek 此次降价,可视为对这一趋势的直接回应。
但低价不等于无利可图。通过精细化的缓存定价,厂商实际上在引导用户行为——你越会“省”,他们越能“赚”。因为缓存复用意味着 GPU 实际计算量下降,而单位收入并未同比减少。
换句话说,这场降价既是让利,也是教育:教会开发者如何更高效地使用大模型 API。
实测建议
如果你打算尝试新价格,不妨做个小实验:
- 准备一段固定 prompt,比如“请用三句话总结以下新闻”;
- 连续调用 10 次,输入相同内容;
- 查看账单中是否只有第一次计费为“未命中”,其余均为“命中”;
- 再微调 prompt(如加个空格或换标点),观察是否重新计为未命中。
这类测试能帮你摸清缓存边界,避免意外高额账单。
总的来说,DeepSeek 这次调价没有玩虚的,实实在在降低了特定场景的使用成本。对于追求性价比的开发者而言,Flash 系列的吸引力确实增强了。