DeepSeek涨价前后价格差多少?API成本控制实战指南
2025年2月9日早上九点多,我负责的一个RAG问答服务突然触发了成本告警——前一日的API账单从平常的三十几块钱跳到了一百四十多。当时我第一反应是有人刷接口,查了调用日志才发现请求量纹丝不动,是单价变了。DeepSeek的优惠期在前一天晚上结束,我那份没来得及细看的邮件通知,代价就是这么直接。
这件事让我意识到,很多团队在选模型时只看跑分,很少认真算过账。
核心结论摘要:DeepSeek涨价前后价格对比的核心不是"单价涨了几倍",而是缓存命中率决定了你实际付多少钱。优惠期结束后,deepseek-chat 输出价格从 2 元/百万 tokens 涨到 8 元/百万 tokens,涨幅达 300%;但到 2025 年 9 月 V3.2-Exp 发布,输出价格已回落到 3 元/百万 tokens,比涨价后的价格还低 62.5%。
涨价时间线:DeepSeek 到底调了几次价
先把事实摆清楚。DeepSeek 的 API 定价并不是一次性的"涨"或"降",而是经历了至少四个明确节点,每个节点的定价逻辑都不一样。
DeepSeek 涨价前后价格,是指 2024 年 12 月 V3 发布时公布的限时优惠价,与 2025 年 2 月 9 日优惠期结束后恢复的标准价之间的差额。很多人把这次调整理解成"厂商割韭菜",但把时间轴拉长看,结论会不太一样。
| 时间节点 | 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 | | --- | --- | --- | --- | --- | | 2024.12.26–2025.2.8(优惠期) | deepseek-chat (V3) | 0.1 元 | 1 元 | 2 元 | | 2025.2.9 起(标准价) | deepseek-chat (V3) | 0.5 元 | 2 元 | 8 元 | | 2025.1.20 起 | deepseek-reasoner (R1) | 1 元 | 4 元 | 16 元 | | 2025.9.6 起(V3.1) | chat / reasoner 统一 | 0.5 元 | 4 元 | 12 元 | | 2025.9.29 起(V3.2-Exp) | 同上 | 0.2 元 | 2 元 | 3 元 |
单位均为元/百万 tokens,数据来源为 DeepSeek 官方 API 定价文档各版本快照。
2025 年 2 月 9 日这次调整最容易被记住,因为它是唯一一次"变贵":输出价格直接翻了四倍。2025 年 2 月 26 日官方还补了一个错峰优惠(北京时间 00:30–08:30 调用享折扣价),算是给这次涨价打了个补丁——但对白天跑业务的团队,这个优惠基本用不上。
价格表对比:涨的到底是什么
单看数字会误判。deepseek-chat 在优惠期内是典型的"获客定价",输入 1 元、输出 2 元这个水平,放在 2024 年底的市场上几乎是成本线以下。
真正需要关注的是结构变化:输出价格涨了 4 倍,输入缓存命中价格只涨了 5 倍但绝对值仍然极低(0.5 元),而缓存未命中的输入价格从 1 元涨到 2 元。
这意味着什么?意味着 DeepSeek 在鼓励你把上下文做成可复用的前缀。缓存命中的价格是 0.5 元,未命中是 2 元,差 4 倍。这个价差不是随手定的,它对应的是真实的算力开销差异。
我拿一个真实场景算过:客服知识库问答,每次请求拼接约 10K tokens 的系统提示与检索片段,输出约 1K tokens。假设前缀缓存命中率 70%。
- 优惠期单次成本:约 0.0057 元
- 涨价后单次成本:约 0.0175 元,**约 3.07 倍**
- V3.2-Exp 单次成本:约 0.0104 元,**比涨价后便宜 40.6%**
日均 10 万次调用的话,涨价后每月多出约 3.5 万元,这个数字对中小团队足够疼了。
涨价背后的技术逻辑,以及一个被忽略的成本杠杆
聊到这里得往底层看一层。DeepSeek-V3 是 MoE 架构,总参数 671B,每 token 激活 37B(数据来自 2024 年 12 月发布的 DeepSeek-V3 技术报告,arXiv:2412.19437)。MoE 的好处是推理时只激活一部分专家,算力开销远小于稠密模型;代价是显存占用和路由调度复杂度都不低。
更关键的是 MLA(Multi-head Latent Attention)。它把 KV Cache 压缩成低维潜向量,显存占用大幅下降——这正是 DeepSeek 能推出"缓存命中 0.5 元"这种价格的底气。上下文前缀一旦被缓存,后续请求只需要做注意力计算,不需要重新跑一遍完整前向传播。
坦白讲,我认为这是 DeepSeek 涨价前后价格对比中最容易被误读的部分。多数人盯着"涨了 4 倍"这个数字,却没注意官方实际上是把定价权交回给了开发者:你的工程能力越强,缓存命中率越高,实际单价就越接近 0.5 元而不是 2 元。 这跟传统云服务的按量计费完全是两种思路。
我在实际项目里做过一轮对比:把动态检索片段从系统提示前面挪到后面、把固定指令和 Few-shot 示例前置并加稳定的前缀标记,缓存命中率从 38% 提到了 76%,同样的业务量下月成本直接砍掉三分之一。改动量不到 50 行代码,投入产出比高得有点离谱。
这种"名义价格"和"有效价格"的分离,才是 2025 年调用大模型时最值得建立的成本直觉。选型时只比单价,等于放弃了这部分优化空间。关于国产大模型在推理侧的更多优化思路,可以参考 国产大模型推理优化路线梳理。
实战:涨价后把成本压回去的四个动作
下面这段代码是我自己写来估算成本的,跑一遍就能看出不同策略的差距。没有第三方依赖,Python 3.8 以上直接能跑。
deepseek_cost.py
用途:估算单次请求在不同定价阶段的 DeepSeek API 成本
运行环境:Python 3.8+,标准库即可
单位:元 / 百万 tokens
PRICING = { "v3_promo_2024_12": {"cache_hit": 0.1, "cache_miss": 1.0, "output": 2.0}, "v3_standard_2025_02": {"cache_hit": 0.5, "cache_miss": 2.0, "output": 8.0}, "v3_2_exp_2025_09": {"cache_hit": 0.2, "cache_miss": 2.0, "output": 3.0}, }
def estimate_cost(input_tokens, output_tokens, cache_hit_rate, plan): """按缓存命中率拆算输入侧成本,再叠加输出侧成本""" price = PRICING[plan] hit_tokens = input_tokens * cache_hit_rate miss_tokens = input_tokens - hit_tokens
cost = ( hit_tokens price["cache_hit"] + miss_tokens price["cache_miss"] + output_tokens * price["output"] ) / 1_000_000 # 单价按百万 tokens 计 return round(cost, 6)
if __name__ == "__main__":
场景:RAG 问答,输入 10K tokens,输出 1K tokens,缓存命中率 70%
for plan in PRICING: c = estimate_cost(10_000, 1_000, 0.7, plan) print(f"{plan:22s} 单次成本 {c:.6f} 元 日均10万次月成本 {c 100000 30:,.0f} 元")
跑出来的结果会让你对"涨价"这件事的体感具体很多。
除了算账,能落地的动作大致是这四类:
- **上下文重排**:把稳定不变的部分(角色设定、格式约束、Few-shot 示例)放在最前面,把动态检索结果放到后面,最大化前缀复用。
- **控制输出长度**:输出单价通常是输入的好几倍,让模型少说废话比省输入划算得多。在 prompt 里明确字数上限,效果立竿见影。
- **模型分级路由**:简单分类、抽取类任务走轻量模型,复杂推理才用 R1 这类推理模型。我见过太多团队把 90% 的请求都打到最贵的模型上。
- **批处理与错峰**:非实时任务(离线打标、语料清洗)排到夜间折扣时段,价格差可以直接折算成利润。
第 2 条我想多说一句。很多团队的 prompt 里没有任何长度约束,模型默认会输出一大段解释性文字。加一句"仅输出 JSON,不要任何解释",单次输出能从 800 tokens 压到 200 以内。这个改动几乎零成本,但省下的钱比折腾缓存还多。
价格的反转,和接下来该盯什么
2025 年 9 月是个有意思的月份。9 月 6 日 V3.1 把 chat 和 reasoner 合并成统一模型,同时取消了错峰优惠——表面看是变贵了,因为输出从 8 元调到了 12 元。
但三周后的 9 月 29 日,V3.2-Exp 直接把这套价格打到 输出 3 元、缓存命中 0.2 元。根据官方公告,这次降价幅度超过 50%,背后是稀疏注意力机制的引入带来的长文本推理效率提升。
从 2 月的"涨价"到 9 月的"降价",中间隔了七个月。这七个月里,DeepSeek 涨价前后价格对比的结论其实已经反转了:现在调用 deepseek-chat 的成本,比 2025 年 2 月优惠期结束时还要低。
不过话说回来,这种价格波动本身就是信号——模型厂商的定价能力,本质取决于推理侧的工程效率。稀疏注意力、KV Cache 压缩、MoE 路由优化,这些听起来很底层的东西,最终都会变成你账单上的数字。想持续跟踪这类技术变化,大模型推理成本优化手段盘点 这个方向值得长期关注。
关键要点速览
- 优惠期结束后,deepseek-chat 输出价格从 2 元涨到 8 元/百万 tokens,涨幅 300%;输入缓存命中价仅 0.5 元。
- 实际成本取决于缓存命中率,70% 命中率下涨价后单次成本约为优惠期的 3.07 倍,而非简单的 4 倍。
- 2025 年 9 月 29 日 V3.2-Exp 上线后,输出价格降至 3 元/百万 tokens,已低于 2 月涨价后的水平。
- 最划算的优化动作排序:约束输出长度 > 提高缓存命中率 > 模型分级路由 > 错峰批处理。
相关推荐
- **阅读相关专题**:想系统了解国产大模型的成本与性能取舍,可以浏览 VergeX 的大模型专题,我们持续跟踪各家 API 定价与推理优化进展。
- **查看工具推荐**:需要对比不同模型的实时价格与能力,欢迎访问 [VergeX AI 工具导航](https://nav.vergex.cn),里面整理了主流的模型 API 与开发工具入口。
- **订阅更新**:模型定价和技术报告更新频繁,建议订阅 VergeX 的更新推送,涨价降价这类消息第一时间就能收到。

