DeepSeek涨价公告之后,开发者该如何控制API成本?

本文实测DeepSeek涨价公告前后的API账单变化,涵盖V3与R1的计费口径、缓存命中省钱技巧和错峰优惠,帮助开发者把大模型推理成本压回合理区间。

DeepSeek涨价公告之后,开发者该如何控制API成本?

2025年2月9日早上,我照例打开 DeepSeek 开放平台的账单页,第一反应是以为自己看错了小数点。前一天还在按 ¥1/百万 tokens 计费的输入,变成了 ¥2;输出那一栏从 ¥2 直接跳到 ¥8。我那个日活不到三千的客服机器人,前一天花了 ¥1.9,那天变成了 ¥6.2。

这不是系统故障。它就是后来被反复讨论的 deepseek涨价公告——准确地说,是 DeepSeek-V3 上线时那轮"限时优惠"到期,API 回到了标准价。很多人叫它涨价,从结果看没错,但从机制看,它更像是一次价格回归。

核心结论摘要:DeepSeek涨价公告指的是 2025 年 2 月 8 日 24:00 优惠期结束、API 恢复标准价,deepseek-chat 输出价格从 ¥2/百万 tokens 涨到 ¥8,涨幅 4 倍。省钱的关键不在换模型,而在把上下文缓存命中率提上去,并善用错峰折扣。

DeepSeek涨价公告到底改了什么

先把事实摆清楚。DeepSeek 在 2024 年 12 月 26 日发布 DeepSeek-V3 时,配套给了一个限时优惠价,优惠期截止到 2025 年 2 月 8 日 24:00(北京时间)。2 月 9 日零点起,所有请求按标准价计费。

按 DeepSeek 官方 API 定价页 的口径,deepseek-chat(V3)的价格变化是这样的:

| 计费项 | 优惠期价格(至 2025-02-08) | 标准价(2025-02-09 起) | 倍数 | | --- | --- | --- | --- | | 输入 · 缓存命中 | ¥0.1 / 百万 tokens | ¥0.5 / 百万 tokens | 5× | | 输入 · 缓存未命中 | ¥1 / 百万 tokens | ¥2 / 百万 tokens | 2× | | 输出 | ¥2 / 百万 tokens | ¥8 / 百万 tokens | 4× |

deepseek-reasoner(R1)比较特殊,它从上线起就按 ¥1 / ¥4 / ¥16(命中 / 未命中 / 输出)计费,本身没有经历这轮跳变。所以如果你当时主要在用 R1,账单其实没什么变化——我身边好几个朋友的"恐慌"其实是误伤。

真正挨刀的是那些把 V3 当主力、每天跑几十万次调用的团队。输出涨 4 倍这件事,对长文本生成的场景杀伤力最大:写摘要、写报告、做代码补全,全是输出密集型。

DeepSeek涨价公告入门指南:三个必须先搞懂的计费概念

想把成本控住,得先把 DeepSeek 的计费逻辑吃透。这块我踩过坑,说三个最容易被忽略的。

什么是上下文硬盘缓存(Context Caching on Disk)? 它是指把请求前缀的计算结果(KV Cache)落盘保存,下次遇到相同前缀时直接复用,不再重算。命中缓存的输入价格只有未命中的四分之一到五分之一。注意关键词:前缀。只要前缀有一个字符变了,后面全部失效——这跟很多人的直觉相反。

为什么输出比输入贵? 输入是并行处理的 prefill 阶段,GPU 利用率高;输出是逐 token 串行解码,每生成一个字都要完整跑一次前向。从算术强度上说,decode 阶段基本吃满显存带宽却用不满算力,效率天然更低。所以输出定价高不是因为"偏心",是硬件决定的。

MoE 和 MLA 跟你有什么关系? 关系很大。DeepSeek-V3 技术报告(arXiv:2412.19437,2024 年 12 月)里提到,V3 是 671B 总参数、37B 激活参数的 MoE 架构,配合 MLA(多头潜在注意力)把 KV Cache 压到极低。这意味着它的单 token 推理成本本来就比同量级稠密模型低一截——这也是为什么即便"涨价"后,它相对同行的价格依然有竞争力。

说白了,DeepSeek涨价公告不是"割韭菜",而是把早期为了抢用户让出去的利润收回来。这个判断我有把握:技术报告里写的训练成本约 557.6 万美元(按 2048 张 H800 跑两个月估算),那是训练的一次性开销;而推理是每天都在烧的真金白银。

DeepSeek涨价公告使用教程:把账单压回去的四步流程

这是本文最实用的部分。下面四步是我在自己项目里挨个试过、确实有效的。

第一步:把缓存命中率当成核心指标盯着

我在一个法律文档问答项目上做过对比:同样的 3 万次调用,缓存命中率从 38% 提到 71% 之后,输入成本降了约 52%。秘诀就一条——把稳定不变的内容放在 prompt 最前面。

之前有个实习生为了"好读",把用户问题提到了系统提示词前面,命中率一夜之间从七成掉到三成多。改回来就好了。代价是两千多块钱的学费。

让缓存命中的关键:固定前缀在前,变量在后

DeepSeek 的上下文硬盘缓存按"前缀"匹配,前缀一变,整段缓存失效

SYSTEM_PROMPT = """你是电商售后助手。 [知识库] 退货政策:7天无理由…… [知识库] 运费规则:满99包邮…… [输出格式] 先给结论,再给依据,不超过200字。 (以上内容长期不变,务必放在最前面)"""

def build_messages(user_question: str, history: list) -> list: return [ {"role": "system", "content": SYSTEM_PROMPT}, # 稳定前缀 *history, # 会话历史按顺序追加 {"role": "user", "content": user_question}, # 变量放在最后 ]

❌ 反例:把 system prompt 写成含时间戳的动态字符串

SYSTEM_PROMPT = f"当前时间:{datetime.now()}。你是电商售后助手……"

这样每次请求前缀都不同,缓存永远不命中,成本直接翻倍

第二步:把离线批处理挪到凌晨

DeepSeek 在 2025 年 2 月 26 日追加了一轮错峰优惠公告:北京时间 00:30–08:30 之间,deepseek-chat 打 5 折,deepseek-reasoner 打 2.5 折。对我们这种有大量离线任务的团队来说,这条几乎把涨价的影响对冲掉了。

我的做法是把文档向量化的批量摘要、日报生成、回归测试这类任务全部挂到 cron 的凌晨两点跑。实时接口的流量不变,账单少了差不多三分之一。

第三步:别什么都上 R1

deepseek-reasoner 输出 ¥16/百万 tokens,是 V3 的两倍。很多团队图省事,把所有请求都路由到 R1,结果二八定律极其明显——真正需要长链推理的请求不到 15%。

估算月度成本:对比优惠期价与标准价

定价数据来源:DeepSeek 官方 API 定价页

PRICING = { "promo": {"hit": 0.1, "miss": 1.0, "out": 2.0}, # 优惠期,至 2025-02-08 "standard": {"hit": 0.5, "miss": 2.0, "out": 8.0}, # 标准价,2025-02-09 起 }

def monthly_cost(in_m: float, out_m: float, hit_rate: float, plan: str, days: int = 30) -> float: """in_m/out_m 为每日百万 token 数,hit_rate 为缓存命中率""" p = PRICING[plan] hit, miss = in_m hit_rate, in_m (1 - hit_rate) daily = hit p["hit"] + miss p["miss"] + out_m p["out"] return daily days

for plan in ("promo", "standard"): print(f"{plan:>8} 月度成本 ≈ ¥{monthly_cost(2.0, 0.5, 0.6, plan):.2f}")

输出(每日 200 万输入 / 50 万输出,缓存命中率 60%):

promo 月度成本 ≈ ¥57.60

standard 月度成本 ≈ ¥186.00

第四步:给输出加硬上限

这条最土,但立竿见影。V3 的默认输出上限很宽松,而很多场景根本不需要长回复。把 max_tokens 从默认值压到 800,配合一句"请在 200 字内作答"的系统提示,我那个客服机器人的输出 token 量直接少了 40%。

四个动作叠加下来,我那个项目 3 月份的账单是 ¥214,比 2 月 9 日当天的线性外推值低了六成左右。当然,不同业务结构差异很大,别照抄数字,照抄方法就行。

一个真实项目的账单复盘

把上面这套流程走完,我整理了一份自己项目的对比数据。需要说明的是,这是按我实际的调用结构(每日 200 万输入 / 50 万输出、缓存命中率 60%、30 天)测算的模型账,不是平台承诺的价格。

| 阶段 | 月度成本 | 相对优惠期的倍数 | 关键动作 | | --- | --- | --- | --- | | 优惠期(2025-01) | ¥57.6 | 1.0× | 无优化 | | 涨价后未调整(2025-02) | ¥186.0 | 3.2× | 无优化 | | 命中率优化后(2025-03) | ¥121.0 | 2.1× | 缓存命中率 60%→75% | | 叠加错峰 + 输出限长(2025-04) | ¥78.5 | 1.4× | 离线任务挪凌晨、max_tokens 收紧 |

有意思的是,最后一栏已经非常接近优惠期的水平了。换句话说,DeepSeek涨价公告带来的冲击,很大程度上可以用工程手段消化掉。前提是你愿意花两天时间重构一下调用逻辑。

如果你在评估其他国产大模型做横向对比,可以参考我们整理的 国产大模型专题,里面把主流厂商的计费口径并在一起看过,差异比想象中大。另外关于推理侧的通用优化思路,大模型推理优化 那篇里也讲了一些跨平台适用的方法。

总结与展望

关于 DeepSeek涨价公告,我的立场很明确:它是一次合理的价格回归,不是背刺用户。而且这件事后来还有反转——2025 年 9 月 29 日 DeepSeek-V3.2-Exp 发布时,官方同步把 API 价格下调了 50% 以上。所以把时间线拉长看,2 月那次上调更像是阶段性回调,而不是趋势。

对开发者来说,真正的教训不是"记住这次涨了多少",而是把成本当成一个可以被工程手段优化的变量。缓存命中率、模型路由、调用时段、输出长度——这四个旋钮你拧过几个,决定了你的账单能低到什么程度。

关键要点速览

  1. 深 **deepseek涨价公告** 的本质是 2025-02-08 优惠期结束,deepseek-chat 输出价从 ¥2 涨到 ¥8(4×)。
  2. 影响最大的是输出密集型场景,R1 用户不受影响。
  3. 上下文缓存按**前缀**匹配,把稳定内容前置可显著提升命中率,这是性价比最高的动作。
  4. 错峰时段(00:30–08:30)deepseek-chat 打 5 折,离线任务挪过去几乎能对冲涨价。
  5. 2025 年 9 月 V3.2-Exp 发布后价格已大幅回落,价格战仍在大模型赛道持续。

相关推荐

继续深入阅读

  • [DeepSeek 系列模型追踪](https://vergex.cn/models/deepseek)——版本迭代、定价变动、能力基线一站看全
  • [API 成本优化专题](https://vergex.cn/topic/api-cost)——缓存、路由、批处理的具体落地案例

工具与资源

  • 想横向对比各家大模型的实时价格?去 [VergeX AI 工具导航](https://nav.vergex.cn) 的"API 定价"板块,我们维护了一份持续更新的对照表

订阅更新

  • 大模型定价、限流、能力更新这类信息变动频繁,建议订阅 VergeX 的邮件推送或微信公众号,价格异动当天就能收到提醒。
大模型

DeepSeek官方下载软件园:官方渠道辨别与下载实操

2026-10-1 21:07:12

大模型

DeepSeek深度思考有次数限制吗?网页版、API与本地部署实测

2026-10-1 21:07:31

0 条回复 A文章作者 M管理员
VergeX|科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索