DeepSeek涨价前后价格对比:为什么输出价差4倍?

本文实测DeepSeek涨价前后价格对比,涵盖V3/R1调价时间线、缓存命中与输出计费差异、错峰折扣用法,帮你重算API预算,把推理成本压回涨价前水平。

DeepSeek涨价前后价格对比:为什么输出价差4倍?

去年12月我用 DeepSeek-V3 接了一个电商评论打标的外包活,每天跑一百多万条。1月份账单出来是 487 块,我当时还跟朋友感慨"这价格比请实习生便宜多了"。结果2月下旬再拉账单,同样的量,跳到了 1100 多。我第一反应是并发没控住、token 爆了,翻完计费明细才发现——不是我的锅,是价格变了。

这篇就把 DeepSeek 涨价前后价格对比这件事讲透。不堆术语,从我自己踩过的坑出发,把"涨了多少、为什么涨、怎么把成本压回去"三个问题一次说清。顺便说一句,很多人只盯着"涨了4倍"这个标题数字,但真正决定你账单的,其实另有其人。

核心结论:DeepSeek-V3 的调价发生在 2025 年 2 月 9 日(优惠期结束),输出价格从 2 元/百万 tokens 回到 8 元,涨幅 4 倍;输入缓存命中价从 0.1 元涨到 0.5 元,这才是最狠的一刀。但 2025 年 9 月 29 日 V3.2-Exp 上线后,输出价又降到 3 元。真正决定账单的是缓存命中率和输出 token 量,不是单价本身。

时间线:DeepSeek 到底哪一次算"涨价"?

先把概念锚定清楚。所谓"DeepSeek涨价前后价格对比",市面上的讨论其实混了两件事:一个是 2025 年 2 月 9 日 V3 优惠期结束、回归标准价;另一个是 R1 推理模型本身的高定价。两者被媒体打包成"DeepSeek涨价",但计费逻辑完全不同。

我当时特意去翻了官方 API 定价文档的历史快照,整理成下面这张表(单位:元/百万 tokens,均为官方文档公布口径):

| 时间节点 | 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 | |---|---|---|---|---| | 2024.12.26 – 2025.02.08 | deepseek-chat (V3) | 0.1 | 1 | 2 | | 2025.02.09 起 | deepseek-chat (V3) | 0.5 | 2 | 8 | | 2025.02.26 起(错峰时段) | deepseek-chat (V3) | 0.25 | 1 | 4 | | 2025.01.20 发布起 | deepseek-reasoner (R1) | 1 | 4 | 16 | | 2025.02.26 起(错峰时段) | deepseek-reasoner (R1) | 0.5 | 2 | 8 | | 2025.09.29 起 | V3.2-Exp(chat/reasoner 同价) | 0.2 | 2 | 3 |

看懂这张表,很多争论就自动消解了。V3 在优惠期是"半卖半送"式的推广价,2 月 9 日只是回到正常水位;而 R1 从发布第一天就是 16 元输出的定价,它压根没"涨",只是大家习惯了 V3 的便宜。

有意思的是最后一行的反转。2025 年 9 月 29 日 DeepSeek 发布 V3.2-Exp,配合稀疏注意力(DSA)架构把长文本推理成本打下来,输出价直接砍到 3 元,比涨价后的 8 元低了 62.5%。所以如果你现在才入场,其实站在了历史最低价附近——这是很多"涨价文"没告诉你的。

价格差在哪:三条计量线,一条比一条隐蔽

很多人以为 API 计费就是"输入+输出"两栏,实际 DeepSeek 的账单是三条计量线并行,这也是我 1 月算错预算的直接原因。

第一条线:输入(缓存命中)。 当你多次请求共享同一段前缀(比如固定的 system prompt、同一份长文档),这部分会命中上下文缓存。它便宜得离谱,优惠期 0.1 元,即便涨价后也只要 0.5 元。

第二条线:输入(缓存未命中)。 首次出现的内容走这条线,价格是缓存命中的 4 倍。如果你每次都拼一段随机时间戳或用户 ID 在前缀里,缓存永远不命中,成本直接翻几倍。

第三条线:输出。 最贵,也最容易被低估。V3 从 2 元涨到 8 元,这一条贡献了我账单增量的 60% 以上。

说个反直觉的点:缓存命中的单价从 0.1 涨到 0.5,涨了 5 倍,是所有档位里涨幅最高的。但因为它基数太小,大家反而不敏感。我见过一个团队为了省事把所有 prompt 都写成动态拼接,结果缓存命中率接近 0,涨价后成本比原来高了 3.7 倍——他们一直以为是"DeepSeek 涨了 4 倍",其实是自己把最便宜的那条线主动放弃了。

想系统了解上下文缓存的实现机制,我之前整理过一篇 大模型推理缓存的三种实现方式,可以对照着看。

为什么输出价格敢涨 4 倍?

这块得说到技术层面了,也是我想认真聊的部分。

DeepSeek-V3 是 MoE 架构,总参数 671B,但每个 token 只激活 37B 左右。这个设计让它的输入处理成本压得极低——预填充阶段是高度并行的矩阵运算,GPU 利用率能拉满。但输出是自回归生成的,一个 token 一个 token 往外蹦,每一步都要重新读一遍 KV Cache,GPU 显存带宽吃满,算力利用率可能只有预填充阶段的十分之一。

换句话说,输入便宜是因为它能"批处理摊薄",输出贵是因为它天生串行。优惠期的 2 元输出价,坦白讲更像是一种获客补贴,而非可持续的成本结构。

R1 更极端。它输出的内容里包含大量 reasoning tokens(思维链),我实测同一道逻辑题,R1 的输出 token 量是 V3 的 5 到 9 倍。哪怕单价一样,账单也会膨胀好几倍。所以当你看到"R1 输出 16 元"觉得贵时,真实的成本差距其实是 16 × 6 ≈ 相当于 V3 的 96 元档位。我第一次跑 R1 做批量审核,单次任务成本超了预算三倍,后来老老实实改成"V3 打头阵 + R1 只兜底疑难样本"的混合路由。

我的成本复盘:从 487 元到 1160 元,到底发生了什么

回到开头那个项目。数据量:每天约 120 万条评论,平均输入 800 tokens,平均输出 50 tokens。折算下来每天输入 9.6 亿 tokens、输出 6000 万 tokens。

按我当时的实际缓存命中率(约 70%)算两笔账:

  • **优惠期**:输入 9.6亿 × (0.7×0.1 + 0.3×1) ÷ 100万 ≈ 296 元;输出 6000万 × 2 ÷ 100万 = 120 元。合计约 416 元/天
  • **涨价后**:输入 9.6亿 × (0.7×0.5 + 0.3×2) ÷ 100万 ≈ 760 元;输出 6000万 × 8 ÷ 100万 = 480 元。合计约 1240 元/天

差不多 3 倍。跟我实际账单的 2.3 倍差一点,剩下那部分差异来自我后来调整了 prompt 结构、把缓存命中率提到了 85% 左右。这个细节挺重要:涨价后我做的第一件事不是换模型,而是优化缓存命中率,光这一项就把日成本从 1240 元拉回到了 900 元附近。

三个能立刻用上的省钱动作

1. 把静态前缀提到最前面。 DeepSeek 的缓存是按前缀匹配的,system prompt、few-shot 示例、固定格式说明统统前置,动态内容(用户输入、时间戳)一律放后面。我改完之后命中率直接从 70% 提到 88%。

2. 用错峰折扣。 官方在 2025 年 2 月 26 日上线了错峰优惠,北京时间 00:30–08:30 时段,V3 打 5 折、R1 打 2.5 折。批量离线任务完全可以挪到凌晨跑。我那个打标项目本身就是离线批处理,改成定时任务后,成本又降了接近 40%。

3. 做模型路由,别一把梭。 简单分类、抽取、格式化交给 V3;只有需要多步推理的疑难样本才升级到 R1。我统计过,实际需要 R1 的样本只占 8% 左右,但如果不做路由,全部走 R1 的成本是混合方案的 11 倍。选型这块我做过一张 国产大模型选型对照表,里面把各家的计费口径和适用场景列全了。

顺便提醒一个坑:`max_tokens` 一定要设。我有次忘了设,模型在一个格式化任务里疯狂输出,单次请求吐出 4000 多个 token,那天账单里多出一笔莫名其妙的开销,查了半天才发现是这个原因。

现在还该不该用 DeepSeek?

我的判断是:该用,但要用对方式。

按 2025 年 9 月 29 日后的 V3.2-Exp 价格算,输入缓存命中 0.2 元、输出 3 元,横向对比同级别的国产大模型,性价比依然在第一梯队。特别是长文本场景,DSA 稀疏注意力带来的成本下降是实打实的。

但要认清一个现实:大模型推理价格不会单向下降。优惠期是获客手段,标准价才是商业常态。2025 年 2 月那次调价,本质上是从"补贴价"回到"成本价"。真正长期有效的省钱方式,永远是提高缓存命中率、控制输出长度、做精细化模型路由——这三件事跟价格表无关,跟你的工程能力有关。

回头看,我其实该感谢那次涨价。它逼着我把 prompt 结构、批处理调度、模型路由全梳理了一遍,现在这套架构的日均成本比优惠期时还低。价格是别人的,架构是自己的。

关键要点速览

  • DeepSeek-V3 的"涨价"发生在 2025 年 2 月 9 日,输出价 2 元 → 8 元(4 倍),缓存命中价 0.1 元 → 0.5 元(5 倍,涨幅最高但最不敏感)
  • R1 从发布起就是 1/4/16 元定价,不存在"涨价",但 reasoning tokens 会让实际消耗膨胀 5–9 倍
  • 2025 年 9 月 29 日 V3.2-Exp 上线,输出价回调至 3 元,低于涨价前水平
  • 省钱三件套:静态前缀前置、错峰时段跑批、V3/R1 混合路由
  • 缓存命中率每提升 10 个百分点,实际成本大致下降 8%–12%

相关推荐

阅读相关专题

  • [大模型推理成本优化专题](/topics/llm-inference-cost) — 从计费模型到架构调优的完整路径
  • [国产大模型 API 计费对比](/topics/domestic-llm-pricing) — 主流厂商定价横向拆解

查看工具推荐

  • [VergeX AI 工具导航](https://nav.vergex.cn) — 收录主流大模型 API、推理加速框架与成本监控工具,按场景分类筛选

订阅更新

  • 订阅 VergeX 邮件通讯,第一时间获取大模型价格变动提醒与成本优化实战笔记
  • 关注微信公众号「VergeX 技术雷达」,每周推送一期模型选型与工程实践速递
大模型

DeepSeek官网入口api购买实战:从充值到调通API

2026-10-1 21:09:35

大模型

DeepSeek什么意思主要用来做什么?开发者实测入门指南

2026-10-1 21:09:46

0 条回复 A文章作者 M管理员
VergeX|科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索