DeepSeek是什么时候推出的?从V1到R1时间线全梳理
我第一次被同事追着问「DeepSeek是什么时候推出的」,是2025年1月27日那天晚上。当时英伟达股价单日跌了将近17%,市值蒸发约5890亿美元(Bloomberg当日盘后统计),群里连做前端的同学都在问这家公司到底什么来头。那会儿我刚把一个内部知识库问答系统从某闭源模型切到DeepSeek-R1,切完的第二天就被人事拉着解释「为什么成本掉了一个数量级」。
这个问题看着简单,其实问的人背后通常藏着三个不同的诉求:有人想知道发布时间好判断技术代际,有人想确认版本号避免调错API,还有人只是想弄清楚「它是不是一夜之间冒出来的」。这篇文章我打算把时间线、技术转向和实际选型一次讲透,顺便把我踩过的坑也写进来。
核心结论摘要:DeepSeek(深度求索)公司成立于2023年7月,首个模型DeepSeek Coder与DeepSeek LLM 67B发布于2023年11月。真正引爆全球的是2024年12月26日发布的DeepSeek-V3和2025年1月20日发布的DeepSeek-R1。
先给答案:DeepSeek是什么时候推出的,关键节点一张表看完
如果只看一个日期,答案是2023年11月——这是DeepSeek第一批模型公开的时间。但如果问的是「大家嘴里那个DeepSeek」,那更准确的时间点应该是2024年12月26日(V3)和2025年1月20日(R1)。
| 时间 | 事件 | 关键规格 | 为什么值得记一笔 | | --- | --- | --- | --- | | 2023年7月 | 深度求索成立 | 幻方量化孵化 | 起点,团队来自幻方AI Lab | | 2023年11月 | DeepSeek Coder / DeepSeek LLM 67B | 67B稠密模型 | 首个开源系列,论文2024年1月挂上arXiv | | 2024年5月 | DeepSeek-V2 | 236B总参 / 21B激活 | 首次把MLA引入MoE架构,推理成本大幅下降 | | 2024年12月26日 | DeepSeek-V3 | 671B总参 / 37B激活 | 训练用278.8万H800 GPU小时,按官方口径约557.6万美元 | | 2025年1月20日 | DeepSeek-R1 | 基于V3基座 | 纯强化学习路线,MIT许可开源权重 | | 2025年9月17日 | R1论文登《Nature》封面 | 同行评审 | 主流大模型里少见的经过正式同行评审 | | 2025年8月起 | V3.1 / V3.2-Exp 迭代 | 混合推理、稀疏注意力 | 把「思考模式」和成本优化继续往前推 |
这张表里我特意保留了参数量和GPU小时数,因为很多人问「deepseek是什么时候推出的」,实际想确认的是「它到底是不是小作坊作品」。278.8万H800 GPU小时这个数字来自DeepSeek-V3技术报告(arXiv:2412.19437,2024年12月27日),不算小,但也确实比同期同级别模型的公开投入低得多——这才是当时引发震动的原因。
从V1到R1,这条时间线上真正发生了什么
时间点只是表象,版本之间的三次技术转向才是关键。我按自己的理解拆一下。
第一次转向:MLA把推理成本压下来
2024年5月的V2是个分水岭。多头潜在注意力(Multi-head Latent Attention,MLA)做的事说穿了就一句话:把KV Cache压缩到潜空间里存,推理时显存占用大幅下降。当时我在一台单卡A100上跑V2的量化版本,长上下文场景下的显存曲线比我预期平缓不少——这个体验比任何论文里的对比曲线都有说服力。不过话说回来,MLA的工程实现相当绕,想自己魔改推理框架的人要有心理准备。
第二次转向:671B的MoE与经济性
V3把总参数推到671B,但每个token只激活37B。这种稀疏激活是它成本可控的核心。训练侧官方用了FP8混合精度,报告里提到的流水线并行与通信优化,坦白讲是一套重工程轻算法的组合拳。它不优雅,但有效。
第三次转向:R1证明了纯RL路线能走通
2025年1月20日的R1是我个人认为最值得关注的一次发布。它没有走「先大量SFT再对齐」的常规路径,而是用强化学习直接激发出长链推理行为。根据发表在《Nature》上的R1论文(2025年9月17日),其训练成本在V3基座之上约为29.4万美元量级,这个数字在业内被反复引用。
有意思的是,R1发布后我最直观的感受不是「模型变聪明了」,而是「同一个问题它愿意花更长时间想」。这种「思考长度」的可控性,对做Agent编排的人来说是全新的设计变量。
为什么这个时间点值得深究:市场冲击与技术代际
把时间钉在2025年1月,还有一个现实原因:那是国产大模型第一次在应用层面真正出圈。Appfigures与Sensor Tower的监测数据显示,2025年1月下旬DeepSeek App在美区App Store免费榜登顶,超过了ChatGPT——这是中国AI应用少有的时刻。
但我不想把它讲成爽文。1月27日那波市场反应里,情绪放大的成分远大于基本面。一位做量化交易的朋友那晚跟我吐槽:真正让他们紧张的,不是某一个模型的跑分,而是「训练成本假设被公开挑战」这件事本身。
从技术代际角度看,DeepSeek的发布时间点踩得很准:2024年底正好是行业对「大模型训练成本能不能降一个数量级」争论最激烈的时候,它在12月底交出答卷,1月又用R1补上推理能力这块拼图。如果你正在写deepseek是什么时候推出的入门指南,我建议把这条因果链写进去,比单纯罗列日期有用得多。
实战使用教程:什么时候该用哪个版本
聊完历史,回到能落地的东西。我在项目里实际用过的组合大概是这样:
| 场景 | 推荐模型 | 理由 | | --- | --- | --- | | 常规对话、摘要、抽取 | deepseek-chat(V3系列) | 延迟低、成本低,够用 | | 数学、代码、多步推理 | deepseek-reasoner(R1系列) | 有显式思维链,准确率明显更高 | | 超长文档处理 | V3.2-Exp 及之后版本 | 稀疏注意力对长上下文更友好 | | 私有化部署 | 开源权重版本 | MIT许可,权重可下载 |
调用这块,DeepSeek的API兼容OpenAI协议,迁移成本极低。下面这段可以直接跑:
使用 OpenAI SDK 调用 DeepSeek API(DeepSeek 兼容 OpenAI 接口协议)
安装依赖:pip install openai
from openai import OpenAI
client = OpenAI( api_key="sk-你的DeepSeek密钥", # 在 platform.deepseek.com 申请 base_url="https://api.deepseek.com" # DeepSeek 的兼容端点 )
resp = client.chat.completions.create( model="deepseek-chat", # 通用对话;推理任务换成 deepseek-reasoner messages=[ {"role": "system", "content": "你是一名严谨的技术编辑"}, {"role": "user", "content": "用一句话说清 DeepSeek-V3 和 R1 的区别"} ], temperature=1.0, # 官方建议:通用对话 1.3,代码/数学类任务 0.0 stream=False )
deepseek-reasoner 会额外返回 reasoning_content 字段,注意别丢
print(resp.choices[0].message.content)
一个坑提前说:`deepseek-reasoner` 不响应 `temperature` 参数,设了也会被忽略,我当初在代码里写了个动态温度调节逻辑,结果排查了半天才发现问题出在这儿。
如果你还在纠结模型选型和API成本核算,可以先看看VergeX 的 AI 模型对比与工具导航,上面按任务类型做了分类,比翻各家文档快。
我看到的三个常见误区
误区一:把公司成立时间和模型发布时间混为一谈。 深度求索2023年7月成立,但第一个公开模型是2023年11月,中间隔了四个月——这在AI创业公司里算相当快了。
误区二:以为R1是V3的「升级版」。 严格说R1是基于V3基座做强化学习得到的推理特化模型,不是简单迭代。两者在不同任务上的表现差异很明显,混用会吃亏。
误区三:把开源等同于免费商用无限制。 权重是开源的,但部署算力、数据合规、服务稳定性都是你自己的事。我在一个客户项目里就遇到过「本地部署比调API还贵」的情况,671B的MoE模型对显存的要求不是闹着玩的。
总结与展望
回过头看,DeepSeek是什么时候推出的这个问题,答案其实有三层:2023年7月是公司起点,2023年11月是首个模型,2024年12月到2025年1月才是它真正改变行业认知的窗口。三个时间点对应三种不同的意义,别混。
往后看,V3.2-Exp引入的稀疏注意力、以及多模态方向的探索,说明这条技术路线还没走到头。对开发者来说,真正该关心的不是下一个版本什么时候发,而是「推理成本降下来之后,哪些之前不划算的场景现在能做了」——这个问题,比时间线本身有价值得多。
关键要点速览
- DeepSeek公司成立于2023年7月,首个模型发布于2023年11月
- DeepSeek-V3发布于2024年12月26日,训练约278.8万H800 GPU小时
- DeepSeek-R1发布于2025年1月20日,论文于2025年9月登上《Nature》封面
- `deepseek-chat` 适合通用任务,`deepseek-reasoner` 适合推理类任务,两者不可简单替换
- API兼容OpenAI协议,迁移成本低,但 `deepseek-reasoner` 忽略 temperature 参数
延伸阅读
- [国产大模型发展脉络专题](https://nav.vergex.cn)——按时间线整理的国内主流模型发布记录
- [VergeX AI工具导航](https://nav.vergex.cn)——覆盖模型API、推理框架、Agent编排工具
- [DeepSeek-V3 技术报告(arXiv:2412.19437)](https://arxiv.org/abs/2412.19437)——训练成本与架构细节的一手来源
相关推荐
- **阅读相关专题**:想继续深挖国产大模型的版本演进,可以关注站内「大模型时间线」系列,我们把每家的发布节奏和技术路线做了横向对照。
- **查看工具推荐**:需要做模型选型或API成本核算,直接去 [VergeX AI工具导航](https://nav.vergex.cn) 按任务类型筛选,比逐家翻文档省事。
- **订阅更新**:新模型发布后我们通常会在48小时内出实测记录,可以通过邮件或微信订阅,避免错过第一时间的成本对比数据。

