deepseek是什么公司开发的?一次讲透团队与技术路线
上周三晚上,一个做金融风控的朋友突然给我发消息:deepseek是什么公司开发的,怎么感觉一夜之间全世界都在聊它?说实话,这个问题我 2024 年 5 月就被问过一轮——当时 DeepSeek-V2 刚发布,把 API 价格砸到 GPT-4 Turbo 的百分之一量级,我在群里还吐槽"又一家烧钱的主"。
结果 2025 年 1 月 R1 刷屏、App 登顶美区 App Store 免费榜,连英伟达股价都跟着单日大跌,我才意识到自己低估了这家公司。所以这篇文章我打算把"deepseek是什么公司开发的"这个问题彻底讲清楚,顺带把它的技术底牌和我自己的使用经验一并摊开。
核心结论摘要:DeepSeek 由杭州深度求索人工智能基础技术研究有限公司开发,2023 年 7 月由梁文锋在杭州创立,母公司背景是国内头部量化私募幻方量化。代表作品包括 DeepSeek Coder、V2、V3 和 R1,走的是一条"小团队 + 极高算力效率"的路线。
一、deepseek是什么公司开发的?先给一个直接答案
直接说结论:开发方是杭州深度求索人工智能基础技术研究有限公司,业内一般简称"深度求索",英文名 DeepSeek。它跟"幻方量化"是两套独立的主体,但血缘关系很近——幻方是出资方和算力基础的提供者。
我把关键信息整理成一张表,方便你一眼看完:
| 项目 | 信息 | | --- | --- | | 公司全称 | 杭州深度求索人工智能基础技术研究有限公司 | | 成立时间 | 2023 年 7 月 | | 创始人 | 梁文锋(同时也是幻方量化创始人) | | 股东背景 | 幻方量化(High-Flyer Quant)体系 | | 总部所在地 | 浙江杭州 | | 团队规模 | 百人量级,以本土应届生和年轻研究员为主 | | 代表模型 | DeepSeek Coder、DeepSeek-V2、V3、R1 |
有个细节挺反常识:这家公司几乎没有从海外大厂挖"明星科学家"。2024 年 12 月 V3 技术报告(arXiv:2412.19437)里的作者名单,绝大多数是本土培养的年轻研究员,博士毕业两三年的居多。梁文锋在几次公开采访里也提过,他更倾向于招"刚毕业、没被既有范式框住"的人。
二、一家量化私募,为什么要去做大模型
这个问题我琢磨了很久。表面看是跨界,实际上是同一条技术路线的延伸。
幻方从 2019 年前后就开始囤 GPU,2020 年建了千卡 A100 集群,2021 年规模进一步扩大。做量化交易的人对算力效率的敏感度,跟做大模型训练的人其实是同一套肌肉——都是在有限算力下压榨出更高的产出比。
梁文锋的逻辑大致是这样的:量化交易的天花板受限于市场容量,而 AGI 的天花板高得多;既然手里已经有集群和工程能力,为什么不试试?
我的判断是,这个"非典型出身"恰恰是 DeepSeek 能做出成本奇迹的原因之一。传统 AI 实验室习惯了"堆卡堆数据",而量化出身的团队天然会把每一次 GPU 小时当成真金白银在算。
三、技术路线拆解:V3 和 R1 到底做对了什么
先给一张版本演进表,后面再逐条拆:
| 发布时间 | 模型 | 关键参数 | 标志性意义 | | --- | --- | --- | --- | | 2023 年 11 月 | DeepSeek Coder | 1B–33B 多规格 | 从代码能力切入市场 | | 2024 年 5 月 | DeepSeek-V2 | 236B 总参 / 21B 激活 | MLA + MoE 组合,触发国内 API 价格战 | | 2024 年 12 月 | DeepSeek-V3 | 671B 总参 / 37B 激活 | 训练成本约 557.6 万美元 | | 2025 年 1 月 | DeepSeek-R1 | 基于 V3 基座 | 纯强化学习路线,对标 o1 级推理 |
MLA:把 KV Cache 压下去
MLA 是指多头潜在注意力机制(Multi-head Latent Attention),核心思路是把 Key/Value 投影到一个低维潜在空间再缓存。根据 V2 技术报告,这一改动让推理阶段的 KV Cache 减少约 93%,吞吐量提升数倍。
这不是那种"论文里好看、工程上难落地"的优化——它直接决定了 API 能不能卖那么便宜。我在本地用 vLLM 部署 7B 蒸馏版时也验证过,开不开 MLA 类优化,显存占用差得非常明显。
DeepSeekMoE:细粒度专家 + 共享专家
传统 MoE 的问题是专家负载不均、路由塌缩。DeepSeek 的做法是把专家切得更细(细粒度专家分割),再单独留一批"共享专家"处理通用知识。V3 总共 671B 参数,但每个 token 只激活 37B 左右——这意味着推理时你只付 5% 左右的算力成本。
关于不同国产大模型的架构取舍,我在这篇国产大模型技术路线对比里做过横向梳理,有兴趣可以对照着看。
FP8 训练和 MTP:把成本压到 557.6 万美元
V3 技术报告里最炸裂的一个数字是:整轮预训练只用了 278.8 万 H800 GPU 小时,按每 GPU 小时 2 美元估算,总成本约 557.6 万美元。作为对比,同级别的稠密模型训练成本通常在数千万美元量级。
它怎么做到的?主要靠三件事:FP8 混合精度训练(配合细粒度量化策略保证稳定性)、MTP 多 token 预测(一次预测多个未来 token,提升数据效率)、以及 14.8T tokens 的高质量预训练数据。当然,这个数字不含前期架构探索和失败实验的开销,别把它当成"从零到 V3 全部只花 557 万美元"。
R1:不用 SFT 冷启动的纯强化学习
2025 年 1 月发布的 R1 系列(论文 arXiv:2501.12948)里,最有意思的是 R1-Zero 这条线:完全跳过监督微调,直接在基座模型上跑强化学习。用的是自研的 GRPO 算法,去掉了 PPO 里那个和策略模型同规模的 critic 网络,显存开销直接砍半。
结果是模型自己涌现出反思、自我验证、长链推理这些行为。R1-Zero 在 AIME 2024 上的 pass@1 是 71.0%,加上冷启动数据和多阶段训练的正式版 R1 达到 79.8%,MATH-500 拿到 97.3%——这两个数字跟 OpenAI o1-1217 已经在一个水平线上。
坦白讲,R1-Zero 那部分论文我反复读了三遍。它的意义不在于分数,而在于证明了"推理能力可以不靠人类标注的思维链教出来"。这个结论如果站得住,整个后训练范式的成本结构都要重算。
四、我自己怎么用:接入和部署的实操建议
理论说够了,聊聊落地。
最省事的方式是调 API。DeepSeek 的接口兼容 OpenAI SDK,改两行就能迁移:
from openai import OpenAI
client = OpenAI( api_key="你的 DeepSeek API Key", base_url="https://api.deepseek.com" # 兼容 OpenAI 协议,无需换 SDK )
resp = client.chat.completions.create( model="deepseek-reasoner", # R1 推理模型;通用对话用 deepseek-chat messages=[ {"role": "system", "content": "你是一名简洁的技术助理"}, {"role": "user", "content": "用一句话解释 MoE 架构的核心优势"} ], stream=False )
推理模型会把思维链单独放在 reasoning_content 字段里
print(resp.choices[0].message.reasoning_content) print(resp.choices[0].message.content)
几个我踩过的坑,顺手记下来:
- `deepseek-reasoner` 不支持 `temperature`、`top_p` 这类采样参数,传了会报错;
- 思维链内容在 `reasoning_content` 里,别指望在 `content` 中拿到;
- 多轮对话时不要把上一轮的 `reasoning_content` 塞回上下文,会显著推高 token 消耗。
如果要私有化部署,7B/14B 的蒸馏版可以直接用 Ollama 拉起,32B 以上建议走 vLLM 或 SGLang。具体的显存估算和并发调优,我整理在大模型推理部署实践这篇里了。
五、几个容易搞混的问题
DeepSeek 是幻方量化吗? 不是。幻方是量化私募,深度求索是独立注册的 AI 研究公司。两者共享创始人,但业务、团队、法律主体都是分开的。
模型开源到什么程度? V3 和 R1 的权重都开放下载。R1 采用 MIT 许可证,商用门槛极低;V3 用的是自家的模型许可,允许商用但要求在衍生品中标注来源。代码仓库基本是 MIT。跟"只放论文不放权重"的路线完全不是一回事。
"深度求索"和"深度求索智能"是同一家吗? 市面上确实有名称相近的其他主体,认准杭州深度求索人工智能基础技术研究有限公司这个全称比较稳妥。
六、总结与学习路径
回答最初的问题:deepseek是什么公司开发的?答案是杭州一家由量化基金孵化、成立不到三年、团队规模百人量级的公司。它靠 MLA、DeepSeekMoE、FP8 训练这些工程优化把成本打下来,又靠 R1 的纯强化学习路线证明了推理能力的另一种可能。
如果你想深入,我建议按这个顺序读:
- 先读 DeepSeek-V2 论文,理解 MLA 和 MoE 的动机;
- 再读 V3 技术报告(arXiv:2412.19437),重点看训练成本和 FP8 细节;
- 最后啃 R1 论文(arXiv:2501.12948),关注 GRPO 和 R1-Zero 的涌现现象;
- 动手跑一遍蒸馏版模型,体感比读十遍论文都强。
关键要点速览:
- DeepSeek 的开发方是杭州深度求索人工智能基础技术研究有限公司,2023 年 7 月成立,创始人为梁文锋
- 与幻方量化为同一创始人的关联主体,但业务和法律主体独立
- V3 总参数 671B、激活 37B,预训练成本约 557.6 万美元(278.8 万 H800 GPU 小时)
- R1 用 GRPO 实现纯强化学习推理,AIME 2024 pass@1 达 79.8%
- R1 权重采用 MIT 许可证,商用门槛极低
相关推荐
- **阅读相关专题**:[VergeX 大模型技术专题](https://vergex.cn/topic/llm),持续跟踪 V3、R1 后续版本与国产大模型横向评测
- **查看工具推荐**:访问 [VergeX AI工具导航](https://nav.vergex.cn),我们整理了国内可用的大模型 API、本地部署工具与推理框架清单
- **订阅更新**:关注 VergeX 的邮件订阅或 RSS,每周推送一次大模型领域的关键版本发布与论文速读

