核心结论:DeepSeek 至今没有引入外部融资,也就不存在公开市场估值。市面上所有「deepseek创始人身价」的数字,本质都是用梁文锋在幻方量化的持股比例乘以一个假设倍数反推出来的——口径差一倍,结论就能差出几百亿。
2025年1月27日那天晚上我正对着屏幕,看着英伟达单日跌幅一路扩大到接近17%,市值一天蒸发约5890亿美元。朋友圈里讨论的不是显卡,而是一个名字:梁文锋。
那阵子几乎每天都有媒体在问同一个问题:deepseek创始人身价多少亿?说实话,我一开始也以为这是个能一句话回答的问题。翻了两天公开资料之后我发现,这问题根本没有标准答案——不是没人算,而是大家用的口径差得太远。
梁文锋是谁:先把人和公司捋清楚
先把基本盘说清楚,不然后面所有数字都是空中楼阁。
梁文锋 1985 年出生在广东湛江吴川,浙江大学电子信息工程本科、信息与通信工程硕士,2010 年毕业。他的第一段职业经历其实是做量化交易,2015 年与合伙人共同创立幻方量化(杭州幻方科技/浙江九章资产),2021 年前后管理规模突破千亿人民币,是国内最早一批进入千亿俱乐部的量化私募。
然后是关键转折:2023 年,他在幻方体系内孵化了 DeepSeek(杭州深度求索),2024 年 12 月 26 日发布 DeepSeek-V3,2025 年 1 月 20 日发布 DeepSeek-R1。R1 采用 MIT 许可开源,模型权重直接放上 Hugging Face,这在当时是相当激进的一步。
这里有个很多人忽略的点:DeepSeek 不是梁文锋"二次创业"融了钱做的公司,它从第一天起就是幻方自有资金在养。 这意味着没有 VC 定价、没有 D 轮估值、没有招股书——而这三样东西恰恰是算身价的标准工具。
为什么「deepseek创始人身价」没有标准答案
身价这个词,严格对应的财务概念是"净资产净值"(net worth),指的是一个人名下可交易资产减去负债后的公允价值。注意"公允价值"三个字,它要求资产有市场报价或者可参照的成交价格。
问题就出在这儿。梁文锋的财富主要压在两家非上市公司上:
- **幻方量化**:私募股权,没有公开交易价格,只能拿管理规模做倍数推算;
- **DeepSeek**:连融资都没有,估值完全是想象空间。
我在自己的笔记里把媒体常见的算法归纳成了三种,差异大得有点离谱:
| 估算口径 | 核心假设 | 得出的量级 | 主要问题 | |---|---|---|---| | 仅算幻方股权 | 管理规模 × 私募股权估值倍数(5%~15%)× 持股比例 | 数十亿人民币到百亿人民币 | 忽略了深度求索这块资产 | | 幻方 + DeepSeek 打包 | 给 DeepSeek 一个对标 OpenAI 的估值 | 数百亿到上千亿人民币 | DeepSeek 没有收入模型可锚定,纯拍脑袋 | | 榜单机构口径 | 按可验证的工商股权穿透计算 | 相对保守 | 更新慢,且不反映未融资资产 |
据胡润研究院《2025 胡润全球富豪榜》(2025 年 3 月发布)的公开口径,梁文锋首次上榜,财富量级约在数百亿人民币区间。而彭博社在 2025 年 1 月的报道中给出的推算则在数十亿美元量级。两个数字看着差不多,但背后一个按人民币股权穿透、一个按美元资产折算,中间还夹着汇率和管理规模缩水的时间差——光是"哪一天算"这个变量,结果就能差出三成。
决定身价量级的,其实是三个技术变量
讲钱之前先说技术,因为这家公司的估值逻辑确实和别家不一样。DeepSeek 值不值钱,很大程度上取决于它的技术路线能不能持续压低成本。
第一个变量:大模型训练成本的量级。
根据 DeepSeek-V3 技术报告(arXiv:2412.19437,2024 年 12 月),V3 的完整训练消耗约 278.8 万 H800 GPU 小时,按每小时 2 美元的租金折算,总成本约 557.6 万美元。这个数字当年被反复引用,但它有个前提——它只算了最终那次正式训练的算力开销,不含前期架构探索、消融实验和数据清洗。我在做推理成本测算的时候踩过这个坑,直接拿论文里的数字当"总研发投入"去和友商对比,结论会严重失真。
第二个变量:大模型推理效率带来的商业想象力。
训练便宜只是一半,推理便宜才是能赚钱的那一半。DeepSeek-V3 用的是 MoE 架构,671B 总参数、每个 token 激活 37B,加上 MLA 注意力机制压低 KV Cache 占用。这套组合的意义在于:同样一张卡,能服务的并发请求更多。对一家不靠融资的公司来说,推理成本直接决定了它能不能自己养活自己。
第三个变量:国产大模型的稀缺性溢价。
这个不太好量化,但在估值里占比不小。国产大模型在中文语料、合规部署、私有化交付上有天然优势,而这些恰好是政企客户的刚需。多模态大模型方向 DeepSeek 的节奏相对克制,直到后面才补齐视觉能力,这也让它在"全模态"叙事上少了一块故事。
我把这三个变量写成了一个粗糙的敏感性脚本,用来直观感受口径差异有多大(注意:这不是精算工具,只是把假设摆到明面上):
一个把"估值假设"显式化的敏感性分析脚本
数据均为公开报道口径,仅用于观察参数如何影响结果
aum = 600 # 幻方量化管理规模(亿元人民币),随市场波动 stake = 0.76 # 媒体估算的梁文锋持股比例 multiples = [0.05, 0.10, 0.15] # 私募股权估值 / 管理规模的倍数假设
for m in multiples: company_value = aum m # 公司层面的推算估值 personal_value = company_value stake # 折算到个人持股 print(f"倍数 {m:.0%} → 公司估值 {company_value:.0f} 亿 → 个人持股约 {personal_value:.0f} 亿")
跑一遍你就明白了:管理规模不变、持股比例不变,仅仅把估值倍数从 5% 调到 15%,个人数字就能翻三倍。这就是"deepseek创始人身价多少亿"这个问题最诚实的答案——它取决于你愿意相信哪个倍数。
我的判断:哪些数字能看,哪些当故事听
坦白讲,我对市面上绝大多数"身价 XX 亿"的标题都持保留态度,包括一些看起来很权威的榜单。原因很简单,未上市资产的价格是谈出来的,不是算出来的。
但有几件事我觉得是比较扎实的:
- **持股比例比估值倍数重要得多。** 梁文锋在幻方体系里是控股方,这一点基本没有争议;而 DeepSeek 的股权结构相对简单,没有被稀释过多轮,这也是媒体统一采用约 76% 这个口径的原因。
- **管理规模会缩水。** 2021 年的千亿规模和后来的规模之间有明显回落,任何静态数字都会过时。
- **开源策略是有代价的。** R1 用 MIT 许可放出来,短期看是放弃了 API 独占溢价,但换来的是生态位和人才吸引力。这笔账我认为长期是赚的,但它在当期财报上体现为"少赚的钱"。
如果你要引用这个数字,我建议的做法是:永远带上口径和时间点,比如"按 2025 年 3 月某榜单的口径"或者"按彭博社 2025 年 1 月的推算"。不带口径的身价数字,本质上和算命差不多。
顺着这条线往下研究的话,我建议按这个顺序走:先搞清楚 MoE 和 MLA 到底怎么省算力,再去看推理侧的工程优化,最后回来看商业模式——这样你就不会被人云亦云的估值故事带跑。VergeX 上整理的国产大模型技术报告合集里有 DeepSeek 系列论文的索引,比零散找 PDF 省事。
关键要点速览
- DeepSeek 无外部融资,**不存在公开估值**,所有身价数字都是反向推算
- 财富主体是幻方量化股权,持股比例(媒体估算约 76%)比估值倍数更关键
- 不同机构口径差异可达数倍,引用时必须标注来源和时间
- DeepSeek-V3 单次训练约 278.8 万 H800 GPU 小时 / 约 557.6 万美元(据其技术报告),但这不是总研发投入
- 推理效率和国产化交付能力,才是支撑估值的真正技术底座
相关推荐
- **阅读相关专题**:本站「大模型」分类下还有 DeepSeek 架构拆解、MoE 路由机制等系列文章,建议连着看,理解会更完整。
- **查看工具推荐**:想找国产大模型的 API 对比、推理成本计算器等实用工具,可以逛逛 [VergeX AI工具导航](https://nav.vergex.cn)。
- **订阅更新**:AI 行业的估值和技术迭代都很快,建议订阅本站更新,新文章发出来第一时间能看到。
参考来源:
- DeepSeek-AI,《DeepSeek-V3 Technical Report》, arXiv:2412.19437, 2024年12月
- DeepSeek-AI,《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》, arXiv:2501.12948, 2025年1月
- 胡润研究院,《2025 胡润全球富豪榜》, 2025年3月
- 彭博社关于 DeepSeek 创始人财富的推算报道, 2025年1月

