如何读懂DeepSeek创始人履历?梁文锋从量化到大模型的路径
2025 年 1 月之后,DeepSeek 这个名字几乎每天都出现在我的信息流里。但有意思的是,当我跟同行聊起 deepseek创始人履历的时候,能完整说出梁文锋这个名字、并且讲清楚他此前做过什么的人,比我想象中少得多。大部分人只知道"一家杭州公司做出了对标 GPT-4 的模型",然后就没有然后了。
这种信息断层其实挺可惜的。因为在我看来,DeepSeek 的很多技术选择——从 MoE 架构到激进的 API 定价,再到坚持开源——如果脱离创始人的背景去看,会显得莫名其妙;但把履历这条线接上,很多事情就顺了。
核心结论摘要:DeepSeek 创始人是梁文锋,1985 年生于广东湛江,浙江大学信息与通信工程硕士,2015 年联合创立幻方量化,2023 年 7 月成立 DeepSeek。他的量化交易背景直接塑造了 DeepSeek 对算力效率、工程极致和开源策略的偏好。
DeepSeek创始人履历入门指南:梁文锋是谁
如果只想快速建立认知,下面这张表基本能覆盖主干信息。我把它当成一份 deepseek创始人履历入门指南来用,先看骨架,再看细节。
| 时间 | 关键节点 | 对后续的影响 | | --- | --- | --- | | 1985 年 | 出生于广东湛江 | 典型的非一线城市出身,后来多次强调"本土人才" | | 2002—2010 年前后 | 浙江大学电子信息工程本科、信息与通信工程硕士 | 研究方向涉及图像处理与目标跟踪,属于早期的机器学习应用 | | 2015 年 | 与徐进等人联合创立幻方量化 | 第一次把"算法 + 算力"规模化落地到金融场景 | | 2019—2021 年 | 幻方自建「萤火」超算集群,管理规模据公开报道一度突破千亿元 | 提前囤积算力,成为后来训练大模型的物理基础 | | 2023 年 7 月 | 成立杭州深度求索人工智能基础技术研究有限公司 | DeepSeek 正式诞生,由幻方孵化并出资 | | 2024 年 5 月 | DeepSeek-V2 发布,API 定价大幅下探 | 直接引发国内大模型价格战 | | 2024 年 12 月 | DeepSeek-V3 发布 | 671B 总参数、37B 激活参数,训练成本约 557.6 万美元 | | 2025 年 1 月 | DeepSeek-R1 发布并开源 | 大模型推理能力第一次以开源形式逼近闭源头部 |
有一点需要说明:梁文锋本人极少接受采访,公开露面的次数屈指可数。据《暗涌Waves》2023 年 5 月的一篇访谈,他当时谈到幻方做大模型的初衷,核心意思是"不是为了做生意,而是想搞清楚这件事的边界在哪里"。这句话我反复琢磨过,它其实解释了后来 DeepSeek 为什么能在 API 定价上做出那么激进的决策——因为压根不是按常规商业逻辑在算账。
从幻方到DeepSeek:履历里的两次关键转折
DeepSeek创始人履历里真正值得拆的,不是学历,而是两次转折。
第一次转折:从学术研究到量化交易。 2015 年前后,国内量化投资刚刚起步。梁文锋和团队把深度学习、强化学习这套方法搬到了 A 股和商品期货市场。这件事的意义在于,它逼着团队形成了两个习惯:一是对算力投入的极端重视,二是对"模型效果必须用真金白银验证"的执念。量化交易没有情怀分的空间,策略回撤就是回撤,这跟学术圈发论文的逻辑完全不同。
第二次转折:从量化到通用大模型。 2023 年,幻方宣布进军 AGI,成立 DeepSeek。这个时间点很有意思——比 OpenAI 发布 GPT-4 晚了几个月,但比国内大部分大厂正式立项还要早或者基本同步。更关键的是资金来源:据公开报道,DeepSeek 早期并未接受外部融资,主要依靠幻方自有资金支持。这一点决定了很多东西,后面会展开。
量化基因如何拆解成大模型能力
这部分是我认为整篇 DeepSeek创始人履历分析里最有价值的地方。很多人把梁文锋的量化背景当成一个花边信息,但我觉得它才是理解 DeepSeek 技术路线的钥匙。
先说算力。幻方在 2019 年就开始自建 AI 超算,2021 年的「萤火二号」据公开信息达到约 1 万张 A100 的规模。在大模型训练还是"军备竞赛"的年代,一家量化基金手里握着上万张卡,这件事本身就极不寻常。等到 2023 年 DeepSeek 成立,这批算力直接变成了先发优势。
再说效率。量化策略的核心命题是:在有限的算力和延迟约束下,从噪声里提取尽可能多的信号。我做了几年量化策略相关的工作,深知这个领域对"单位算力产出"的敏感程度。DeepSeek-V2 引入的 MLA(多头潜在注意力)和 DeepSeekMoE 架构,本质上都是在做同一件事——把每一个 FLOP 榨干。根据 DeepSeek 官方 2024 年 12 月发布的《DeepSeek-V3 Technical Report》,V3 使用 2048 张 H800 训练,总计约 278.8 万 GPU 小时,按当时的租赁价格折算训练成本约 557.6 万美元。这个数字在业内引起的震动,比模型本身的 benchmark 分数还要大。
说实话,我不认为 557.6 万美元能简单等同于"训练一个 GPT-4 级模型只需要这么多钱"——它不含前期试错、数据构建和人力成本,媒体在这点上有点过度解读了。但它确实说明了一件事:这支团队的工程效率控制能力,明显高于行业平均水平。
再往下延伸,就是国产大模型的整体路线问题。梁文锋在为数不多的公开表态里提过一个观点,大意是中国 AI 不能永远做跟随者,需要有人去做原创性的架构探索。这话听起来像口号,但对照 V3 和 R1 的论文看,MLA、GRPO 这些确实是原创贡献,而不是对已有工作的复现。
至于多模态大模型,DeepSeek 目前的公开工作重心仍偏文本和推理。不过从团队构成和算力储备看,补齐多模态只是时间问题。
履历给从业者的实战启示
与其把 DeepSeek创始人履历当成一份 deepseek创始人履历使用教程去逐条对照,不如把它当成一个可复用的决策样本。我从中抽了三条对自己影响比较大的:
- **算力先行,但要算清楚账。** 幻方囤卡不是为了炫富,是为了在需要的时候不用排队。对中小团队来说,这个逻辑可以降维应用——提前锁定推理成本,比临时抱佛脚强。
- **不融资有时候是优势。** 没有外部回报压力,才能做出短期看起来"不划算"的决策,比如把 R1 完全开源。这一点很难复制,但值得警醒:融资节奏会反向塑造技术路线。
- **本土人才不是妥协。** DeepSeek 的核心团队据公开信息以国内应届生和年轻研究员为主,很多人没有海外经历。这打破了不少人心里"做前沿模型必须海归"的刻板印象。
想深入了解,看这几份原始材料
二手转述容易失真,下面这几份是我自己读过、觉得值得推荐的:
- 《DeepSeek-V3 Technical Report》,DeepSeek 官方,2024 年 12 月发布——架构细节和成本数据的原始出处。
- 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》,arXiv,2025 年 1 月——大模型推理能力训练的强化学习路径。
- 《暗涌Waves》2023 年 5 月对梁文锋的访谈——了解其个人思路最直接的一手材料。
关于国产大模型的整体竞争格局,可以参考 VergeX 上的国产大模型技术路线梳理;如果更关心推理侧的工程实现,大模型推理优化实践这个专题也值得一读。
关键要点速览
- DeepSeek 创始人是梁文锋,浙大信息与通信工程硕士,此前联合创立幻方量化。
- 量化背景带来的两个直接影响:提前囤积算力和极致的单位算力效率追求。
- DeepSeek-V3 训练成本约 557.6 万美元,但该数字不含数据、人力和试错成本,需谨慎解读。
- 团队以本土年轻研究员为主,坚持开源和低价策略,与不依赖外部融资的结构有关。
- 理解 deepseek创始人履历,本质上是理解一家公司为什么做出某些"反常识"决策。
回头看,DeepSeek创始人履历之所以值得研究,不是因为它有多传奇,而是因为它提供了一条非典型路径:不做应用、不追风口、不急着融资,先把底层能力做扎实。这条路能不能走通,现在下结论还太早。但至少在 2025 年初这个时间点上,它交出了一份让人没法忽视的答卷。
至于下一步,我的判断是 DeepSeek 大概率会在多模态和 Agent 方向继续加码,而梁文锋本人依然会保持低曝光。想跟踪这家公司的人,与其等采访,不如直接去读它的技术报告——那里面信息量比任何访谈都大。
相关推荐
- **阅读相关专题**:想系统了解国产大模型的架构演进与训练方法,可以浏览 VergeX 的[大模型专题](/category/大模型),里面按技术方向做了分类整理。
- **查看工具推荐**:需要挑选合适的模型 API 或开发工具?可以访问 [VergeX AI工具导航](https://nav.vergex.cn),收录了主流大模型工具和评测信息。
- **订阅更新**:VergeX 会持续跟踪 DeepSeek 及国产大模型的最新进展,建议通过邮件或微信公众号订阅,第一时间收到更新推送。

