DeepSeek创始人简介:梁文锋怎么做出国产大模型?
2025年1月27日,英伟达股价单日跌了约17%,市值蒸发接近5890亿美元。那天晚上我在一个开发者群里看到有人甩出这条新闻,配文只有四个字:“梁文锋干的。”
这话当然夸张——股价波动不可能由一个人决定。但它精准地说明了一件事:一个此前几乎不接受采访、不上台演讲、连公司发布会都懒得开的广东人,突然成了全球AI叙事里绕不开的名字。很多人是在DeepSeek-R1刷屏之后才开始搜“deepseek创始人简介”,搜完之后往往更困惑:一个做量化私募出身的人,凭什么做出能和OpenAI掰手腕的模型?
这篇就把这件事讲清楚。不只是履历罗列,更重要的是把他的背景、判断和技术选择串成一条线。
核心结论:DeepSeek创始人梁文锋,1985年生于广东,浙江大学信息与通信工程硕士,2015年前后创办量化机构幻方量化,2023年7月创立DeepSeek。他最关键的一条判断是——真正的创新必须由本土团队原创完成,而不是跟随式微创新。MLA、DeepSeekMoE、GRPO这一整套技术选择,都是这条判断的产物。
梁文锋是谁?一份不太常规的创始人履历
先把基础信息摆出来。梁文锋不是那种典型的“海归大厂高管创业”模板,他的路径在国内AI圈里相当少见:没有海外求学经历,没有在Google或微软待过,甚至没在互联网大厂打过一天工。
浙大七年,他学的东西和金融没关系
1985年,梁文锋出生在广东湛江吴川。2002年考入浙江大学电子信息工程专业,本科毕业后继续在本校读信息与通信工程硕士。他的硕士研究方向是机器视觉相关的内容,具体做的是目标跟踪这一类课题。
这段经历常被忽略,但我觉得挺重要。目标跟踪要处理的是视频序列里的时序信息、特征表示和状态估计——这些问题和大模型里的注意力机制、表示学习,在数学直觉上是相通的。他后来的团队招人时也偏爱竞赛背景的应届生,而不是履历漂亮的资深工程师,这跟他自己就是“一张白纸做研究”的路子是一脉相承的。
幻方量化那十年,是大模型的“预训练”
据多家媒体报道,梁文锋在2008年前后就开始接触量化交易。2015年,他与浙大同学一起创立幻方量化。到2021年,幻方量化管理规模突破千亿人民币,一度跻身国内量化私募第一梯队。
有意思的地方在于,幻方从2019年就开始自建AI超算集群,把深度学习模型用在量化策略上。也就是说,在DeepSeek成立之前,梁文锋已经完整地走过一遍“大规模算力集群 + 大模型训练 + 工程化落地”的流程。2023年7月,杭州深度求索人工智能基础技术研究有限公司注册成立,团队的核心班底很大程度上来自幻方AI。
这里有个我在做技术调研时反复跟人强调的点:DeepSeek不是一群学者拍脑袋搞出来的实验室项目,它背后是一支已经在生产环境里跑过万卡集群的工程团队。这个起点,比很多融资故事动听但没做过大规模训练的团队要扎实得多。
| 时间 | 事件 | 为什么值得记住 | | --- | --- | --- | | 1985年 | 出生于广东湛江 | 本土成长路径,无海外背景 | | 2002–2009年 | 浙江大学本硕,方向为电子信息/信息与通信工程 | 机器视觉与目标跟踪的技术底子 | | 2015年前后 | 参与创立幻方量化 | 获得算力与工程团队的组织能力 | | 2019年 | 幻方AI自建深度学习超算集群 | 提前完成大规模训练的实战演练 | | 2023年7月 | 创立DeepSeek(杭州深度求索) | 正式转向AGI | | 2024年5月 | DeepSeek-V2发布,提出MLA | 推理成本大幅下降的技术拐点 | | 2024年12月 | DeepSeek-V3发布 | 671B总参数、37B激活参数 | | 2025年1月 | DeepSeek-R1发布 | 引发全球范围的开源推理模型热潮 | | 2025年9月17日 | R1论文登上《Nature》封面 | 中国大模型研究首次以封面形式亮相 |
从量化思维到大模型架构:三条技术主线
理解梁文锋的技术选择,我觉得抓住一个词就够了:成本效率。量化交易本身就是在一个极度内卷、极度看重边际收益的环境里做决策,这种思维被完整带进了DeepSeek的模型设计。国产大模型在算力受限的现实条件下,能不能用更少的资源做出接近的效果,几乎是唯一的活路。
MLA:把KV Cache压下去
2024年5月发布的DeepSeek-V2技术报告中,团队提出了多头潜在注意力机制(Multi-head Latent Attention,MLA)。它做的事情说人话就是:通过低秩压缩的方式重构注意力里的键值表示,把推理阶段最吃显存的KV Cache显著压小。
这个改动对普通用户意味着什么?同样一张显卡,能塞进更长的上下文、更大的并发。我在本地部署V2系列模型时最直观的感受就是,显存占用比同期同参数量的模型宽松不少,长文本场景下尤其明显。大模型推理的成本大头之一就在KV Cache,MLA直接把这块砍了。
DeepSeekMoE:稀疏激活换来的性价比
更早一点,2024年1月的DeepSeekMoE论文提出了细粒度专家切分加共享专家的方案。V3最终做到了671B总参数、每次推理只激活37B左右。参数量撑起模型能力上限,激活量决定实际算力开销,这两件事被拆开了。
根据DeepSeek-V3技术报告(arXiv:2412.19437,2024年12月发布)披露的数据,V3的完整训练只用了278.8万H800 GPU小时,按当时租赁价格折算约557.6万美元。这个数字在业内引发了大量讨论,因为它比很多人对“千亿参数级模型训练”的成本想象低了一个数量级。
当然了,成本低不等于容易。稀疏专家的负载均衡、通信开销、训练稳定性,每一个都是坑。能做到这个数字,靠的是前面说的那支跑过万卡集群的团队。
GRPO与R1:把强化学习推到极限
DeepSeek-R1走的路线更激进。R1-Zero版本完全跳过监督微调,直接对基础模型做强化学习,结果模型自己涌现出了长链推理、自我验证、反思回溯这些行为。这个结果在2025年1月发布时,说震动业界不夸张。
到了2025年9月17日,R1的相关论文以封面文章形式发表在《Nature》上,论文标题为《DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning》。据《Nature》官方说明,这是首篇经过同行评审的大语言模型推理能力研究。
顺便说一句,DeepSeek在2025年9月还发布了V3.2-Exp实验版本,引入了稀疏注意力机制。节奏一直没慢下来。
我对这个人最真实的判断
坦白讲,市面上关于梁文锋的报道里,我最不喜欢的是那种“天才少年逆袭”的叙事。它把一个可以被复制的组织选择,包装成了不可复制的个人天赋。
在我看来,梁文锋真正做对的事情有三件,而且每一件都不依赖天赋。
第一件,他选择在幻方阶段就把钱砸进算力,而不是等到风口来了再补课。2019年自建集群这个决策,在当时的量化圈里属于异类——大部分同行把钱花在策略和人才上。五年后回头看,这批提前储备的算力成了DeepSeek冷启动的燃料。
第二件,他把组织结构做得极度扁平。据公开报道,DeepSeek内部没有严格的层级和跨部门汇报,研究员的选题自由度很高。这种结构在大厂里基本不可能存活,因为它无法向上汇报KPI。但它恰恰适合做前沿研究。
第三件,也是最被低估的一件——他坚持开源。R1以MIT协议开源,允许商用和蒸馏,这在商业上是“把钱往外推”的做法。但他的公开表态一直很一致:中国AI不能永远做跟随者,闭源护城河挡不住技术扩散。这话听着理想主义,可它确实换来了全球开发者的生态反哺。
不过话说回来,这套打法也有明显的脆弱面。极度依赖单一创始人的判断、开源模式缺乏明确的商业闭环、团队规模刻意保持精悍——这些都是真实存在的问号。我不会假装它们不存在。
了解创始人之后,普通开发者能做什么?
知道梁文锋是谁,对一线开发者来说不是谈资,而是判断依据。我整理了几个我自己实际用过的切入点。
本地部署选型。 如果你的显存有限,优先考虑蒸馏版而非满血版。R1-Distill系列里,Qwen-1.5B和7B版本在消费级显卡上就能跑,14B和32B需要更高配置。真正要跑671B的V3/R1,那是服务器级别的事。
关注架构而非榜单。 与其盯着各种跑分排名,不如看看MLA、MoE这些设计是不是被其他框架吸收了。截至目前,MLA已经被多个国产开源模型借鉴,这是比榜单更硬的信号。
读一手论文。 DeepSeek的技术报告写得相对克制,公式完整,没有太多营销话术。想系统了解大模型训练的人,从DeepSeekMoE和V2的技术报告入手,比看二手解读效率高得多。关于这方面的更多资料,我在国产大模型的整体格局里做过一次横向梳理,可以配合着看。
注意推理成本的实际账。 很多团队在选型时只看API定价,忽略了自建的运维成本。我在做大模型推理成本优化的实测时发现,小规模团队用API往往比自建集群划算,除非你的调用量已经稳定在高位。
关于梁文锋,被问得最多的几个问题
DeepSeek是国企吗? 不是。DeepSeek是民营企业,注册主体为杭州深度求索人工智能基础技术研究有限公司,公开工商信息显示梁文锋通过直接和间接方式持有绝大部分股权。公司没有接受过外部大额融资,主要资金来自幻方体系。
他和幻方量化现在是什么关系? 幻方量化是梁文锋早期创办的量化机构,DeepSeek在算力和早期资金上得到过幻方体系的支持,但两者是独立运营的实体。梁文锋本人的精力已经全面转向DeepSeek。
DeepSeek只有他一个创始人吗? 对外发声和公众认知高度集中于梁文锋,但他不是孤军奋战。团队核心成员多来自幻方AI和国内顶尖高校,采用高度扁平的组织结构,不设传统意义上的多层级管理。
他为什么一直不接受采访? 2024年他罕见地接受了36氪旗下《暗涌Waves》的专访,那是为数不多的深度对话。其余时间他基本不露面。从他在那次专访里的表述看,他更在意“做出东西”本身,而不是被讨论。
总结与学习路径
如果要给“deepseek创始人简介”这个问题一个最终答案,我会这么说:梁文锋是一个把量化交易的成本意识和工程纪律,完整移植到AGI研究里的人。他的价值不在于某一句金句,而在于用一系列具体决策——自建算力、扁平组织、稀疏架构、全面开源——证明了国产大模型不必走跟随路线。
给想深入了解的读者一条学习路径:
- 先读DeepSeekMoE论文(2024年1月),理解稀疏专家架构的基本逻辑
- 再读DeepSeek-V2技术报告(2024年5月),重点看MLA那一节的公式推导
- 然后读DeepSeek-V3技术报告(2024年12月),关注训练成本与工程细节
- 最后读登上《Nature》封面的R1论文(2025年9月),理解纯强化学习如何激发推理能力
- 动手环节:用Ollama或vLLM跑一个蒸馏版R1,亲手感受一下推理链的输出形态
关键要点速览:
- 梁文锋1985年生于广东,浙大本硕,无海外背景,是国内少见的纯本土成长路径的AI创始人
- 幻方量化那十年不是弯路,而是算力储备和工程团队的建设期
- MLA压缩KV Cache、DeepSeekMoE稀疏激活、GRPO强化学习,三条主线共同指向“用更少资源做更多事”
- V3训练成本约557.6万美元(据DeepSeek-V3技术报告),这个数字本身就是技术路线的证明
- R1论文于2025年9月登上《Nature》封面,是国产大模型研究的一个标志性节点
相关推荐
阅读相关专题 想系统了解国产大模型的整体格局和技术演进脉络,可以持续关注 VergeX 的大模型专题,我们会定期更新模型架构拆解和实测对比。
查看工具推荐 需要挑选适合自己的大模型推理框架、部署工具或API服务?可以直接访问 VergeX AI工具导航,里面按类别整理了目前可用的主流工具,省去逐个试错的时间。
订阅更新 AI领域的技术迭代速度确实快,DeepSeek 从V2到R1只用了八个月。如果你想第一时间收到这类深度拆解,可以通过邮件或微信订阅 VergeX 的更新推送,我们尽量只发有价值的内容。

