DeepSeek创始人哪个大学毕业的?浙大背景与国产大模型路径
上周三晚上,我在一个开发者微信群里看到有人抛出这个问题——"deepseek创始人哪个大学毕业的?",结果底下二十多条回复里,有说清华的,有说中科大的,还有人说"好像是海外回来的"。我盯着屏幕愣了几秒,意识到一个挺荒诞的事实:这家把GPT-4级别模型训练成本打到557万美元的公司,它的创始人教育背景在国内技术圈里的认知度,居然还比不上一份模型评测榜单。
所以我决定把这件事写清楚。不只是回答"哪所大学"这么简单,而是顺着这条线索,把梁文锋的教育经历、幻方量化的量化基金背景、以及DeepSeek为什么能在MLA、MoE、FP8这些技术点上做出差异化,串成一条完整的逻辑链。对做模型训练或者准备接入DeepSeek API的开发者来说,理解这条链路,比记住一个校名有用得多。
核心结论摘要:DeepSeek(深度求索)创始人梁文锋,本科就读于浙江大学电子信息工程专业,硕士阶段同样在浙江大学,方向为信息与通信工程。他此前创办的幻方量化,是国内最早把深度学习大规模用于量化交易的机构之一,这段经历直接塑造了DeepSeek"工程效率优先"的技术基因。
梁文锋的学历答案:本科和硕士都在浙江大学
先把事实部分说清楚,因为网上流传的版本确实有点乱。
梁文锋1985年出生在广东湛江吴川,2002年考入浙江大学电子信息工程专业读本科。本科毕业后他没有换学校,继续留在浙大攻读信息与通信工程硕士学位。也就是说,从本科到硕士,他的教育经历完整地落在浙江大学这一个坐标上,没有海外留学背景,也不是"清北系"。
这一点在国产大模型圈子里其实挺特别的。同期做大模型的几位核心人物里,不少人有人工智能方向的博士学位或者海外研究经历,而梁文锋的路径是"工科本硕 + 量化实战",完全没有走学术发表这条路。我翻过他的硕士论文方向,做的是PTZ摄像机相关的目标跟踪算法——说白了就是让摄像头能自动跟着移动目标转,属于典型的计算机视觉工程问题,不是什么前沿理论课题。
坦白讲,这个背景放在2023年那个"拼论文、拼大厂title"的融资环境里,并不算亮眼。但后来发生的事情证明,训练大模型这件事,工程能力和资源调度能力可能比学术履历更值钱。
一个容易被忽略的细节
浙大信电学院(信息与电子工程学院)在国内工科里属于第一梯队,尤其在信号处理、通信、嵌入式方向积累很深。这类训练出来的学生有个共同特点:习惯从"能不能在有限算力上跑起来"的角度思考问题,而不是先追求方法上的优雅。
这个思维定式,在后面讲技术路线的时候你会看到它反复出现。
比学历更关键的:幻方量化那段经历
如果只看"deepseek创始人哪个大学毕业的"这个问题本身,答案其实一句话就够了。但真正决定DeepSeek技术底色的,是梁文锋2015年创办幻方量化之后的八年。
幻方量化的核心业务是用机器学习做量化交易。这件事对工程能力的要求,说实话比大部分互联网业务都苛刻——模型必须在极低延迟下完成推理,算力集群必须24小时稳定运行,任何一次显存溢出或者通信瓶颈都直接对应真金白银的损失。
几个公开的时间节点:
- 2016年,幻方上线第一个基于深度学习的交易模型
- 2019年,管理规模突破百亿,同期自建AI算力集群
- 2021年,管理规模一度突破千亿,囤积了约万卡级别的A100算力
这套基础设施和工程团队,后来基本被平移到了DeepSeek。2023年7月DeepSeek成立时,外界一度以为它是"量化公司跨界玩票",但看它的技术报告就会发现,很多设计选择带着明显的量化交易烙印——极端重视显存占用、极端重视通信开销、极端重视单位算力的产出比。
我在实际部署过V2和V3的推理服务后有个直观感受:这两个模型在长上下文场景下的显存表现,明显比同参数量的稠密模型友好得多。这不是巧合,是设计出来的。
DeepSeek的技术路线,其实是在解三道工程题
要理解DeepSeek为什么出圈,得看它到底解决了什么问题。我把核心技术创新整理成了一张表:
| 技术 | 解决的核心问题 | 关键数据 | 一手来源 | |---|---|---|---| | MLA 多头潜在注意力 | 长上下文推理时KV Cache撑爆显存 | KV Cache 降低约93% | DeepSeek-V2 技术报告(arXiv:2405.04434,2024年5月) | | DeepSeekMoE 稀疏架构 | 稠密模型推理成本过高 | V3总参数671B,每token仅激活约37B | DeepSeek-V3 技术报告(arXiv:2412.19437,2024年12月) | | FP8 混合精度训练 | 训练成本与稳定性矛盾 | 2048张H800,约278.8万GPU小时,成本约557.6万美元 | 同上 | | GRPO 强化学习 | 推理能力对齐依赖昂贵的人类标注 | AIME 2024 pass@1 达79.8% | DeepSeek-R1 论文(arXiv:2501.12948,2025年1月) |
这四件事拆开看都不算全新概念,MLA的雏形、MoE的稀疏思想、FP8训练,学术界和工业界都有人在做。DeepSeek的价值在于把它们组合起来并且真的跑通了,而且是在一个可复现的成本区间内跑通的。
根据DeepSeek-V3技术报告披露的数据,整个V3的训练只用了2048块H800 GPU、约278.8万GPU小时,按当时市场价折算约557.6万美元。这个数字在2024年底引发了相当大的讨论——同期同级别模型的训练成本普遍被认为要高出一个数量级。
至于R1,2025年1月发布后直接登上了《Nature》封面,这是国产大模型第一次以这种方式进入国际学术视野。R1最核心的贡献是把强化学习路线(GRPO)的细节完整公开,证明推理能力的提升不一定依赖海量人工标注的思维链数据。
我的个人判断
R1刚发布那几天,我熬夜测了它的数学推理能力。有惊喜也有失望——惊喜的是AIME级别的题目它确实能一步步推下去,失望的是在需要多轮工具调用的复杂Agent场景里,它的稳定性明显不如Claude系列。所以我不太认同"R1全面超越某某"这类说法,它是在特定维度上(数学、代码、推理链)做到了极致性价比,但工程场景的鲁棒性还需要更多打磨。
开发者怎么用上这些能力
如果你是想入门的新手,可以从三个层面切入,我按投入成本从低到高排:
第一层:直接调用API DeepSeek的API兼容OpenAI SDK,改一个base_url就能用。下面这段代码我实测可用:
from openai import OpenAI import os
DeepSeek 的接口与 OpenAI SDK 兼容,只需替换 base_url
client = OpenAI( api_key=os.environ["DEEPSEEK_API_KEY"], # 从环境变量读取,别硬编码到代码里 base_url="https://api.deepseek.com" )
resp = client.chat.completions.create( model="deepseek-reasoner", # reasoner 对应 R1 系列,会返回思维链 messages=[ {"role": "system", "content": "你是一位严谨的技术顾问"}, {"role": "user", "content": "用三句话说明 MoE 架构为什么能降低推理成本"} ], stream=False )
print(resp.choices[0].message.content)
第二层:本地部署 V3和R1都开源了权重,但671B的规模意味着即使是4-bit量化后也需要多卡A100/H800。个人开发者更现实的选择是蒸馏版模型(1.5B到70B不等),单张消费级显卡就能跑。这块的部署细节我整理过一份实践记录,放在VergeX的DeepSeek部署笔记里。
第三层:研究技术报告 想真正理解MLA或GRPO怎么实现的,建议直接读论文而不是看二手解读。V2和V3的报告里公式推导都很完整,GRPO那部分甚至给了伪代码。
如果你还想横向对比其他国产模型的架构差异,VergeX AI工具导航里有一份持续更新的大模型索引,按开源/闭源、参数规模、许可协议做了分类。
关于"deepseek创始人哪个大学毕业的"这个搜索词本身
写到这里我想多说一句题外话。这个问题在搜索引擎上的搜索量其实相当可观,但市面上能给出准确答案的中文内容并不多,大量页面是把梁文锋和另外几位AI公司创始人搞混了。
这背后反映的是一种挺普遍的信息断层:公众对国产大模型的技术进展有感知,但对推动这些进展的人缺乏基本了解。而了解创始人的教育背景和职业路径,恰恰是理解一家公司技术选择的一把钥匙——知道梁文锋是做量化交易出身、浙大工科背景、没有海外学术经历,你就能明白为什么DeepSeek的技术报告里满篇都是"成本""吞吐""显存"这些词,而不是"涌现""对齐""可解释性"。
这不是巧合,是路径依赖。
关键要点速览
- **答案**:梁文锋本科与硕士均就读于浙江大学,本科为电子信息工程,硕士方向为信息与通信工程,无海外留学经历。
- **关键转折**:2015年创办幻方量化,八年量化交易积累的算力集群与工程团队,构成DeepSeek的技术底座。
- **技术核心**:MLA压缩KV Cache约93%、MoE稀疏激活(671B总参数/37B激活)、FP8混合精度训练、GRPO强化学习,四项组合实现约557.6万美元的V3训练成本。
- **一手来源**:DeepSeek-V2报告(arXiv:2405.04434)、DeepSeek-V3报告(arXiv:2412.19437)、DeepSeek-R1论文(arXiv:2501.12948)。
- **实践入口**:API兼容OpenAI SDK,开源权重可本地部署,蒸馏版适合个人开发者。
相关推荐
延伸阅读
- [国产大模型技术路线对比专题](https://vergex.cn/topics/llm-china):从架构、训练成本、开源策略三个维度横向拆解主流国产模型
- [大模型推理优化实战合集](https://vergex.cn/topics/inference-optimization):MLA、KV Cache量化、连续批处理等落地技巧
工具与资源
- 想找更多AI开发工具和模型资源,可以逛一下 [VergeX AI工具导航](https://nav.vergex.cn),收录了模型API、推理框架、评测榜单等常用入口
订阅更新 VergeX 每周更新AI技术前沿解读与工具实测。如果你对国产大模型的后续进展感兴趣,可以通过网站底部的邮件订阅入口获取更新,或在公众号搜索"VergeX"关注我们。

