deepseek创始人是谁?梁文锋和那支从量化基金走出来的AI团队

本文实测deepseek创始人是谁这一问题,涵盖梁文锋的浙大背景、幻方量化创业历程和DeepSeek的关键技术决策,帮助读者一次理清这家国产大模型公司的来龙去脉与技术底牌。

deepseek创始人是谁?梁文锋和那支从量化基金走出来的AI团队

核心结论:DeepSeek(杭州深度求索)的创始人是梁文锋,1985年生于广东湛江,浙江大学信息与通信工程硕士,同时也是量化私募幻方量化的联合创始人。他于2023年7月创办深度求索,用幻方自建的超算集群切入大模型基础研究,2024年底的DeepSeek-V3和2025年初的DeepSeek-R1让这家不足两百人的公司站到了全球第一梯队。

这个问题我今年被问过不下二十次。有意思的是,问的人里一半是刚入行的算法工程师,另一半是找我做技术选型的甲方——他们想搞清楚,一个做量化交易的老板,凭什么能在两年内把国产大模型推到Nature封面上。今天就把这条线索完整捋一遍,顺便聊聊创始人的技术判断力到底体现在哪些工程细节里。

deepseek创始人是谁?先纠正几个流传很广的误传

梁文锋的公开履历其实很干净,但网上流传的版本五花八门。我见过最离谱的说法是"DeepSeek是某互联网大厂孵化后独立的团队",还有人把罗福莉当成创始人——她确实是DeepSeek-V2时期的核心研究者之一,2024年底离开后去了小米,但和创始团队是两码事。

先把基本事实摆出来:

| 时间 | 关键节点 | | --- | --- | | 1985年 | 梁文锋出生于广东湛江吴川 | | 2002年 | 考入浙江大学电子信息工程专业,后攻读信息与通信工程硕士 | | 2008年 | 读研期间与同学组队做量化交易,赶上金融危机后的市场波动 | | 2015年 | 与浙大校友徐进等人共同创立幻方量化 | | 2019年 | 幻方管理规模突破百亿 | | 2021年 | 规模突破千亿,跻身国内头部量化私募 | | 2023年7月 | 杭州深度求索人工智能基础技术研究有限公司成立 | | 2024年12月 | DeepSeek-V3发布,671B总参数、37B激活参数 | | 2025年1月 | DeepSeek-R1发布,App登顶美区App Store免费榜 | | 2025年9月 | R1相关论文以封面文章形式登上《Nature》 |

团队构成上有个容易被忽略的点:深度求索的核心成员里有相当比例是幻方时期的技术骨干,另外很大一部分是直接招进来的应届生和年轻研究者。梁文锋在2024年接受《暗涌》采访时说过大意是"团队里很多人是本土培养的,没有海外背景",这话当时被解读成姿态,但看后来的V3、R1论文作者名单,确实如此。

我自己第一次认真关注这家公司是2024年5月V2发布那天。当时国内几家大模型厂商的API定价还在一毛钱每千token上下,DeepSeek直接把价格打到几分钱,行业群里炸了锅。坦白讲,我第一反应是"烧钱换量",后来去翻他们的技术报告才发现,MLA(多头潜在注意力)带来的KV Cache压缩是实打实的结构性省钱,不是补贴。

从幻方量化到DeepSeek:一次顺着算力往下走的创业

理解梁文锋这个人,绕不开幻方。

幻方在2021年前后自建了"萤火"超算集群,公开报道里提到过万卡级别的A100规模。作为量化机构,这套集群本来是用来跑因子挖掘和策略回测的。但量化交易的算力需求和深度学习训练有个本质区别:前者对通信带宽和并行效率的要求,其实比后者还苛刻——你得在毫秒级完成大规模参数同步。

所以当2022年底ChatGPT引爆行业时,幻方手里已经攥着一样别人要花几十亿去买的东西:成规模的GPU集群,以及一支习惯了分布式训练的工程团队。光有卡还不行,真正稀缺的是"知道怎么让几千张卡不空转"的人。国内很多团队2023年才刚开始搭集群,幻方在这件事上至少领先了两年工程经验。

2023年7月深度求索成立时,梁文锋的定位说得很清楚:不做垂直应用,不做To B定制,只做基础模型和前沿研究。这个选择在当时的创业环境下相当反常识——2023年国内AI创投的主流叙事是"找场景、快落地、讲故事"。他反着来,先扎进最烧钱、最不确定、也最难短期变现的预训练环节。

我个人的判断是,这不是情怀,是算过账的。幻方的主业能持续供血,团队不需要靠融资节奏决定研究节奏,这在国内AI公司里几乎是唯一一例。代价是外界长期看不懂他们在干什么,好处是没人能催他们出季度财报。

创始人的技术审美,落在了哪几个工程决策上

梁文锋本人在公开场合谈技术细节不多,但从论文和产品里能倒推出团队的取舍逻辑。我把几个最有代表性的拎出来。

第一,MLA的坚持。 DeepSeek-V2首次把多头潜在注意力做成大规模可用的方案,核心是把KV Cache投影到低维潜空间,推理时显存占用大幅下降。这个方向2024年初并不主流,当时大家更愿意堆GQA。但MLA后来被多个开源模型借鉴,说明这条路走对了。这里其实能看出创始团队的取向:优先解决推理成本,而不是先刷榜单分数。想横向看各家路线差异,可以翻翻我们的国产大模型技术路线盘点。

第二,FP8混合精度训练。 DeepSeek-V3的技术报告(arXiv:2412.19437,2024年12月)里写到,模型在14.8万亿token上完成预训练,全程使用FP8混合精度,整个训练在2048张H800上跑完,累计约278.8万GPU小时。按报告给出的每小时2美元估算,总成本约557.6万美元。这个数字在2024年底被反复引用,因为它和同级别模型的训练开销不在一个量级。

第三,R1的纯强化学习路线。 DeepSeek-R1(arXiv:2501.12948,2025年1月)最让人意外的不是分数,而是方法:R1-Zero完全跳过监督微调,直接用GRPO做强化学习,让模型自己涌现出长链推理。AIME 2024 pass@1达到79.8%,MATH-500达到97.3%。论文里也老实承认了早期版本存在可读性差、中英混杂的问题,所以正式版R1才补了冷启动数据。2025年9月,这篇工作以封面文章形式发表在《Nature》,审稿人关注的正是"纯RL能否激发推理"这个核心命题。

这三件事串起来看,方向是一致的:在算力受限的前提下,把每一分钱花在能带来结构性收益的地方。这跟量化交易里"在有限资金下追求夏普比率"的思路,说实话挺像的。

对开发者意味着什么:实战场景与部署建议

聊完人,回到你真正关心的:这套技术路线对实际开发有什么影响。

今年2月我做过一个日志根因分析的小工具,最初直接调R1的官方API。效果确实好,它会把推理链完整展开,定位问题的思路比之前的模型清楚不少。但有两个坑:一是延迟高,长推理链动辄几千token;二是成本,高频调用下账单不便宜。后来我换成R1-Distill-Qwen-7B在本地部署,牺牲了一部分准确率,换来响应速度和成本的可控。

如果你也想本地跑,大概长这样:

用 vLLM 拉起蒸馏版,8K 上下文在单张 24G 卡上够用

vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-7B --max-model-len 8192

走 OpenAI 兼容接口,几乎不用改原有代码

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY") resp = client.chat.completions.create( model="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B", messages=[{"role": "user", "content": "解释一下 MLA 为什么能降低 KV Cache 占用"}], temperature=0.6, # R1 系列官方建议 0.5~0.7,设太低容易陷入重复输出 ) print(resp.choices[0].message.content)

几点实操心得:

  • **温度别设太低**。R1系列在低温下反而容易循环重复,这点和常规对话模型习惯相反,我踩过。
  • **推理链要截断**。生产环境里记得限制`max_tokens`,不然一个简单问题能给你写两千字。
  • **蒸馏版和满血版差距明显**。7B蒸馏版适合分类、抽取这类结构化任务;真要复杂推理,还是得用671B的API。显存和吞吐的取舍细节可以看[大模型推理部署与显存优化](https://vergex.cn/posts/llm-inference-deployment)。
  • **善用它的"思考过程"**。R1输出的推理链本身就是很好的调试素材,我在排查线上问题时经常直接读它的中间步骤,比看日志快。

几个可能被追问的问题

梁文锋现在还在管DeepSeek吗? 公开信息显示他仍是法定代表人及实际控制人,通过持股平台持有大部分股权。公司对外发声极少,没有CMO式的角色。

为什么叫"深度求索"? 公司全称是杭州深度求索人工智能基础技术研究有限公司,"求索"对应的是基础研究定位,不是产品公司定位。

团队规模多大? 多方报道提到长期维持在百人级别,和动辄数千人的大厂AI团队形成鲜明对比。人数少、算力集中、决策链短,这套配置在预训练阶段效率极高,但产品化和生态建设上会吃亏——这是我对它最大的疑虑。

总结与展望

回到最初的问题,deepseek创始人是谁?答案是梁文锋,一个从量化交易跨界到基础模型研究的浙大毕业生。但比"是谁"更值得琢磨的,是他带来的那套方法论:在算力硬约束下做工程最优解,而不是在资本充裕时做规模最优解。MLA、FP8训练、纯RL推理,三件事都指向同一个逻辑。

往后看,我比较关注两个方向:一是多模态能力的补齐,目前DeepSeek在这块的公开进展明显慢于推理侧;二是开源生态的持续性,模型权重开放容易,长期维护社区和文档是另一回事。如果你在评估技术选型,建议别只看benchmark,先拿自己的业务数据跑一轮,尤其试试它在长上下文和多轮工具调用上的实际表现。

关键要点速览:

  1. DeepSeek创始人是梁文锋,同时是幻方量化联合创始人,2023年7月创办深度求索
  2. 核心优势来自幻方时期积累的万卡级超算集群和分布式训练工程经验
  3. V3用FP8混合精度在2048张H800上完成14.8T token预训练,报告估算成本约557.6万美元
  4. R1验证了纯强化学习可以激发推理能力,论文于2025年9月登上《Nature》封面
  5. 团队规模长期保持百人级别,研究优先于商业化,这是优势也是风险

相关推荐

  • **延伸阅读**:[国产大模型技术路线盘点](https://vergex.cn/posts/domestic-llm-landscape)、[大模型推理部署与显存优化](https://vergex.cn/posts/llm-inference-deployment)
  • **工具导航**:想找DeepSeek相关的API服务、本地部署工具和评测榜单,可以逛一下 [VergeX AI工具导航](https://nav.vergex.cn),分类整理得比较清楚
  • **订阅更新**:VergeX 持续追踪国产大模型的技术演进,欢迎通过邮件或微信订阅,新文章发布第一时间推送
大模型

deepseek下载最新版实战指南:2026全平台安装与避坑

2026-9-28 18:06:42

大模型

deepseek深度思考蓝色是打开了吗?三端确认与原理拆解

2026-9-28 18:06:55

0 条回复 A文章作者 M管理员
VergeX 科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索