kimi创始人杨植麟是哪里人啊?聊聊汕头少年和他的大模型技术底牌
先把答案摆在最前面:杨植麟是广东汕头人。
我第一次被问到"kimi创始人杨植麟是哪里人啊"这个问题,是在一个开发者微信群里。当时群里正在争论国产大模型的上下文长度到底是营销噱头还是真本事,有人突然插了一句"Kimi那个创始人哪儿的人来着",话题就歪了。但说实话,这个问题本身挺有意思——它说明大众对国产大模型创业者的好奇,已经从"他做了什么"延伸到"他从哪来"。
核心结论摘要: 杨植麟是广东汕头人,1992年生,本科毕业于清华大学计算机系(师从唐杰教授),博士就读于卡内基梅隆大学(导师Ruslan Salakhutdinov),是Transformer-XL和XLNet两篇高被引论文的第一作者,2023年3月创办月之暗面并推出Kimi智能助手。
这个摘要基本涵盖了绝大多数人搜索"kimi创始人杨植麟是哪里人啊"时想知道的全部信息。但如果你只是想知道籍贯,看到这儿就可以关页面了。接下来我想聊的,是这条籍贯信息背后那条更有价值的技术线——他凭什么能在两年内把月之暗面做成国内估值最高的大模型公司之一。
从汕头到清华园,再到CMU
公开资料里关于杨植麟早年经历的记载不算多,但几条关键节点在多家财经和科技媒体的创始人报道中反复出现,可信度比较高。
他1992年出生在广东汕头,高中念的是汕头金山中学——这所学校在广东本地是出了名的理科强校。之后他被保送进清华大学计算机科学与技术系,本科阶段就进了唐杰教授的实验室做数据挖掘和社交网络分析。这里有个细节值得注意:他本科期间发的论文方向是图神经网络和网络表示学习,跟后来做语言模型并不是一条线。这种"中途转向"在顶尖研究者身上其实很常见。
博士阶段他去了卡内基梅隆大学,导师是Ruslan Salakhutdinov——就是那本《Deep Learning》教材的合著者之一。CMU的语言技术研究所(LTI)在NLP领域什么地位,圈内人都清楚。
我个人的判断是,杨植麟的路径和国内大部分大模型创业者不太一样。很多人是从工业界一线做大工程出来的,而他是典型的"学术型创始人"——先在国际顶会上把名字打出来,再回国创业。这条路径的优势和劣势都很明显,后面我会展开说。
技术底牌:Transformer-XL和XLNet解决了什么真问题
要理解Kimi为什么能在长上下文这条路上跑得这么快,得先看他读博期间的两篇论文。这两篇都是他做第一作者,也都直接指向同一个技术痛点:Transformer怎么处理超长序列。
先说Transformer-XL(发表于ACL 2019)。标准Transformer有个硬伤——它只能处理固定长度的上下文窗口,超过就得截断。Transformer-XL提出了"片段级循环"机制,把上一段的隐藏状态缓存下来传给下一段,相当于给模型加了个记忆模块,让它能跨越固定窗口建模更长的依赖关系。这篇论文的引用量到今天依然是万级。
再看XLNet(发表于NeurIPS 2019)。它挑战的是BERT的掩码语言模型(MLM)预训练范式。BERT的做法是随机挖掉一些词让模型猜,XLNet换成了排列语言模型(Permutation Language Modeling),通过打乱因子化顺序,让模型在预测每个位置时都能"看到"双向上下文,同时保留自回归的特性。结果是在20个任务上超过BERT,包括GLUE、RACE、SQuAD这些当时的硬骨头。
| 时间 | 成果/事件 | 技术意义 | | --- | --- | --- | | 2019年1月 | Transformer-XL论文发布(ACL 2019收录) | 首次用片段循环机制突破固定上下文窗口限制 | | 2019年6月 | XLNet论文发布(NeurIPS 2019收录) | 用排列语言模型超越BERT,成为当时SOTA | | 2023年3月 | 创办月之暗面(Moonshot AI) | 从循环智能内部孵化分拆 | | 2023年10月 | Kimi Chat发布,支持20万汉字上下文 | 国内首批把超长上下文做成产品卖点 | | 2024年3月18日 | 官方公告启动200万字无损上下文内测 | 上下文长度提升一个数量级 | | 2025年7月 | Kimi K2开源,总参数1T、激活参数32B的MoE架构 | 转向开源+Agent能力路线 |
这张表里最后一行值得多说两句。根据月之暗面2025年7月发布的官方技术公告,Kimi K2采用MoE(混合专家)架构,总参数量达到1万亿,单次推理激活约320亿参数。这个设计思路其实和当年Transformer-XL的取舍一脉相承——在算力预算有限的前提下,怎么把有效上下文和有效参数利用率做到最大。MoE靠稀疏激活省推理成本,长上下文靠工程优化省显存,本质上都是在跟"计算资源"这个约束条件博弈。
为什么"籍贯"会变成一个搜索热词
这里我要说点不太中听的话。
坦白讲,一个技术创始人的籍贯,对理解他的技术水平毫无帮助。但"kimi创始人杨植麟是哪里人啊"这类词能被搜索到一定的量,反映的是一个更真实的行业心态:国产大模型赛道的竞争太激烈了,普通用户需要一些"人设锚点"来记住不同公司的差异。谁是哪里人、什么学校毕业、几岁创业,这些标签比"上下文窗口200万token"好记太多了。
这事儿有好有坏。好的一面是行业关注度真的起来了,我身边做后端开发的朋友都在讨论Kimi和DeepSeek的区别,这在三年前不可想象。坏的一面是,标签化叙事容易让人忽略技术路线的真实差异。
拿长上下文举例。我在实际项目里做过一个合同比对的原型,把三份加起来大概80万字的采购合同丢给模型做差异提取。测试下来,单纯的"上下文长度"数字并不是决定性的,真正影响结果的是模型在长文本中段和尾段的信息召回能力。有些模型宣称支持百万级上下文,但实际跑到50万字以后,中间段落的细节就开始丢。这种差异用户不会从"创始人籍贯"里看出来,只能自己动手测。
长上下文为什么成了国产大模型的胜负手
顺着上面那个测试说下去。多模态大模型、大模型推理这些方向当然是更大的战场,但长上下文是少数几个国内团队能靠工程能力快速建立差异化的领域。
原因不复杂。预训练阶段的算力投入,国内团队普遍比不过头部几家国际大厂;但在推理侧的工程优化——显存管理、注意力算子、KV Cache压缩、长度外推——这些更吃工程细节而不是纯粹堆卡。杨植麟做过Transformer-XL,对"怎么让模型跨窗口记住东西"这件事的理解是刻在论文里的。
不过话说回来,长上下文也有它的问题。我自己的使用感受是,超过一定长度后,推理延迟会明显上升,成本也不便宜。所以我们团队后来调整了策略:不是所有任务都硬塞长上下文,而是先用检索做粗筛,只把最相关的片段喂给模型。这套"RAG + 长上下文兜底"的组合,比纯长上下文方案在实际业务里更省钱。
想跟上这条技术线,我的几点实操建议
如果你是因为搜"kimi创始人杨植麟是哪里人啊"误打误撞进来的技术同学,那不妨顺着往下走一步。这里是我自己踩过坑之后总结的三条建议:
- **先读原始论文,别只看二手解读。** Transformer-XL和XLNet的arXiv版本加起来不到40页,一个周末能啃完。读完之后再看现在各家大模型的"长上下文"宣传,你会有完全不同的判断力。
- **自己搭一个长文本评测集。** 不用很大,20份真实文档就够。重点测两件事:中段信息召回率、以及100k token以上时首尾token的延迟差。这个数据比任何榜单都更能说明问题。
- **关注MoE和长上下文的组合。** Kimi K2走的是万亿参数MoE + 长上下文的路子,这个组合对推理成本的影响很大。如果你在做成本敏感的AI应用,这类架构的演进值得盯紧。
想系统了解国产大模型的技术分野,可以看看站内的国产大模型技术路线对比,另外Kimi长上下文实战笔记那篇里有完整的测试脚本。
关键要点速览
- 杨植麟是广东汕头人,1992年生,高中就读汕头金山中学,后保送清华大学计算机系
- 他是Transformer-XL(ACL 2019)和XLNet(NeurIPS 2019)两篇高被引论文的第一作者
- 2023年3月创办月之暗面,2023年10月推出Kimi,2024年3月官方公告启动200万字无损上下文内测
- 2025年7月发布的Kimi K2采用1T总参数、32B激活参数的MoE架构,并选择开源
- 长上下文是国产大模型少有的、能靠工程能力建立差异化的技术方向,但实际业务里建议配合RAG使用
延伸阅读
- [VergeX AI工具导航](https://nav.vergex.cn) —— 收录国内外主流大模型与AI开发工具,可按上下文长度、开源协议、API价格筛选
- [月之暗面官方技术博客](https://www.moonshot.cn) —— Kimi K2技术报告与模型卡的一手来源
- Transformer-XL论文:Dai, Z., Yang, Z., et al. "Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context", ACL 2019
- XLNet论文:Yang, Z., Dai, Z., et al. "XLNet: Generalized Autoregressive Pretraining for Language Understanding", NeurIPS 2019
相关推荐
阅读相关专题:想继续深挖国产大模型的架构演进,推荐浏览「大模型」分类下的技术拆解系列,从注意力机制优化到MoE路由策略都有覆盖。
查看工具推荐:如果你正在选型大模型API,可以直接访问 VergeX AI工具导航,站内按推理成本、上下文长度、多模态能力做了横向对比表,省去一家家翻文档的时间。
订阅更新:VergeX 每周更新一期AI技术雷达摘要,涵盖模型发布、论文速递和工程实践。可通过站内邮件订阅或关注微信公众号获取推送,第一时间收到国产大模型的最新动态。

