如何理解Kimi创始人在中关村论坛演讲的技术信号
每年三四月的中关村论坛,我基本都会蹲 AI 那几场。原因很实际——产品发布会的话术可以听个响,但创始人在这种半学术场合讲的路线判断,往往提前一年就埋好了后面的技术动作。2025 中关村论坛年会开在 3 月 27 日到 31 日之间,月之暗面创始人杨植麟在论坛的 AI 主题环节做了发言,网上流传的片段大多盯着"AGI 还有多远"这类流量话题,反而把真正有价值的技术信号给淹了。
我关注 Kimi创始人在中关村论坛演讲,倒不是想收集金句,而是想验证一件事:这家公司嘴上讲的路线,和它实际砸资源的方向到底是不是同一套。把演讲内容和过去两年 Kimi 放出来的技术报告摆在一起看,答案挺清楚的。
核心结论摘要: 这场演讲释放的核心信号是——大模型竞争的主战场已从预训练参数规模,转向后训练强化学习的效率、长上下文推理的工程化,以及多模态输入的协同。Kimi 从 k1.5 到 K2 的技术演进,恰好就是这条路径的实证。
Kimi创始人在中关村论坛演讲透露了什么技术信号
如果把演讲里那些关于"智能体""伙伴"的感性表述剥掉,剩下的技术判断大致可以归成两条主线。有意思的是,这两条在月之暗面的公开技术文档里都能找到对应的工程落地,不是空谈。
信号一:Scaling 的主战场从预训练挪到了后训练
杨植麟这几年的公开表态一直有个连贯性:他承认 Scaling Law 仍然有效,但强调单纯的参数扩张边际收益在递减,真正的增量来自强化学习这个新的缩放维度。
这个判断放到 2025 年看并不新鲜,OpenAI 的 o 系列、DeepSeek 的 R1 都在讲同一件事。但 Kimi 的做法有个细节值得看:根据其 2025 年 1 月发布的技术报告《Kimi k1.5: Scaling Reinforcement Learning with LLMs》,团队在长上下文强化学习里刻意去掉了蒙特卡洛树搜索(MCTS)、价值函数和过程奖励模型(PRM)这三样东西——而这三样恰恰是当时业界做推理模型的主流配方。
他们赌的是:只要上下文窗口足够长、RL 的采样规模足够大,模型自己会学会怎么反思和纠错,不需要外挂一套搜索框架来帮它规划。坦白讲,我第一遍读这个报告时是持怀疑态度的,因为这等于把整个系统的成败押在"上下文长度"这一个变量上。但后面的结果说明这条路走得通。
信号二:长上下文不是卖点,是基础设施
2023 年 Kimi 刚出圈时,200K 上下文被当成营销亮点。站在 2025 年回头看,长上下文的定位变了——它不再是产品页上的一个数字,而是支撑强化学习训练、Agent 记忆、多模态输入的前置条件。
这个转变挺关键的。上下文窗口不够长,长思维链的训练就做不下去;Agent 的多轮工具调用也会因为记忆截断而崩掉。杨植麟在演讲里把长上下文和强化学习绑在一起讲,逻辑就在这。
拆开看:Kimi 当下的三个工程支点
光听演讲容易停在概念层。我把月之暗面公开的技术材料做了个对照,发现它们其实是三个互相咬合的支点:
| 技术支点 | 代表成果与发布时间 | 关键设计 | 解决的痛点 | |---|---|---|---| | 推理架构 | Mooncake(2024 年 6 月) | 以 KVCache 为中心的预填充 / 解码分离式集群 | 长上下文推理的显存与成本瓶颈 | | 训练范式 | Kimi k1.5(2025 年 1 月) | 长上下文强化学习,去掉 MCTS 与过程奖励 | 长思维链能力的规模化训练 | | 参数效率 | Kimi K2(2025 年 7 月) | 1T 总参数 / 32B 激活的 MoE,MuonClip 优化器 | 把能力上限与单次推理成本解耦 |
推理架构:Mooncake 为什么重要
Mooncake 是月之暗面 2024 年 6 月公开的底层推理架构,核心思路是把预填充(prefill)和解码(decode)拆到不同的资源池里跑,再用 GPU 集群里闲置的 CPU、内存和 SSD 搭一层分布式 KVCache。
这个设计对长上下文场景的意义是直接的。我去年做一个合同条款比对的 Agent,一开始用分块策略处理几十页 PDF,跨条款的引用关系全靠自己在提示词里硬拼,效果时好时坏。后来换成支持长上下文的通道,最直观的感受不是"能塞更多字",而是我终于可以把整份文件连同历史对话一次性丢进去,模型对条款之间隐含关系的把握明显更稳了。这类体验背后,靠的就是 长上下文模型的工程实现 这类基础设施在扛成本。
训练范式:k1.5 的"极简 RL"赌局
前面提到的 k1.5,最反直觉的地方在于它的"减法"。业界当时普遍认为,要训出会思考的模型,必须有过程奖励模型来给每一步打分,必须用树搜索来扩展推理路径。k1.5 直接把这两样都砍了,只保留结果奖励加长上下文 RL。
风险在哪?如果模型在长链推理中跑偏,没有中间信号能把它拉回来。收益在哪?工程复杂度大幅下降,训练时能并行扩展的采样量上去了。这是一次典型的"用工程简洁性换探索空间"的取舍。对一个资源有限的团队来说,这个选择比照搬大厂的复杂配方更现实。
参数效率:K2 走的是另一条路
到 2025 年 7 月的 K2,路线又补上了一块。根据官方发布的技术报告,K2 是一款总参数 1 万亿、单次激活 320 亿的 MoE 模型,训练用了自研的 MuonClip 优化器来压住训练不稳定的问题。
一万亿参数的模型只激活三百多亿——这个比例说明稀疏化做得相当激进。它想解决的问题很明确:能力上限要够高,但每次调用的算力成本得控制在能大规模商用的范围内。这也是我认为国产大模型当下最务实的一条路,比拼单次跑分意义不大,把 国产大模型推理架构的差异 搞清楚,对做选型的人来说更值钱。
这些信号对实际开发者意味着什么
聊完技术,说点能落地的。如果你正在做基于大模型的产品,这几条判断值得放进决策清单:
第一,别再单纯按参数量选模型。 MoE 架构普及之后,总参数和实际体验之间的关联度已经明显下降。看激活参数、看推理成本、看长上下文稳定性,比看榜单排名有用得多。
第二,把上下文长度当架构约束来设计。 如果你的 Agent 每天要处理的长文档超过几万字,选型阶段就要确认模型在长上下文下的衰减曲线,而不是拿短提示词测出来的效果做判断。
第三,强化学习后训练能力的差异会体现在"多步任务"上。 单轮问答看不出差距,但涉及五六步工具调用、中间还要自我纠错的场景,不同模型的表现会差出一个量级。
第四,多模态输入要和长上下文一起评估。 单独测图片识别准确率意义有限,真正难的是让模型在几十轮对话里记住某张图里的细节。
我在实际项目里踩过的坑是:早期为了省钱用了小上下文模型 + 复杂的分块逻辑,结果花在调分块策略上的时间,远超直接换用长上下文通道省下来的成本。这笔账很多人一开始都算反了。
想深入的话,从这几份一手材料开始
网上关于 Kimi创始人在中关村论坛演讲的二次解读很多,但真正有信息量的还是一手文档。我按阅读顺序排一下:
- **《Kimi k1.5: Scaling Reinforcement Learning with LLMs》技术报告(2025 年 1 月)** —— 想理解"极简 RL"路线,这份是必读,重点是它对 MCTS 和 PRM 的处理理由。
- **Mooncake 架构论文(2024 年 6 月)** —— 偏系统方向,做推理部署的同学值得细看 KVCache 分离那部分。
- **Kimi K2 技术报告(2025 年 7 月)** —— MuonClip 优化器的设计动机讲得比较清楚,对训练稳定性有兴趣的可以深挖。
- **中关村论坛官方发布的论坛实录与议程资料** —— 用来做原始语境的交叉验证,避免被二手转述带偏。
如果你更关心工具层面的横向对比,VergeX AI工具导航 上有一份持续更新的国产模型能力对照表,比逐个翻官网快不少。
写在最后
把 Kimi创始人在中关村论坛演讲和后续几个月的技术发布放在一条时间线上看,你会发现一条挺清晰的逻辑:先解决"能不能装下"(Mooncake 的长上下文推理),再解决"会不会想"(k1.5 的强化学习),最后解决"跑不跑得起"(K2 的稀疏化)。三步环环相扣,不是临时起意。
我个人的判断是,2026 年国产大模型的竞争焦点会进一步从模型本身转向"训练—推理—应用"的闭环效率。谁能把长上下文推理的单 token 成本继续压下来,谁就能在 Agent 赛道拿到先手。这个判断未必对,但至少它是个可以被数据证伪的假设,而不是一句空话。
关键要点速览:
- 演讲的核心信号是竞争重心从预训练规模转向后训练强化学习效率与推理工程化
- Kimi k1.5 砍掉 MCTS 与过程奖励模型,走的是长上下文 RL 的极简路线
- Mooncake 解决了长上下文推理的成本瓶颈,是 Agent 类应用的隐性基础设施
- K2 的 1T 总参数 / 32B 激活说明稀疏化是当前控制推理成本的主流解
- 开发者选型应优先看激活参数、长上下文衰减表现和多步任务稳定性,而非榜单排名
延伸阅读
- [VergeX AI工具导航](https://nav.vergex.cn) —— 国产大模型与 AI 工具的横向对照
- [大模型强化学习后训练方法梳理](/models/rl-post-training)
- [长上下文模型的工程实现](/models/long-context-engineering)
相关推荐
阅读相关专题:大模型技术演进专题持续追踪国产模型的架构迭代与训练方法变化,建议从「大模型训练范式」系列开始按顺序阅读。
查看工具推荐:想快速对比 Kimi、DeepSeek、通义等模型的实际能力差异,可前往 VergeX AI工具导航 查看实时更新的模型能力矩阵与选型建议。
订阅更新:VergeX 每周推送一期 AI 技术雷达简报,覆盖大模型训练、推理优化与工具生态动态,可通过站内邮件订阅或关注公众号获取。

