MiniMax创始人闫俊杰谈AI:国产大模型突围实战指南

本文实测梳理MiniMax创始人闫俊杰谈AI的核心观点,涵盖大模型训练路线、推理成本控制与多模态布局,帮助读者看懂国产大模型的突围逻辑与落地方法。

MiniMax创始人闫俊杰谈AI:国产大模型突围实战指南

2024年我跑了好几场AI行业沙龙,发现一个有意思的现象:只要聊到国产大模型的技术路线,Minimax创始人闫俊杰谈AI的那些发言,总会被同行翻出来反复咀嚼。不是因为他讲得多玄乎——恰恰相反,他说的东西经常让人"不舒服"。

核心结论摘要:MiniMax创始人闫俊杰谈AI,可以浓缩成一句话——国产大模型不能只在应用层做"套壳生意",必须在模型架构、推理效率和多模态能力上建立底层优势。他把MoE架构视为效率突破口,把Agent看作下一阶段的产品形态,多模态统一则是长期押注。

这篇不打算做新闻稿复读。我会结合自己跑模型、做产品的经历,把闫俊杰谈AI的几个关键判断拆开聊,顺便说清楚哪些我认同,哪些我保留意见。

闫俊杰是谁,他的观点凭什么值得听

先给不熟悉的朋友补个背景。闫俊杰是中科院博士出身,曾在商汤科技做到副总裁、研究院副院长,2021年底创立MiniMax。这家公司你可能没直接注册过,但它的产品大概率刷到过——海螺AI、星野、Talkie,都是MiniMax的手笔。据多家媒体报道,MiniMax在2024年完成新一轮融资,估值超过25亿美元。

闫俊杰的特别之处在于,他是国内少有的既做底层模型、又亲自盯C端产品的创始人。这种双重身份让他的判断往往比纯学术派更"接地气",也比纯产品派多一层技术纵深。我个人觉得,这正是Minimax创始人闫俊杰谈AI值得细读的原因——他被迫在两套逻辑之间反复权衡,而大多数创业者只站在其中一边。

三层技术判断:从训练、推理到多模态

大模型训练:不做"套壳"的底层执念

闫俊杰反复强调一个观点:如果一家公司只是调用别人的API做应用,那它本质上不是AI公司。这话听着刺耳,但逻辑是成立的。API是租来的,模型能力的天花板由别人决定,你今天做出的爆款,明天对手改一次价格策略就可能土崩瓦解。

那怎么建立底层优势?MiniMax给出的答案之一是MoE架构。据MiniMax官方2024年4月发布的abab 6.5技术资料,该模型采用MoE(混合专家)架构,在保持参数规模的同时降低单次推理的激活参数量。说白了,就是让模型"按需调用脑细胞",而不是每次推理都把整个大脑点亮一遍。

坦白讲,MoE不是什么独家秘方,DeepSeek、Mistral都在用。但MiniMax落得比较早、比较彻底。这里我想插入一段自己的判断:MoE真正难的不是架构本身,而是路由训练的稳定性。我自己复现过小规模MoE,最头疼的就是专家负载不均——少数专家被反复激活,其余专家"躺平",最后模型退化回稠密结构。所以闫俊杰谈AI时强调训练侧的工程能力,不是客套话,是踩过坑的人才有的体感。

大模型推理:成本才是生死线

模型训出来只是第一步,真正的战场在推理成本上。这一层我特别有共鸣。

据斯坦福大学《AI Index 2024》报告(2024年4月发布),前沿模型的推理成本在18个月内下降了约280倍,远超训练成本的下降速度。这个数字背后是一整套工程优化:量化、KV Cache复用、批处理调度、投机解码……闫俊杰谈AI时多次提到,成本控制能力直接决定了商业化的天花板。

我去年帮一个团队做过推理服务选型,结论很扎心:同一个开源模型,配置优化得好和优化得差,单位token成本能差出5倍以上。所以国产大模型如果只拼"谁的评测分数高",是拼不出护城河的——高分数低效率,规模化时就是烧钱黑洞。

多模态大模型:文本、语音、视频的统一战场

闫俊杰谈AI时,多模态是出现频率最高的词之一。他的判断是:未来不该有"文生文""文生图"这么细的分工,而应该有一个统一的多模态底座。海螺AI视频生成在2024年下半年出圈,某种程度上就是这个判断的一次公开验证。

统一底座的诱惑在于数据复用和任务迁移。但难点也明显——不同模态的数据分布差异极大,对齐成本高,训练稳定性差。我的看法是,多模态统一是方向没错,但短期内更现实的路径是"共享骨干 + 模态适配头",而不是把所有模态硬塞进同一个表征空间。

一张表看懂:闫俊杰的判断 vs 行业现状

| 维度 | 闫俊杰的核心判断 | 行业主流做法 | 落地难点 | |---|---|---|---| | 模型架构 | MoE是效率必经之路 | 部分公司仍押注稠密模型 | 路由训练不稳定、专家负载不均 | | 推理成本 | 成本决定商业化天花板 | 靠融资补贴换规模增长 | 边际成本压不下去 | | 多模态 | 统一底座优于单点能力 | 各模态独立迭代 | 跨模态数据对齐成本高 | | 产品形态 | Agent是下一个入口 | 以聊天机器人为主要形态 | 长任务稳定性差、错误累积 |

这张表我改了三四版。核心想表达的是:判断本身不难获取,难的是每条判断落到工程细节上都要付出真金白银的代价。闫俊杰谈AI之所以有价值,是因为他把这些代价摆在台面上说,而不是只画饼。

实战应用:把判断落到自己的项目里

如果你不是创业者,只是想用好这些观点,我整理了几条可操作的建议:

  • **选模型先看推理成本结构**,不要只盯榜单分数。跑一个真实业务场景的压测,算清每千token的落地成本,再决定用谁。
  • **做多模态应用时,优先验证数据链路**。模型能力往往是够的,卡住项目的通常是数据标注、清洗和对齐。
  • **押注Agent前先想清楚容错机制**。Agent的多步推理会累积错误,没有断点重试和人工兜底,线上事故率会很难看。
  • **关注MoE的服务化部署**。MoE推理对显存和调度要求更高,自建服务需要提前评估硬件预算。

这些不是纸上谈兵。我在实际项目中发现,第一条和第三条能帮团队省下最多的试错预算——很多人卡在"选错模型 + Agent失控"这两件事上。

冷思考:哪些判断我持保留意见

说点不同意的。闫俊杰谈AI时对"统一多模态底座"的乐观,我认为略微超前。统一模型在演示场景很惊艳,但真到垂直行业,客户要的往往是"小而准的专用模型",而不是"大而全的通用模型"。通用底座的边际价值在B端可能低于预期。

另外,Agent作为入口的判断,我部分认同但保持警惕。Agent的体验上限很高,但工程上限很低——一个工具调用失败、一次上下文丢失,用户体验就崩了。这条路要走通,恐怕还要一两年。

总结与学习路径

回头看,Minimax创始人闫俊杰谈AI对我最大的启发不是某个具体结论,而是他看问题的方式:从底层架构推导商业结果,而不是反过来。这种思路在AI行业尤其稀缺,因为大多数人都在追热点,而不是追第一性原理。

如果你想顺着这条线深入学习,我的路径建议是:先补MoE和Transformer的架构基础,再动手复现一个小规模推理服务,最后带着成本视角去看各家模型的技术报告。顺序别倒过来,否则容易停在"看懂新闻"的层面。

关键要点速览:

  1. 闫俊杰强调底层架构能力,反对纯应用层套壳
  2. MoE是效率突破口,但工程难点在路由训练稳定性
  3. 推理成本而非评测分数,才是商业化的真正瓶颈
  4. 多模态统一是方向,短期内"共享骨干+适配头"更现实
  5. Agent前景被看好,但容错机制是落地前提

相关推荐

  • **阅读相关专题**:想继续深入国产大模型的技术路线,可以浏览我们的大模型架构专题,横向对比MoE、稠密模型与多模态方案的取舍。
  • **查看工具推荐**:想找当前主流的AI模型与开发工具,欢迎访问 [VergeX AI工具导航](https://nav.vergex.cn),一站对比国内外大模型API、Agent框架和推理服务。
  • **订阅更新**:VergeX 持续追踪AI前沿技术动态,可通过邮件或微信订阅,第一时间收到大模型领域的新内容。
大模型

MiniMax是什么公司有没有食堂?AI大模型公司底细核查实录

2026-10-2 18:21:27

大模型

MiniMax code能力排行怎样?拆开三大榜单看真实水平

2026-10-2 18:21:39

0 条回复 A文章作者 M管理员
VergeX|科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索