minimax创始人是谁?闫俊杰的国产大模型突围实战解析
2025年初,当MiniMax-Text-01以400万token的上下文窗口刷新行业纪录时,我正坐在深圳南山的一间共享办公空间里,跟几个做AI应用的朋友聊国产模型的选型问题。有人突然问了一句:“MiniMax背后到底是谁在操盘?”这个问题让我愣了一下——minimax创始人的低调程度,跟这家公司技术上的高调形成了鲜明反差。闫俊杰,前商汤科技副总裁,2021年底创立MiniMax,三年多时间把公司做到估值超过25亿美元。说实话,这个速度在国产大模型赛道里算得上第一梯队。
核心结论摘要:MiniMax创始人闫俊杰,前商汤科技副总裁,2021年底在上海创立MiniMax。他选择了一条“技术极致+产品多元”的路线,用MoE架构和线性注意力机制把推理成本压到行业低位,同时通过海螺AI、星野等C端产品反哺模型迭代。截至2025年,MiniMax估值超25亿美元,是国内少数同时在大模型API和消费级应用两端都跑通商业模式的公司。
minimax创始人是谁?从商汤副总裁到创业者的转身
闫俊杰的履历在国产大模型创始圈里算比较特别的一个。他不是从学术界直接跳出来创业的教授派,也不是大厂VP出来带资源变现的商务型选手。他是真正在一线带过大规模工程团队、亲手训练过工业级模型的技术操盘手。
在商汤期间,他担任副总裁,负责通用智能技术,深度参与了深度学习平台的搭建和多个行业落地项目。这段经历让他对两件事有了清醒认知:一是大规模分布式训练的工程复杂度远超学术论文描述;二是To B的AI项目很难形成标准化产品,每个客户都要定制,规模效应起不来。
2021年底,他决定出来单干。当时国内大模型赛道还没现在这么卷,百度文心还没正式发布,智谱AI也刚起步不久。MiniMax成立的时间点,坦白讲,卡得挺准。
有个细节我印象很深。2023年接受晚点LatePost采访时,闫俊杰说了一句话:“我们不是在做中国的OpenAI,我们是在做MiniMax。”这句话听起来像公关话术,但结合他们后来的产品策略看,确实跟其他家不太一样。
技术路线拆解:MoE架构+线性注意力,怎么把成本打下来
MiniMax的技术路线选择,是我认为最值得细看的部分。
为什么选MoE而不是Dense架构?
Mixture of Experts(混合专家)架构的核心思想是:每次推理只激活模型参数的一部分,而不是全部。打个比方,Dense模型像一家餐厅只有一个全能大厨,每道菜都得他来做;MoE模型像厨房里有十几个专项厨师,点川菜就激活川菜师傅,点粤菜就激活粤菜师傅,其他人在旁边待命。
根据MiniMax在2025年1月发布的MiniMax-Text-01技术报告,该模型总参数量为4560亿,但每次推理只激活约459亿参数——激活比例不到10%。这意味着推理成本大幅降低,而模型能力并没有同比例缩水。
线性注意力机制的工程取舍
传统Transformer的注意力机制计算复杂度是O(n²),n是序列长度。上下文一长,计算量爆炸式增长。MiniMax采用了一种混合架构:每8层Transformer中插入1层线性注意力层。
这不是纯线性注意力,而是混合方案。纯线性注意力虽然快,但表达能力会打折扣。混合架构相当于“高速公路+城市道路”的组合,既保证了整体速度,又不至于在复杂推理任务上掉链子。
| 对比维度 | MiniMax-Text-01 | 智谱GLM-4 | 百度文心4.0 | |---------|----------------|-----------|------------| | 总参数量 | 4560亿(MoE) | 未公开 | 未公开 | | 激活参数量 | 约459亿 | — | — | | 上下文窗口 | 400万token | 128K token | 128K token | | 架构特点 | MoE+混合线性注意力 | Dense为主 | 未详细披露 | | 发布时间 | 2025年1月 | 2024年 | 2024年 |
这个表格里的数据来自各家官方技术报告和发布会信息,可以看到MiniMax在上下文窗口这个指标上确实拉得比较开。
minimax创始人闫俊杰谈ai:不迷信Scaling Law,但也不放弃
闫俊杰在2024年WAIC的一场圆桌讨论中说过一段话,我觉得值得反复琢磨。大意是:Scaling Law仍然有效,但边际收益在递减,单纯堆参数的性价比越来越低,接下来的竞争在于架构效率和数据质量。
这个判断跟我在实际项目中的感受是一致的。去年我帮一个团队做长文档摘要系统,试过用某国产模型直接处理200页的PDF,结果上下文一超限就得切片,切片之后语义连贯性又出问题。后来换成MiniMax的API,400万token的窗口直接把整本书塞进去,效果确实好不少。当然,成本也不便宜,但至少技术上可行了。
闫俊杰还有一个观点让我印象很深。他在2024年底的一次内部交流中说,“多模态不是锦上添花,是大模型的标配能力”。MiniMax的产品线也印证了这一点——海螺AI做视频生成,星野做AI角色扮演,Talkie做海外市场,全部是原生多模态能力驱动的。
不过话说回来,这种“什么都做”的策略也有风险。资源分散,每条线都要跟垂直领域的头部玩家竞争。视频生成要面对可灵、Runway,角色扮演要面对Character.AI。MiniMax的应对方式是底层模型能力共享,上层产品快速试错——用一个模型底座支撑多个产品线,哪个跑出来就加码。
实战视角:MiniMax的产品矩阵和商业化路径
MiniMax目前的产品布局大致分三层:
底层:大模型API 提供文本、语音、视频三种模态的API服务,按token计费。这块是技术输出的主要通道,也是跟阿里云、火山引擎等云厂商合作的基础。
中层:海螺AI 主打视频生成和智能对话,2024年上线后用户增长很快。我实测过它的视频生成功能,输入“一只猫在雨天弹钢琴”这样带点意境的提示词,生成结果在光影处理上比早期的Runway Gen-2要好。
上层:星野/Talkie AI角色扮演类产品,国内版叫星野,海外版叫Talkie。这块的商业化模式是订阅制+虚拟道具,跑得还不错。根据Sensor Tower的数据,Talkie在2024年上半年曾进入美国App Store免费榜前50。
这种“API+产品”双轮驱动的模式,在国内大模型公司里不算主流。大部分公司要么专注API,要么专注C端产品。MiniMax两边都押,闫俊杰的解释是:API业务验证技术能力,C端产品验证用户需求,两个反馈回路缺一不可。
minimax创始人身价与公司估值
聊到minimax创始人身价,公开信息比较有限。MiniMax在2024年3月完成了一轮由阿里巴巴领投的6亿美元融资,估值超过25亿美元。闫俊杰作为创始人,持股比例未公开披露,但参照同类公司创始人的持股惯例(通常在15%-30%之间),其个人身价大致在数亿美元量级。
当然,这种估算很不精确。大模型公司的估值波动很大,受技术进展、商业化数据、资本市场情绪多重因素影响。2025年如果MiniMax启动IPO,估值可能会重新定价。
总结与学习路径
回头来看,minimax创始人闫俊杰给国产大模型赛道带来的最大启示,可能不是某个具体的技术突破,而是一种“工程效率优先”的创业哲学。在算力受限、资本环境收紧的条件下,不盲目跟风堆参数,而是从架构层面想办法把成本打下来,把产品体验做上去。
如果你对MiniMax的技术细节感兴趣,建议按这个路径深入:
- **先读技术报告**:MiniMax-Text-01的论文在arXiv上有公开版本,重点看MoE路由机制和线性注意力的混合比例设计
- **动手调API**:注册MiniMax开放平台,用长文档处理任务实测一下400万token上下文的实际表现
- **对比产品体验**:海螺AI和星野都提供免费额度,可以跟同类产品做横向对比
相关推荐
延伸阅读:
- [VergeX AI工具导航](https://nav.vergex.cn) — 收录MiniMax等国产大模型API的实测对比和价格汇总
- [国产大模型MoE架构对比](https://nav.vergex.cn) — 详细拆解各家的专家路由策略差异
订阅更新: 关注VergeX,获取国产大模型技术拆解和工具实测的第一时间推送。邮件订阅每周三发送,微信订阅搜索“VergeX技术雷达”。
关键要点速览:
- MiniMax创始人闫俊杰,前商汤科技副总裁,2021年底创立公司
- 核心技术路线:MoE架构+混合线性注意力,推理激活参数不到10%
- 商业化模式:API+海螺AI+星野/Talkie三层产品矩阵
- 2024年3月完成6亿美元融资,估值超25亿美元

