MiniMax创始人谈AI:国产大模型如何走差异化路线
2025年6月,MiniMax开源了M1——一个总参数456B、激活参数45.9B的推理模型,上下文窗口开到100万token。同一个月,创始人闫俊杰密集接受了数轮媒体访谈。我把官方技术报告和几篇访谈记录翻完之后,最大的感受是:这家公司的叙事方式和大部分国产大模型团队不太一样。他们很少提"对标GPT-4",反而在反复算一笔账——每一块钱的推理成本,能换回多少有效智能。
核心结论摘要:MiniMax创始人谈AI的逻辑可以浓缩成三句话——模型能力本身是唯一护城河,架构创新(线性注意力+MoE)是压低推理成本的关键抓手,产品必须长在模型之上、而不是套在模型之外。
闫俊杰的底牌:技术派出身决定了叙事方式
闫俊杰是中科院博士,创业前在商汤担任副总裁、通用智能技术负责人。2021年12月他创办MiniMax的时候,ChatGPT还要再过将近一年才发布。这个时间点很关键——它不是跟着风口起来的团队,而是在风口之前就已经在赌一件事:通用模型能力会持续变便宜、变强,最终变成基础设施。
团队早期产品走的也不是"先做一个聊天机器人"的路子。Glow(后来的星野)做AI社交,Talkie打海外陪伴市场,海螺AI切视频生成。乍看很分散,其实背后是同一个判断:没有应用侧的真实用户数据回流,模型迭代会失去方向。
坦白讲,我第一次看到这个产品矩阵时是有点困惑的。但把闫俊杰的几次公开表达串起来看,逻辑就通了——他不太相信"先把模型做到最强,再想怎么用"这条路径。
MiniMax创始人谈AI的四个核心判断
MiniMax创始人谈AI时反复回到的几个判断,我认为值得单独拆开说。这些判断不是抽象口号,都能在技术报告里找到对应动作。
判断一:模型即产品,不做纯中间层。 闫俊杰在公开访谈中表达过一个态度:如果只是调用别人的模型做一层包装,长期没有壁垒。这也解释了为什么MiniMax从第一天就自研底层架构,而不是做应用集成商。
判断二:推理成本决定生死。 这是MiniMax技术路线里最有辨识度的一点。大模型训练贵,但真正拖垮商业模型的是推理——每一次对话、每一次视频生成都在烧钱。所以他们的架构选择几乎全部围绕"单位token成本"展开。
判断三:开源是手段,不是情怀。 M1选择开源,在国产头部团队里并不常见。从结果看,这是一次开发者生态的卡位——让研究者用起来、让企业低成本试起来。
判断四:多模态不是加分项,是必选项。 MiniMax-VL-01与文本模型同期发布,海螺AI视频模型持续迭代,这条线一直没停。
技术拆解:线性注意力、MoE与RL算法到底改了什么
要理解MiniMax创始人谈AI时的底气,得落到具体架构上。以下是三个最关键的改动。
Lightning Attention(线性注意力) 是指把标准注意力的O(n²)复杂度降到接近O(n)的机制。根据MiniMax官方技术报告《MiniMax-01: Scaling Foundation Models with Lightning Attention》(2025年1月),模型每8层里有7层使用线性注意力,只有1层保留标准softmax注意力。这种混合设计既保住了长上下文的效果,又把推理时的KV缓存压力大幅削掉。
MoE(混合专家) 在这里的作用是"参数大、激活少"。456B总参数听起来吓人,但每次前向只激活约45.9B,实际计算量接近一个中型稠密模型。
CISPO强化学习算法 出现在M1的技术报告里(《MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention》,2025年6月)。它只对被选中的部分token计算梯度,官方给出的说法是显著降低了长序列RL训练的开销。
| 模型 | 发布时间 | 总参数 | 激活参数 | 上下文长度 | 核心机制 | |------|---------|--------|---------|-----------|---------| | MiniMax-Text-01 | 2025年1月 | 456B | 45.9B | 100万token | 混合Lightning Attention + MoE | | MiniMax-M1 | 2025年6月 | 456B | 45.9B | 100万输入 / 40K输出 | 同上 + CISPO强化学习 | | MiniMax-VL-01 | 2025年1月 | 未公开 | 未公开 | 100万token | ViT + 图像适配器 |
这张表里最值得盯的是"上下文长度"那一列。100万token意味着什么?大概是一本《三体》三部曲的体量能一次性塞进去。我在做一个合同比对的小工具时试过类似的长上下文模型,说实话,把几十份PDF直接丢进去提问,比传统RAG切片的体验要顺——当然代价是你要接受更长的首token延迟。
开发者怎么用:从API到实际场景
聊完原理,回到能上手操作的部分。
接入MiniMax的模型,最省事的路径是走它兼容OpenAI协议的API。下面这段代码可以直接跑,注意把key换成自己的:
from openai import OpenAI
MiniMax 开放平台兼容 OpenAI SDK,改 base_url 即可
client = OpenAI( api_key="你的MiniMax_API_Key", base_url="https://api.minimax.chat/v1" )
resp = client.chat.completions.create( model="MiniMax-Text-01", # 具体模型名以官方文档为准 messages=[ {"role": "system", "content": "你是一个严谨的技术助手"}, {"role": "user", "content": "用三句话说明线性注意力为什么能降低推理成本"} ], temperature=0.7 )
print(resp.choices[0].message.content)
几个我踩过坑的地方:
- **长上下文不等于免费。** 100万token能吃进去,但计费和延迟都跟着涨,别拿它当无脑方案。
- **模型名要对着官方文档核对。** 平台模型ID更新比较频繁,硬编码容易报错。
- **推理类任务优先试M1。** 它在数学和代码上的表现比通用对话模型更稳。
想横向对比其他国产大模型的接入方式,可以翻一下VergeX的大模型工具导航,里面按场景做了分类。
我的判断:这条路线能走多远
说点个人看法。
MiniMax创始人谈AI时表现出的克制,我觉得是这个团队最值钱的地方。国内很多团队在2023年那波浪潮里选择了"参数军备竞赛",堆到千亿、万亿,但推理成本没人敢算。MiniMax反着来,把工程优化放在第一位——这在短期看不够性感,长期看却是唯一能跑通商业闭环的路。
但这条路也有风险。线性注意力在极端长文本上的效果衰减,学界一直有争论;开源M1能带来开发者好感,能不能转化成收入是另一回事。我个人不太看好"开源换生态"在两年内直接变现,它更像是一种防守性投入。
不过话说回来,如果推理成本真能持续压到别人的三分之一,那这件事本身就已经是护城河了。
关键要点速览
- MiniMax创始人闫俊杰是前商汤副总裁,2021年12月创业,比ChatGPT早近一年。
- MiniMax创始人谈AI的核心判断是"模型即产品",不做纯中间层包装。
- 技术路线的关键词是混合Lightning Attention + MoE,目标是把单位token推理成本打下来。
- M1(2025年6月)用CISPO算法降低长序列RL训练开销,并选择开源。
- 开发者可以通过兼容OpenAI协议的API低成本接入,模型名以官方文档为准。
相关推荐
- **阅读相关专题**:想系统了解国产大模型的技术路线分野,可以继续浏览VergeX「大模型」分类下的架构对比与推理优化内容。
- **查看工具推荐**:需要选型、比价或找接入文档,直接去 [VergeX AI工具导航](https://nav.vergex.cn) 按场景筛选。
- **订阅更新**:MiniMax后续模型迭代和开源动作我们会持续跟进,欢迎订阅VergeX的邮件或微信推送,第一时间收到解析。
延伸阅读
- [VergeX AI工具导航](https://nav.vergex.cn)——大模型、多模态、视频生成工具一站汇总
- [VergeX 大模型专题](https://nav.vergex.cn)——训练、推理、部署相关的深度内容合集

