MiniMax是哪家公司的大模型?厂商溯源与实测选型指南
上周技术群里有人甩出一句"minimax是哪家公司的大模型",底下七八个人接话,答案从"字节的"到"好像是阿里的"都有。我当时看着挺意外——MiniMax在开发者圈子的存在感不算低,可在更广的中文互联网语境里,它的品牌认知度确实远不如通义千问或者文心一言。更麻烦的是它的模型命名:一边是"abab6.5"这种看着像乱码的代号,一边是"MiniMax-M2"这种明显改过品牌策略的新名字,不熟悉的人很容易以为是两家公司的产品。
这篇就把这个问题一次说透。我会先给结论,再拆技术路线,最后落到实际调用和选型上。
核心结论摘要:MiniMax(中文名"上海稀宇科技")是一家2021年12月成立于上海的人工智能公司,由前商汤科技副总裁闫俊杰创办。它对外提供的abab系列、MiniMax-01系列、M1/M2等模型全部是自研的,不是任何大厂"授权"或"开源转售"的产物。
一、直接回答:MiniMax到底是哪家公司的
先把最容易混淆的点理清:MiniMax大模型是MiniMax公司自己的模型,公司即产品的同名方,英文品牌MiniMax,中文注册实体为上海稀宇科技有限公司。
这个答案听起来简单,但混淆的来源很真实。一是它早期主推的模型叫"abab",跟公司名毫无关联,很多人只记住了abab却不知道谁做的;二是2025年之后它把模型统一改名为"MiniMax-01""MiniMax-M2",品牌才和模型对齐;三是它的投资方名单里有腾讯、阿里巴巴、米哈游、IDG、高瓴、红杉中国这些如雷贯耳的名字,不少人误以为它是"腾讯系"或"阿里系"的模型——投资关系和研发归属是两码事,这点必须区分清楚。
想系统看它在国产阵营里的位置,可以参考这篇国产大模型厂商格局梳理,横向对比会更直观。
二、从商汤到独角兽:这家公司的技术底色
创始人闫俊杰是中科院博士,在商汤科技做到副总裁、研究院副院长,负责过通用智能技术方向。联合创始人周彧聪同样出自商汤研究院,带过算法团队。早期核心成员里,商汤、字节跳动、微软亚洲研究院的背景占了相当比例。
有意思的是公司名字的来历——minimax是博弈论里的经典算法,指的是在零和博弈中"最小化最坏情况下的损失"。给公司起这个名字,某种程度上暴露了团队的性格:在不确定的环境里优先控制下行风险,而不是一味押注最大收益。这个思路后来直接体现在他们的技术选择上,后面会讲。
产品侧的时间线大致是这样:2022年推出AI社交应用Glow,2023年海外版Talkie和国内版星野先后上线,这两个产品积累了海量的多轮对话数据。我2023年底做角色扮演类产品调研时深度试过星野,当时最直观的感受是它的角色一致性明显强于同期几个竞品,这背后大概率就是自有模型+自有数据闭环带来的优势。
三、模型家族演进:从abab到M2
MiniMax的模型迭代速度在国产阵营里算是相当快的,命名也经历了一次彻底换代。
| 模型 | 发布时间 | 总参数 | 激活参数 | 上下文长度 | 开源情况 | |---|---|---|---|---|---| | abab6.5 / abab6.5s | 2024年初 | 未公开 | 未公开 | 200K | 闭源商用 | | MiniMax-Text-01 | 2025年1月 | 456B | 45.9B | 4M | 开源 | | MiniMax-M1 | 2025年6月 | 456B | 45.9B | 1M | 开源 | | MiniMax-M2 | 2025年10月 | 230B | 10B | 204K | 开源 |
数据来源:MiniMax官方技术报告《MiniMax-01: Scaling Foundation Models with Lightning Attention》(2025年1月)与MiniMax-M2官方发布博客(2025年10月)。
abab时代的模型基本是闭源商用,走API调用路线,主打长上下文和角色扮演场景。2025年1月的MiniMax-01系列是个转折点——这是国内第一批把混合线性注意力架构做成400B级别并开源的工作,一下把技术声量拉了起来。到了M2,策略又变了:总参数从456B砍到230B,激活参数直接压到10B,上下文从4M缩到204K,明显是冲着"agent和编码场景要好用、要便宜"去的。
四、技术拆解:为什么它死磕线性注意力
要理解MiniMax的技术路线,绕不开一个数字:O(n²)。
标准Transformer的注意力机制复杂度是序列长度的平方,上下文翻一倍,计算量翻四倍。这是长上下文模型最大的成本瓶颈。MiniMax的解法是混合架构:在每一组8层Transformer里,7层用Lightning Attention(线性注意力,复杂度接近O(n)),只留1层用标准softmax注意力。
为什么不全换成线性注意力?说实话这是个工程上的妥协。线性注意力虽然快,但在需要精确"大海捞针"式检索的场景里,精度往往不如标准注意力。保留一层做全局精确匹配,是在效率和准确性之间找平衡点。想补MoE和注意力机制的基础,MoE混合专家架构入门这篇讲得比较细。
另一个关键设计是MoE。456B总参数只激活45.9B,意味着推理时的实际计算量接近一个50B量级的稠密模型,但模型容量是它的九倍。M2更激进,230B总参数只激活10B。我的判断是,这条路线的核心赌注在于"稀疏化程度还能再往上推"——如果10B激活能撑住agent任务,那推理成本就能压到很多中型团队愿意自建部署的区间。
五、动手试试:调用MiniMax大模型
MiniMax开放平台提供OpenAI兼容接口,迁移成本很低。下面这段代码我实测跑通过:
安装依赖: pip install openai
注意: base_url 与模型名请以 MiniMax 官方文档最新说明为准
from openai import OpenAI
client = OpenAI( api_key="你的MINIMAX_API_KEY", # 从开放平台控制台获取 base_url="https://api.minimax.chat/v1" # 国内站接口地址 )
resp = client.chat.completions.create( model="MiniMax-M2", # 也可切换为 abab6.5s 等 messages=[ {"role": "system", "content": "你是一位严谨的技术文档编辑。"}, {"role": "user", "content": "用三句话解释什么是混合专家架构。"} ], temperature=0.7, max_tokens=512 )
print(resp.choices[0].message.content)
几个实测提醒:国内站和国际站的接入地址、模型名清单并不完全一致,跨区调用前务必先核对官方文档;另外M2在长链工具调用场景下对system prompt比较敏感,把工具描述写清楚比堆参数更有效。
六、什么场景该选它
结合我这两年的使用和跟同行交流的情况,给几个具体建议:
- **角色扮演、情感陪伴类产品**:MiniMax是最对口的选项之一,星野和Talkie本身就是最好的验证案例,多轮人设一致性是它的长板。
- **超长文档处理**:需要吃下整本书或超长代码库时,M1的1M上下文和Text-01的4M上下文值得优先测试,但要注意长上下文的实际召回质量会随长度衰减,别只看标称值。
- **Agent与编码任务**:选M2。10B激活参数带来的成本优势,在需要反复调用的agent循环里会被放大很多倍。
- **多模态场景**:MiniMax-VL-01负责图文理解,视频生成看海螺AI的视频模型,这两条线是分开的,别混为一谈。
七、总结与学习路径
回到最初那个问题——minimax是哪家公司的大模型?答案就是它自己家:一家从商汤系走出来、以上海为基地、靠社交产品养数据、用线性注意力+MoE做技术差异化的公司。它不算国产阵营里参数最大的,但技术路线是少数派里最坚定的一家。
如果你刚开始接触,我建议的路径是:先跑通上面的API示例,用一个真实的小需求(比如批量处理长文档摘要)压测成本和延迟,再决定要不要深入。别一上来就啃技术报告,那玩意儿容易劝退。
关键要点速览
- MiniMax = 上海稀宇科技,2021年12月成立,创始人闫俊杰出自商汤科技。
- 模型全部自研,与腾讯、阿里的关系仅为投资方,非研发归属。
- 产品线从闭源abab系列转向开源MiniMax-01/M系列,2025年1月是分水岭。
- 技术标签是"混合线性注意力 + MoE",核心目标是压低长上下文和推理成本。
- M2把激活参数压到10B,是当前性价比路线里值得优先测试的选项。
相关推荐
- **阅读相关专题**:想继续深挖国产大模型的架构差异,可以翻翻我们的大模型技术专题,里面横向对比了多家厂商的注意力机制选型。
- **查看工具推荐**:更多主流大模型API、开发框架和评测工具,都在 [VergeX AI工具导航](https://nav.vergex.cn) 里,按类别整理好了。
- **订阅更新**:VergeX 每周更新AI前沿资讯与实测报告,可通过站内邮件订阅或关注公众号获取推送。
延伸阅读
- [大模型 API 调用实战](https://vergex.cn/llm-api-guide)
- [多模态大模型技术专题](https://vergex.cn/multimodal)

