minimax是什么公司的?拆解这家国产大模型公司的技术路线
上周有个做企业知识库的朋友在群里问我「minimax是什么公司的」,我第一反应是极小化极大算法(Minimax Algorithm),回了句「那是博弈论里的搜索策略啊」。结果他说的是做海螺AI的那家公司。这个误会挺有代表性——Minimax这个词在搜索场景里同时指向两种完全不同的东西,一个是教科书里的决策算法,一个是2021年成立的中国大模型公司。
这篇就按我自己的理解,把这家公司从头到脚捋一遍:它是谁、模型怎么演进的、为什么突然开始大力开源、产品在哪里落地。
核心结论摘要:MiniMax(上海稀宇科技)是一家成立于2021年12月的中国大模型公司,创始人闫俊杰出自商汤。它以abab、MiniMax-01、M1、M2等自研模型为核心资产,同时运营海螺AI、星野等C端产品,是国内少有的把开源大模型与多模态生成两条线同时跑通的厂商。
一、MiniMax是什么公司?先厘清三个容易混淆的名字
这里最容易把人绕晕的是三个名字在同一个话题里反复出现:MiniMax(公司)、海螺AI(产品)、abab/M 系列(模型)。它们是同一家公司上下游的三层。
公司主体是上海稀宇科技有限公司,2021年12月成立。创始人闫俊杰是中科院自动化所博士,此前在商汤科技担任副总裁、通用智能技术负责人,也就是商汤通用模型那条线的直接负责人。这个背景挺关键——它决定了MiniMax从一开始就是「模型能力优先」而不是「应用优先」的团队配置。
资本层面,2024年3月阿里巴巴领投了约6亿美元的一轮融资,投后估值超过25亿美元(据2024年3月多家媒体报道的融资信息)。更早的投资方里还有米哈游、高瓴、IDG、红杉中国这些名字。到了2025年,公司向港交所递交了招股书,进入IPO流程,具体进度以港交所披露易的文件为准。
| 名称 | 指向什么 | 常见混淆点 | | --- | --- | --- | | MiniMax | 公司主体(上海稀宇科技) | 容易和Minimax博弈算法混淆 | | 海螺AI / Hailuo | C端产品,主打视频生成 | 被当成独立公司 | | abab / M1 / M2 | 自研大模型系列 | 被误认为是某个开源社区项目 | | 星野 / Talkie | AI角色互动应用(国内/海外) | 很少人知道它俩同源 |
有意思的是,星野和Talkie其实是同一套东西的两个版本,国内叫星野,海外叫Talkie,2024年一度冲进美国App Store免费榜前列。很多做海外投放的同行只知道Talkie,不知道背后是MiniMax。
二、模型谱系:从abab到M2的技术路线拆解
要回答「minimax是什么公司的模型」,得看它的模型迭代节奏。这家公司的路线变化比大多数国产厂商都要剧烈。
abab阶段(2022—2024):早期是abab系列,包括abab5.5、abab6、abab6.5、abab6.5s,走的是常规稠密模型路线,主要服务于自家的对话产品和API。这个阶段MiniMax对外声量不算大,属于闷头做模型的时期。
MiniMax-01阶段(2025年1月):转折点。团队发布了技术论文《MiniMax-01: Scaling Foundation Models with Lightning Attention》,提出用闪电注意力(Lightning Attention)替换大部分softmax注意力层,模型规模做到456B总参数、每token激活约45.9B。论文给出的上下文窗口达到400万token级别。这个设计的核心动机很直白——传统注意力机制在长上下文下计算量是平方级增长,而线性注意力能把它压到接近线性。
M1阶段(2025年6月):把「混合注意力+大规模强化学习」这套组合推到开源。M1采用的就是每8层中7层闪电注意力、1层softmax注意力的混合结构,同时团队在强化学习侧用了自研的CISPO算法,官方称训练收敛速度明显优于常规做法。
M2阶段(2025年10月):这一步挺反直觉的。M2把参数量降到230B总参数、10B激活,并且放弃混合注意力,回归全注意力机制,重心押在Agent和代码任务上。根据MiniMax官方在2025年10月发布的技术报告,M2在SWE-bench Verified上的成绩为69.4%,Terminal-Bench为46.4%。
| 模型 | 发布时间 | 架构特点 | 定位侧重 | | --- | --- | --- | --- | | abab6.5s | 2024年 | 稠密模型 | 通用对话 | | MiniMax-Text-01 | 2025年1月 | 456B MoE + 闪电注意力 | 超长上下文 | | MiniMax-M1 | 2025年6月 | 456B MoE + 混合注意力 | 长思考链推理 | | MiniMax-M2 | 2025年10月 | 230B MoE + 全注意力 | Agent与代码 |
三、开源路线背后的判断
坦白讲,M2从混合注意力退回全注意力这件事,我一开始是有点意外的。毕竟闪电注意力是自家论文的核心卖点,公开「降级」听起来像是自我否定。
但把两代模型的定位摊开看,逻辑其实很清楚。M1要解决的是「单次推理能扛多长的上下文」,所以线性注意力带来的效率优势是刚需;M2要解决的是「多轮工具调用能不能稳定走完」,Agent场景下的瓶颈不在上下文长度,而在每一步决策的准确率和指令遵循的稳定性。全注意力在短序列上的表达能力和训练稳定性更好,代价是长文本成本上升——对Agent来说这笔账是划算的。
这里还有个商业化上的考量。我在自己的测试环境里对比过M2和几个同价位模型跑代码修复任务,M2在「读懂仓库结构后定位到具体文件」这一步的成功率确实比同参数量级的开源模型高一截,但在纯长文档摘要场景下,反而不如M1省token。所以选型真的要看任务形态,不能只看榜单分数。
顺带说一句,MiniMax这两年选择把旗舰模型开源、走低价API的策略,和它要在Agent生态里抢开发者心智是配套的。闭源模型卖的是能力溢价,开源模型卖的是生态位——这两种生意的打法完全不同。
四、多模态与商业化:海螺AI、星野和语音模型
模型之外,MiniMax的产品线铺得比很多人以为的宽。
视频生成是海螺AI,2024年8月上线video-01模型,此后陆续迭代出图生视频、导演模式等能力,海外版Hailuo AI在视频创作者圈子里有一定口碑。语音方向是Speech系列,2025年4月发布的Speech-02在Artificial Analysis的语音合成评测榜单上曾登顶(以该榜单2025年4月的公开数据为准)。此外还有音乐生成Music系列和MiniMax Agent这类产品。
这几条线里,我个人觉得语音才是被低估的那条。原因很简单:视频生成是视觉冲击力强但商业化路径模糊的赛道,而语音合成是能直接塞进客服、有声书、教育硬件里的确定性需求。MiniMax在这块的积累,其实比它视频模型的讨论度高得多。
五、实战:怎么调用MiniMax的模型
想实际用上它的模型,最直接的是开放平台。MiniMax提供了OpenAI兼容的接口,迁移成本很低,我自己的脚本基本就是改两行配置。
依赖:pip install openai
from openai import OpenAI
client = OpenAI( api_key="你的API Key", # 在 platform.minimaxi.com 账户管理中获取 base_url="https://api.minimax.chat/v1", # MiniMax 的 OpenAI 兼容端点 )
resp = client.chat.completions.create( model="MiniMax-M2", # 可替换为 MiniMax-M1、abab6.5s-chat 等 messages=[ {"role": "system", "content": "你是一名严谨的代码审查助手"}, {"role": "user", "content": "这段Python为什么会有内存泄漏?"}, ], temperature=0.3, # 代码类任务建议压低温度 stream=True, # 流式输出,长回答体验更好 )
for chunk in resp: # 逐块读取流式返回 delta = chunk.choices[0].delta.content if delta: print(delta, end="")
价格方面,M2在海外定价大概是输入0.3美元/百万token、输出1.2美元/百万token这个量级,M1则按上下文长度分档计费,200K以内更便宜。具体数字会调整,建议直接看官网定价页(我写这篇时查的是2025年11月的版本)。
选型上给个粗略的判断:
- **长文档、大知识库问答** → 优先考虑M1,它的成本结构对长上下文更友好
- **代码Agent、多轮工具调用** → 优先M2,指令遵循更稳
- **中文角色扮演、对话产品** → 星野背后的模型系列,情感表达调得比较细
- **视频素材生成** → 直接走海螺AI,别自己接模型
想横向看看其他国产大模型的价格和能力对比,可以翻一下VergeX 的国产大模型工具清单,我平时做选型会先在那里过一遍。
总结与展望
MiniMax这家公司的辨识度,其实不在于某一代模型的跑分,而在于它敢在半年内把架构方案推翻重来——从闪电注意力到混合注意力,再回到全注意力。这种调整速度在国内团队里不多见,也说明它对「模型能力服务什么场景」这件事想得比较清楚。
至于未来,我比较关注两个点:一是M2这条Agent路线能不能在开源生态里沉淀出真正的开发者粘性;二是IPO之后,公司在C端产品上的投入会不会被资本市场牵着走。这两件事的答案,大概未来一年就能看到轮廓。
关键要点速览:
- MiniMax是上海稀宇科技,2021年12月成立,创始人闫俊杰曾任商汤科技副总裁
- 模型路线经历过abab → MiniMax-01(闪电注意力)→ M1(混合注意力)→ M2(全注意力)四次大调整
- M2主打Agent与代码能力,230B总参数、10B激活,官方报告称SWE-bench Verified成绩69.4%
- 产品线覆盖海螺AI(视频)、星野/Talkie(角色对话)、Speech(语音合成)
- 选型关键看任务形态:长上下文选M1,Agent任务选M2,不要只看榜单
相关推荐
- **阅读相关专题**:想继续了解其他国产大模型团队的定位与技术路线,可以关注 VergeX 的「大模型厂商图谱」系列,我们会持续更新各家模型的开源状态、定价与实测表现。
- **查看工具推荐**:完整的国产大模型 API 对比、免费额度清单和调用示例,都整理在 [VergeX AI 工具导航](https://nav.vergex.cn)。
- **订阅更新**:VergeX 每周推送一期 AI 技术雷达简报,覆盖新模型发布、论文解读和实用工具,可通过站内邮件订阅或关注公众号获取。

