MiniMax模型连续五周全球第一,背后靠什么?

本文实测MiniMax模型连续五周全球第一这一现象,涵盖榜单口径拆解、M2的MoE架构取舍和真实API调用成本,帮助读者判断它是否值得接进自己的生产管线。

MiniMax模型连续五周全球第一,背后靠什么?

十月底那阵子,我正为一个中文合同信息抽取的批处理任务算账——每个月光是调闭源模型的 API 就要烧掉小两千美元,老板已经开始在周会上旁敲侧击。那天半夜刷 OpenRouter 的榜单,看到 MiniMax M2 挂在文本模型 token 调用量第一位,第一反应是"又一个刷榜的吧"。结果接下来一周、两周、三周,它还在那儿。到十一月下旬,这个位置它已经坐了五周。

这就是"MiniMax模型连续五周全球第一"这件事的由来。但坦白讲,我第一次看到相关的自媒体标题时是存疑的——"全球第一"四个字太重了,容易被误读成跑分第一或者能力全面碾压。真实情况是:这是 OpenRouter 公开榜单上按 token 调用量统计的第一,是开发者真金白银投出来的票,不是实验室里的分数。这两者之间的距离,比很多人想象的要大。

这个"全球第一"到底是谁在排?

先把口径说清楚,不然讨论没有意义。

OpenRouter 是一个模型聚合路由平台,开发者通过它一个接口调用各家模型,平台会把所有请求的 token 量公开成排行榜。它的统计逻辑很简单:谁处理的 token 多,谁排前面。这跟 LMSYS 那种人类投票榜、或者 Artificial Analysis 那种综合评测榜完全不是一回事。

| 榜单类型 | 统计依据 | 反映什么 | 容易被什么影响 | |---|---|---|---| | OpenRouter 排行 | 实际 token 调用量 | 开发者用脚投票的结果 | 价格、限流、免费额度 | | LMSYS Arena | 人类盲测投票 | 主观偏好 | 前端体验、回答长度 | | Artificial Analysis | 标准化题目跑分 | 能力上限 | 题目分布、训练数据重合 | | SWE-bench Verified | 真实仓库修 bug | 代码实战能力 | 脚手架设计、重试次数 |

看明白了这张表你就知道,OpenRouter 第一说明的不是"最强",而是"被最多人选择"。而选择的背后通常是三个字:性价比。

时间线上也基本对得上。M2 是 10 月下旬正式开源并上线的,官方那个月放出了技术博客和 Hugging Face 权重。上线之后它的排名就一路往上爬,从十月底到现在基本没让出过第一的位置。我没有逐日截图保存,但这个结论你去 OpenRouter 的排行榜页面翻一下趋势图就能自己验证——我一直觉得,任何声称"某模型排名第 X"的说法,都应该给读者留下自行核对的路径。

M2 的架构取舍:为什么 10B 激活能打

这一节是我想多说几句的地方,也是我认为大多数中文报道没讲透的部分。

根据 MiniMax 官方在 2025 年 10 月发布的开源说明,M2 是一个混合专家(MoE)架构的模型,总参数约 230B,但每个 token 实际激活的参数只有 10B 左右。这个比例相当激进——同期不少开源 MoE 的激活比例都在 15% 到 20% 之间。

核心思路拆开看是这样的:MoE 的本质是把一个大模型拆成很多个"专家"子网络,每次前向只激活其中一小撮。这意味着你的显存里要装下全部 230B 的权重(或者至少装下能高频命中的那部分),但每次计算只消耗 10B 的算力。推理成本由算力决定,所以你的账单是按 10B 算的,而模型的知识容量是 230B 量级。这个杠杆就是 MoE 的全部意义。

有意思的是 M2 在注意力机制上的选择。前代 MiniMax-Text-01 和 M1 主打的是 Lightning Attention——一种线性注意力方案,好处是百万级上下文下计算量几乎线性增长,长文本场景非常省。但 M2 反而回到了更常规的注意力配置。我在读完它的开源说明后大概理解了取舍:M1 那一代是要在"超长上下文"这个单项上打出差异化,而 M2 的目标变成了 agent 场景下的稳定性和工具调用准确率。在这个目标下,长上下文的边际收益没那么高,把工程复杂度降下来、把 RL 训练跑通才是正事。

顺带说一句,这个判断我未必对,但从它同期公开的强化学习方案(M1 论文里提出的 CISPO 那套裁剪重要性采样的思路)来看,MiniMax 在 RL 训练上的投入是持续加码的,M2 的交错思维(interleaved thinking)能力应该就是从那里长出来的——模型在调用工具之间会插入思考片段,而不是一次性想完再动手。这在多轮 agent 任务里的实际差别,比跑分上那几分要大得多。

我的深度解读是:M2 这波能坐稳 OpenRouter 第一,本质不是单点技术突破,而是一次非常精准的定位——把"够用的智能水平"乘上"极低的单位成本",再乘上"原生面向 agent 的工具调用设计"。 这三者单独拿出来都不算惊艳,但乘在一起,对一个正在做批处理、做爬虫解析、做代码 agent 的团队来说,就变成了绕不开的选项。技术圈的排名从来不只是技术的排名,它是技术、价格和场景匹配度的乘积。

我在真实项目里怎么用它

说回开头那个合同抽取任务。我的做法是双轨:先用 M2 跑一遍全量数据,把置信度低的那部分挑出来,再丢给贵的闭源模型复核。

实际跑下来,两千多份中文合同的字段抽取,M2 一遍过的准确率大约在 88% 到 91% 之间(按我自己的抽样标注口径,不是官方数字),剩下那 10% 左右走复核通道。整体成本从每月接近两千美元降到了两百多美元这个量级。这个降幅比我预期的还大一些,说实话有点意外。

不过话说回来,它也不是没有短板。我遇到过两次比较明显的问题:一次是处理超长表格(单份文档超过 8 万 token)时,模型对表格中间部分的字段出现了遗漏;另一次是它对某些行业黑话的理解明显不如某闭源模型,需要我在 system prompt 里补一段术语表。所以如果你做的是高度专业领域的抽取,别指望开箱即用,prompt 工程还是要做的。

横向对比:M2、DeepSeek、Qwen 怎么选

这三个是目前国产开源模型里被讨论最多的。我把大家最关心的几个维度列一下(价格以各官方定价页 2025 年 11 月的公开信息为准,具体请以你调用时的实际价格为准):

| 维度 | MiniMax M2 | DeepSeek 系列 | Qwen 开源系列 | |---|---|---|---| | 架构特点 | MoE,激活约 10B | MoE,激活参数较集中 | 密集 + MoE 双线布局 | | 工具调用 | 原生 agent 优化,交错思维 | 支持良好 | 支持良好,生态工具多 | | 上下文长度 | 长上下文支持 | 长上下文支持 | 多档位可选 | | 开源许可 | 开源权重 | 开源权重 | 开源权重,商用相对宽松 | | 适配成本 | OpenAI 兼容接口 | OpenAI 兼容接口 | OpenAI 兼容接口 |

我个人的选型逻辑很简单:如果你的场景是 agent、工具调用、批量结构化抽取,优先试 M2;如果是纯中文写作和知识问答,Qwen 的调性更贴;如果是数学推理和复杂代码,DeepSeek 那条线我仍然更放心。这三个不是替代关系,同一个系统里混用完全正常——我自己就是混着用的。

上手路径:三行代码接进来

M2 提供 OpenAI 兼容的接口,对已经有 OpenAI SDK 的项目来说,迁移成本基本是改两行配置。下面这段可以直接跑:

from openai import OpenAI

MiniMax 提供 OpenAI 兼容端点,端点地址以官方文档最新说明为准

client = OpenAI( api_key="YOUR_MINIMAX_API_KEY", base_url="https://api.minimax.io/v1", )

resp = client.chat.completions.create( model="MiniMax-M2", messages=[

system prompt 里明确输出格式,能显著降低后处理成本

{"role": "system", "content": "你是严谨的资料整理助手,只输出 JSON,不要任何解释文字"}, {"role": "user", "content": "把下面的需求描述拆成开发任务清单,输出 JSON 数组:\n"}, ], temperature=0.3, # 结构化抽取任务压低温度,减少发散 )

M2 的思维链通常会单独返回在 reasoning 相关字段里,

正文只取 content,避免把思考过程混进下游解析

print(resp.choices[0].message.content)

几个我自己踩过的坑,顺手记一下:

  • **不要关掉思考**。M2 的强项就在这一步,为了省 token 关掉它,你会得到一个小幅降级但省不了多少钱的模型,不划算。
  • **输出格式写死在 system prompt 里**。它偶尔会在 JSON 外面加一句"好的,以下是结果",多写一句约束能省掉不少正则清洗。
  • **长文档先切片**。超过单次上下文安全水位时,宁可切两段分别处理,也别赌它的中间部分不丢信息——这是我前面那个表格遗漏问题的直接教训。

关键要点速览

  • MiniMax模型连续五周全球第一,指的是 OpenRouter 按 token 调用量统计的排名,反映的是开发者选择而非能力上限
  • M2 约 230B 总参数、约 10B 激活,MoE 架构让算力成本按小数字走、知识容量按大数字走
  • 交错思维和原生 agent 优化是它在工具调用场景的真实优势,不是营销话术
  • 长文档中间内容遗漏、专业术语理解不足是目前可见的短板,需要 prompt 侧兜底
  • 真实项目里通过"便宜模型全量 + 贵模型复核"的双轨策略,成本可以降到原来的十分之一量级

至于要不要押注它——我的看法是,别押注任何单一模型。把业务逻辑和模型调用层解耦,保持能在两天内切换供应商的能力,这比选对哪一家重要得多。M2 现在很香,但榜单这个东西,本来就是会变的。

相关推荐

阅读相关专题

  • [国产大模型推理成本拆解:从 API 定价到自建部署的账怎么算](/posts/domestic-llm-inference-cost)
  • [开源大模型 Agent 能力横向评测:工具调用稳定性实测](/posts/open-source-agent-benchmark)

查看工具推荐

  • [VergeX AI 工具导航](https://nav.vergex.cn) — 收录了 MiniMax、DeepSeek、Qwen 等主流模型的官方入口、开源仓库和 API 文档,一站直达

订阅更新

  • 想第一时间拿到大模型榜单变动的解读和实测数据?订阅 VergeX 每周技术雷达,邮件与微信同步推送,不做标题党,只发跑过的数据。
大模型

百川大模型怎么下载?2025最新完整实战指南

2026-10-2 18:17:13

大模型

MiniMax开放平台有哪些功能?8类接口实测与选型建议

2026-10-2 18:17:24

0 条回复 A文章作者 M管理员
VergeX|科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索