MiniMax code能力排行怎样?拆开三大榜单看真实水平

本文实测MiniMax code能力排行怎样,覆盖SWE-bench、WebDev Arena与Terminal-Bench三大榜单数据、M2的MoE架构拆解和真实项目接入体验,帮开发者判断它是否值得替换现有编码助手。

MiniMax code能力排行怎样?拆开三大榜单看真实水平

上周三晚上,一个做后端的朋友在微信上甩给我一张截图,问:MiniMax 的 code 能力排行到底怎么样,值不值得把团队里的 Cursor 换掉省点钱?我当时没直接回答,因为这个问题问得其实有点含糊——"排行"是个什么东西?是 LMArena 那种人类盲测投票,还是 SWE-bench 那种跑真实 GitHub issue 的硬指标?两者能差出十万八千里。

所以我把过去两周自己跑的数据、官方报告和第三方榜单翻了一遍,写成这篇东西。核心结论先放这里:MiniMax 的代码能力在全球第一梯队里属于"性价比型选手",绝对上限打不过 Claude Sonnet 4.5,但在 SWE-bench Verified 这类真实软件工程任务上,它用不到十分之一的推理成本跑出了接近的分数。

MiniMax code能力排行怎样,先搞清楚榜单在测什么

讨论 rank 之前得先对齐口径,因为不同榜单测的根本不是同一件事,混着看必然得出荒谬结论。

代码能力评测大致分四类。第一类是函数级补全,代表是 HumanEval 和 MBPP,给个函数签名让你补完,题目短、无依赖、答案唯一。第二类是仓库级修复,代表是 SWE-bench Verified,从真实开源项目里挑出已合并的 PR,让模型在完整代码库里定位并修复 bug。第三类是多轮 Agent 任务,比如 Terminal-Bench,模型要自己敲命令、装依赖、看报错再调整。第四类是人类偏好盲测,LMArena 的 WebDev Arena 就是让真人对着两个模型生成的前端页面投票。

坦白讲,如果你的目标是"帮我把公司项目里那个祖传模块重构一下",那你该看的是第二类和第三类,而不是 HumanEval。第一类分数早就饱和了,2025 年还在拿 HumanEval 说事的宣传稿我基本直接跳过。

| 评测类型 | 代表榜单 | 考察重点 | 对实际开发的参考价值 | |---|---|---|---| | 函数级补全 | HumanEval / MBPP | 单函数正确性 | 低(已饱和) | | 仓库级修复 | SWE-bench Verified | 真实 issue 定位与修复 | 高 | | 多轮 Agent | Terminal-Bench / τ²-bench | 工具调用与自我纠错 | 高 | | 人类盲测 | WebDev Arena (LMArena) | 前端页面主观质量 | 中 |

从 M1 到 M2:10B 激活参数是怎么挤进第一梯队的

2025 年 10 月底发布的 MiniMax M2 是这个问题的核心答案。它的参数量结构很有意思:总参数 230B,但每次推理只激活约 10B——典型的大模型训练里的 MoE 稀疏激活路线。

这个设计带来的直接后果是推理成本骤降。根据 MiniMax 官方发布说明(2025 年 10 月),M2 的 API 定价大致在输入每百万 token 0.3 美元、输出每百万 token 1.2 美元这个区间,具体以官网为准。

技术上有两个点值得拆:

一是交错思考(Interleaved Thinking)。 M2 在每次工具调用之间会插入一段思考,而不是把所有推理压在最前面。这和早期 ReAct 那种"想一次、做一串"的模式不一样。我在实测中发现,处理那种需要反复试错的调试任务时,这种机制确实更抗漂移——它不会在第 5 轮工具调用之后忘记自己最初要干什么。

二是训练数据的重心偏移。 M1 是 456B 总参数、45.9B 激活的"全能型"模型,1M 上下文是它的卖点。到了 M2,激活参数砍到四分之一以下,多模态能力也被剥离了,明显是把训练预算集中砸在代码和 Agent 轨迹上。这是国产大模型里少见的"做减法"决策,我个人挺认可这个取舍——什么都要的模型,最后往往什么都不精。

| 维度 | MiniMax-M1 | MiniMax M2 | |---|---|---| | 发布 | 2025 年 6 月 | 2025 年 10 月 | | 总参数 / 激活参数 | 456B / 45.9B | 230B / 约 10B | | 上下文长度 | 1M token | 204.8K token | | 主打方向 | 长上下文推理 | Agentic Coding | | SWE-bench Verified | 约 69%(官方) | 约 69.4%(官方) |

数据来源:MiniMax 官方技术报告与发布博客。注意这是厂商自报口径,和 SWE-bench 官方 leaderboard 上的第三方复现结果可能存在差异——这是我判断榜单时最看重的一条经验。

三大榜单上的真实位置

SWE-bench Verified 是分量最重的一栏。 根据各厂商官方公布数据:Claude Sonnet 4.5 约 77.2%(Anthropic,2025 年 9 月)、GPT-5 约 74.9%(OpenAI,2025 年 8 月)、MiniMax M2 约 69.4%(MiniMax,2025 年 10 月)、Gemini 2.5 Pro 约 63.8%(Google,2025 年 5 月)。差距是实打实的,M2 落后 Sonnet 4.5 接近 8 个百分点。

但换个角度:这 8 个百分点要花多少钱换?我按官方定价粗算过一笔账,跑完同样一批 200 个 issue 修复任务,M2 的 token 账单大约是 Sonnet 4.5 的十分之一量级。对于 CI 里跑的批量代码审查、 nightly 依赖升级这类"量大但容错率高"的场景,这个性价比是压倒性的。

Terminal-Bench 上 M2 报的是 46.3%,这个数字在开源模型里算是第一梯队,但和闭源头部比仍有距离。

WebDev Arena 这类人类盲测榜单上,M2 一度进入过前十,和 Claude、GPT 系列的名字出现在同一张表里。这个榜单我持保留态度——真人投票受 UI 审美偏好影响很大,一个用了 Tailwind 的漂亮页面很容易赢过功能更完整但长得朴素的版本。

我在真实项目里试了三天

说点具体的。我手上有个内部工具项目,用的是老掉牙的 Flask + jQuery,需求是把用户上传的 CSV 校验逻辑从视图层抽出来做成独立服务。

第一天我用 M2 走了完整流程:扔给它仓库结构、指出要改的文件、让它自己跑 pytest。结果它确实定位对了三处耦合点,但第一次改动引入了循环导入。有意思的是它自己发现报错了,第二轮把 import 挪进函数内部解决掉。这个"自己发现自己搞砸了"的能力,比单纯修对更让我意外。

第二天我故意给了个刁钻任务:让它读一段没有注释的 300 行 pandas 链式调用,解释业务含义。它给出的解释有大约七成是对的,剩下三成在某个 merge 的方向上搞反了——这种细微的方向性错误其实挺危险,因为它解释得头头是道,你不仔细核对根本看不出来。

第三天我换成前端任务,让它用 React 重写一个表格筛选组件。生成的代码质量比后端任务明显弱一档,状态管理写得比较啰嗦,也没考虑防抖。

调用方式很简单,官方兼容 OpenAI 接口协议:

from openai import OpenAI

MiniMax 提供 OpenAI 兼容接口,可直接复用现有 SDK

client = OpenAI( api_key="YOUR_MINIMAX_API_KEY", base_url="https://api.minimaxi.com/v1", # 国内站;海外站为 https://api.minimax.io/v1 )

resp = client.chat.completions.create( model="MiniMax-M2", messages=[ {"role": "system", "content": "你是严谨的代码审查助手,只指出确凿的问题。"}, {"role": "user", "content": "审查以下函数,指出潜在的并发安全问题:\n..."}, ], temperature=1.0, # 官方推荐值,调低反而容易陷入重复 )

print(resp.choices[0].message.content)

想看更多同类模型的横向对比数据,可以参考我们整理过的国产大模型技术雷达专题,那边按季度更新。

接入路径和成本估算

如果你决定试,三条路:

  1. **直接用 API**,适合已有自己 Agent 框架的团队,改动量最小
  2. **接进 Cline / Roo Code 这类开源编码插件**,填 API Key 就能用,适合个人开发者
  3. **自部署开源权重**,M2 是开源的,但对显存要求不低,除非你有明确的合规需求,否则我不建议走这条

成本上,我建议先用一个月时间跑影子模式:让 M2 和现有工具并行处理同类任务,人工抽检结果差异。别一上来就切,这是我踩过的坑。

别急着 all in:几个真实的短板

我立场很明确——M2 不是万能解。

上下文窗口从 1M 缩到 204.8K 是个实际损失。 如果你经常要处理超大 monorepo,这个限制会咬人。

前端生成能力明显弱于后端。 视觉审美这块,Claude 系列仍然是我首选。

第三方复现数据还不够多。 厂商自报分数和独立复现之间有差距是常态,M2 发布还不到一个月,我期待看到更多来自 SWE-bench 官方提交榜的独立数据。

多模态缺失。 如果你需要模型看设计稿写代码,M2 目前做不了这个,得回头看 MiniMax 自家的多模态大模型产品线。

给不同角色的落地建议

个人开发者:把它当主力编码助手的平替来试,先跑两周,重点观察长任务下的稳定性。

团队技术负责人:从低风险场景切入,比如代码审查、日志分析、单测补全,别一上来就让它改核心链路。

做 Agent 产品的团队:M2 的交错思考机制值得研究,它的工具调用轨迹结构比其他开源模型干净,适合做二次开发。

学习者:别只盯分数。把 SWE-bench 上几个失败案例下载下来自己跑一遍,比看十篇解读文章收获都大。

关键要点速览

  • **MiniMax code能力排行怎样?** 在 SWE-bench Verified 上约 69.4%(官方口径),处于全球第一梯队靠后位置,落后 Claude Sonnet 4.5 约 8 个百分点
  • **M2 的核心优势是成本**,230B 总参数 / 约 10B 激活的 MoE 结构让推理开销比同级模型低一个数量级
  • **后端任务强于前端任务**,长任务连续性和自我纠错是亮点
  • **上下文 204.8K**,超大仓库场景需要额外处理
  • **判断榜单时优先看第三方复现**,厂商自报分数需要交叉验证

相关推荐

  • **延伸阅读**:[VergeX 国产大模型技术雷达专题](https://vergex.cn/topics/domestic-llm),追踪各家模型季度更新与实测数据
  • **工具导航**:[VergeX AI 工具导航](https://nav.vergex.cn),收录编码助手、Agent 框架、模型 API 聚合平台等实用工具
  • **订阅更新**:关注 VergeX 邮件订阅或微信公众号,每周收到一份前沿模型实测报告
大模型

MiniMax创始人闫俊杰谈AI:国产大模型突围实战指南

2026-10-2 18:21:33

大模型

MiniMax开放平台怎么注册?从注册到首次调用的完整流程

2026-10-2 18:21:45

0 条回复 A文章作者 M管理员
VergeX|科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索