为什么MINIMAX股价突破300港元?技术人视角的拆解
上个月跟一个做Agent创业的朋友吃饭,他随口说了句:"我们现在跑长上下文任务,第一反应是切MiniMax。"当时我没太在意,直到MINIMAX股价突破300港元这件事在圈子里刷屏,我才回过头去把这家公司的技术报告重新翻了一遍。说实话,市场情绪和工程现实之间,往往隔着一条很宽的河。但这次,我觉得河没那么宽。
核心结论:MINIMAX股价突破300港元,市场定价的不是某场发布会的热度,而是"MoE稀疏激活 + 线性注意力"这条路线把百万级上下文的推理成本压到了可商用区间之后,Agent和多模态应用能真正跑起来的预期。
300港元这个数字,市场到底在给什么定价?
股价是结果,不是原因。对于一家大模型公司,能被资本市场持续抬估值的东西其实很有限——不是参数规模,而是单位token成本能不能降下来,以及降下来之后有没有人真的愿意付钱。
我翻了MiniMax从2025年初到10月的几次关键技术发布,时间线拉出来看会清晰很多:1月开源MiniMax-01,6月开源MiniMax-M1,10月开源MiniMax-M2。三次迭代的方向非常一致,都在做同一件事——用架构换成本。
| 模型 | 发布节点 | 总参数 | 激活参数 | 核心卖点 | |------|---------|--------|---------|---------| | MiniMax-01 | 2025年初 | 456B | 45.9B | Lightning Attention,长上下文 | | MiniMax-M1 | 2025年中 | 456B | 45.9B | 开源,强化学习训练成本大幅下探 | | MiniMax-M2 | 2025年10月 | 230B | 10B | Agent与编码场景,激活参数再压缩 |
这张表里最值得盯的不是总参数,而是最后一列"激活参数"。参数总量决定了它能学多复杂的东西,激活参数决定了你每次调用要花多少钱。这两个数字之间的差距越大,商业模型越性感。
技术原理拆解:Lightning Attention和MoE各自解决了什么
长上下文的老大难问题
传统Transformer的注意力机制是O(n²)复杂度。上下文从128K涨到1M,计算量和显存占用不是涨8倍,是涨64倍。这是整个行业卡了很久的墙。
MiniMax-01技术报告里给出的方案是把注意力拆成两部分:大部分层用Lightning Attention做线性近似,少量层保留标准softmax注意力来兜住精度。据其2025年1月发布的技术报告,这套混合架构让模型在保持1M token上下文的同时,把推理时的计算复杂度压到了接近线性。
坦白讲,线性注意力不是新概念,学术圈喊了好几年。真正难的是"近似之后效果不掉"。我在实际项目里拿M1跑过一次20万token的合同比对任务,输出质量跟分段喂给常规模型相比,上下文一致性明显更稳——这个体验是我最直观的转折点。
MoE的账要算清楚
MoE(混合专家)是指把一个大模型拆成很多个专家子网络,每个输入token只激活其中一小部分。MiniMax-01的456B总参数里,每个token实际激活45.9B,约十分之一。到了M2,总参数230B、激活10B,比例压得更狠。
这里有个常见的误解:很多人以为开源一个456B的模型,本地部署就得准备456B的显存。不是的,MoE的显存占用取决于总参数,但计算量取决于激活参数。前者决定你要买多少卡,后者决定你每度电跑多少token。这两个成本曲线是分开的,优化空间恰恰在中间。
强化学习训练成本才是隐藏彩蛋
M1的技术报告里有个数据我印象很深:它在512块H800上训练了三周左右,报告披露的强化学习阶段成本约53.47万美元。这个数字放在动辄千万美元级别的训练叙事里,显得很不合群。
背后是关键算法CISPO对重要性采样比率的裁剪方式做了调整,让长序列RL训练的稳定性上来了。稳定意味着不用反复重启、不用堆冗余算力兜底——省下来的都是真金白银。
推理成本为什么成了估值弹性最大的变量
大模型商业化的死结一直在这儿:训练是一次性投入,推理是每天都在流血。
我见过不少团队,模型效果很好,但因为单次调用的token成本压不到盈亏线以下,商业模式根本跑不通。所以当一家公司能把长上下文的推理成本往下压一个量级,它撬动的不是技术指标,而是一整类之前算不过账的应用场景。
具体是哪些场景?我自己观察下来,跑得比较通的有三类:
- **超长文档处理**:财报、合同、代码库级别的分析,过去必须切片+向量检索,现在可以整篇塞进去,准确率提升明显
- **Agent长链路任务**:多轮工具调用容易丢上下文,长窗口能显著减少"忘记前面说过什么"的翻车
- **多模态内容生成**:视频、语音、文本统一到一套表征里,跨模态一致性比拼接多个专用模型更省事
这也解释了为什么"多模态大模型"和"大模型推理"这两个词最近总被放在一起提——它们本质是同一笔账的两面。
开发者视角:这套技术栈怎么接进去
MiniMax提供了OpenAI兼容的接口形态,如果你已经在用openai这个SDK,迁移成本很低:
import os from openai import OpenAI
MiniMax 提供 OpenAI 兼容接口,沿用熟悉的 SDK 即可
注意:base_url 和可用模型名请以官方文档最新版本为准
client = OpenAI( api_key=os.environ["MINIMAX_API_KEY"], base_url="https://api.minimaxi.com/v1", )
resp = client.chat.completions.create( model="MiniMax-M2", # Agent/编码场景优先选 M2 messages=[ {"role": "system", "content": "你是一名严谨的技术文档助手"}, {"role": "user", "content": "把这段日志按时间线整理成表格,标注异常点"}, ], temperature=0.3, # 结构化任务压低温度,减少发散 )
print(resp.choices[0].message.content)
选型上我的建议很直接:要长上下文和复杂推理,看M1;要做Agent、写代码、跑工具调用,优先M2,因为它激活参数只有10B,单位成本更友好。别一上来就挑参数最大的那个,那是给自己找账单。
想横向对比一下其他国产大模型的能力边界和价格,可以看看我们整理的国产大模型能力对比专题,里面按场景做了分类。
回到估值:技术账和资本账的交汇点
我在前面说过,这次跟以往不太一样。过去两年国产大模型的估值故事主要讲"我们也能做出来",属于追赶叙事。而MINIMAX股价突破300港元这一轮,市场问的问题变了——能不能规模化地卖出去,且卖的时候不亏钱。
这个转变对技术路线的筛选是相当残酷的。参数规模领先但推理成本下不来的路线,会越来越难拿到溢价;反过来,那些在架构层面就把成本结构改掉的团队,会拿到不成比例的回报。MoE加线性注意力的组合之所以被反复讨论,正是因为它是少数能同时回答"能力够不够"和"成本扛不扛得住"这两个问题的方案。
不过话说回来,我也不认为股价能直接反映技术优劣。资本市场有它自己的节奏和情绪,300港元只是一个截面。真正值得关注的,是接下来半年到一年里,这套技术栈上能不能长出足够多的付费应用——那才是验证。
学习路径与上手建议
如果你想系统地把这块吃透,我建议按这个顺序走:
- **先读原始技术报告**,别只看二手解读。MiniMax-01和M1的论文对架构细节交代得比较清楚
- **动手跑一次长上下文任务**,拿你自己业务里的长文档去试,比任何benchmark都有说服力
- **算一遍成本账**,把你的日均token量代入真实单价,看看商业模型能不能成立
- **关注Agent场景的工程细节**,长窗口不等于不会丢信息,工具调用的设计同样关键
关键要点速览
- MINIMAX股价突破300港元的核心支撑,是架构层面的推理成本下降,而非单纯的参数规模
- Lightning Attention把长上下文复杂度从O(n²)压向线性,MoE把每token激活参数压到总参数的十分之一量级
- M1的RL训练成本据其技术报告约53.47万美元,CISPO算法是关键
- 开发者选型:长上下文选M1,Agent与编码选M2
- 估值可持续性的真正验证点,是付费应用能否规模化
相关推荐
- **阅读相关专题**:想继续深挖国产大模型的技术路线差异,可以逛逛[VergeX 大模型专题](https://vergex.cn/topics/llm),我们按架构、成本、场景三个维度做了长期跟踪
- **查看工具推荐**:需要对比更多AI模型与开发工具的实时价格和能力,推荐访问 [VergeX AI工具导航](https://nav.vergex.cn),按场景分类收录,更新比较勤
- **订阅更新**:AI技术雷达每周推送一次,覆盖模型发布、架构论文和工具更新,订阅入口在站点首页底部
有不同看法或者踩过坑,欢迎在评论区聊聊。

