DeepSeek 为什么这么便宜?MLA 与 MoE 工程拆解
2024 年 12 月底 DeepSeek-V3 发布那会儿,技术群里讨论最多的不是它跑分多少,而是一句反复出现的话:「这个价格是怎么算出来的?」
核心结论:DeepSeek 的低价不是补贴烧出来的,而是两个架构决策叠加的结果——MLA 把 KV Cache 压掉 93.3%,DeepSeekMoE 让 671B 参数的模型每次只激活 37B。R1 则进一步证明,纯强化学习也能让模型自己长出推理能力。
先把丑话说在前面:论文里那个 557.6 万美元的训练成本,只统计了正式预训练那一段,不含前期研究、数据清洗和消融实验。网上传成「五百万美元造出 GPT-4」是误读。但即便按三倍余量估算,它依然比同档位模型便宜一大截——这个差距是实打实的工程结果,值得拆开看。
DeepSeek 是什么?先把它说清楚
DeepSeek 是指深度求索公司研发的一系列开源大语言模型及其配套推理服务。这家公司 2023 年 7 月成立,核心团队来自量化机构幻方,早期最出名的标签是「不融资、不烧钱、自己买卡」。
它真正进入大众视野是 2025 年 1 月 20 日。R1 发布当天,DeepSeek 应用登顶美国 App Store 免费榜,随后几天英伟达股价出现历史性回调。这个场景我记得很清楚——当时我正在给一家制造业客户写模型选型报告,第二天早上打开微信,几个技术群全在转股价截图,没人讨论技术了。
但如果只把 DeepSeek 当成「便宜的 ChatGPT 替代品」,就错过了它真正有价值的部分。它的技术路线里有两根支柱:一根解决「大模型推理时花多少钱」,另一根解决「大模型训练时花多少钱」。前者是 MLA,后者是 MoE。
便宜的根源:MLA 和 MoE 究竟省了什么
这一节讲原理。坦白说,我第一次读 V2 论文时没太看懂 MLA,直到自己拿一个小模型把 KV Cache 的显存占用曲线画出来,才突然明白作者在干什么。
MLA:把 KV Cache 压到原来的十四分之一
传统多头注意力(MHA)在推理时,每生成一个 token,都要把此前所有 token 的 Key 和 Value 缓存下来。上下文一长,这块显存就爆了——它基本是长文本大模型推理最大的瓶颈。
MLA(Multi-head Latent Attention,多头潜在注意力)的做法是:不直接缓存完整的 K 和 V,而是把它们压缩成一个低维潜向量,推理时再从潜向量还原。
根据 DeepSeek-V2 技术报告(arXiv:2405.04434,2024 年 5 月发布),MLA 相比 MHA 能将 KV Cache 降低 93.3%,同时效果上超过 GQA 和多查询注意力。
这也解释了为什么 DeepSeek 的 API 敢做上下文硬盘缓存,而且拉开两个计费档位:缓存命中时输入 0.5 元/百万 tokens,未命中 2 元/百万 tokens(V3 标准价,2025 年初)。差了整整四倍。
DeepSeekMoE:671B 的参数,只激活 37B
MoE 不是

