DeepSeek 为什么这么便宜?MLA 与 MoE 工程拆解

本文拆解 DeepSeek 的低成本逻辑,涵盖 MLA 注意力、DeepSeekMoE 稀疏路由和 R1 强化学习三条主线,附可运行的 API 调用代码与选型建议,帮你判断什么场景该用它。

DeepSeek 为什么这么便宜?MLA 与 MoE 工程拆解

2024 年 12 月底 DeepSeek-V3 发布那会儿,技术群里讨论最多的不是它跑分多少,而是一句反复出现的话:「这个价格是怎么算出来的?」

核心结论:DeepSeek 的低价不是补贴烧出来的,而是两个架构决策叠加的结果——MLA 把 KV Cache 压掉 93.3%,DeepSeekMoE 让 671B 参数的模型每次只激活 37B。R1 则进一步证明,纯强化学习也能让模型自己长出推理能力。

先把丑话说在前面:论文里那个 557.6 万美元的训练成本,只统计了正式预训练那一段,不含前期研究、数据清洗和消融实验。网上传成「五百万美元造出 GPT-4」是误读。但即便按三倍余量估算,它依然比同档位模型便宜一大截——这个差距是实打实的工程结果,值得拆开看。

DeepSeek 是什么?先把它说清楚

DeepSeek 是指深度求索公司研发的一系列开源大语言模型及其配套推理服务。这家公司 2023 年 7 月成立,核心团队来自量化机构幻方,早期最出名的标签是「不融资、不烧钱、自己买卡」。

它真正进入大众视野是 2025 年 1 月 20 日。R1 发布当天,DeepSeek 应用登顶美国 App Store 免费榜,随后几天英伟达股价出现历史性回调。这个场景我记得很清楚——当时我正在给一家制造业客户写模型选型报告,第二天早上打开微信,几个技术群全在转股价截图,没人讨论技术了。

但如果只把 DeepSeek 当成「便宜的 ChatGPT 替代品」,就错过了它真正有价值的部分。它的技术路线里有两根支柱:一根解决「大模型推理时花多少钱」,另一根解决「大模型训练时花多少钱」。前者是 MLA,后者是 MoE。

便宜的根源:MLA 和 MoE 究竟省了什么

这一节讲原理。坦白说,我第一次读 V2 论文时没太看懂 MLA,直到自己拿一个小模型把 KV Cache 的显存占用曲线画出来,才突然明白作者在干什么。

MLA:把 KV Cache 压到原来的十四分之一

传统多头注意力(MHA)在推理时,每生成一个 token,都要把此前所有 token 的 Key 和 Value 缓存下来。上下文一长,这块显存就爆了——它基本是长文本大模型推理最大的瓶颈。

MLA(Multi-head Latent Attention,多头潜在注意力)的做法是:不直接缓存完整的 K 和 V,而是把它们压缩成一个低维潜向量,推理时再从潜向量还原。

根据 DeepSeek-V2 技术报告(arXiv:2405.04434,2024 年 5 月发布),MLA 相比 MHA 能将 KV Cache 降低 93.3%,同时效果上超过 GQA 和多查询注意力。

这也解释了为什么 DeepSeek 的 API 敢做上下文硬盘缓存,而且拉开两个计费档位:缓存命中时输入 0.5 元/百万 tokens,未命中 2 元/百万 tokens(V3 标准价,2025 年初)。差了整整四倍。

DeepSeekMoE:671B 的参数,只激活 37B

MoE 不是

大模型

通义千问官方APP怎么用?从下载到多模态实战完整指南

2026-9-27 0:50:58

大模型

如何完成文心一言手机版免费版安装?避坑与实测记录

2026-9-27 0:51:08

0 条回复 A文章作者 M管理员
VergeX 科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索