deepseek是什么旗下的软件?幻方量化与深度求索关系梳理

本文实测deepseek是什么旗下的软件,涵盖幻方量化孵化背景、DeepSeek-V3与R1的技术路线、实际调用体验,帮你彻底搞清这家公司的来龙去脉与上手方式。

deepseek是什么旗下的软件?幻方量化与深度求索关系梳理

上周三晚上,我所在的一个技术交流群里突然有人抛出这么个问题:deepseek是什么旗下的软件?群里七八个人,答案五花八门——有人说是字节的,有人说是阿里的,还有个哥们非常肯定地说是"某个量化基金搞的副业"。最后那个哥们其实最接近真相,但也没说全。

这个问题看起来简单,实际上牵扯到中国AI行业里一条挺特别的创业路径。我自己从2024年5月开始用DeepSeek的API做内部工具,到现在跑了大概十几个小项目,中间踩过坑也吃过惊。这篇就把我知道的、查证的、以及亲身体验过的都摊开讲。

核心结论摘要:DeepSeek(深度求索)不是任何互联网大厂旗下的产品。它的孵化方是国内头部量化私募幻方量化(High-Flyer),实际运营主体是2023年7月成立的杭州深度求索人工智能基础技术研究有限公司,属于独立法人实体。

先把关系说清楚:谁孵化了谁

很多人一听到"量化基金搞AI",第一反应是"副业"。这个理解方向对了一半,但性质搞错了。

幻方量化成立于2015年,是国内最早一批把深度学习大规模用到量化交易上的私募机构,管理规模一度超过千亿。它的联合创始人梁文锋,也就是后来深度求索的创始人,在2023年决定把AI研究这条线单独拆出来做。

关键在于——拆出来的不是一个部门,而是一家独立公司。杭州深度求索人工智能基础技术研究有限公司,2023年7月注册成立,梁文锋直接持股并担任法定代表人。幻方量化提供的是早期资金、算力基础设施(那批早早就囤下的A100/H800集群),以及在量化交易中积累的大规模工程经验。

| 主体 | 定位 | 关键信息 | | --- | --- | --- | | 幻方量化(High-Flyer) | 孵化方、早期出资方 | 2015年成立的量化私募,提供启动资金与算力基础 | | 杭州深度求索人工智能基础技术研究有限公司 | DeepSeek品牌的实际运营主体 | 2023年7月成立,独立法人,梁文锋为创始人 | | 其他互联网大厂 | 无股权关系 | 市场上"字节系""阿里系"的说法均无公开依据 |

我的判断是,用"旗下的软件"这个说法本身就不太准确。更贴切的描述是"同源孵化"。两者的关系有点像斯坦福和它孵化的创业公司——有渊源,但法律和经营上是两码事。这一点在查企业工商信息时能看得非常清楚。

技术底子到底怎么样

搞清楚归属只是第一步。真正让我持续用下去的原因,是它在架构上的几个选择确实有意思。

MoE + MLA:把推理成本打下来的组合拳

DeepSeek-V2(2024年5月发布)是第一个让我注意到这家公司的版本。它用了两个核心设计:

  • **DeepSeekMoE(混合专家架构)**:总参数236B,但每次推理只激活21B。这就像一家餐厅有236个厨师,但每道菜只需要21个人动手,其余的在旁边待命。
  • **MLA(多头潜在注意力)**:把KV缓存压缩到传统MHA的一个零头,长上下文场景下显存占用大幅下降。

到DeepSeek-V3(2024年12月),这套思路被推到极致:671B总参数、37B激活参数,同时引入FP8混合精度训练和多令牌预测(MTP)。

成本数据:一个绕不开的参照点

根据DeepSeek-V3技术报告(arXiv:2412.19437,2024年12月发布),V3的完整训练使用了2048张H800 GPU,总计278.8万GPU小时,官方给出的训练成本约为557.6万美元。

这个数字在2025年初引发了相当大的讨论。坦白讲,我个人对这个数字的理解是:它指的是最终那次成功训练的算力开销,不包含前期架构探索、消融实验、失败重跑的成本。把它当成"训练一个大模型只要500多万美元"来引用,是会误导人的。但即便如此,这个量级相对于同期的闭源模型,仍然是数量级上的差异。

| 模型 | 发布时间 | 参数规模 | 关键特性 | | --- | --- | --- | --- | | DeepSeek-V2 | 2024年5月 | 236B总 / 21B激活 | MLA + DeepSeekMoE | | DeepSeek-V3 | 2024年12月 | 671B总 / 37B激活 | FP8混合精度、MTP、14.8T tokens训练 | | DeepSeek-R1 | 2025年1月 | 671B(基于V3底座) | 纯强化学习激发的推理能力 |

R1:另一条路线

DeepSeek-R1的论文(arXiv:2501.12948,2025年1月)讲的是另一件事:不做SFT冷启动,直接上大规模强化学习,让模型自己"长出"长链推理能力。论文里那个"顿悟时刻"(aha moment)的描述,我读的时候确实愣了一下——模型在训练中途突然开始自发地重新检查自己的解题步骤。

有意思的是,R1发布后不久,DeepSeek把R1的蒸馏版本(1.5B到70B)全部开源了,MIT协议。我当时下载了14B的蒸馏版,在一张4090上跑起来,数学题的表现在同类尺寸模型里确实能打。

实际调用体验:我踩过的几个坑

说点实在的。我从2024年5月开始用DeepSeek API做内部的知识库问答和代码辅助,到现在大概跑了十几个项目。下面这段代码是我常用的调用模板,因为接口兼容OpenAI SDK,迁移成本几乎为零:

用 OpenAI SDK 调用 DeepSeek API(接口兼容,改 base_url 即可)

from openai import OpenAI

client = OpenAI( api_key="你的 API Key", # 在 platform.deepseek.com 申请 base_url="https://api.deepseek.com" # 关键:替换成 DeepSeek 的端点 )

resp = client.chat.completions.create( model="deepseek-chat", # 通用对话;需要推理时换成 deepseek-reasoner messages=[ {"role": "system", "content": "你是一个严谨的技术助手,回答要给出依据"}, {"role": "user", "content": "用一句话解释 MoE 架构的核心思想"} ], stream=False )

print(resp.choices[0].message.content)

几个真实感受:

便宜是真的便宜。 我做过一次粗略对比,同一个RAG问答任务,在输出质量差不多的情况下,DeepSeek的成本大概是我原来用某闭源模型的三分之一到五分之一。对于需要跑大量离线批处理的任务,这个差距是决定性的。

但限流也是真的。 2025年1月底那波流量高峰,我有个定时任务连续几天在晚上八点左右报超时。后来我把批处理时间挪到了凌晨,问题基本消失。这不是DeepSeek独有的问题,但确实说明它在高峰期承载能力有边界。

推理模型要慎用。 deepseek-reasoner的输出token里包含大量思考链,如果你只是做简单分类或者信息抽取,用它纯属浪费。我一开始图省事全量切到reasoner,账单直接翻了三倍多。

想横向对比其他国产大模型的调用成本,可以参考 VergeX AI工具导航 上整理的模型选型对照。

几个常见的误解,顺手澄清一下

"DeepSeek是幻方旗下的软件" ——这个说法不准确。DeepSeek的运营主体是独立的深度求索公司,幻方是孵化方和早期投资方。你在工商信息里查不到"幻方量化旗下"这样的表述。

"DeepSeek只是开源模型,没有商业产品" ——它的官网(chat.deepseek.com)和App都是直接面向C端的产品,2025年1月App曾同时登顶中美iOS免费榜。API也是正经在卖的。

"开源就等于可以随便商用" ——代码仓库用的是MIT协议,模型权重有单独的模型许可协议,商用前建议逐条看一遍,尤其是涉及蒸馏和二次分发的场景。

"它只有文本模型" ——DeepSeek-VL系列是多模态方向的研究成果,但主力商业化产品目前仍以文本为主。多模态大模型这块它走得比一些同行低调。

想上手的话,我的建议路径

如果你是想搞清楚deepseek是什么旗下的软件之后,顺手把它用起来,我给一条我觉得比较省时间的路线:

  1. **先玩网页版**(chat.deepseek.com),把深度思考模式和联网搜索都点一遍,感受一下它在什么场景下强、什么场景下会翻车。
  2. **读两份技术报告**,V3和R1的arXiv论文。不用全懂,重点看架构图和训练流程部分,能建立起对"为什么它便宜"的直觉。
  3. **申请API跑通Demo**,用上面那段代码,成本几毛钱。跑通之后再考虑接入自己的业务。
  4. **本地部署选蒸馏版**,除非你有8卡H800级别的资源,否则别碰671B的原版。1.5B/7B/14B的蒸馏版本用Ollama或者vLLM都能拉起来。
  5. **关注开源仓库的更新节奏**,DeepSeek在GitHub上的发布频率不低,新版本经常带一些工程上值得抄的细节。

关键要点速览

  • DeepSeek由幻方量化孵化,运营主体是2023年7月成立的杭州深度求索,属独立公司,不是任何大厂旗下产品。
  • 技术核心是MoE稀疏激活 + MLA注意力压缩,V3训练成本官方口径约557.6万美元(arXiv:2412.19437)。
  • R1通过纯强化学习路线激发推理能力(arXiv:2501.12948),蒸馏版本以MIT协议开源。
  • 实际使用中性价比突出,但高峰期限流和推理模型的token开销需要提前规划。
  • 入门路径:网页版体验 → 读技术报告 → API跑通 → 本地部署蒸馏版。

相关推荐

  • **延伸阅读**:[VergeX AI工具导航](https://nav.vergex.cn) 上收录了国产大模型、推理框架、本地部署工具的完整清单,可以按调用成本、上下文长度、是否支持私有化部署等维度筛选。
  • **相关专题**:本站「大模型」分类下还有 MoE 架构演进、国产大模型开源生态等系列文章,适合顺着往下读。
  • **订阅更新**:VergeX 每周整理一次AI技术雷达简报,覆盖模型发布、论文速递和工具更新,可通过站内邮件订阅或关注公众号获取推送。
大模型

DeepSeek网页版入口免登录:实测4种可行路径

2026-9-28 18:03:31

大模型

DeepSeek官网登录入口在哪?2025实测指南

2026-9-28 18:03:41

0 条回复 A文章作者 M管理员
VergeX 科技前沿
    暂无讨论,说说你的看法吧
❯
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索