百川大模型是哪个公司的?公司背景、模型谱系与上手路径
上周团队开选型会,一个刚转岗过来的同事举手问:「百川大模型是哪个公司的?我以为是百度的。」会议室里安静了两秒,然后好几个人笑了——但说实话,这个混淆真不能怪他。国内大模型名字里带「百」字的太多了,加上百川智能这家公司平时公关声量不算大,不了解的人很容易把它归到某个大厂名下。
可这个问题偏偏很关键。你选了谁的模型,就等于选了谁的合规主体、谁的算力供应链、谁的商业协议。后面要私有化交付、要过数据合规审查的时候,这个「谁是出品方」的答案会直接决定项目能不能落地。所以我把这半年整理过的资料重新梳理了一遍,写成这篇东西。
核心结论摘要:百川大模型由北京百川智能科技有限公司研发,这是一家由前搜狗 CEO 王小川于 2023 年 4 月创立的独立大模型公司,总部在北京,不是百度、阿里或腾讯的内部项目。它于 2023 年 8 月 31 日入选国家网信办首批生成式人工智能服务备案名单。
百川大模型是哪个公司的?先把公司档案摆出来
直接上答案:出品方是北京百川智能科技有限公司,业内一般简称「百川智能」或 Baichuan Intelligence。公司 2023 年 4 月 10 日成立,创始人王小川在搜狗被腾讯收购后离开,拉了一支以搜狗核心算法团队为班底的队伍出来创业。名字的由来他自己在采访里讲过,「百川」取自「海纳百川」,顺便也带上了他名字里的「川」字——这个细节我第一次听到时觉得挺有意思,创业公司起名往往就是这么随性又带点私心。
| 项目 | 信息 | | --- | --- | | 公司全称 | 北京百川智能科技有限公司 | | 成立时间 | 2023 年 4 月 10 日 | | 创始人 | 王小川(前搜狗 CEO) | | 总部 | 北京 | | 首款开源模型 | Baichuan-7B,2023 年 6 月 15 日发布 | | 融资节点 | 2023 年 10 月完成 3 亿美元 A 轮;2024 年 7 月完成 50 亿元人民币 A 轮,投后估值约 200 亿元 | | 合规备案 | 2023 年 8 月 31 日进入国家网信办首批生成式 AI 服务备案名单 |
这张表里的最后两行,是我认为技术选型时最该看的两行。2023 年 8 月 31 日那批备案名单一共 8 家企业,百度、抖音、智谱、百川等都在内,能进第一批说明至少在合规资质上它是被认可的。融资信息则来自公开报道,投资方名单里出现过阿里、腾讯、小米、深创投、北京市人工智能产业投资基金等——这一点常被误读成「百川是阿里系或腾讯系」,其实财务投资和业务归属是两回事,公司控制权始终在创始团队手里。
顺手把几个常见的张冠李戴也澄清一下:
- **不是百度**。百度的大模型叫文心一言,主体是百度在线网络技术(北京)有限公司,和百川智能没有任何股权关系。
- **不是搜狗遗留业务**。王小川是创始人,但百川智能是 2023 年新设的独立法人,搜狗的业务和团队早已并入腾讯。
- **不是高校实验室**。虽然百川早期和清华、北大的一些研究者有交流,但它是一家商业公司,不是科研机构。
从 Baichuan-7B 到 Baichuan-M2:这条模型谱系怎么长起来的
搞清楚了百川大模型是哪个公司的,下一个问题自然是「它到底出过哪些模型」。因为百川的命名方式前后变过几次,新手很容易被 Baichuan-13B、Baichuan2-13B、Baichuan 3 这几个名字绕晕。
| 发布时间 | 模型 | 关键信息 | | --- | --- | --- | | 2023 年 6 月 | Baichuan-7B | 70 亿参数,1.2 万亿 tokens 训练,上下文 4096,Apache 2.0 开源 | | 2023 年 6 月 | Baichuan-13B | 130 亿参数,Base 与 Chat 双版本,改用自有许可协议 | | 2023 年 9 月 | Baichuan2-7B / 13B | 训练数据量提升至 2.6 万亿 / 1.4 万亿 tokens,中文评测大幅提升 | | 2024 年 1 月 | Baichuan 3 | 千亿级参数,官方称中文评测集上对标 GPT-4 | | 2024 年 5 月 | Baichuan 4 | 多模态能力,同期推出 AI 助手「百小应」 | | 2025 年 1 月 | Baichuan-M1-14B | 开源的医疗增强模型 | | 2025 年 | Baichuan-M2 | 面向医疗推理场景的开源模型 |
架构层面,Baichuan 系列走的是主流 decoder-only 路线:RoPE 旋转位置编码、SwiGLU 激活函数、RMSNorm 归一化,这套组合在 2023 年之后基本成了国产大模型训练的标准配方。真正拉开差距的是两个地方——词表和数据配比。Baichuan-7B 的 tokenizer 词表是 64000,到 Baichuan2 扩到了 125696,中文单字和常见词组的切分效率明显改善,同样的中文文本消耗的 token 更少。官方模型卡里给出的数据是,Baichuan2-13B-Base 相对上一代在通用、法律、医疗、数学、代码和多语言翻译六个维度的平均提升约 49%,7B 版本约 30%。
这里插一句我的判断。很多人看开源模型只看跑分,但我在实际微调项目里的体感是,词表大小对中文业务的影响经常被低估。同样一段 800 字的中文合同,词表小的模型可能要多消耗 20% 以上的 token,长文档场景下这就是实打实的成本差异。
为什么「它归谁」这件事会影响你的选型决策
这部分我想多说几句,因为标题里的问题看着像个百科问答,实际牵着一串工程决策。
原创解读:国内做技术选型有个绕不开的现实——大模型供应商分两类,一类是大厂,一类是创业公司。大厂的优势是资源稳、生态全、法务流程规范,但定制化响应慢,私有化交付的门槛和报价都高;创业公司的优势是配合度高、愿意做深度定制、开源策略激进,代价是长期稳定性需要自己评估。百川智能属于典型的第二类,而且它把「开源」这张牌打得很靠前——2023 年 6 月就放出 Baichuan-7B,当时国内愿意开源可商用基座模型的团队屈指可数。
这对你的意义在于:如果你的场景需要把模型部署在自有 IDC 里,百川早期版本的开源权重几乎是当时最省事的选择之一。但许可协议得看清楚。Baichuan-7B 用的是 Apache 2.0,改起来毫无顾虑;从 Baichuan-13B 开始换成了自有的《百川模型许可协议》,免费商用需要向官方提交申请,条款里对某些使用场景有限制。我见过有团队直接拿 Baichuan2 权重做了对外收费的 SaaS,后来补申请手续补得手忙脚乱——这种坑完全可以提前避开。
另一个变化是战略重心。2024 年底到 2025 年,百川智能把资源明显往医疗方向倾斜,王小川多次公开谈「AI 医生」的路径,开源模型也转向了 Baichuan-M 系列。如果你的业务是通用对话或通用 RAG,依然能用它的 API;但如果你期待它持续在通用基座上做激进迭代,得重新评估一下这个预期。这不是唱衰,只是创业公司在算力和资金约束下的理性选择——垂直场景更容易做出商业闭环。
上手实操:三种方式调用百川大模型
说完背景,给点能直接跑的东西。目前接入百川有两条主要路径,选择取决于你对数据主权的要求。
方式一:云端 API(OpenAI 兼容)
百川开放平台提供了 OpenAI 兼容接口,意味着你原来的代码几乎不用改。
使用 OpenAI SDK 调用百川大模型(OpenAI 兼容端点)
安装依赖:pip install openai
from openai import OpenAI
client = OpenAI( api_key="你的_BAICHUAN_API_KEY", # 在百川开放平台控制台申请 base_url="https://api.baichuan-ai.com/v1" # 百川的 OpenAI 兼容地址 )
resp = client.chat.completions.create( model="Baichuan4", # 模型名以控制台当前提供的版本为准 messages=[
system prompt 用来约束输出风格,百川从 Baichuan2 起对 system 角色支持较好
{"role": "system", "content": "你是一名严谨的中文技术文档助手。"}, {"role": "user", "content": "用三句话解释 RoPE 旋转位置编码的作用。"} ], temperature=0.3, # 技术类问答建议调低温度,减少发散 max_tokens=512 )
print(resp.choices[0].message.content)
方式二:本地部署开源权重
如果数据不能出内网,就走 Hugging Face 上的开源版本。注意 Baichuan2 系列需要 `trust_remote_code=True` 加载自定义建模代码。
本地加载 Baichuan2-7B-Chat(建议显存 16GB 以上,或用 8bit 量化)
from transformers import AutoModelForCausalLM, AutoTokenizer import torch
model_id = "baichuan-inc/Baichuan2-7B-Chat" tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained( model_id, trust_remote_code=True, # 百川的建模文件是自定义实现,必须开启 torch_dtype=torch.bfloat16, device_map="auto" # 多卡自动切分 ) model = model.eval()
Baichuan2 的 Chat 模型封装了 chat 方法,history 用于多轮上下文
response, history = model.chat(tokenizer, "介绍一下百川智能这家公司", history=[]) print(response)
两种路径怎么选
| 维度 | 云端 API | 本地部署开源权重 | | --- | --- | --- | | 上手成本 | 分钟级 | 小时级,需处理环境和显存 | | 数据出境 | 需走云端,注意合规评估 | 数据完全留在内网 | | 单位成本 | 按 token 计费,前期便宜 | 前期投入高,高频调用后更划算 | | 可定制性 | 仅 prompt 与微调服务 | 可全参微调、可蒸馏 | | 版本风险 | 供应商可能下线旧模型 | 权重到手后长期可用 |
关于 API 与本地部署的成本平衡点,我之前在大模型 API 成本对比里做过一轮实测测算,结论是日调用量低于百万 token 时,自建通常不划算,除非有合规硬约束。
几个我踩过或见过的坑
- **模型名混淆**:`Baichuan2-13B-Chat` 和 `Baichuan 3` 完全不是一个量级的东西,前者 130 亿参数,后者千亿级,用 API 时别把文档里的旧模型名直接抄进代码。
- **许可协议不看就商用**:前面提过,13B 之后的开源协议和 Apache 2.0 不是一回事。
- **忽略上下文长度**:Baichuan2 系列原生上下文 4096,长文档场景需要自己做分块或者选更新的版本。
写在最后:百川的下一步和你的学习路径
国内大模型的格局这两年变了好几轮,能活到今天并且还有清晰产品路线的创业公司已经不多。百川智能选择往医疗走,是个高风险但也相对聪明的选择——通用赛道和大厂硬碰硬的性价比确实不高。从技术学习角度,它的开源权重依然是国产大模型里文档相对完整、社区资料较多的一支,拿来做微调练手或者私有化原型都很合适。
如果你想系统上手,我建议这条路径:先用云端 API 跑通一个你自己的小场景(比如文档问答),感受一下中文理解和幻觉水平;再去 Hugging Face 拉一个 7B 权重做 LoRA 微调,理解大模型训练和推理的显存账本;最后回头看国产大模型全景梳理,把各家定位放到一张图里对比。
关键要点速览
- 百川大模型出自北京百川智能科技有限公司,2023 年 4 月由王小川创立,独立于百度、阿里、腾讯。
- 2023 年 8 月 31 日入选国家网信办首批生成式 AI 服务备案名单,合规资质齐全。
- 模型谱系从 Baichuan-7B 起步,经 Baichuan2、Baichuan 3/4,2025 年重心转向医疗方向的 Baichuan-M 系列。
- 商用前务必确认许可协议:Baichuan-7B 为 Apache 2.0,13B 及之后为自有协议。
- 接入方式有二:OpenAI 兼容 API 快速验证,或本地部署开源权重满足数据合规。
相关推荐
延伸阅读
- [VergeX AI 工具导航](https://nav.vergex.cn) —— 收录国内外主流大模型的开放平台入口、定价页与文档地址,选型时一站对比
- 《百川智能开放平台技术文档》,百川智能,2024 年持续更新
- 《Baichuan 2 技术报告》,百川智能,2023 年 9 月发布
- 国家互联网信息办公室《首批生成式人工智能服务备案清单》,2023 年 8 月 31 日
订阅更新
VergeX 每周整理国产大模型的最新动态、开源权重发布和技术报告解读。如果你在评估国内大模型方案,欢迎通过站内邮件订阅或添加微信读者群,第一时间拿到更新。
下一步行动
挑一个你手头真实的小需求,用上面的 API 代码跑一次百川模型,和你在用的其他模型做个盲测对比——比读十篇评测文章都有用。

