百川智能的大模型叫什么名字?Baichuan 全系模型入门指南
“百川智能的大模型叫什么名字”这个问题,我这两年至少被同事和读者问过五六次。每次都得从 2023 年 6 月那个开源的 Baichuan-7B 讲起,因为百川的命名体系确实不太线性——它不像 GPT 那样干净地做版本递增,而是 1、2、3、4 之外还岔出 53B、M1、Omni 这些分支,第一次接触的人很容易绕晕。
这篇就把这事一次讲透:名称清单、版本演化背后的技术取舍、以及你真正想跑起来时该走哪条路。
核心结论摘要:百川智能的大模型统一命名为 Baichuan(中文品牌“百川”),已迭代出 Baichuan-7B/13B/53B(第一代)、Baichuan 2、Baichuan 3、Baichuan 4 四条主线,并衍生出医疗增强模型 Baichuan-M1 与全模态模型 Baichuan-Omni。截至 2025 年,商用 API 上主力是 Baichuan 4 与 Baichuan 4 Turbo。
百川智能的大模型叫什么名字?三条主干一次讲清
先给结论,省得你翻半天文档。百川智能(Baichuan Intelligence,2023 年 4 月由搜狗前 CEO 王小川创立)的模型品牌名一直叫 Baichuan,中文写作“百川”。这个名字取自“海纳百川”,也暗合公司想做“中国版 OpenAI”的定位。
真正让人迷惑的是它的版本号。我按发布时间把主要节点拉成一张表,你对照着看会清楚很多:
| 发布时间 | 模型名称 | 参数规模 | 开源情况 | 定位 | |---|---|---|---|---| | 2023 年 6 月 | Baichuan-7B | 70 亿 | 是(Apache 2.0) | 首个开源模型 | | 2023 年 7 月 | Baichuan-13B | 130 亿 | 是(免费商用需申请) | 当时最大中文开源模型 | | 2023 年 8 月 | Baichuan-53B | 530 亿 | 否(内测/API) | 首个闭源商用模型 | | 2023 年 9 月 | Baichuan 2 | 7B / 13B | 是 | 引入“对齐税”方案 | | 2024 年 1 月 | Baichuan 3 | 千亿级 | 否(API) | 医疗能力大幅强化 | | 2024 年 5 月 | Baichuan 4 | 未公开 | 否(API) | 主力旗舰,同期发布“百小应”助手 | | 2024 年 11 月 | Baichuan 4 Turbo | 未公开 | 否(API) | 推理加速版 | | 2025 年 1 月 | Baichuan-M1 | 140 亿 | 是 | 医疗增强推理模型 |
需要说明的是,这张表基于百川官方发布页与 Hugging Face 上的模型卡整理,时间截至 2025 年 4 月。之后如果有新版本,建议直接去官网核对。
一句话总结命名逻辑:7B/13B/53B 是按参数规模走的“尺码命名”,从 Baichuan 2 开始转成“代数命名”,而 M1、Omni 是场景化的分支线。
从对齐税到医疗专用:版本演化背后在解决什么
搞清楚名字只是第一步,我更关心的是每一代在技术上到底动了什么手脚。
Baichuan 2 的技术报告里有个概念我印象很深——“对齐税”(alignment tax)。说白了就是:模型经过 SFT 和 RLHF 对齐之后,通用能力往往会掉一截。你为了让模型更“听话”,结果它变“笨”了。这个反直觉的现象当时在圈内讨论挺多。百川的做法是在预训练阶段就混入一部分对齐数据,让模型从一开始就适应人类交互格式,而不是等最后再硬掰。他们在 Baichuan 2 报告里给出的数据是,在 CMMLU、GSM8K 等基准上,对齐后的能力损失比同期基于 LLaMA 2 的方案更小。
坦白讲,这个思路现在看不算独家——后来不少国产模型都采用了类似策略——但在 2023 年下半年,它算是比较早把这个问题系统性提出来的。
Baichuan 3 则把重心压在医疗上。团队公开的说法是,他们在 MedBench、CMB 等中文医疗基准上做了专门优化,还引入了“主动问询”机制,让模型在信息不足时主动追问病史,而不是硬编一个答案。这个设计在真实问诊场景里挺关键的,我自己用几个类似模型做过测试,很多模型会一本正经地瞎猜,反而医疗专用模型会停下来问你。
Baichuan-M1 是这条线的延续。2025 年 1 月发布的 14B 开源版本,专门针对医疗推理做了强化,官方在 Hugging Face 上给出了完整权重和评估报告。对于想在垂直场景做微调的团队来说,这是个不错的起点——14B 的体量在单张 A100 80G 上就能比较舒服地跑推理。
至于 Baichuan 4,公开的技术细节少了很多。从 API 行为反推,它在长上下文、工具调用和指令遵循上的提升比较明显,同期推出的“百小应”App 也验证了这些能力。
不同场景该选哪个版本?给个对照建议
说实话,“选哪个”这个问题没有标准答案,得看你的具体约束。我把常见的几类需求列出来,你可以对号入座:
- **只是想体验一下**:直接注册百川开放平台,用 Baichuan 4 的免费额度,别折腾本地部署。
- **要做私有化部署、数据不出内网**:Baichuan 2 系列的 7B/13B 仍是主流选择,社区生态成熟,vLLM、llama.cpp 都有现成支持。
- **医疗垂直场景**:优先看 Baichuan-M1,或者拿 Baichuan 2 的底座自己微调。
- **需要多模态能力**:关注 Baichuan-Omni 系列,不过公开的商用接口还在完善中。
- **成本敏感的高并发场景**:Baichuan 4 Turbo 的定价和延迟都比标准版更有优势。
一个
上手实操:两种方式调用 Baichuan
理论说再多不如跑一遍。这里给两种最常用的调用方式。
方式一:走官方 API(推荐新手)
百川的 API 兼容 OpenAI 的接口格式,如果你用过 OpenAI SDK,迁移成本几乎为零。我在一个内部工具里替换 base_url 和 key 之后,五分钟就跑通了。
from openai import OpenAI
百川智能的 API 兼容 OpenAI 格式,只需替换 base_url 和 api_key
client = OpenAI( api_key="sk-你的百川API密钥", # 从 platform.baichuan-ai.com 获取 base_url="https://api.baichuan-ai.com/v1" )
resp = client.chat.completions.create( model="Baichuan4", # 也可以填 Baichuan4-Turbo messages=[ {"role": "user", "content": "用一句话解释什么是对齐税"} ], temperature=0.7, # 0.3-0.7 之间比较稳,太高容易跑偏 max_tokens=512 )
print(resp.choices[0].message.content)
方式二:本地跑开源模型
如果数据不能出内网,用 transformers 加载 Baichuan 2 是最快的方式。7B 版本在单张 24G 显卡上用 bf16 精度就能跑起来。
from transformers import AutoModelForCausalLM, AutoTokenizer import torch
model_path = "baichuan-inc/Baichuan2-7B-Chat"
trust_remote_code=True 是必须的,百川用了自定义的模型实现
tokenizer = AutoTokenizer.from_pretrained( model_path, trust_remote_code=True, use_fast=False ) model = AutoModelForCausalLM.from_pretrained( model_path, trust_remote_code=True, torch_dtype=torch.bfloat16, # 24G 显存建议用 bf16,不要用 fp32 device_map="auto" ) model.eval()
messages = [{"role": "user", "content": "帮我写一个 Python 快排"}]
Baichuan2-Chat 自带 chat 方法,内部处理了 prompt 模板
response = model.chat(tokenizer, messages) print(response)
这里有个小坑我踩过:Baichuan 2 的 tokenizer 必须加 `use_fast=False`,否则在某些 transformers 版本下会报错。还有就是它用的是自定义的 `model.chat()` 方法,不能直接套 Hugging Face 的标准 generate 流程,prompt 模板得让它自己拼。
我的判断:百川在国产大模型梯队里的位置
聊完了“叫什么”和“怎么用”,说点更主观的。
百川最大的差异化其实不在模型本身的能力排名上——这个维度它和智谱、月之暗面、MiniMax 基本是缠斗状态。它真正的战略标签是两个:开源动作最激进(7B、13B、Baichuan 2、M1 一路开下去),以及医疗垂直化。前者帮它积累了开发者心智,后者让它在 B 端落地时有故事可讲。
但另一面,Baichuan 4 之后的闭源策略也确实让一部分开发者转向了 Qwen 和 DeepSeek 这类更彻底开源的路线。这不是百川独有的问题,是国产大模型商业化普遍要面对的取舍。
如果你是初次接触,建议从 API 入手感受一下;如果你是要做长期技术选型,那开源权重和许可协议的细节,比“叫什么名字”重要得多。
关键要点速览
- 百川智能的大模型统称 **Baichuan(百川)**,不是一个单一模型,而是一个系列
- 命名主线:Baichuan-7B/13B/53B → Baichuan 2 → Baichuan 3 → Baichuan 4
- 分支线:Baichuan-M1(医疗增强,开源)、Baichuan-Omni(全模态)
- 开源协议:Baichuan 2 及之前只需申请即可免费商用;Baichuan 3/4 为闭源 API
- 调用方式:API 兼容 OpenAI 格式;开源权重可通过 Hugging Face 加载
相关推荐
- **阅读相关专题**:想系统对比国产大模型的命名体系和版本演化,可以浏览 VergeX 的[国产大模型专题合集](https://nav.vergex.cn),里面按公司维度做了完整梳理。
- **查看工具推荐**:需要更多可用的模型 API 和推理工具,欢迎访问 [VergeX AI 工具导航](https://nav.vergex.cn),已收录上百款主流 AI 开发工具。
- **订阅更新**:百川后续若发布新版本,我会第一时间在 VergeX 更新解读。可以通过站点的邮件订阅或微信公众号获取推送,避免错过版本迭代的关键信息。

