大模型包括哪些?主流模型分类与选型实战指南
上周三晚上,一个做企业知识库的朋友突然发消息问我:我们准备接大模型了,可打开技术文档一看,GPT、Claude、Qwen、Llama,后面还跟着 VL、R1、Instruct 各种后缀,到底大模型包括哪些?该从哪儿下手?
这个问题我被问过太多次。大部分人第一次接触时的印象都是"就是 ChatGPT 那种能聊天的东西",可真到落地阶段才发现,这个家族远比想象中庞杂。有只能处理文字的,有能看图看视频的,有能下载权重自己微调的,也有只能隔着 API 调用的。分类搞不清楚,选型基本靠碰运气。
下面我把平时梳理大模型体系的思路完整写一遍,包括分类维度、主流成员,以及我在几个实际项目里踩过的坑。
核心结论摘要:大模型按模态可分为语言、多模态、语音、视频四类;按开放程度分为开源与闭源;按地域形成海外与国产两大阵营。真正决定项目成败的是模态需求、上下文长度和推理成本这三项,而不是参数规模。
大模型包括哪些?先建立三个分类维度
"大模型"这个词目前没有统一官方定义。学术语境下它通常指参数规模十亿以上的预训练语言模型,也就是 LLM(Large Language Model)。这两年语义被拉宽了,图像生成、视频生成模型也经常被塞进来。
我自己的做法是用三个维度做交叉定位,任何一个模型都能在三秒内说清它是什么。
维度一:模态。 模型接收和输出什么类型的信息。纯文本一类,文本加图像一类,文本加音频、视频又是另一类。这是最直观、也最影响技术选型的维度。
维度二:开放程度。 权重能不能拿到手里。开源模型可以下载、量化、私有化部署;闭源模型只能通过 API 调用。
维度三:训练阶段与能力定位。 同一个基座,经过不同阶段的训练会变成完全不同的东西。基座模型、指令模型、对话模型、推理模型,这四个身份经常被混为一谈,后果还挺严重。
三个维度摞起来,基本就拼出了大模型的全景地图。
语言大模型仍是绝对主力,但它内部还有分层
按模态看,语言大模型的数量和迭代速度都遥遥领先,这块值得单独展开。
语言大模型是指输入输出都只处理文本的模型。GPT-4 系列早期版本、Llama 3.1、Qwen2.5、DeepSeek-V3、GLM-4 都属这一档。它们的共性是训练数据以文本为主,推理时也只输出 token 序列。
有意思的是,同一个语言大模型按训练阶段还能再切一刀:
| 类型 | 训练方式 | 典型代表 | 适合场景 | |---|---|---|---| | 基座模型 Base | 纯下一词预测 | Llama 3.1 Base | 二次预训练、领域继续训练 | | 指令模型 Instruct | 指令数据微调 | Qwen2.5-Instruct | 结构化任务、批量处理 | | 对话模型 Chat | 偏好对齐训练 | GPT-4o、Claude 3.5 | 交互式问答、Agent | | 推理模型 Reasoning | 强化学习长思维链 | o1、DeepSeek-R1 | 数学、代码、复杂规划 |
坦白讲,很多人抱怨"模型不听话",根因就是阶段用错了。拿基座模型直接做对话,效果当然惨不忍睹;用推理模型跑简单的信息抽取,又白白烧掉几倍的成本和延迟。这个坑我自己踩过,后来在团队内部立了条规矩:任何新任务先确认需要的模型形态,再去看具体型号。
多模态大模型是另一大分支,门槛是至少接受两种模态输入。GPT-4o、Gemini 1.5 Pro、Claude 3.5 Sonnet 都支持图像理解,其中 Gemini 1.5 Pro 的上下文窗口按 Google DeepMind 官方发布信息(2024 年 2 月)达到了一百万 token 级别。国内 Qwen-VL、GLM-4V、豆包视觉版属同类产品。
再往外一层是语音和视频。语音模型像 Whisper、GLM-4-Voice;视频生成模型像 Sora、可灵、Vidu。严格讲视频生成模型跟语言模型的技术路线差异巨大,但在行业沟通里大家习惯并称为大模型。这个叫法不算严谨,我自己写内部文档时会用括号注明实际技术类别,免得新人混淆。
开源、闭源与国产阵营:三个身份标签怎么理解
开放程度这个维度特别容易被低估。我的经验是,它比参数量更能决定一个项目到底能不能落地。
开源阵营这几年变化很大。Meta 在 2024 年 7 月 23 日发布 Llama 3.1,把旗舰模型权重直接放了出来,405B 版本上下文长度 128K。阿里通义的 Qwen 系列、深度求索的 DeepSeek 系列走的是同一条路线。这些模型能下载到本地、量化成 4bit 跑在单卡上,也能放进私有云。
这里有个细节值得说清楚:Llama

