Gemini中的Gem是什么?自定义AI助手到底怎么玩
上个月有个做跨境电商的朋友在微信上问我:"gemini中的gem是什么?我在 Gemini 侧边栏里看到这个入口,点进去一堆英文名字,完全不知道能干嘛。"
我当时正在用自己搭的一个 Gem 做选品文案的初审,就顺手截了个图给他看。他愣了两秒说:这不就是每次都要粘贴一遍的那套提示词吗?
对,也不对。这篇就把 Gemini 中的 Gem 到底是什么、技术上是怎么实现的、以及我自己怎么用它,一次讲清楚。
核心结论:Gemini 中的 Gem(英文写作 Gems)是 Gemini 应用内的"自定义 AI 助手"功能。它本质是一份可保存、可复用的 System Prompt 加一组知识文件,创建一次后每次对话都自动携带这套人设与规则。底层模型没有变,变的是提示工程被产品化了。
Gemini中的Gem是什么?先给一个不绕弯的定义
Gems 是指 Google 在 Gemini 应用中提供的定制化 AI 助手对象,用户可以给它起名字、写指令、挂载参考资料,然后像切换聊天窗口一样在多个 Gem 之间来回切换。
这东西第一次正式亮相是 2024 年 8 月 28 日。根据 Google 官方博客当天的公告,Gemini Advanced 订阅用户(当时对应 Google One AI Premium,19.99 美元/月)可以创建自己的 Gems,Google 同时预置了五个现成角色:Brainstormer、Career guide、Writing editor、Coding partner、Learning coach。
中文界面里这几个预置 Gem 的译名各版本略有差异,但功能是一致的。后来 Google Workspace 的商业版 Gemini 也接入了 Gems,2025 年起 Google 又开始把它下放到更多用户层级,包括部分地区的免费账户(来源:Google Gemini 帮助中心《Create & manage Gems》)。
所以如果你在免费账号里也看到了这个入口,不是你记错了。
拆开看:一个 Gem 到底由什么组成
一句话概括——Gems 是 Google 把"提示工程"从一次性动作变成了持久化配置。
System Instruction 才是 Gem 的骨架
你在创建 Gem 时填的那个"指令"输入框,落到 API 层就是 `system_instruction`。它和普通对话消息不在同一个优先级上:模型会把它当作整个会话的前置约束,而不是可以被后续对话冲淡的一句普通提问。
我用 Python 复刻一个和网页端 Gem 等价的逻辑,你可以对照着看:
from google import genai from google.genai import types
client = genai.Client(api_key="YOUR_API_KEY")
下面这段就是你在网页端创建 Gem 时填进"指令"框的内容
CODE_REVIEWER_PROMPT = """ 你是一名资深 Python 后端工程师,负责代码评审。 规则:
- 只指出可能造成线上故障的问题,不讨论代码风格偏好;
- 每条意见必须给出可直接替换的修改片段;
- 输出用 Markdown 表格,列为:问题、风险等级、修改建议。
"""
chat = client.chats.create( model="gemini-2.5-flash", config=types.GenerateContentConfig( system_instruction=CODE_REVIEWER_PROMPT, # 关键:等效于 Gem 的设定 temperature=0.2, # 评审类任务压低随机性 ), )
resp = chat.send_message("帮我看看这段代码:def f(l): return l[::-1]") print(resp.text)
跑通这段代码,你就理解了 Gem 的全部秘密——没有黑魔法,没有微调,就是一段被固定下来的系统指令。
知识文件和技术边界
Gem 还允许上传文件作为参考知识。按 Google 帮助文档的说法,上传的内容会作为该 Gem 的上下文资料参与检索,而不是塞进模型权重。这意味着两件事:一是知识更新只需要换文件,二是它仍然受上下文窗口限制,别指望把一个几百页的产品手册全丢进去还能保持精准。
Gems、普通对话、自定义 GPT 到底差在哪
我把这几种方案横向拉了个表,这是我实际选型时整理的版本:
| 维度 | 普通 Gemini 对话 | Gemini Gems | 自定义 GPT | API + System Prompt | |---|---|---|---|---| | 配置持久化 | 无,每次重写提示词 | 有,一次创建长期复用 | 有 | 取决于你的代码 | | 技术本质 | 纯对话 | System Instruction + 知识文件 | System Instruction + 工具链 | System Instruction | | 上手成本 | 零 | 低,图形界面 | 低 | 中,需要写代码 | | 可编程性 | 无 | 弱 | 中(可接 Action) | 强 | | 适合场景 | 零散问答 | 个人/小团队固定流程 | 对外发布的助手 | 生产系统集成 | | 底层模型 | 可选 | 可选 | 仅 OpenAI 系 | 可选 |
我的判断是:Gems 解决的是"个人重复劳动"这一层的问题,而不是"产品化交付"。想对外发布一个给几百人用的助手,仍然要走 API。
我在项目里怎么用它
说点真实的。我给自己搭的第一个 Gem 叫"选题审稿人",工作流是丢一篇文章大纲进去,它按我预设的五个维度打分并给出修改意见。
前两周用得挺爽,第三周就翻车了。它开始给我的反馈越来越笼统,什么"建议增加案例支撑""结构可以更清晰"——全是废话。我一开始以为是模型退化了,后来才反应过来:是我自己在指令里写得太松。"给出改进建议"这种表述,模型完全可以敷衍了事。
改法很土但很有效:把那些模糊要求全部换成可勾选的检查项。比如不写"评估内容质量",改写为"逐条判断是否存在以下五个问题:①核心概念未定义 ②缺少具体数据来源 ③段落长度趋于雷同 ④结论段与前文重复 ⑤没有给出下一步行动建议"。改完之后输出质量肉眼可见地稳定了。
这件事让我对 Gems 有了一个更清醒的认识:它降低的是重复输入的成本,不是提示工程的门槛。你原本写不好提示词,做成 Gem 之后只是把一个糟糕的提示词固化了下来,反而更难发现自己在偷懒。Google 官方文档里也反复强调 Gem 的效果高度依赖指令的具体程度,这不是客套话。
反过来,一旦指令写得够具体,Gems 带来的复利效应非常明显。我那个审稿 Gem 现在已经迭代到第七版,累计用了几百次,节省的时间大概是重新搭建一套提示词框架的好几倍。
几个容易被带偏的误解
Gems 不等于 Gemma。 这是我见过最多的混淆。Gemma 是 Google DeepMind 在 2024 年 2 月 21 日开源发布的轻量级模型家族(后来陆续有了 Gemma 2、Gemma 3),是拿权重、能自己部署的那种。Gems 是 Gemini 应用里的一个功能模块,两者名字像,路线完全不同。
Gems 不是微调。 它不会改变模型参数,换掉指令,行为立刻回到默认状态。
Gems 不保证跨版本一致。 底层模型升级后,同一个 Gem 的输出风格可能变化。这一点在把 Gem 用在正式工作流里之前,值得专门测一轮。
上手路径与我的建议
如果你现在想试,按这个顺序走效率最高:
- 先别急着自建,把五个预置 Gem 各用一遍,感受一下"指令会怎样塑造输出"
- 挑一个你每周至少重复三次的任务,把它做成 Gem
- 第一版指令不要追求完美,但一定要包含输出格式和禁止事项
- 用满两周后回头改一次指令——这一步几乎所有人都会跳过,但收益最大
- 需要接进生产系统时,把 Gem 里的指令原样搬到 API 的 `system_instruction`,逻辑是通用的
想看看目前主流对话式 AI 工具各自的自定义助手方案,可以在 VergeX AI工具导航 里横向对比一下,比逐个注册试用来得快。
关键要点速览
- Gemini 中的 Gem(Gems)是 Gemini 应用内的自定义 AI 助手功能,2024 年 8 月 28 日随 Gemini Advanced 正式推出
- 技术本质是持久化的 System Instruction 加可选知识文件,不涉及模型微调
- 它适合固化个人重复流程,不适合直接当产品对外交付
- 输出质量取决于指令的具体程度,模糊指令会被原样放大
回到最开始那个问题——gemini中的gem是什么?说白了就是把你每次都要复制粘贴的那长串提示词,存成了一个可以点开就用的按钮。工具本身不复杂,复杂的是你想清楚自己到底要它干什么。
相关推荐
阅读相关专题
- 大模型提示工程实践:从 System Prompt 到结构化输出
- Gemini 与 GPT 系列模型能力横评
查看工具推荐
- 想找更多支持自定义助手的大模型工具?访问 [VergeX AI工具导航](https://nav.vergex.cn),已按对话助手、代码模型、多模态等分类整理
订阅更新
- 订阅 VergeX 邮件通讯或关注公众号,获取每周 AI 工具实测与技术拆解

