Gemini是哪一家的AI?Google大模型家族拆解

本文解析gemini是哪一家的ai,涵盖Google DeepMind的研发脉络、原生多模态技术原理和API实战调用,帮助读者彻底搞清Gemini的归属与用法。

Gemini是哪一家的AI?Google大模型家族拆解

上周在一个开发者群里,有人贴了张截图问"Gemini是哪一家的AI,怎么一会儿Bard一会儿Gemini一会儿DeepMind的,我头都大了"。这问题看着简单,其实背后牵扯的是Google过去三年最剧烈的一次AI组织重组。我2023年12月Gemini首发那天就申请了Bard的体验权限,一路从`palm` SDK迁到`google-generativeai`,又迁到现在的`google-genai`,被官方改名折腾过至少三次,所以对这个话题还算有点发言权。

核心结论:Gemini是Google(谷歌)旗下的大语言模型系列,由Google DeepMind团队研发,2023年12月6日首次对外发布。它不是收购来的产品,而是Google Brain与DeepMind合并后整合出的旗舰模型线,直接对标OpenAI的GPT系列。

如果你只想知道这一句,那已经可以关掉页面了。但如果你像我一样,被Google这一堆产品名搞晕过,下面这段梳理应该能帮你省下不少搜索时间。

Gemini是哪一家的ai?答案只有一句话

Gemini是Google的。不是Meta的,不是Anthropic的,也不是某个创业公司的产品。它的研发主体叫 Google DeepMind —— 这个名字本身也是个合并产物:2023年4月,Google把原来的Google Brain(大脑团队)和2014年收购来的DeepMind合成了一个新部门,由Demis Hassabis领导。换句话说,Gemini的血统里既有DeepMind做AlphaGo的强化学习基因,也有Brain做大模型基础设施的工程能力。

这里有个细节值得说清楚:DeepMind是Google在2014年以约4亿英镑收购的伦敦AI公司,现在它是Google内部的研发部门,不是独立公司。 所以严格来讲,说"Gemini是DeepMind的"和说"Gemini是Google的"都没错,只是前者指研发主体,后者指母公司。

我在Google AI Studio里第一次调Gemini API的时候,注意到返回体里的`model`字段写的是`models/gemini-pro`,而文档页脚挂的版权方是Google LLC。这个细节其实已经说明了一切。

从Bard到Gemini:一段把所有人绕晕的更名史

坦白讲,Google在这块的命名策略堪称灾难级。

2023年3月,Google推出聊天机器人Bard,底层用的是LaMDA模型。同年12月,Gemini 1.0发布,Google把Bard的底层模型换成了Gemini Pro,但产品名还叫Bard。直到2024年2月,Bard才正式改名为Gemini。这中间近三个月的时间里,你可以在Bard的界面里用着Gemini的模型,却看不到Gemini这个名字——难怪大量用户到现在都搞不清它们的关系。

我把关键节点整理成了一张表,方便对照:

| 时间 | 事件 | 关键信息 | |------|------|----------| | 2014年1月 | Google收购DeepMind | 约4亿英镑,伦敦团队 | | 2023年4月 | Google Brain与DeepMind合并 | 成立Google DeepMind,Demis Hassabis任CEO | | 2023年3月 | Bard发布 | 底层为LaMDA,后切换至Gemini Pro | | 2023年12月6日 | Gemini 1.0发布 | 分Ultra/Pro/Nano三档,Ultra在MMLU得分90.0% | | 2024年2月 | Bard更名为Gemini | 产品名与模型名统一 | | 2024年2月 | Gemini 1.5 Pro发布 | 支持100万token上下文窗口 | | 2024年12月 | Gemini 2.0 Flash发布 | 主打原生工具调用与低延迟多模态 | | 2025年3月 | Gemini 2.5 Pro发布 | 引入"思考"能力,长上下文推理大幅提升 |

根据Google官方博客2023年12月6日的公告,Gemini Ultra是首个在MMLU(大规模多任务语言理解)测试中超过人类专家水平的模型,得分90.0%,而人类专家基线为89.8%。这个数字当时在圈内引发了不小的讨论,因为差距只有0.2个百分点,有人觉得是里程碑,也有人觉得是精心挑选的测试集。我倾向于认为它有宣传成分,但Gemini Ultra在推理类任务上的表现确实比当时的GPT-4有明显的提升,这点我在实际对比中验证过。

技术原理:原生多模态到底意味着什么

这里要讲点稍微硬核的东西。

市面上大多数"多模态模型"的做法是:先训一个强大的文本模型,再外挂一个视觉编码器把图像转成文本模型能理解的向量。GPT-4V基本是这个路子。Gemini的官方说法是原生多模态(natively multimodal),指从预训练第一天开始,文本、图像、音频、视频就是混在一起喂进去的,模型在同一个表征空间里学习不同模态的对应关系。

这个区别在实际使用中能感觉到。我拿同一张带手写公式的电路图分别测试过Gemini 1.5 Pro和某个后期拼接的多模态模型,Gemini在识别手写符号并推导下一步时明显更稳,尤其是符号和上下文文字混排的场景。当然这只是个人观察,不构成严格的benchmark。

架构层面,Gemini 1.5系列转向了稀疏混合专家(MoE)结构。简单说,模型总参数量很大,但每次推理只激活其中一小部分专家网络,这样既保住了容量,又控制了推理成本。配合这一架构,Gemini 1.5 Pro把上下文窗口推到了100万token——大约相当于一本《三体》三部曲的体量。2025年的Gemini 2.5 Pro进一步把它扩展到200万token级别。

Gemini 2.0开始的另一个变化是原生工具调用。以前的函数调用要靠prompt工程硬凑,现在模型直接从训练阶段就学会了输出结构化的函数调用请求,还能调用Google搜索、代码执行环境。Gemini 2.5 Pro引入的"思考"机制(thinking)则是让模型在回答前先生成一段内部的推理链,在AIME 2025数学竞赛题上的准确率提升相当可观。

实战:怎么真正用上Gemini

搞清楚gemini是哪一家的ai之后,下一个问题自然是:如何使用Gemini? 目前主要有四条路。

第一条是面向普通用户的Gemini App和网页版(gemini.google.com),免费额度够日常用,订阅Google One AI Premium可以解锁2.5 Pro。第二条是Google Workspace里的集成,Gmail、Docs里直接调用。第三条是面向开发者的Google AI Studio,网页端就能调试prompt,免费额度对个人开发者很友好。第四条是Vertex AI,企业级部署,走GCP结算。

我个人最常用的是AI Studio + API这条线。新版SDK叫`google-genai`,比老版的`google-generativeai`干净不少。下面这段代码可以直接跑:

安装:pip install google-genai

from google import genai

API Key 从 https://aistudio.google.com/apikey 免费获取

client = genai.Client(api_key="YOUR_API_KEY")

调用 Gemini 2.0 Flash,适合低延迟的日常任务

response = client.models.generate_content( model="gemini-2.0-flash", contents="用一句话说明Gemini是哪个公司研发的模型" )

print(response.text)

输出示例:Gemini 是由 Google DeepMind 研发的多模态大语言模型系列。

多模态输入:直接传图片文件

import pathlib img = pathlib.Path("circuit.png") resp2 = client.models.generate_content( model="gemini-2.5-pro", # 复杂推理任务建议用 2.5 Pro contents=[img, "识别图中的手写公式并解释其含义"] ) print(resp2.text)

有个坑提醒一下:老代码里的`import google.generativeai as genai`在新SDK里已经不推荐了,Google在2025年逐步把支持重心移到了`google-genai`。我上个月迁移一个生产项目时,光是处理`GenerationConfig`的参数改名就花了半天——`candidate_count`还在,但`stop_sequences`的位置变了。所以如果你正准备接Gemini API,建议直接用新SDK起步,别走弯路。

如果你同时在评估多家模型,可以顺手对比一下各家在长上下文、多模态、价格上的差异。我之前整理过一份横向对比,放在VergeX的AI工具导航里,按场景分类会更好查。

几个常见误区,顺手澄清一下

误区一:Gemini和DeepMind是两个东西。 不对。Gemini就是Google DeepMind做出来的,DeepMind是Google内部部门,不是外部合作方。

误区二:Gemini就是Bard换了个名字。 部分对。Bard是产品名,Gemini既是模型名也是产品名。2024年2月之后两者统一了,但Bard时代底层还用过LaMDA和PaLM 2,不能简单划等号。

误区三:Gemini只有对话功能。 差得远。Gemini Nano跑在Pixel手机和Chrome上做端侧推理,Gemini for Google Cloud是企业的Agent平台,还有Med-Gemini这类垂直领域的变体。

误区四:Gemini是免费的所以能力弱。 这是我最想反驳的一条。免费额度不等于弱模型,Gemini 2.0 Flash在多项基准上的表现已经不输一些收费模型,它的定价策略更多是Google抢开发者入口的商业选择。

关键要点速览

  • Gemini由**Google DeepMind**研发,母公司是**Google(谷歌)**,2023年12月6日首发
  • 前身产品叫Bard,2024年2月完成品牌统一,底层模型从LaMDA一路换到Gemini系列
  • 核心特征是**原生多模态**与**超长上下文**,1.5 Pro支持100万token,2.5 Pro达到200万级别
  • 开发者接入优先选`google-genai`新SDK,个人用Google AI Studio,企业用Vertex AI
  • 根据Google官方2023年12月公告,Gemini Ultra是首个MMLU得分(90.0%)超过人类专家基线的模型

相关推荐

📖 延伸阅读

  • [大模型选型实战:Gemini、GPT、Claude 该怎么挑](https://nav.vergex.cn)
  • [多模态模型技术演进:从拼接式到原生训练](https://nav.vergex.cn)

🧰 工具推荐 想一次性对比主流AI模型的定价、上下文长度和适用场景?访问 VergeX AI工具导航,按大模型、图像生成、语音合成等分类筛选,省去逐个查文档的时间。

📬 订阅更新 VergeX 每周更新AI前沿动态与技术拆解。如果你希望第一时间收到类似的大模型深度文章,可以通过网站底部的邮件订阅入口留下邮箱,或关注我们的微信公众号推送。

大模型

gemini郭家毅在哪里直播?搞懂AI实时直播这套技术

2026-9-13 22:50:47

大模型

gemini3官网在哪?官方入口、使用教程与真假辨别指南

2026-9-13 22:51:10

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索