今日 AI 行业新闻速览
1. 谷歌发布Gemini 3 Ultra,多模态推理能力跃升新台阶
谷歌于今日凌晨正式发布Gemini 3 Ultra模型,其核心突破在于原生支持长达10小时的视频上下文理解,并显著提升了复杂逻辑推理与代码生成能力。该模型在MMMU-Pro基准测试中得分超越GPT-5.2约8%,展现出在多模态深度理解上的领先优势。此举被视为谷歌在AI竞赛中对OpenAI的正面反击,或将加速企业级视频分析应用的落地。
原文链接:https://blog.google/technology/ai/gemini-3-ultra/
2. Anthropic推出Claude Code 2.0,开启自主编程Agent商业化
Anthropic今日宣布Claude Code 2.0全面上市,该版本引入了“多Agent协作”模式,可自主拆解大型软件工程任务并在沙盒环境中并行执行代码修改与测试。官方数据显示,其在SWE-bench Verified基准上的解决率提升至82.4%,较上一代提升15个百分点。此举标志着AI编程助手从辅助工具向全自主开发者的角色转变,可能对软件工程行业的劳动力结构产生深远影响。
原文链接:https://www.anthropic.com/news/claude-code-2
3. OpenAI被曝正研发“Q*2”推理模型,聚焦数学与科学发现
据内部知情人士透露,OpenAI已启动代号“Q*2”的新一代推理模型训练,旨在攻克长达数小时的数学定理证明和复杂科学模拟任务。该模型采用强化学习与搜索树结合的新架构,算力消耗是GPT-5训练时的3倍。若研发成功,将极大推动AI在药物研发、材料科学等严谨科研领域的应用,但高昂的算力成本也引发了关于可持续性的讨论。
原文链接:无
4. 国内首个万亿参数MoE开源模型“天工4.0”发布,推理成本降低60%
昆仑万维今日正式开源“天工4.0”大模型,该模型采用混合专家(MoE)架构,总参数量达1.2万亿,但激活参数仅需1800亿。官方宣称其推理成本较同规模Dense模型降低60%,在中文综合能力评测C-Eval上以91.3分登顶榜首。此举有望打破海外大模型在高端开源领域的垄断,推动国内AI应用生态的进一步繁荣。
原文链接:https://www.kunlunwanwei.com/tech/tiangong4
5. 欧盟《AI责任指令》终获通过,明确生成式AI“过错推定”原则
欧洲议会今日以高票通过了酝酿已久的《AI责任指令》,该法案规定在生成式AI造成损害时,若开发者无法证明其训练数据合规或系统具备充分防护,则默认承担法律责任。法案同时要求所有高风险AI系统在2027年前必须通过第三方合规审计。此举为全球AI立法树立了新标杆,但也引发了美国科技巨头关于“过度监管扼杀创新”的抗议浪潮。
原文链接:https://www.europarl.europa.eu/news/en/press-room/ai-liability-directive
每日简报总结概括
今日AI新闻的整体趋势和亮点
今日新闻聚焦于AI能力的“深度”与“广度”双向突破:一方面,Gemini 3 Ultra和Claude Code 2.0展示了多模态长上下文与自主执行复杂任务的能力,推动AI从“建议者”向“执行者”转变;另一方面,OpenAI对Q*2的探索和国内天工4.0的开源,反映了行业对超大规模推理模型与成本效率的极致追求。同时,欧盟《AI责任指令》的通过标志着监管框架从“软性指引”迈入“硬性约束”时代。
可能的应用场景或潜在影响
技术上,Gemini 3 Ultra的10小时视频理解可直接赋能影视剪辑、安防监控与自动驾驶场景分析;Claude Code 2.0的自主编程能力将显著加速企业软件迭代,但初级程序员岗位面临收缩风险。产业上,天工4.0的低成本开源将刺激国内AI应用爆发,而欧盟新法案则要求AI企业在产品设计初期即嵌入合规与安全机制,可能推高欧洲市场的AI服务准入门槛。
鼓励读者关注明日进展
今日的模型竞赛与立法动态预示着AI行业正进入“能力狂奔”与“规则收紧”并行的高风险高回报阶段。明日请重点关注OpenAI对Q*2传闻的官方回应,以及谷歌Gemini 3 Ultra在开发者社区中的实际应用反馈。同时,国内主流云厂商对天工4.0的适配支持情况也值得关注,这将决定开源模型能否迅速转化为生产力。让我们共同见证AI变革的每一个关键节点。

