-
Claude Opus 4.5 发布!2 小时工程测试超人类,前代 Sonnet 搞不定的活它轻松拿捏
文章详细介绍了 Anthropic 最新发布的大型语言模型 Claude Opus 4.5,强调其在编码、Agent 功能和计算机使用方面的显著提升。该模型在两小时高强度工程测试中得分超越所有人类候选人,并在前端开发、视觉能力、深度研究、PPT 制作和电子表格处理等日常任务中表现出色。文章指出,Opus 4.5 的核心优势在于其卓越的“理解力”,能够自主处理模糊场景、权衡复杂决策,并解决前代 So… -
110. 逐段讲解 Kimi K2 报告并对照 ChatGPT Agent、Qwen3-Coder 等:“系统工程的力量”
本期播客深入探讨了大型语言模型(LLM)驱动的 AI 智能体(Agent)从理论研究到实际应用的复杂性与挑战。嘉宾首先对 Agent 进行了清晰定义和分类,包括 Coding Agent、Search Agent、Tool-Use Agent 和 Computer Use Agent,并阐述了其感知与行动的核心能力。对话对比了 In-Context Learning 和端到端训练两种主流技术路线的… -
DeepSeek 新模型被硅谷夸疯了!用二维视觉压缩一维文字,单 GPU 能跑,"谷歌核心机密被开源"
文章详细介绍了 DeepSeek 最新开源的 DeepSeek-OCR 模型,该模型创新性地提出“上下文光学压缩”思路,利用视觉方式高效压缩文本信息,显著降低大模型处理长文本的计算开销。通过将文字信息转化为少量视觉 token,实现了高达 10 倍的压缩率,同时保持 97%的 OCR 解码准确率,并在主流文档解析基准 OmniDocBench 上取得了 SOTA 性能。其核心 DeepEncode… -
最强 3B「小钢炮」,代码数据全公开!推理随意开关,128k 超长上下文
文章详细介绍了 Hugging Face 最新发布的 SmolLM3 大型语言模型,该模型以 30 亿参数在小模型中脱颖而出,支持 128k 超长上下文和独特的双推理模式(think/no_think),并实现了全链路(训练、对齐、架构、数据)100%开源。文章深入阐述了 SmolLM3 在 Llama 架构基础上的多项关键优化,如 GQA 机制、NoPE 编码、文档内注意力屏蔽和稳定性优化。此外… -
LangChain CEO 再聊 Agent:chat 模式只是起点,Ambient Agents 才是未来
本文通过 LangChain CEO Harrison Chase 和企业 Agent 平台 Dust CEO Stanislas Polu 的深度对谈,探讨了 AI 智能体(Agent)的未来发展。文章首先澄清了 Agent 与 Workflow 的定义和核心区别,指出 Agent 更具灵活性和想象空间。随后,两位 CEO 展望了 Agent 的交互模式将从当前的聊天模式转向更“环境化”(Amb… -
独家对话 OpenAI 姚顺雨:生成新世界的系统
文章独家对话 OpenAI 研究员姚顺雨,深入探讨 AI Agent(智能体)的演进历程与未来趋势。姚顺雨从个人经历出发,阐述了其从计算机视觉转向语言模型,并最终专注于 Language Agent 研究的非共识路径。他强调语言作为实现泛化通用系统最本质的工具,并指出 GPT 模型在开放行为空间决策上的优势远超 BERT。文章详细梳理了 Agent 从符号主义 AI 到深度强化学习,再到大语言模型… -
刚刚,微软推出 AI 浏览器,上网从此不一样了
文章详细报道了微软 Edge 浏览器推出的“Copilot 模式”,该模式将浏览器深度集成 AI 能力,使其从显示工具转变为能主动执行任务的 AI 助手。核心功能在于其跨标签页情境感知能力,能同时读取、分析所有打开的标签页,进行复杂总结和比较。文章介绍了 AI 浏览器如何通过统一输入框实现智能导航、信息提取、标签分组等功能,并提及了未来将推出的“主题式旅程”及自动执行预订、购物等任务。同时,文章也… -
AI 写代码的“上下文陷阱”:为什么 AI 总是写错?如何系统性解决?
本文深入探讨了 AI 辅助代码生成中常见的“上下文陷阱”问题,即 AI 因缺乏完整、精确和聚焦的上下文信息而导致代码生成错误。作者提出了一套系统性的解决方案,核心是“上下文工程”和应用级记忆结构的设计。该方案将上下文分为三层:应用基础记忆(系统架构、技术栈等)、功能模块记忆(具体功能描述、链路图、关键逻辑)和需求迭代记忆(当前业务需求、技术方案)。文章详细阐述了如何利用 AI 辅助记忆的构建、维护… -
Claude 代码框架之战
本文深入探讨了开发者社区正在进行的“Claude 代码框架之战”——一场通过实验各种结构、编排与标准,试图从 AI 编程中榨取更多价值的运动。文章阐述了将 AI(特别是 Claude)视为一个“框架”而非简单的聊天框的核心思想,即通过一套包含规则、角色和工作流的系统,以实现可预测且有价值的输出。文中详细列举了设计 AI 工作流的八个核心决策点:任务管理、指令方式、AI 智能体协作、会话运行、工具使… -
程序员的自我修养 - 架构要素与认知
本文以“程序员的自我修养”为主题,深入探讨了系统架构的核心概念、原则与方法。首先,文章基于《系统架构》一书,详细阐述了“形式”、“功能”和“概念”三者关系,并定义了系统、价值、复杂系统等一系列关键术语,提出了涌现、整体、聚焦、价值与架构、解决方案中立等架构原则及方法论。其次,文章着重强调了“概念”在软件设计中的决定性作用,提出“概念为王”的观点,认为清晰、合理的概念是解决复杂历史包袱、统一团队认知… -
Qwen3 小升级即 SOTA,开源大模型王座快变中国内部赛了
文章详细报道了阿里云 Qwen3 大模型最新版本的发布,该版本采用 MoE 架构,总参数量 235B,激活参数 22B,并在基准测试中超越了 Kimi K2 和 DeepSeek-V3。新版 Qwen3 不再采用混合思维模式,而是分别训练 Instruct 和 Thinking 模型,显著提升了通用能力、多语言长尾知识覆盖、用户偏好符合度以及 256K 长上下文理解能力。文章还指出,随着 Llam… -
Agent Factory:Agentic AI 的新纪元 - 常见用例和设计模式
本文深入探讨了 Agentic AI 这一新兴领域,强调其超越传统 RAG 模型、推动实际业务影响的重要性。Agentic AI 通过使智能体能够推理、行动和协作来实现这一目标。文章介绍了构建强大企业自动化解决方案的五个基本模式:工具使用(智能体与系统交互)、反思(自我改进以提高可靠性)、规划(分解复杂任务)、多智能体(专业智能体之间的协作)和 ReAct(自适应问题解决)。每个模式都通过真实的 … -
刚刚,OpenAI 首个 L3 级智能体深夜觉醒!AI 自己玩电脑引爆全网,AGI 一触即发
本文深入解读了 OpenAI 最新发布的智能体 Operator,这是一款能够像人类用户一样直接与计算机图形用户界面(GUI)交互的 AI 系统。Operator 的核心技术是 Computer-Using Agent (CUA),它通过感知屏幕像素、模拟鼠标键盘操作,实现了对各种软件和网页的通用控制,突破了传统 AI 依赖 API 的局限。文章详细介绍了 Operator 的工作原理、技术优势,… -
大模型如何推理?斯坦福 CS25 重要一课,DeepMind 首席科学家主讲 | 机器之心
文章深入解读了 Google DeepMind 首席科学家 Denny Zhou 在斯坦福大学 CS25 课程中对大语言模型推理能力的权威观点。他提出 LLM 推理的关键在于生成一系列中间 token,而非简单地扩展模型规模,这种机制使 Transformer 模型能变得极其强大。文章阐述了预训练模型本身已具备推理能力,但需要通过链式推理解码、提示技巧(如思维链)、监督微调(SFT)以及当前最强大… -
122. 朱啸虎现实主义故事的第三次连载:人工智能的盛筵与泡泡
本期播客中,资深投资人朱啸虎深入分析了当前 AI 领域的诸多热点议题。他认为,至少在未来三年内 AI 产业泡沫不会形成,二级市场的看跌情绪可能旨在为未来爆发奠定基础。他指出 OpenAI 已从对 AGI 的纯粹追求转向了应用端,特别是通过群聊、POS 等功能争夺日活用户,展现了清晰的战略调整。他强调 AI 应用的关键在于超级入口的争夺以及用户日活和时长的积累,并特别看好中国在数据中心建设和开源生态… -
41 个榜单 SOTA!智谱最新开源 GLM-4.5V 实测:看图猜地址、视频秒变代码
文章详细介绍了智谱最新开源的 GLM-4.5V 多模态视觉推理模型,该模型基于 GLM-4.5 基座,并在 42 个公开榜单中 41 项夺得 SOTA,成为 100B 级别最强开源多模态模型。文章通过 GeoGuessr 看图猜地址、清明上河图 Grounding、视频转前端代码、空间关系理解、UI 转 Code、图像识别和物体计数等多个实测案例,全面展示了 GLM-4.5V 在图像、视频和文档理… -
127. 大模型季报跨年对谈:和广密预言 AI War 的两大联盟、第三范式 Online Learning
本期播客围绕全球 AI 领域的竞争格局展开深入对话,提出了 AI War 而非 AI Bubble 的观点,认为 AI 竞争已上升至国家战略层面。嘉宾们分析了以英伟达 GPU 和谷歌 TPU 为代表的两大阵营,以及 OpenAI、Anthropic 等领先模型之间的交替领先常态。同时,重点探讨了在线学习(Online Learning)作为继预训练和强化学习之后的第三个范式,预示其可能带来的核弹级… -
OpenAI 内部揭秘:我们如何使用 Codex
文章详细揭示了 OpenAI 内部团队如何利用其 AI 编码助手 Codex,覆盖了从安全到基础设施的多个工程领域。它总结了七大核心应用场景,包括加速代码理解、高效重构与迁移、性能瓶颈识别与优化、提升测试覆盖率、加快开发速度、帮助工程师保持心流,以及辅助探索与构思。此外,文章还分享了六项实用的最佳实践,如从“提问模式”开始、像写 GitHub Issue 一样组织提示、逐步完善 Codex 环境等… -
Claude Haiku 4.5 介绍
Anthropic 发布了 Claude Haiku 4.5,他们最新的小型模型,该模型实现了接近顶尖水平的编码性能,可与 Claude Sonnet 4 相媲美。同时,成本仅为三分之一,速度却是两倍以上。这一进步使高智能 AI 更容易获得,并且对于各种应用来说效率更高,特别是那些需要实时、低延迟响应的应用,例如聊天助手、客户服务代理和结对编程。Haiku 4.5 在 Agentic AI 编码任… -
刚刚,马斯克发布 Grok 4!全榜第一,年费飚到 2 万+ | 机器之心
文章详细报道了 xAI 新一代大模型 Grok 4 的发布及其宣称的强大能力。马斯克声称 Grok 4 在 SAT 和 GRE 考试中接近满分,并在所有学科达到“博士后”水平。Grok 4 的推理能力相较前代提升 10 倍,得益于强化学习和工具调用能力的增强。文章列举了 Grok 4 在 HLE、GPQA、ARC-AGI、Vending-Bench 等多项高难度基准测试中取得 SOTA 成绩,并展…
AI 前线
❯
个人中心
购物车
优惠劵
今日签到
有新私信
私信列表
搜索
扫码打开当前页
返回顶部
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
✈优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!


















