-
全球首个混合推理模型:Claude 3.7 Sonnet 来袭,真实编码力压一切对手
Anthropic 发布了新型旗舰模型 Claude 3.7 Sonnet,这是一个混合推理模型,支持标准和扩展思考模式,并允许 API 用户控制思考时间。同时,Anthropic 还推出了智能编码工具 Claude Code,作为有限的研究预览版,旨在提升开发者的编码效率。Claude 3.7 Sonnet 在编码能力方面表现出色,在 SWE-bench Verified 上实现了 SOTA 性… -
Vibe engineering
本文介绍了一种有纪律、负责任的 “Vibe engineering” 方法,适用于经验丰富的软件工程师,它与快速、不负责任地使用 AI 的 “Vibe 编码” 截然不同。得益于涌现的编码代理(比如 Claude Code、Codex CLI 和 Gemini CLI),它们可以迭代、测试和修改代码,这让经验丰富的开发者能用 LLM 更快地完成工作,同时保证软件的质量绝对靠谱。作者强调,玩转 LLM… -
首个 OpenAI 免费推理模型 o3-mini 发布!DeepSeek 让奥特曼反思:不开源我们错了
文章详细介绍了 OpenAI 发布的最新推理模型 o3-mini 系列,这是 OpenAI 首次向用户免费推出的推理模型,包括 low、medium 和 high 三个版本。o3-mini 在响应速度、数学、科学和编码能力等方面表现出色,尤其在高推理强度下超越了前代产品 o1-mini,同时降低了重大错误率。在与 DeepSeek 的竞争中,o3-mini 性能更强,但性价比仍逊一筹。文章还引用了… -
一文详解|Gemini-3,及配套的 Antigravity、Gemini CLI、生成式 UI、Otter、Firebase..
本文以“2025 年 11 月 19 日”为背景,大胆虚构并详尽展望了 Google 发布 Gemini 3 模型及其一系列颠覆性配套产品的未来图景。文章首先通过多个令人惊叹的案例,展示了 Gemini 3 Pro 在复杂代码生成、多模态理解和超长上下文处理方面的强大能力,并强调其在各项基准测试中(如 LMArena)的领先地位。为支撑这种超凡能力,文中引入了创新的“Deep Think”模式,通… -
AI 代理已到来。接下来怎么办?
Hugging Face 博客的文章《AI 代理已到来。接下来怎么办?》深入探讨了 AI 代理这一新兴技术,这些系统能够自主执行与用户目标一致的任务。文章强调了大语言模型(LLMs)的快速发展,使这些代理能够以越来越高的自主性运行,将复杂任务分解为子任务而无需人工干预。文章讨论了 AI 代理的伦理问题,特别是与其自主性相关的风险,如安全、隐私和安全问题。文章认为完全自主的 AI 代理会带来重大风险… -
JustHTML:一场生动的“氛围工程”实践
本文介绍了 JustHTML 这个全新的 Python HTML 解析库,并将其定位为“氛围工程”(vibe engineering)的典范。作者最初被 JustHTML 吸引,源于其诸多出色特性:纯 Python 实现、100%测试覆盖率、通过全部 9,200 多项 html5lib 测试,以及对 CSS 选择器的支持。深入研究后发现,该库几乎完全是在多种大型语言模型(包括 Claude Cod… -
DeepSeek-R1 更新,思考更深,推理更强
DeepSeek 发布了其 R1 模型的小版本更新 DeepSeek-R1-0528,基于 DeepSeek V3 Base 基座,通过增强后训练显著提升了模型的思维深度和推理能力。新版本在数学、编程和通用逻辑等多项基准测试中表现优异,特别是在复杂推理任务如 AIME 2025 中准确率大幅提升。文章提到模型在解题过程中使用了更多 tokens 进行深入思考。此外,新版模型优化了幻觉问题,降低幻觉… -
“上下文工程”的兴起
文章介绍了“上下文工程”,将其定义为构建动态系统,为 LLM 提供正确的信息、工具和格式,以便它能够可靠地完成任务。它认为这对于可靠的代理系统至关重要,因为失败往往源于不充分或格式不佳的上下文,而不仅仅是模型的固有局限性。它将上下文工程与提示工程区分开来,认为后者是前者的一个子集。文章提供了工具使用、记忆和检索等示例,并将 LangGraph 和 LangSmith 定位为实现这种方法的工具,强调… -
AI Agent 的「GPT 时刻」,Manus 炸醒整个 AI 圈!
文章介绍了 Monica.im 研发的全球首款 AI Agent 产品 Manus。Manus 强调直接交付最终结果的能力,通过模拟人类工作方式的多代理架构,在独立虚拟机中运行,可调用各类工具完成复杂任务。文章列举了 Manus 在旅行规划、股票分析、教育内容创建、保险政策比较以及 B2B 领域的应用案例,展示了其自主规划和执行任务的能力。Manus 像一个数字代理人或实习生,能根据用户需求进行自… -
菜鸡才用 AI 写代码,10 倍程序员这样用 Claude 重塑编程工作流
本文深入探讨了如何通过 AI 协作,将编程工作流从传统模式升级为高效的场景化解决方案。文章首先通过 Anthropic 团队的真实案例,展示了 AI 在提升开发效率、缩短周期和扩展能力边界方面的巨大潜力。随后,作者将程序员日常工作归纳为核心关键路径(同步协作)、重复性执行任务(异步自主)和未知领域探索(混合探索)三大场景,并提供了对应的 AI 协作策略。文章还分享了三个被低估的高效技巧:'… -
我的 Cursor 编程实践经验分享
本文深度总结了作者在大淘宝技术团队近两个月使用 Cursor AI 编程助手的实战经验。文章首先剖析了开发者在使用 Cursor 时常遇到的效率和产出不符预期等痛点,并明确指出 Cursor 在日常开发中实现提效的关键在于“有效的 Rules、正确的开发流程和标准的 Prompt”。文章详细介绍了如何构建标准化的 Prompt,包括目标、上下文和具体要求,并提供了项目理解、方案设计、代码生成和单测… -
一文全解析:AI 智能体 8 种常见的记忆(Memory)策略与技术实现
文章深入探讨了 AI 智能体在长对话场景中面临的记忆挑战,特别是大语言模型(LLM)上下文长度限制导致的早期信息遗忘和资源消耗问题。为解决这些痛点,文章系统性地剖析了 8 种主流的 AI 记忆策略,涵盖了从基础的“全量记忆”和“滑动窗口”,到更高级的“相关性过滤”、“摘要/压缩”、“向量数据库”、“知识图谱”、“分层记忆”以及“类 OS 内存管理”。每种策略都详细阐述了其核心原理、具体特点(包括优… -
【生成式人工智慧與機器學習導論 2025】第 7 講:大型語言模型的學習歷程
本课程深入探讨了 ChatGPT 和 Gemini 等 LLM 背后的三阶段学习范式:预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)。文章通过“学龄前、上学、进入社会”的生动类比,清晰阐释了每个阶段在模型能力演进中的作用。预训练阶段通过海量自监督数据奠定语言与世界知识基础,强调算力、模型大小与数据质量的权衡(如 Chinchilla 定律),并探讨了数据瓶颈和模型并非死记硬背的特性… -
300 万行代码精简到 30 万!腾讯新闻推荐架构重构复盘
文章详细复盘了腾讯新闻推荐系统一次为期 24 个月的大规模架构重构项目。作者首先明确了“重构”的定义,并阐述了何时及为何需要重构,指出旧架构面临性能瓶颈、扩展困难和高维护成本等痛点。接着,文章深入探讨了“平迁”与“重建”两种重构策略的选择标准,并分享了腾讯新闻采用“以平迁为主,局部重建”的混合策略。核心重构策略是“绞杀者模式”,通过建立代理层、模块化拆分、灰度发布和逐步下线老模块,实现了业务不中断… -
Anthropic 发布 AI Agent 上下文工程指南
文章深入探讨了 Anthropic 提出的“上下文工程”概念,将其定位为“提示词工程”的自然演进,强调在构建工业级 LLM 应用时,需全面管理模型可访问的整体状态。文章指出,尽管 LLMs 处理能力增强,但仍存在“上下文衰减”现象,因此需要精心设计上下文以应对有限的“注意力预算”。指南详细介绍了高效上下文的结构,包括清晰的系统提示词、高效的工具设计和规范的少样本示例。此外,文章还提出了针对长期任务… -
当 AI 创业公司遇困境,能借“Agent 化”找到新出路吗?
文章探讨了 AI Agent 技术的发展现状和未来趋势。2023 年底斯坦福大学的 AI 实验项目引发了对 AI Agent 的期待,但一年后,许多产品仍停留在对话机器人阶段。2024 年,AI Agent 成为科技巨头竞争的新焦点,OpenAI、Anthropic、微软、谷歌等公司纷纷推出相关产品,国内大厂如百度、阿里、腾讯也积极布局。尽管 AI Agent 依赖 LLM 的“黑盒”特性,存在不… -
好的 founder 都懂的道理:taste 才是 AI 创业最大的壁垒
文章深入分析了在生产力极大提升的 AI 时代,为何“品味”(taste)成为衡量产品价值和创业成功的新稀缺资源。文章通过 Stripe、Spotify、Notion 等具体案例阐释,真正的品味不仅是美学设计,更是通过上万个细微、一致的决策积累形成的复合效应,需要创业者付出代价进行取舍和坚持。它不是快速迭代的对立面,反而是实现可持续高速发展的关键。文章阐述了品味如何渗透到产品设计、用户体验、市场策略… -
分享 3 个飞书多维表格+快捷指令的超绝用法,这才是自动化真神。
本文深度解析了如何将飞书多维表格与苹果快捷指令进行高效联动,实现了三大自动化应用场景,旨在极大提升个人及团队的生产力。首先,文章简要介绍了苹果快捷指令的基础功能及其作为手机本地轻量级工作流的潜力。接着,作者通过三个实际案例进行了详细的步骤指导:一是利用快捷指令快速记录公众号文章链接和选题思路,并通过飞书多维表格的 AI 字段捷径进行内容分析;二是搭建可视化的全自动记账工具,通过快捷指令识别截屏金额… -
实测 Claude 3.7:3200 行代码一口气输出,物理规律手拿把掐,弱智吧已失守
文章对 Anthropic 最新发布的 Claude 3.7 Sonnet 大语言模型进行了全面评测。结果表明,该模型在编程能力上表现突出,能够快速生成高质量代码,实现复杂的游戏机制和物理模拟,速度和代码质量均优于其他模型。同时,Claude 3.7 Sonnet 在逻辑推理方面也有显著提升,能够识破逻辑陷阱,准确理解问题。此外,文章还介绍了 Claude 3.7 Sonnet 在实际开发场景中的… -
从 Prompt 到 Context:为什么 Think Tool 是形式化的必然?
文章以编译原理为理论基础,深刻阐述了 AI 编程(或 AI 系统开发)中从 Prompt Engineering 到 Context Engineering,再到 Anthropic 的 Think Tool 的演进路径。作者首先回顾了语言形式化的必要性,并引入乔姆斯基谱系作为衡量语言形式化程度的标尺,指出其在表达能力与可预测性间的权衡,并将其类比到当前 AI 工程师面临的困境。接着,文章详细分析…
AI 前线
❯
个人中心
购物车
优惠劵
今日签到
有新私信
私信列表
搜索
扫码打开当前页
返回顶部
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
✈优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!








