-
阿里发布了他们最强思考模型,有点东西。。(附实测)
文章详细评测了阿里旗舰级思考模型 Qwen3-Max-Thinking。技术上,该模型引入了“测试时扩展”策略,通过经验累积式迭代实现自我反思修正;同时具备自适应工具调用的原生 Agent 能力,并原生兼容 Anthropic API 协议。实测显示,Qwen3 在处理长逻辑推理(如网文细节查询)、复杂逻辑陷阱识别、实时影评搜索汇总以及公务员图形推理题方面表现优异,甚至在部分任务中超越了 Gemi… -
红杉对话 LangChain 创始人:2026 年 AI 告别对话框,步入 Long-Horizon Agents 元年
本文编译自红杉资本对 LangChain 创始人 Harrison Chase 的访谈。文章指出 2026 年将成为长程智能体(Long-Horizon Agents)的元年,AI 将从对话框交互转向自主目标导向的执行。Harrison 详细阐述了 Agent 发展的三个阶段,强调当前已进入以“Harness(软件外壳)”为核心的第三个拐点,其中上下文工程(Context Engineering)… -
ACM Multimedia | 京东零售广告创意:统一的布局生成和评估模型
本文介绍了京东零售入选 ACM Multimedia 的研究成果 Uni-Layout。针对现有布局生成任务分散、评估标准与人类感知不一致的问题,该框架实现了三项核心创新:首先,通过分类体系将布局任务统一,利用多模态大语言模型(MLLM)构建通用生成器;其次,发布了包含 10 万个人工标注样本的数据集 Layout-HF100k,并开发了结合视觉、几何信息与思维链(CoT)推理的类人评估器;最后,… -
AGENTS.md 在我们的智能体评估中表现优于 Skills - Vercel
Vercel 深入研究了 AI 编码智能体如何学习特定框架的知识,特别是针对模型训练数据中不存在的 Next.js 16 API。他们对比了“Skills”(一种按需调用工具/文档的开放标准)与“AGENTS.md”(一种提供持久上下文的项目根目录 Markdown 文件)。结果令人惊讶:虽然 Skills 经常无法触发或需要脆弱的提示词,但嵌入在 AGENTS.md 中的 8KB 压缩文档索引却… -
元宝派、文心、UC…为什么 BAT 都急着给 AI 拉群?|甲子光年
文章探讨了近期 BAT(腾讯、百度、阿里)密集上线或内测“AI 群聊”功能的现象。分析认为,AI 群聊已从最初强调情绪价值的“AI 社交”演变为以任务为导向的“多人+多 Agent”协作模式。这种转变旨在解决单一 Chatbot 难以沉淀社会关系与协作历史的痛点,通过模拟“永远在线”的社交体验,试图构建 AI 时代的超级入口。腾讯元宝派、百度文心及 UC 浏览器的不同尝试,反映了巨头们从社交、办公… -
模型之外,AI 正在打开的新机会丨 a16z
文章深度解析了顶级风投机构 a16z 对 AI 应用周期的前瞻性判断。a16z 团队认为,当前正处于软件史上最大且最快的产品转变期,AI 正在从概念验证转向大规模生产部署。核心观点包括:AI 应用的竞争重点已从模型新颖性转向工作流所有权和数据护城河。文章提出了三个关键投资方向:一是现有软件类别的 AI 原生化重构;二是软件直接作为劳动力替代人类执行任务(如 Eve 案例);三是基于专有数据和闭环工… -
彻底被 Kimi 的新模型惊到了。
文章详细介绍了 Kimi 最新发布的 K2.5 开源模型。该模型实现了原生视觉与文本的统一,告别了传统“外挂式”图像理解,大幅减少了信息损耗。作者通过实测发现,K2.5 在前端代码生成和复杂动画交互方面表现卓越,甚至在某些高难度任务上优于 Gemini 3.0 Pro。文章进一步分析了 Kimi 的技术路径:在算力受限的情况下,通过 Muon 优化器和 Kimi Linear 线性注意力机制等工程… -
别担心它取代你的工作,但会吃掉你的部分工作
本文基于 OpenAI 首席研究员 Lukasz Kaiser 的观点,深入分析了人工智能的五个核心趋势。文章指出,AGI 的定义应从“取代人类”转向“增强人类”,AI 在数学和编程等数字领域已展现超人能力,但在物理世界受限于成本和技术。核心技术正从基于 Transformer 的“预测下一个词”转向具备“内部思考过程”的推理范式,使 AI 能够通过试错和反思解决复杂问题。此外,文章讨论了算力资源… -
构建无服务器、后量子加密的 Matrix 家用服务器
本文详细介绍了将 Matrix 家用服务器从传统的有状态单体架构迁移到使用 Cloudflare Workers 的无服务器架构的技术细节。通过将 PostgreSQL、Redis 和文件系统等传统组件映射到 Cloudflare 的 D1、KV、R2 和 Durable Objects,团队消除了服务器管理的运维“税”。核心亮点包括在传输层实现后量子加密(X25519MLKEM768)、使用 D… -
8B 端侧写作智能体 AgentCPM-Report 开源,DeepResearch 终于本地化
本文介绍了由清华大学、中国人民大学及面壁智能联合研发的开源端侧写作智能体 AgentCPM-Report。该模型仅 8B 参数,却能通过平均 40 轮深度检索与近 100 轮思维链推演,在本地环境下产出逻辑严密的万字调研报告。其核心优势在于“物理隔绝”的安全性,解决了企业深度研究中核心数据泄密的风险。技术上,它采用“写作即推理”模式,将长篇写作拆解为微小目标,并通过多阶段智能体学习强化检索、写作、… -
数据土壤,决胜 AI 下半场:一场关于企业 Data+AI 战略的炉边思辨
文章记录了 Snowflake 与 InfoQ 联合举办的“炉边对话”,多位行业专家回顾了 2025 年 AI 认知的重构,并对 2026 年的战略命题展开思辨。核心观点认为,AI 竞争的下半场已从模型算法转向“数据土壤”的质量与治理。讨论涵盖了 Agentic AI 的落地门槛、开源社区范式转移(从代码到提问)、工业与医药领域的 AI 实践路径,以及多云环境下打破数据孤岛的策略。专家们一致认为,… -
AI 驱动的智能异常处置:从异常发现到根因定位
文章详细阐述了阿里云计算平台在应对大规模分布式系统运维挑战时的 AI 驱动方案。核心内容包括:在异常发现阶段,通过自研的周期分解算法和基于分布的检测模型实现单/多指标及日志的精准监控;在告警降噪阶段,利用时间序列下钻和日志聚类技术进行影响面评估与问题定界;在根因定位阶段,创新性地提出了多 Agent 协同框架,模拟专家排障流程,并结合 RAG 和自主编排提升诊断可靠性。最后,文章分享了基于阿里云百… -
前端同事看走眼了,这个“游戏网页”其实全是 AI 写的!
文章详细介绍了 Kimi K2.5 的核心升级与实测表现。K2.5 引入了四种模式,其中“Agent 集群模式”通过多 Agent 并行协作,将原本需数天的复杂任务(如 40 篇论文综述)缩短至十几分钟。在 Vibe Coding 领域,K2.5 展现了极强的视觉理解与前端生成能力,能根据简单 Prompt 或截图生成高质量、可交互的网页及丝滑动效。此外,文章还探讨了月之暗面为解决 Transfo… -
曦望发布推理 GPU S3:All-in 推理的国产 GPU,开始算单位 Token 成本
国产 GPU 厂商曦望(Sunrise)发布了新一代推理专用 GPU 启望 S3 及其配套的寰望 SC3 超节点方案。该产品采取了“反常识”的纯推理路线,放弃峰值训练性能,转而优化单位 Token 成本。S3 采用国内首款 LPDDR6 显存方案,支持 FP16 到 FP4 多精度切换,在 DeepSeek 等主流模型推理中使单位 Token 成本下降约 90%。此外,曦望通过兼容 CUDA 的软… -
中国开源 AI 生态的架构选择:超越 DeepSeek 的建设之路
报告研究了自 2025 年初以来中国 AI 社区的演变,指出其已从单纯的模型复制转向战略性的架构选择。核心趋势包括:为了在现实约束下平衡高推理能力与成本效益,几乎一致转向混合专家(MoE)架构;以阶跃星辰(StepFun)和腾讯为代表的厂商引领了多模态“全能(Any-to-Any)”模型(音频、视频、3D)的激增。此外,生态系统表现出对小型实用模型(0.5B-30B)的强烈偏好,这些模型通过大型“… -
Kimi K2.5:视觉智能体智能
本文探讨了 Moonshot AI 发布的 Kimi K2.5,这标志着从仅限文本的 K2 模型进行的重大升级。关键增强功能包括在 15 万亿混合 Token 上训练的原生多模态支持,以及能够协调多达 100 个子智能体进行并行工作流的独特“智能体集群”架构。作者通过 SVG 视觉生成测试了该模型,并通过让其将复杂的软件插件项目分解为可并行的组件来测试其推理深度。虽然该模型展示了令人印象深刻的代码… -
在使用智能体编程时评估内部质量
本文通过为基于 Swift 的 Mac 应用 CCMenu 添加 GitLab 支持的案例研究,探讨了 AI 编程智能体对内部软件质量的影响。虽然像 Windsurf 和 Claude Code 这样的智能体可以快速生成功能性代码,但它们往往在非功能性需求和惯用精准度上表现不佳。Fowler 强调了一个具体实例:智能体提出了一个“氛围修复(vibe fix)”——使用空字符串来处理可选令牌——这绕… -
从零开始构建流水线并行
本技术指南和课程大纲深入探讨了流水线并行的机制,这是训练超出单张 GPU 显存容量的大规模 AI 模型的关键技术。内容遵循结构化的教学路径:从单体多层感知器(MLP)基准开始,逐步进行手动模型分区和分布式通信原语的实现。核心内容侧重于流水线调度策略的演进,从基础的“停止并等待”方法,发展到行业标准的 GPipe(含微批次处理)以及高效的交错式 1F1B(一前向一后向)算法。它将理论推导与异步通信的… -
Claude Code 浏览器自动化方案,怎么选?
文章针对开发者在 Claude Code 及 AI Agent 开发中面临的浏览器自动化选型问题,深入对比了由 Vercel、Google 和微软分别推出的三款头部方案。Agent Browser 以轻量、省 Token 为核心优势,适合日常浏览和简单信息采集;Playwright MCP 凭借其跨浏览器支持和高稳定性,成为复杂业务流程和功能测试的首选;而 Chrome DevTools MCP … -
强化学习最难的不是算法,是写环境!
文章作者分享了从 2024 年开始学习多智能体强化学习(MARL)的心路历程,重点探讨了在 AGV 仓库协同任务中遇到的挑战。作者指出,强化学习最核心的难点在于“环境设计”,即如何将现实场景翻译成智能体可理解的语言。文章详细讨论了状态空间设计(从全知视角到局部观测)、奖励函数避坑(防止智能体钻空子)、以及利用图神经网络(GNN)建模复杂关系的实践经验。作者强调,环境设计本质上是建模问题,定义了世界…
AI 前线
❯
个人中心
购物车
优惠劵
今日签到
有新私信
私信列表
搜索
扫码打开当前页
返回顶部
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
✈优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!









