-
地平线HSD V2.0实测:世界模型驱动的端到端智驾「二次进化」
地平线HSD V2.0通过世界模型+端到端强化学习双引擎,实现智驾系统从规则执行到场景理解的质变。实测显示无接管里程提升56%、博弈能力跃升167%,窄路掉头、社会常识决策、VLM道路语义识别等能力突破显著,标志着一段式端到端架构进入可持续自进化新阶段。- 0
- 0
-
Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了
本文介绍持续学习(Continuous Learning)这一新兴 AI 赛道,深度解析 Mind Lab 的 Macaron V1 技术架构与商业路径,并将其置于硅谷同行的竞争格局中,探讨「参数空间迭代」与「提示词空间迭代」两条路线的本质差异与产业意义。- 0
- 0
-
Agent 开始“自我进化”:会出题、会反思,还会自己长出新技能
本文深度解析了自进化 Agent 的技术演进路径,将其划分为经验存储型、RL 训练型与 0 数据自学型三大路线,并详细拆解了各路线下的前沿研究工作。- 0
- 0
-
Qwen3.8-Max:编程与办公,全面跃升
通义千问发布 Qwen3.8-Max 旗舰模型,凭借 2.4 万亿参数与百万上下文,在长程自主编程、科研复现及复杂商业经营等领域实现端到端交付能力的突破。- 0
- 0
-
LLM 学习笔记:最好的学习方法是带着问题去寻找答案
本文对 LLM (大型语言模型) 的学习方法进行了探讨,强调带着问题去寻找答案。文章首先分析了大模型聊天过程,从流程和原理两个层面进行了浅析,然后详细介绍了 LLM 的预训练、后训练 (SFT) 和强化学习 (RL) 三个构建步骤,这三个阶段是递进关系,各自作用不同,包括数据集的准备、Tokenization、词汇表构建、数据分片、模型架构选择等关键环节。同时,文章还结合当前主流的应用形式,如文件…- 0
- 0
-
Andrej Karpathy:AGI 仍需十年,长期挑战犹存
在本次深度访谈中,人工智能专家 Andrej Karpathy 对通用人工智能 (AGI) 即将到来的观点提出质疑,并断言 AGI 仍需十年才能实现。他强调,当前的大语言模型 (LLM) 存在关键的认知缺陷,例如缺乏持续学习能力、多模态交互不足以及计算机交互能力较弱,这些缺陷使其无法胜任复杂的任务。Karpathy 严厉批评强化学习 (RL),认为其效果“糟糕”,因为它存在稀疏且嘈杂的监督机制。他…- 0
- 0
-
2.6B参数碾压百亿级巨兽!Liquid AI最新实验性模型LFM2 2.6B Exp发布
圣诞节当天,知名边缘AI初创公司Liquid AI正式发布了其最新实验性模型LFM2-2.6B-Exp,这一仅有2.6B(26亿)参数的小型开源模型,在多项关键基准测试中表现出色,尤其在指令跟随能力上超越了参数量高达数百亿的DeepSeek R1-0528,引发业界广泛热议,被誉为“最强3B级模型”。模型背景:纯强化学习驱动的实验突破LFM2-2.6B-Exp基于Liquid AI第二代Liqui…- 0
- 0
-
Kimi 硬刚多模态满血版 o1,首曝训练细节!强化学习 scaling 新范式诞生
Kimi 发布了 k1.5 多模态思考模型,这是继去年 11 月和 12 月发布的 k0-math 和 k1 模型之后的又一次重大升级。k1.5 在数学、代码和多模态推理能力上达到了 OpenAI o1 满血版的水平,成为全球范围内首个在 Long CoT 模式下达到这一水平的非 OpenAI 模型。Kimi 团队通过创新的强化学习 scaling 技术,如长上下文扩展、改进的策略优化、简化框架和…- 0
- 0
-
AI 算法开源|Logics-Parsing:攻克 PDF 复杂文档端到端结构化处理
文章详细介绍了阿里巴巴自主研发并开源的 Logics-Parsing 模型,旨在解决传统 OCR 和现有视觉语言模型在处理复杂 PDF 文档(如多栏排版、图文混排、专业公式、手写字)时存在的理解和阅读顺序不足的问题。Logics-Parsing 基于 Qwen2.5-VL 架构,采用“SFT-then-RL”两阶段训练策略,核心创新在于引入了以布局为中心的强化学习(LC-RL),通过精心挖掘标注的…- 0
- 0
-
121. 对 DeepMind 谭捷的访谈:机器人、跨本体、世界模型、Gemini Robotics 1.5 和 Google
本期播客深入访谈了 Google DeepMind 高级研究科学家谭捷,聚焦机器人技术的前沿发展。谭捷分享了其从计算机图形学转型机器人研究的经历,强调了强化学习和大语言模型对机器人领域的革命性影响。他指出,大语言模型赋予机器人理解语言和常识的能力,而强化学习则擅长底层运动控制,二者结合构建了机器人的“大脑”与“小脑”。播客详细介绍了 DeepMind 的 Gemini Robotics 1.5 项…- 0
- 0
-
从 RLHF、PPO 到 GRPO 再训练推理模型,这是你需要的强化学习入门指南 | 机器之心
文章作为强化学习入门指南,首先介绍了 RL 在 LLM 中的重要性,并从吃豆人游戏引入 RL 基本概念(环境、agent、动作、奖励)。随后详细讲解了 RLHF、PPO,并着重介绍了 DeepSeek 提出的 GRPO 算法。相较 PPO,GRPO 通过移除价值模型并利用多次采样来计算优势,显著提升了训练效率。文章还提及了 RLVR 以及强化学习中“耐心即所需”的哲学理念。最后,文章结合开源库 U…- 0
- 0
-
k1.5 新模型登场:Kimi 如何做到满血版多模态 o1 水平(附技术报告)
文章介绍了 Kimi 推出的全新多模态模型 k1.5,该模型在短链思维(short-CoT)和长链思维(long-CoT)模式下均表现出色,尤其在数学、代码和视觉推理任务中大幅领先现有 SOTA 模型如 GPT-4o 和 Claude 3.5 Sonnet。k1.5 的核心优势在于其强化学习框架,包括长上下文扩展、改进的策略优化方法以及简洁高效的训练设计。此外,Kimi 技术团队首次公开了详细的训…- 0
- 0
-
奖励模型终于迎来预训练新时代!上海 AI Lab、复旦 POLAR,开启 Scaling 新范式 | 机器之心
文章详细介绍了上海人工智能实验室与复旦大学联合提出的预训练奖励模型 POLAR,旨在解决大语言模型后训练阶段奖励模型面临的数据成本高、泛化能力差等核心问题。POLAR 创新性地引入“策略判别学习”范式,通过对比学习衡量候选策略与最优策略的“距离”,摆脱对人类绝对偏好的依赖。其训练分为大规模自动化合成数据预训练和少量偏好数据微调两阶段。实验结果表明,POLAR 在偏好评估和强化微调(RFT)应用中均…- 0
- 0
-
通义 WebSailor 开源,首个挑战 BrowseComp 基准的开源网络智能体!
文章详细介绍了通义实验室最新开源的网络智能体 WebSailor,该智能体在复杂网络检索任务中展现出强大的推理和检索能力,并在高难度评测集 BrowseComp 上取得了开源榜单第一的成绩,甚至超越了部分闭源模型如 DeepSeek R1 和 Grok-3。WebSailor 的核心优势在于其创新的 post-training 方法,包括大规模合成高不确定性复杂任务数据 SailorFog-QA,…- 0
- 0
-
The Second Half:一位 OpenAI 科学家的 AI 下半场启示录
本文是 OpenAI 科学家姚顺雨对 AI 发展下半场的解读,核心观点是 AI 的发展正从解决问题转向定义问题,Evaluation (模型评估) 会比 Training (模型训练) 更重要。文章回顾了 AI 上半场以算法和模型创新为主的特点,例如 Transformer、AlexNet、GPT-3 等,指出强化学习 (RL) 在实现通用人工智能 (AGI) 中的关键作用,并强调了先验知识 (p…- 7
- 0
强化学习
❯
个人中心
购物车
优惠劵
今日签到
有新私信
私信列表
搜索
扫码打开当前页
返回顶部
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
✈优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!












