复旦大学与新智具身联合发布触觉智能研究‘三部曲’:N0-Foundation首次验证触觉模态具备媲美视觉的规模化扩展潜力;N0-VTLA实现触觉信号无缝嵌入主流视觉-语言-动作(VLA)架构,打破模态壁垒;N0-TWAM则将触觉深度整合进世界模型顶层设计,使其与视觉并列为物理交互的认知双支柱。这标志着机器人正从‘纯视觉理解’迈向‘视触协同推理’——不再仅靠‘看见’判断,更通过主动触摸验证假设、预演操作、动态校准。例如,‘识别插座’不等于‘成功插入’,‘看到杯子’不等于‘稳握拿起’,这些人类与生俱来的物理直觉,首次被系统性编码为机器底层认知逻辑。N0-TWAM采用混合专家架构,集成视频、触觉、动作三大异步子网络,总参数仅72亿(约为全宽方案一半),却可同步预测未来视频帧、触觉反馈与动作序列,显著缓解世界模型在真实场景中的物理对齐失配问题。实测显示:在插拔插头任务中,N0-VTLA成功率高达85%(视觉方案仅60%);拔钥匙达99%(视觉方案仅35%)。更突破性的是,其引入失败轨迹驱动的自主进化机制——通过触觉增强的进度评估模型,精准识别任务阶段、‘救场行为’乃至‘能力退化’,结合离线强化学习,在毛巾折叠、书包收纳、纸箱折叠等长程任务中,成功率分别跃升至95%、80%、75%,真正实现‘从失败中持续学习’。
来源:量子位
