智元机器人自主研发的全模态大模型WITA-Omni,在权威评测基准DailyOmni中以综合得分85.21分荣膺全球第一,全面超越谷歌Gemini、英伟达、千问、豆包等主流通用大模型。该评测聚焦真实开放环境下的音视频联合理解,要求模型在连续时序中精准判断声画对应(86.13分)、事件先后(84.64分)及跨模态因果推理(85.06分),并在30秒/60秒长视频理解、比较式理解等高阶任务中领跑。八项核心指标中六项夺魁,首次在‘感知—时序—推理’全链条建立系统性优势。
尤为关键的是,WITA-Omni并非通用内容模型,而是根植于具身智能场景的原生架构:其‘Thinker–Talker–Actor’三位一体设计,打破传统语音交互流水线式延迟,实现全双工实时语轮切换——听得清、判得准、接得顺、动得自然。在动态对话节奏、打断恢复、附和响应等真实交互维度上,显著优于GPT-Realtime等闭源商用模型。这标志着智元已从机器人本体厂商,跃升为具备全链路AI能力的第一梯队玩家。
此次登顶印证了智元‘三智一体’技术路径的战略正确性:运动智能为基、作业智能提效、交互智能赋感。继WorldArena综合评测第一、GO系列作业模型与运控基座领先后,交互智能的全球登顶,完整勾勒出其面向产线、门店与家庭部署态的生产力闭环。当行业迈入2026年规模化落地关键期,WITA-Omni所代表的‘自然交互力’,正成为衡量具身智能真实价值的新标尺。
来源:智东西
