中科院突破AI社会心智瓶颈:发布‘知境’大模型体系,直击AI情商与可信协作短板

中科院‘知境’团队发布全球首个社会心智大模型技术体系,以3481例专家标注数据构建能力图谱,首创诊断型评测基准SoMBench与靶向训练引擎FLARE,直击AI在真实社交场景中缺乏共情、推理与可信协作的核心短板,20个顶级模型在该基准上最高正确率仅72.08%,凸显该领域仍处技术无人区。

当GPT-5.5已能撰写专业论文、DeepSeek-V4-Pro可生成高复杂度代码、具身机器人可执行基础物理任务时,语言智能与工具智能正加速分化。然而,一旦进入家庭聚餐、团队会议或医患沟通等真实社交场景,多数AI仍显得机械、失当——问题不在知识储备不足,而在于缺乏对人际语境的深层理解与共情响应能力。这一‘社会心智’长期缺位,正成为AI从单点任务执行迈向可信社会协作的关键瓶颈。7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室‘知境’团队正式发布社会心智大模型技术体系。该体系并非单纯追求参数规模或榜单排名,而是首次将社会心智定义为可建模、可评测、可迭代的独立工程能力。其核心包含两大支柱:一是覆盖3481个经十余位人类专家严格筛选与标注的社会情境实例所构建的‘社会心智能力图谱’;二是全球首个细粒度诊断型评测基准SoMBench——支持单选、多选、判断与开放问答四类题型,并融合选项扰动、捷径识别与受控改写等技术,精准定位模型失效根源(如推理链断裂、表面模式误判等)。在SoMBench测试中,当前20个顶尖大模型最高正确率仅72.08%,无一逼近90%理论天花板,印证社会心智仍是AI领域的‘无人区’。配套训练引擎FLARE则实现闭环优化:当模型在诊断集中暴露特定认知缺陷(如角色立场混淆、隐含意图误读),系统自动合成语义新颖、场景重构、路径重设但靶向同一能力维度的新样本,并经多轮难度过滤,确保训练题既非简单重复,亦非超出当前学习边界——真正实现‘哪里弱、练哪里;练新题、不刷题’。

来源:量子位

AI 前线

三万小时触觉数据破局具身智能:复旦×新智具身联合发布触觉认知三部曲

2026-7-27 0:17:06

AI 前线

飞书深诺发布Marvy 2.0:首个深度嵌入出海营销全链路的可信赖AI智能体系统

2026-7-27 16:42:00

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索