当GPT-5.5已能撰写专业论文、DeepSeek-V4-Pro可生成高复杂度代码、具身机器人可执行基础物理任务时,语言智能与工具智能正加速分化。然而,一旦进入家庭聚餐、团队会议或医患沟通等真实社交场景,多数AI仍显得机械、失当——问题不在知识储备不足,而在于缺乏对人际语境的深层理解与共情响应能力。这一‘社会心智’长期缺位,正成为AI从单点任务执行迈向可信社会协作的关键瓶颈。7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室‘知境’团队正式发布社会心智大模型技术体系。该体系并非单纯追求参数规模或榜单排名,而是首次将社会心智定义为可建模、可评测、可迭代的独立工程能力。其核心包含两大支柱:一是覆盖3481个经十余位人类专家严格筛选与标注的社会情境实例所构建的‘社会心智能力图谱’;二是全球首个细粒度诊断型评测基准SoMBench——支持单选、多选、判断与开放问答四类题型,并融合选项扰动、捷径识别与受控改写等技术,精准定位模型失效根源(如推理链断裂、表面模式误判等)。在SoMBench测试中,当前20个顶尖大模型最高正确率仅72.08%,无一逼近90%理论天花板,印证社会心智仍是AI领域的‘无人区’。配套训练引擎FLARE则实现闭环优化:当模型在诊断集中暴露特定认知缺陷(如角色立场混淆、隐含意图误读),系统自动合成语义新颖、场景重构、路径重设但靶向同一能力维度的新样本,并经多轮难度过滤,确保训练题既非简单重复,亦非超出当前学习边界——真正实现‘哪里弱、练哪里;练新题、不刷题’。
来源:量子位
