桃子桃子快讯
返回首页
研究论文

中科院发布「知境」社会心智大模型技术体系

中科院计算所推出覆盖评测、训练与部署的社会心智技术体系,Zing 系列模型在多项基准上宣称超越主流大模型。

2026.07.27 · 周一4 分钟阅读

7 月 24 日,中国科学院计算技术研究所智能算法安全全国重点实验室「知境」团队正式发布「知境社会心智大模型技术体系」,围绕 AI 在人际交互中的「情商」能力,构建了从评测、训练到部署的完整工程框架。该体系由三部分组成:评测基准 SoMBench、模型系列 Zing 以及部署架构 Actio。

评测先行:SoMBench 建立社会心智坐标系

「知境」团队首先发布了 SoMBench 评测基准,将笼统的「懂不懂人」拆解为 3 大一级维度、17 个二级维度、71 项细粒度任务,覆盖从基础信念推断到高阶情绪理解、从社会规范到关系建模的完整光谱。基准包含 3481 道经过十余名人类专家评审保留的实例,并支持单选、多选、判断与开放题等多种题型,通过选项扰动、捷径检测与受控改写等手段定位模型的错误模式。在该基准上,20 个顶级大模型的最佳正确率仅为 72.08%,无模型达到 90% 天花板。

训练体系:Zing 模型与自适应进化机制

基于 SoMBench 的诊断结果,团队推出 Zing 系列模型(参数量覆盖 8B、14B、27B、32B),并设计了三项核心训练机制:

  • FLARE 数据飞轮:根据模型暴露的认知短板,针对性合成全新训练样本——语义与推理路径不同于原题,但瞄准同一能力缺陷;候选样本经多轮过滤,仅保留中高难度样本。
  • 两阶段训练:第一阶段用多教师蒸馏构建冷启动数据,并以 Mixed-Reward GRPO 强化学习框架,根据任务类型与训练阶段动态组合过程奖励、可验证奖励与拒绝采样;第二阶段针对薄弱环节进行监督微调与困难样本持续校准。
  • OPD 在线蒸馏:在在线轨迹上引入教师模型的 token 级分布约束,避免强化学习过程中出现「学新忘旧」的风险。

基准成绩:宣称超越部分主流大模型

依据原文披露的数据,Zing-27B 在 5 项国际权威社会心智评测基准上的综合均值达 79.80,超越文中提到的 GPT-5.5(78.44),并在 HiToM(+4.08pp)与 EmoBench(+5.62pp)上优势明显;Zing-32B 综合均值 76.32,略超文中提到的 DeepSeek-V4-Pro(75.90)。小尺寸模型方面,Zing-8B 在 HiToM 上达到 78.08,Zing-14B 达到 80.00,分别较同尺寸基座模型提升约 12 与 8 个百分点。需要说明的是,文中所引对比对象为该报道发布时点所披露的版本,读者可据此自行核实当前主流大模型的实际水平。

部署架构:Actio 按需激活心智能力

Actio 是团队设计的显式心智状态部署架构,以 Harness 为编排核心,可按任务需求选择性激活四类支撑模块:PRISM(76 项分层心理与社交技能,按需路由)、Starling Memory(显式记录「谁、何时、相信什么」,支持版本化更新)、SAGE(跨任务可复用推理经验,三级回退激活)以及 Gated RAG(社会文化知识按需检索)。一次典型推理经历「识别心智需求 → 并行检索技能、知识与记忆 → 排序裁剪组合 → 离线沉淀经验」四步。

应用方向与开源计划

团队表示,8B/14B 小参数模型适合端侧部署,可用于家庭看护、儿童陪伴、协作机器人等需要实时社会推理的场景;社会心智建模框架未来亦可服务于政策沟通、危机管理、组织变革等复杂决策推演,以及多智能体系统的统一心智协议。评测基准、模型权重与技术报告将在 GitHub 仓库 github.com/Zhijing-AI/Zing 陆续开源,技术报告已发布于 zhijing-AI.github.io/Zing/。

作为面向「心智空间」的工程化尝试,该体系将社会智能从模糊的「情商」概念,推进为可测量、可训练、可检查的工程对象,为通用人工智能的下一步发展提供了新的技术路线参考。

信源