社会心智基准

关于 SoMBench

SoMBench 是一套以心理学理论为基础的社会智能评测基准,用于分析语言模型理解个体心智、处理社会互动并权衡社会规范的能力。

评估什么

社会智能不仅是识别情绪或复述规则,还包括理解他人的信念与意图、在互动中选择合适策略,以及根据关系、角色和情境判断行为是否得体。SoMBench 从三个相互关联的方向分析这些能力。

01

心智化能力

理解个体的信念、欲望、意图与情绪,并结合可见行为和情境线索推断其心理状态。

02

社会互动的策略性

在沟通、合作、冲突与协商中识别各方目标和关系,并选择与局势相匹配的互动策略。

03

社会文化-规范的内化与动态平衡

理解身份、角色和社会规范,并在规范冲突或情境变化时判断行为的适当性与边界。

如何阅读评测结果

排行榜先给出模型在当前评测数据上的整体表现,再沿能力体系逐层展开。总体结果适合快速比较,详细结果用于观察模型在不同能力方向和任务范式上的优势与局限。

  • 总体准确率 按照选中结果中的正确数除以总题数计算,用于比较模型的整体表现。
  • 能力维度 从一级能力维度继续查看二级能力维度,定位模型在具体社会认知能力上的表现。
  • 任务范式 通过细粒度任务范式继续分析具体推理任务,避免只用单一总分概括模型能力。

建设单位

SoMBench 由中国科学院计算技术研究所智能算法安全全国重点实验室建设。

关于我们

智能算法安全全国重点实验室(以下简称“实验室”)依托中国科学院计算技术研究所,于2024年12月获科技部批准建设。实验室学术委员会名誉主任为李国杰院士,主任为费爱国院士,实验室主任为程学旗研究员。实验室以构建智能算法理论体系、打造数字基础设施、服务国家重大需求为三大核心使命,聚焦智能算法的可信、可管、可控安全范式构建这一关键科学问题,布局智能算法安全基础理论、算法风险监测评估、智能装备安全增强、智能系统算法对抗及认知智能算法博弈五大重点研究方向,解决智能算法的可信域判定、透明化监测、临界点调控等重大技术挑战,建立智能算法安全理论基础,形成算法安全评估与算法智能博弈技术体系,已在前沿理论、技术创新及核心基础设施建设方面取得了重要进展,成为人工智能安全国家战略任务科技主力军和前沿科技创新的国际引领者。