一、事件概述

arXiv 上出现了一篇题为 《Beyond Right and Wrong: Evaluating Second-order Social Reasoning in Large Language Models》 的新论文(arXiv:2609.05437v1,公告类型为 new,提交时间为 2026 年 7 月 17 日)。

作者包括 Sunny Rai、Jinyi Kuang、Reyhan Jamalova、Annie Lou、Cristina Bicchieri、Niyati Malhotra、Victor Hugo Orozco-Olvera、Ana Maria Munoz-Boudet、Lyle H Ungar、Sharath C Guntuku,研究方向横跨人工智能与计算与社会(论文同时归类于 cs.AI 与 cs.CY)。

论文提出了一个核心区分:

  • 一阶社会规范(first-order social norms):什么是社会可接受或不可接受的,比如“不要偷窃”。以往 AI 对齐工作主要集中在这一层。
  • 二阶社会预期(second-order expectations),即 元规范(metanorms):当规范被违反时,谁会去执行它、以什么方式执行——例如公开羞辱,甚至监禁。

论文认为,社会智能不只是识别规范,还包括预判规范的执行方式,因此提出了一个评估 LLM 元规范推理能力的新框架,并发布了配套数据集与分类任务。

摘要给出的主要发现是:当前 LLM 描绘了一个比现实更严苛的社会。在六个模型上,它们会在人类预期“不作为”的场景中过度预测负面制裁;并且随着社会距离增加,模型与人类判断的一致性会下降。

二、关键技术点

1. 评估框架:两个维度

论文沿两个维度评估 LLM 的元规范推理:

  • 情绪评估(emotional appraisal)
  • 行为反应(behavioral response)

2. 新的分类任务

基于上述框架,论文提出两类新的分类任务:

  • 预测违规者的自我调节(self-regulation in violators)
  • 预测观察者的他人调节(other-regulation in observers)

3. 数据集 NormReact

论文发布了多视角数据集 NormReact:

  • 包含 450 个规范违反场景;
  • 对情绪与行为反应进行人工标注;
  • 标注维度覆盖违规者的性别与观察者的社会亲近度(social closeness)。

4. 实验结论

  • 在六个模型上,LLM 系统性地过度预测负面制裁,而人类在这些情境下更可能预期不作为;
  • 社会距离越大,模型与人类判断的对齐度越差;
  • 论文由此提示:在冲突调解、政策模拟等对规范敏感的领域,AI 系统可能输出一幅被扭曲的社会调节图景——过度呈现惩罚,低估现实中普遍存在的宽容、克制与关系性校准。

三、对数据科学与 AI Agent 落地的意义

1. RLHF 与偏好数据的“过度惩罚”偏差。
如果模型在元规范推理上系统性地高估惩罚,那么在涉及人际冲突、内容审核、社区治理等任务时,其判断会偏向更严厉的一端。这类偏差很难通过一阶规范对齐(“知道什么是对的”)来消除,因为它发生在“预判他人会如何反应”这一层。原文未说明该偏差与训练数据分布之间的因果机制。

2. 社会模拟类 Agent 的系统性失真。
论文直接点名了冲突调解与政策模拟。如果用一个高估惩罚的 LLM 去扮演社会角色、模拟群体反应,那么模拟结果会天然偏向“强执法、弱容忍”的均衡,进而可能反过来影响现实决策。对于做多智能体社会仿真的团队,这是一个需要显式校准的偏差项,而不是可以忽略的噪声。

3. 评估维度应加入“社会距离”。
论文发现对齐度随社会距离衰减,这意味着单点、无社会关系设定的评测集不足以刻画模型的社会推理能力。NormReact 用“观察者社会亲近度”作为控制变量,这种做法值得被更广泛地借鉴到 Agent 的社交能力评测中。

4. 细粒度标注数据的价值。
450 个场景、双维度(情绪 + 行为)、双角色(违规者 + 观察者)的人工标注,规模不大但结构清晰。这类小而精的行为标注集,往往比大规模弱标注数据更能暴露模型的系统性偏差。

四、我的技术点评

这篇论文最值得肯定的地方,是把“对齐”从一个规范性问题(模型知不知道什么该做)推进到了一个预期性问题(模型认为别人会怎么做)。这两者在工程上完全是两回事:前者影响模型的输出合规性,后者影响模型作为社会参与者、模拟器或决策辅助工具时的可信度。

但也要客观看几点局限:

  • **规模有限。**450 个场景对于刻画“元规范”这样一个高度依赖文化、语境与关系的概念来说,是偏小的。原文未说明场景的文化来源、语言分布与领域覆盖,这直接决定了结论能否外推。
  • **“六个模型”未具名。**摘要中只给出模型数量,未说明具体是哪些模型、参数量级或是否包含开源与闭源对比。这使得“当前 LLM 都更严苛”这一结论的普适性有待验证。
  • **人类基准本身有争议。**用人类标注作为“正确”参照,前提是标注者群体内部足够一致。论文是否报告了标注者间一致性(inter-annotator agreement),原文未说明。
  • **偏差来源未定位。**是预训练语料中惩罚性叙事更多,还是 RLHF 的偏好数据更偏好“安全但严厉”的回答?这个因果链条在摘要中没有展开,但恰恰是对工程最有指导意义的部分。

对做 Agent 落地的团队,我的一条实操建议是:在任何涉及人际冲突或规则执行的 Agent 流程里,明确区分“模型认为应该发生什么”和“模型认为实际会发生什么”两个问题,并分别做评测。论文的发现提示,后者的偏差可能比前者更大,也更隐蔽——因为它不会触发常规的安全拒答,只会悄悄把整个系统的社会判断推向更严苛的一侧。

五、原文链接