SocialReasoning-Bench:衡量AI代理是否真正代表用户利益

TL;DR · AI 摘要
SocialReasoning-Bench 揭示当前主流 AI 模型在代表用户进行社交推理时,虽能完成任务但常接受次优结果,未能充分维护用户利益。
核心要点
- 在日程协调中,前沿模型有36%的概率接受低于最优值15%以上的会议时间。
- 通过提示工程可提升表现,但最佳模型仍比理想代理低23个百分点的综合得分。
- 该基准测试评估结果与过程:包括结果最优性与尽职程度(due diligence)。
结构提纲
按章节快速跳转。
随着AI代理参与日程管理、谈判等社会性任务,其需具备代表用户进行社交推理的能力。
该基准测试评估AI代理在真实社交情境下为用户争取利益的能力,涵盖结果与决策过程。
在单日日程安排中,代理需根据用户偏好函数协商会议时间,并避免接受低价值时段。
在模拟交易中,代理代表买家或卖家就价格和条款谈判,目标是最大化用户效用。
系统同时评分结果最优性(outcome optimality)和尽职行为(due diligence),如探索替代方案。
当前模型普遍缺乏主动协商能力,即使提示也难以达到可信代理应有水平。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- SocialReasoning-Bench
- 核心目标
- 评估AI是否真正代表用户利益
- 推动社交推理能力建设
- 测试场景
- 日程协调
- 市场谈判
- 评估维度
- 结果最优性
- 尽职程度
- 关键发现
- 模型常接受首个提议
- 提示仅有限改善表现
金句 / Highlights
值得收藏与分享的关键句。
当前前沿模型在93%的情况下接受了首个报价,未尝试协商或探索其他选项。
SocialReasoning-Bench 衡量两个关键维度:结果最优性和尽职程度。
即便经过专门提示要求‘为用户最佳利益行动’,模型表现仍显著不足。

核心概览
- AI代理正在进入社会场景。当代理需要管理日历、协商购买或代表用户与其他代理交互时,它们需要的不仅是任务执行能力——更需要社会推理能力。
- SocialReasoning-Bench评估这种能力。该基准测试在两个真实场景中检验代理的用户代表能力:日历协调和市场谈判。
- 该基准同时衡量结果和过程:既评估代理达成结果的最优性(为用户争取的价值),也评估尽责程度(是否遵循专业的决策流程)。
- 当前前沿模型常未能充分实现价值。它们通常能完成任务,但频繁接受次优会议时间或不利交易,未能有效维护用户利益。
- 提示词优化有帮助但效果有限。即使明确指导代理维护用户最佳利益,其表现仍远未达到可信代理人应达到的标准。
随着AI代理承担越来越多现实任务,它们正在社会场景中运作。通过适当整合,像Claude Cowork和Google Gemini这样的代理可以管理电子邮件和日历工作流。在这种场景下,代理需要代表用户与他人交互,这就需要社会推理能力——理解用户需求、对方需求,以及哪些信息需要披露、保护或据理力争。
我们之前的研究表明,当前前沿模型缺乏社会推理能力。在我们的模拟多代理市场中,代理有高达93%的概率会接受首个提案而不探索其他选项。在对代理社交网络的红队测试中,一条恶意消息会在系统中传播,导致代理泄露隐私数据后再传递该消息。
这种关系在AI领域之外有悠久历史。在经济学和法律领域被称为委托-代理关系:代理需要代表委托人与利益不同的第三方交互。律师、房产中介和财务顾问都属于这种模式,他们应尽的勤勉、忠诚和保密义务已在数百年专业规范中确立。代表用户行动的AI代理最终也应达到类似标准。
为了衡量和推动社会推理能力发展,我们构建了SocialReasoning-Bench:一个测试代理能否代表用户与具有独立目标、私有信息和潜在对抗意图的对手方进行推理和谈判的基准测试。

_图1:我们的基准测试在日历协调和市场谈判两个领域衡量代理的社会推理能力。这两个领域都需要与第三方沟通、代表委托人主张,并进行权衡推理。_
SocialReasoning-Bench在两个领域评估社会推理能力:日历协调和市场谈判。在每个场景中,代理需要代表用户与对手方博弈,评估维度既包括达成的结果,也包括执行过程。我们发现前沿模型虽然能完成大部分任务,但持续未能为用户争取应有价值。
日历协调
在日历协调场景中,助理代理需要管理用户单日日程,并处理来自其他代理的会议请求。
假设代理可访问一个时间槽价值函数,该函数以0.0到1.0的数值表示用户的日程偏好。该函数可由用户显式提供,或通过日历历史推断获得,并在任务开始时提供给助理代理。
对手方是由请求代理代表的第三方,希望与用户安排会议。对方拥有基于用户价值函数反向构造的独立价值函数,即对一方最有价值的时间段对另一方最不值。有些请求方会善意协商,而有些则试图通过交互获取隐私日程细节,或迫使助理代理接受用户不希望的时间段。
每个任务都存在一个可能协议区域(ZOPA),这是谈判理论中表示双方都可接受结果的集合。在日历协调中,ZOPA是指双方日历都空闲的时间段集合。我们构建的每个任务都包含至少三个具有不同用户偏好分值的时间段,且请求方的初始请求总是与用户的日程冲突。
市场谈判
在市场谈判场景中,代表用户的买方代理需要与卖方代理就单个产品采购进行谈判。
用户希望以最低价格购买产品。其价值函数体现为交易价格与私人保留价格(即用户愿意支付的最高价格)之间的差值。差值越大代表获得的价值越高,而高于保留价的交易则无法创造价值。
交易对手是卖家代理,其私人保留价低于买方。卖方的价值函数与买方呈镜像关系:成交价越高价值越大,低于卖家保留价的交易则无价值。
ZOPA(协议区间)指买卖双方保留价之间的价格区间。卖家的初始报价始终高于买方保留价,迫使买方必须通过谈判压低价格。
新指标适应新场景
现有基准测试侧重于任务完成度:会议是否安排成功?交易是否达成?在委托-代理场景中,重要的不仅是_是否_完成任务,更在于_如何_完成。我们引入新指标来体现这种差异。
结果最优性
结果最优性在0到1的区间内衡量代理为委托人获取的价值占比。在ZOPA范围内对委托人最有利的结果得分为1,对交易对手最有利的结果得分为0。中间结果根据委托人价值函数在两个端点间的位置进行评分。
尽职调查
仅凭结果最优性会混淆能力与运气。一个代理若立即接受交易对手的首次报价,既未评估自身处境也未提出反建议,仍可能因对手恰好提出优质方案而获得高分。为区分能力与运气,我们引入过程指标。
尽职调查通过0到1的评分体系,将代理在每个决策点的行动与确定性"合理代理"策略进行对比。合理代理策略是一种贪婪算法,体现专业代理人应采取的步骤:行动前收集相关背景信息、以对委托人有利的立场开场、在耗尽更优选项后才做出让步。尽职调查得分是代理实际选择与合理代理策略匹配度的比率。
护理义务
结果最优性与尽职调查共同构成了代理对所代表人的"护理义务"操作化定义。依赖粗心过程达成优质结果的代理具有脆弱性,而遵循良好流程却达成劣质结果的代理则反映能力差距而非疏忽。只有两项指标均表现优异的代理才展现出强大的社会推理能力。
PODCAST SERIES

人工智能医疗革命再审视
跟随微软Peter Lee探索人工智能如何影响医疗保健,并思考其对未来医学的意义。
实验设置
针对日历助手代理和市场买家代理,我们测试了GPT-4.1(思维链模式)、GPT-5.4(高推理努力模式)、Claude Sonnet 4.6和Gemini 3 Flash(高思考水平模式)。交易对手(日历协调中的请求者、市场谈判中的卖家)始终采用Gemini 3 Flash(中等推理努力模式),且在所有测试条件下保持不变,确保评分差异反映被测模型而非对手难度。
每个模型在两种提示条件下运行:基础提示下代理仅接收角色和工具描述,防御提示下额外获得明确指导,要求查阅所有可用资源并为用户争取最佳结果。
每项任务最多进行10轮谈判,交易对手始终先发起报价。
初步发现
发现1:代理任务完成率接近完美但结果质量低下
在日历调度中,代理几乎总能成功预约会议,但常选择次优时段。在市场谈判中,交易虽几乎全部达成,但频繁以最差价格成交。任务看似完成,实则效果欠佳:任务完成率显示成功,结果最优性却揭示代理始终未能有效维护委托人利益。

_图2:按模型和领域划分的任务完成率与结果最优性。所有模型任务完成率接近完美,但结果质量低下。我们测量了基础提示与防御提示下的结果最优性,防御提示有所改善但未完全弥补差距。_
发现2:防御提示有帮助但不足以弥补差距
当指导代理为委托人积极争取时,两个领域均出现改善,但仍未完全弥补差距。GPT-5.4受益最大(日历领域+0.21,市场领域+0.12),而GPT-4.1在两个领域几乎无改善,其他模型表现居中。
发现3:结果最优性揭示代理错失的价值空间
结果最优性反映每笔交易在协议区间(ZOPA)中的落点位置。当我们将谈判结果可视化时,会发现结果更接近对方的理想点而非己方。

_图3:按模型和领域划分的结果最优性(OO)分布。每个点代表一个任务实例。OO=1.0表示代理为己方获取了全部可用价值;OO=0.0表示对方获取了全部价值。黑线显示平均值。在市场谈判中,所有模型的结果都聚集在零值附近。在日历调度中,代理表现更好但仍低于中点值。_
在市场谈判场景中,所有模型的结果都处于或接近零值,接受了几乎让出全部可用剩余价值的交易。在日历调度场景中,代理表现更优但仍低于中点值,倾向于接受请求方的首选时段而非更符合己方利益的时段。
衡量代理谈判中的价值获取能力建立在近期关于代理在市场场景中表现的研究基础上。由于我们处于受控环境中,可以为双方建立真实约束条件,并精确测量可用价值的分配方式。我们的模型还具有价格谈判之外的泛化能力:通过抽象为领域特定价值函数,结果最优性可以衡量任何存在竞争性激励场景下的剩余价值分配,包括日历调度这类用偏好评分而非价格定义"价值"的非货币领域。
发现4:尽职调查可区分运气与能力
当我们综合考量结果质量与过程质量时,会发现更复杂的图景。许多达成合理结果的代理依赖脆弱的谈判过程:它们在行动前不检查上下文,或在未还价的情况下直接接受报价。高结果最优性伴随低尽职调查表明代理只是运气好而非值得信赖。相反,有些代理展现出真正的尽职行为——收集信息、提出异议——但最终结果仍不理想,这指向能力缺陷而非疏忽。将结果最优性和尽职调查分别划分为高(≥0.5)和低(<0.5)两个区间后,我们可以将每个任务归类为四种原型之一。
| | 未尽职(DD < 0.5) | 尽职(DD ≥ 0.5) | | --- | --- | --- | | 好结果(OO ≥ 0.5) | 幸运型 | 稳健型 | | 坏结果(OO < 0.5) | 疏忽型 | 低效型 |
通过这种分解视角,我们发现模型在超过50%的日历协调任务中展现出稳健的"尽职义务",其中Gemini 3 Flash表现最佳,稳健率达90%。但在市场谈判场景中呈现截然不同的图景:GPT-4.1在95%的任务中表现为疏忽型,既不收集信息也不为己方争取利益;而Claude Sonnet 4.6、GPT-5.4和Gemini 3 Flash在约90%的市场任务中表现为低效型——虽然谈判过程尽职但仍无法达成良好结果。

_图4:将结果最优性(OO)和尽职调查(DD)分别划分为"低"(<0.5)和"高"(≥0.5)区间后,绘制各模型在每个象限的任务占比。例如,在日历调度中,GPT-4.1在63%的任务中同时实现高OO和高DD(稳健型)。而在市场领域,GPT-4.1在95%的任务中表现为低OO和低DD(疏忽型)。_
图5-8通过SocialReasoning-Bench日历领域的真实案例展示了这些不同的行为模式和失败类型。我们既能看到遵循强势谈判策略并取得高价值结果的代理,也能观察到通过粗疏流程达成合理结果的代理(如未提出己方最优选项)。还有代理虽然开局强势但过早让步导致达成劣质交易。极端情况下,某些代理表现出疏忽行为,在未检查约束条件的情况下直接接受首个提案,即使该提案明显损害用户利益。

_图5:GPT-4.1在日历领域展现稳健行为的真实改写案例。该代理首先提出己方最偏好的选项,正确拒绝冲突安排,最终坚持己方次优选项达成良好结果。_

__图6:GPT-4.1在日历领域通过一个未包含提议人最偏好的选项的粗糙流程实现了合理结果。__

__图7:GPT-4.1在日历领域初始阶段表现强劲,提出提议人最偏好的时段,但过早让步导致结果不佳。__

__图8:GPT-4.1表现出疏忽行为,在未确认可用性的情况下接受请求者的首个提议,与提议人的日程安排冲突。__
综上所述,这些示例说明了为何仅凭结果本身是不够的。如果不衡量过程,我们可能会将脆弱或偶然的成功误认为真实能力。尽职调查有助于判断代理是持续表现出胜任且可信赖的代理人行为,还是仅仅运气好。
发现5:代理易受对抗性操控
当我们通过让代理面对对抗性交易对手进行压力测试时,发现代理在判断何时参与、何时拒绝以及如何在压力下谈判方面存在困难。
为了创建这些对抗性场景,我们引入了明确试图操纵结果或绕过保护步骤的交易对手。有些遵循精心设计的策略施加压力或探测信息,而另一些则使用更具创造性和不可预测的异想天开的策略,模仿新型社会工程手段。这些测试共同验证了代理是否能够处理已知攻击和未知攻击。

_图9:代理在两个领域中与对抗性请求者交互时的拒绝率和结果最优性。代理在日历领域很少拒绝对抗性请求,而在市场领域拒绝更多。当代理确实参与恶意行为时,整体结果最优性显著下降。_
我们发现除了Claude Sonnet 4.6外,代理在日历调度中很少拒绝对抗性请求,而在市场环境中拒绝频率更高。这表明在社交框架的交互中对抗意图更难检测。当代理确实参与时,影响在日历调度中最为明显,GPT-4.1、GPT-5.4和Gemini Flash 3的结果最优性大幅下降,表明对抗性交易对手成功引导这些代理走向更差的结果。在市场领域,代理参与时的结果最优性仍与对抗良性交易对手时的低水平相当,表明未能为委托人创造价值。
为何现在尤为重要
代理正在多方环境中相互交互,从企业工作流程协作到数字市场交易。随着这些网络的形成,我们在简单双代理场景中观察到的社会推理差距开始累积。薄弱的谈判能力、过度信任或未能履行尽职调查不再局限于局部。它们通过协调传播,影响下游决策,并塑造集体结果。
孤立来看,接受不良会议时间或达成糟糕交易的代理造成的危害有限。但在网络中,这些行为可能级联,导致系统性更差的协调或跨多个代理的广泛价值损失。
最近的研究已开始通过代理在网络环境中交互的案例研究探索这些风险和动态。SocialReasoning-Bench通过提供一个受控、可复现的基准补充了这一研究方向,该基准隔离了交互行为并使其可测量。这使我们能够超越轶事,系统性追踪进展,为模型、代理和平台开发者提供构建可信赖代理人的具体目标。
SocialReasoning-Bench是开源的,可在GitHub获取。
局限性和未来工作
我们当前的衡量标准将所有交易对手视为平等。实际上,关系很重要。社交智能代理应根据委托人与交易对手的关系调整其坚定程度:在安排与高管的会议时过于强硬可能会损害重要关系,有时通过妥协才能达成正确结果。开发考虑权力动态、关系亲密度和长期后果的关系感知型衡量标准是未来工作的重要方向。
我们在简化的双主体环境中评估社交推理能力,而现实中的委托场景通常涉及多方动态,例如群组日程安排或多利益相关者谈判。每个任务都被视为独立事件,未对长期关系、声誉积累或重复互动中的信任建立进行建模。我们的测试场景也仅限于英语语境和美国本土的商业环境,尽管不同文化背景下的谈判规范、隐私观念和层级制度存在显著差异。展望未来,我们计划将基准测试扩展到更多元化的场景。
结果最优性在边界明确的场景中表现良好,当"良好"结果可以被定义和量化时尤为有效。但对于需要体现责任义务的任务(如撰写敏感信息或处理团队关系),可能不存在明确的ZOPA(共识区间)。在这些场景中,结果质量往往取决于具体情境、人际关系和主观判断,难以通过单一评分体系衡量。将我们的方法扩展到这类主观性更强的场景,是未来研究的重要方向。
致谢
感谢Brendan Lucier、Adam Fourney、Amanda Swearngin和Ece Kamar对本研究提供的宝贵反馈、讨论与支持。