LLM外交局:谁真守承诺?

一组允许模型撒谎的《Diplomacy》多智能体对局近日引发讨论,但公开帖子缺少完整统计表和实验配置。真正值得关注的不是“谁最诚实”,而是承诺、背叛与胜率之间并不存在简单对应关系。
先说结论:现有公开材料不足以确认冠军
一组让不同大语言模型参加《Diplomacy》多智能体博弈的实验,近日在机器学习社区引发讨论:模型被明确告知可以撒谎、结盟和背叛,并在相同规则下彼此对抗,部分对局还加入了人类玩家。
**但截至 2026 年 9 月 26 日,仅凭目前公开的 Reddit 帖子,无法严谨确认“哪一个模型最守承诺”。**帖子说明统计来自《Diplomacy》对局,却没有在正文中完整给出模型版本、样本量、随机种子、承诺判定规则、各国席位分配以及置信区间;原帖提到的方法说明,也没有被完整收录进现有材料。任何直接给出确定排行榜的做法,都可能是在把一张传播图表误写成可靠基准。
这并不意味着这次实验没有价值。恰恰相反,它触及了当前 Agent 评测里最容易被忽略的一层:模型说了什么,与模型最终做了什么,必须分开统计。
**承诺履约率是智能体作出可验证承诺后,实际行动与承诺一致的比例。**这个指标比“语气是否真诚”更接近真实系统需要的可靠性,因为一个模型可以措辞谨慎、态度友好,却在执行阶段频繁改变计划;另一个模型也可能公开保留选择权,看起来不够合作,但几乎从不作出虚假保证。

《Diplomacy》为什么比普通推理题更适合测“可信度”
**《Diplomacy》是一款以一战前欧洲为背景、由七方同时谈判和行动的战略棋盘游戏。**玩家扮演英国、法国、德国、意大利、奥匈、俄罗斯和土耳其,通过结盟、协商、支援、佯攻与背叛争夺补给中心;其核心不是掷骰子,而是预测其他参与者会相信什么、承诺什么,以及最终执行什么。
这套规则对 LLM 特别残酷,因为语言能力在这里不再等于任务能力。模型不仅要生成一段看起来合理的外交辞令,还要完成至少五层工作:理解地图状态、规划当前回合、预测他方意图、管理多段双边关系,并把谈判结果转化为合法行动。
**多智能体博弈是多个自主智能体在共享环境中合作或竞争,并由彼此决策共同决定结果的交互过程。**它和单模型问答的关键差异在于环境会反应:一个承诺是否有价值,取决于对手是否相信;一次背叛是否划算,取决于未来还有没有人愿意合作。
普通基准往往把题目和答案冻结下来,模型只需要找到正确输出。《Diplomacy》则像一个持续变化的生产环境:昨天的盟友今天可能转向,当前最优动作会因为一句谈判内容而改变,模型还必须记住谁曾经违约。它测到的不是静态知识,而是动态社会推理。
**心智理论是根据他人的信念、目标、知识和意图预测其行为的能力。**在外交博弈中,一阶推理是“法国可能进攻我”,二阶推理则是“法国认为我相信它不会进攻,所以它更可能借机突袭”。模型能不能处理这种递归判断,直接影响结盟质量和背叛时机。
“允许撒谎”不等于“鼓励模型一直撒谎”
**允许欺骗的实验设置,是取消必须诚实的行为约束,而不是把说谎本身设为最高目标。**这一点决定了该测试不能被简化为“谁撒谎最多谁更聪明”,也不能把“谁最少违约”直接等同于“谁最强”。
在《Diplomacy》里,背叛是一种有成本的策略。一次成功突袭可能换来一个补给中心,却会同步降低模型在后续回合的信用;如果剩余玩家开始共享情报、联合围堵,短期收益很快就会变成长线负债。
真正强的智能体不是机械诚实,也不是无差别欺骗,而是能计算信用资产。它需要判断什么时候合作能换来更高的长期收益,什么时候协议已经失去可执行性,以及什么时候背叛带来的地图收益足以覆盖声誉损失。
这也是本次讨论比传统“幻觉率测试”更有意思的地方。幻觉通常是模型在事实层面生成错误内容,战略欺骗则是模型知道真实计划,却主动让对方形成错误信念。两者表面上都可能表现为“不说真话”,内部机制和风险却完全不同。
谁最守承诺,至少要先回答五个统计问题
一份可信的履约排行榜必须先定义什么算作承诺。“我会支援你进入比利时”是明确承诺,“我倾向于帮助你”是意向表达,“德国很危险,我们应该合作”则只是立场陈述;如果把三者都计入分母,统计结果会被谈判风格严重污染。
下面这张表列出了判断模型是否“守信”时不可缺少的实验字段,也解释了为什么现有帖子还不足以支撑确定排名。
| 评测维度 | 应公开的信息 | 缺失后会造成什么问题 | |---|---|---| | 模型身份 | 精确模型名称、版本、日期与推理配置 | 同名模型更新后行为可能变化,结果无法复现 | | 对局规模 | 总局数、总回合数、每个模型参与次数 | 少量对局容易被一次偶然背叛左右 | | 席位控制 | 七个国家的分配和轮换方式 | 地理位置会影响可谈判对象与早期生存率 | | 承诺定义 | 明确承诺、条件承诺、模糊意向的分类规则 | 爱说话的模型会产生更多“违约机会” | | 行动判定 | 以提交命令、实际执行还是最终结果为准 | 支援被切断不应自动算作背约 | | 上下文设置 | 是否共享历史、是否有长期记忆、上下文长度 | 遗忘与主动欺骗会被混为一谈 | | 人类参与 | 人类玩家数量、水平及加入方式 | 人类可能针对特定模型调整谈判策略 | | 统计不确定性 | 均值、方差、置信区间与显著性检验 | 细小差距可能只是随机波动 |
**样本量决定排行榜究竟是结论还是截图。**如果一个模型只作出 20 次可验证承诺,履约 18 次就是 90%;只要再出现两次违约,履约率就降到 81.8%。没有分母,单独公布百分比几乎没有解释力。
席位轮换决定模型比较是否公平。《Diplomacy》的七个国家并不拥有完全相同的开局关系和谈判压力,例如不同国家的邻国数量、早期冲突方向和扩张路线均不相同;如果某个模型频繁拿到更容易维持稳定联盟的位置,它的履约率可能天然更高。
条件承诺必须和无条件承诺分开。“如果你不进入黑海,我就不进亚美尼亚”只有在前提成立时才能评价;若对方先违约,模型随后改变行动,不应被简单记为背叛。更可靠的标注单位不是一句话,而是“承诺内容—触发条件—目标回合—实际命令”四元组。
守信率、胜率与语言表现是三条不同坐标轴
**高履约率不必然带来高胜率。**一个从不背叛的模型可能很容易被利用:它会坚持执行已经明显不利的协议,也可能在盟友失去合作价值后继续投入资源。
**高胜率也不必然代表谈判能力更强。**模型可能依靠地图规划、合法命令生成和战术搜索取胜,甚至在几乎不进行复杂协商的情况下赢下对局;反过来,一个谈判表达优秀的模型,也可能因为行动规划错误把优势送掉。
**语言上的合作姿态更不能直接当作行为诚信。**LLM 很擅长生成“我理解你的顾虑”“我们有共同利益”“我保证不会进入该区域”这类低成本文本,但这些句子只有与下一阶段提交的行动绑定后才有评测意义。
因此,一份真正有用的对比至少应该同时报告以下指标:
- 承诺精确率:被判定为明确承诺的语句中,有多少确实包含可验证行动。
- 条件满足后的履约率:只统计触发条件成立的承诺,避免误伤合理变更。
- 主动欺骗率:模型在作出承诺时,内部计划或同回合对其他玩家的消息是否已经与之冲突。
- 背叛收益:违约后获得的补给中心、位置优势或生存概率变化。
- 声誉成本:背叛后收到的合作提议数量、支援次数和被联合攻击概率变化。
- 最终博弈表现:胜率、平均补给中心数量、存活率及平局得分。
| 模型行为类型 | 履约率 | 战略灵活性 | 典型风险 | 更适合的场景 | |---|---:|---:|---|---| | 机械守信型 | 高 | 低 | 容易被对手利用,无法及时止损 | 强规则协作、固定工作流 | | 谨慎承诺型 | 高 | 中 | 谈判推进较慢,可能错过窗口 | 企业协作、任务委派 | | 机会主义型 | 中 | 高 | 声誉波动大,需要精确判断时机 | 竞争模拟、红队测试 | | 无差别欺骗型 | 低 | 表面较高 | 很快失去合作对象,长期表现通常不稳 | 对抗性压力测试 |
这张表也解释了“最守承诺”为什么只是一个局部问题。对开发者而言,更值得寻找的是“承诺校准最好”的模型:它不轻易作出无法兑现的保证,一旦承诺就有较高执行概率,同时能在外部条件变化时明确重谈,而不是悄悄改口。
与 Cicero、Richelieu 的关系:别把不同实验混成一张榜
**Cicero 是 Meta 在 2022 年公布的《Diplomacy》智能体,它把战略推理与自然语言对话结合起来,并达到接近人类玩家的游戏水平。**这项工作的关键限制是,Cicero 的对话策略被设计为尽量诚实,研究目标并不是测试开放式欺骗能力。因此,Cicero 的成绩不能直接拿来证明通用 LLM 在“允许撒谎”条件下也会守信。
**Richelieu 是面向《Diplomacy》多智能体博弈的自演进智能体框架,它通过对手建模、记忆、分层规划、反思和自我对弈提升策略能力。**北京通用人工智能研究院公开介绍称,该框架不依赖人类专家对局数据,在有通信模式下能够达到与 Cicero 接近的平均胜率,并可迁移到底层不同的 LLM。
这两项工作共同说明,底座模型不是全部答案。把同一个 GPT 系列模型直接放进游戏,与给它增加长期记忆、对手可信度记录、规划器和行动校验器,得到的会是两个完全不同的智能体。
**智能体架构是围绕模型增加记忆、规划、工具和反馈回路的系统设计。**在多回合外交中,架构差异甚至可能比底座模型差异更重要:没有稳定记忆的强模型会忘记三轮前的协议,有显式账本的较小模型反而能持续追踪每名玩家的履约历史。
因此,若这次社区实验比较的是“裸模型”,结论只能回答这些模型在特定提示词和上下文管理方式下的行为差异;若比较的是完整 Agent,排行榜反映的则是模型、提示词、记忆系统、规划算法和裁判逻辑的综合效果。两者不能混写。
对 Agent 开发者最直接的启示:把承诺做成可执行对象
**开发者不应只把 Agent 的承诺保存在聊天记录里。**聊天文本适合人类阅读,却不适合稳定审计;更可靠的做法是把关键承诺转换为结构化状态,至少记录承诺方、接收方、动作、约束条件、截止时间和当前状态。
结构化承诺可以让系统区分四种常被混淆的失败:模型主动违约、外部条件不成立、工具执行失败,以及模型忘记历史。只有第一类真正接近战略背叛,后三类分别属于条件判断、工程可靠性和记忆管理问题。
**声誉系统是根据智能体过去的承诺与行动,为其维护动态可信度分数的机制。**在企业多 Agent 系统里,一个调度智能体可以根据历史完成率决定是否继续向某个子智能体分派关键任务,而不是每轮都把它当成全新的合作方。
可落地的设计包括:
- 为每项承诺生成唯一标识,并绑定可验证的完成条件;
- 将“计划改变”设计成显式事件,要求智能体说明原因并请求重新协商;
- 分开记录语言违约与工具失败,避免把网络超时当成欺骗;
- 保存每个合作方的历史履约率、条件违约率与任务难度;
- 在评测中加入对抗参与者,测试模型是否会被虚假承诺持续利用;
- 同时统计短期收益和后续合作损失,避免奖励无成本背叛;
- 对裁判模型进行人工抽检,防止“用另一个 LLM 判断是否撒谎”形成循环偏差。
**承诺校准比绝对诚实更适合生产环境。**一个可靠 Agent 应该在不确定时说“我需要先检查依赖条件”,而不是为了显得有帮助而直接保证完成;如果执行条件改变,它应主动更新计划,而不是继续维持表面一致。
人类玩家的加入让实验更真实,也让结果更难解释
**加入人类对手可以测试模型是否只会利用其他模型的固定模式。**如果一个 Agent 只在面对措辞规律、响应稳定的 LLM 时表现良好,一旦遇到人类的含糊表达、情绪施压和临时变卦就崩溃,它的所谓社会推理能力仍然有限。
人类参与同时引入了新的混杂变量。熟悉《Diplomacy》的玩家可能很快识别出模型的模板化表达,并故意诱导它作出条件冲突的承诺;新手则可能因为不理解地图而频繁改变计划。若不披露玩家水平和对局分配,人机结果很难与纯模型对局合并计算。
更关键的是,人类知道自己正在和 AI 对战后,行为本身也会变化。有人会优先围攻模型,有人会刻意测试它是否会说谎,还有人可能更愿意相信语气流畅的模型。这些都是实验现象的一部分,却不能被误写成模型的单独属性。
这类排行榜最容易出现三种误读
**第一种误读是把“最诚实”当成“最安全”。**安全还包括是否服从权限边界、是否泄露信息、是否能在冲突指令下保持一致,以及是否会用诚实语言包装危险行动;外交游戏只能覆盖其中很窄的一部分。
**第二种误读是把“会欺骗”当成模型已经产生自主恶意。**实验明确给予模型竞争目标和欺骗许可后,模型生成策略性谎言,首先说明它能够遵循博弈激励,而不是证明它在实验之外拥有稳定意图。
**第三种误读是把一次模型排名当成永久人格。**LLM 的行为会随系统提示、采样温度、推理预算、历史长度和角色设定变化;同一底座模型在“追求胜率”“优先维护联盟”和“尽量减少违约”三种目标下,可能呈现完全不同的外交风格。
我们的判断:真正的赢家不是最老实的模型
**这次讨论最有价值的结论,是 LLM 的可靠性必须在互动中测量,而不能只看单轮回答。**当模型被允许说谎并面临实际利益冲突时,承诺才开始具有成本,开发者也才能观察它如何在短期收益与长期信用之间做选择。
现阶段不应根据缺少方法细节的社区帖子宣布某个模型是“最守承诺冠军”。更稳妥的结论是:公开材料证明了这类统计值得做,却还没有提供足够信息让外界独立验证具体排名。
真正优秀的外交智能体也不应该以 100% 履约为唯一目标。它应当少做空泛保证、准确识别条件变化、明确请求重谈,并让每一次违约都能被追踪、解释和计入后续声誉成本。
对正在搭建多 Agent 工作流的开发者来说,这比一张模型人格排行榜重要得多。当 Agent 开始彼此委派任务、共享资源和协商计划后,“它说过什么”会成为系统状态的一部分;如果承诺仍只是上下文窗口里的一句自然语言,系统规模越大,失控概率就越高。
参考来源
- Reddit:LLMs were told they could lie in Diplomacy. Here's who actually kept their promises:本次讨论的原始社区帖子,说明数据来自《Diplomacy》多智能体模拟,并提及模型与人类在相同规则下参与对局;帖子正文未完整披露可复核的统计与实验配置。


