AI 快讯DeepMind给AI评测加上双盲
开发心得

DeepMind给AI评测加上双盲

2026-08-27T14:03:31.159Z
DeepMind给AI评测加上双盲

DeepMind近日试行所谓全球首个双盲 AI 评测方案,同时隔离评测者与模型身份信息,试图减少品牌、来源、提示词和评测者偏好对模型排名的影响。

DeepMind给AI评测加上双盲

DeepMind近日公布了一项双盲 AI 评测试点,目标是让模型排名尽量不受“评测者是谁”和“模型来自谁”影响。这项工作没有发布一个新的模型,也没有新增一张“谁第一”的榜单,而是试图改造大模型竞争中最容易被忽视的基础设施:评测本身。

**双盲 AI 评测是指同时隐藏被测模型身份与评测参与者身份或偏好,使双方尽量无法利用额外身份信息影响结果。**它借鉴了医学研究和社会科学实验中的双盲设计,但在 AI 场景里,盲法面对的对象不只是人,还包括自动评测器、提示词、上下文以及模型可能接收到的元信息。

这件事的重要性在于,今天的大模型排名看起来越来越精确,实际却可能仍然混入大量“名字效应”。当评测者知道答案来自 GPT、Claude、Gemini 或某个热门开源模型时,他评价的可能就不再只是答案质量,而是对品牌、训练机构和模型定位的综合印象。

双盲 AI 评测流程示意图:模型身份和评测者身份经过随机化与脱敏后,再进入人工或自动评分环节

排名可能不是能力的镜子,而是信息的回声

**传统模型评测是把固定题目交给模型,再由人工、规则或另一个模型给出分数的流程。**它的优点是简单、便于复现,缺点是容易把测试过程中的非能力因素一起算进去。

最常见的问题是模型身份偏见。评测者如果看到模型名称,往往会产生先验判断:某家公司擅长推理,某个模型更安全,某个开源模型通常回答更长。即使评测者主观上努力保持中立,这些信息仍可能通过更高的容错率、更积极的解释或对格式问题的不同处理进入评分。

位置偏见同样普遍。两个回答一左一右呈现时,评测者可能更倾向于选择第一个或第二个;如果模型 A 总是被放在前面,榜单就可能出现稳定但虚假的优势。长度偏见也很难彻底消除:更长的回答容易被误认为更充分,但它也可能只是重复、绕圈或用更多措辞掩盖不确定性。

自动评测并没有天然摆脱这些问题。**模型裁判是指使用一个大模型对其他模型的回答进行比较或打分。**它能降低人工成本,却会继承训练数据中的偏好,并且可能偏爱与自己表达风格相似的回答。研究者还发现,模型裁判可能受到答案顺序、措辞风格、引用数量和格式整洁度影响,而这些因素与任务真正考察的能力并不总是相关。

模型还可能受到“评测者身份”影响。严格来说,模型不会像人一样理解“这是谁在打分”,但只要系统提示、任务描述或上下文泄露了评测标准,它就可能针对评分机制进行优化。比如,模型知道自己要追求“有帮助、完整、礼貌”,就可能生成一套看起来符合标准、但并不真正解决问题的模板化答案。

DeepMind的双盲试点究竟改变了什么

**DeepMind这次试点的核心不是增加一个更复杂的分数,而是把评测过程中的身份信息从回答与判断之间拆掉。**在理想流程中,模型被分配随机化标识,评测者只看到匿名回答;同时,评测系统尽可能不向模型暴露具体评测者、机构或偏好信息。

这意味着评测者看到的可能不再是“某公司旗舰模型的回答”,而是“系统 A”和“系统 B”的匿名输出。评测结果在收集完成后,再通过映射表恢复真实模型名称。映射表的作用类似于实验中的盲法密钥:参与评分的人不掌握它,直到结果锁定后才揭示对应关系。

如果任务采用人工比较,重点是隐藏模型来源、统一展示格式、随机化回答顺序,并预先定义评分标准。如果任务采用模型裁判,除了隐藏候选模型名称,还需要避免把不必要的品牌线索、特殊系统提示或模型特有的输出格式传递给裁判模型。

如果任务涉及模型自身对评测环境的适应,双盲还需要处理另一层问题:被测模型可能通过上下文推断自己正在参加哪类测试。**评测污染是指模型因提前接触测试题、测试格式或评分规则而获得非正常优势。**因此,身份盲法只能减少一部分偏见,不能替代新题目、私有题集、动态任务和结果审计。

DeepMind将这项工作称为“试行”而不是最终标准,这个措辞很关键。它说明研究团队目前更关心的是验证流程是否可运行、偏见是否能被测量,以及不同任务是否适合采用同一套盲法,而不是宣称从此可以得到绝对客观的模型排名。

截至目前,公开信息的重点是评测方法和试点设计,并没有给出一组足以改写行业格局的统一模型分数。因此,不能把这次公告解读成“某个模型在双盲测试中击败了所有竞争对手”。它更像是一次对评测制度的压力测试:先确认排名系统里到底有多少噪声,再讨论如何提高模型本身的能力。

双盲与常见评测方式有什么区别

**双盲并不等于盲测榜单,而是一种控制身份信息泄露的实验设计。**它可以与人工评测、模型裁判、规则评分和真实用户反馈结合使用,但不能取代这些评价方式。

| 评测方式 | 主要评分者 | 是否通常隐藏模型身份 | 优点 | 主要风险 | |---|---|---:|---|---| | 基准题自动评分 | 规则或标准答案 | 部分隐藏 | 成本低、可复现 | 容易被针对性优化,难覆盖开放任务 | | 人工盲评 | 人类评测者 | 可以隐藏 | 更接近真实质量判断 | 成本高、存在主观差异 | | 模型裁判 | 另一个大模型 | 通常不充分 | 速度快、易扩展 | 裁判偏好、位置偏见、风格偏见 | | 用户投票 | 真实用户 | 通常不隐藏 | 反映实际使用体验 | 受品牌、流量和用户群体影响 | | 双盲 AI 评测 | 人工或模型裁判 | 同时强化身份隔离 | 有助于估计身份偏见 | 流程复杂,无法消除所有偏差 |

双盲评测最适合比较“回答质量差距不大”的模型。当两个模型明显一强一弱时,身份隐藏的边际价值可能有限;但当多个模型能力接近,哪一个排在前面可能只差几个百分点,品牌提示和回答顺序就可能改变最终名次。

对开发者来说,最值得关注的不是榜单名次

**开发者真正需要的不是一个永久有效的总榜,而是知道模型在什么任务、什么约束和什么成本下更可靠。**双盲评测如果继续推进,可能会推动榜单从单一总分转向更细的能力剖面。

例如,代码生成任务不应只统计“测试通过率”,还应记录编译时间、依赖使用、错误修复轮次和安全缺陷;长文本任务不应只看人工偏好,还应测量事实一致性、引用可追溯性和无关内容比例;视觉任务则应把图像描述、空间关系、界面操作和视频时序推理分开。

这点尤其适用于多模态模型。**多模态评测是同时检验模型处理文字、图像、音频或视频及其关系的评测方式。**如果评测者知道某个模型以视觉能力见长,他可能更愿意解释其空间推理中的模糊答案;如果完全匿名,测试更有机会回答一个实际工程问题:模型到底能不能准确理解按钮、工具栏、布局关系和连续动作,而不是仅仅生成一段听起来合理的描述。

对企业采购而言,双盲结果也有现实价值。很多团队并不需要“全球最强模型”,而需要在固定预算、固定延迟和固定数据合规要求下,找到最适合客服、代码审查、文档抽取或内部搜索的系统。匿名比较能够减少品牌光环对决策的干扰,让采购团队更关注成功率、失败类型、上下文长度、延迟和单位成本。

对开源模型尤其如此。开源模型经常在榜单上遭遇两种相反的偏见:一类评测者默认闭源旗舰更可靠,另一类用户则因为本地部署和社区热度给予开源模型额外好感。双盲并不会自动让开源模型得分更高,但至少有机会把“我喜欢它的生态”与“它在这道题上答得更好”分开。

这套方法仍然有四个现实限制

**双盲只能控制身份偏见,不能把主观评价变成客观真理。**AI 评测的难点不只来自模型名称,还来自任务定义、参考答案、评分维度和样本分布。

第一,匿名并不代表完全不可识别。模型可能有稳定的措辞、特殊的 Markdown 格式、工具调用习惯或拒答风格。熟悉不同系统的评测者,仍可能从输出特征猜出模型身份。若强行抹平这些差异,又可能损害答案的自然性,导致测试的不是模型真实表现。

第二,盲法可能隐藏产品差异,而这些差异在实际使用中很重要。一个模型也许拥有更成熟的工具调用、更好的上下文管理或更稳定的服务质量,这些不是“答案文本”本身,却决定了开发者最终能否把它用起来。因此,双盲文本比较不应取代端到端产品评测。

第三,自动裁判仍然需要验证。即便候选模型名称被替换,裁判模型也可能偏爱某种写作风格。更可靠的做法是使用多裁判交叉评分、交换答案顺序、报告一致性区间,并抽取争议样本进行人工复核,而不是只公布一个看似精确的平均分。

第四,盲评不等于无偏评测。**评测偏差是测试结果系统性偏离真实使用价值的误差。**如果题目主要来自英语学术场景,双盲之后仍然可能低估中文、方言、行业术语和不同文化语境下的模型能力;如果测试只考察静态问答,也无法判断模型在长流程代理任务中的稳定性。

一个更可信的评测协议应该长什么样

**可信的模型评测需要把盲法、任务设计、统计报告和真实场景验证组合起来。**单独依赖某一种榜单或某一种裁判,都容易把复杂能力压缩成一个不稳定的数字。

面向开发者的评测流程至少可以包含以下步骤:

  1. **预注册任务和评分标准。**在看到模型结果之前确定题目类型、权重、合格线和排除规则,避免事后调整指标。
  2. **随机化模型顺序和样本分配。**让不同模型在不同位置出现,并避免某个模型只拿到更容易的题目。
  3. **统一输入与输出约束。**固定系统提示、上下文长度、工具权限和时间限制,同时记录所有异常情况。
  4. **隐藏身份信息。**替换模型名称、机构名称、特有前缀和不必要的系统元数据,减少评测者先验判断。
  5. **进行多轮交叉评估。**交换答案顺序,使用多个评测者或裁判模型,报告平均值、方差和一致性,而不是只给单一名次。
  6. **保留原始证据。**保存输入、输出、工具轨迹、评分理由和版本信息,方便后续审计和复现。
  7. **补充真实任务测试。**把匿名对比结果与线上成功率、人工返工率、延迟、成本和安全事件放在一起看。

在报告结果时,评测机构还应该明确区分“统计显著”和“工程显著”。如果模型 A 的胜率是 51.2%,模型 B 是 48.8%,这可能在大样本下具有统计差异,却未必足以改变企业选型。只有当差异能转化为更少的人工修正、更低的任务失败率或更好的单位成本,排名才真正具有决策价值。

结语:模型榜单需要从竞技场走向实验室

**DeepMind这次双盲试点的最大价值,是把“评测者也会影响结果”重新放到行业讨论中心。**过去,模型公司、榜单平台和用户都习惯把分数当作能力的直接映射;现在越来越多研究开始承认,评测流程本身也是系统的一部分。

这不会让模型排名从此变得绝对公平,也不会解决数据污染、任务泄露、裁判偏差和真实场景迁移等问题。但它提供了一个清晰的改进方向:先隔离身份信息,再测量剩余偏差;先报告不确定性,再解释名次变化;先看任务是否适合,再讨论谁是第一。

对开发者而言,接下来最值得观察的不是哪家模型在某次双盲试验中登顶,而是 DeepMind 是否公开更完整的实验数据、盲法细节、评测者一致性和不同任务下的偏差变化。如果这些信息能够被第三方复现,双盲评测才可能从一次研究试点,变成大模型行业真正可用的基础设施。

在那之前,面对任何“模型排名”,更稳妥的做法仍然是:把榜单当作筛选工具,而不是最终答案;把匿名对比当作证据,而不是绝对真相;在自己的数据、自己的延迟约束和自己的失败成本上重新测试一遍。

参考来源

  • 知乎:2025 年 AI 大模型年度盘点 —— 用于补充多模态模型、视觉理解与评测生态背景。
  • Google DeepMind 官方博客:《Piloting the world's first double-blind AI evaluations》—— 本文关于双盲 AI 评测试点的核心信息来源,发布于 2026 年 8 月,原文标题可在 Google DeepMind 官方博客检索。

注:本文未将第三方实时排行榜的模型名次作为结论依据。模型排名会随评测集、提示词、版本和裁判设置变化,开发者应结合具体任务进行验证。

相关推荐

查看全部