别问一次就比模型

一项关于大模型重复查询可靠性的最新预印本提出:模型评测不应依赖固定次数,而应先做小规模试验,再根据方差和目标可靠性计算所需查询次数。研究在39个预测单元中有37个达到预设复现标准,但也明确显示,固定迭代阈值并不能跨任务通用。
别问一次就比模型:大模型评测需要一套“重复查询协议”
大模型评测正在从“谁答得更好”进入“这个结论到底稳不稳”的阶段。2026年9月4日,一项围绕大模型重复查询可靠性的最新预印本引发讨论:比较多个模型或品牌推荐结果时,不能简单地把同一个提示词问 3 次、10 次或 20 次,然后把平均结果当成结论。更合理的方法是先进行一轮小规模试验,估计结果波动来自哪里,再反推出达到目标可靠性所需的重复查询次数。
**重复查询可靠性协议是一种先估计波动、再决定查询次数的大模型评测方法。**它的核心不是规定一个所有任务都适用的固定数字,而是把“需要问几遍”变成一个可以由数据支持的统计决策。
这件事看起来像统计学上的细节,实际上直接关系到模型排行榜、品牌推荐、政治倾向测试、产品选型和线上 A/B 评测的可信度。很多评测文章只展示一次回答,或者用一个固定的 n=5、n=10 作为重复次数;问题在于,模型输出的随机性、提示词措辞、时间漂移和评分规则,往往会共同决定最终排名。

先说结论:固定问几遍,没有普适答案
这项研究最值得开发者记住的结论是:固定的重复次数阈值无法稳定迁移到不同任务,查询次数必须由先导试验估计。
研究作者将一般化理论(Generalizability Theory)用于重复查询审计。一般化理论是一种把观测结果拆分为多个误差来源、并估算结论能否推广到更广泛条件的统计框架。放到大模型场景里,一次回答不是一个“纯粹的模型能力分数”,而是模型、提示词、随机采样、评测对象以及时间环境共同作用后的观测值。
在原始应用中,研究关注的是大模型对品牌的推荐结果:给多个模型相同或高度相近的提问,观察它们推荐哪些品牌、推荐顺序是否稳定,再比较模型之间的差异。如果只查询一次,某个品牌被排在第一位,可能是模型偏好,也可能只是一次采样结果;如果查询次数太少,评测者甚至无法判断所谓“模型差异”是否小于模型自身的输出噪声。
研究采用了一个更接近实验设计的流程:
- 先导试验:对目标任务进行少量重复查询,收集初步结果。
- 方差分解:估计模型、查询轮次、被评测对象及其他因素造成的波动。
- 设定可靠性目标:例如要求可靠性系数达到某个预先指定的水平。
- 计算重复次数:根据先导试验的方差组件,推算正式评测需要重复多少轮。
- 独立验证:在新的数据集或独立收集的语料上检验预测是否成立。
这和“大家都问 10 次”的区别在于,10 只是一个人为设定的数字;协议试图回答的是:在当前任务的噪声水平下,问多少次才足以支撑结论?
研究结果:39个预测单元中,37个达到预设复现标准
作者在三个独立收集的外部语料库上测试了这一统计方法,覆盖政治取向问卷和基准稳定性等任务。结果显示,在39个预测单元中,有37个达到了预先设定的复现标准,另外2个属于部分匹配。
37/39个预测单元达到预设标准,意味着先导试验可以在相当程度上预测后续重复评测的可靠性,但它并不等于协议已经适用于所有大模型场景。
这个结果有两层含义。
第一,重复查询次数并非只能靠经验拍脑袋决定。只要先导试验设计得当,研究者可以利用已有数据预测正式评测的稳定程度。对于预算有限的团队,这比盲目增加所有模型的查询量更有效:低波动任务可能不需要大量重复,高波动任务则应提前扩大样本,而不是等排名出现争议后再补测。
第二,37/39并不是“准确率 94.9%”这么简单。这里的预测单元是研究设计中的统计检验单元,不等同于模型回答正确率,也不能直接理解为协议对任何任务都有 94.9% 的成功概率。研究本身还报告了两个部分匹配,以及其他预注册检验失败的情况,包括部分漂移诊断没有达到预期。这种不完美反而是论文有价值的地方:它没有只展示成功案例,而是把固定阈值失效和诊断失败也纳入结论。
一般化理论如何解决“模型到底稳不稳”
一般化理论的关键,是把总误差拆分成多个可解释的方差来源,而不是把所有波动都归咎于模型随机性。
以一次品牌推荐评测为例,输出差异至少可能来自以下几类因素:
- 模型因素:不同模型的训练数据、对齐策略和知识结构不同。
- 重复查询因素:即便提示词完全相同,采样过程也可能产生不同答案。
- 提示词因素:同一问题的措辞、上下文顺序和格式要求变化,都会改变输出。
- 对象因素:不同品牌、政治议题或测试样本的难度并不相同。
- 评分因素:把自然语言回答转成类别、排名或分数时,解析规则会引入额外误差。
- 时间因素:闭源模型可能在后台更新,系统提示词、路由策略和安全策略也可能变化。
如果这些来源没有区分,评测者很容易犯一个常见错误:看到两个模型的平均排名不同,就认为它们能力不同。但如果模型内部重复查询产生的波动已经足以覆盖这段差距,那么这两个排名可能没有统计意义。
可以把它类比成两支球队的比赛。只踢一场,主客场、天气和偶然失误都可能决定结果;多踢几场可以降低偶然性,但到底要踢 3 场还是 30 场,取决于两队实力差距和比赛本身的波动。大模型评测中的重复查询,就是在增加“比赛场次”;一般化理论则试图估算每一种偶然因素到底有多大。
在统计表达上,研究者通常会围绕可靠性系数来设计重复次数。其直觉是:真正关心的稳定信号越强、随机误差越小,所需重复次数越少;如果误差占比很高,即使增加少量查询,也未必足够。重复次数增加通常能降低均值估计的随机误差,但不能自动修复系统性偏差,例如提示词本身诱导了某种答案,或者评测样本与真实用户场景严重不一致。
为什么“问10次”在很多评测里并不可靠
固定重复次数的问题,不只是统计上不够优雅,而是会在实际工作中制造相当具体的误判。
1. 不同任务的波动水平不同
事实抽取、结构化分类和开放式推荐的输出稳定性通常不在同一水平。一个模型对“这段文本包含几个日期”的回答可能几乎不变,但对“最值得购买的手机品牌是什么”的回答则可能在多个候选之间反复切换。对前者重复 3 次可能已经足够,对后者重复 10 次仍可能不足。
2. 不同模型的随机性也不同
模型的温度、采样策略和服务端生成配置会影响输出分布。即使用户没有显式设置采样参数,产品层也可能采用不同的默认策略。用相同次数评测两个随机性不同的模型,相当于用相同数量的比赛场次比较两支比赛风格完全不同的球队。
3. 平均答案稳定,不代表排名稳定
有些评测只统计某个选项出现的比例,却不检查完整排序。例如模型在10次回答中有6次推荐 A、4次推荐 B,看起来 A 获得多数;但如果每次回答还包含不同的第二、第三推荐,最终品牌排名可能非常不稳定。
4. 重复查询无法覆盖时间漂移
**模型漂移是模型或服务在时间变化后,输出分布发生改变的现象。**重复查询主要测量同一时间窗口内的随机波动,不能自动识别数周后模型版本、系统指令或后端路由变化带来的差异。
因此,一项在周一完成的20次重复查询,可能只能说明“周一这个时间段的稳定性”,不能证明模型在未来一个月仍然保持相同表现。研究作者也指出,部分预注册的漂移诊断没有按预期工作,这提醒评测者不要把单一可靠性指标当成完整的长期稳定性证明。
这项研究没有证明什么
研究结果值得重视,但不应该被解读成“只要做一次先导试验,就能解决大模型评测的可重复性问题”。作者明确指出,一个重要限制是:三个外部语料库并不包含原始应用中的品牌推荐数据。
**外部语料库验证的是统计机制,而不是品牌推荐结论本身。**这一区分很重要。政治取向问卷和基准稳定性任务可以用来检验“先导试验能否预测重复评测可靠性”,但它们无法完全代表品牌推荐场景中的开放式语言、商业偏好、上下文敏感性和候选集合变化。
品牌推荐尤其容易受到隐藏变量影响。例如:
- 用户是否要求结合预算、地区和售后服务;
- 模型是否能访问实时信息;
- 品牌是否在训练数据中拥有更高曝光度;
- 问题是开放式推荐还是给定候选列表中的排序;
- 是否将“推荐理由”也纳入评分;
- 同一品牌的不同产品线是否被模型混为一谈。
如果这些因素没有在实验设计中固定,增加重复次数只能更精确地测量一个混杂任务,而不能让结论自动变得有效。
此外,研究中两个部分匹配和部分漂移诊断失败,也说明协议需要持续校准。统计方法可以告诉你当前的重复次数是否可能足够,却不能替实验者决定可靠性目标、定义有效输出或选择代表性样本。
对开发者和评测团队的实际建议
对于需要比较模型的开发者,最有用的改变不是立刻把所有评测扩大到数百次,而是把评测拆成“探索”和“确认”两个阶段。
第一步:先定义你要比较的对象
不要只写“比较模型回答质量”。需要提前明确比较的是:
- 单次回答的成功率;
- 多次回答的平均分;
- 首选项出现概率;
- 完整排序的一致性;
- 事实正确率;
- 安全拒答率;
- 长期版本稳定性。
不同指标对应不同的可靠性问题。首选项比例稳定,不代表理由质量稳定;平均分稳定,也不代表极端失败率稳定。
第二步:做小规模先导试验
先选择一批能够代表正式任务的样本,为每个模型进行若干轮重复查询。关键是保留原始回答,而不是只保存最后的分数。原始回答可以帮助你发现解析器错误、拒答模式变化和输出格式漂移。
先导试验至少应记录:模型名称和版本、查询时间、提示词版本、采样参数、系统指令、输入样本、原始输出、解析结果以及评分规则。闭源模型尤其需要记录调用时的模型标识和响应元数据,因为服务端版本可能在不明显通知用户的情况下变化。
第三步:估计波动并预先设定目标
在看到正式结果之前,先写清楚“什么叫足够稳定”。例如,团队可以要求模型首选项比例的估计误差低于某个范围,或者要求模型间排名在重复抽样后保持一致。可靠性目标越高,通常需要的查询次数越多;但过高的目标也会显著增加时间和计算成本。
第四步:正式评测时不要只报告平均值
一份可信的模型比较报告至少应该同时展示:
- 平均得分或推荐比例;
- 重复查询次数;
- 置信区间或不确定性范围;
- 模型排名在不同重复轮次中的变化;
- 失败回答和拒答比例;
- 评测时间窗口及模型版本信息。
如果两个模型的分数分别是 82 分和 80 分,但不确定性范围高度重叠,那么最诚实的结论可能是“当前实验无法确认二者存在稳定差异”,而不是宣布前者胜出。
推荐一套轻量级工作流
对于中小团队,可以先采用下面这套不依赖复杂基础设施的流程:
定义指标与可靠性目标
↓
抽取代表性样本
↓
对每个模型进行小规模重复查询
↓
保存原始输出并检查解析规则
↓
估计查询、样本、模型和时间因素的波动
↓
计算正式评测所需的重复次数
↓
独立样本复测并报告不确定性
这套流程的重点不是把每个项目都变成完整的统计学论文,而是避免三个低级错误:用一次回答代表模型整体表现;用固定次数掩盖任务差异;把偶然排名差距写成确定性结论。
如果预算非常有限,可以采用分层策略:先对少量样本做高重复次数试验,判断任务噪声;再对更多样本做较低次数的查询,并把两者结合起来估计总体表现。但要注意,样本数量和每个样本的重复次数解决的是不同问题:前者主要提高对任务总体的覆盖,后者主要降低单个样本的随机误差,二者不能简单互相替代。
和现有模型评测习惯相比,它改变了什么
传统基准往往默认模型对同一个输入会给出稳定答案,因此一次推理就可以计分。这种假设在分类题、代码单元测试等场景下有一定合理性,但在开放式生成、偏好判断、品牌推荐和价值观问答中越来越脆弱。
另一方面,很多团队已经开始进行多次采样,但仍停留在“多跑几次取平均”的阶段。重复查询可靠性协议进一步追问:平均值的误差有多大?当前次数是怎么来的?如果换一批样本,结论还能不能复现?如果模型一周后更新,排名是否仍然成立?
从行业趋势看,这与模型能力评测逐渐转向可靠性、校准、漂移监控是一致的。大模型的竞争不再只是某个榜单上的最高分,而是能否在不同时间、不同用户、不同提示形式下持续给出可预测的结果。微软亚洲研究院等机构近年的研究也持续把安全、对齐、复杂推理和可靠性放在同一框架中讨论;而社会科学大规模复现项目反复显示,单次显著结果并不等于稳定事实。大模型评测正在吸收这些元科学经验。
我们的判断:这是评测方法的进步,但还不是“可靠性认证”
这项研究最有价值的地方,在于它把一个经常被忽略的工程问题——“同一提示词到底要问几次”——变成了可验证的实验设计问题。37/39个预测单元达到预设复现标准,说明先导试验驱动的重复次数规划具备实际潜力;固定迭代阈值无法迁移,则直接否定了“所有任务问10次就够”的懒惰做法。
但它的边界同样清晰:外部语料库没有覆盖品牌推荐,部分预注册检验失败,漂移问题也没有被完全解决。因此,开发者不应把这项协议当成一个给出标准答案的计算器。它更像实验前的功率分析:帮助你知道数据是否足够支撑结论,但不能替你选择好的问题、干净的样本和合理的评分规则。
**真正成熟的大模型比较,应该报告的不只是模型得分,还包括得分的稳定性、重复次数、时间窗口和不确定性。**在模型更新越来越频繁、输出越来越开放的今天,“问一次就下结论”已经不再是高效,而是把随机性误认为能力。下一次你准备发布模型对比结果时,先别急着问谁赢了,先问一句:这个结论,在重复查询和独立复测后还能成立吗?
参考来源
- Reddit:How many repeated LLM queries are enough? Testing a pilot-based reliability protocol:研究作者对预印本、一般化理论、39个预测单元及研究限制的介绍。
- ChineseFactEval 项目:中文大模型事实性评测项目,说明生成内容可靠性与可验证性为何需要独立评估。
- SCOPE 相关讨论:围绕大模型实验设计、评测规划与科研可重复性的中文背景资料入口。



