AI 快讯AI榜单重标:集体降6至15分
开发心得

AI榜单重标:集体降6至15分

2026-07-30T16:05:11.951Z
AI榜单重标:集体降6至15分

Agiranker 审计评分尺度后,同一批模型的得分全部下降6至15分。模型能力并未突然退化,真正失准的是把原始测试结果映射成总分的方法。

模型没变,榜单先集体降分

一份 AI 排行榜在重新审计评分尺度后,所有模型的总分都下降了6至15分。Agiranker 的维护者近期在 Show HN 分享了这次调整:测试对象没有集体换代,模型也没有在一夜之间变笨,变化来自排行榜用于换算和展示成绩的标尺。

这里首先要纠正一个容易被标题混淆的细节:原作者说的是下降6至15个分数点,而不是统一下降6%至15%。如果一个模型从80分降到74分,下降的是6分,相对降幅为7.5%;如果从80分降到65分,下降15分,相对降幅则达到18.75%。两种表述不能直接互换。

**AI 排行榜是将多个模型在一组测试任务上的结果汇总、标准化并排序的评测系统。**开发者通常用它快速判断模型在推理、编程、写作、检索或多语言任务中的相对位置,但排行榜上醒目的总分,往往不是模型直接答对了多少题,而是经过归一化、加权和缺失值处理后的二次产物。

这次集体降分最值得关注的地方,不是哪一个模型掉得最多,而是它暴露了 AI 评测中长期被忽略的一层:基准测试可能没有变,原始结果可能也没有变,但只要评分函数被重新校准,80分就可以变成68分。

AI排行榜重新校准前后,同一批模型总分整体下降6至15分的对比示意图

下降6至15分,不等于模型能力倒退

这次调整更接近给一把刻度印错的尺子重新画线,而不是重新测量模型。假设某模型在数学题中答对72%,代码测试通过65%,长文本检索命中88%,这些原始结果没有变化;变化的是排行榜如何把三项成绩压缩成一个0至100分的总分。

**评分尺度审计是检查原始测量值如何被转换、归一化和汇总为最终分数的过程。**它需要验证上下界是否合理、不同任务是否同量纲、权重是否符合产品定义,以及旧模型或人工基线是否仍适合作为参照点。

按照维护者披露的结论,重新审计后所有模型都下降6至15分,这意味着旧尺度存在系统性偏高,而不只是个别模型的异常波动。系统性偏差比单个错分更值得警惕,因为它会让整个市场对模型能力形成过度乐观的共同预期。

下面用一个80分模型展示「分数点」与「百分比」的区别,表中仅是算术示例,并非 Agiranker 对某个具体模型公布的成绩:

| 调整幅度 | 调整前总分 | 调整后总分 | 相对降幅 | 能否理解为能力退化 | |---|---:|---:|---:|---| | 下调6分 | 80 | 74 | 7.5% | 不能,需先确认原始测试是否变化 | | 下调10分 | 80 | 70 | 12.5% | 不能,可能只是评分尺度变化 | | 下调15分 | 80 | 65 | 18.75% | 不能,需要查看逐项原始数据 |

这组数字说明,排行榜的「分」通常只是一个索引,而不是物理单位。延迟从800毫秒降到200毫秒,可以明确说下降75%;模型总分从80变成70,却不能据此断言能力下降12.5%,因为80分与70分之间未必是线性、等距的能力差。

总分为什么会被高估

评分上浮最常见的原因是归一化锚点失真。排行榜为了把准确率、通过率、偏好胜率和延迟等不同指标放进同一张表,通常会设置一个低位基线和一个高位基线,再将原始结果映射到统一区间。如果高位锚点设得太低,今天的大量模型就会被挤在90分附近,看起来个个接近满分。

**归一化是把不同范围和单位的数据转换到可比较尺度的数学处理。**最简单的 min-max 归一化会把最低值映射为0、最高值映射为100,但它高度依赖样本中的极端值:加入一个特别弱或特别强的模型,其他模型即使没有重测,显示分数也可能随之变化。

权重设计也会悄悄放大总分。一个榜单如果把数学推理、代码生成和写作偏好分别设置为40%、40%和20%,它测量的实际上是维护者定义的「综合能力」;另一张榜单若采用20%、20%和60%,同一模型的总分与排名都可能完全不同。

缺失值处理同样可能制造虚高。某些模型无法完成超长上下文测试,或者因工具调用格式不兼容而没有成绩;如果系统直接忽略缺失项,并只对模型擅长的项目重新分配权重,未参赛就可能比低分完赛更有利。合理做法应当明确标注缺失原因,并同时公布覆盖率。

饱和基准则会让模型间差距看起来比实际更小。当头部模型在某套选择题上普遍达到90%以上时,这套题已经很难分辨它们在真实任务中的差异。此时把92%和94%线性映射成92分和94分,精确到个位数,看似客观,实际测量误差可能已经超过两分。

不同评分方式的优缺点并不相同:

| 评分方式 | 主要优点 | 主要风险 | 更适合的场景 | |---|---|---|---| | 直接公布准确率或通过率 | 含义直观,可复算 | 不同任务不能直接相加 | 单一固定任务 | | Min-max 归一化 | 容易映射到0至100分 | 对最高值、最低值极敏感 | 样本长期固定的榜单 | | Z-score 标准化 | 能显示偏离平均水平的程度 | 普通读者不易理解,随样本变化 | 研究型横向比较 | | 百分位排名 | 能说明超过多少参评模型 | 无法表达绝对能力,模型池变化会改分 | 大规模相对排名 | | 相对参考模型计分 | 版本之间容易建立锚点 | 参考模型过时后尺度会漂移 | 持续更新的在线榜单 | | 多指标加权总分 | 便于选型和快速排序 | 权重带有主观判断,容易掩盖短板 | 产品级综合榜单 |

排名没变,也不代表这次调整无关紧要

如果所有模型都下降相近分数,榜单名次可能几乎不变,但这次校准仍会影响采购和产品决策。模型选型并不只是在第一名和第二名之间二选一,开发团队还会设置「达到80分即可上线」之类的质量门槛,而尺度调整可能让原本越线的模型全部回到门槛以下。

**排名回答的是谁相对更强,分数试图回答强到什么程度。**前者只关心顺序,后者还承担能力解释;一个榜单可以把排序做对,却仍然把能力成熟度说错。

这种偏差在企业落地中尤其危险。假设团队看到模型获得90分,可能会认为人工复核只需覆盖10%的边缘情况;如果校准后实际显示为75分,产品就不应沿用同一套自动化策略。排行榜不会直接给出生产环境错误率,但过高的总分会诱导团队低估回退、监控和人工审核的成本。

分数虚高还会影响模型价格判断。一个价格为竞品两倍、榜单高出3分的模型,看起来可能值得购买;若3分落在评测误差或尺度漂移范围内,所谓领先就不足以覆盖成本差异。对于每日调用量较大的应用,吞吐、首 token 延迟、完整响应时间和失败重试率,往往比一个不透明的综合分更有财务意义。

这不是某一张榜单独有的问题

排行榜漂移是整个生成式 AI 评测体系的结构性问题。模型更新越来越快,测试集污染、提示模板差异、采样参数变化和裁判模型偏好都会改变结果,而用户最终看到的通常只是一个保留一两位小数的数字。

Hugging Face 的 Open LLM Leaderboard 会公开评测任务和模型结果,EleutherAI 的 lm-evaluation-harness 则把大量学术基准整理成可复现的评测框架。公开任务与工具链解决了「如何运行测试」的一部分问题,但它们仍不能替榜单维护者决定如何选权重、如何处理缺失项,以及是否应该把多类任务压缩成单一总分。

**可复现评测是指第三方能够使用相同模型版本、数据集、提示模板和推理参数得到接近结果的评测。**只有模型名称而没有精确版本、量化方式、上下文长度、解码参数和运行日期,结果就很难真正复现。

裁判模型也会形成新的隐藏标尺。许多主观任务不再由人类逐条评分,而是让另一个大模型判断两个回答谁更好;这种方法成本低、速度快,却可能偏爱更长、更自信或与裁判自身风格相似的答案。即使原始胜率计算无误,裁判偏差仍会一路传递到最终总分。

因此,我对这次集体降分的判断是积极多于负面。主动承认尺度有误会短期损害榜单的可信度,但拒绝修正才是真正的问题;维护者愿意把所有模型一起下调,至少说明其没有为了维持「高分盛世」而继续沿用错误刻度。

开发者应该怎样重新读榜

开发者不应把综合分当成采购结论,而应把它视为缩小候选范围的第一轮过滤器。一张榜单最有价值的部分不是首页前三名,而是可下载的逐任务成绩、评测配置和历史版本。

**置信区间是用于描述评测结果不确定范围的统计区间。**如果模型 A 得分82.1、模型 B 得分81.7,而两者误差范围均为正负1分,那么0.4分的领先不具有足够判断力;将它们写成明确的第一名和第二名,只是在制造虚假的精确感。

在实际选型时,至少应检查以下七项:

  1. 查看原始指标,确认总分背后是准确率、通过率、胜率还是主观评分。
  2. 查看模型精确版本,避免把同名模型的预览版、正式版和量化版混在一起。
  3. 查看运行配置,尤其是温度、最大输出长度、上下文长度、工具权限和系统提示词。
  4. 查看评测日期,判断模型、裁判或测试框架是否在不同时间发生过更新。
  5. 查看权重与缺失值规则,确认模型未完成的任务是否被错误忽略。
  6. 查看置信区间和样本量,不为零点几分的表面差距支付明显溢价。
  7. 使用自己的真实流量复测,把质量、延迟、稳定性和单位任务成本放在同一张表里。

团队自建内部榜单时,最好同时保留绝对指标和相对指标。绝对指标可以是工单一次解决率、代码测试通过率、结构化输出成功率和每千次任务失败数;相对指标可以是与当前生产模型相比的胜率。前者决定能否上线,后者决定是否值得迁移。

版本化评分规则也应成为基本要求。一次权重或归一化修改不应直接覆盖旧结果,而应像数据库迁移一样产生新的榜单版本,例如 Scale v1 与 Scale v2,并提供同一批模型在两套规则下的对照。这样开发者才能区分「模型升级」与「尺子换了」。

榜单真正缺少的是测量说明书

AI 评测当前最大的问题不是榜单太多,而是总分被包装得过于确定。一个没有原始数据、评分公式、模型版本、误差范围和变更记录的85分,其信息量可能低于一项定义清楚的62%任务成功率。

这次6至15分的集体回调给开发者的提醒很直接:排行榜上的小数点不等于精度,0至100的界面也不等于百分制考试。只要评分尺度可以改变,同一批原始结果就能讲出不同故事。

更可靠的 AI 榜单应当同时公布原始成绩、标准化成绩和排名,并允许用户按照自身场景修改权重。对于代码助手,仓库级修改成功率可能比知识问答更重要;对于客服系统,事实准确率、拒答策略和响应延迟可能比竞赛数学更重要。不存在适用于所有产品的唯一综合分。

截至2026年7月30日,这次审计还不足以证明其他排行榜也普遍高估了相同比例,但它已经提供了一个值得复用的方法论:在追问哪个模型得分最高之前,先问这套分数究竟是怎样算出来的。模型能力决定产品上限,评测尺度决定我们是否看得清这个上限。

参考来源

注:本文所述集体降分事件依据 Agiranker 发布的评分尺度审计说明及其 Show HN 讨论;按照本文来源域名规范,未附原始站点链接。

相关推荐

查看全部