AI榜单换了把尺子

Artificial Analysis Intelligence Index 更新至 v4.2,大模型排行榜再次调整评测框架。相比只看知识问答,新版本更强调真实工作、代码执行、科学推理与事实可靠性,榜首变化不再是唯一看点。
AI榜单换了把尺子:Artificial Analysis Intelligence Index v4.2 更新
Artificial Analysis 最近将 Intelligence Index 更新至 v4.2,大模型排行榜迎来新一轮评测结果。与上一轮版本相比,这次更新的意义不只是“谁排第一”,更在于 Artificial Analysis 正在持续把榜单从传统能力考试,改造成一套更接近真实使用场景的综合测量体系。
Artificial Analysis Intelligence Index 是一项将多个模型评测组合成单一分数的综合指标,用于比较大模型在知识、推理、代码、专业工作和可靠性等维度的总体表现。 它不是某一个单项榜,也不是模型在所有任务上的统一胜负判定,而是一个帮助用户快速缩小选择范围的“总分榜”。
截至 2026 年 9 月 5 日,Artificial Analysis 已经发布 v4.2 版本页面。需要注意的是,模型排行榜属于动态数据:同一模型可能因为推理档位、上下文设置、工具权限、供应商部署版本和评测样本变化而出现不同分数。因此,阅读 v4.2 时,不能把榜单上的一个数字直接理解为模型的“绝对智力”。

v4.2 的核心变化,不是多了一个榜单
这次更新的核心,是继续把模型评价从“答题能力”转向“完成任务的能力”。 传统的 MMLU、数学题或短代码题,适合快速横向比较,但很难回答企业真正关心的问题:模型能不能把一项工作做完?它会不会在不确定时乱编?能不能处理多步骤工具调用?面对研究级问题时,是否能给出可验证的推导?
Artificial Analysis 在此前 v4.0 和 v4.1.1 的方法论中,已经明显减少对单一通用考试的依赖。现有评测组合包括 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 等项目。v4.2 延续了这条路线,榜单的重点也从“模型知道多少”进一步转向“模型在复杂任务中是否可靠”。
下面是当前评测体系中最值得关注的能力方向:
| 能力方向 | 代表性评测 | 主要考察内容 | 对实际用户的意义 | |---|---|---|---| | 专业知识工作 | GDPval-AA v2 | 基于真实职业与行业任务的产出质量 | 能否协助分析、写作、研究和办公 | | 金融代理任务 | τ³-Banking | 多轮金融服务与工具交互 | 能否稳定完成客服、查询和流程任务 | | 终端与代码操作 | Terminal-Bench v2.1 | 在终端环境中执行多步骤任务 | 能否真正改代码、跑命令和排查问题 | | 科学编程 | SciCode | 科学计算、代码实现与结果解释 | 能否支持科研和复杂数值工作 | | 高难度知识推理 | Humanity’s Last Exam、GPQA Diamond | 专家级知识与跨领域推理 | 能否处理普通搜索难以解决的问题 | | 研究级物理推理 | CritPt | 新颖物理问题与可验证推导 | 能否突破熟题记忆,完成原创推理 | | 事实可靠性 | AA-Omniscience | 正确回答、拒答和幻觉控制 | 不确定时是否知道自己“不知道” | | 长上下文与检索 | AA-LCR | 长上下文中的信息定位与推理 | 能否从长文档中找准依据并回答 |
这套组合有一个重要变化:模型的“聪明”不再只由答对率决定。一个模型即使在知识题上得分很高,如果在长流程中频繁调用错误工具、在没有依据时自信编造答案,最终也很难成为可靠的生产力工具。
为什么综合分数越来越难看懂
综合指数的分数越高,代表模型在整套评测中的加权平均表现越强,但不代表它在每一个具体任务上都更好。 这是理解 v4.2 最重要的前提。
Artificial Analysis 此前公开的 v4.0 数据可以说明这一点:GPT-5.2(xhigh)曾以 51 分位居榜首,Claude 4.5 Opus 为 49 分,Gemini 3 Pro Preview(high)为 48 分,GPT-5.1(high)为 47 分;Claude 4.5 Sonnet 与 GLM-4.7 约为 42 分,Grok 4 与 DeepSeek v3.2 约为 41 分,Kimi K2 Thinking 为 40 分。这些分数能够展示模型之间的大致梯队,但无法替代具体场景测试。
进入 v4.2 后,用户更应该关注三个问题:
- 模型的评测配置是什么? 同一模型的标准模式、高推理模式和自适应推理模式,可能对应完全不同的成本、速度与成绩。
- 模型在哪些子项领先? 一个模型可能在 GDPval-AA v2 和代码任务上表现突出,但在 AA-Omniscience 上更容易产生幻觉。
- 榜单分差是否足够大? 如果两个模型只相差 1 分,却对应明显不同的价格和延迟,实际选型未必应该优先选择高分模型。
换句话说,综合榜适合做第一轮筛选,子榜和原始任务结果才适合做最终决策。
从“答对”到“知道什么时候不该答”
AA-Omniscience 是面向知识可靠性的评测,重点不仅是模型答对多少题,也包括模型在不确定时是否避免乱猜。 这类设计比传统选择题更接近企业应用,因为现实系统最危险的输出往往不是“我不知道”,而是一个措辞流畅、看起来可信但没有依据的错误答案。
据 Artificial Analysis 此前披露的设定,AA-Omniscience 包含约 6,000 道题目,覆盖六大领域和 42 个主题,并通过扣分机制惩罚错误猜测;模型选择不回答时,通常保持中性分数,而不是被简单判为零分。
这个机制会改变模型之间的比较方式。某些模型在开放式问答里更积极,短期看起来“什么都能答”;另一些模型则更谨慎,遇到证据不足的问题会拒答。前者可能在覆盖率上占优,后者可能在高风险业务中更有价值。医疗、法律、金融和企业知识库场景尤其不能只看总分,还需要单独考察引用准确率、拒答质量和错误类型。
CritPt 暴露了模型的真实短板
CritPt 是面向研究级物理推理的高难度评测,目标不是考模型是否记住公式,而是考察它能否从新问题出发完成可验证的推导。 这是 v4 系列中最能拉开“会做题”和“会推理”差距的项目之一。
此前公开结果显示,CritPt 的领先模型正确率也仅在约一成上下,GPT-5.2(xhigh)约为 11.6%,多数其他知名模型则处于个位数甚至接近零的水平。即使允许模型使用代码执行和网页搜索工具,成绩也只是小幅改善,没有真正解决核心推理瓶颈。
这组结果对市场叙事有一定降温作用。模型在常见数学题、代码补全和知识问答上的进步,并不等于它已经具备稳定的科学研究能力。面对陌生问题时,模型仍然可能出现以下问题:
- 把合理的中间步骤误认为正确证明;
- 在单位、边界条件或初始假设上出现隐蔽错误;
- 通过长篇解释掩盖最终答案无法验证的问题;
- 依赖工具获得局部信息,却没有形成完整的因果链条。
因此,v4.2 的科学推理结果更适合被理解为“能力边界探测器”,而不是产品宣传中的单一卖点。
这次更新对开发者意味着什么
对于开发者而言,v4.2 更适合用来建立模型候选集,而不是直接决定生产环境的唯一模型。 推荐采用“总榜初筛、子榜复核、真实数据集验收”的三步流程。
第一步:用综合榜筛掉明显不合适的模型
如果任务涉及复杂推理、长上下文、代码执行和专业知识,可以先从 v4.2 的高分模型中选择候选。综合分的价值在于节省初筛时间,避免团队一开始就对几十个模型逐一做完整测试。
但这一步只解决“能力上限”问题,没有解决成本、延迟、稳定性和部署可用性问题。
第二步:根据工作流查看子项成绩
代码代理不应该只看综合 Intelligence 分数,而要重点查看 Terminal-Bench、SciCode、长上下文和工具交互相关结果。企业知识库则应优先检查 AA-Omniscience、AA-LCR 以及长文档问答表现。需要复杂研究辅助的团队,还要关注 GPQA Diamond、CritPt 和 Humanity’s Last Exam。
模型选型的关键不是找到总分最高的模型,而是找到在目标任务上单位成本产出最高的模型。 例如,一个高推理模型可能只比中档模型高 2 分,却需要更长的思考时间和更高的 token 费用;在批量摘要、分类和结构化抽取中,这个差距可能完全不值得支付。
第三步:用自己的数据做最终验收
评测榜单无法覆盖企业内部术语、业务流程、权限系统和数据格式。上线前至少应该建立一套包含真实失败案例的测试集,并记录以下指标:
- 任务完成率,而不是只记录文本相似度;
- 首次通过率和平均重试次数;
- 幻觉率、错误引用率与高风险错误率;
- 平均响应时间、P95 延迟和超时比例;
- 单任务成本以及人工复核成本;
- 工具调用失败率和异常恢复能力。
如果模型在榜单上领先,但在你的真实工作流中需要更多人工返工,它就不是更好的模型。
开源模型与闭源模型,比较方式也在变化
v4.2 的综合榜会进一步放大“模型能力、推理配置和服务体验”之间的差异,而不是简单呈现开源与闭源的二元竞争。 闭源模型往往在高预算推理、复杂工具使用和端到端任务上占据优势;开放权重模型则在私有化部署、数据控制和单位成本方面更有吸引力。
对于开发者,真正值得比较的是以下维度:
| 比较维度 | 闭源前沿模型 | 开放权重模型 | |---|---|---| | 综合能力 | 通常在复杂推理和专业任务上更强 | 头部模型已覆盖大量通用场景 | | 数据控制 | 依赖供应商服务与数据政策 | 可在自有环境中部署和审计 | | 推理成本 | 高能力档位通常价格更高 | 可通过量化、批处理和专用硬件降本 | | 迭代速度 | 服务端更新快,但版本可能变化 | 版本可锁定,部署和升级由团队负责 | | 工具与代理 | 平台集成通常更完整 | 需要自行搭建工具调用和安全层 | | 适合场景 | 高价值复杂任务、快速上线 | 私有数据、规模化调用、可控部署 |
榜单分数并不会自动抹平这些差异。一个部署在本地、速度更快且可接受的开放权重模型,可能比排名更高但延迟和成本都更高的闭源模型更适合生产环境。
不要把 v4.2 当成“最终答案”
Artificial Analysis Intelligence Index v4.2 的最大价值,是提供了一把更贴近真实任务的统一尺子;它的最大局限,则是任何综合分都会隐藏具体能力之间的差异。
这次更新值得关注,但不值得被当作新一轮“榜首崇拜”的依据。模型排名会变化,评测权重会变化,模型的推理档位也会变化。更重要的是,真实业务通常不是一道独立题目,而是一条包含检索、判断、工具调用、格式校验、权限控制和人工复核的工作流。
对普通用户来说,可以把 v4.2 当作选择模型的导航页:先看综合梯队,再看自己关心的专项能力。对开发者来说,则应该把榜单当成外部基准,建立自己的回归测试体系。对企业团队来说,最终决策仍应由质量、成本、速度、合规和可维护性共同决定。
截至今天,v4.2 的榜单已经更新,但真正值得追踪的并不是某个模型短期上升或下降了几名,而是评测机构正在把问题问得越来越接近现实:模型能不能完成工作、能不能承认不确定、能不能在复杂环境中保持稳定。这个方向,比“又刷新了多少分”更重要。
参考来源
- Artificial Analysis Intelligence Index v4.2(官方更新页面):v4.2 更新说明与评测榜单入口。受本文链接白名单限制,正文仅以页面名称引用。
- iThome:Artificial Analysis 改版智慧指标 v4.0:介绍 v4.0 的评测调整、GDPval-AA、AA-Omniscience 与 CritPt 等项目,并提供历史榜单数据作为背景参考。
- Artificial Analysis Intelligence Index 方法论与评测页面:用于核对 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 等评测项目。由于页面为动态榜单,具体分数应以 2026 年 9 月 5 日页面显示结果为准。



