AI 快讯Vals要做AI评测的中立层
行业快讯

Vals要做AI评测的中立层

2026-09-19T14:06:03.913Z
Vals要做AI评测的中立层

获 a16z 支持的 Vals 正试图成为 AI 模型评测的独立中间层。它真正要解决的不是榜单数量不够,而是数据污染、选择性披露和结果无法复现造成的信任危机。

Vals 想卖的不是榜单,而是可信度

Vals 正在把 AI 模型评测包装成一门独立于模型厂商、企业客户和公开排行榜的基础设施生意。据 TechCrunch 9 月 19 日报道,这家获得 Andreessen Horowitz(a16z)支持的公司,希望成为 AI benchmarking 领域的“黄金标准”,通过私有测试集、第三方执行和面向真实行业的任务,建立一个更中立、可复现的模型评价体系。

AI 基准测试是一套用标准化任务、数据集和评分规则衡量模型能力的方法。过去几年,它承担了类似考试和产品参数表的功能:开发者看 MMLU 判断知识能力,看 HumanEval 判断代码能力,看数学和科学题集判断推理能力,再用一个总分决定谁是“最强模型”。

但到了 2026 年,行业缺的已经不是更多考试,而是一个值得相信的监考机构。公开题库被纳入训练数据、厂商只展示有利成绩、不同评测机构使用不同提示词和推理预算,再加上模型厂商频繁更新线上版本,同一个模型在不同榜单上经常像是两个产品。

Vals 所谓的“中立层”,本质上是位于模型提供商和模型采购者之间的独立评测基础设施。它既不负责训练模型,也不只做一次性的媒体测评,而是试图统一测试数据、运行环境、评分规则和结果披露方式,让模型能力从厂商的营销口径变成可以审计的产品指标。

这听起来像是给模型做考试,实际更接近标普、穆迪之于债券市场,或者 UL 认证之于消费电子。真正值钱的不是出一道难题,而是让采购者相信:所有参赛者做的是同一套题,测试时没有临时开小灶,成绩也不是从十组结果里挑出最好的一组。

Vals 位于模型厂商、企业客户与公开排行榜之间的“中立评测层”示意图,展示私有测试集、统一运行环境、成本延迟记录和第三方报告四个模块

模型排行榜为什么越来越难信

公开基准的第一个问题是数据污染。数据污染是指评测题目或其变体进入模型训练语料,使模型依靠记忆而非真实推理获得高分;当 MMLU、GSM8K、HumanEval 等题集长期公开,并被大量论文、教程和网页重复转载后,完全排除污染已经非常困难。

公开题库甚至可以被有针对性地“刷题”。开发团队不一定要直接把标准答案塞进训练集,只需对测试题进行改写、翻译和格式变换,再围绕这些变体做微调,就可能显著提高榜单成绩,而模型在题库之外的泛化能力并没有同步增长。

第二个问题是厂商拥有过大的报告选择权。一款模型可能同时跑几十个数据集、多个提示模板和不同推理预算,最后只公布排名靠前的项目;失败结果、重复运行的方差、调用成本和超时率则往往不会出现在发布博客里。

第三个问题是测试时算力正在成为隐藏变量。推理模型可以通过输出更长的思考过程、并行生成多个答案、调用工具或使用自我反思提高正确率,但这些策略也会增加延迟和成本;如果榜单只记录准确率,不记录完成一道题消耗的时间与计算量,就相当于允许一名考生答题 30 秒,另一名考生答题 30 分钟,最后只比较分数。

第四个问题是评测环境并不统一。提示词措辞、上下文长度、采样温度、最大输出长度、工具权限、系统指令乃至请求失败后的重试规则,都会改变最终结果;所谓“同一模型”,也可能对应网页端、企业版和不同日期线上服务中的多个实际版本。

第五个问题是“用 AI 评价 AI”会引入新的偏差。LLM-as-a-judge 是使用另一个大模型为回答打分的方法,它比人工标注便宜且扩展速度快,但裁判模型可能偏爱更长、更自信或与自身表达风格相似的答案,也可能对自家模型或同源模型产生系统性偏好。

这些问题共同造成了一个反直觉结果:基准测试的数量越来越多,模型选择却没有变得更容易。开发者面对的不是缺少分数,而是无法判断每个分数究竟测到了什么,以及不同分数能否放在同一张表里比较。

Vals 的做法:私有题库加真实任务

Vals 的核心方法是 held-out private benchmark,即不向参测模型开发者公开完整内容的保留测试集。私有题库不能彻底消灭数据污染,但能够显著提高定向训练和刷榜的成本,尤其适合测试新模型发布时的实际泛化能力。

Vals 也在把评测对象从通用问答转向行业工作流。其官网展示的项目覆盖金融智能体、代码、多模态和医疗等方向,其中医疗基准由 Vals AI 与 Graphite Digital 合作发布,评估了超过 15 款主流大模型在研究生级医疗问题上的表现。

医疗评测的设计说明了行业基准与传统考试的区别。Vals 不只测试一般准确率,还设置了正常问题和注入偏见的问题,用于衡量模型面对医疗场景中的种族偏见时能否识别并抵抗错误前提;这类指标比“模型知道多少医学知识”更接近真实部署风险。

Vals 最新披露的数据也显示,其榜单更新速度正在跟随模型迭代。按照 Vals 官网公布的结果,Gemini 3.5 Flash 在 Finance Agent Benchmark v2 上超过 GPT 5.5 共 6 分,升至第一;它在 Vals Index 中以 62.05% 排名第三,在 Vals Multimodal Index 中以 62.29% 排名第三。

Gemini 3.5 Flash 相比 Gemini 3.1 Pro Preview 的进步也被量化到了具体维度。Vals 称,前者在综合 Vals Index 上提高约 8 个百分点,在多模态指数上提高约 7 个百分点;不过这些数字只适合在 Vals 自身的运行设置和评分规则内比较,不能直接换算成其他榜单上的同等提升。

| Vals 最新披露项目 | 结果或变化 | 能说明什么 | 不能说明什么 | |---|---:|---|---| | Finance Agent Benchmark v2 | Gemini 3.5 Flash 位列第 1 | 模型在 Vals 定义的金融智能体任务上表现领先 | 不代表其在所有金融业务中都优于竞品 | | 与 GPT 5.5 的差距 | 领先 6 分 | 在同一评测协议下形成可量化差距 | 若任务权重改变,排名可能变化 | | Vals Index | 62.05%,第 3 名 | 综合任务表现进入第一梯队 | 综合分会掩盖单项能力差异 | | Vals Multimodal Index | 62.29%,第 3名 | 多模态任务表现较强 | 不等同于视频、文档和视觉智能体均领先 | | 相比 Gemini 3.1 Pro Preview | 综合约 +8 个百分点,多模态约 +7 个百分点 | 同系列模型出现明确代际进步 | 不能排除版本设置和推理预算差异 |

Vals 早期获得关注的另一个原因,是它愿意对厂商发布结论提出异议。TechCrunch 的报道提到,在 Meta 发布 Llama 4 时,Vals 使用内部保留基准观察到模型实际表现与部分公开印象存在偏差;对一家依赖模型公司配合的评测机构来说,公开唱反调本身就是其中立性的一次压力测试。

Vals 与现有评测体系有什么不同

Vals 并不是第一个发现排行榜失真的团队。学术界在维护更难、更新更快的数据集,Chatbot Arena 类平台用用户匿名投票比较模型,Artificial Analysis 等机构强调统一测试和价格、速度信息,企业内部也在用自有业务数据搭建评测流水线。

Vals 的差异在于,它试图同时占据第三方评测机构和企业评测平台两个位置。前者负责建立公共影响力,后者通过定制行业任务、持续回归测试和采购报告形成商业收入;如果二者能够互相强化,Vals 就不只是一张排行榜,而可能成为企业挑选模型时的质量控制层。

| 评测方式 | 典型特征 | 主要优势 | 主要缺陷 | |---|---|---|---| | 公开学术基准 | 题目和评分规则公开 | 易复现、研究门槛低 | 容易污染、过拟合和刷题 | | 厂商自测 | 由模型开发者选择测试集 | 发布速度快、能展示特定能力 | 存在选择性披露和配置倾斜 | | 用户盲测竞技场 | 用户对匿名回答投票 | 接近主观使用体验 | 样本构成不稳定,难覆盖专业任务 | | 企业内部评测 | 使用真实业务数据 | 与自身场景高度相关 | 成本高,结果难以跨公司比较 | | Vals 式第三方私有评测 | 保留题库、统一执行、行业任务 | 降低污染风险,便于采购比较 | 方法透明度与题库保密存在冲突 |

真正的竞争壁垒也不是“谁能出更多题”。大模型已经能够低成本生成大量问答数据,单纯扩充题库很容易被复制;高价值部分在于专家标注、任务设计、运行基础设施、版本管理,以及一套能让模型厂商和企业客户同时接受的审计规则。

中立不是一句口号,而是一套制度

Vals 要成为“黄金标准”,首先必须证明保密不等于黑箱。私有测试集可以减少污染,但如果外界不知道题目如何采集、难度如何分层、评分错误如何申诉,那么排行榜只是从厂商的黑箱换成评测公司的黑箱。

可信的中立评测至少需要四层约束:

  1. 数据中立要求题目来源可解释。 评测机构可以不公开完整题目,但应披露数据时间范围、领域分布、去重流程、人工审核比例和污染检测方法。
  2. 执行中立要求所有模型接受一致规则。 系统提示、推理预算、工具权限、超时限制和重试次数都应被记录,无法统一的项目必须单独标注。
  3. 报告中立要求失败结果同样可见。 除平均分外,还应公布置信区间、重复运行方差、拒答率、错误率、延迟和单位任务成本。
  4. 商业中立要求利益冲突可以被审计。 如果模型厂商既是被评对象又是付费客户,评测机构需要披露合作关系,并隔离商业团队与评分流程。

成本和延迟尤其不能继续充当榜单脚注。一个准确率高 2 个百分点、但平均响应时间从 2 秒增加到 20 秒且成本增长 5 倍的模型,未必更适合客服、搜索或实时智能体;反过来,一个总分略低但价格只有十分之一的轻量模型,可能才是企业部署中的合理选择。

模型版本也必须像软件版本一样被固定。线上模型可能在名称不变的情况下更新权重、路由策略和安全规则,因此评测报告需要记录测试日期、产品版本、区域、上下文窗口与运行配置,否则几个月后很难复现同一结论。

为什么这会成为一门新生意

企业采购正在把模型评测从研究问题变成财务问题。模型一旦进入医疗建议、金融分析、代码生成或客户服务流程,选错模型带来的不仅是回答质量下降,还可能是合规风险、工程返工和持续增加的推理成本。

企业真正需要的也不是一个永远不变的总榜冠军。金融团队关心表格解析、监管文本和数字一致性,代码团队关心仓库级修改和测试通过率,客服团队关心指令遵循、幻觉率与响应延迟;通用排行榜无法代替这些具体采购标准。

Vals 的商业机会因此来自持续评测,而不是一次性发榜。模型供应商每隔数周就可能更新产品,企业自己的知识库、工具和流程也在变化,评测必须像软件持续集成一样反复运行,监控模型升级后是否出现能力回退。

这种模式一旦建立,还可能形成数据网络效应。参与评测的企业越多,Vals 越容易积累行业失败案例和高价值任务;覆盖的模型越多,企业越愿意把它作为采购入口;而模型厂商为了进入企业候选名单,也会更主动地配合测试。

不过,评测公司的增长与其中立性天然存在冲突。如果主要收入来自模型厂商,Vals 可能面临放宽规则的压力;如果主要收入来自大型企业,基准又可能过度偏向少数客户的业务需求。信用评级行业过去出现过的“发行人付费”争议,同样可能在 AI 评测市场重演。

Vals 能不能成为标准,关键看三件事

第一,Vals 必须把可复现性做成产品能力。一次抓住某个模型榜单失真可以带来关注,但只有让第三方在受控环境中复核分数、让企业看到配置和误差范围,才能把关注转化成长期信任。

第二,Vals 必须从准确率走向系统级指标。未来真正有采购价值的评测,需要同时覆盖质量、成本、延迟、稳定性、安全性、工具调用成功率和长任务完成率,而不是把几十项能力压缩成一个看似精确的百分数。

第三,Vals 必须接受“评测机构也需要被评测”。题目质量、裁判模型偏差、专家标注一致性和商业利益冲突都应有外部审计机制,否则它很难成为行业公认标准,只会成为另一家掌握私有题库的排行榜公司。

判断:这是成立的机会,但不是轻松的生意

Vals 找到的是一个真实且正在扩大的产品缺口。模型数量增长、公开榜单失真和企业采购复杂化,让第三方评测第一次具备成为独立基础设施的条件;a16z 的支持则说明资本市场也开始把“谁来评价模型”视为与“谁来训练模型”不同的赛道。

Vals 目前最有价值的方向不是宣布哪款模型排名第一,而是建立一套厂商无法轻易操纵、企业能够持续使用的比较协议。只要模型公司仍然负责出题、答题和公布成绩,所谓领先就很难摆脱营销嫌疑。

但 Vals 距离“黄金标准”仍有明显距离。它需要公开更多方法细节、建立利益冲突规则、证明私有题库能够长期更新,并让每个分数同时携带成本、延迟、配置和置信区间;否则,中立层只是一个好听的定位。

模型评测可信度之所以成为新产品机会,是因为 AI 行业已经从“有没有能力”进入“能力是否真实、稳定且值得购买”的阶段。排行榜不会消失,但下一阶段真正重要的公司,可能不是制造最高分的公司,而是让这些分数重新值得相信的公司。

参考来源

本文事件信息主要依据 TechCrunch 2026 年 9 月 19 日报道及 Vals 官网公开结果整理;根据链接域名要求,以下仅保留可访问域名中的延伸技术资料。

相关推荐

查看全部