AI 快讯WPS AI登顶TableBench方法榜
行业快讯

WPS AI登顶TableBench方法榜

2026-07-22T13:05:28.639Z
WPS AI登顶TableBench方法榜

7月21日,WPS AI以72.54分升至TableBench方法榜第一,事实核验与数值推理均超过90分。这是其继SpreadsheetBench夺冠后,再次获得国际表格基准认可。

WPS AI拿下的,不只是一次表格跑分

WPS AI刚刚登上国际表格问答基准TableBench的方法榜第一。根据7月21日更新的榜单,金山办公旗下WPS AI获得72.54分,事实核验和数值推理两个分项均超过90分。

截至2026年7月22日,这是WPS AI近两个月内第二次在国际表格基准中拿到领先位置。今年6月,WPS AI表格Agent已经以73.46%的准确率登顶SpreadsheetBench全量榜单;这一次,评测重点从“能不能把电子表格任务做完”,转向了“能不能从表格中得到可信答案”。

这两个第一不能简单相加,但放在一起看,信号很明确:WPS AI正在把表格能力从单点功能,做成覆盖理解、操作、计算与核验的完整链路。

TableBench最新方法榜截图,突出WPS AI以72.54分位列第一,以及事实核验、数值推理超过90分

TableBench考的是回答是否可信

TableBench是一个面向表格问答能力的综合基准,主要评估AI能否理解结构化数据,并完成事实核验、数值推理、数据分析等任务。它不是让模型背诵表格里的某个单元格,而是要求模型理解行列关系、指标口径与计算条件,再给出可验证的结论。

表格问答是指AI根据一个或多个表格回答自然语言问题的能力。比如,用户问“华东区第二季度毛利率相比第一季度下降了多少个百分点”,系统不能只找到两个数字,还要识别季度、区域、收入和成本字段,计算毛利率,再处理“百分点”而不是“百分比”的口径。

TableBench设置了方法榜和大语言模型榜两个独立榜单,这个区分很重要。

  • **方法榜是评估完整解题方案的榜单。**参评方可以围绕模型加入表格解析、任务拆解、工具调用、结果校验等环节,成绩反映的是一整套系统方法,而不只是底层模型的裸能力。
  • **大语言模型榜是更侧重模型自身能力的榜单。**它主要用于观察不同模型在相对统一条件下处理表格问题的表现,减少外部工程流程带来的影响。

因此,WPS AI的72.54分不能被解读为某个基础模型在所有表格任务上的统一准确率。更准确的说法是:WPS AI采用的完整方法在TableBench当前评测规则下获得72.54分,并位列Methodology Leaderboard第一。

这一成绩的价值恰恰在于“方法榜”三个字。真实办公场景从来不是把一张干净的二维表直接塞给模型,而是涉及合并单元格、多级表头、隐藏行列、跨表引用、日期格式、空值和单位换算。基础模型再强,如果没有稳定的解析与校验流程,最后仍可能算对过程、答错口径。

两项超过90分,说明WPS AI补上了可靠性短板

事实核验是判断表格中的数据能否支持某个结论,并识别陈述与数据之间是否一致的能力。它对应的不是简单检索,而是“这个结论到底有没有数据依据”。

数值推理是根据表格数据进行计算、比较、排序、聚合和条件判断的能力。它通常涉及增长率、占比、平均值、差值、排名以及跨行列运算,是通用大模型在办公环境中最容易出现稳定性问题的环节之一。

WPS AI在事实核验和数值推理两个分项上均超过90分,说明它的优势并非只来自格式识别。至少在TableBench覆盖的任务中,这套方法能够较稳定地完成“找到正确数据—理解问题口径—执行计算—检查答案”这条链路。

这比生成一段看起来专业的分析更难。大模型擅长组织语言,但表格任务要求答案能够回到具体单元格、计算式和筛选条件上验证。一份经营报告中,把同比增长12%写成增长12个百分点,文字仍然通顺,业务结论却可能完全相反。

事实核验超过90分尤其值得关注,因为它直接关系到AI生成结论能否进入正式办公流程。表格Agent如果只能执行命令,最多是效率工具;如果还能验证结论与源数据是否一致,才有机会成为财务复核、经营分析和审计辅助环节的一部分。

不过,超过90分仍不意味着可以跳过人工检查。公开基准通常拥有明确问题、固定输入与可判定答案,而企业内部表格还存在字段定义不统一、数据版本冲突、权限缺失和业务规则未显式记录等问题。基准成绩证明了能力上限,却不能替代生产环境中的权限控制、引用追踪与责任确认。

TableBench与SpreadsheetBench不是同一场考试

SpreadsheetBench是一个面向真实电子表格操作任务的评测基准,重点考察AI能否根据自然语言要求修改并交付可用的电子表格文件。该基准源自2024年发表于NeurIPS相关研究体系的工作,收录了912个来自真实Excel论坛的问题。

TableBench更像是一场“读表、算表、判断结论”的考试,SpreadsheetBench则更像是一场“拿到文件后直接把活做完”的实操考试。前者重视问答和推理可信度,后者重视最终电子表格的修改结果。

两套基准的核心差异如下:

| 对比项 | TableBench | SpreadsheetBench | |---|---|---| | 核心任务 | 表格问答、事实核验、数值推理 | 真实电子表格操作与自动化 | | 主要输入 | 表格与自然语言问题 | 电子表格文件与操作指令 | | 主要输出 | 可核验的答案或分析结论 | 修改完成的电子表格 | | WPS AI最新公开成绩 | 方法榜72.54分 | Full 912准确率73.46% | | WPS AI突出分项 | 事实核验、数值推理均超过90分 | 完成复杂真实表格任务 | | 适合观察的能力 | 理解是否准确、推理是否可信 | 任务是否真正执行成功 |

WPS AI在两套基准上的成绩不能直接横向比较,因为72.54分与73.46%来自不同数据集、任务定义和计分规则。前者是TableBench方法榜综合得分,后者是SpreadsheetBench全量任务准确率,把两者当作同一指标会造成误读。

但两套成绩能够形成能力互证。SpreadsheetBench证明WPS AI可以操作复杂文件,TableBench则进一步检验它能否基于表格得出相对可靠的答案。对于表格Agent而言,只有“会做”和“算对”同时成立,产品才真正有用。

两个月两次登顶,WPS在表格赛道已经形成连续性

WPS AI此前已经在SpreadsheetBench上完成了一次更接近产品实战的验证。今年5月,金山办公自研的表格AI基座Qingqiu Agent在Verified 400专家精标榜单取得94.75%;6月,WPS AI表格Agent Seed 2.0又以73.46%的准确率登顶Full 912全量榜单。

SpreadsheetBench的Full 912包含912个真实场景任务,其中42.7%的表格采用非标准结构,35.7%涉及多张表格。任务还会出现颜色标记、跨工作表引用以及复杂格式,这些因素都不是普通文本模型擅长处理的对象。

WPS AI的73.46%还超过了该基准论文给出的人类Excel专家基线71.33%,领先2.13个百分点,按相对幅度计算约高2.99%。这并不等于AI已经全面超过人类表格专家,但至少说明在固定任务集和统一评测规则下,Agent可以达到非常有竞争力的完成率。

Verified 400的94.75%与Full 912的73.46%也不能直接对比。前者是经过专家精细标注的400项任务,后者覆盖全部912项任务,数据范围与难度构成都不同;分数下降不代表产品退步,而是测试集合发生了变化。

| 时间 | 评测基准 | 榜单或数据集 | WPS AI成绩 | 主要意义 | |---|---|---|---:|---| | 2026年5月 | SpreadsheetBench | Verified 400 | 94.75% | 基座能力在专家精标任务中领先 | | 2026年6月 | SpreadsheetBench | Full 912 | 73.46% | 全量真实任务第一,超过71.33%人类基线 | | 2026年7月21日 | TableBench | Methodology Leaderboard | 72.54分 | 表格问答方法榜第一 | | 2026年7月21日 | TableBench | 事实核验、数值推理分项 | 均超过90分 | 可靠性与计算能力得到进一步验证 |

连续登顶比一次高分更有说服力,因为两套基准考察了不同能力侧面。单一榜单容易被特定任务分布、提示词策略或评测规则放大,而跨基准保持领先,至少说明WPS的优势不是押中了一组题。

真正的竞争点已经从模型转向系统工程

表格Agent是能够理解用户意图、读取电子表格、规划操作步骤并交付结果的办公智能体。它与传统表格助手的区别,在于用户不必逐项指定函数和单元格,而可以直接描述业务目标。

复杂表格任务很难只靠一个大语言模型端到端完成。一个稳定系统通常需要处理文件解析、结构识别、公式生成、计算执行、异常检测、结果验证和文件写回,其中任何一环失误,都可能导致最终答案错误。

这也是WPS AI登顶方法榜比登顶纯模型榜更符合金山办公定位的原因。金山办公拥有WPS表格产品、文档格式处理经验与大量真实办公场景,它最有价值的资产并不是再训练一个通用聊天模型,而是把模型能力嵌入电子表格的计算和编辑环境。

与OpenAI、Google、Microsoft、Anthropic等公司相比,WPS的通用基础模型声量并不占优,但在中文办公软件和表格产品闭环上拥有更短路径。用户提出任务后,系统能够直接读取当前工作簿、执行修改并返回文件,这类产品集成能力往往比单纯增加模型参数更重要。

方法榜也意味着竞争门槛正在变化。未来表格AI的差距未必主要来自谁的模型能多做几道数学题,而会来自谁能更准确地识别脏数据、保留原有格式、追踪公式引用、发现异常结果,并让用户知道每个结论是怎么算出来的。

榜单第一距离企业落地仍有三道关

基准领先并不自动等于产品体验领先。WPS AI接下来仍需要在可解释性、复杂文件稳定性和企业治理三个方面证明自己。

第一道关是结果可追溯。企业用户不仅需要一句答案,还需要看到引用了哪些工作表、哪些单元格、采用了什么公式,以及中间是否排除了空值和异常值。没有证据链的正确答案,很难进入财务和审计流程。

第二道关是长流程稳定性。一次筛选或求和可以靠局部能力完成,但真实任务往往包含十几步操作,例如导入数据、清洗字段、建立透视表、计算指标、生成图表并回填报告。单步准确率即使很高,连续执行后仍可能发生误差累积。

第三道关是权限与数据边界。表格往往包含客户名单、员工薪酬、经营数据与未公开财务信息,企业部署时需要明确数据存储位置、访问权限、日志留存和模型使用边界。这些能力不会出现在TableBench分数里,却会直接决定采购决策。

WPS AI这次领先,有含金量但不宜神化

WPS AI以72.54分登顶TableBench方法榜,是一次有含金量的国际基准成绩。事实核验与数值推理均超过90分,说明其表格能力已经不止于生成公式或整理格式,而是开始触及办公AI最关键的可靠性问题。

这次成绩也应被放在正确范围内理解。它证明的是WPS AI方法在当前TableBench评测中的领先,不代表其在所有真实企业数据、所有语言和所有复杂工作簿上都能保持同等水平,更不代表表格分析可以彻底取消人工复核。

更值得重视的是,WPS已经连续在SpreadsheetBench和TableBench两类基准上取得领先。前者考“把表做出来”,后者考“把答案算明白”,两者合在一起,勾勒出下一代表格Agent的基本形态:既是操作员,也是分析员,还要承担第一层核验工作。

对于金山办公而言,榜单第一只是技术证明,接下来真正决定竞争结果的,是这些能力能否稳定进入WPS表格的日常工作流。如果普通用户无需学习复杂提示词,也能让AI在保留格式与公式关系的前提下完成分析,并为每个结论提供清晰证据,那么这次登顶才会从跑分优势转化为产品优势。

参考来源

相关推荐

查看全部