AI 快讯OceanBase登顶Data Agent榜单
行业快讯

OceanBase登顶Data Agent榜单

2026-09-21T12:06:04.533Z
OceanBase登顶Data Agent榜单

OceanBase团队提交的Data Agent方案以90.62%的准确率登顶国际Data Agent Benchmark,首次突破90%大关,并超过多项基于GPT、Claude的方案。数据库智能体正在从“能写SQL”进入“能完成数据任务”的实测竞争阶段。

OceanBase登顶Data Agent榜单,数据库智能体进入实测竞争阶段

OceanBase团队提交的Data Agent方案近日以 90.62%的准确率 登顶国际数据智能体基准 Data Agent Benchmark(DAB),成为该榜单首个准确率突破90%的参评方案。

这次成绩的看点不只是国产数据库拿到了第一名,更在于它击败了多项基于 GPT、Claude Opus、Claude Fable 等海外模型构建的方案。OceanBase方案内部代号为 Scout,底层采用国产大模型 GLM-5.2,相关能力后续将融入 OceanBase DataPilot。

OceanBase Data Agent登顶DAB榜单的示意图,展示数据理解、任务规划、查询执行和结果验证四个环节

这不是一次普通的Text-to-SQL比赛

Data Agent是能够理解数据环境、规划分析路径、执行计算并验证结果的数据智能体。 它和传统的Text-to-SQL系统并不是一回事:后者主要考察模型能否把一句自然语言转换成一条可执行SQL,而Data Agent要解决的是一项更完整的数据分析任务。

用户可能只会提出一句模糊的问题,例如“分析过去三年不同地区客户流失率的变化,并找出增长最快的产品线”。对一个真正的数据智能体来说,任务至少包含几步:先理解数据库里有哪些表、字段代表什么,判断哪些字段可以关联,再决定使用哪种查询和计算路径,最后还要检查结果是否合理。

DAB的价值正在于,它把评测重点从“SQL写得像不像”推进到了“答案到底对不对”。在真实企业环境中,最难的往往不是写出一条语法正确的查询,而是确定应该查哪些数据、怎样处理口径差异、如何避免关联重复,以及如何证明最终数字没有算错。

据公开资料,DAB覆盖互联网与本地生活、金融股票、生物医学、知识产权、企业运营、政务公共管理、媒体文娱等多个领域,并涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等不同数据库。这意味着参评系统面对的不是结构统一、字段命名规范的实验数据,而是更接近真实业务的数据环境。

90.62%意味着什么

90.62%的成绩意味着OceanBase方案首次把数据库智能体的准确率推过了90%这一重要门槛。 对于需要多步推理、跨表关联和结果校验的任务来说,超过90%并不等同于“已经可以完全替代分析师”,但它说明数据智能体正在从演示型产品走向可以被系统性比较的工程产品。

从横向比较看,OceanBase方案的特殊之处在于,它不是单独展示某个大模型的推理能力,而是由数据库、智能体框架和底层模型共同完成任务。公开报道显示,Scout采用GLM-5.2作为底层模型,最终超过了若干使用GPT、Claude Opus和Claude Fable的Data Agent方案。

| 对比维度 | OceanBase Scout | 传统Text-to-SQL | 通用大模型数据分析方案 | |---|---|---|---| | 核心目标 | 完成复杂数据分析任务并验证答案 | 将自然语言转换为SQL | 根据上下文生成分析结果 | | 主要能力 | 数据理解、路径规划、查询执行、证据追踪、结果校验 | SQL生成与格式修正 | 通用推理、代码生成或表格分析 | | 数据环境 | 多领域、多数据库、多表关系 | 通常是结构清晰的单一数据库 | 依赖上传文件、连接器或外部数据系统 | | 结果校验 | 具备证据追踪和答案复核机制 | 通常较弱,执行成功不等于答案正确 | 依赖模型自检,容易出现“看似合理”的错误 | | 本次公开成绩 | 90.62%,DAB第一 | 缺少同口径数据 | 不同方案和榜单难以直接比较 |

需要强调的是,不同榜单的准确率不能直接横向等同。DAB的90.62%并不意味着OceanBase在所有数据库任务、所有企业数据和所有模型场景中都能保持同样表现,但它至少提供了一个相对明确的信号:数据库厂商已经开始把“智能体能不能把数据用起来”作为产品能力,而不只是把自然语言入口加在数据库前面。

OceanBase的方案,核心不在模型而在闭环

OceanBase Scout采用的是“数据理解—规划执行—验证修复”的闭环,而不是一次性生成SQL。 这也是它能够在复杂数据任务中取得高分的关键。

第一步是建立数据画像。系统通过 DataLens 等能力识别数据库中的表、字段、字段含义和数据关系,尝试理解不同数据对象之间的关联。对企业数据来说,这一步比生成SQL更重要,因为很多数据库中的字段名称并不直观,表之间也未必存在清晰的外键关系。

第二步是进行任务规划。系统会根据问题复杂程度判断应该直接查询、分步计算,还是先进行数据探索再执行正式分析。如果问题涉及多个业务口径,智能体需要拆分任务,分别得到中间结果,然后再进行关联和汇总。

第三步是执行数据操作。智能体需要完成数据选择、筛选、关联、聚合和计算,同时处理不同数据库类型带来的语法和能力差异。这使得系统不能只依赖一个固定的SQL模板,而需要根据具体数据环境选择执行方式。

第四步是验证结果。系统会保留证据链,追踪结果来自哪些数据、经过了哪些计算,并对答案进行校验。如果中间结果异常,或者最终数字与数据分布不一致,智能体需要重新调整执行路径,而不是把第一次生成的答案直接交给用户。

这个流程可以类比为一名经验丰富的数据分析师:他不会在听到问题后立刻打开编辑器写SQL,而是先确认数据在哪里、指标如何定义、表之间怎么关联,再逐步计算并检查结果。区别在于,Data Agent需要把这种经验固化成可执行的系统流程。

数据库正在成为Agent的“工作环境”

AI时代的数据库不再只是存储和查询数据的后台组件,而正在成为智能体理解、操作和验证企业数据的工作环境。 这也是OceanBase从分布式数据库向AI数据平台演进的一个缩影。

过去,企业通常把数据库、搜索引擎、向量数据库、数据湖和报表系统分别部署,再通过应用层代码把它们串起来。这样的架构能够覆盖不同业务需求,但也带来了数据复制、权限同步、事务一致性和运维复杂度等问题。

当智能体加入之后,问题会进一步放大。一个用户问题可能同时涉及结构化交易数据、文本知识、历史文档和实时指标。智能体不仅要找到相关信息,还要保证不同系统里的数据版本、权限范围和计算口径一致。如果数据系统之间缺乏统一的上下文,模型就可能在不同来源之间拼接出一个逻辑上完整、实际上错误的答案。

OceanBase目前对AI数据库的产品定位,正是试图把结构化、半结构化和非结构化数据放到更统一的底座中,并在同一引擎内提供标量、JSON、全文、向量和多模态数据的存储与检索能力。对于Data Agent来说,数据库不只是“被调用的地方”,还需要提供数据发现、权限控制、计算执行、记忆管理和结果追溯等基础能力。

这也是DataPilot值得关注的原因。按照公开信息,Scout相关能力后续将沉淀到DataPilot,用于经营分析、业务决策和企业数据问答等场景。产品真正的价值,不在于让业务人员偶尔生成一条SQL,而在于让他们可以围绕一个业务问题持续追问、修改口径、查看证据并得到可复用的分析结果。

“模型+Agent+数据库”成为新的竞争单位

Data Agent的实际效果取决于模型、智能体框架和数据系统三者的协同,而不是由底层模型单独决定。 这会改变数据库厂商和大模型厂商的竞争方式。

模型负责语言理解、推理和计划生成,但模型本身并不知道企业数据库中的字段含义,也无法天然保证计算结果准确。Agent负责拆解任务、调用工具和处理异常,但如果数据系统无法提供清晰的元数据、稳定的执行能力和可追踪的证据,Agent也只能在不完整的信息上做推测。数据库则负责数据存储和计算,但如果缺少面向智能体的语义层和反馈机制,也很难支撑复杂的自然语言任务。

因此,未来数据库智能体的比较,可能会从“哪个模型参数更大”转向以下几个问题:

  • 能否准确识别企业数据中的真实语义,而不是只依赖字段名称?
  • 能否在多表、多库和异构数据之间建立正确关联?
  • 能否处理指标口径冲突、缺失值、重复记录和时间范围问题?
  • 能否把每个结论对应到具体数据和计算过程?
  • 能否在发现错误后自动修正,而不是重复生成相同答案?
  • 能否在权限、成本和延迟约束下稳定运行?

这几项能力都不是单纯扩大模型规模就能解决的。它们需要数据库元数据、查询优化器、数据治理、权限系统和Agent编排框架共同参与。OceanBase此次登顶,至少证明数据库厂商在这条路线上的系统工程能力已经开始显现。

这次登顶仍然不是企业落地的终点

DAB第一名是一个重要的工程信号,但不能直接等同于DataPilot已经解决了企业级数据分析的全部问题。 评测榜单能够衡量方案在固定任务集上的表现,却无法完全覆盖企业真实环境中的数据权限、实时性、稳定性和责任追溯要求。

企业落地时,最常见的难题包括数据资产质量不高、指标定义不统一、历史系统缺少元数据、跨部门权限复杂,以及查询成本不可控。一个智能体即使在公开基准上准确率达到90.62%,也可能因为企业内部表结构混乱、数据更新延迟或业务规则没有显式记录,而在实际使用中表现下降。

另外,准确率也不是唯一指标。对于金融、政务和医疗等场景,系统还需要提供可解释证据、权限隔离、审计日志和失败兜底。一个能够回答问题但无法说明数据来源的智能体,很难直接进入核心生产流程。

延迟与成本同样重要。复杂任务通常需要多次数据探索、查询执行和结果验证。如果一次问题需要连续调用多个工具,用户等待时间和数据库资源消耗都会上升。真正成熟的Data Agent,需要在准确率、响应速度、查询成本和安全边界之间找到平衡。

国产数据库竞争进入“可测量”阶段

OceanBase此次登顶的最大意义,是把国产数据库的AI能力从产品叙事带到了可公开比较的实测阶段。 过去,数据库厂商谈AI,常见表达集中在向量检索、自然语言查询和知识库连接;如今,行业开始追问更具体的问题:在统一基准上到底能答对多少,面对复杂任务会不会走错路径,结果能不能被验证。

对OceanBase而言,GLM-5.2与OceanBase数据库的组合拿到DAB第一,说明国产模型和国产数据基础设施之间存在进一步协同的空间。对大模型厂商而言,这也意味着数据库智能体可能成为模型落地企业场景的重要试验场。对开发者来说,未来真正值得关注的不是某个产品是否“支持AI”,而是它能否把数据发现、任务规划、查询执行和结果验证打通。

数据库智能体的竞争才刚刚开始。随着更多厂商提交方案、更多真实数据集开放,榜单上的第一名可能会变化,但评价标准已经发生改变:从“能不能生成一条SQL”,转向“能不能在真实数据环境中可靠地完成一项任务”。OceanBase这次90.62%的成绩,正是这个新阶段的一个明确标志。

参考来源

  1. 知乎:Agent落地,数据库先变 —— 介绍OceanBase DataPilot面向经营分析和业务决策的数据智能体定位,以及数据库在Agent落地中的作用。
  2. Hugging Face —— DABstep及数据智能体评测相关公开资料的模型与数据社区入口,可用于关注后续榜单和评测进展。

相关推荐

查看全部