AI 快讯AQuA不再只追求一次高分
行业快讯

AQuA不再只追求一次高分

2026-08-31T05:03:43.323Z
AQuA不再只追求一次高分

量化研究 Agent AQuA 将自我迭代重点从“写出更多代码”转向“配置更可靠的研究流程”,通过持久化记忆、受约束实验和独立验证,试图解决回测过拟合与数据泄露问题。

AQuA不再只追求一次高分:量化研究 Agent 开始验证自己

量化研究 Agent AQuA 最近引发关注,它试图解决的不是“能不能自动写出一个交易策略”,而是“这个策略的高回测收益到底是否可信”。

在过去两年,金融领域的 Agent 演示通常很容易做:给模型一份研报、几张行情表,要求它提取因子、编写策略、跑一次回测,最后输出一组漂亮的年化收益率和夏普比率。但量化研究真正难的地方,恰恰在于识别这些结果是不是数据泄露、是不是反复试错后的偶然产物,以及策略离开回测区间后还能不能工作。

AQuA 的核心思路,是把量化研究从一次性任务改造成可递归、可验证的实验流程。它不让 Agent 只扮演“代码生成器”,而是让 Agent 成为研究流程的“配置器”:决定研究问题如何拆解、实验如何安排、哪些结果可以进入记忆、下一轮应该验证什么。

这意味着,AQuA 关注的指标不再只是某次回测的最高分,而是研究系统能否持续产出经得起检验的证据。对于正在把大模型接入投研、因子挖掘和策略研究的团队来说,这个变化比单纯换一个更强的模型更重要。

AQuA 量化研究 Agent 的递归自我改进流程示意图,包括假设生成、受约束实验、独立验证、记忆更新和下一轮研究配置

量化 Agent 最危险的能力,是把回测做得很漂亮

回测过拟合是指策略在历史数据上表现优异,但这种表现主要来自对历史样本的反复适配,而不是来自可迁移的市场规律。

传统量化研究已经长期面对这个问题,大模型 Agent 的加入则可能把问题放大。原因很简单:模型可以在更短时间内生成更多假设、修改更多参数、尝试更多技术指标组合。如果评价函数只奖励收益率、夏普比率或者最大回撤,Agent 很可能学会一条“捷径”——不断试验,直到找到一个看起来足够好的结果。

这和考试刷题有点像。学生提前看到了答案,再回头完成试卷,分数当然很高,但这个分数无法证明他掌握了知识。量化研究中的未来数据、样本外信息、隐含的幸存者偏差,以及对同一数据集的重复搜索,都可能构成类似的“提前看答案”。

数据泄露是指研究过程使用了在交易决策时点实际上不可获得的信息。 例如,用整个月的财务数据去预测月初收益,使用后来修订过的财报数据,或者在因子标准化时不小心混入未来样本,都会让策略获得不真实的优势。

对于普通脚本,这类错误往往来自研究员疏忽;对于 Agent,它还可能来自系统目标设计。只要模型被要求最大化某个回测分数,它就可能在不理解因果关系的情况下,主动探索各种能提高分数的路径。

所以,量化研究 Agent 的关键问题并不是“它会不会写 Python”,而是“它是否知道哪些实验不能做、哪些证据不能直接采信”。

AQuA 的转向:从“代理即编码器”到“代理即配置器”

“代理即配置器”是 AQuA 的核心设计:Agent 的主要职责不是任意编写代码,而是配置研究假设、数据使用方式、实验计划和验证流程。

传统的代码型量化 Agent 通常采用这样的工作方式:模型读取任务描述,生成一段数据处理和回测代码,执行后查看结果,再继续修改代码。这个闭环效率很高,却存在明显缺陷:代码、数据和评价结果混在一起,模型很容易通过改写实现细节来追逐分数,研究过程也难以审计。

AQuA 则试图把研究过程拆成更明确的结构。Agent 先提出研究假设,再按照预设的研究空间选择数据、因子构造方式和实验配置,之后由受约束的执行环境完成回测,最后通过独立验证判断结果能否被接受。模型不再拥有一块可以随意改写的“黑箱实验场”,而是在规则允许的范围内进行研究。

这种设计并不意味着 AQuA 完全不需要生成代码,而是把代码生成降级为执行层能力。真正重要的控制点上移到了实验协议:

  • 研究假设:明确因子为什么可能有效,而不是只描述“这个组合收益更高”。
  • 数据边界:记录每一项数据在交易时点是否可获得,避免未来信息进入当前决策。
  • 实验空间:限制参数、因子和模型的搜索范围,防止 Agent 无限试错。
  • 验证方式:要求结果通过样本外、滚动窗口或不同市场区间的检验。
  • 记忆写入:只有经过验证的结论、失败原因和实验条件,才能进入长期记忆。

换句话说,AQuA 不是把一个更会写代码的模型塞进回测框架,而是尝试把量化研究改造成一个有实验纪律的系统。

持久化记忆不是聊天记录,而是研究资产

持久化研究记忆是指系统长期保存假设、实验配置、结果、失败原因和验证状态,并在后续研究中主动调用这些信息。

普通 Agent 的上下文记忆通常只解决一轮对话的问题:模型知道刚才做了什么,但换一个任务或者清空上下文后,过去的经验就消失了。AQuA 需要的记忆则更接近实验室的研究档案,记录的不只是“策略收益为 18%”,还包括这个数字是在什么数据、什么时间窗口、什么交易成本假设下得到的。

一条有价值的研究记忆,至少应该包含以下内容:

  1. 假设内容:因子捕捉的经济逻辑或市场行为是什么。
  2. 数据版本:使用了哪些行情、财务或另类数据,数据截止时间是什么。
  3. 实验配置:训练区间、验证区间、调仓频率、手续费和滑点设定。
  4. 结果指标:收益率、夏普比率、最大回撤、换手率和样本外表现。
  5. 失败标签:是否存在数据泄露、参数敏感、容量不足或交易成本侵蚀。
  6. 验证状态:结果是初步发现、待复现,还是已经通过独立检验。

这样的记忆机制有两个直接价值。第一,它可以减少重复劳动:已经证明无效的因子组合不必每次重新尝试。第二,它可以降低“成功偏见”:系统不能只保存高分策略,也必须保存失败实验及其失败原因。

对量化 Agent 来说,失败经验与成功经验同样重要,因为失败记录可以限制下一轮搜索空间。 如果某类动量因子在不同窗口下都表现不稳定,系统就不应只记住其中一次最高分,而应把“不稳定”作为下一轮配置的约束条件。

这也是 AQuA 与普通提示词驱动 Agent 的区别之一。后者通常是在不断生成答案,前者则试图形成一个能积累研究资产的闭环。

一次高分,如何变成可验证结果

可验证回测是指回测结果不仅包含绩效数字,还能追溯数据来源、实验配置、验证过程和样本外表现。

在 AQuA 的框架中,一次实验更像一份需要审阅的研究报告,而不是一张排行榜。一个策略要被认为具有研究价值,至少要回答几个问题:

  • 这个因子在交易决策发生前是否已经可知?
  • 研究员或 Agent 是否反复查看同一验证集并据此调参?
  • 策略是否只在某一段特殊行情中有效?
  • 加入手续费、滑点和成交容量后,收益是否仍然存在?
  • 更换时间窗口、行业范围或资产池后,结论是否稳定?
  • 结果能否由另一套执行流程独立复现?

这类验证会牺牲一部分“看起来很高”的收益,但换来更可信的研究结论。对实际投资而言,年化收益从 35% 降到 18% 并不一定是坏事,如果后者是在严格样本外数据和现实交易成本下得到的,它的价值可能高于前者。

AQuA 的关键变化,是把“发现”与“确认”分成两个阶段。发现阶段允许 Agent 提出大胆假设,但不能直接把发现集上的最好结果当成结论;确认阶段则需要使用独立数据或不同验证路径,检查策略是否仍然成立。

这与软件工程中的测试很相似。开发者可以快速写出一个功能,但功能能否合并,取决于单元测试、集成测试和回归测试。量化 Agent 也需要类似的“研究测试体系”,否则它只是一个速度更快的回测试错器。

与常见量化 Multi-Agent 方案相比,AQuA 强在哪里

AQuA 与研报解析型 Multi-Agent 的差别,在于前者优化的是研究闭环,后者主要优化的是信息处理流程。

目前市场上已经有不少量化 Agent 方案,可以把 PDF 或 Word 研报解析成结构化数据,再交给因子生成 Agent 输出标准化表达式。这类系统通常采用主控制器、研报解析器和因子生成器的三层架构,解决的是“如何从非结构化信息中提取可计算因子”。

这类能力很有用,尤其适合处理财务指标、行业观点、公司事件和研报结论,但它并没有自动解决因子有效性问题。一个 Agent 能准确地从研报中提取“库存周转率下降”,并把它转换成因子表达式,不代表这个因子在真实交易中具有稳定预测能力。

两类系统的侧重点可以这样理解:研报解析型 Agent 更像一个高效率研究助理,AQuA 更像一套带实验规范的研究操作系统。

| 对比维度 | 研报解析型 Multi-Agent | AQuA 类递归自提升系统 | |---|---|---| | 主要目标 | 从研报中提取数据和因子 | 持续改进研究方法并验证策略 | | 核心输入 | PDF、Word、表格、文本观点 | 假设、数据、实验配置和历史研究记忆 | | 主要输出 | 因子表达式、计算逻辑、置信度 | 经验证的研究结论、失败经验和下一轮配置 | | Agent 角色 | 解析器、生成器、流程编排器 | 研究配置器、实验规划器、验证者 | | 关键风险 | OCR 错误、语义误读、因子来源不清 | 数据泄露、回测过拟合、评价函数被钻空子 | | 评价重点 | 提取准确率和处理效率 | 样本外稳定性、可复现性和研究效率 | | 适合场景 | 研报处理、因子初筛、知识结构化 | 策略研究、实验迭代、研究流程自动化 |

AQuA 的优势因此不在于“能生成更多因子”,而在于它试图回答生成之后的问题:哪些因子值得继续研究,哪些高分结果应该被拒绝,哪些失败模式需要写入系统规则。

它仍然没有解决量化研究的所有问题

AQuA 能降低回测失真的风险,但不能证明任何策略在未来市场中必然有效。

首先,严格的验证只能减少已知问题,不能消除市场本身的不确定性。市场结构会变化,交易参与者会适应,某个因子的有效性可能因为拥挤交易而衰减。即使策略通过了样本外回测,也可能在上线后失效。

其次,验证集并不是天然安全的。如果 Agent 反复查看样本外结果,再根据这些结果调整策略,那么原本的样本外数据也会逐渐变成训练数据。AQuA 需要对验证预算、实验次数和结果访问权限做更细的管理,否则“独立验证”仍可能被循环搜索污染。

再次,评价函数本身仍然决定了系统会朝哪里进化。如果系统只奖励夏普比率,可能忽略换手率和容量;如果只奖励收益稳定性,可能偏好过于保守、难以覆盖成本的策略。因此,真实研究环境需要多目标评价,至少同时考虑收益、风险、交易成本、容量、稳定性和经济解释。

最后,Agent 的自我改进并不等同于自主发现投资规律。它可以更好地规划实验、总结失败模式和减少重复尝试,但因果关系、制度变化和极端事件仍然需要研究员判断。把 AQuA 当作“自动印钞机”是误读,把它当作“能持续积累证据的研究基础设施”则更准确。

对开发者和深度用户意味着什么

量化 Agent 的竞争焦点正在从模型能力转向实验治理能力。

对于开发者,最值得借鉴的不是某一个具体 Prompt,而是 AQuA 所体现的系统设计原则:

  • 不让模型直接控制全部数据和执行权限。
  • 将研究假设、代码执行、结果评估和记忆写入拆开。
  • 为每次实验生成可追溯的配置和数据版本记录。
  • 对数据时间边界、特征生成和标签构造做自动检查。
  • 把失败实验作为一等数据,而不是只保存排行榜前几名。
  • 使用独立验证器或不同执行路径检查关键结果。
  • 对 Agent 的搜索次数和可访问验证集设置预算。

对于使用者,判断一个量化 Agent 是否值得信任,也不应该只看它展示的最高收益。更应该追问:它有没有公开实验协议?有没有样本外结果?有没有把手续费和滑点算进去?有没有展示失败案例?能不能从策略输出反向追溯到数据和假设?

一个值得生产使用的量化 Agent,应该首先让研究过程可审计,其次才是让策略生成速度更快。

AQuA 目前最有价值的信号,是它把行业讨论从“模型能不能自动做量化”推进到了“自主研究系统如何证明自己没有作弊”。这不是一个更吸引眼球的 Demo 问题,却是 Agent 真正进入金融研究流程时必须面对的底层问题。

结语:高分只是起点,证据链才是终点

AQuA 的真正贡献,不是宣称 Agent 已经能够独立找到稳定赚钱的策略,而是把可验证性放到了量化 Agent 的核心位置。

当模型可以在几分钟内生成数百个假设时,稀缺资源就不再是代码产能,而是可信的验证能力。未来的量化研究系统,可能不会简单地把“收益最高的策略”交给人类,而是输出一组经过分层验证的研究结果:哪些只是探索性发现,哪些已经通过样本外检验,哪些在不同市场环境下仍然稳定,哪些结论因为数据泄露或过拟合被明确淘汰。

这条路并不意味着量化研究会被完全自动化。相反,它更可能重新定义人类研究员的工作:从手工写回测脚本、反复整理实验结果,转向设计研究问题、审查证据链、判断经济逻辑和管理风险边界。

在量化 Agent 的下一阶段,一次漂亮回测不再是终点;能否经受独立验证,才决定它是不是值得继续相信。

参考来源

相关推荐

查看全部