AI 快讯汤森路透首发大模型Thomson
模型上新

汤森路透首发大模型Thomson

2026-08-24T15:03:41.759Z
汤森路透首发大模型Thomson

汤森路透公布首款大语言模型 Thomson,基于阿里 Qwen3.5-397B 打造,整体研发投入约 4000 万美元。它在法律基准中接近全球顶级模型,但深度搜索能力仍落后于 GPT 系列。

汤森路透首发大模型 Thomson:基于 Qwen3.5-397B,研发投入约 4000 万美元

汤森路透近日正式公布首款大语言模型 Thomson,并披露这款模型的整体研发投入约为 4000 万美元,按 2026 年 8 月 24 日汇率计算约合 2.69 亿元人民币。此前外界流传的 45 万美元,并不是 Thomson 的完整研发成本,而只是最后一次训练的费用。

Thomson 是汤森路透面向法律、税务、新闻和专业信息服务场景打造的大语言模型。它的基础模型来自阿里巴巴千问,目前采用的版本为 Qwen3.5-397B。汤森路透并非简单地对开源模型进行领域微调,而是与帝国理工学院合作,对基础模型重新训练,再使用自有专业内容完成预训练、后训练,并在内部环境中进行强化学习。

这件事的真正看点,不只是又一家专业服务公司发布了自己的模型,而是 Thomson 代表了一条越来越清晰的路线:对于法律文档审查、合同分析、监管研究等高价值、强专业场景,企业未必需要从零训练一个基础模型,但也不愿意长期依赖 OpenAI、Anthropic 等闭源模型。基于强大的开放权重模型进行深度改造,可能是成本、可控性和专业效果之间更现实的折中方案。

汤森路透 Thomson 大模型与 Qwen3.5 基础模型关系示意图,突出法律文档、合同审查与专业知识库场景

Thomson 到底做了什么:不是换皮,而是面向专业领域重训

Thomson 是汤森路透基于开放基础模型重新训练、并针对专业内容和企业安全要求进行定制的大语言模型。与直接调用通用模型相比,它的核心差异在于训练数据、行为约束、后训练流程和部署控制权都掌握在汤森路透手中。

目前公开信息并未披露 Thomson 的最终参数规模、训练 token 数量、具体硬件集群或完整训练配方。因此,不能把 Thomson 直接等同于原始 Qwen3.5-397B-A17B,也不能据此推断汤森路透完整复刻了阿里千问的训练过程。已知信息是,Qwen3.5-397B 是 Thomson 的基础来源,汤森路透随后加入了自己的专业数据和训练流程。

汤森路透披露的改造过程大致分为四步:

  1. 基础模型重新训练:与帝国理工学院合作,让模型更符合安全、伦理和政治中立性要求。
  2. 专业内容预训练:加入汤森路透长期积累的法律、税务、监管、商业和新闻等内容。
  3. 后训练:通过指令数据和人类偏好数据,调整模型在专业问答、文档理解和任务执行中的行为。
  4. 内部强化学习:在汤森路透自己的工作环境和任务流程中继续优化,使模型更贴近实际业务,而不只是追求公开榜单分数。

这套流程与通用模型公司强调的“规模化预训练”不同。汤森路透真正拥有竞争力的部分,不一定是模型架构,而是专业语料、工作流数据、专家反馈和产品入口。对法律 AI 来说,一个模型是否能准确引用法规、区分司法辖区、识别合同责任边界,往往比它在通用数学题上的分数更重要。

4000 万美元投入,为什么不是一次训练就够了

汤森路透给出的 4000 万美元,是 Thomson 项目的整体研发投入,而不是单次 GPU 训练账单。这个数字通常应当包含基础设施、算力、数据处理、研究人员、模型评测、合规审查、产品集成和长期运维等成本。

45 万美元则只是最后一次训练成本。两者并不矛盾:大模型项目的主要成本往往不只发生在最终训练阶段。数据清洗和去重、版权审查、标注与专家反馈、实验性训练、失败的超参数组合、评测体系建设,以及将模型接入企业内部系统,都可能消耗大量预算。

| 成本口径 | 汤森路透披露数字 | 应如何理解 | |---|---:|---| | Thomson 项目整体研发投入 | 约 4000 万美元 | 包含研发、算力、数据、人员、评测和系统建设等综合成本 | | 最后一次训练成本 | 约 45 万美元 | 仅代表最终训练阶段的直接成本,不等于模型总成本 | | 折合人民币 | 约 2.69 亿元 | 按参考资料给出的现汇率估算 |

这个成本结构也解释了汤森路透为什么没有选择完全依赖外部闭源模型。调用闭源模型的前期门槛更低,但当模型每天处理大量法律文档、合同和企业检索任务时,推理费用会随着调用量持续增长;同时,企业很难改变模型的底层行为,也难以完全掌控数据边界和版本节奏。

但自研并不意味着一定更便宜。汤森路透需要承担训练失败、模型迭代、推理集群、数据合规和安全责任。它真正押注的不是“训练一个模型就能省钱”,而是通过长期使用量摊薄固定投入,并把模型能力沉淀为法律数据库、审查软件和专业工作流中的基础设施。

评测成绩:法律能力接近第一梯队,但不能只看排名

汤森路透称 Thomson 已跻身全球最佳 AI 模型之列。从目前公布的测试结果看,它在专业法律任务上确实具备很强竞争力,但“全球最佳”需要结合测试条件理解,不能简单解读为全面超越 GPT、Gemini 或 Claude。

| 评测项目 | Thomson 成绩 | 对比结果 | 需要注意的条件 | |---|---:|---|---| | Stanford LegalBench | 0.823 | 落后于 Gemini 3.1 Pro 和 GPT-5.5 | Thomson 使用了推理阶段扩展 | | Harvey Legal Agent Benchmark | 接近 Opus 4.8 | 仅略低于 Opus 4.8 | 更接近法律智能体实际任务 | | 深度搜索测试 | 0.53 | 低于 GPT-5.4 的 0.65 | 体现长链路检索与综合研究能力差距 |

LegalBench 是法律领域的重要评测集合,覆盖法律推理、规则理解、案例判断和文本分类等任务。Stanford LegalBench 得分 0.823,说明 Thomson 在法律语言理解和结构化推理方面已经达到很高水平。不过,该成绩不是在完全相同的推理配置下取得的:Thomson 使用了推理阶段扩展,而 GPT-5.5 参加比较时没有开启推理模式。

推理阶段扩展是指模型在输出最终答案前,投入更多计算资源进行多步分析、候选答案比较或结果验证。它类似于让分析师在交付报告前多做几轮核对,通常能提高复杂任务的准确率,但也会增加延迟和计算成本。没有披露统一推理预算时,单看最终分数并不能完全说明模型本身的能力差异。

Harvey Legal Agent Benchmark 的结果更值得关注。这个测试更加接近真实法律智能体:模型不只是回答一个问题,还需要理解任务、拆分步骤、检索材料、处理文档并形成结果。Thomson 仅略低于 Opus 4.8,说明汤森路透在专业工作流和法律任务适配上已经具备与顶尖闭源模型竞争的能力。

但深度搜索测试中,Thomson 得分为 0.53,GPT-5.4 为 0.65,差距达到 0.12,按 Thomson 的成绩计算约低 18.5%。这说明 Thomson 的优势更集中在专业文档处理和法律判断,而不是所有复杂智能体任务都处于第一名。深度搜索需要模型持续检索、交叉验证、发现矛盾、追溯来源,并在较长链路中保持结论一致性,这类能力对搜索工具、上下文管理和代理编排都提出了更高要求。

Qwen3.5-397B 为什么适合作为底座

Qwen3.5-397B-A17B 是阿里 Qwen3.5 系列的开放权重旗舰模型。该模型总参数量约 3970 亿,但每次前向传播实际激活约 170 亿参数,采用稀疏混合专家架构,并结合 Gated Delta Networks 等线性注意力机制,以降低大模型推理时的计算压力。

“397B-A17B”中的 397B 表示模型总参数规模,A17B 表示单次推理大约激活 170 亿参数。它并不是把 3970 亿参数全部用于每一个 token 的计算,而是根据输入内容选择部分专家参与处理。对企业来说,这种设计的价值在于:模型可以保留较大的容量,同时避免每一步都支付完整稠密模型的推理成本。

根据阿里公开信息,Qwen3.5-397B-A17B支持文本和视觉输入,语言与方言支持数量从 119 种扩展到 201 种,并在推理、编程、智能体和多模态理解等任务上进行优化。官方还称,该模型在 32K 和 256K 上下文长度下的解码吞吐量分别达到 Qwen3-Max 的 8.6 倍和 19 倍,性能保持相当;与 Qwen3-235B-A22B 相比,吞吐量分别提升至 3.5 倍和 7.2 倍。

这些能力对 Thomson 很有价值。法律和税务任务经常需要同时处理合同全文、法规条文、判例、注释和企业内部政策,长上下文、多文档理解和工具调用比普通聊天能力更重要。Qwen3.5 的开放权重属性,则让汤森路透可以在基础模型之外继续改变训练数据、行为规范和部署方式。

不过,基础模型强并不等于专业模型自动强。专业领域最难的部分包括版权可用性、法规时效性、不同司法辖区的差异、引用准确率、保密数据隔离和责任追踪。这些问题不能靠增加参数量一次解决,也不是通用基准分数高就能直接证明。

为什么不直接使用 OpenAI 或 Anthropic 的闭源模型

汤森路透给出的理由主要有两个:外部闭源模型的长期使用成本较高,以及企业无法对其进行足够自由的调整。

第一是成本。法律服务的调用并不是一次性问答,而可能是数百页文件的批量审查、持续的监管监测、多个代理并行检索和多轮结果复核。如果每项任务都通过外部模型完成,输入 token、输出 token、长上下文和推理模式都会形成持续支出。对于拥有大量企业客户的专业信息服务商,这种边际成本会直接影响产品毛利。

第二是可控性。法律模型需要明确的引用格式、严格的免责声明、稳定的政治和伦理边界,以及针对特定司法辖区的输出风格。闭源模型可以通过提示词和外部检索进行一定程度的控制,但基础行为、模型更新、拒答策略和数据处理方式仍由模型供应商决定。自有模型则可以更深入地融入汤森路透的数据库和软件产品。

但这不是“开放模型全面胜过闭源模型”。闭源模型在通用推理、深度搜索、工具生态、产品成熟度和模型迭代速度上仍然有明显优势。Thomson 的现实定位,更可能是让汤森路透掌握专业任务的核心控制面,同时在个别复杂任务上组合使用外部模型或其他专用模型。

Thomson 对法律 AI 市场意味着什么

Thomson 的发布说明,专业服务公司的模型竞争正在从“谁的参数更多”转向“谁能把模型嵌入真实工作流”。法律 AI 的竞争对象不再只是聊天机器人,而是合同审查、尽调、法规追踪、诉讼研究、税务分析和企业知识管理等完整流程。

汤森路透拥有 Westlaw、Practical Law 等专业信息资产,也拥有大量企业客户和律师工作场景。模型本身只是入口,真正能够形成壁垒的是“模型 + 权威数据 + 可追溯引用 + 专家审核 + 工作流软件”。如果 Thomson 能在回答中稳定给出正确、可验证、符合司法辖区的依据,它的商业价值就不需要建立在通用聊天能力的绝对领先上。

对于开发者而言,Thomson 还有三点值得观察:

  • 开放权重正在降低专业模型的起步门槛:企业不必从零训练基础模型,可以将预算集中在数据、后训练和业务评测上。
  • 领域数据的价值进一步上升:通用模型能力逐渐趋同后,真正拉开差距的是高质量专业语料、专家反馈和任务日志。
  • 评测条件必须透明:是否开启推理、使用了多少检索工具、上下文长度多大、是否允许人工修正,都会影响结果。没有统一测试协议,“超过某模型”往往只能作为营销信息,不能直接转化为采购结论。

OpenAI Hub 观点:这更像一次供应链重组,而不是简单的模型上新

我们认为,Thomson 最重要的意义不是“汤森路透也训练了一个大模型”,而是专业公司开始主动重组自己的 AI 供应链。

过去,企业通常在闭源模型之间选择:哪个模型效果更好,就接入哪个模型。但随着调用量增长,专业公司开始重新计算总成本、数据控制权、模型可解释性和长期议价能力。开放权重模型提供了一个中间选项:企业仍然可以使用顶级基础能力,但可以在安全、知识、风格和工作流上进行深度改造。

Thomson 的 4000 万美元投入也提醒市场,训练费用只是 AI 项目预算的一部分。专业模型的真正成本,往往分散在数据治理、专家标注、评测体系、基础设施和产品整合中。对于没有专业数据和业务入口的企业,照着汤森路透的路线投入 4000 万美元,未必能得到同样结果。

短期来看,Thomson 更适合被视为汤森路透专业软件体系的底层能力,而不是一个面向大众的通用聊天产品。它在 LegalBench 和法律智能体测试中已经展现出竞争力,但深度搜索测试仍落后于 GPT-5.4,且公开信息还不足以判断它在多模态、代码、长链路代理和大规模商业部署上的全面表现。

接下来最值得关注的不是 Thomson 在榜单上能否再前进几名,而是汤森路透是否会公开更多细节:模型是否开放权重、是否支持客户私有部署、如何处理法律引用和错误责任、推理成本是多少,以及它最终会怎样进入 Westlaw、Practical Law 等产品。只有当模型能力真正转化为更快的合同审查、更可靠的法规检索和更低的专业服务成本,Thomson 才算完成从技术项目到商业产品的跨越。

结论

汤森路透的 Thomson 是一款基于 Qwen3.5-397B 深度改造的专业大语言模型,整体研发投入约 4000 万美元,最后一次训练成本约 45 万美元。它在 Stanford LegalBench 上取得 0.823 分,在 Harvey Legal Agent Benchmark 中接近 Opus 4.8,但在深度搜索测试中以 0.53 低于 GPT-5.4 的 0.65。

这款模型的竞争力不在于证明开放模型已经全面击败闭源模型,而在于展示了一种更务实的企业 AI 路线:用开放基础模型获得能力上限,用自有专业数据和强化学习建立领域优势,再把模型嵌入已有的软件和信息服务体系。对法律、金融、医疗和咨询等行业来说,这可能比盲目训练一个“全能模型”更值得参考。

参考来源

相关推荐

查看全部