AI 快讯4B模型把GPT-5.6搜索成本打到1%
模型上新

4B模型把GPT-5.6搜索成本打到1%

2026-08-07T07:04:37.811Z
4B模型把GPT-5.6搜索成本打到1%

Neon与Castform开源一款4B检索模型,在自建文档搜索评估中以1.447分超过GPT-5.6 Sol,单次推理成本约为后者的1/100。但这仍是垂直任务结果,不代表通用能力反超。

4B模型把GPT-5.6搜索成本打到1%

Neon 与 Castform 在 8 月 6 日披露了一套面向文档检索的强化学习后训练方案,并开源了一款仅有 40 亿参数的检索模型。按照两家公司公布的内部评估结果,这款模型取得 1.447 的平均分,高于 GPT-5.6 Sol 的 1.369 和 GPT-5.4 的 1.377;其单次推理成本则约为 GPT-5.6 Sol 的 1/100。

这不是一个“4B 小模型全面击败旗舰大模型”的故事,而是一次典型的垂直任务压缩:让参数更少的模型只学习如何搜索、如何选择文档以及如何引用正确段落,而不是要求它同时承担开放式写作、代码生成、复杂数学和通用推理。对正在搭建企业知识库与 AI 智能体的开发者来说,这种结果可能比又一个通用跑分冠军更有实际价值。

Neon与Castform的4B检索模型、GPT-5.6 Sol和GPT-5.4在文档搜索得分及单次成本上的对比图

1.447 分超过 Sol,但“超过”有明确边界

**检索模型是专门负责提出搜索查询、筛选候选文档并定位证据的模型。**它通常处在 AI 智能体与数据库之间,决定智能体应该查什么、下一步继续查什么,以及哪些段落足以支撑最终答案。

Neon 此次公布的核心数据很直接:经 Castform 后训练的 4B 模型平均评估分为 1.447,GPT-5.6 Sol 为 1.369,GPT-5.4 为 1.377。以 Sol 为基准,4B 模型高出 0.078 分,相对增幅约为 5.70%;相较 GPT-5.4,它高出 0.070 分,相对增幅约为 5.08%。

| 模型 | 参数规模 | 文档搜索平均分 | 与4B模型的分差 | 单次搜索成本 | 定位 | |---|---:|---:|---:|---:|---| | Neon × Castform 后训练模型 | 4B | 1.447 | — | 约 0.0003 美元(按1/100口径推算) | 专用文档检索 | | GPT-5.6 Sol | 未公开 | 1.369 | -0.078 | 约 0.03 美元 | 旗舰通用推理模型 | | GPT-5.4 | 未公开 | 1.377 | -0.070 | 本次未披露 | 通用模型对照组 |

这组数字只能证明该模型在 Neon 设置的文档搜索任务中表现更好,不能推出其通用能力超过 GPT-5.6 Sol。Neon 没有在本次材料中完整披露评估集规模、问题类别占比、评分区间、统计方差和人工评分一致性,因此 1.447 与 1.369 之间的差距究竟有多稳定,仍需要独立复现。

这个限制非常关键。一个针对固定文档结构和搜索工具训练过的 4B 模型,就像熟悉仓库货架的拣货员;GPT-5.6 Sol 则更像能够处理多种任务的高级顾问。前者在“从指定仓库找到指定商品”上更快、更便宜,并不意味着它在仓库之外也更聪明。

真正值得关注的是成本,而不是标题里的“击败GPT”

**单次推理成本是模型完成一次完整搜索任务所消耗的模型调用费用。**它与模型参数规模、输入输出长度、推理强度、硬件利用率、量化方式和服务商定价共同相关,不能简单等同于每百万 Token 的标价。

Neon 给出的典型请求口径显示,GPT-5.6 Sol 完成一次智能体式搜索需要超过 10 秒,成本约为 0.03 美元。若 4B 模型确实只需要前者的 1/100,那么对应单次成本约为 0.0003 美元,即从 3 美分降到 0.03 美分,降幅约为 99%。

这个差距在低频演示里没有那么显眼,但在生产环境中会迅速放大。假设一个企业知识助手每天处理 10 万次搜索,且每次都符合 Neon 的典型请求口径,那么仅模型检索环节的理论账单如下:

| 日搜索量 | GPT-5.6 Sol理论日成本 | 4B模型理论日成本 | 理论日节省 | |---:|---:|---:|---:| | 1,000次 | 30美元 | 0.3美元 | 29.7美元 | | 10,000次 | 300美元 | 3美元 | 297美元 | | 100,000次 | 3,000美元 | 30美元 | 2,970美元 | | 1,000,000次 | 30,000美元 | 300美元 | 29,700美元 |

这些数字只是依据官方“1/100”说法进行的等比例测算,不包括数据库、向量索引、重排器、网络、日志和 GPU 部署成本。自托管开源模型也不是免费午餐:如果请求量很低,GPU 闲置成本可能高于按次使用闭源模型;只有在稳定并发、批处理充分或能够与其他任务共享算力时,4B 模型的成本优势才更容易兑现。

延迟同样不能根据成本比例直接推导。Neon 只明确给出了 GPT-5.6 Sol 单次搜索超过 10 秒,并未在本次披露中提供 4B 模型端到端延迟、首 Token 时间或搜索轮数,因此不能据此声称新模型把延迟也缩短了 100 倍。

它优化的不是“回答”,而是“该搜什么”

**智能体式搜索是由模型主动拆分问题、生成查询、阅读结果并反复决定下一步行动的多轮检索流程。**它与传统的一次性向量召回不同,模型不只接收搜索结果,还参与制定搜索策略。

传统企业知识库常用的是嵌入检索。嵌入检索是把文档和用户问题映射成向量,再按照距离找出语义相近内容的方法。它便宜、快速,适合“退款政策是什么”“某项功能如何开启”这类答案集中在单个段落的问题,但遇到需要跨文档拼接证据的任务时容易失灵。

智能体式搜索更适合处理多跳问题。例如,用户询问“哪些客户在第二季度提交过高优先级工单,但合同将在 30 天内到期,并且尚未安排续约会议”,系统需要依次查询客户名单、工单记录、合同日期和销售日程。一次向量相似度搜索很难直接命中完整答案,模型必须把问题拆成多个子查询,并根据前一轮结果调整后一轮搜索。

Neon 与 Castform 的分工正好对应这一流程。Neon 是一款完全托管的无服务器 PostgreSQL 数据库,其核心特点是计算与存储分离、按需扩缩容、缩容至零以及类似 Git 的数据库分支;在这套方案中,它负责保存文档并提供搜索能力。Castform 则负责模型训练,让模型学会判断“现在应该搜索什么”。

这种架构把企业 AI 系统中的两个问题拆开了:数据库负责可靠保存和查找数据,模型负责制定查询策略。它比让一个超大模型包办所有步骤更容易控制,也更符合数据库系统原本擅长的职责边界。

强化学习让模型从结果中学会搜索

**强化学习后训练是让模型通过尝试行动、获得奖励并据此调整策略的训练方式。**在检索任务里,奖励不只取决于最终回答是否正确,还可以细分到是否找到正确文档、是否引用正确段落以及是否走了不必要的搜索步骤。

Castform 的训练过程可以理解为让模型反复完成“开卷考试”。模型先尝试拆解问题并调用搜索工具,系统随后给这次尝试打分,再把评分反馈给下一轮训练。相比只用人工示范做监督微调,这种方式能够直接优化最终任务结果,也更适合处理存在多条有效搜索路径的问题。

Neon 披露的评估维度包括三个部分:

  • 是否找到了正确文档;
  • 是否引用了合适段落;
  • 最终答案是否正确。

这三个维度比单纯检查答案文本更接近企业需求。一个模型可能凭借预训练记忆猜对答案,却没有使用企业内部资料;也可能找对文档,但引用了无法支撑结论的段落。对于客服、法务、金融和医疗场景,可追溯证据往往与答案本身同样重要。

专用后训练的优势还在于,它可以学习特定组织的数据结构。模型能够逐渐理解产品文档的版本规则、工单字段的含义、内部缩写以及哪些数据源更可信,而通用模型每次都要从提示词和工具描述中临时推断这些规则。

4B为什么可能打赢旗舰模型

小模型在受限任务上超过大模型并不反常,因为参数规模决定的是能力容量,不是对每个工作流的熟悉程度。一个没有接受专门训练的旗舰模型,可能生成更自然的查询,却不一定知道某家企业应优先搜索哪张表、如何组合过滤条件,以及什么时候应该停止搜索。

4B 参数规模也处在相对容易部署的区间。以权重本身粗略估算,FP16 格式约需 8GB 存储,INT8 约需 4GB,4-bit 量化约需 2GB;实际运行还要为 KV Cache、激活值、推理框架和上下文窗口预留显存,因此不能把权重体积直接视为完整显存需求。即便如此,它仍明显比前沿闭源模型更适合本地化、边缘部署和高并发批处理。

更重要的是,4B 模型可以成为智能体系统里的“搜索控制器”,而不是最终回答者。一个更现实的生产架构是:先由 4B 模型负责拆解问题、调用数据库和整理证据,只在确实需要复杂综合、长文本写作或高风险判断时,再把证据交给 GPT-5.6 Sol 这类旗舰模型。

这种大小模型路由可以同时保住成本和能力上限。假设 90% 的普通检索由 4B 模型完成,剩余 10% 升级到 Sol,按 Neon 给出的单次成本计算,100 次请求的检索模型费用约为 0.327 美元,而全部使用 Sol 则需要约 3 美元,理论降幅约为 89.1%。

与向量搜索相比,它不是替代关系

智能体式搜索不会淘汰向量检索,因为前者通常仍需要后者提供候选结果。更准确的理解是:向量数据库或 PostgreSQL 搜索负责“从大量数据里快速取回一批可能相关的内容”,检索模型负责“决定搜什么、判断结果够不够、是否继续搜”。

| 方案 | 查询方式 | 优势 | 局限 | 适合场景 | |---|---|---|---|---| | 关键词搜索 | 词项匹配与过滤 | 快、确定性强、便于调试 | 难处理同义表达 | 日志、编号、精确字段 | | 嵌入检索 | 向量相似度召回 | 语义匹配好、成本较低 | 多跳推理能力有限 | FAQ、文档问答 | | 智能体式搜索 | 模型多轮规划与工具调用 | 可拆解复杂问题、跨数据源搜索 | 延迟和成本更高,流程更难评估 | 企业分析、研究型任务 | | 4B专用检索模型 | 小模型规划加数据库搜索 | 成本低、可定制、可部署 | 泛化上限和跨领域能力待验证 | 高频垂直知识库 |

Neon 这次方案的意义,是尝试把智能体式搜索原本昂贵的“规划层”压缩到 4B 模型,而不是重新发明底层搜索引擎。数据库索引、全文搜索、向量召回和元数据过滤依然不可缺少,模型只是更聪明地组合这些工具。

“开源”还需要模型卡、许可证和复现材料

开源模型是否真正可用,不能只看权重能否下载,还要看许可证、训练数据说明、评估脚本和推理框架是否完整。对于企业开发者,许可证能否商用、能否修改、是否存在用途限制,往往比单项跑分更加重要。

截至 2026 年 8 月 7 日,本次参考材料尚未完整列出模型仓库地址、许可证名称、基础模型来源、上下文长度、量化版本和训练数据规模。因此,Neon 与 Castform 的“开源”承诺还需要通过后续模型卡与代码仓库来验证,尤其是 1.447 分能否由第三方在相同数据集和工具配置下复现。

安全问题也不能被低成本掩盖。检索控制器能够访问企业文档和数据库工具后,必须防范提示词注入、越权查询、恶意文档诱导以及敏感信息泄露。模型越擅长自主搜索,权限隔离、查询审计和结果脱敏就越重要。

这次发布对开发者意味着什么

Neon 与 Castform 的结果表明,AI 智能体的竞争重点正在从“谁的基础模型参数更多”转向“谁能把模型放在正确的位置”。对于结构明确、任务重复且请求量大的文档搜索,专用 4B 模型很可能比每次调用旗舰模型更合理。

这款模型当前最值得测试的场景包括:

  1. 企业内部知识库:跨产品文档、会议纪要和工单系统查找证据;
  2. 客服与销售助手:根据客户记录、合同和历史沟通生成下一步建议;
  3. 研发文档检索:在设计文档、代码说明和故障记录之间进行多跳搜索;
  4. 合规审查:定位规则条款并给出可追溯引用;
  5. 数据库智能体:根据自然语言问题选择表、字段和过滤条件。

开发者不应只复现官方平均分,而应记录命中率、引用准确率、最终答案正确率、平均搜索轮数、P95 延迟和每次成功任务成本。一个模型如果得分略高,却需要更多搜索轮次或频繁产生无效查询,最终数据库负载和端到端延迟仍可能抵消模型费用优势。

OpenAI Hub 判断:这是搜索层的效率突破,不是通用模型下克上

Neon 与 Castform 这款 4B 模型最有价值的地方,不是把 GPT-5.6 Sol 压在了排行榜下面,而是证明检索策略本身可以被蒸馏、训练和独立部署。过去企业常把“不会搜索”当作大模型能力不足,解决办法是换更贵的模型;这次结果说明,更有效的方法可能是针对工具和数据做后训练。

“成本只有 1/100”仍需要真实工作负载检验,因为官方口径没有覆盖硬件利用率、并发量、搜索基础设施和运维成本。但即使最终只能兑现十分之一的成本优势,对于每天运行数十万次的企业智能体,也已经足以改变模型选型。

现阶段更稳妥的结论是:在 Neon 的特定文档搜索评估中,这款 4B 后训练模型以 1.447 分超过 GPT-5.6 Sol 的 1.369,单次推理费用按官方口径约从 0.03 美元降至 0.0003 美元。它展示的是“小模型负责高频检索、旗舰模型处理少数难题”的系统路线,而不是参数规模失去意义。

如果后续开源仓库能够补齐许可证、模型卡、训练配方和可复现评估集,这套方案有机会成为企业 Agent 架构里的实用组件;如果只有内部跑分和成本宣称,它就仍然是一场有吸引力、但证据尚未闭环的产品演示。

参考来源

相关推荐

查看全部