AI 快讯Toast 1亮相,搜索智能体快12倍
模型上新

Toast 1亮相,搜索智能体快12倍

2026-08-14T23:03:17.878Z
Toast 1亮相,搜索智能体快12倍

Mixedbread 发布首款专业搜索智能体 Toast 1,宣称在保持前沿搜索质量的同时实现 12 倍速度和十分之一成本。真正值得关注的不是单项跑分,而是搜索智能体开始从“效果优先”转向效率竞争。

Toast 1亮相,搜索智能体快12倍

Mixedbread 于 8 月 13 日发布 Toast 1,这是该公司第一款面向搜索任务专门训练的 AI 智能体。按照官方说法,Toast 1 在不同领域都能提供前沿级搜索质量,同时速度达到对比对象的 12 倍,成本只有十分之一。

这不是又一个负责把文本变成向量的嵌入模型,也不是传统意义上的聊天大模型。**搜索智能体是能够自主理解问题、组织检索过程、筛选证据并返回结果的模型系统。**它解决的核心问题不是“如何生成一段听起来合理的话”,而是“应该去哪里找、搜几次、保留哪些材料,以及什么时候停止搜索”。

Toast 1 官方发布视觉图,突出 12 倍速度、十分之一成本和专业搜索智能体定位

Toast 1卖的不是更聪明,而是更高效

Toast 1 最明确的卖点是把搜索质量、响应速度和使用成本同时放进了一张表里。Mixedbread 将其称为新的“Pareto frontier”,也就是帕累托前沿:当一个方案已经位于前沿时,竞争者如果想在不牺牲其他指标的情况下继续改善某一项指标,会变得非常困难。

官方给出的三个核心结论非常直接:

  • 搜索质量达到前沿水平;
  • 搜索速度提高至 12 倍;
  • 使用成本降低至十分之一;
  • 能够处理跨领域搜索任务,而非只针对单一垂直行业。

Toast 1 的产品逻辑很清楚:搜索智能体不应该通过无限增加推理轮次来换取最后几个百分点的质量。一个智能体即便能找出正确答案,如果每次需要等待几十秒、消耗大量模型调用和搜索请求,也很难成为高频产品的默认能力。

所谓 12 倍速度并不必然等于端到端延迟降低 91.7%。速度可以指吞吐量、任务完成时间、单位时间完成的搜索数量,或者某个固定评测环境中的相对表现;在 Mixedbread 公布完整测试设置之前,不能把这个数字简单理解为所有实际请求都会快 12 倍。

所谓十分之一成本同样是相对指标,而不是公开价目表。若对比系统完成一次任务需要 1 元,十分之一意味着 Toast 1 在相同统计口径下需要约 0.1 元;但基准是否包含检索服务、推理 token、网页抓取和重排成本,都会改变这一数字的实际含义。

**Toast 1 当前最值得重视的是效率曲线,而不是一个孤立的搜索跑分。**在企业知识库、研究助手和编程智能体中,成本与延迟往往比排行榜第一名更能决定产品能否上线。

它与嵌入模型、重排模型有什么区别

搜索智能体与嵌入模型的区别在于,前者负责决定完整搜索策略,后者主要负责计算内容之间的语义相关性。嵌入模型会把问题和文档转换成向量,再从向量库中找出距离较近的内容,但它本身通常不会判断是否需要改写查询、补充搜索或核验证据。

重排模型则处在检索流程的中间层。**重排模型是对第一轮召回结果重新评分并调整顺序的模型。**它能把更相关的材料推到前面,却通常不负责拆解问题,也不会主动发起下一轮检索。

Toast 1 的定位比这两类模型更靠近应用层。按照“专业搜索智能体”的定义,它应该处理从问题理解到搜索执行的一整段链路,而不只是给某一个环节提供分数。不过,Mixedbread 目前对外传播的重点仍是结果、速度和成本,模型架构、工具调用方式以及是否包含答案合成层,还需要更多技术资料才能确认。

| 方案 | 核心职责 | 是否主动规划搜索 | 多轮检索能力 | 典型优势 | 典型短板 | |---|---|---:|---:|---|---| | Toast 1 | 面向搜索任务执行完整或接近完整的智能体流程 | 是,按官方产品定位 | 预期支持 | 官方宣称前沿质量、12 倍速度、十分之一成本 | 公开技术细节和第三方验证仍有限 | | 嵌入模型 | 将查询与文档映射到向量空间 | 否 | 否 | 速度快、成本低、适合大规模召回 | 复杂问题容易漏掉隐含条件 | | 重排模型 | 对候选文档二次评分 | 否 | 否 | 能明显改善结果排序 | 依赖第一轮召回质量 | | 通用大模型搜索智能体 | 规划、搜索、阅读并生成答案 | 是 | 是 | 泛化能力强、解释能力好 | 延迟和 token 成本通常较高 | | 固定 RAG 流程 | 按预设步骤检索并生成回答 | 有限 | 通常有限 | 行为稳定、容易控制和审计 | 面对开放问题时缺少动态调整能力 |

Toast 1 因此更像是一位专职研究员,而不是图书馆里的索引卡。索引卡能迅速告诉你哪些书可能相关,研究员则需要理解问题、翻阅多份材料、排除相互矛盾的证据,再决定是否已经找到足够的信息。

12倍速度为什么比跑分更重要

搜索智能体的最大现实瓶颈是串行调用。一个复杂问题可能先被拆成多个子问题,每个子问题再触发搜索、抓取、阅读和重排;只要其中五六个环节必须顺序进行,端到端延迟就会迅速累积。

通用大模型往往通过“想得更久”提高搜索质量。它会生成更长的推理轨迹、提出更多搜索词,并反复检查答案,这种方式在研究型任务中有效,却不适合站内搜索、客服问答和代码导航等高频场景。

专业模型可以通过缩短决策路径获得更高效率。它不必把大量计算用于闲聊、文学创作或角色扮演,而是集中学习查询改写、证据判断、搜索停止条件和结果组织等能力。这与专用芯片的思路类似:能力范围更窄,但在目标工作负载上更快、更省。

如果 Toast 1 的 12 倍速度能够在真实工作负载中复现,它会直接改变搜索智能体的产品形态。原本只能用于低频深度研究的能力,可以进入编辑器即时检索、企业协作软件、在线客服和电商搜索等对延迟敏感的场景。

如果十分之一成本同样成立,影响甚至可能比速度更大。企业内部知识助手每天可能处理数万乃至数十万次查询,单次任务成本从 0.1 美元降至 0.01 美元,十万次任务对应的理论支出就会从 1 万美元降到 1000 美元;这只是比例演示,并非 Toast 1 的官方报价。

Mixedbread正在补齐搜索基础设施的最后一层

Mixedbread 是一家聚焦 AI 检索基础设施的公司,其产品覆盖数据存储、语义召回、结果重排以及面向智能体的上下文访问。该公司过去更为开发者熟悉的是 mxbai 系列嵌入与重排模型,而不是通用聊天模型。

Mixedbread 的 Stores 是面向 AI 应用管理和检索数据的知识库产品。开发者可以将文本及其他内容组织进 Store,再让 AI 应用搜索相关上下文,而不必自己维护完整的向量数据库和检索服务。

Mixedbread 的 MCP Server 则把这些知识库连接到 Claude Desktop、Cursor 和 Claude Code 等支持 MCP 的应用。**MCP 是一种让模型以标准方式连接外部工具与数据源的协议。**对 Mixedbread 来说,MCP 解决的是“智能体如何接入数据”,Toast 1 解决的则更接近“接入之后如何高效搜索”。

这条产品线的演进方向并不意外。嵌入模型负责初步召回,重排模型负责改善顺序,Store 负责托管数据,MCP 负责连接智能体,Toast 1 则试图接管检索决策层。Mixedbread 正在从提供搜索零部件,转向提供能够直接完成搜索任务的系统。

这一转变也意味着 Mixedbread 开始进入更拥挤的市场。搜索智能体不只要与其他检索模型竞争,还要与通用大模型的联网搜索、云厂商的企业搜索产品,以及用户自行拼装的 RAG 流程竞争。

“跨所有领域”仍需要更严格的验证

Toast 1 最需要谨慎看待的表述是“across all domains”,也就是跨所有领域保持前沿搜索质量。领域泛化一直是搜索模型最难证明的能力之一,因为新闻、法律、金融、学术论文和产品手册对时效性、引用精度和错误容忍度的要求完全不同。

一个模型在公开网页问答上表现优秀,不代表它能读懂企业内部缩写。一个模型能够找到新闻事件的时间线,也不代表它可以正确处理法律条款之间的优先级。真正的跨领域能力需要按领域公开任务集、数据时间范围、评价标准和失败案例。

搜索评测本身也比普通问答评测更容易受到系统配置影响。搜索源是否相同、网页抓取是否成功、候选结果数量有多少、是否允许并行查询,以及最终由谁判断答案正确,都会显著影响结果。

官方所说的“前沿质量”因此还不能直接等同于已经超越所有竞品。更有说服力的材料应当包括完整 benchmark 名称、样本数量、基线系统版本、延迟的统计分位数、每项任务的平均成本,以及可复现的测试方法。

目前公开信息也不足以确认 Toast 1 的参数规模、基础模型、上下文窗口、模型权重许可和详细计费方式。开发者在技术选型时不应只看 12 倍和十分之一两个比例,还要等待稳定性、并发限制、数据保留策略以及可观测性能力进一步明确。

Toast 1最适合哪些场景

企业知识搜索可能是 Toast 1 最直接的落地场景。企业内部查询往往跨越产品手册、会议记录、工单和政策文件,固定的一次向量召回很难覆盖全部条件,而通用深度研究智能体又可能太慢、太贵。

编程智能体也是专业搜索模型的潜在入口。代码问题经常需要同时检索仓库、依赖文档、Issue 和提交记录,搜索智能体如果能快速判断信息缺口,就能减少大模型在错误上下文上持续推理的浪费。

客服和运营场景更看重延迟与一致性。用户不会愿意为一个订单规则等待几十秒,企业也不希望智能体为简单问题启动冗长研究流程;专业模型若能在质量相近的前提下降低 90% 成本,会比单纯提高回答文风更有价值。

高风险决策场景则不应仅凭官方性能主张直接采用。法律、医疗和金融搜索需要来源追踪、权限控制、版本管理与人工复核,搜索质量再高也不能替代责任链路。

别把它和餐饮软件Toast IQ混为一谈

Toast 1 与餐饮科技公司 Toast 的 Toast IQ 没有直接关系。Toast IQ 是集成在 Toast 餐饮平台中的对话式 AI 助手,而 Toast 1 是 Mixedbread 发布的专业搜索智能体,两者只是名称相近。

这种重名会对搜索结果造成明显干扰。开发者查找 Toast 1 的评测、价格或接入信息时,最好同时加入 Mixedbread、search agent 或 specialised search agent 等限定词,以避免进入餐饮 SaaS 的帮助文档。

结论:搜索智能体开始拼单位经济性

Toast 1 释放出的关键信号是,搜索智能体的竞争指标已经从“能不能完成复杂研究”转向“每秒、每元能够完成多少可靠搜索”。这与大模型行业从盲目追求参数规模转向推理效率的路径非常相似。

Mixedbread 的优势是对检索链路足够熟悉。它已经拥有嵌入、重排、Store 和 MCP 等基础设施,因此 Toast 1 不是孤立模型,而是可以嵌入现有搜索栈的一层能力。

Toast 1 的短板则是公开证据还不够完整。12 倍速度和十分之一成本足够吸引眼球,但开发者真正需要的是测试口径、绝对价格、延迟分布、失败率和跨领域明细,而不只是两个相对数字。

截至 2026 年 8 月 14 日,Toast 1 更像一个值得认真跟踪的新方向,而不是已经被第三方充分验证的行业标准。若后续评测能够证明它在真实数据、复杂权限和高并发环境下仍保持官方宣称的效率,Mixedbread 可能会把搜索智能体从昂贵的高级功能,变成 AI 应用中的默认基础设施。

参考来源

相关推荐

查看全部