AI 快讯Ringg用GPT-5.6降本90%
产品更新

Ringg用GPT-5.6降本90%

2026-09-24T08:08:00.659Z
Ringg用GPT-5.6降本90%

Ringg披露,其多渠道AI智能体每月接入超过700万通电话,最多可独立解决65%的常规客服请求。通过将部分实时任务从GPT-4.1迁移至GPT-5.6,模型成本下降约90%。

Ringg用GPT-5.6降本90%,65%客服来电无需人工接管

Ringg近日披露,其基于 OpenAI GPT-5.6 系列构建的多渠道客服智能体,目前每月处理超过 700 万次接通电话,最多可在无需人工介入的情况下解决 65% 的客户请求。更值得关注的是,Ringg 将适合的实时任务从 GPT-4.1 迁移至 GPT-5.6 后,模型成本下降约 90%,同时维持了生产环境要求的响应质量和延迟。

这里的“解决”并不等于让模型完成一次问答,而是指智能体能够理解客户意图、调用业务工具、执行流程,并在通话结束前完成问题闭环。例如查询订单状态、修改预约、解释账单、处理退款条件或完成基础身份核验。对于复杂投诉、异常订单和高风险操作,系统仍会转交人工坐席。

Ringg多渠道客服智能体架构示意图,展示电话、聊天、WhatsApp和网页入口统一接入,并由GPT-5.6不同模型分别负责实时对话、通话分析和评测优化

这不是“一个模型包打天下”,而是按任务拆分模型

Ringg 的核心做法是模型路由,即根据任务对实时性、推理能力、成本和语言表现的不同要求,选择 GPT-4.1 或 GPT-5.6 家族中的不同版本,而不是把所有请求都交给同一个大模型。

模型路由是指系统根据任务类型和业务约束,动态选择最合适的模型执行不同环节。 这与许多企业直接绑定单一模型的做法不同,更接近传统客服中心的分工:一线坐席负责快速接听,质检团队负责复盘,培训团队负责改进话术。

根据 Ringg 披露的信息,其大致采用了以下分工:

| 任务环节 | 使用模型 | 主要目标 | 关键约束 | |---|---|---|---| | 实时语音与聊天 | GPT-4.1、GPT-5.6 Luna | 理解用户意图、调用工具、完成对话 | 延迟、稳定性、成本 | | 通话后分析 | GPT-5.6 Terra | 生成摘要、判断情绪、提取问题标签 | 分析准确率、多语言能力 | | 评测与提示词改进 | GPT-5.6 Sol | 执行离线评测、比较提示词效果 | 可重复性、评测覆盖度 | | 人工升级与业务流程 | 由平台编排 | 处理复杂或高风险请求 | 权限、审计、转接体验 |

需要注意的是,资料中提到的 GPT-5.6 Luna、Terra 和 Sol,是 Ringg 在案例中使用的任务分工名称。公开信息并未完整披露每个变体的上下文窗口、输入输出价格、最大并发量或具体模型规格,因此不宜简单把它们理解为面向所有开发者公开售卖的三个标准型号。

90%降本,真正省下来的是什么钱?

Ringg 所说的“成本下降约90%”,主要指适合迁移的实时工作负载在模型层面的成本,而不是整个客服运营成本下降90%。客服系统的总成本还包括语音识别、语音合成、电话线路、号码资源、业务系统调用、存储、人工坐席和质检等部分。

模型成本是客服智能体总成本中的一个组成部分,模型费用下降并不会自动等比例转化为企业总运营成本下降。 这一点在解读案例时尤其重要。

如果一个实时任务原本使用 GPT-4.1,每百万输入和输出 token 的综合成本被视为 100 个单位,迁移到 GPT-5.6 Luna 后,模型成本降至约 10 个单位,那么“下降90%”成立。但如果模型成本只占整个通话链路成本的40%,在其他条件不变时,企业整体成本理论上最多下降约36%,还要扣除迁移、监控、线路和人工兜底等额外开销。

不过,客服场景确实是模型降本最容易产生规模效应的地方。一次电话可能持续数分钟,系统需要持续维护上下文,还要处理打断、确认、工具调用和多轮澄清。单次调用看起来并不昂贵,但每月700万次接通后,任何微小的单通成本差异都会被放大。

Ringg 没有披露每通电话的平均 token 数、模型实际输入输出比例,也没有公布迁移前后的总账单,因此目前能够确认的是“适用实时工作负载的模型成本下降约90%”,而不是“每通电话整体成本下降90%”。

65%的自动解决率,关键不只在模型智商

Ringg 披露的65%是“最多可达到”的独立解决率,不应被理解为所有客户、所有行业和所有来电都能稳定达到65%。这一指标通常会受到业务类型、自动化范围、客户语言、工具系统质量和人工升级规则的共同影响。

自动解决率是指客户请求在没有人工坐席直接介入的情况下完成处理的比例。 它与模型回答准确率、意图识别准确率和客户满意度不是同一个指标。

一个智能体可能正确回答了问题,却因为没有完成系统操作而不能算作解决;也可能成功完成退款,但客户对语气或等待时间不满意,导致满意度下降。反过来,一些看似简单的请求,如果企业后台没有开放查询或修改权限,也只能转给人工。

Ringg 同时表示,其客户满意度平均达到 4.8 分。资料没有明确说明评分采用5分制还是其他口径,也没有公布样本量、行业分布及满意度统计周期,因此这个数字更适合被视为企业案例中的运营指标,而不是可直接复现的通用基准。

从产品角度看,65%的自动解决率已经足以改变客服中心的排班方式。假设一个业务团队每天接到10万次请求,其中6.5万次由智能体完成,人工坐席可以集中处理剩余的3.5万次复杂问题。企业不一定马上裁撤65%的坐席,但可以把人工资源从“重复回答”转向投诉处理、销售转化和高价值客户服务。

多渠道统一,比单纯接电话更有价值

Ringg 的智能体覆盖电话、网页聊天、WhatsApp 和其他聊天入口,价值不只是增加几个接入渠道,而是让同一个业务流程能够跨渠道延续。

多渠道智能体是指能够在电话、即时通讯和网页等不同入口中共享业务规则、用户上下文和工具权限的客服系统。 例如客户先在网页上查询订单,随后通过 WhatsApp 补充地址,最后拨打电话要求修改配送时间,理想状态下,系统应当识别这是同一个订单和同一个问题,而不是让客户重复描述三遍。

对于印度等语言和渠道高度碎片化的市场,这种能力尤其重要。客户可能使用英语、印地语或地区语言,也可能在电话和 WhatsApp 之间切换。Ringg 表示,其评估覆盖多语言能力、指令遵循、工具调用、可靠性和延迟等维度,而不是只看文本问答分数。

这种场景也解释了为什么单纯比较“哪个模型在公开榜单上分数更高”意义有限。语音客服的真实瓶颈包括:

  • 用户说话速度快、口音重或夹杂多种语言时,语音识别是否稳定;
  • 模型能否在用户打断后及时停止播报并重新规划回答;
  • 工具调用失败时,系统是否会诚实说明,而不是编造处理结果;
  • 电话线路抖动或服务超时后,能否恢复上下文;
  • 高风险操作是否要求二次确认,并留下可审计记录;
  • 客户表达不清时,系统是否能提出有效澄清问题。

与 Gemini 2.5 Flash 的比较,结论不是“全面胜出”

Ringg 表示曾将 OpenAI 模型与 Gemini 2.5 Flash 等替代方案进行比较,评估维度包括对话质量、延迟、指令遵循、工具调用、多语言表现、可靠性和成本。其结论是,OpenAI 模型在生产工作负载中提供了更强的综合平衡。

资料还提到,在一项通话后分析测试中,GPT-5.6 Terra 在常见区域语言上的准确率最高达到 97%,表现优于 Gemini 2.5 Flash。这个数字需要谨慎解读:它是特定测试集和特定任务中的最高结果,并不代表模型在所有语言、所有行业和所有客服意图上的准确率都为97%。

| 对比维度 | GPT-5.6 系列在 Ringg 案例中的表现 | Gemini 2.5 Flash | 解读 | |---|---|---|---| | 实时对话 | 满足 Ringg 的质量和延迟要求 | 被纳入替代方案测试 | 公开资料未给出完整绝对分数 | | 通话后分析 | GPT-5.6 Terra 最高达到97%准确率 | 低于 Terra 的该项测试结果 | 仅代表特定区域语言和任务 | | 模型成本 | 适用实时任务较 GPT-4.1 下降约90% | 未披露可比迁移成本 | 不能据此推导总运营成本 | | 工具调用 | 被纳入生产评估维度 | 被纳入生产评估维度 | 关键在失败恢复与权限控制 | | 多语言能力 | 支撑 Ringg 的区域语言场景 | 具备多语言能力 | 仍需按企业真实数据验证 |

更准确的结论是:Ringg 认为 OpenAI 模型在其生产约束下更适合,而不是 GPT-5.6 在所有客服场景中都绝对优于 Gemini 2.5 Flash。对于企业来说,最有价值的做法仍然是用自己的真实通话数据建立评测集,比较解决率、转人工率、误操作率、平均延迟和每通成本。

Ringg 的方法,给企业迁移模型提供了三个启示

第一,不要把所有任务都交给最强或最贵的模型。 实时对话、通话总结、情绪分类和提示词评测的性能要求不同。将离线任务与在线任务拆开,通常比全链路统一使用一个模型更容易控制成本。

第二,模型切换必须以生产评测为前提。 Ringg 关注的不只是答案是否“看起来合理”,还包括工具调用是否成功、延迟是否达标、多语言是否稳定,以及在异常条件下是否会转人工。对于客服系统而言,一次错误退款或错误承诺,可能抵消大量 token 成本节省。

第三,自动化率需要和业务闭环一起衡量。 建议企业至少同时跟踪以下指标:

  • 独立解决率:无需人工介入完成请求的比例;
  • 转人工率:智能体主动或被动升级人工的比例;
  • 重复来电率:客户在自动处理后再次联系的比例;
  • 工具成功率:查询、修改、退款等业务操作成功的比例;
  • 平均首响应延迟和平均轮次;
  • 单通模型成本与全链路成本;
  • 客户满意度和高风险错误率。

对客服行业来说,GPT-5.6的价值在“够好且足够便宜”

Ringg 这次案例最值得关注的,不是又一家企业宣布使用新模型,而是它展示了一个更现实的生产路线:用不同模型承担不同工作,再通过路由、评测和人工兜底把系统串起来。

企业级智能体的竞争重点,正在从“模型回答得多聪明”转向“每次任务完成得多稳定、每通电话花多少钱”。 如果GPT-5.6确实能在满足质量和延迟要求的前提下,把适用实时工作负载的模型成本降低约90%,那么它对高并发客服、外呼、订单查询和售后场景的吸引力会明显增强。

但这仍不是客服自动化的终局。65%的最高自动解决率意味着至少还有35%的请求需要人工或其他流程处理;多语言语音、客户身份认证、支付和退款等环节也会持续带来合规与安全挑战。企业如果只看到“90%降本”就直接替换原有系统,最终可能把节省的模型费用转化为更高的投诉、返工和风险成本。

截至 2026年9月24日,Ringg 的披露更适合被看作 GPT-5.6 在真实高并发语音客服场景中的一项早期生产案例。它证明了模型分层和任务路由可以带来可观的经济收益,但是否适合某家企业,仍要回到自己的通话数据、业务工具和风险边界上验证。

参考来源

  • OpenAI 官方案例:Ringg’s AI agents resolve up to 65% of customer calls with OpenAI:关于 Ringg 每月通话量、65%自动解决率、GPT-5.6任务路由及成本下降的主要一手资料。由于本文按要求仅保留指定域名链接,未展示其原始站点 URL。
  • 补充行业报道:Inside AI、Daily.dev 等资料:用于交叉核对 Ringg 的模型分工、GPT-5.6 Terra 的区域语言分析结果,以及与 Gemini 2.5 Flash 的评测背景。相关站点域名不在本文允许展示的链接白名单内,因此不附外链。

注:本文中的“最多65%”“约90%”和“最高97%”均为 Ringg 或相关案例资料披露的特定场景数据,不代表所有企业部署后的必然结果。GPT-5.6 Luna、Terra、Sol 的完整规格、价格和公开可用范围,仍应以 OpenAI 后续官方文档为准。

相关推荐

查看全部