AI 快讯TeleAgent冲进IDC实测前三
模型上新

TeleAgent冲进IDC实测前三

2026-09-17T14:06:43.032Z
TeleAgent冲进IDC实测前三

中国电信通用智能体TeleAgent上线两个月注册用户突破100万,并以6.85分进入IDC国内通用智能体实测第三。成绩亮眼,但完整榜单、评分维度与复现方法仍待公开。

中国电信的通用智能体产品,第一次拿出了一组足以进入行业第一梯队的数据。

9月16日,中国电信在天翼AI媒体开放日披露,星辰超级智能体TeleAgent上线约两个月,注册用户已经突破100万,技能数量从数千个扩展至4万余个。更受关注的是,在IDC近期针对国内主流通用智能体产品开展的标准化实测中,TeleAgent获得6.85分,综合排名第三。

**TeleAgent是中国电信面向办公与复杂任务执行场景打造的通用智能体。**它不是一个只负责回答问题的聊天机器人,而是试图把需求理解、任务拆解、网页检索、文件处理、表格分析、文档与PPT生成串成一条自动执行链路。

这组成绩说明,运营商做AI已经不再停留于提供云、算力和网络,而是开始直接进入生产力工具的正面竞争。不过,“IDC第三”证明的是TeleAgent已经具备较强的系统工程能力,并不等于其底层模型能力已经排到国内第三。

TeleAgent桌面端执行深度调研、Excel分析和PPT生成任务的产品界面示意图

6.85分排名第三,但榜单还缺少关键上下文

**IDC实测第三是TeleAgent此次亮相最醒目的标签,也是最需要谨慎理解的数据。**根据中国电信在活动现场披露的信息,IDC近期对国内主流通用智能体进行了标准化实测,TeleAgent综合得分6.85分,位列第三。

截至2026年9月17日,公开信息尚未完整披露这次评测的参测名单、总分设置、任务集、各维度权重、重复测试次数与人工评分规则。因此,外界目前只能确认“6.85分”和“第三名”两个结果,暂时无法判断TeleAgent究竟是在任务完成率、交付物质量、执行速度还是成本控制上拉开了差距。

**通用智能体评测是对AI系统完成多步骤真实任务能力的综合测试。**它考察的不只是底层大模型会不会回答,还包括模型选择、工具调用、网页操作、文件读写、错误恢复、上下文管理和最终交付质量。一个参数更大、知识问答更强的模型,如果频繁点错网页、读错表格或无法保存文件,在智能体评测中照样可能输给规模更小但执行链路更稳定的系统。

这也是TeleAgent进入前三值得重视的原因。中国电信并不是简单把星辰大模型接进一个聊天窗口,而是在补齐从模型到桌面执行环境的整套工程栈。

**目前的6.85分更适合作为产品进入头部区间的信号,而不是一张已经盖棺定论的能力排名。**要让“第三名”真正具有行业参考价值,IDC或中国电信后续仍需公开更完整的方法说明,至少包括测试任务数量、是否允许人工介入、失败重试规则、耗时与成本是否计分,以及不同产品是否运行在同等网络和硬件环境下。

两个月100万用户,规模增长快于产品验证

**TeleAgent上线约两个月注册用户突破100万,意味着它已经越过多数企业级AI工具最难的冷启动阶段。**按照60天粗略计算,其平均每天新增注册量约为1.67万,但注册用户并不等同于日活用户,更不等同于完成过复杂任务的有效用户。

中国电信同时披露,TeleAgent的Skill数量已经超过4万个,其中约99%由用户自主创建。按此比例估算,用户创建的Skill约为3.96万个。这个数字表明,TeleAgent正在尝试从单一办公软件转向可扩展的智能体平台。

**Skill是将提示词、操作流程、工具权限和领域知识封装成可重复调用能力的任务模块。**例如,“整理周报”“分析季度订单”“检查合同风险”都可以被做成Skill,用户以后不必重新描述完整步骤,只需输入数据和目标即可复用既有流程。

4万个Skill看起来很多,但更关键的指标不是数量,而是有效率。一个健康的技能生态需要回答四个问题:有多少Skill被重复调用、有多少来自真实工作流、有多少能够跨版本稳定运行,以及存在风险的Skill能否在执行前被识别和隔离。

**技能广场的规模越大,安全审查和质量治理的压力就越高。**智能体Skill不同于浏览器插件,它可能直接读写本地文件、运行脚本、访问企业系统甚至修改业务数据。若平台只追求数量而缺少权限声明、来源校验、版本锁定和运行审计,生态增长越快,潜在攻击面也越大。

中国电信此前介绍,其桌面智能体会检查Skill来源,对病毒与漏洞进行扫描,并在Skill运行中发生修改时请求用户确认。这样的设计方向是正确的,但企业客户还会进一步关注审计日志、细粒度权限、内部技能仓库、离线更新以及管理员统一禁用能力。

TeleAgent真正的卖点不是聊天,而是交付文件

**TeleAgent最清晰的产品定位,是把用户的一句话需求变成可以直接使用的办公交付物。**其官方产品信息列出了深度调研、资讯追踪、文档撰写、PPT制作、Excel分析、代码生成和简单应用制作等能力。

用户提出“从不同维度分析季度订单数据,并形成分析报告”后,系统需要完成数据汇总、分析维度抽象、透视统计、图表生成和报告撰写。这类任务比生成一段文字复杂得多,因为任何一个环节出错,最终报告都可能看起来完整、实际上数据失真。

**办公智能体的核心价值是减少软件之间的人工搬运。**传统AI助手可以生成文字,但用户仍要把内容复制进Word、把数据搬进Excel、再手工制作图表和PPT。TeleAgent试图跨越这些软件边界,让智能体直接读取文件、处理数据并输出可编辑成果。

官方案例显示,某类采购文件编制可由过去的2至3天压缩到20分钟,合同合规风险识别可在40秒内完成;另有咨询场景称,原本需要从5个系统导出20多张报表、耗时半天以上的季度经营分析,可在约5分钟内生成带可视化图表的完整报告。

**这些效率数字展示了理想工作流的上限,但目前主要来自产品方或使用案例,并非统一条件下的第三方对照实验。**企业在采购前仍应使用自己的合同、报表与模板做小规模验证,重点检查数字引用、公式准确率、格式稳定性以及失败任务的人工返工时间。

对办公智能体而言,最危险的情况不是直接报错,而是生成一份排版精美、结论合理、数字却悄悄错了一列的报告。TeleAgent若要在政企市场建立长期优势,就必须让结果可追溯,让用户能够定位每个结论来自哪张表、哪条公式和哪个网页来源。

model router与上下文压缩决定了成本上限

**Model router是根据任务类型、复杂度和成本要求自动选择合适模型的调度组件。**中国电信称,TeleAgent使用自研model router按需匹配模型,而不是让所有任务都调用同一个大模型。

这种设计对通用智能体非常重要。提取表格字段、修改文档格式和总结百字邮件不需要最强模型;复杂行业调研、代码调试和多步骤数据分析则需要更强的推理能力。如果所有步骤都交给高成本模型,效果可能更稳定,但推理费用与等待时间会迅速上升。

**上下文压缩是将冗长历史信息提炼为更短、仍能保留关键事实的上下文表示。**智能体连续操作几十步后,网页内容、文件数据、工具结果和中间计划会快速堆积,若每一步都把完整历史重新输入模型,Token消耗将近似滚雪球式增长。

TeleAgent通过模型路由和上下文压缩控制Token消耗,技术路线与当前主流智能体系统一致。真正拉开差距的地方,是压缩之后是否会丢失关键数字、模型切换是否导致指令理解不一致,以及路由器能否在低成本模型失败后及时升级到更强模型。

**中国电信的优势在于能够把算力、模型、平台、传输网络与应用部署放进同一套体系。**公开资料显示,其自有及接入智算规模达到87 EFLOPS,集群利用率达到98%,训练效能达到国际主流同等算力的93%。这些基础设施指标不会自动转化为更好的用户体验,但有助于降低大规模并发下的资源调度难度。

沙盒、本地执行和信创适配,是央企路线的护城河

**沙盒是将智能体操作限制在隔离环境中的安全执行机制。**它允许AI运行脚本、处理文件或调用工具,同时避免任务越权访问无关目录、系统凭据和核心业务数据。

TeleAgent强调使用自研轻量级沙盒限制文件访问范围,并提供沙盒隔离、虚拟机隔离、加密存储和最小权限控制等机制。与消费级聊天产品相比,这些能力对央国企、金融、政务和大型组织更重要,因为它们首先要解决的不是“回答够不够聪明”,而是数据能否不出域、操作能否审计、责任能否追踪。

**终端适配能力决定了办公智能体能否进入真实企业环境。**中国电信披露,TeleAgent目前已经完成Windows、macOS和Linux信创环境适配,这比只提供网页端更接近政企客户的实际部署需求。

当前公开资料中还同时出现了TeleAgent与TeleClaw两个产品名称。中国电信集团此前将TeleClaw桌面版定义为本地安全、自主执行的桌面生产力助手,而天翼AI目前主推的产品页面使用TeleAgent名称。两者在桌面执行、安全沙盒和办公场景上高度接近,但在官方提供完整版本沿革之前,不宜简单认定二者完全等同。

它与聊天助手、RPA和编程智能体有什么不同

**TeleAgent处在聊天助手、RPA和通用桌面智能体的交叉位置。**它既要理解自然语言,又要调用工具,还要适配企业文件、办公软件和权限体系。

| 对比维度 | TeleAgent | 普通聊天助手 | 传统RPA | 通用编程智能体 | |---|---|---|---|---| | 核心目标 | 完成调研、表格、文档、PPT等办公任务 | 回答问题与生成内容 | 按固定规则自动点击和录入 | 编写、修改和调试代码 | | 任务拆解 | 支持多步骤自主规划 | 通常需要用户连续追问 | 依赖预先配置流程 | 主要围绕代码仓库规划 | | 文件操作 | 强调本地文件读取、编辑与交付 | 多数以附件分析为主 | 可以操作,但配置成本高 | 主要处理代码与配置文件 | | 软件适配 | 面向跨办公应用协作 | 通常停留在对话界面 | 依靠界面坐标或流程组件 | 集中在终端、IDE和浏览器 | | 流程稳定性 | 取决于模型判断和工具可靠性 | 不负责完整执行 | 固定流程下稳定性较高 | 在软件工程任务中更强 | | 安全机制 | 强调沙盒、权限控制和信创适配 | 以云端账户权限为主 | 企业权限体系成熟 | 重点防止危险命令与代码执行 | | 公开价格 | 截至9月17日未见统一标准价格完整披露 | 常见订阅或按量模式 | 通常按软件许可和项目实施计费 | 常见订阅或按使用量计费 |

这张表也说明,TeleAgent并不是要彻底替代RPA。固定、重复、规则明确的核心业务流程,传统RPA仍然更可控;需要理解模糊需求、临时读取不同文档并生成新内容的任务,则更适合交给大模型智能体。两者未来更可能融合,而不是二选一。

百万注册不等于建立护城河

**TeleAgent的短期成绩已经足够亮眼,但其长期竞争力要看留存、任务成功率和企业复购。**100万注册用户证明中国电信拥有强大的渠道和触达能力,4万个Skill证明平台具备一定扩展性,IDC第三则说明产品能力至少进入了国内主流阵营。

真正困难的问题从现在才开始。用户可能因为活动注册一次,但只有持续完成工作才能形成留存;企业可能愿意试用,但只有准确率、权限管理和总成本达到要求才会采购;Skill可以快速生成,但只有稳定复用才会形成生态网络效应。

**TeleAgent目前最大的差异化优势不是底层模型跑分,而是中国电信在政企渠道、国产算力、信创终端和安全交付上的组合能力。**这套组合不一定能在所有消费级场景击败互联网厂商,却很适合采购周期长、合规要求高、需要私有化或本地化管理的组织。

**TeleAgent目前最大的短板则是公开评测信息仍不够透明。**IDC的6.85分究竟如何得出、同场产品有哪些、哪些任务失分、实际单任务成本是多少,这些信息决定了开发者和企业能否客观判断其能力边界。

从行业角度看,中国电信这次进入前三还有另一层意义:通用智能体的竞争已经从“谁的模型参数更多”转向“谁能稳定交付结果”。当底层模型能力逐步趋同后,桌面控制、工具生态、上下文管理、安全沙盒和企业部署,反而会成为更难复制的部分。

**截至2026年9月17日,TeleAgent已经证明自己不是又一个套壳聊天助手,但还没有证明自己能够稳定替代成熟工作流。**接下来最值得观察的,不是注册用户能否继续翻倍,而是月活跃用户、复杂任务成功率、Skill复用率、平均执行成本和企业续约率能否被持续披露。

参考来源

  • 中国电信天翼AI产品资料:用于核对TeleAgent的产品定位、深度调研、文档、PPT、表格与应用生成能力;按发布域名规范不附外链。
  • 中国电信天翼AI媒体开放日信息:用于核对100万注册用户、4万余个Skill、IDC实测6.85分及第三名等数据;按发布域名规范不附外链。
  • 中国电信集团公开资料:用于核对桌面智能体的本地执行、沙盒隔离、权限控制与Skill安全机制;按发布域名规范不附外链。
  • 经济参考报公开报道:用于核对87 EFLOPS智算规模、98%集群利用率及办公场景案例;按发布域名规范不附外链。
  • OpenAI Evals:开源模型评测框架,用于说明可复现评测通常需要公开任务集、评分器和运行流程。
  • SWE-bench:公开智能体基准项目,用于对照任务成功率、环境一致性和可复现评测的重要性。

相关推荐

查看全部