OpenAI展示Astra:智能体开始组队

奥尔特曼在国会山闭门展示Astra,核心方向不是更会聊天,而是让多个智能体协同完成长周期任务。不过它目前仍未正式发布,性能、价格与上线时间均待确认。
OpenAI展示Astra:智能体开始组队
OpenAI正在把智能体从“单兵作战”推向“团队协作”。据科技媒体 The Information 8月1日报道,OpenAI首席执行官萨姆·奥尔特曼本周在美国国会山闭门展示了一个名为Astra的新AI模型系列,其核心能力是拆分复杂任务、调度多个智能体协同工作,并将任务持续推进到最终交付。
需要先说清楚:Astra目前是一个被媒体披露的内部项目,而不是已经公开上线、可以购买或调用的正式产品。截至2026年8月1日,OpenAI尚未发布Astra的模型卡、技术报告、基准测试、价格、上下文窗口、开放范围或具体发布日期。因此,把Astra直接称为“OpenAI新旗舰模型”还为时过早,更准确的说法是:OpenAI正在向美国议员展示下一阶段的智能体技术路线。

Astra是什么:重点不是模型更大,而是任务能跑得更久
Astra是OpenAI正在展示的一组面向长周期任务的AI模型或智能体系统,其目标是让多个智能体分工协作,处理单个智能体难以独立完成的复杂问题。报道显示,奥尔特曼于7月29日会见美国参议员拉斐尔·沃诺克和伯尼·莫雷诺,并计划会见参议院情报委员会民主党首席成员马克·华纳,Astra正是在相关闭门交流中出现。
长周期任务是需要跨越较长时间、多个步骤和多个工具,并在过程中持续维护目标、状态与约束的任务。它不是让模型一次生成一份更长的答案,而是要求系统像项目团队一样,在数小时、数天甚至更长时间里完成调研、规划、执行、检查、返工和交付。
协同智能体是由多个具有不同角色或工具权限的AI智能体共同完成一个目标的系统。一个智能体可以负责拆解目标,另一个负责检索资料,第三个负责执行操作,第四个负责验证结果;系统还需要决定谁先做、谁复核、什么时候重试,以及出现冲突时采用哪份结论。
这一区别很重要。今天多数所谓“智能体”,本质上仍是一个模型在工具调用循环中不断执行“思考—操作—观察—再操作”;Astra透露的方向,则更接近一个由模型驱动的虚拟组织。前者像一个人同时开着浏览器、终端和表格来回切换,后者试图组建产品经理、研究员、执行者和审计员组成的小队。
为什么单个智能体还不够用
单个智能体的最大问题不是不会做,而是连续做很多步之后容易偏离目标。一次任务只要包含网页检索、文件读取、数据清洗、表格生成、邮件发送和结果复核,任何一步的误判都会向后传播;如果模型没有保存清晰的状态,做到第20步时甚至可能忘记第1步确定的限制条件。
长周期任务的难点可以概括为四类:
- 任务分解:系统必须把模糊目标变成有依赖关系、可验证的子任务,而不是简单列出待办事项。
- 状态保持:系统必须记录已经完成什么、哪些结论仍不确定、哪些操作需要等待外部反馈。
- 错误恢复:网页结构变化、权限不足、工具超时或数据冲突后,智能体不能只重复失败动作。
- 结果验收:系统必须判断交付物是否真正满足目标,而不是把“成功调用工具”误当成“任务已经完成”。
多智能体协作可以降低一部分认知负担,但不会自动解决可靠性问题。让四个智能体同时工作,并不等于准确率变成四倍;如果它们共享同一套错误信息,或者都由相近模型驱动,错误反而可能被多数意见放大。Astra真正需要证明的不是“能同时启动多少个智能体”,而是能否通过角色隔离、独立验证和动态调度降低整体失败率。
Astra和现有OpenAI智能体有什么不同
Astra更像底层能力与调度架构的升级,而不是给现有ChatGPT增加一个按钮。OpenAI此前已经推出过Tasks、Deep Research、Operator和ChatGPT Agent,产品路线逐步从定时触发、深度检索走向浏览器操作和完整任务交付;近期官方产品说明又把重点转向ChatGPT工作与工作空间智能体,强调长期、多步骤工作流、定时运行和企业治理。
ChatGPT Agent是把网页浏览、代码执行、信息整合和文档生成放进同一个任务循环的通用智能体。该产品在2025年推出时,OpenAI曾以初级财务分析为例,声称可把原本需要数小时的工作压缩到约30分钟;但OpenAI目前的帮助页面已经注明,原有智能体模式不再可用,较长的多步骤任务将由ChatGPT工作承接。
工作空间智能体是部署在企业ChatGPT环境中、可连接Slack、Google Drive和微软应用等工具的可定制智能体。它强调自然语言创建、团队共享、定时运行、基于角色的访问控制以及管理员审批,更接近可治理的业务自动化,而不是追求单次对话的模型跑分。
| 产品或方向 | 核心形态 | 典型任务 | 多智能体协作 | 长周期能力 | 公开状态 | 价格或限额 | |---|---|---|---|---|---|---| | Astra | 新模型系列或协同智能体系统 | 复杂项目、跨阶段任务 | 报道称支持 | 核心卖点 | 仅闭门展示,未正式发布 | 未公布 | | ChatGPT Agent | 单一入口调用浏览器、代码和研究工具 | 财务分析、购物、报告、幻灯片 | 未以协同团队为核心 | 支持多步骤任务 | 原有模式已被官方标注为不再可用 | 历史限额曾为Plus每月40条、Pro每月400条 | | ChatGPT工作 | 面向更长任务和交付成果的产品形态 | 研究、分析、文档交付 | 官方未披露与Astra的关系 | 明确面向更长任务 | 已由官方帮助页面提及 | 具体方案依产品页面为准 | | 工作空间智能体 | 企业内可创建、共享和治理的流程智能体 | 销售、IT、财务、产品运营 | 可部署多个专用智能体 | 支持长期、多步及定时流程 | Business、Enterprise、Edu及教师版研究预览 | 暂无独立公开定价 |
这张表也暴露了Astra当前最大的信息缺口:OpenAI没有说明它究竟是基础模型、模型系列、智能体运行时,还是包含调度器、记忆系统和工具环境的一整套产品。媒体报道使用“模型”一词,并不足以证明协同能力完全来自模型权重;在实际系统中,任务队列、权限控制、上下文压缩、检查点和验证器通常与底层模型同样重要。
真正的突破口是“可交付”,不是“会规划”
Astra如果想成为一次实质升级,必须把长周期任务的成功标准从“给出合理计划”提高到“稳定交付可验收结果”。现有大模型已经很擅长把一个目标拆成十个步骤,但计划写得像样和连续执行十个步骤是两回事;后者还要处理真实世界中的登录验证、数据缺失、文件版本冲突、审批等待和需求变化。
一个典型企业场景是供应商风险审查。系统需要先从内部采购记录中找到供应商,再检索制裁名单和司法信息,分析财务风险,识别同名实体,生成结构化报告,并把高风险项目提交给法务复核。单个智能体容易在检索与写作之间丢失证据链,而协同架构可以让检索智能体保存来源、分析智能体计算风险、审计智能体逐项核对引用,最后由总控智能体组织交付。
软件研发也是检验Astra含金量的直接场景。真正的长周期编码任务不是补全一个函数,而是阅读代码库、复现缺陷、定位依赖、修改多个模块、运行测试、分析失败日志、补充文档并等待代码审查反馈。只要Astra仍需要用户每隔几分钟纠正一次方向,它就只是更复杂的工具调用演示,而不是可以托付项目的协同智能体。
多智能体也会带来新的成本和风险
多智能体系统首先会放大推理成本。假设一个任务由5个智能体执行,每个智能体平均进行10轮模型调用,再增加一次独立复核,实际调用规模可能达到单智能体方案的数倍;如果模型还需要反复读取共享上下文,Token消耗、首个结果等待时间和工具费用都会同步上升。
多智能体系统其次会增加协调开销。两个智能体给出冲突结论时,需要由调度器裁决或重新取证;三个智能体重复搜索同一资料时,所谓并行只是浪费算力。软件工程里增加团队人数不会线性提高产出,AI团队也一样,角色边界和通信协议甚至可能比单个模型的能力更关键。
企业部署面临的最大门槛则是权限与审计。负责查资料的智能体不应该拥有付款权限,负责发送邮件的智能体不应该任意读取人事文件,能够修改生产环境的智能体更不能自行批准自己的操作。OpenAI现有工作空间智能体已经强调角色访问控制、审批节点和监控策略,Astra若进入企业市场,也必须继承甚至强化这些治理能力。
长周期运行还会扩大提示注入的攻击窗口。智能体浏览网页、读取邮件或打开共享文档时,可能接触到伪装成正常内容的恶意指令;任务持续时间越长、连接工具越多,攻击者诱导系统泄露数据或执行越权操作的机会就越多。多个智能体之间如果共享未经清洗的记忆,一次污染还可能扩散到整个协作链。
现在还不能谈跑分,应该看五项指标
Astra目前没有可供比较的公开基准成绩。OpenAI没有披露它在SWE-bench、BrowseComp或其他智能体评测上的结果,也没有公布任务最长运行时间、平均完成率、人工接管次数与单任务成本;任何关于“Astra超过某某模型”的说法,现阶段都缺乏可验证依据。
Astra正式发布后,最值得关注的是以下五项指标:
- 端到端任务成功率:系统是否交付了正确结果,而不是完成了多少次工具调用。
- 无人干预持续时间:平均运行多久需要用户确认、纠错或重新描述目标。
- 错误恢复率:遇到工具失败、权限中断和数据冲突后,有多少任务可以自主恢复。
- 单任务总成本:多个智能体完成一次任务所消耗的推理、浏览器和计算资源。
- 可审计性:管理员能否追踪每个智能体读取了什么、执行了什么,以及依据什么做出决定。
其中,端到端成功率比传统问答跑分更有意义。一个在单项基准中拿到90分的模型,如果连续执行20个关键步骤且每一步成功率都是95%,在粗略独立假设下,整条流程一次通过的概率只有约35.8%;长周期智能体必须通过复核、回滚和检查点机制打破这种错误累积,而不能只依赖模型单步更聪明。
OpenAI为什么选择在国会山展示
OpenAI向议员而不是开发者大会展示Astra,说明这次沟通同时具有政策意味。能够连续运行、调用企业工具并组织多个智能体的系统,潜在生产力高于普通聊天机器人,但它对就业、网络安全、政府采购、关键基础设施和责任归属的影响也更直接。
闭门演示也意味着外界暂时无法独立验证效果。演示可以选择最适合模型的任务、提前准备工具环境,并绕开失败率较高的边缘场景;只有当普通用户在不可控环境中重复运行相同任务,才能判断Astra是稳定系统还是精心设计的样片。
名称本身也可能造成混淆。Google此前已经使用Project Astra命名其实时多模态通用助手项目,而此次报道中的Astra指向OpenAI的协同智能体模型;在OpenAI正式确认名称之前,读者不应把两者视为同一项目,也不应根据名称推断产品能力。
判断:方向对了,但离“AI同事”仍差一张成绩单
Astra瞄准的是智能体产品当前最真实的瓶颈:模型已经会搜索、写代码和操作软件,但还不够可靠,无法长期独立承担一个有明确交付标准的项目。用多个智能体分担规划、执行和审计,是比单纯扩大上下文窗口更务实的路线,因为它试图解决组织和流程问题,而不仅是增加一次推理能看到的信息量。
Astra也可能成为OpenAI企业产品的底层拼图。工作空间智能体负责把企业流程、应用权限和治理规则接入ChatGPT,Astra负责调度多个角色并维持长时间执行,两者结合后,产品才有机会从“员工主动调用的助手”变成“接到目标后持续推进的工作系统”。不过,OpenAI目前并未确认这种产品关系,现阶段只能视为基于公开路线的合理推测。
Astra现在最缺的不是更炫的演示,而是一张可复现的成绩单。上线时间、模型规格、任务成功率、人工接管频率、安全边界和价格全部未知,这使它更像一次方向预告,而不是完整的模型发布。对开发者和企业用户而言,值得关注,但没有必要提前把现有工作流押在一个尚未公开的名字上。
真正的分水岭将是Astra能否把任务从“30分钟演示”推进到“数天稳定运行”。如果它能在预算和权限可控的前提下完成跨工具、跨角色、可审计的项目,协同智能体就会从实验性编排框架变成新的软件入口;如果它只是并行启动多个会互相讨论的模型,那么复杂度和账单很可能比生产力增长得更快。
参考来源
- IT之家:OpenAI奥尔特曼推介Astra模型,主打协同智能体与长周期任务 — 汇总The Information关于奥尔特曼在美国国会山闭门展示Astra的报道,也是目前Astra名称与能力描述的主要公开线索。
注:截至2026年8月1日,OpenAI尚未公开Astra技术报告、模型卡、价格、基准成绩或发布日期。文中涉及Astra的具体定位均以现有媒体披露为基础,最终信息应以OpenAI后续正式公告为准。



