ChatGPT语音智能体登上手机

OpenAI于9月23日将Work任务能力扩展到ChatGPT移动端,Pro、Enterprise、Edu用户率先获得支持,Plus和Business用户将在未来几天陆续开放。用户可以用语音启动任务、查看进度,并在手机与桌面之间继续工作。
ChatGPT语音智能体登上手机:Work任务开始走向移动端
OpenAI今天(2026年9月23日)宣布,ChatGPT正在把基于语音的智能体能力扩展到手机端,用户可以直接在移动应用中进入Work,启动文档撰写、邮件总结等工作流,再回到桌面继续处理。
这次更新的重点不是“ChatGPT终于能在手机上语音聊天”,而是语音开始从对话入口变成任务入口。过去,手机端语音主要解决的是问答、头脑风暴和信息查询;现在,用户可以用一句更接近自然工作的指令,让ChatGPT开始执行一项需要多个步骤的任务。
OpenAI把这类任务能力放在ChatGPT Work中。Work是ChatGPT面向持续性工作流的任务空间,用户可以在其中提供文件、上下文和交付标准,让ChatGPT完成并持续跟进一项工作。
目前,Work在网页和移动端已经开始向Pro、Enterprise和Edu用户推出,Plus和Business用户将在未来几天陆续获得支持。桌面版ChatGPT则提供Chat、Work和Codex三个入口,并面向包括免费用户在内的所有套餐开放,但具体能力仍取决于账号、工作区设置和地区。

它和普通语音聊天到底有什么区别
普通语音聊天的核心是“你说一句,它回答一句”;Work中的语音智能体则更接近“你交代目标,它负责推进任务”。
例如,普通语音模式适合问:“帮我解释一下这份报告的结论。”而Work语音更适合说:“把这份报告整理成一页管理层摘要,保留三个关键数据,语气正式,最后列出需要进一步确认的问题。”
两者的区别不在于有没有麦克风,而在于模型是否需要围绕一个目标持续行动。Work任务通常包含以下几个步骤:
- 理解用户希望得到的最终结果;
- 读取用户提供的文件、邮件或其他上下文;
- 组织内容、生成草稿或提炼结论;
- 根据用户反馈修改结果;
- 在任务尚未完成时保留进度和后续要求。
**语音智能体是能够通过自然语言接收目标、调用工作上下文并推进多步骤任务的AI助手。**它不只是把声音转成文字,而是把语音变成任务控制面板。
OpenAI此次强调的典型场景包括起草文档、总结邮件、查看长时间运行任务的状态,以及在移动途中审阅草稿。用户可以先在手机上说出需求,等任务完成或遇到阻塞后,再通过语音询问进度。
这对移动办公尤其重要。手机端不适合长时间编辑文档,但很适合发起任务、补充约束和快速审阅。Work移动端的定位并不是把桌面工作区原封不动搬到小屏幕上,而是让手机承担“指派任务”和“检查状态”的角色。
OpenAI想解决的,是工作流被设备切断的问题
ChatGPT此前已经能够在手机、网页和桌面应用之间同步普通对话,但普通对话同步和任务连续性并不是一回事。
一个普通聊天窗口同步到手机,意味着用户可以继续阅读历史消息;一个Work任务同步到手机,则意味着用户可以在不同设备上继续处理同一个工作目标。两者的差别类似于“打开同一个文档”和“加入同一个项目”之间的差别。
OpenAI给出的使用路径很直接:用户可以在手机ChatGPT中选择Work,开启新的聊天或打开现有项目,补充文件、任务目标和审阅标准,然后等待ChatGPT返回结果。回到桌面后,用户可以继续修改同一个工作线程,而不需要重新描述背景。
这种跨设备衔接更适合以下场景:
- 通勤途中启动任务:在地铁或出租车上,用语音要求ChatGPT整理会议材料;
- 会议间隙查看进度:不打开电脑,也能询问报告是否完成、目前卡在哪里;
- 移动端快速补充要求:发现新的约束条件后,直接说“把第三部分改成面向客户的版本”;
- 桌面端完成最终编辑:回到办公室后,在大屏幕上检查格式、数据和引用;
- 跨时间段推进项目:早上让ChatGPT起草,午间审阅,下午继续修改,而不是每次从零开始。
从产品设计上看,OpenAI正在把ChatGPT从“聊天记录集合”推进成“工作状态集合”。这也是Work与普通Chat之间最重要的区分。
但移动端并不是桌面版Work的完整复制品
目前最容易被误解的一点,是“手机端支持语音智能体”并不等于“桌面端所有Agent能力都已经完整移植到手机”。
根据OpenAI帮助文档,Work可以在网页和移动端使用,但Codex目前仍不是网页或移动端中的可选体验。桌面版macOS和Windows应用仍然承担更完整的语音任务入口,用户可以在桌面端通过语音启动Work或Codex任务、查看进度,并在一次对话中协调多个智能体。
换句话说,手机端这次更新主要解决的是Work任务的移动访问和语音控制,而不是让手机成为完整的开发工作站。
| 能力 | 移动端 | 网页端 | macOS/Windows桌面端 | |---|---|---|---| | 普通语音聊天 | 支持 | 支持 | 支持 | | Work任务空间 | 支持,分批开放 | 支持,分批开放 | 支持,取决于套餐 | | 通过语音启动Work任务 | 正在扩展 | 取决于当前版本与账号 | 支持 | | 通过语音启动Codex | 不作为独立体验提供 | 不作为独立体验提供 | 支持 | | 查看长任务进度 | 支持 | 支持 | 支持 | | 手机发起、桌面继续 | 支持云端Work任务 | 支持 | 支持 | | 本地桌面任务同步到手机 | 不一定支持 | 不一定支持 | 仅云端Work任务可跨设备延续 |
**云端Work任务可以在手机、网页和桌面之间继续,而只保存在某台电脑本地的任务不一定能够跨设备同步。**这一区别对重度用户非常关键:不要把桌面应用中的本地任务,和云端Work项目混为一谈。
GPT-Live让语音不再只是“语音转文字”
这次移动端更新建立在OpenAI今年7月推出的GPT-Live之上。GPT-Live是OpenAI面向实时语音交互设计的模型系列,重点是降低对话延迟、提高打断处理能力,并让语音与文本、图像等输入保持在同一个会话中。
根据OpenAI语音帮助文档,Live目前由GPT-Live-1或GPT-Live-1 mini提供支持,具体取决于用户套餐。它可以配合网页搜索、记忆和部分可视化组件使用,但目前仍不支持视频、屏幕共享、已连接应用或插件等所有外部能力。
这意味着,ChatGPT的移动语音体验仍然分为不同层次:
- Live模式:面向更自然、更连续的实时对话;
- 高级语音体验:用于部分支持视频或屏幕共享等移动能力的场景;
- 标准语音体验:先把语音转写成文字,再生成回复,交互更接近传统语音输入。
Work语音的价值,不只是模型说话更自然,而是模型能把语音内容和工作上下文结合起来。用户无需先口述一长串结构化提示词,再等待文本输入完成;只要交代目标、语气、限制条件和验收标准,系统就可以开始处理。
当然,语音并不天然等于高效率。复杂任务如果缺少边界,模型仍可能产生方向偏差。比如“总结一下最近的邮件”并不明确:是总结全部邮件,还是只总结未读邮件?时间范围是今天、过去一周,还是整个项目周期?是否需要区分外部客户和内部同事?
因此,语音智能体真正好用的前提,是用户能用口语说清楚四件事:要做什么、依据什么、输出给谁、怎样算完成。
与Anthropic的Cowork相比,OpenAI仍然在坚持“聊天”和“工作区”分离
这次更新也把OpenAI与Anthropic的产品路线差异暴露得更明显。
Anthropic近期把移动端与桌面端的衔接做得更紧,并逐步合并Cowork和Claude聊天界面。它的方向更像是把Agent能力直接嵌入主聊天入口,让用户不必在“聊天”和“工作空间”之间切换。
OpenAI则继续保留Chat、Work和Codex之间的边界。对于开发者和高频用户来说,这种分区有明显好处:普通问答不会轻易触发任务执行,长时间运行的工作流也不会被大量闲聊内容淹没。缺点同样明显——用户需要理解不同入口的权限、同步方式和能力范围。
| 对比项 | ChatGPT Work | Anthropic Cowork路线 | |---|---|---| | 产品定位 | 独立的持续性工作空间 | 更深度融入聊天与工作流 | | 移动端价值 | 发起任务、审阅结果、查看进度 | 移动与桌面连续工作 | | 入口设计 | Chat、Work、Codex分开 | 聊天与工作能力逐步合并 | | 适合场景 | 多步骤任务、项目型工作 | 对话式办公与连续协作 | | 主要问题 | 入口较多,权限边界复杂 | 工作模式与普通对话边界可能变模糊 |
我的判断是,OpenAI的分区策略更适合企业和专业用户,尤其是那些需要区分“随便问问”和“真正开始执行”的团队。但对普通用户而言,Work的存在感能否建立起来,取决于OpenAI能否让任务状态、文件上下文和历史结果足够透明。
对开发者和重度用户意味着什么
这次更新最值得关注的,不是手机上多了一个语音按钮,而是AI产品开始把“任务状态”作为跨设备体验的核心对象。
过去的AI产品主要同步消息;现在的Agent产品需要同步任务、权限、文件、进度、失败原因和后续动作。对于开发者来说,这意味着未来评估一个AI助手时,不能只看模型回答质量,还要看它能否稳定完成以下工作:
- 记住任务目标,而不是只记住最近一句话;
- 明确区分已完成、进行中和被阻塞的步骤;
- 在换设备后保留足够的上下文;
- 在执行高风险动作前要求确认;
- 允许用户随时纠正方向,而不必重启整个任务;
- 对文件、邮件、日历和第三方应用的访问权限进行清晰提示。
尤其是在企业场景中,语音启动任务会带来新的权限和审计问题。用户在开放办公环境中说出“总结我最近收到的客户邮件”,系统需要判断哪些邮件属于当前账号、哪些内容可以被模型读取,以及最终摘要是否会暴露敏感信息。
OpenAI目前已经在Enterprise、Edu、Healthcare和Business等工作区中提供管理员控制项,语音能力是否可用取决于工作区设置。对于企业部署来说,这比模型本身的语音表现更重要:一个无法被管理员关闭、无法追踪任务记录的Agent,很难进入正式业务流程。
现在要不要立刻用Work替代传统办公工具
我的答案是:可以把它当作“移动任务调度器”,但还不应该把它当作完全自动化的办公系统。
它最有价值的地方,是减少了从想法到任务之间的摩擦。用户不必等到坐在电脑前,才开始整理材料、写提纲或检查工作进度。对于经常出差、需要处理大量信息、或者在多个会议之间切换的人来说,这种能力确实有用。
但它并不适合完全无人审阅的场景。涉及合同、财务、客户承诺、医疗信息和内部机密的任务,都应该保留人工复核。语音输入还可能因为环境噪声、专有名词识别错误或上下文不完整而放大误差。
更现实的使用方式是把任务分成三层:
- 低风险任务交给它直接做:会议录音摘要、邮件分类、资料提纲、日程整理;
- 中风险任务让它先出草稿:客户回复、项目周报、竞品分析、内部汇报;
- 高风险任务只让它辅助:合同修改、财务判断、对外发布、权限变更。
从这个角度看,ChatGPT移动端的Work不是“手机上的全自动员工”,而是一台可以随时召唤的任务调度器。它负责让工作开始、保持连续,并把需要人工判断的节点推回给用户。
结语:手机端Agent的竞争,才刚刚开始
OpenAI此次更新释放出的信号很明确:语音正在从AI助手的交互方式,升级为Agent系统的控制方式。
ChatGPT移动端现在能够让用户用语音启动Work任务、检查进度,并在手机、网页和桌面之间继续处理同一项工作。Pro、Enterprise和Edu用户率先获得支持,Plus和Business用户将在未来几天陆续开放。与此同时,Codex仍主要停留在桌面端,移动端也不是所有Work能力的完整镜像。
这次更新目前还谈不上彻底改变移动办公。它真正完成的是第一步:让用户不必等到打开电脑,才开始给AI布置工作。
接下来,产品竞争的关键会从“谁的语音更像真人”转向“谁能把任务做得更稳”。包括跨设备状态同步是否可靠、任务失败能否解释、权限边界是否清晰、长任务是否真的能持续运行,以及用户能否用最少的确认完成最多的工作。
如果这些问题能够解决,手机就不再只是ChatGPT的问答终端,而会成为AI工作流的启动器。Work走向移动端,意味着ChatGPT开始从“随时可以聊天”进一步走向“随时可以开工”。
参考来源
- ChatGPT相关话题检索|知乎:用于补充查看国内用户对ChatGPT Work和移动端Agent功能的讨论。
- ChatGPT相关讨论|Reddit:用于观察海外用户对Work、语音智能体和跨设备使用体验的反馈。
- OpenAI官方公告与帮助中心:本文关于Work的上线节奏、套餐范围、GPT-Live语音能力、移动端与桌面端差异的事实信息,依据OpenAI官方产品公告及帮助文档整理。由于本文按要求仅保留指定国内可访问域名链接,未附OpenAI官方域名直链。
- TechCrunch《ChatGPT mobile app gets voice-based agentic features》:本文所述9月23日移动端语音智能体更新的原始报道依据。



