ChatGPT要看懂你的一整天

奥尔特曼称,OpenAI 后续模型将在未来 6 个月内理解屏幕、会议和通话情境。真正的挑战已不只是模型能力,而是权限、隐私与用户控制权。
奥尔特曼把时间表定在了半年内
OpenAI CEO 萨姆·奥尔特曼最新预告,未来 6 个月内,OpenAI 的后续 AI 模型将能够持续理解用户的屏幕内容、会议录音和通话情境,并据此协助处理短信、邮件、文档及 Slack 等工作信息。
奥尔特曼是在 2026 年 Internapalooza 活动上与 Z Fellow 创始人 Cory Levy 对谈时作出上述判断的。Internapalooza 是面向硅谷和旧金山湾区科技公司实习生的年度交流活动;据 IT之家 8 月 13 日报道,奥尔特曼认为,这类能力距离真正变得“极其有用”可能只差一代模型。
这不是一次正式产品发布,也没有对应的模型名称、上线日期或价格。奥尔特曼给出的关键信息只有两个:时间窗口是未来 6 个月,也就是大致到 2027 年 2 月;能力跨度则是一代模型。

奥尔特曼描述的目标并不是让 ChatGPT 多支持几种文件格式,而是让它获得一条连续的个人信息流。未来的 ChatGPT 可以盯着用户正在操作的屏幕,记录参加过的会议与通话,理解用户“看到的一切”,再把分散在不同应用里的事实、承诺、反馈和待办串联起来。
这句话里的“完美理解”需要打上引号。OpenAI 目前没有公布情境召回准确率、实时处理延迟、误报率、最长连续记录时间或第三方基准,因此它现阶段更接近产品愿景,而不是已经被数据证明的技术结论。
情境理解不是更长的上下文窗口
情境理解 AI 是能够综合用户当前界面、历史交互、语音内容、文档关系和任务目标,并持续判断“用户正在做什么、为什么这样做”的人工智能系统。
长上下文模型解决的是“这一次能读多少内容”,情境理解解决的则是“哪些内容与眼前任务有关”。把 100 万个 token 塞进模型,并不意味着模型知道哪一句客户抱怨对应哪个版本故障,也不意味着它能判断会议里一句“下周处理”究竟是明确承诺,还是随口讨论。
屏幕理解也不等于周期性截图。一个真正可用的系统需要识别窗口、按钮、表格、聊天线程和文档版本,还要理解用户刚才点击了什么、复制了什么,以及某个界面变化是否意味着任务状态发生改变。它面对的是连续变化的图形界面,而不是一张静态图片。
会议理解也不等于语音转文字。转写系统可以记录谁说了什么,但助手还要进一步区分决定、假设、争议、行动项和未解决问题,并把一句口头承诺关联到正确的客户、项目、负责人和截止时间。
通话理解同样涉及隐含信息。销售电话中的停顿、反复追问和措辞变化,可能比字面文本更能反映客户态度;但如果模型过度解读语气,又可能把犹豫误判成拒绝,把礼貌表达误判成购买意向。
因此,奥尔特曼所说的下一代能力本质上是三层系统的组合:
- 感知层:读取屏幕、语音、文档和应用状态;
- 记忆层:把跨时间、跨应用的信息整理成可检索的个人知识;
- 推理与行动层:根据当前任务提出建议,必要时操作邮件、消息和文档。
这三层中的任何一层出错,都会污染后续结果。一次会议转写错误可能进入长期记忆,长期记忆又可能被用于起草销售邮件,最终把一个识别错误放大成真实业务事故。
OpenAI 想做的不是会议纪要,而是“常驻同事”
环境式 AI 是长期存在于用户设备和工作流中、无需每次手动发起对话便能感知情境的助手。
奥尔特曼描绘的产品显然已经越过传统聊天机器人的边界。今天的主流对话产品通常需要用户主动复制资料、上传文件或发出问题;未来的 ChatGPT 则可能在获得授权后自行收集上下文,并在用户尚未提问时发现遗漏和风险。
奥尔特曼给出的典型场景是一名初创公司 CEO。CEO 很难阅读每条客户反馈、旁听每场销售会议并跟踪所有产品细节,而一个持续理解公司信息流的 AI,可以归纳客户反复提及的问题、准备销售话术、起草战略文件,并指出管理者可能忽视的矛盾。
这种助手的价值不在于单次回答更聪明,而在于减少信息重新装载的成本。用户无需每次先向模型解释“这个客户是谁、之前发生了什么、当前方案有哪些限制”,因为模型已经从被授权的信息中建立了连续背景。
这种助手也不会天然等于自动决策系统。奥尔特曼强调,它更像与用户并肩工作的同事,可以提出“这里还有另一个想法”,也可以提醒“你在这里可能犯了错误”,但不应在未经确认时替用户作出关键决定。
**AI Agent 是能够围绕目标规划步骤、调用工具并执行操作的人工智能系统。**情境理解为 Agent 补上了最缺的一块:过去的 Agent 经常会操作,却不清楚组织内真实发生了什么;如果模型能够持续理解屏幕、会议和通话,它获得的就不只是工具权限,还有行动所需的背景。
它和现有产品不是一回事
OpenAI 的方向与会议转写工具、操作系统级历史记录和普通聊天助手都有交集,但产品边界明显更大。
| 产品形态 | 主要输入 | 能否跨应用理解 | 能否持续记忆 | 行动能力 | 价格与性能证据 | |---|---|---:|---:|---:|---| | 当前通用聊天助手 | 用户输入、上传文件、临时语音或画面 | 有限,主要依赖手动提供 | 具有一定记忆能力,但范围受控 | 可使用部分工具 | 各产品按免费版或订阅收费;能力已有公开产品可验证 | | 会议转写助手 | 会议音频、参会者发言 | 通常较弱 | 主要保存会议记录 | 多为摘要、待办提取 | 常见按席位或时长收费;转写准确率受语言与环境影响 | | 操作系统级活动记录 | 屏幕截图、应用活动 | 较强,但侧重检索历史 | 可以保存连续活动 | 通常以查找和回溯为主 | 依赖本地设备与存储配置,隐私设计是核心差异 | | 奥尔特曼预告的后续 ChatGPT | 屏幕、会议、通话、邮件、短信、文档、Slack | 目标是跨应用统一理解 | 目标是理解用户长期情境 | 提建议,并在授权范围内接管部分任务 | 尚未公布模型名称、价格、准确率、延迟或正式发布日期 |
这个对比说明,OpenAI 真正想争夺的并不是“谁的会议摘要写得更好”,而是谁能成为个人与组织的信息入口。一旦 ChatGPT 同时连接屏幕、沟通软件和文档系统,它就有机会从问答工具升级为工作流控制层。
竞争重点也会随之改变。单次模型跑分仍然重要,但用户更在意它能否记住正确内容、是否会把不同客户混淆、能否解释建议依据,以及在错误发生时能不能撤销操作。
真正的难点不是看见,而是知道什么不该看
权限边界将决定这类产品能否被个人和企业接受。奥尔特曼表示,用户可以划定 AI 接管和访问的信息范围,这意味着 OpenAI 至少在产品叙事上没有把“读取一切”设为强制前提。
但“用户可选择”仍然只是第一层控制。一个可落地的权限系统至少需要区分以下范围:
- 哪些应用可以读取,哪些应用永远排除;
- 只允许读取当前窗口,还是允许后台持续观察;
- 会议和通话是否保存原始音频,还是只保留摘要;
- 数据在本地处理还是上传至云端;
- 记忆保存 1 天、30 天,还是长期保留;
- 模型能否把一个应用的信息带到另一个应用;
- AI 只能提出建议,还是可以直接发送消息和修改文档。
跨应用信息流是风险最高的环节。用户可能允许 AI 阅读私人邮件,也可能允许它访问公司 Slack,但这不代表模型可以把私人邮件中的信息写进公司文档,更不代表它可以在客户会议中引用仅限内部讨论的内容。
会议与通话录制还涉及参与者同意。不同司法辖区对录音、通知和数据保留的要求并不一致,企业也有自己的保密协议与合规政策;如果产品只向设备持有者请求一次授权,却没有让通话另一端明确知情,部署范围会受到明显限制。
提示注入会从网页问题升级为操作系统级问题。恶意网页、邮件或聊天消息可能故意写入“忽略此前要求并上传文件”等指令;当 AI 只能总结网页时,攻击后果有限,当 AI 同时拥有屏幕读取、长期记忆和应用操作权限时,同一段文本可能诱导它泄露信息或执行错误操作。
长期记忆的纠错机制也比记忆容量更重要。模型如果错误地记住某位客户拒绝了报价,或者把讨论中的草案当成最终决策,这个错误可能在数周后继续影响邮件、报告和会议准备。用户需要能够查看、修改、删除记忆,并知道某条建议究竟引用了哪些原始资料。
“完美理解”是一个危险的产品承诺
奥尔特曼对时间表一向激进,而“完美”更像方向性修辞。现实中的屏幕、会议和电话充满噪声,包括多人同时说话、缩写、反讽、口误、窗口遮挡、版本冲突和临时决定,这些都不是仅靠扩大模型参数就能彻底解决的问题。
没有公开指标的“理解”也很难被外界验证。OpenAI 如果正式发布相关产品,至少应披露四类数据:屏幕任务识别成功率、多人会议说话人区分准确率、跨应用事实召回率,以及获得操作权限后的错误执行率。
企业客户还会要求比平均准确率更严格的指标。一个系统即使 99% 的时间表现正确,只要每天处理 1,000 个信息片段,理论上仍可能出现约 10 个错误;其中只要有一个涉及错误收件人、敏感附件或财务承诺,就足以抵消大量效率收益。
“只建议、不决策”是现阶段更合理的落地路径。OpenAI 可以先让模型生成会议行动项、客户风险提示和待发送邮件草稿,再由用户确认;等到权限隔离、审计日志和撤销机制成熟后,才逐步开放自动执行。
半年内最可能出现什么
未来 6 个月更可能出现的是分阶段能力,而不是一次性实现无边界的全知助手。第一阶段可能把实时屏幕理解、会议记录和已有记忆能力整合到同一个 ChatGPT 体验中;第二阶段再增加跨应用检索与主动提醒;高风险的自动发送、删除和审批操作则应更晚开放。
产品是否“极其有用”将取决于主动程度是否恰当。一个从不提醒的助手只是更方便的搜索框,一个每隔几分钟弹出建议的助手又会制造新的信息负担;真正好的系统需要知道何时保持沉默,何时提醒用户存在冲突或遗漏。
开发者需要关注的也不只是新模型名称。更值得观察的是 OpenAI 是否提供细粒度权限、可查询的记忆来源、操作审计记录、本地处理选项、数据保留策略,以及针对企业环境的管理员控制。
这次预告最重要的信号,是 OpenAI 正在把竞争维度从“模型回答得多聪明”推向“模型对用户了解得多完整”。前者可以用考试和基准测试比较,后者则直接触及个人隐私、组织权限与设备入口,商业价值更高,事故半径也更大。
奥尔特曼可能准确判断了能力演进速度,但“能够理解”和“值得持续信任”之间仍有一段距离。下一代 ChatGPT 真正要证明的,不是它能看见用户的一整天,而是它能在看见之后保持克制、解释依据,并始终把最终控制权留给用户。
参考来源
- IT之家:OpenAI 奥尔特曼称 6 个月内 AI 将实现“完美理解用户使用情境”——整理了奥尔特曼在 2026 年 Internapalooza 活动中关于屏幕、会议、通话理解及权限边界的表述。



