GPT-5.5看得见,却不会动

ActiveVision 最新测试显示,GPT-5.5 得分仅为 10.6%,远低于人类的 96.1%。模型能识图、写代码,却仍难以在变化环境中持续观察并主动操作。
GPT-5.5 在主动视觉测试中只拿到 10.6%
GPT-5.5 在新基准 ActiveVision 上只解决了 10.6% 的测试项目,并在 17 项任务中的 11 项得分为零。同期参与评测的 Claude Fable 5 得分更低,仅为 3.5%;三名人类参与者的平均成绩则达到 96.1%。
这组结果来自本周公开的预印本论文,论文编号为 arXiv:2607.16165。研究者使用了 GPT-5.5 对外开放的最高推理强度档位,但它与人类之间依然相差 85.5 个百分点;按得分比例计算,人类成绩约为 GPT-5.5 的 9.1 倍。

ActiveVision 是一套测试模型能否通过反复观察、判断和操作完成视觉任务的基准,而不是让模型对一张静态图片做一次性描述。它包含 17 项任务,分属 3 个类别,设计目标是迫使模型持续获取新的视觉信息,而不能只靠第一眼生成答案。
| 参与者或模型 | ActiveVision 得分 | 零分任务 | 与人类差距 | |---|---:|---:|---:| | GPT-5.5(最高公开推理强度) | 10.6% | 11/17 | 85.5 个百分点 | | Claude Fable 5 | 3.5% | 论文摘要未单列 | 92.6 个百分点 | | 人类参与者(3 人平均) | 96.1% | 未披露 | — |
GPT-5.5 虽然比 Claude Fable 5 高出 7.1 个百分点,得分约为后者的 3 倍,但这并不意味着它已经接近可用。10.6% 在真实产品里意味着绝大多数操作链都会中途失败,而 11 项任务直接归零,则说明模型面对的不是偶发识别错误,而是一整类能力缺失。
ActiveVision 测的不是“看图答题”
主动视觉是智能体根据当前观察主动选择下一步动作,并利用动作带来的新画面继续推理的能力。它与传统视觉问答最大的区别在于,输入不是固定的:模型点击、移动、缩放或改变视角之后,环境会发生变化,模型必须重新确认状态。
传统多模态评测更像把一张卷子拍下来交给模型,而 ActiveVision 更像让模型坐到电脑前亲自完成任务。前者只需要把图像压缩成一次性的语义表示,后者则要求模型循环执行“观察—形成假设—采取动作—检查结果—修正计划”。
这个差别看起来只是多了几轮交互,实际却把错误来源成倍放大。一条包含 10 个步骤的操作链,即使模型每一步成功率都有 90%,整条链全部正确的概率也只有约 34.9%;如果单步可靠性降至 80%,最终成功率会跌到约 10.7%,恰好接近 GPT-5.5 此次的整体成绩。
ActiveVision 因此暴露的是系统级可靠性,而不只是单张图片的识别准确率。模型可能第一步看对了按钮,第二步却没有确认点击是否生效;也可能正确识别局部元素,却忘记当前任务进行到了哪里;还可能在操作失败后继续沿用旧状态推理,最终让整条行动链偏离目标。
同一个 GPT-5.5,静态视觉能拿 76.12%
GPT-5.5 的低分不能简单归结为视觉编码器太弱,因为它在静态视觉测试中的表现并不差。Roboflow 公布的第三方 Vision Evals 显示,GPT-5.5 综合准确率为 76.12%,在 63 个参评模型中排名第四。
| 测试项目 | GPT-5.5 成绩 | 主要考察能力 | |---|---:|---| | Roboflow Vision Evals 综合成绩 | 76.12% | 静态图像理解与视觉问答 | | 文档理解 | 88.9% | OCR、版面结构和文字关系 | | 缺陷检测 | 86.7% | 发现图像中的异常区域 | | 对象理解 | 85.7% | 识别物体及其语义属性 | | 精确计数 | 30.0% | 对重复目标进行准确计数 | | ActiveVision | 10.6% | 反复观察、操作与状态更新 |
这两组成绩并不矛盾,反而清楚展示了前沿模型能力的“锯齿状边界”。GPT-5.5 可以读懂复杂文档、判断物体属性,也能在缺陷检测任务中取得 86.7%,但一旦视觉信息需要随着动作持续更新,它的能力就从 70%—80% 档位跌到 10.6%。
第三方分析认为,GPT-5.5 采用了基于 32×32 patch 的视觉编码方式,这有利于处理高分辨率文档、图表和结构化布局。Patch 可以理解为模型观察图片时使用的小方格:图片先被切成网格,再转换为视觉 token 进入模型。它能帮助模型“读懂画面”,却不会自动赋予模型稳定的行动闭环。
精确计数只有 30% 也是同一种问题的较轻版本。模型可以知道画面里有很多相似物体,却容易重复计算、遗漏目标或失去空间对应关系;在主动操作里,这种空间追踪误差还会与历史状态、动作反馈和任务目标叠加,最终形成连续失败。
会写代码,也没有补上视觉闭环
ActiveVision 最值得关注的发现不是前沿模型又输掉了一次新跑分,而是模型无法靠自己写代码修补能力缺口。论文专门观察了模型能否生成辅助程序来完成任务,但代码能力没有顺利转化为主动视觉能力。
这对 GPT-5.5 尤其刺眼,因为编码和智能体执行正是它这一代的主打方向。公开数据中,GPT-5.5 在 Terminal-Bench 2.0 上达到 82.7%,比 GPT-5.4 提高 7.6 个百分点;BrowseComp 成绩为 84.4%,提高 1.7 个百分点。GPT-5.5 Pro 在 BrowseComp 上还可以达到 90.1%。
| 基准 | GPT-5.5 成绩 | 任务性质 | 能否直接代表主动视觉 | |---|---:|---|---| | Terminal-Bench 2.0 | 82.7% | 终端环境中的编码与执行 | 不能 | | BrowseComp | 84.4% | 浏览、检索与信息整合 | 不能 | | GPT-5.5 Pro BrowseComp | 90.1% | 更高强度的浏览推理 | 不能 | | ActiveVision | 10.6% | 视觉反馈驱动的连续操作 | 可以直接衡量 |
代码不能救场的原因并不神秘:程序可以放大、裁切、标记和比较图像,却不能替模型决定什么时候应该重新观察,也不能保证模型正确理解程序输出。只要模型对环境状态的表征已经错了,它就可能写出逻辑正确但输入错误的工具,然后更自信地沿着错误路径前进。
主动视觉真正缺少的是“感知策略”,而不是另一个图像处理函数。一个可靠智能体需要知道当前证据是否充分、某次点击有没有成功、界面是否发生了预期变化,以及什么时候应该放弃原计划重新定位目标。这些判断无法靠一次代码生成完成。
高推理强度为什么仍然不够
增加推理 token 主要改善的是模型在已有信息上的搜索深度,却无法保证它主动获得了正确的新信息。模型如果从第一帧就误认目标位置,后续再长的思维链也可能只是在错误地图上做更复杂的规划。
视觉行动任务至少同时依赖四层能力:
- 视觉定位能力:准确找到目标元素,而不只是说出画面中“存在一个按钮”。
- 状态记忆能力:记住已经执行的动作、当前进度与环境变化。
- 反馈校验能力:每次操作后确认结果,而不是默认动作已经成功。
- 恢复规划能力:发现界面不符合预期时回退、重试或更换策略。
任何一层出现短板,都会让高推理强度失去意义。当前模型常见的工作方式是先根据首帧形成一个完整计划,再连续执行多个动作;人类则更倾向于每做一步就扫一眼界面,用低成本反馈修正下一步。后者看起来没有长篇推理,实际却拥有更密集的闭环校验。
人类 96.1% 的成绩说明这些任务并非依靠冷门知识或超人视觉才能完成。尽管只有 3 名人类参与者,样本规模不足以代表完整人群分布,但接近满分的平均结果仍足以表明:ActiveVision 的主要难点来自模型架构和交互策略,而不是任务本身含糊不清。
10.6% 对视觉智能体意味着什么
ActiveVision 的结果直接给“截图驱动型智能体”泼了一盆冷水。只要产品需要模型根据连续截图控制桌面软件、网页、工业界面或远程设备,静态视觉问答跑分就不能作为可靠性的替代指标。
浏览器智能体可能因为 DOM 和无障碍树而显得比纯视觉智能体成熟。结构化页面会直接告诉模型某个元素是按钮、输入框还是链接,相当于给它一份机器可读的地图;ActiveVision 这类任务则更接近只给截图,让模型自己完成定位和状态跟踪,难度自然更高。
机器人场景面临的风险还会进一步放大。网页点错按钮通常可以撤销,但机械臂抓错位置、移动设备误判障碍物或工业系统重复执行指令,都可能产生物理成本。10.6% 的成功率意味着这类模型目前更适合作为建议者和异常提示器,而不是脱离监督的最终执行者。
现阶段更现实的产品路线是限制动作空间,并给视觉模型加上外部校验。开发者可以让模型每次只选择少量预定义动作,要求关键操作前后保存截图,对高风险步骤使用传统视觉算法或规则系统复核,并在状态变化不明确时强制停止,而不是让模型凭自然语言计划一路执行到底。
GPT-5.5 仍然强,但强得并不均匀
GPT-5.5 不是一款视觉能力差的模型,而是一款在视觉语义理解和视觉行动之间存在巨大断层的模型。它在文档、对象和缺陷理解上表现靠前,在终端编码与网页研究中也有领先成绩,但这些能力尚未组合成稳定的主动操作系统。
这种断层也解释了为什么演示视频常常比真实部署更惊艳。演示可以挑选成功路径、固定窗口尺寸并避免意外弹窗,生产环境却会出现加载延迟、遮挡、动画、焦点丢失和状态不同步;模型只要漏掉一次反馈,后续步骤就可能全部失效。
价格同样会放大这一问题。GPT-5.5 的公开价格为每百万输入 token 5 美元、每百万输出 token 30 美元,上下文窗口为 100 万 token;GPT-5.5 Pro 则分别达到 30 美元和 180 美元。主动视觉需要重复上传画面并进行多轮推理,如果成功率仍只有 10.6%,更高推理预算很容易变成昂贵的重复试错。
| 模型 | 输入价格 | 输出价格 | 上下文窗口 | ActiveVision 已披露成绩 | |---|---:|---:|---:|---:| | GPT-5.5 | 5 美元/百万 token | 30 美元/百万 token | 100 万 token | 10.6% | | GPT-5.5 Pro | 30 美元/百万 token | 180 美元/百万 token | 公开信息未在论文摘要中对应说明 | 未单列 |
ActiveVision 的价值正在于把“会看”和“会做”拆开评估。模型读懂一张截图,并不等于它能在十张连续截图中保持同一目标;模型会生成自动化脚本,也不等于它能判断脚本何时失效。对开发者而言,这比又一个综合多模态分数更接近真实产品问题。
真正的突破要看闭环成功率
下一代视觉智能体的关键指标不应只是单帧准确率,而应包括长链任务成功率、动作后复核率、错误恢复率和平均无故障步数。只有这些指标同步提高,模型才可能从“能解释界面”走向“能可靠操作界面”。
GPT-5.5 的 10.6% 也不意味着主动视觉没有进展空间。模型厂商可以引入更细粒度的视觉记忆、显式状态表示、动作前后差分检测,以及针对失败恢复的强化学习;基准设计者则需要继续区分识别错误、动作错误、记忆错误和恢复失败,避免把所有问题压成一个总分。
目前最稳妥的结论是:GPT-5.5 已经是强大的静态视觉理解模型和编码模型,但还不是可靠的视觉操作模型。它看得懂很多东西,也能写出复杂程序;真正困难的是让它在每一次动作之后重新看清现实,并承认现实可能没有按计划发展。
参考来源
- Hugging Face Papers:ActiveVision 论文页面:对应预印本 arXiv:2607.16165,可查看论文摘要与基础信息。
- Reddit /r/MachineLearning 讨论帖:汇总 GPT-5.5、Claude Fable 5 和人类参与者的 ActiveVision 成绩及社区讨论。
- 知乎:GPT-5.5 实测与产品取向分析:从工程交付、稳定性和使用成本角度讨论 GPT-5.5 的实际表现。



