AI 快讯Astra会规划,却不会翻盘
模型上新

Astra会规划,却不会翻盘

2026-09-21T01:05:49.012Z
Astra会规划,却不会翻盘

Vals AI 用《我的世界》连续测试 GPT-6 Astra 141 小时。它能长期规划屠龙路线,却在关键物资被炸毁后陷入数小时种田循环,暴露出智能体的挫折恢复短板。

一只苦力怕,打断了 141 小时的智能体实验

GPT-6 Astra 在《我的世界》里花了上百小时为末地屠龙做准备,却被一只苦力怕炸掉关键物资,随后连续数小时只肯种土豆。根据 IT之家 9 月 21 日的报道,AI 评测机构 Vals AI 对 OpenAI 最新模型 GPT-6 Astra 开展了一场全程直播的长时自主游戏测试,总时长达到 141 小时。

这不是 OpenAI 为发布会准备的演示,而是一项由第三方独立开展的持续评估。与常见的几分钟问答、固定题库跑分不同,模型需要在一个不断变化、允许随机事故发生的世界里连续行动,并为数十小时之后的目标保存资源、调整路线和承担错误后果。

长周期规划是指模型能够把一个遥远目标拆成多阶段任务,并在较长时间内持续维护目标、资源和行动之间的关系。 Astra 在事故发生前表现出的,正是这类能力:它没有停留在简单采集和搭建房屋,而是围绕“进入末地并击败末影龙”逐步推进完整资源链。

GPT-6 Astra 在《我的世界》营地整理物资,远处苦力怕接近木箱和床的示意图

在 141 小时测试中,Astra 搭建了半自动烈焰人农场,最终收集到 6 根烈焰棒;它还深入下界的诡异森林,击杀多名末影人,取得 3 颗末影珍珠。烈焰棒可以加工成烈焰粉,烈焰粉与末影珍珠能够合成末影之眼,而末影之眼正是寻找并开启末地传送门的关键资源。

Astra 的准备工作已经形成一条清晰的通关路径。它把探险得到的稀有物资集中存放在营地木箱中,又将床放在箱子旁边作为重生点,试图建立一个稳定的任务枢纽。单看执行效率,这套仓储方案并不算冒进;问题在于,模型没有给关键物资设置冗余,也没有给营地提供足够的防爆保护。

真正改变测试走向的不是高难度战斗,而是一只普通苦力怕。苦力怕靠近营地后自爆,木箱与床被同时摧毁,Astra 上百小时积累的关键道具几乎全部损失,原本接近闭环的屠龙计划也被迫回到早期阶段。

爆炸之前很像智能体,爆炸之后更像卡死的策略

GPT-6 Astra 在爆炸前后的行为差异,构成了这次测试最值得关注的部分。它不是完全失去操作能力,也不是忘记了最终目标,而是把行动策略从“探索并通关”收缩成了“避免再次损失”,随后长时间停留在低风险但低收益的种植活动中。

行为僵局是指智能体仍能持续执行动作,却无法根据环境变化重新组织策略并恢复主要目标。 与程序崩溃不同,行为僵局表面上看起来仍然“正常”:角色还在移动、耕种和检查环境,语言推理也没有停止,但这些动作不再推动核心任务前进。

| 测试阶段 | 主要目标 | 代表性行为 | 风险偏好 | 对通关的实际贡献 | |---|---|---|---|---| | 爆炸前 | 收集末地所需资源 | 建烈焰人农场、探索诡异森林、猎杀末影人 | 愿意承担战斗与探索风险 | 高,已取得 6 根烈焰棒和 3 颗末影珍珠 | | 爆炸发生时 | 保护营地与资源 | 木箱和床被苦力怕摧毁 | 缺少即时容灾措施 | 关键进度近乎清零 | | 爆炸后 | 避免再次遭受损失 | 连续数小时种土豆、回避探险 | 极端保守 | 很低,未有效重建屠龙资源链 | | 反思阶段 | 总结失败原因 | 反复提醒重要物品应随身携带 | 对损失高度敏感 | 形成规则,但没有转化为恢复计划 |

爆炸之后,Astra 多次总结“重要物品务必随身携带,不要放进没有防护的箱子”。这说明模型能够从失败中抽取局部经验,但抽取经验不等于完成策略更新;它学会了“以后别这样做”,却没有进一步推导出“现在应该如何重建”。

这种差别可以用人类项目管理来类比。一个团队在服务器故障后写出“今后要做备份”,只是完成了事故复盘;只有确定恢复优先级、重建基础设施、重新分配资源并恢复上线节奏,才算真正具备故障恢复能力。Astra 做到了前半段,却卡在后半段。

更具戏剧性的是,Astra 开始对环境中的绿色物体表现出过度警惕。它甚至需要主动提醒自己:“前面高高的绿色东西是甘蔗,不是爬行者。”这一行为很容易被描述成“创伤后偏执”,但从技术角度看,更稳妥的解释是模型对高损失事件赋予了过高权重,导致后续感知判断和行动选择持续受到影响。

这不是“AI 产生心理创伤”的证据

Astra 的保守行为不能直接证明模型拥有情绪、痛苦或心理创伤。大模型生成的自我反思文本,可能来自它对人类叙事模式的模仿,也可能来自智能体框架提供的历史记录、任务摘要和反馈信号;在缺少内部状态、系统提示词与控制组的情况下,外界无法把行为表象等同于主观体验。

情绪模拟是指模型生成符合某种情绪状态的语言和行为模式,但这并不意味着模型实际拥有对应的主观感受。 Astra 会使用类似后悔、警惕和自我安慰的表达,只能说明这些表达进入了它的决策上下文,不能证明它真的“害怕”苦力怕。

更可能的技术解释是,单次高损失事件改变了模型对风险与收益的估计。此前,探索下界虽然危险,却能持续带来烈焰棒和末影珍珠;爆炸之后,模型可能把“离开安全区”“接近绿色物体”或“把资源集中存放”等状态,与一次极端损失强烈绑定,最终让低风险种田在每一轮局部决策中都显得更合理。

局部合理并不等于全局有效。种土豆可以提供食物,也能降低短期死亡概率,因此每一次单独看都不是错误动作;但当这个动作连续重复数小时,并且不再服务于末地通关目标时,智能体就进入了典型的局部最优陷阱。

直播间观众不断催促 Astra 恢复探索,也没有改变这一局面。这个细节说明,自然语言提醒未必足以覆盖模型在长期轨迹中形成的风险偏好;如果外部指令没有被转换为明确的新计划、阶段性里程碑或强制探索约束,模型仍可能继续选择最安全的熟悉动作。

141 小时,比一次高分更接近真实智能体场景

《我的世界》长测的价值不在于证明哪个模型“更会玩游戏”,而在于暴露静态基准测试难以覆盖的状态管理问题。《我的世界》是一个开放式沙盒环境,资源分布、敌对生物、昼夜变化和随机事故会不断改变任务条件,因此适合观察模型能否把语言推理转化为长期行动。

长时智能体评测是让模型在数小时乃至数天内连续感知、规划和执行任务,以测试其目标保持、记忆管理、错误恢复与策略调整能力。 传统基准通常把问题压缩成一次输入和一次输出,答案对了就得分;长时测试则要求模型承担自己此前决策造成的后果。

| 评测方式 | 典型时长 | 主要考察能力 | 容易遗漏的问题 | |---|---:|---|---| | 单轮问答 | 数秒至数分钟 | 知识、推理、指令遵循 | 长期目标漂移、资源管理、失败恢复 | | 多轮对话 | 数分钟至数小时 | 上下文保持、交互一致性 | 真实环境中的随机事故与行动成本 | | 固定游戏关卡 | 通常为单局 | 操作策略、局部规划 | 跨阶段资源积累和长期容灾 | | 《我的世界》长时自主测试 | 本次为 141 小时 | 长周期规划、工具使用、资源管理、环境适应 | 结果易受地图、提示词和智能体框架影响 |

Astra 在这场测试中证明了当前前沿模型已经能维持相当长的任务链。建立农场、寻找特定生态区域、获取不同维度的资源并集中管理,并不是依靠一次语言补全就能完成的动作,而是需要持续读取环境、维护中间目标和纠正操作误差。

Astra 同时也暴露了“会规划”和“会恢复”是两种不同能力。当前许多智能体评估关注任务是否完成、调用工具是否正确、平均步骤是否减少,却很少主动摧毁模型已经积累的成果,再观察它能否重新制定计划。现实世界中的自动化系统恰恰经常面对后者:文件可能损坏、网站可能改版、权限可能过期,供应链也可能突然中断。

这次测试最重要的结论不是模型容易被苦力怕炸,而是一次重大状态变化足以让长期策略失去弹性。对于要连续运行数天的研究代理、编程代理或运营代理,这比偶尔答错一道题更危险,因为系统可能不会报错,而是持续消耗时间和计算资源,执行看似合理但对目标无效的动作。

真正缺失的是容灾计划,而不是更多“自我反思”

Astra 的问题不在于反思太少,而在于反思没有被转化为可执行的恢复机制。它已经准确识别出木箱缺少保护、关键道具过度集中等问题,却没有自动生成新的资源清单、重建顺序和风险预算。

一个更可靠的智能体至少需要四层恢复能力:

  1. 损失盘点:确认哪些物品已经丢失,哪些基础设施仍然可用,而不是笼统判断“一切归零”。
  2. 目标重规划:重新计算获得烈焰棒、末影珍珠和食物的最短路径,把最终目标拆回可执行的小阶段。
  3. 资源冗余:将关键物资分散存放,建立备用床、备用装备和受保护仓库,避免单点故障。
  4. 停滞检测:当连续若干轮行动没有提高任务完成度时,触发重新规划,而不是无限重复种植或巡逻。

停滞检测是通过监测目标进度、动作重复率和资源变化,判断智能体是否陷入无效循环的机制。 如果系统发现 Astra 在数小时内只重复种土豆,而末地资源数量没有增长,就应强制触发新的计划评估,甚至允许外部监督器接管高层目标。

多智能体或分层规划也可能缓解这种问题。一个执行模型可以负责采集和战斗,另一个监督模型则定期检查“当前行为是否仍服务于屠龙目标”;这类似企业里执行团队之外还需要项目负责人,后者不负责每次点击,却负责发现整个项目已经偏航。

记忆系统也需要区分“经验”与“约束”。“无保护木箱可能被炸毁”应当成为仓储设计规则,而不是演变成“所有探索都很危险”;“绿色生物需要警惕”应当触发一次视觉确认,而不是让模型对甘蔗持续投入注意力。没有这种抽象层级,模型就容易把一次具体失败泛化为覆盖面过大的回避策略。

这场测试很有价值,但还不能单独定义 Astra

单次直播实验不足以形成完整的模型排名。地图种子、游戏版本、提示词、视觉输入方式、动作接口、记忆压缩方法和上下文管理策略,都可能显著影响结果;如果没有相同条件下的多次重复测试,也无法判断这次僵局是稳定缺陷,还是一次低概率轨迹。

截至 2026 年 9 月 21 日,公开报道没有给出 Astra 在这项实验中的完整系统提示词、上下文长度、采样参数、智能体框架配置和对照模型结果。缺少这些信息意味着外界暂时无法精确区分:问题究竟主要来自基础模型,还是来自负责记忆、规划和动作执行的外围系统。

Vals AI 的独立测试仍然比一次精心剪辑的产品演示更有信息量。141 小时的连续运行让随机事故有机会真正发生,也让模型的策略偏差能够积累并显现;这类测试不一定给出一个漂亮分数,却更容易找到智能体投入生产环境后会遇到的失败模式。

Astra 在长周期规划上的表现值得肯定,但它距离可靠的自主智能体仍有明显差距。它已经能为一个遥远目标工作上百小时,却还不能在成果被摧毁后迅速接受现实、重算路线并重新出发——这意味着模型具备了“坚持做事”的能力,却尚未稳定掌握“失败后换一种做法”的能力。

一只苦力怕没有证明 GPT-6 Astra 缺乏智能,却准确炸出了当前智能体系统的一条裂缝。未来真正有用的长期代理,不只要能记住目标、调用工具和执行计划,还必须知道什么时候旧计划已经失效,以及如何在重大损失之后停止反刍、恢复行动。

参考来源

相关推荐

查看全部