DeepMind把AI送进EVE宇宙

Google DeepMind与EVE Online开发商Fenris Creations达成研究合作,将在离线版EVE Online中探索长期规划、记忆、持续学习与涌现行为,标志着游戏AI研究从Atari走向复杂社会系统。
DeepMind把AI送进EVE宇宙:游戏AI从打砖块进入复杂社会系统
Google DeepMind正在与EVE Online开发商Fenris Creations合作,把这款以玩家驱动经济、联盟政治和大规模太空战争闻名的MMO,变成下一阶段游戏AI研究的实验场。
这不是一次普通的“AI帮游戏做NPC”合作。双方关注的核心问题是:一个AI能否在规则复杂、信息不完整、目标长期变化、玩家行为不可预测的环境中,持续记忆、制定计划并学习如何与其他智能体协作或对抗。
根据Google DeepMind在2026年发布的研究回顾,这项合作延续了其超过15年的游戏AI研究路线。研究对象已经从Atari这类规则清晰、反馈即时的街机游戏,逐步扩展到《星际争霸II》、多人协作环境,以及如今拥有复杂经济和社会结构的EVE Online。

EVE Online不是更大的棋盘,而是一套持续运行的社会系统
EVE Online是一款由玩家共同塑造经济、政治和战争秩序的太空MMO,其难点不只是地图大,而是游戏世界的状态会被玩家长期改变。
在传统街机游戏里,AI通常可以根据屏幕画面和即时奖励做决策:躲避障碍、击落敌人、获取分数。EVE Online则把问题推向了另一种维度——AI可能需要先积累资源,再建立盟友关系,等待合适的窗口发动行动,甚至在数周或数月后才看到策略结果。
EVE的复杂性主要来自四个方面:
- 长期规划:一次行动的价值可能要在很长时间后才能验证,短期得失未必等于最终收益。
- 部分可观测:AI无法直接知道所有敌方舰队位置、联盟意图和市场库存,只能依靠侦察、历史信息与推断行动。
- 多智能体博弈:玩家、联盟、市场参与者和自动化角色之间存在合作、背叛、谈判与竞争。
- 涌现行为:涌现行为是指系统没有被直接写入规则,却因为大量智能体互动而自然出现的复杂结果,例如市场操纵、联盟分裂或意外的战争升级。
这意味着,EVE不是一个“把游戏画面喂给模型,再让模型输出操作”的简单测试环境。它更接近一个可控的数字社会实验室:规则由游戏引擎提供,目标由任务设定或智能体自行形成,结果则由大量相互影响的决策共同产生。
从Atari到EVE,DeepMind在研究什么
Atari游戏是游戏AI研究的起点之一,因为它们提供了清晰的状态、动作和奖励结构,适合验证强化学习能否从原始画面中学会操作。
2013年,DeepMind发布关于深度Q网络(DQN)的研究,展示了同一个算法可以直接从像素和游戏得分中学习多款Atari游戏。DQN的关键贡献不是“打赢了某一款游戏”,而是证明了深度神经网络可以把视觉感知、动作选择和奖励优化连接起来。
随后,研究重点不断向更复杂的环境移动:
- Atari阶段:验证AI能否从图像和奖励中学习基本策略。
- 围棋与棋类阶段:研究搜索、价值评估和超越人类专家的规划能力。
- 星际争霸II阶段:处理更长时间跨度、隐藏信息、多单位控制和资源管理。
- 多人协作阶段:研究AI如何与人类或其他智能体配合完成任务。
- EVE Online阶段:探索长期记忆、持续学习、社会博弈和复杂系统中的涌现行为。
DQN是从“看见什么就做什么”迈向策略学习的代表;MuZero则进一步展示了AI可以在不知道完整环境规则的情况下,通过学习环境模型来进行规划;AlphaStar则把研究推进到实时策略游戏中的资源调度、侦察和多单位控制。
EVE Online的加入,意味着测试标准不再只是胜率、反应速度或单局得分,而是AI能否在不断变化的环境中保持目标一致性,并且理解行动的间接后果。
合作细节:先用离线版,而不是直接接入线上宇宙
目前公开信息显示,Google DeepMind将使用运行在本地服务器上的EVE Online离线版本作为研究环境,而不是让实验AI直接进入由真实玩家共同维护的线上服务器。
离线部署很重要。它让研究团队可以控制实验速度、重置世界状态、记录全部环境变量,并在出现异常时回滚。对于强化学习和多智能体研究来说,这相当于拥有一个可以反复复制的“数字沙盒”,而不是把未经验证的实验系统放进真实玩家社区。
离线环境还可以支持更密集的训练。线上EVE的时间流逝、玩家活动和经济变化受到真实用户限制,而研究环境可以加速时间、复制市场、批量生成对手,或者让同一场景运行数千次。只有这样,研究人员才有机会比较不同记忆机制、规划算法和奖励函数的效果。
不过,离线环境也会带来一个明显问题:实验室里学会的策略,能否迁移到真实玩家环境?
游戏AI中的“模拟到现实”问题,在这里可能表现为三种偏差:
- 行为偏差:离线环境中的AI对手可能过于规则化,无法模拟真实玩家的临时决策和心理博弈。
- 经济偏差:离线市场中的资源分布与价格波动,可能无法复现线上生态。
- 社会偏差:联盟、外交和背叛行为很难仅靠预设脚本完全还原。
因此,这项合作更可能首先产出研究方法和评测环境,而不是很快上线一个能够替玩家指挥舰队的通用AI。
长期规划、记忆和持续学习,是这次合作的三个关键词
长期规划是指AI不仅考虑下一步动作,还要评估一连串行动在更远时间尺度上的结果。
在EVE中,一个看似亏损的行动可能是为了制造假象、消耗敌方资源,或为几周后的战略行动铺路。如果AI只根据即时奖励训练,就容易学会“短视最优”:看到眼前收益就立即行动,却无法理解延迟回报、战略欺骗和机会成本。
记忆是让AI能够利用过去事件形成当前判断的能力,而不是每次决策都从零开始。
对EVE这类游戏而言,记忆不能只等于把聊天记录塞进上下文窗口。更有价值的记忆可能包括:某个联盟过去是否守约、某条航线最近是否频繁遭遇伏击、某种资源的价格在战争前后如何变化,以及一次失败行动究竟是情报错误、执行错误还是策略本身错误。
持续学习是指AI在部署后继续从新经验中更新能力,同时避免破坏已经掌握的技能。
这在EVE环境里尤其困难。游戏规则可能更新,玩家会针对AI策略进行反制,市场结构也会随着新参与者进入而改变。如果AI一直不学习,它会迅速过时;如果学习速度过快,又可能被短期异常数据带偏,甚至把对手的诱导行为当成普遍规律。
| 研究能力 | 传统街机AI | 实时策略游戏AI | EVE Online研究环境 | |---|---|---|---| | 决策时间尺度 | 秒级、单局内 | 分钟级到小时级 | 天、周甚至更长周期 | | 信息状态 | 大多直接可见 | 存在战争迷雾 | 高度不完整且动态变化 | | 智能体数量 | 通常较少 | 多单位、多阵营 | 玩家、联盟、市场与AI共同参与 | | 主要目标 | 得分、通关 | 摧毁对手、经营资源 | 生存、扩张、外交、经济和长期战略 | | 评价指标 | 胜率、分数 | 胜率、资源效率、操作质量 | 计划稳定性、记忆能力、适应性与涌现行为 |
这比“AI NPC”更接近通用智能测试
EVE Online的价值不在于它能提供更复杂的画面,而在于它把许多现实世界任务中常见的不确定性集中到了一起。
现实中的企业运营、供应链管理、金融交易和军事指挥,都不是一次性问答问题。它们通常包含长期目标、有限信息、多个利益相关者、资源约束,以及行动对环境的反作用。EVE提供了一个比现实成本更低、又比棋盘游戏更接近社会系统的研究场景。
如果AI在EVE中表现良好,可能说明它具备以下能力:
- 能把抽象目标拆成多阶段计划;
- 能根据新情报修改计划,而不是机械执行原方案;
- 能区分短期噪声与长期趋势;
- 能在合作与竞争之间切换;
- 能记住不同参与者的历史行为,并据此调整信任程度;
- 能在规则不变但对手策略变化时继续适应。
但需要明确的是,EVE表现好并不等于AI获得了现实世界的通用智能。游戏环境依然有明确的规则边界、可计算的资源和相对有限的行动空间。它可以成为复杂决策能力的压力测试,却不能直接替代现实世界实验。
Fenris Creations的身份变化,也让合作更值得关注
这次合作发生在EVE开发团队从Pearl Abyss体系中分离并更名为Fenris Creations之后。
根据公开报道,Fenris Creations由原CCP Games团队组成,并在独立化过程中与Google DeepMind建立研究合作,Google方面还取得了这家新公司的少数股权。关于股权安排和合作边界,现阶段公开信息有限,不能简单理解为Google接管了EVE Online,或EVE将被改造成AI产品。
更合理的判断是,Fenris希望借助EVE的独特世界观和技术资产开拓长期研究价值,而DeepMind则获得一个成熟、持续运行、具备真实玩家行为数据特征的复杂系统环境。双方的利益并不完全相同:游戏工作室关心产品稳定、玩家体验和IP发展,研究团队关心可控实验、数据记录和能力评测。
这也是合作能否成功的关键。EVE玩家长期以来对游戏经济和政治生态拥有很强的参与感,任何涉及AI的系统都可能引发关于公平性、自动化作弊、数据使用和游戏主导权的讨论。
玩家最关心的不是AI会不会赢,而是它会不会破坏游戏
如果AI最终进入线上EVE,公平性会成为比技术能力更现实的问题。
一个能够高频分析市场、自动执行舰队操作,或全天候监控敌方动向的智能体,可能远超普通玩家的反应速度和在线时长。即使它没有传统意义上的外挂代码,只要它能以不对等的方式获取信息或执行决策,也会破坏游戏竞争基础。
因此,研究环境与线上产品必须严格隔离。至少需要明确以下边界:
- 研究AI是否能够访问真实玩家的未公开数据;
- AI是否拥有普通玩家无法获得的操作频率和信息权限;
- 实验结果是否会用于线上自动化作战;
- 玩家数据和联盟行为是否会被用于训练商业模型;
- AI生成的内容、策略或角色是否会明确标识。
从产品角度看,AI更适合优先用于开发者工具、战斗模拟、任务生成、客服辅助和离线测试,而不是直接替代玩家参与核心经济与战争系统。尤其是在EVE这种由玩家共同书写历史的游戏里,AI如果成为不可见的“超级玩家”,最终可能让真实玩家失去参与感。
判断:EVE是一次高价值实验,但短期不会产生“AI舰队指挥官”
这项合作的真正价值,在于它把游戏AI的研究问题从“如何赢下一局”推进到了“如何在复杂社会系统中长期行动”。
从技术路线看,DeepMind已经拥有DQN、AlphaStar、MuZero等游戏智能研究积累,EVE则提供了传统基准环境缺少的长期性、开放性和社会互动。两者结合,有机会推动长期记忆、世界模型、多智能体强化学习和可解释规划继续发展。
从产品预期看,短期内不宜把合作解读为EVE即将上线一个能替玩家打仗的AI。公开信息目前只确认了研究合作和离线环境方向,尚未公布具体模型名称、训练规模、评测成绩、上线时间或线上功能。
对开发者而言,最值得关注的可能不是某个最终模型的跑分,而是这项研究会不会带来新的游戏AI评测标准:AI是否能持续记住历史,是否能在目标变化后调整策略,是否能识别对手的欺骗,是否能解释为什么选择一条长期更优、但短期看起来更差的路径。
如果Atari证明了AI可以从像素中学会操作,EVE Online要回答的则是另一个更难的问题:AI能不能在一个由无数玩家、利益和意外共同塑造的世界里,保持稳定、适应性和战略一致性。
这可能是游戏AI走向复杂现实任务前,最有价值的一类中间考场。也正因为如此,EVE Online不会只是DeepMind的下一个游戏项目,而可能成为衡量AI是否真正理解长期决策与多智能体社会行为的一块新试金石。
参考来源
- Reddit:关于Fenris Creations与Google DeepMind合作的讨论——包含合作公告、离线服务器环境以及长期规划、记忆、持续学习等公开信息讨论。
- Google DeepMind官方博客《From Atari to EVE Online: Building on 15 Years of AI Research in Games》——介绍DeepMind从Atari到EVE Online的游戏AI研究路线及此次合作背景。由于来源域名不在本文指定的国内可访问链接白名单中,本文仅列出标题,不附外部链接。



