2026年8月21日 研究
Alexandre Moufarek 和 Adrian Bolton
从 Atari 到围棋,再到《星际争霸》,游戏推动了人工智能领域一些最重大的突破。如今,我们正与游戏开发者展开合作,打造新型游戏体验原型,推动游戏与人工智能的共同发展。
自 DeepMind 于 2010 年成立以来,游戏所构建的受约束却内容丰富的世界,在理解智能方面一直发挥着关键作用。从掌握 Atari 游戏,到帮助解决蛋白质结构预测问题,游戏推动了我们在 AI 领域取得的一些最大突破——直到今天,它们依然是我们工作的核心。
游戏融入了 GDM 的基因。Google DeepMind 的创始人之一 Demis Hassabis 本人曾是一名游戏开发者,GDM 团队中也有许多人拥有类似经历。我们共同积累了数十年的游戏开发实践经验,并始终对游戏制作这门技艺怀有深深的敬意。
我们一直明确认为,利用游戏开展 AI 研究,需要与游戏开发者建立深入合作——例如今年早些时候公布的、我们与 Fenris Creations 的重要研究合作以及 EVE 宇宙的合作,还有我们与 Hello Games、Coffee Stain Studios、Foulball Hangover 等知名工作室共同开展的工作。
游戏:AI 研究的引擎
我们的探索始于一个小团队:他们训练深度神经网络,让其直接根据原始像素画面玩 Atari 2600 游戏。深度 Q 网络(Deep Q-Network,DQN)学会了玩 49 款不同的游戏——从 Pong 到 Breakout,再到 Space Invaders——整个过程没有针对任何特定游戏进行工程优化。关于 DQN 的 2015 年《自然》论文 помог助推动了现代深度强化学习时代的到来。
之后,我们尝试掌握更加复杂的游戏,每一次里程碑式的进展都带来了能力更强、泛化性更好的系统。AlphaGo 于 2016 年击败了围棋世界冠军李世石——许多专家原本认为这一成就至少还要十年才能实现。AlphaGo Zero 完全通过自我对弈进行学习,不使用任何人类数据,超越了之前的所有版本。AlphaZero 将这一方法推广到国际象棋、将棋和围棋,仅凭一种算法便掌握了这三种游戏;而 MuZero 甚至在不了解游戏规则的情况下学会了游戏。2019 年,AlphaStar 在 StarCraft II 中达到了宗师级水平,能够应对实时复杂性和信息不完备的情况。
在每一款游戏中,AI 都丰富了玩家体验。AlphaGo 著名的 第 37 手出人意料,以至于专业解说员最初认为那是一个失误。这一手棋颠覆了围棋界数百年来形成的传统认知,并激励专家探索新的策略。AlphaZero 同样启发了国际象棋领域全新的行棋路线。更重要的是,在游戏中取得成功的探索精神,也对其他 AI 系统产生了深远影响:AlphaFold 将这些基础应用于解决蛋白质结构预测这一持续了 50 年的重大挑战。这项突破最终获得了 2024 年诺贝尔化学奖的认可。
从掌握游戏到理解游戏
我们早期的工作证明,只要目标明确且训练充分,AI 就能够掌握任何游戏。但现实世界并没有分数和规则手册——这促使我们提出了一个截然不同的根本性问题:AI 能否像人一样理解并与任何游戏世界互动?
这正是 SIMA 所要解决的挑战。SIMA 即可扩展可指令多世界智能体(Scalable Instructable Multiworld Agent)。SIMA 不以获得高分为优化目标,而是一个通用智能体:它能够“看到”玩家在屏幕上看到的内容,理解自然语言指令,并通过普通键盘和鼠标进行操作——无需使用 API,也无需访问源代码。
在 Gemini 前沿 AI 模型的驱动下,SIMA 2 能够作为互动伴侣,进行实时推理和对话。它可以在复杂的 3D 研究环境和电子游戏中实现类似人类的游戏表现,包括 No Man’s Sky、Valheim、Hydroneer 等游戏。
对于游戏开发者而言,真正通用的游戏智能体将解锁适用于现有游戏的 AI 能力——无需修改游戏代码。这将支持全新的游戏玩法,例如真正理解游戏世界的 AI 伙伴,以及能够以脚本系统从未实现的方式进行适应和响应的非玩家角色(Non-Player Characters,NPC)。
通用游戏智能体还可能改变游戏的制作方式。在开发阶段,游戏会随着每次代码提交而发生变化,这类智能体可以实现真正稳健的质量保证(QA)测试。游戏上线后,当引入新内容或玩家出现不可预测的行为时,它们能够实时适应,在无需重新编写脚本的情况下泛化到新的情境。
为了安全、负责任地开发 SIMA 智能体,我们与知名游戏工作室展开合作,并正逐步建立一个不断扩大的游戏组合,用于 AI 研究。这让我们能够用越来越复杂的任务挑战智能体,而这些能力未来或许可以迁移到现实世界问题的解决中。
与游戏开发者合作,探索 AI 与游戏研究的新前沿
游戏工作室带来了专业的制作技艺、非凡的游戏世界,以及对玩家的深入了解。我们带来了前沿 AI——从 Gemini,到生成式交互环境和具身智能体研究——也带来了研究专长、团队独特的游戏开发背景,以及多年为交互式环境构建 AI 的经验。双方共同专注于发现突破性的体验,打造只有借助 AI 才可能实现的前所未有的游戏玩法。
重点不在于技术本身,而在于有趣的体验。因此,我们与合作伙伴采取“展示,而非讲述”的方式。我们的团队与游戏开发者并肩工作,探索新想法、构建可玩的原型,从中寻找真正有趣的玩法。
我们与 Fenris Creations 开展的最新研究合作,开启了我们在游戏 AI 研究历史上的新篇章。Fenris Creations 是 EVE 宇宙背后的独立工作室。
二十多年来,Fenris Creations 一直在打造游戏界最非凡的持久世界之一。2003 年推出的 EVE Online 是一款大型多人太空模拟游戏,数千名玩家共享同一个宇宙,而这个宇宙已经持续演化了 20 多年。其由玩家驱动的经济体系拥有真实的供需关系,以及横跨数千个星系的贸易网络。这个由联盟、冲突和外交塑造的世界,其发展动力来自人与人之间的互动。
对于 AI 研究而言,这是一个绝佳机会。这是一个不断运转、持续演化的世界,恰好要求具备我们认为前沿 AI 必不可少的能力:
- 持续学习(Continual learning):在不断变化的世界中获取新技能,同时不遗忘此前学到的内容。
- 记忆(Memory):在远超当今模型上下文窗口所能覆盖的时间尺度上,积累并检索知识。
- 长时程规划(Long-horizon planning):围绕数周、数月甚至数年进行推理。
- 复杂的多智能体动态(Complex multi-agent dynamics):在大规模环境中应对合作、竞争、谈判、经济活动以及涌现的社会行为。
这些挑战正是我们更广泛研究计划的核心。该计划旨在打造能够持续从经验中学习的系统,并让学习速度随着时间推移不断加快。我们相信,这些前沿能力有望解锁