SIMA 2:AI智能体如何实现推理、泛化与自我进化?

0 阅读

从指令执行到智能推理:SIMA 2的进化之路

去年,DeepMind推出了SIMA(Scalable Instructable Multiworld Agent),一个能够在多种虚拟环境中遵循基本指令的通用AI。SIMA的诞生标志着AI在将语言转化为3D世界中有意义行动的关键一步。然而,SIMA本质上仍是一个指令跟随器,缺乏对目标的深层理解和自主推理能力。如今,SIMA 2的发布彻底改变了这一局面。通过集成Gemini模型,SIMA 2不仅能够执行指令,还能思考目标、与用户对话,并在实践中不断自我提升。这不仅是技术上的飞跃,更是向通用人工智能(AGI)迈进的重要里程碑。

The SIMA 2 self-improvement cycle begins with Gemini providing an initial task and an estimated reward for SIMA 2's behavior. This information is then added to a bank of self-generated experience, which the agent uses for further training in subsequent generations. This process allows the agent to improve on previously failed tasks entirely independently of human-generated demonstrations and intervention.

推理能力:让AI真正“理解”任务

SIMA 2的核心突破在于其强大的推理能力。第一代SIMA学习了超过600种语言技能,如“左转”、“爬梯子”、“打开地图”,但仅限于直接响应指令。SIMA 2则通过嵌入Gemini模型,能够对指令进行深度推理。例如,当用户说“找到篝火”时,SIMA 2不仅会搜索篝火,还会理解“篝火”通常出现在营地或特定地形,从而制定搜索策略。这种推理能力使得SIMA 2在未见过的游戏(如ASKA和MineDojo)中表现出色,而SIMA 1则常常失败。

SIMA 2的架构结合了Gemini的推理引擎,使其能够理解用户的高层目标,进行复杂的多步推理,并熟练执行目标导向的动作。训练过程中,SIMA 2使用了人类演示视频和Gemini生成的标签,这使得它能够向用户解释自己的意图和行动步骤。这种交互方式让用户感觉不是在命令一个机器,而是在与一个能够思考的伙伴协作。

泛化性能:跨越游戏与环境的适应力

SIMA 2在泛化性能上实现了显著飞跃。它能够理解更复杂、更细微的指令,并在从未训练过的游戏或情境中成功执行。例如,在维京生存游戏ASKA中,SIMA 2能够完成“建造一个避难所”这样的复杂任务,而SIMA 1则无法理解。此外,SIMA 2还支持多模态提示,用户可以通过绘制草图来指示目标,SIMA 2能够理解并执行。它甚至能理解不同语言和表情符号,例如用🔥表示“点燃火把”。

更重要的是,SIMA 2展现了跨游戏的概念迁移能力。例如,它在《我的世界》中学到的“采矿”技能,可以迁移到其他游戏中用于“收获”资源。这种能力是通用智能的基础,使得SIMA 2在广泛任务上的表现接近人类玩家。根据评估数据,SIMA 2在训练游戏环境中的任务完成率显著高于SIMA 1,在未见过的游戏(如ASKA和MineDojo)中,SIMA 2的成功率更是大幅提升,缩小了与人类表现的差距。

A four-column representation of SIMA 2, a Gemini-powered AI agent, acting within a 3D virtual environment.

终极测试:在全新生成的世界中适应

Task completion success rates for SIMA 1, SIMA 2, and humans across a set of evaluation tasks for all training game environments, showing SIMA 2 closing a significant portion of the gap to human performance. Note that the SIMA 1 performance reported here is with respect to our new, expanded, and much more difficult set of evaluations, across a wider set of environments and more complex instructions

为了测试SIMA 2的泛化极限,研究人员将其与Genie 3结合——Genie 3能够从单张图片或文本提示生成全新的实时3D世界。当SIMA 2被置于这些从未见过的生成世界中时,它能够合理定位自己,理解用户指令,并采取有意义的行动。例如,在一个由Genie 3生成的森林场景中,SIMA 2能够根据“找到水源”的指令,探索环境并找到河流。这种适应能力展示了SIMA 2在未知环境中的强大泛化能力,为未来在多样化生成世界中训练通用智能体奠定了基础。

Task completion success rates for SIMA 1 and SIMA 2 on held-out (never before seen during training) games: Aska and MineDojo (a Minecraft research implementation).

自我改进:无需人类干预的持续学习

一张创意合成图,展示红色汽车在类似月球表面的地貌上行驶,背景

SIMA 2最令人兴奋的特性之一是其自我改进能力。在训练过程中,SIMA 2能够通过试错和基于Gemini的反馈,逐步执行更复杂的新任务。例如,在初始学习阶段,SIMA 2依赖人类演示,但随后它可以在新游戏中完全通过自我导向的玩耍来学习,无需额外的人类数据。这种自我生成的经验数据可以用于训练下一代更强大的智能体。

图片展示了多款电子游戏的截图拼接,左侧为像素风格沙盒游戏场景

研究人员还发现,SIMA 2能够在Genie 3生成的环境中进行自我改进,这是一个重大里程碑。自我改进循环始于Gemini提供初始任务和奖励估计,然后SIMA 2执行任务并收集经验,这些经验被添加到经验库中,用于后续训练。这个过程完全独立于人类干预,使得智能体能够自主提升技能。例如,在ASKA游戏中,初始SIMA 2在“建造房屋”任务上失败,但经过几代自我训练后,它成功完成了任务,且无需任何人类反馈。这种开放式的学习能力预示着未来AI能够以最小的人类监督持续进化。

未来展望:迈向通用具身智能

SIMA 2在多样化游戏环境中的成功,为通用智能提供了关键验证。它证明了通过多世界数据和强大推理引擎训练出的AI,能够统一多种专门系统的能力,成为一个连贯的通用智能体。SIMA 2的技能——从导航、工具使用到协作任务执行——是物理世界智能体(如机器人)的基础构建块。因此,SIMA 2的研究为未来AI在现实世界中的应用铺平了道路,例如家庭助手、工业机器人等。

一张展示白色机器人头部特写的照片,背景为模糊的工业或仓储环境

然而,SIMA 2仍面临挑战。它难以处理需要长时间多步推理和验证的复杂任务,其记忆窗口有限,无法保持长期交互上下文。此外,通过键盘和鼠标执行精确的低级动作,以及复杂3D场景的视觉理解,仍是整个领域待解决的问题。尽管如此,SIMA 2的研究为行动导向AI提供了新路径,并确认了通用智能体的可行性。

负责任的发展

SIMA 2是一个交互式、以人为中心的智能体,其自我解释能力使其更具吸引力。DeepMind在开发过程中与负责任发展与创新团队紧密合作,确保技术创新的安全性。SIMA 2目前作为有限研究预览发布,仅向少量学者和游戏开发者提供早期访问,以收集反馈并评估风险。这种谨慎的做法有助于在探索新领域时建立适当的缓解措施。

结语

SIMA 2代表了AI从指令执行到智能推理的质变,其推理、泛化和自我改进能力为通用具身智能奠定了基础。尽管仍存在局限,但SIMA 2的研究成果为AI在虚拟和物理世界中的应用开辟了新的可能性。随着技术的不断进步,我们有理由期待一个更加智能、自主的AI时代。