SIMA 2:AI智能体如何实现推理、泛化与自我进化?
从指令执行到智能推理:SIMA 2的进化之路
去年,DeepMind推出了SIMA(Scalable Instructable Multiworld Agent),一个能够在多种虚拟环境中遵循基本指令的通用AI。SIMA的诞生标志着AI在将语言转化为3D世界中有意义行动的关键一步。然而,SIMA本质上仍是一个指令跟随器,缺乏对目标的深层理解和自主推理能力。如今,SIMA 2的发布彻底改变了这一局面。通过集成Gemini模型,SIMA 2不仅能够执行指令,还能思考目标、与用户对话,并在实践中不断自我提升。这不仅是技术上的飞跃,更是向通用人工智能(AGI)迈进的重要里程碑。
推理能力:让AI真正“理解”任务
SIMA 2的核心突破在于其强大的推理能力。第一代SIMA学习了超过600种语言技能,如“左转”、“爬梯子”、“打开地图”,但仅限于直接响应指令。SIMA 2则通过嵌入Gemini模型,能够对指令进行深度推理。例如,当用户说“找到篝火”时,SIMA 2不仅会搜索篝火,还会理解“篝火”通常出现在营地或特定地形,从而制定搜索策略。这种推理能力使得SIMA 2在未见过的游戏(如ASKA和MineDojo)中表现出色,而SIMA 1则常常失败。
SIMA 2的架构结合了Gemini的推理引擎,使其能够理解用户的高层目标,进行复杂的多步推理,并熟练执行目标导向的动作。训练过程中,SIMA 2使用了人类演示视频和Gemini生成的标签,这使得它能够向用户解释自己的意图和行动步骤。这种交互方式让用户感觉不是在命令一个机器,而是在与一个能够思考的伙伴协作。
泛化性能:跨越游戏与环境的适应力
SIMA 2在泛化性能上实现了显著飞跃。它能够理解更复杂、更细微的指令,并在从未训练过的游戏或情境中成功执行。例如,在维京生存游戏ASKA中,SIMA 2能够完成“建造一个避难所”这样的复杂任务,而SIMA 1则无法理解。此外,SIMA 2还支持多模态提示,用户可以通过绘制草图来指示目标,SIMA 2能够理解并执行。它甚至能理解不同语言和表情符号,例如用🔥表示“点燃火把”。
更重要的是,SIMA 2展现了跨游戏的概念迁移能力。例如,它在《我的世界》中学到的“采矿”技能,可以迁移到其他游戏中用于“收获”资源。这种能力是通用智能的基础,使得SIMA 2在广泛任务上的表现接近人类玩家。根据评估数据,SIMA 2在训练游戏环境中的任务完成率显著高于SIMA 1,在未见过的游戏(如ASKA和MineDojo)中,SIMA 2的成功率更是大幅提升,缩小了与人类表现的差距。
终极测试:在全新生成的世界中适应
为了测试SIMA 2的泛化极限,研究人员将其与Genie 3结合——Genie 3能够从单张图片或文本提示生成全新的实时3D世界。当SIMA 2被置于这些从未见过的生成世界中时,它能够合理定位自己,理解用户指令,并采取有意义的行动。例如,在一个由Genie 3生成的森林场景中,SIMA 2能够根据“找到水源”的指令,探索环境并找到河流。这种适应能力展示了SIMA 2在未知环境中的强大泛化能力,为未来在多样化生成世界中训练通用智能体奠定了基础。
自我改进:无需人类干预的持续学习
SIMA 2最令人兴奋的特性之一是其自我改进能力。在训练过程中,SIMA 2能够通过试错和基于Gemini的反馈,逐步执行更复杂的新任务。例如,在初始学习阶段,SIMA 2依赖人类演示,但随后它可以在新游戏中完全通过自我导向的玩耍来学习,无需额外的人类数据。这种自我生成的经验数据可以用于训练下一代更强大的智能体。
研究人员还发现,SIMA 2能够在Genie 3生成的环境中进行自我改进,这是一个重大里程碑。自我改进循环始于Gemini提供初始任务和奖励估计,然后SIMA 2执行任务并收集经验,这些经验被添加到经验库中,用于后续训练。这个过程完全独立于人类干预,使得智能体能够自主提升技能。例如,在ASKA游戏中,初始SIMA 2在“建造房屋”任务上失败,但经过几代自我训练后,它成功完成了任务,且无需任何人类反馈。这种开放式的学习能力预示着未来AI能够以最小的人类监督持续进化。
未来展望:迈向通用具身智能
SIMA 2在多样化游戏环境中的成功,为通用智能提供了关键验证。它证明了通过多世界数据和强大推理引擎训练出的AI,能够统一多种专门系统的能力,成为一个连贯的通用智能体。SIMA 2的技能——从导航、工具使用到协作任务执行——是物理世界智能体(如机器人)的基础构建块。因此,SIMA 2的研究为未来AI在现实世界中的应用铺平了道路,例如家庭助手、工业机器人等。
然而,SIMA 2仍面临挑战。它难以处理需要长时间多步推理和验证的复杂任务,其记忆窗口有限,无法保持长期交互上下文。此外,通过键盘和鼠标执行精确的低级动作,以及复杂3D场景的视觉理解,仍是整个领域待解决的问题。尽管如此,SIMA 2的研究为行动导向AI提供了新路径,并确认了通用智能体的可行性。
负责任的发展
SIMA 2是一个交互式、以人为中心的智能体,其自我解释能力使其更具吸引力。DeepMind在开发过程中与负责任发展与创新团队紧密合作,确保技术创新的安全性。SIMA 2目前作为有限研究预览发布,仅向少量学者和游戏开发者提供早期访问,以收集反馈并评估风险。这种谨慎的做法有助于在探索新领域时建立适当的缓解措施。
结语
SIMA 2代表了AI从指令执行到智能推理的质变,其推理、泛化和自我改进能力为通用具身智能奠定了基础。尽管仍存在局限,但SIMA 2的研究成果为AI在虚拟和物理世界中的应用开辟了新的可能性。随着技术的不断进步,我们有理由期待一个更加智能、自主的AI时代。