清华机器狗指挥人类称重:物理AGI如何实现无脚本即兴交互?
在人工智能发展的漫长进程中,我们见证了无数基于虚拟环境的性能刷榜,但在将智能从屏幕带入真实物理世界的过程中,却始终面临着“最后一公里”的艰难跨越。近期,清华大学的一场现场演示为这一困境提供了极具说服力的破题思路。搭载“一念Unisonmind”端侧大脑的机器狗“哮天”,在无预设脚本、环境完全开放的条件下,展现了令人瞩目的即兴交互能力。它不仅能看懂黑板上的手绘迷宫并自主规划路径,甚至能指挥人类助手使用天平称重,或估算观众手中矿泉水瓶的剩余水量。这些看似简单的日常行为,实则标志着物理通用人工智能(Physical AGI)正在从概念走向实证。
重新定义Physical AGI:以人类智能为标尺
长期以来,行业对于具身智能的讨论往往陷入路线之争,要么沉迷于虚拟仿真基准测试(Benchmark)中的高分,要么局限于特定任务的专项训练。然而,真正的通用智能应当具备类似人类的“物理智能”(Physical GI)。正如发展心理学家霍华德·加德纳所提出的多元智能理论,人类智能并非单一能力,而是一套在真实时空中持续运行、面对不同对象形成多元适应的认知系统。
Physical AGI的核心定义应被重构为:一套以实体为载体,在真实世界中持续运行,能够调度感知、表征、记忆、学习、推理、规划、生成与反馈调节等基础认知能力的系统。它不是语言、空间、物理等模块的简单拼接,而是同一套认知体系在面对不同任务时动态组合的自然涌现。判断Physical AGI是否达成,不应看其在封闭数据集上的准确率,而应看其能否在开放世界中完成“感知—行动—反馈”的实时闭环。
无脚本现场的三重考验:从抽象到协作
清华大学的演示现场,几十位观众围观,任务随机生成,这种高噪声、非结构化的环境对智能体的鲁棒性提出了极致要求。“哮天”表现出的三项核心能力,分别对应了Physical AGI的不同维度智能。
首先是空间智能与抽象推理。当主持人随手在黑板上画出一个三维迷宫简图,并圈出起始点后,“哮天”并未表现出机械的地图匹配,而是通过视觉理解将二维线条抽象为三维空间结构。在行进过程中,它不仅遵循既定路线,还能主动询问“能不能走捷径”,并在执行后根据现场墙体结构(黑板路线与实物墙体相交)进行动态修正。这一过程涉及了复杂的视觉表征、空间映射、路径规划以及基于环境反馈的自我纠错,展现了智能体对空间关系的深刻理解。
其次是物理智能与社会协作。在称重任务中,“哮天”需要指挥人类助手使用天平。这超越了单纯的机器人控制,进入了社会交互领域。它必须理解天平的物理原理,通过自然语言下达指令,协调人类助手的行为,并结合视觉反馈判断重量数据。这要求智能体同时具备物理常识、语言交流能力、行动规划能力以及社会协作技巧,是多领域智能协同解决的典型案例。
最后是常识推理与模糊估算。面对观众临时递来的两瓶喝过的矿泉水,询问剩余水量,这是一个典型的非结构化、非标准化问题。机器狗首先提出“撕掉标签”以减少视觉干扰,随后通过视觉感知进行估算。这种处理模糊信息、剥离无关特征、基于常识进行推断的能力,正是区别于传统计算机视觉模型的关键所在。
统一架构:从模块拼接走向认知涌现
支撑上述复杂表现的底层逻辑,是“一念Unisonmind”提出的“统一世界Token空间”架构。传统模型往往采用多分支处理,图像、语音、动作各自独立处理后再进行后期融合,导致信息丢失和延迟。而Unisonmind采用的是一种Any-to-Any的统一架构,将视频、图像、声音、文字和动作汇入同一个状态空间。
这一架构具备三个核心特征:全模态输入输出、理解与生成的统一、以及全链路运行时(Runtime)的持续在线。在18毫秒的高频对齐周期内,模型持续接收环境信息,统一演化世界状态,并直接输出多模态结果。外部世界的反馈又立即成为下一轮的输入,形成毫秒级的闭环。这种设计使得智能体不再是在“思考”后“行动”,而是在“感知”的同时就在“行动”,行动的结果即刻改变感知,从而实现真正的实时交互。
跨本体泛化:同一认知,不同身体
Physical AGI的重要标志之一是通用性,即认知能力不应绑定于特定的硬件形态。在此次演示中,同一套Unisonmind大脑不仅运行在机器狗上,还无缝迁移至人形机器人和电动轮椅。
这种跨本体的泛化能力证明了认知底座与执行机构的解耦。对于机器狗,大脑调度运动控制模块进行灵活走位;对于人形机器人,大脑协调双臂进行精细操作;对于电动轮椅,大脑可能侧重于路径导航与避障。尽管“身体”不同,但底层的感知、推理、规划等认知能力是共享的。当场景变化时,相同的认知系统可以重新调用不同的能力子集,适应新的本体约束和环境需求。这种“一套大脑,多种身体”的模式,极大地降低了具身智能的开发门槛,提升了技术的可扩展性。
迈向真实世界:Physical AGI的门槛已至?
回归到最初的问题:一念Unisonmind是否已经跨过了Physical AGI的门槛?依据前述定义,Physical AGI需要以实体为载体,在真实世界中持续组织多维度智能,并自主迭代。清华的现场演示给出了肯定的答案。
首先,它证明了智能体能够在未经过针对性预训练的真实现场中,处理随机、开放的任务。其次,它展示了语言、空间、物理、社会等多维智能在统一认知框架下的自然涌现,而非机械叠加。最后,它验证了同一认知体系在不同本体间的通用迁移能力。
这并非终点,而是一个重要的起点。它意味着我们不再需要为每个新任务训练一个新模型,而是可以依靠一个通用的认知底座,在真实世界中不断学习和适应。Physical AGI不再是遥远的技术想象,而是已经踏上了真实世界的土地。未来的挑战将集中在如何进一步提升模型在极端长尾场景下的鲁棒性,以及如何降低端侧部署的算力功耗,但核心范式的转变已经完成。人类认知范式正在以数字形式在物理世界中重生,开启了智能体与现实世界深度互动的新篇章。