一个模型通吃多场景?AWE3.7如何实现具身智能的通用泛化

1 阅读

长期以来,机器人系统的开发遵循“一事一模”的范式——针对特定任务采集数据、训练模型、部署调试。这种模式在封闭、结构化的环境中尚可运行,但一旦面对真实世界的开放性、动态性和多样性,便迅速暴露出泛化能力薄弱的致命缺陷。物体形态千变万化,光照条件瞬息万变,任务流程长短不一,甚至机器人本体也可能因维护或升级而更换执行器。在这样的背景下,具身智能的发展重心正从“能否完成单一任务”转向“能否用同一套智能系统应对多变环境与任务”,即实现真正的通用泛化

文章配图

它石智航近期发布的通用具身大模型AWE3.7(AI World Engine 3.7),正是对这一行业命题的有力回应。该模型在十天内密集展示了覆盖工业制造、物流搬运、家庭服务等多个领域的数十项真实任务,全部由同一套基座模型驱动,无需针对每个场景重新训练或微调。这种“一脑通吃”的能力,不仅打破了传统机器人系统的边界限制,更标志着具身智能正从实验室演示迈向可复制、可扩展的工程化落地阶段。

文章配图

工业场景:精度、力度与稳定性的极限挑战

文章配图

工业现场向来是检验机器人能力的“试金石”。在这里,容错率极低,操作必须达到毫米级精度,同时具备实时力控和长时间运行的稳定性。AWE3.7在多个典型工业任务中展现了令人信服的表现。

文章配图

在零件分拣任务中,系统需从一堆混杂的螺丝、螺母中识别出目标对象。这些金属件尺寸相近、反光强烈,极易造成视觉误判。AWE3.7通过融合多视角RGB-D信息与触觉反馈,在抓取瞬间动态调整夹持力与姿态,即使中途被人为干扰,也能自主纠错并继续完成后续分拣流程,体现出强大的鲁棒性。

缠胶带任务则对柔性材料处理提出了更高要求。线束柔软易变形,胶带张力难以控制。AWE3.7采用双手协同策略:左手固定线束末端,右手持胶带沿预设螺旋轨迹缠绕。系统通过实时监测胶带边缘与线束表面的相对位置,动态修正手腕运动轨迹,确保缠绕紧密、无重叠、不断带。这种对连续形变物体的精准操控,依赖于模型对物理交互的深层理解。

网线插接更是毫厘之间的较量。水晶头与网孔的公差极小,稍有偏差便无法插入。AWE3.7的机器人双手配合,先将水晶头初步对准网孔,随后通过腕部多自由度微调角度,并结合接触力反馈预测插入状态。即使在轻微外力扰动下,系统仍能完成精准插接,全程无需人工干预。

手机装盒是一项典型的长程操作任务,涉及多个子步骤:拾取手机、放入内托、盖上盒盖、压合卡扣。每一步都需毫米级对位,且光照变化可能影响视觉定位。AWE3.7通过空间记忆机制维持任务上下文,在光照突变时仍能准确完成整套流程,一次成功率接近100%。

拧螺丝任务则最考验机器人的“手感”。系统需先精确定位螺丝刀与螺丝槽口的空间关系,缓慢下压并对准;随后根据扭矩传感器反馈实时调整旋转速度与下压力,在达到预设拧紧力矩后立即停止。整个过程实现了“对得准、拧得稳、收得住”的闭环控制,避免了滑丝或过拧等常见问题。

动态环境:在流动中保持操作连贯性

真实世界并非静态舞台。传送带持续运转,收纳容器可能被移动,机器人自身也需要在空间中穿行。要在这种动态环境中完成任务,仅靠高精度操作远远不够,还需具备感知-决策-执行的全链路连贯性

面对传送带上不断移动的软性玩偶,AWE3.7展现出对动态窗口的精准把握。机器人首先预测玩偶到达抓取点的时间,同步启动机械臂运动;抓取后,继续跟踪传送带节拍,待袋子移动至合适位置时,双手协调将玩偶平稳放入。整个过程如同人类工人般流畅,体现了对时间与空间耦合关系的深刻建模。

积木分拣看似简单,实则蕴含复杂的规则理解与异常处理能力。系统需建立“颜色—目标框”的映射关系,并在执行中持续验证。当发现积木被错误放置时,AWE3.7能主动识别异常,重新抓取并归位至正确容器。更关键的是,即便收纳框被人为移动,模型也能通过实时视觉跟踪更新目标位置,动态重规划抓取轨迹,确保任务最终完成。

当任务空间扩展至整个办公环境,移动与操作的协同成为核心挑战。AWE3.7驱动的机器人可在复杂室内环境中自主导航,避开障碍物抵达目标桌旁;随后切换至上肢操作模式,精准拾取物品;最后移动至投放点上方,完成放置动作。整个过程中,下肢移动与上肢操作高度耦合,模型端到端输出全身运动指令,无需模块化切换或人工干预,真正实现了“移动即操作”的一体化控制。

家庭场景:非结构化环境下的通用能力试炼场

如果说工业环境是“规则明确的考场”,那么家庭则是“开放命题的实战”。物体形态多样、任务流程冗长、约束条件模糊,这对通用模型的迁移能力提出了极高要求。AWE3.7在多个生活服务任务中展现了令人惊讶的适应性。

整理衣物任务需要全身协调。衣物散落在地面,机器人需弯腰俯身抓取。这一动作涉及重心大幅前移,极易导致失衡。AWE3.7通过全身动力学模型实时调整腿部关节力矩与躯干姿态,在俯身与起身过程中保持稳定,成功将衣物放入收纳筐。这种loco-manipulation(移动操作协同)能力在当前机器人领域仍属稀缺。

擦白板任务则凸显了精细力控的重要性。板擦需以恰到好处的力度接触板面,既要擦净字迹,又不能因用力过猛导致白板晃动或掉落。AWE3.7支持左右手任意执行,并可在任务中途无缝切换。系统通过触觉反馈实时调节按压力度,即使遭遇外部推挤,也能维持擦除轨迹完整,体现出对任务状态的持续感知与恢复能力。

整理书包是一项典型的长程、多对象任务。桌面上散落着笔、橡皮、文具盒等形态各异的物品。AWE3.7首先进行语义分割与分类,随后规划合理的装入顺序(如先放文具盒,再放细小文具),逐件抓取并调整姿态后放入书包。整个过程逻辑清晰、节奏有序,展现出类人的任务分解与执行能力。

早餐准备任务进一步考验多物体协同操作。机器人需从橱柜中取出碗、盘、杯子等餐具,再将面包、牛奶、水果等食品依次摆放到餐盘上。这一过程涉及对不同材质、形状物体的识别与抓取,以及对厨房空间布局的记忆。AWE3.7通过跨模态对齐(视觉-语义-空间)实现高效操作,即使中途被打断,也能恢复任务上下文继续执行。

制作冰沙则对柔性物体操作提出极限挑战。机器人需单手抓取软质塑料杯,将其对准制冰机出冰口,另一手按压启动按钮。在出冰过程中,系统持续监测杯内冰量,通过视觉估算填充高度,在接近满杯时及时停止出冰,随后将冰沙递送至指定位置。整个流程完全自主,无需人工接管,体现了对连续流体与柔性容器的综合控制能力。

技术底座:方法论闭环驱动泛化能力

AWE3.7之所以能在如此广泛的场景中保持高性能,源于其独特的技术架构与训练范式。它石智航构建了一个“原生架构—双先验预训练—世界模型驱动后训练—规模化验证—数据反哺”的闭环方法论。

首先,模型采用统一的多模态Transformer架构,原生支持视觉、语言、触觉、本体感知等多种输入,并输出全身运动指令。这种端到端设计避免了传统模块化系统中的信息损失与误差累积。

其次,“双先验”预训练策略至关重要。一方面,模型在超百万小时的人类中心(human-centric)真实操作视频上进行自监督学习,习得对物理交互的常识性理解;另一方面,通过大规模仿真环境注入物理规律先验,强化对力、摩擦、形变等底层机制的建模。

在此基础上,AWE3.7引入世界模型(World Model)作为后训练的核心驱动力。该模型不仅能预测动作后果,还能模拟“如果……会怎样”的反事实推理,从而在真实执行前进行内部演练与优化。这种能力极大提升了系统在未知场景中的适应性与安全性。

最后,所有真实任务数据都会回流至训练 pipeline,形成持续进化的正向循环。这种“部署即学习”的机制,使得模型能力随应用场景扩展而不断增强。

产业落地:从纪录到产线的复利效应

AWE3.7的能力已不仅停留在演示层面,而是产生了切实的产业价值。2026年3月,搭载该模型的它石A1机器人以“一小时内完成亚毫米级线束装配最多次数”打破吉尼斯世界纪录,验证了其在精密制造领域的极限性能。同年世界人工智能大会(WAIC)上,AWE成为唯一获得SAIL之星奖的具身基座模型,获得学术与产业界双重认可。

更重要的是,这颗“通用大脑”已进入真实汽车制造产线,承担线束装配、协同检测等关键工序。相比传统专用机器人,基于AWE3.7的系统部署周期缩短70%,任务切换成本趋近于零,为制造业提供了真正可扩展的智能化解决方案。新闻联播曾专题报道其机器人集群在产线上的规模化应用,标志着具身智能正式进入主流工业视野。

具身智能的竞争,正在从“炫技式单点突破”转向“基础能力的复用效率”。AWE3.7的实践表明,通用落地并非遥不可及的愿景,而是一条已被数据、成果与产业场景充分验证的工程化路径。当一颗“大脑”能够贯通工厂与家庭,跨越刚性与柔性,适应静态与动态,我们或许正站在一个新时代的门槛上——在那里,机器人不再是任务的执行者,而是环境的共处者。