WAIC具身智能深水区突围:AWE 3.5如何重构工业多任务范式
工业深水区:被具身智能打破的自动化瓶颈
走进大型汽车制造商的线束车间,往往能看到与整车总装线截然不同的景象。整车车间追求极致的洁净与自动化,而线束车间则充斥着密集的线缆、复杂的接口以及高强度的重复劳动。这里长期被视为工业自动化的“深水区”:工人培训周期短但流失率极高,岗位坚持三个月以上的比例极低,且对人工操作的精细度和灵活性要求极高。
然而,在2026年世界人工智能大会(WAIC)上,这一传统认知被彻底颠覆。它石智航将一条1:1还原的环形线束流水线直接搬入展馆,展示了多台机器人集群协同作业的场景。流水线轮转线束板,每个工位在同一时间内装配不同线型的线束,效率大幅提升。它石智航首席科学家丁文超甚至调侃道,现场不敢让机器人一直工作,因为速度太快导致物料供应跟不上。支撑这一全自动化产线的核心,正是其最新发布的具身原生基座模型AWE 3.5。
这不仅是技术的展示,更是具身智能从实验室走向工业实战的标志性事件。AWE 3.5作为具身智能领域首个真正打通预训练到后训练完整范式的原生模型,标志着行业从“单点突破”向“系统级能力”的跨越。它不再依赖特定场景的定制开发,而是通过一个统一的基座模型,实现了从预训练到后训练的全链路闭环,为工业场景的规模化落地提供了新的技术范式。
One Model架构:重构具身智能的底层逻辑
AWE 3.5的发布,信号明确:希望其像GPT-3.5在多任务能力上展现新可能一样,在具身智能领域实现能力的溢出。回顾AWE系列的发展,3.0版本主要聚焦于线束场景的突破,而3.5版本则将能力扩展至工业装配、插接、收纳等多个领域。关键在于,这些任务无需重新加载模型或切换参数,全部由同一个基础模型处理。
这种“One Model”架构的设计精妙之处在于,模型本身保持不变,仅通过改变输入输出的组合方式,就能切换出不同的功能“人格”。例如,视觉到动作的输出构成Base Policy,负责制定策略;以动作为条件预测未来视觉,则构成Action Condition World Model,负责预测环境变化。两者交互形成完整的强化学习闭环。
以打包书包拉拉链为例,这是一个毫米级精度的操作,涉及复杂的力学反馈。传统方法需要在真机上反复试错,数据获取成本高且设备磨损大。AWE 3.5则先在预训练模型的“脑海”中模拟不同力度下的结果,优化策略后再指导Base Policy执行。这种“模型即仿真器”的能力,使得预训练建立通用物理交互能力,后训练在模型内部进行自我对弈和强化,形成了高效的自闭环。这一路径在语言模型领域已获验证,而在具身原生模型中,它石智航是首家完整跑通的。
数据Scaling与效率革命:从百万小时到小时级采集
AWE 3.5的成功,得益于其长期布局的两条暗线:足够大的真实数据规模以及能消化大规模数据的Infra。模型基于超百万小时的human-centric数据训练,这一量级与主流视频生成模型和自动驾驶所需数据相当。然而,具身数据的价值分布极不均匀,简单的堆量已无意义,关键在于如何从海量数据中筛选出高质量、高价值的部分。
它石智航的数据系统重心正从“更多”转向“更聪明、质量更高”,Data Efficiency成为新的评测维度。随着数据规模和数据效率的提升,Scaling的威力得以释放。丁文超指出,现在预训练已足够扎实,一个新任务仅需小时级别的数据采集即可跑通。这种前置战略的红利,使得模型能够迅速向各个场景分发,不再局限于单一场景的闭环。
目前,除线束外,柔性操作、分拣、检测协同等多个工业场景已在验证中。丁文超大胆预测,具身Scaling已全面释放,2027年上半年可能出现行业分水岭。行业正从“机器人文娱舞蹈”阶段,进入“机器人真干活”的阶段。WAIC展会上,具身智能企业超过200家,机器人展区人流显著,反映出市场对真实落地能力的迫切需求。
世界模型与长时记忆:解决具身智能的“幻觉”难题
2026年被视为世界模型百家争鸣的元年。在WAIC现场,观众通过数据采集夹爪与AWE 3.5生成的平行世界互动,体验了重力、摩擦、碰撞等物理反馈。这些交互无需牛顿定律代码或碰撞引擎,全部由模型从真实数据中学习。然而,视频模型普遍存在长程物理交互连续性差的缺陷,物体容易在预测中消失或变形。
AWE 3.5依托human-centric数据,专门强化了模型结构,使其显式学习长时记忆和长时序空间理解。在数分钟的连续交互闭环推演中,模型能保持环境稳定,避免环境崩盘。这一突破使得在世界模型中进行强化学习成为可能,为具身智能的长期任务规划提供了基础。
灵巧手与硬件协同:从Bottom-Up到Top-Down
在AWE 3.5的研发过程中,硬件与软件协同设计(Co-Design)的重要性远超预期。丁文超强调,夹爪能解决约80%的问题,但剩余20%的复杂操作需依赖灵巧手。它石智航采取Top-Down路径,先梳理人类动作和数据需求,再反向定义硬件设计,而非单纯追求高自由度。
灵巧手在末端增加约20个自由度,双手配合引入约42个自由度,构成高维且富接触的复杂系统。这不仅是技术挑战,更是检验公司综合实力的“黄金测试”。乐观预期是12到18个月内,灵巧手将进入真实场景,带来新的能力涌现。
行业分水岭:从Research Driven到Product Driven
随着具身智能进入Scaling阶段,行业正经历从Research Driven到Product Driven的转变。学术界的前沿研究逐渐向双臂灵巧操作等高自由度方向迁移,而工业界则通过大规模数据和Infra,解决数据采选、架构设计及系统性工程问题。新入局者需寻找差异化生态位,如通用世界模型或全尺寸人形方向。
丁文超认为,2027年上半年到年中,“能否实现多场景可靠落地”将成为关键评判标准。机器人将开始承担更多真实商业任务,评判标准将直观化为任务完成度、扩展速度及成本。这一过程类似自动驾驶的发展轨迹,从演示路线走向开城速度和大规模量产。
结语:永远不要低估模型的能力
从AWE 3.0到3.5,行业对具身智能的质疑从未停止,从“能动”到“能干活”,再到“长序列处理”,质疑的球门不断后移,但行业实际已前进很远。丁文超强调,永远不要低估AI模型的能力,Scaling带来的能力跃升是解决复杂问题的关键。未来,随着真实场景正反馈的积累,具身智能将形成稳定、可靠、可扩展的完整链路,真正重塑工业生产的底层逻辑。