29秒视频教会机器人新技能?HOST框架如何颠覆具身智能学习范式
在具身智能(Embodied AI)的演进历程中,如何高效、低成本地赋予机器人新技能,始终是一道难以逾越的鸿沟。长期以来,行业内的标准操作模式是:专业工程师利用昂贵的遥操作设备采集数百条演示数据,耗费数小时甚至数天进行模型微调,最终让机器人掌握一项特定任务。这种“数据暴力拟合”的路径虽然有效,但成本高昂且效率低下,严重制约了机器人技术的规模化落地。
然而,这一僵局正在被打破。2026年8月3日,自变量机器人与清华大学、北京理工大学联合发布并开源了HOST框架(Human-to-robot One-Shot Skill AcquisiTion)。这一突破性成果的核心在于,机器人仅需观看一段平均时长为29秒的人类演示视频,即可在不更新模型参数、不采集新数据的情况下,执行全新的桌面操作任务。这不仅是一次技术上的迭代,更是机器人学习范式从“动作模仿”向“结果推理”的根本性转折。
从“模仿动作”到“推理结果”的范式跃迁
要理解HOST的突破性,首先需厘清传统机器人学习的核心痛点:人机“身体鸿沟”。人类拥有双臂、五指关节及灵活的躯干,而机器人可能是单臂、夹爪甚至轮式底盘。直接映射人类动作轨迹,因两者运动学和动力学模型的巨大差异,几乎注定失败。过去十年,行业主流解法是通过海量数据来暴力拟合这种差异,但这带来了极高的数据获取成本和算力负担。
HOST框架的创新之处在于,它彻底摒弃了“复现过程”的思路,转而追求“达成结果”。借鉴认知科学中的“观察学习”理论,人类在面对陌生任务时,并非通过反复试错来掌握技能,而是基于已有经验在脑中模拟动作的预期效果,再据此执行。HOST将这一理论工程化,构建了一套“结果先行”的推理范式。
具体而言,HOST的处理流程分为三个关键步骤:首先是任务阶段判断,系统通过视觉内容理解任务进度,识别当前处于“切菜”还是“炒菜”阶段;其次是视角迁移,将人类执行完动作后的画面,转化为机器人自身视角和身体结构下的预期画面,从而跨越身体结构的差异;最后是动作反推,机器人不再复制人类动作,而是求解一个问题:为了达成这个目标状态,我应该执行怎样的动作序列?
这种机制赋予了HOST极强的泛化能力。即使执行过程中物品位置发生偏移,机器人也能根据目标状态重新规划动作,继续完成任务。此外,针对人类与机器人执行速度不同步的问题,HOST引入了“按任务进度对齐”策略。通过动态时间规整(Dynamic Time Warping)算法,系统将视频帧与机器人操作步骤映射到同一向量空间,将对齐误差从基于时钟时间的0.079降低至0.006。这意味着,无论人类演示速度快慢,机器人都能精准同步任务进度,大幅降低了对演示视频规范性的要求。
双专家架构:实现“学新不忘旧”的技术突破
在具身智能领域,一个长期存在的难题是“灾难性遗忘”。当模型通过微调学习新技能时,往往会牺牲对旧技能的掌握能力。论文数据显示,在主流微调方案中,最强基线模型在学习新技能后,在旧任务上的表现下降至原来的43%。
HOST通过其独特的“双专家混合架构”解决了这一难题。该框架采用级联策略模型,将技能学习拆分为两个阶段。第一阶段为“同体预训练”,模型在193,462条机器人同体轨迹数据上进行预训练,覆盖229项任务,建立基础技能框架。第二阶段为“人机视频训练”,利用5,847条人类-机器人配对数据进行微调,实现跨本体迁移。
这种分阶段设计基于数据可获取性的现实考量。机器人执行轨迹数据相对易得,而人机配对数据稀缺。通过先利用机器人视频打好基础,再向人类视频迁移,HOST在有限数据条件下实现了高效学习。更关键的是,HOST在推理时完全不修改模型权重。技能习得更像是“加载了一个新菜谱”,而非“重塑厨师的大脑”。旧技能以模型权重形式固化,新技能以推理时输入的形式存在,两者互不干扰。测试表明,HOST在掌握新技能后,几乎完整保留了所有已掌握的技能,实现了真正的“零遗忘”学习。
数据效率与性能表现的全面领先
在性能评估方面,HOST展现了惊人的数据效率。在涵盖放水果、堆碗、擦盘子、插笔等50项训练阶段从未见过的桌面操作任务测试中,HOST的技能复现成功率达到62%。这一成绩在单样本学习场景下已属突破性成果。
更为显著的是其数据效率的提升。相比当前主流的Pi-0.5配合微调方案,HOST所需数据量减少至1/50,学习时间缩短至1/507。这意味着,原本需要专业团队耗费数周采集和训练的数据与时间,现在仅需一段29秒的视频即可替代。这种效率的提升,直接指向了具身智能行业最核心的瓶颈——数据获取成本。
目前,头部玩家多采用“大规模数据采集”路线,用上百台机器人同时采集数据训练通用基础模型。然而,遥操作数据采集成本极高,一条有效演示的成本可能在数百到上千元,且难以覆盖长尾场景。HOST提供了一条不同的路径:通过算法创新降低单次学习的门槛,使“数据”不再成为专业工程师的专利。
开源生态与行业影响:从专业工具到大众可用
HOST框架的论文、代码和模型权重已全部开源至GitHub和Hugging Face。这一举措具有深远的行业意义。研究团队明确表示,开源的目的是将机器人技能获取从依赖专业人员的复杂流程,转变为普通人通过一段视频即可完成教学的方式。
这一转变有望彻底改变具身智能的生态格局。如果机器人能够通过观看视频学会新技能,那么每一个普通人都可以成为机器人的“老师”。这不仅降低了技术使用门槛,也为长尾场景的覆盖提供了可能。家庭场景中那些罕见但必要的任务,如整理特定杂物、照顾宠物等,将不再因为缺乏数据而无法被机器人掌握。
当然,HOST并非完美无缺。62%的成功率意味着在近四成场景下机器人仍会失败,距离“可靠部署”仍有差距。此外,目前测试任务主要集中在桌面操作类,在更复杂的动态场景中的表现尚待验证。但正如研究团队所言,HOST是迈向通用机器人学习的重要一步,其开源属性将激发社区的创新活力,推动技术进一步迭代。
从宏观视角来看,HOST的发布顺应了2026年具身智能领域“开源加速”的趋势。从谷歌的Open X-Embodiment到小米的Xiaomi-Robotics-1,行业正从“闭门造车”转向“共建生态”。HOST证明了算法创新同样可以大幅降低数据依赖,为具身智能行业提供了一个值得深思的方向:与其无限堆砌数据,不如教会机器人如何更聪明地学习。这一范式的转变,或许正是通往通用人工智能(AGI)的关键一步。