本文作者: 邓哲敏
2026-08-26 14:11
导语:RoboHarness用编排异构策略,让VLA、WAM、RL和TAMP不再各说各话,并零样本完成长时序任务。

作者丨邓哲敏
编辑丨齐铖湧
想象这样一个任务:打开柜门,找到藏在里面的积木,然后把它们搭成一座桥。
对人来说,这是一件很简单的事,几个动作自然衔接,幼儿园小朋友也能顺利完成。
但对机器人来说,这个任务横跨多种完全不同的能力:找积木,需要视觉理解和语言指令跟随;开柜门,需要与环境进行复杂交互;搭积木,需要几何规划和精准操控并推测环境变化。
更麻烦的是,这些种能力分属多个不同“门派”的模型——VLA(视觉-语言-动作模型)、WAM(世界-动作模型)、RL 策略(强化学习)、TAMP(任务与运动规划)。它们各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。
今天在机器人领域,能力不缺,但协作缺位。
华为诺亚方舟实验室近期发布了一篇论文,提出了名为 RoboHarness 的系统,专门解决不同策略之间无法协作的问题。围绕这项工作,论文作者与我们(雷峰网(公众号:雷峰网))进行了交流。

论文:https://arxiv.org/abs/2607.18060
项目主页:https://www.robo-harness.com/

01
万能模型的幻觉和现实的鸿沟
今年夏天,机器人研究领域密集出现了几项围绕 Harness 展开的工作,它们共同指向一个认知:靠更大的模型解决一切,暂时行不通,机器人需要一层执行组织系统。
清华大学于超教授团队在 7 月发布了 Harness VLA,将数字智能中广泛使用的 Harness Layer 引入具身智能,让一个冻结的 VLA 专注于最擅长的接触密集操控,同时用一层 Harness 学会何时、以何种方式调用它,以及在 VLA 失败后如何重置、如何重试。在 LIBERO-Pro 扰动评测中,这套系统把成功率从 50% 提升到 82.4%。
思路上,Harness VLA 解决的是一个模型如何在分布外扰动下稳定发挥。它的问题是单策略的稳定性。
华为诺亚方舟实验室的 RoboHarness,面对的是另一层问题:当任务超出任何一个模型的能力边界时,怎么办?
两者都叫 Harness,都用 Coding Agent 做组织层,但解决的是不同维度的挑战。前者让一个专才变得更稳,后者让一群各有所长的专才协同作战。随着机器人任务复杂度不断上升,后一个问题正变得越来越无法回避。
这个问题的根源,要从各路模型的能力边界说起。
VLA 模型的优势在于理解开放式语言指令、在新环境里泛化,但它端到端生成动作的方式,在长时序任务中很难保持一致性;强化学习策略能在特定训练场景内磨出稳定的闭环行为,但这种稳定性高度依赖训练分布,环境稍有变化便可能失效;TAMP 擅长符号推理和几何约束,但需要预先定义动作原语,面对开放场景和模糊目标时规划器很快就会吃力;WAM 能通过预测未来状态辅助长时序决策,但容易随预测时域增长产生误差累积。
复杂的真实任务同时要求语义理解、几何规划、闭环控制、长时序推理和环境变化推测,这些能力对应的训练目标不同,有时甚至相互冲突。从各项能力分别取得突破,到单一模型在开放环境里长期稳定兼顾所有能力,横亘着一道至今没有被真正跨越的鸿沟。
RoboHarness 的出发点正是:与其等待这道鸿沟被填平,不如先让已经存在、各有所长的模型真正协同起来。作者认为,直到某一个模型能够完全压制其他所有模型、展现出绝对的统治力之前,这样的编排架构都是非常有意义的。
这项工作并非凭空而来。作者告诉我们(雷峰网),RoboHarness 的雏形诞生于去年参加全球机器人挑战赛 BEHAVIOR Challenge 的经历。当时赛题任务又长又难,团队发现无论是端到端训练 VLA 还是用行为克隆之类的模型,都没法覆盖任务本身的难度。这次受挫,反而让团队看清了真正的问题所在。

02
调度大脑如何决定该谁上场
RoboHarness 的核心思路,是把 VLA、WAM、RL 策略、TAMP 等独立开发的控制系统,封装成可以被统一调度的 agentic skills,由 Coding Agent 负责高层决策。
这个设计有一个重要前提:不改变、不重训任何底层策略。各个策略保留自己的原始实现,不需要共享模型结构、动作空间或训练数据。RoboHarness 只是在它们之上增加了一层组织能力。
选对策略,可没那么容易。
对于一个 Coding Agent 来说,单靠原始图像输入,很难可靠地判断这个任务该派发给谁。因为这个决定背后藏着很多靠语言模型的语义理解能力答不出来的量化问题。它能读懂把杯子放到盘子上,但无法从一张 RGB 图像里算出当前场景与某个策略训练分布的相似度,更没法评估此刻传感器数据的可靠程度。
为了解决这个问题,系统设计了三类辅助技能,专门替 Coding Agent 把判断所需的信息提炼出来。

Understanding Skills,负责将原始输入转化为可量化的信号,比如:图像嵌入与各策略训练数据的相似度、物体位姿在时间窗口内的稳定性、当前光照和图像质量是否达标等。这些指标是策略路由的真正依据。作者认为,这个模块的本质,就是从多维度去衡量每一个策略到底适不适合当下的任务。
Memory Skills,检索历史执行经验,为选策略提供参照,并通过 Memory Bridge 处理策略之间的状态分布不匹配——这是系统最核心的设计,下文单独展开。
Evolution Skills,利用在线反馈持续更新策略的元数据和编排逻辑,让系统从每一次执行中学习,而不是每次面对新情况都从零判断。
三类技能的信息流相互交互,共同辅助 Coding Agent 决策。在实际执行中,这套机制主要有两层作用:一是任务拆解,将长指令切分为适合不同策略承接的子任务;二是动态切换,当当前策略逐渐接近其能力边界时,系统会及时切换到更合适的策略,实现不同策略之间的能力互补。
论文用一组消融实验说明了这两层的各自贡献:仅用语言模型帮 pi0.5 拆解任务再发给它,成功率已经明显上升;在此基础上接入多个异构策略后,成功率进一步大幅提升。拆得对是第一步,派得准是第二步,两者缺一不可。
但还有第三个问题,也是最难的一个,是光靠选策略解决不了的。

03
决定接力跑胜利的是交接的瞬间
两个独立训练的策略,通常生活在各自的数据世界里。它们的输入格式不同,对机器人状态的经验分布也不同。TAMP 操作完毕停下来的那个位置,很可能恰好落在 VLA 从未处理过、无法稳定启动的状态空间里。
这是异构策略编排独有的难题。
因此,负责让两个策略稳定交接的 Memory Bridge 被作者列为 RoboHarness 里第一重要的模块。他坦承,如果未来某个通用模型能完美覆盖全部状态空间,Memory Bridge 或许就非必需;但在现状下,任何模型都很容易在交接瞬间落进能力分布之外。

Memory Bridge 的工作分三步。
检索:根据下一子任务和当前观测,通过文本和视觉相似度,从多模态记忆库里找出目标策略曾经成功执行的 Top-K 条相似轨迹,提取末端执行器位姿、关节角度等机器人状态。
建模:根据各状态在轨迹中的相对进程赋予监督信号,通过在线回归实时拟合目标策略“习惯接手”的状态范围。
桥接:采样并评分候选状态,综合考虑进入目标策略舒适区的置信度和运动代价,选出最合适的桥接目标,生成过渡轨迹;机器人抵达这个状态后,再把控制权交给下一个策略。
这套机制完全依赖历史执行数据在线学习,对任意策略即插即用,无需修改底层实现,也不需要联合训练。
消融实验中,移除 Memory Bridge 后,任务进度下降不算太大,说明策略选择依然基本正确,但完整成功率从 86.0% 骤降至 60.4%。大量任务走到最后一步,因为交接状态不兼容而功败垂成,从方面证明了 Memory Bridge 的价值。

04
两条技术谱系,一场悄悄发生的汇流
把视野从这篇论文拉开,我们更想去描述一幅更大的具身技术版图。
RoboHarness 的作者观察到,在过去三年 VLA 快速发展的背景下,传统 TAMP 与分层规划由于在开放场景中的泛化能力明显弱于端到端 VLA,一度淡出社区关注。然而,随着今年 agentic systems 和 coding agents 的快速进展,分层架构重新获得了新的生命力:高层 agent 可以借助可组合的 skills 进行任务拆解、工具调用与动态规划,从而显著增强传统层级方法的泛化能力与适应性。由此,学术社区正重新关注,并开始探索如何将强泛化的高层推理与异构底层策略相结合。
这篇文章的作者来自多所加拿大东部高校和研究机构。笔者观察到,北美机器人研究长期存在两条具有明显学术渊源的技术路线:美国西海岸,以 Stanford、Berkeley 等为代表,更强调 learning 与 scaling,关注端到端学习、数据规模和模型泛化;而美国东北部及加拿大,以 MIT、多伦多大学、MILA 等为代表,则长期更重视分层架构、符号推理、逻辑规划和结构化决策。
RoboHarness 的作者们,正处于后者这条谱系的延伸之上。
技术路线的分化,在具身智能工业界留同样下了清晰印记。近年来快速发展的团队逐渐形成了从 foundation model scaling 到 agentic hierarchy 的技术谱系:一类更强调通用具身基础模型、VLA 与 world model,通过统一模型、数据规模与模型能力的提升不断拓展泛化边界;另一类则更强调可复用操作技能与分层架构,通过任务规划、技能组合和底层控制协同完成复杂任务。国内以智源为代表的团队更接近前者,而苏度科技、魔法原子等则更突出后者;在海外,Physical Intelligence 的 pi 系列长期代表了 scaling 路线,而 Gemini Robotics,则延续了“高层推理与规划 + 底层技能执行”的分层传统。
有意思的是,这种技术谱系的分化并非静态对立,而是在不断演化中形成互补。近几个月,两条技术路线开始出现明显的汇流现象。例如,Physical Intelligence 在 pi0.7 中将可控性与技能组合提升到更核心的位置;与此同时,NVIDIA 等团队也持续推出更具分层特征的 robot agentic systems,将基础模型的理解与推理能力与VLA结合。整体来看,foundation model scaling 与 agentic hierarchy 正在从两条相对独立的技术路径,逐渐演化为同一套机器人系统中的互补能力。

05
以编排为径,走向更通用的智能
RoboHarness 本身有明确的局限:它能调度的是已有策略,无法解决所有策略都做不到的事。Memory Bridge 的可靠性依赖足够的历史执行数据,新接入的策略在早期阶段的能力评估会有较大的不确定性。
论文的核心论点并非否定统一大模型的必要性。
作者强调,长时序任务的编排不仅是对现有能力的组合,本身也会持续产生单个模型难以独立获得的跨能力、跨场景执行数据。这类数据记录了不同策略之间的切换、衔接、失败恢复与协同过程,恰恰可能成为训练下一代通用机器人模型的重要来源。基于这一思路,RoboHarness 团队也正在探索将混合策略编排与执行过程中产生的数据重新用于底层策略训练,异构编排的执行经验进一步反哺模型基础能力的提升。
从寻找最强模型到组织最合适的能力,具身智能的竞争,正在悄悄延伸到系统层面的设计。异构策略编排与统一大模型,像是沿着两条不同山脊展开的跋涉,最终都指向同一个远方:让机器人拥有更通用、更可靠的智能。


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。

98年中科大博士段逸凡创立灵犀智涌 以“模型+Harnes ...

Harness 神器 J-Space 造假案背后,思维链作者暴论, ...

华尔街实测8款全球主流Agent:千问办公综合排名第一 ...

模型换个Harness就「变笨」?EverMind把自进化从研究 ...

编辑
李飞飞、Yilun Du罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIR Paper 115
IJCAI 2026 专访:机器人想学会人类动作,还差一座桥 | GAIR Paper 118
具身智能开始进入「下半场」:从会干活到干完活
中国电信领投,觅蜂科技再获数亿元融资,聚焦物理AI数据服务平台
国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路
WRC 2026|原生全模态世界模型:从模拟世界到交互世界
机器人首秀网球场,银河通用突破具身智能「AstraTennis时刻」
WRC 2026 风向标:具身智能下半场,比「大脑」更比「账本」
宇树科技上市首日大涨629%,世界机器人大会里谁是“下一个宇树”?
以GLM-5为例,探究九章智算云强化学习系统如何落地“训推一致”
共生知行发布人形机器人赛车Demo:以卡丁车测试双足机器人的“全身智能”