今天,清华大学于超教授团队联合正行创新、无问芯穹,正式发布并开源 Harness VLA,这一技术成果首次将数字智能中广泛应用的 Harness Layer 引入具身智能系统,在保持 VLA 模型冻结的基础上,通过 Agentic Planner 对模型调用、任务执行和失败恢复进行统一组织,让机器人从「依赖单一端到端模型」迈向「模型能力与系统能力协同工作」的新架构,显著提升机器人在复杂真实环境中的泛化能力。
在更具挑战性的 LIBERO-Pro 扰动评测中,Harness VLA 将成功率提升至 82.4%,显著超过 Pi_RLinf(50%)、NVIDIA Cap-X(18.2%)和 Berkeley RATS(43.8%),验证了「模型 + 系统」的新一代机器人智能架构的可行性。更重要的是,Harness 并非针对某一特定模型设计,而是一种面向系统层的通用框架。除了 VLA,它同样能够与 WAM 等具身基础模型结合,通过统一的任务执行层释放不同基础模型的能力,为未来具身智能系统提供更加通用的组织方式。

HarnessVLA 系统亮点介绍

过去两年,Vision-Language-Action(VLA)模型几乎已经把机器人操作的标准 Benchmark 的成功率做到了接近饱和。

例如,在 LIBERO 130 个任务中训练的 Pi 0.5 模型,平均成功率高达 96%。从抓取、搬运到整理物体,大多数任务已经能够稳定完成。

但这些漂亮的数字,并没有真正回答一个更现实的问题:机器人离开标准测试环境之后,还能正常工作吗?

当把同样的模型部署在有目标重绑定与布局扰动的 LIBERO Pro 环境中,96% 成功率锐降至 50%。尽管动作依然流畅,局部操作本身也没有明显错误,但由于目标绑定、空间关系或任务阶段判断出现偏差,最终整个任务仍然会失败。

这也是当前 VLA 最核心的挑战之一:泛化能力不足。模型能够完成训练过的任务,却很难稳定适应真实环境中的细微变化。

面对这一问题,一个自然的思路是继续扩大模型规模、收集更多数据,希望模型本身能够学习到更强的泛化能力。但数字智能的发展提供了一个值得借鉴的答案。

以 Claude Code、Codex 等 Coding Agent 为代表的新一代 AI 系统,能力提升并不仅仅来自更大的语言模型,更来自模型之外新增的一层执行组织系统(Harness Layer)。语言模型负责生成,而 Harness 持续维护上下文、调用工具、处理失败,并决定模型在什么时候、以什么方式参与任务。越来越多的研究开始意识到,系统能力不仅取决于模型本身,也取决于模型如何被组织和调用。

那么,对于机器人而言,VLA 是否也需要属于自己的 Harness Layer?

清华大学于超教授团队联合正行创新、无问芯穹提出的 Harness VLA,首次将 Harness Layer 引入具身智能。

这一思路得到了验证,实验发现了惊人的泛化能力。

在具有挑战性的 LIBERO-Pro 扰动评估中,Harness VLA 达到 82.4% 的成功率,显著超过 Pi_RLinf (50%)、NVIDIA Cap-X(18.2%)和 Berkeley RATS(43.8%)。整个过程中,底层 VLA 全程冻结,权重保持不变。

更重要的是,Harness 并非针对某一特定模型设计,而是一种面向系统层的通用框架。除了 VLA,它同样能够与 WAM 等具身基础模型结合,通过改进模型被组织和调用的方式,释放不同基础模型的能力,提升复杂扰动环境下的任务成功率,为未来具身智能系统提供更加通用的组织方式。

这一发现或许意味着,具身智能需要经历与数字智能类似的一次范式演进:从 End-to-End VLA,走向 Harness VLA。



Harness VLA 重新定义了 VLA 在机器人系统中的执行方式

Harness VLA 给出的核心答案不是训练一个更大的端到端 VLA,而是让冻结的 VLA 专注于最擅长的接触密集操作,并通过一层 Harness Layer 学会如何组织、调用和复用它。



图 1 Harness VLA 系统框架。Agentic Planner 在交互过程中不断学习 Primitive 的组织方式,并根据环境动态调度解析 Primitive 与 VLA_ACT Primitive。

在 Harness VLA 中,底层 VLA 被封装为统一的 VLA_ACT Primitive,主要负责抓取、放置、按钮按压、抽屉 / 门操作等难以解析建模的接触密集行为;而 MOVE_TO、ROTATE_WRIST、SET_GRIPPER、RELEASE 等 Analytic Primitives 负责稳定的空间移动、位姿调整、运输和释放。

真正的关键不只是把这些 Primitive 放在一起,而是让 Agentic Planner 在闭环交互中学习它们的使用边界:哪些阶段应交给 Analytic Primitive,哪些局部接触应交给 VLA_ACT Primitive,VLA_ACT Primitive 调用前需要怎样调整视角和预接触位姿,以及一次接触失败后应如何重新 Staging 并再次尝试。

因此,Harness VLA 并不是执行一套固定流程的调度器,它的整个生命周期划分为两个不同的阶段:探索式自举阶段(Exploratory Bootstrapping Phase)和严格的部署评估阶段(Deployment Evaluation Phase)。

它在探索阶段通过环境反馈不断试错,记录成功的 Primitive 组合轨迹,并将其抽象为 Task Specific Memory;同时,它把跨任务可复用的成功规则和失败模式沉淀到 Global Memory 中。在新的布局或任务扰动测试阶段下,Agentic Planner 不会机械地重复旧坐标,而是利用当前观测重新绑定目标和空间位置,再根据已有 Memory 组织 Analytic Primitive 与 VLA_ACT Primitive 的组合。

从这个意义上说,Harness VLA 学到的不是新的底层机器人技能,也不是对 VLA 权重的更新,而是如何更可靠地使用已有技能:它学习 VLA 的适用范围,学习 Analytic Primitives 与 VLA Primitive 的组合结构,学习失败恢复策略,并把这些经验转化为可复用的执行记忆。底层 VLA 始终保持冻结,但 VLA 被调用的时机、条件和上下文不断被 Harness 优化,从而显著提升整个系统在扰动任务、长程任务和跨场景任务中的执行效率与泛化能力。



图 2 Harness VLA 的原理概念图

三类任务结果,扰动、长程和迁移都达到 SOTA

Harness VLA 在三个具有挑战性的机器人操作 Benchmark 上进行评估,分别覆盖扰动泛化、家庭厨房长程任务和双臂跨场景迁移。

其中,LIBERO-Pro 在原始桌面操作任务上引入目标重定向和位置交换等扰动,用于测试系统在语义重绑定和空间变化下的鲁棒性;RoboCasa365 面向真实家庭厨房式操作,包含移动、抓取、放置、抽屉、水龙头、微波炉等长程复合交互,用于评估 Harness 对复杂任务的组织、重试和恢复能力;RoboTwin C2R 则考察双臂操作从 Clean 场景到 Randomized 场景的迁移,进一步验证方法在多臂协作和场景随机化下的泛化能力。

在所有评估中,Harness VLA 始终基于同一套固定的原语词汇表P运行,并且不允许在部署阶段引入新的原语。在下文各表中,Harness VLA (Codex) 和 Harness VLA (CC) 分别表示使用 Codex 规划器和 Claude Code 规划器实例化的同一套 Harness。

基于 Task Specific Memory 的少样本评估 (Few-shot Evaluation)

少样本评估的设定为:Harness VLA 已经在每个任务的 Seed 0 下通过探索和环境反馈不断试错,得到了一条该任务成功的 Primitive 组合轨迹 ,即 Task-Specific Memory ,随后将 Harness VLA 直接应用到该任务的其他 Seed 中测试。这一过程与人类学习过程类似:先通过少样本探索学习直至掌握,而后自行作业。

LIBERO-Pro,Harness VLA 使用 RLinf 开源的 pi05_libero130_fullshot 模型。表 1 汇总了 LIBERO-Pro 上的实验结果,涵盖 SPATIAL、OBJECT、GOAL 和 LIBERO-10 四类任务,并分别考虑指令重定向(instruction-redirection,T)和位置交换(position-swap,S)两类扰动。现有端到端 VLA 模型在这些分布偏移下性能显著下降;直接运行 RLinf 开源模型总体成功率为50.0%。Harness VLA (CC) 将这一结果提升至82.4%。值得注意的是,这一结果也显著超越了领域内提出的 Code as Policy 方案 Cap-X 和 RATS。



表 1|LIBERO-Pro 上的总体成功率(%)。「/」表示该结果不可用或未报告。Cap-X 和 RATS 仅报告了 6 个不包含 LIBERO-10 的评测项,因此其总体结果仅对已报告的单元格取平均。

RoboCasa365,RoboCasa365 将评估范围从桌面操作扩展到家庭厨房任务,其中包含移动平台预置位、关节式机构操控,以及更长的复合操作流程。Harness VLA 使用冻结的 RLDX-1 模型。表 2 显示,Harness VLA 将 RLDX 的成功率分别从 60%、21.3%、5% 提升到了 91.6%、56.3% 和 15%,达到 SOTA 性能。这些提升与预期的任务分工一致:规划器负责导航、预置位,以及局部失败后的重新预置位;冻结的 VLA 则继续作为局部富接触原语。



表 2|RoboCasa365 上的成功率(%)分隔线上方的基线结果来自相应先前论文在 ATOMIC-SEEN、COMPOSITE-SEEN 和 COMPOSITE-UNSEEN 三个评测的报告。

不使用 Bootstrapped Harness Memory 的零样本评估(Zero-shot Evaluation)

LIBERO-Pro Goal,为了评估 Harness VLA 在不依赖记忆检索时的在线决策能力,我们在零样本(Zero-shot)设定下评估 LIBERO-Pro Goal。在该设定中,Harness VLA 不检索目标设定下的 Task Specific Memory,也不使用对应的 Global Memory,而是仅依赖当前任务指令、实时 RGB-D 观测、机器人状态以及固定的 primitive 接口进行在线决策。

表 3 显示,零样本 Harness VLA 在两种扰动设定下均优于 Cap-X:在位置交换(Pos-S)设定下达到31.0%,在指令重定向(Task-T)设定下达到79.0%;相比之下,Cap-X 分别为25.6%16.8%。

这一结果说明,Harness VLA 的优势不完全依赖记忆检索:即使在 zero-shot 下,Agentic Planner 仍能在线调用 VLA_ACT 处理抓取、放置等接触密集阶段,并结合 Analytic Primitives 完成目标定位、位姿调整和释放,因此优于仅依赖解析原语组合的 Cap-X。

但 zero-shot 与 few-shot 的差距也表明,仅靠在线推理还不足以稳定掌握最优 Primitive 组合,尤其在位置交换任务中,空间重定位、Staging、运输和失败恢复仍高度依赖 Task Specific Memory 与 Global Memory 中沉淀的执行结构和失败模型。



表 3|LIBERO-Pro GOAL 上的逐任务成功率(%)。 比较零样本 Harness VLA 与 Cap-X 的结果;Pos 表示位置交换,Task 表示指令重定向。

RoboTwin C2R,RoboTwin C2R 用于评估从 Clean 场景到 Randomized 场景的零样本迁移:Agentic Planner 首先在 Clean 设定下探索得到 Task-Specific Memory,随后将其直接迁移到 Randomized 任务实例中。在此过程中,不进行 Randomized 设定下的自举、不增加额外的任务级探索。



表 4|RoboTwin C2R 上的成功率(%)。 各列比较了在 C2R 设定下,具有代表性的 VLA 基线与 Harness VLA 的性能。

82.4% 背后,是目标、状态和分工三件事

Harness VLA 的设计建立在一个关键洞察上:

许多部署失败,并不是 VLA 不会抓取、放置或操作,而是它在错误的目标、错误的状态或错误的任务阶段,继续执行了一段局部上看似合理的动作。

Harness VLA 提升的并不是 frozen VLA 单次动作的能力,而是让这些已有能力被用在更正确的地方。

第一,让 VLA 作用在正确的目标上

当指令重新指定目标,或者物体与容器交换位置后,端到端 VLA 仍可能延续训练时熟悉的目标和空间关系。

它的动作可能依然流畅:机械臂正常靠近、抓取和放置,但服务的对象已经错了。此时,失败的原因并不是动作执行不够稳定,而是从一开始就选错了目标。

Harness VLA 会由 Agentic Planner 根据当前任务指令和 RGB-D 观测,重新判断应该操作谁、目标位于哪里,再据此组织后续动作。



图 3:LIBERO-Pro 中的目标重定向与布局交换。

如图 3 所示,Frozen VLA 容易延续标准任务中熟悉的目标或空间关系;Harness VLA 则会重新绑定当前目标,再完成空间重定位、Staging 和局部接触操作。

因此,它首先解决的不是「怎样把机械臂移动得更准」,而是「当前究竟应该对谁做什么」。

第二,让 VLA 在合适的状态中被调用和再次调用

即使目标识别正确,如果让 VLA 从任意距离、视角或机械臂姿态直接接管,它仍可能处在不熟悉的状态分布中。这一问题也是分段解决长程任务会遇到的典型策略衔接问题。

Harness VLA 的关键在于,它不是简单地把任务切成若干步骤,而是通过探索和记忆逐渐学习 VLA 的适用边界:什么时候应该先调整空间关系,什么时候 VLA 已经处在可接管的局部操作区间,什么时候一次接触失败后需要重新 Staging 再次尝试。换言之,Harness 学到的不是新的底层动作技能,而是如何为 Frozen VLA 创造更合适的调用条件,并在调用后根据反馈继续组织执行。

调用前:让 VLA 从更合适的状态开始工作。

这种机制让 VLA 不必从任意状态端到端承担整个任务,而是在更接近其优势分布的位置上发挥作用。



图 4:Harness VLA 对 Frozen VLA 的自适应调用。

如图 4 所示,Agentic Planner 在移动、Staging、局部接触和状态检查之间闭环切换;当局部操作不稳定时,系统可以先重新调整操作状态,再发起下一次尝试。

Harness VLA 没有直接增强 Frozen VLA 的单次局部操作能力,而是减少长距离移动、空间搜索和姿态调整对它的干扰,让它更多地处理自己擅长的局部接触。

调用后:根据反馈决定是否再次调用。

一次 VLA_ACT 调用并不总能完成整个任务。对于长程操作,机器人可能需要在抓取、放置、开关部件等不同阶段分别调用 VLA;而当某次局部操作没有取得预期进展时,Harness VLA 也可以重新调整状态,再次调用 VLA 进行重试。

关键在于,这并不是让 Frozen VLA 在相同条件下机械地重复执行。每次调用之后,Agentic Planner 都会根据新的观测判断当前任务进展,并决定是继续执行、使用 Analytic Primitives 重新移动和 staging,还是再次调用 VLA_ACT。

因此,第二次调用所面对的通常已经不是第一次调用时的状态。机器人可能重新调整了机械臂位姿、夹爪状态或与目标的相对位置,再让 VLA 从更合适的局部状态重新开始。

Task-Specific Memory 保存成功任务中可复用的 Primitive 执行结构,Global Memory 则积累跨任务的失败规则和恢复经验,帮助 Agentic Planner 判断什么时候需要再次调用 VLA,以及调用前应该先进行怎样的调整。



图 5:不同 VLA Primitive 调用上限下的累计任务成功率

如图 5 所示,横轴表示每个 Episode 最多允许调用 VLA_ACT 的次数,纵轴表示累计任务成功率。随着允许调用次数的增加,LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 上的成功率都在最初几次调用后快速上升,并逐渐接近完整 Harness VLA 的性能。

这说明,由 Agentic Planner 完成 Staging 后进行的重复调用确实能够提升成功率,但实际所需的调用仍然是稀疏的,并不依赖大量反复尝试。

换句话说,Harness VLA 不再要求 Frozen VLA 一次调用就决定整条任务的成败。每次调用前,Agentic Planner 会先判断当前状态是否适合交给 VLA,并在必要时完成目标定位、空间调整和 Staging;每次调用后,系统又会根据新的观测判断是否继续执行、重新调整,或在新的局部状态下再次调用 VLA。

真正有效的不是单纯「多调用几次」,而是在调用前把 VLA 放到更合适的接触起点,在调用后用反馈决定是否需要少量而有针对性地再次调用。

第三,Analytic Primitives 将非接触执行从 VLA 中剥离出来

Harness VLA 的一个重要作用,是将长程任务中的非接触执行从 VLA 的职责中剥离出来。机器人任务并不是从头到尾都需要学习型视觉运动控制;真正依赖 VLA 的,通常是局部接触密集阶段,而大量中间过程更适合由稳定、可控、可重复的 Analytic Primitives 完成。

这种分工减少了 VLA 需要覆盖的任务范围。VLA 不再需要同时承担长距离移动、物体运输、释放和中间状态维持,而可以专注于自身最擅长、也最难被解析建模的接触操作。换言之,Analytic Primitives 并不是替代 VLA,而是把 VLA 从可解析的非接触执行中解放出来,使其在更清晰的任务边界内发挥作用。

图 6 的任务完成归因直接支持了这一点。在 LIBERO-Pro 系列任务中,许多成功 rollout 的最终完成判定发生在 Analytic Primitive 之后,说明 VLA 常常只负责建立关键接触,而后续完成任务的是非接触执行;而在 RoboCasa365 和 RoboTwin C2R 中,由于任务末端包含更多机构操作、受约束放置或双臂交互,成功更常发生在 VLA_ACT Primitive 之后。不同 Benchmark 中完成归因的差异说明,Harness VLA 并不是固定地偏向某一类原语,而是根据任务结构,将可解析阶段交给 Analytic Primitives,将接触密集阶段交给 VLA_ACT Primitive。

图 7 的代表性 rollout 进一步展示了这种分工:VLA_ACT 负责完成关键接触,Analytic Primitives 则负责围绕接触阶段组织非接触执行,包括任务推进、状态转换和最终完成。二者结合后,Frozen VLA 不再需要端到端承担整条任务,而是作为局部接触能力被嵌入到一个更稳定的执行结构中。

这些证据共同支持了同一种任务分工:Analytic Primitives 围绕富接触阶段组织整个任务,而 VLA 仍负责那些需要学习型视觉运动控制的阶段。



图 6|不同 Benchmark 上的任务完成归因。 柱状图展示了成功 rollout 中,最终 Benchmark 完成判定谓词是在 Analytic Primitive 执行后触发(蓝色),还是在 VLA Primitive 执行后触发(橙色)的比例。

在 LIBERO-Pro 系列任务中,VLA 建立稳定接触后,任务大多由 Analytic Primitives 完成;而 RoboCasa365 和 RoboTwin C2R 包含更多位于任务末端的富接触操作,例如机构部件操控、受约束放置或双臂物体交互,因此其成功 rollout 更常在 VLA 原语执行后完成。



图 7|围绕富接触阶段进行解析式分解的代表性 rollout 帧。

上排:在一个 LIBERO-10-PRO 位置交换任务中,智能体首先调用 VLA_ACT,随后开始向篮子方向移动;但在执行 MOVE_TO 的过程中,系统检测到 VLA 实际上并未成功抓住奶油奶酪盒。规划器于是返回目标附近,再次调用 VLA_ACT;在成功抓取后,使用 MOVE_TO 和 RELEASE 完成该子任务。

下排:在 RoboCasa 的 STEAMINMICROWAVE 任务中,智能体首先通过 VLA_ACT 成功抓取碗,随后持续搜索并调整位置,直到定位到微波炉;接着调用 VLA_ACT 将碗放入微波炉,并使用 MOVE_TO 将其进一步推入,随后关闭炉门,最后通过 MOVE_TO 和 NAVIGATE_TO 完成开关按压操作。

Harness VLA 的定位

Harness VLA 的出现,实际上位于三个研究方向的交汇点:VLA、Agent 和 Code as Policy。VLA 模型通过端到端学习视觉、语言与动作映射,显著提升了机器人在富接触操作中的能力。然而,这类模型通常同时承担语言理解、任务规划和低层控制,在长时程组合、目标重绑定和分布外部署场景中仍然存在明显局限。

Harness VLA 将 VLA 的职责收缩到其最擅长的富接触操作,而将目标定位、运动规划、导航等确定性阶段交由智能体和解析式控制完成。另一方面,Agent 和 Code as Policy 展示了 Coding Agent 强大的任务规划、工具调用和组合泛化能力,但通常依赖解析式原语,难以处理复杂的接触操作。

Harness VLA 将两类方法结合:Agentic Planner 负责基于记忆进行闭环规划、反馈和重规划,而 Frozen VLA 作为一种新的高层原语负责执行富接触技能,从而在不修改 VLA 参数和不扩展原语库的前提下,实现更强的部署泛化能力。Frozen VLA 越强,Harness 可调用的能力越丰富;Harness 对执行流程的优化,又能将这些能力更稳定地转化为完整任务的成功率。

开源!面向具身智能的智能体化基础设施

正如 Harness Layer 推动了 Coding Agent 的快速发展,具身智能或许也正在进入一个新的阶段:模型负责产生能力,而 Harness 负责释放能力。 从「训练一个更强的模型」走向「构建能够持续学习、自主执行、不断进化的智能体系统」,基础设施的重要性正在被重新定义。

基于这一理念,Harness VLA 正式开源,并作为 RPent(Recursive Physical Agent,
https://github.com/RLinf/RPent) 开源生态中的首个核心项目发布。



RPent 是由清华大学于超教授团队联合正行创新、无问芯穹共同发起的新一代具身智能开源项目。在此之前,团队推出的RLinf已成为全球首个面向具身智能大规模强化学习的开源基础设施,GitHub Star 超过 4,100,入选 PyTorch Ecosystem,并被 NVIDIA 官方收录,已被多家机器人企业和科研机构广泛采用,在具身智能领域产生了广泛影响。

如果说 RLinf 的目标是构建具身智能强化学习的训练基础设施(Training Infrastructure),那么 RPent 的目标则是构建具身智能持续进化的智能体化基础设施(Agentic Infrastructure)。RPent 以「服务化、标准化、组合化」为核心设计理念,将模型、机器人、技能、记忆与环境统一纳入智能体基础设施。通过服务化实现能力解耦,通过标准化实现生态连接,通过组合化实现智能重构,让具身智能系统能够像软件一样被构建、扩展和持续进化。欢迎广大研究者关注仓库,贡献代码,共同探索具身智能新范式。