Browser does not support (or has disabled) JavaScript, some features of this page may not work properly

VLA如何通过RL微调?详解具身智能后训练全流程

VLA如何通过RL微调?一个Case详解VLA后训练全流程

为什么VLA需要强化学习?

视觉-语言-动作模型(VLA)是当前具身智能的核心范式。典型的VLA训练分为两步:

  1. 大规模预训练:利用互联网数据 + 机器人专家数据做预训练,让模型获得基础的视觉理解和语言推理能力
  2. 监督微调(SFT):在特定任务数据集上做行为克隆(Behavior Cloning),让模型学会特定操作

但SFT存在两个致命问题:

问题一:累积误差

这是模仿学习(Imitation Learning)的经典困境。机器人在执行长程任务时,每一步的微小误差会随着任务步骤的增加而累积放大。假设单步误差为1%,一个100步的任务,末端误差可能达到灾难性的程度。任务越长、子任务越多,性能下降越明显。

问题二:数据采集成本极高

SFT需要大量高质量的遥操作数据。目前主流的VLA模型训练动辄需要几百小时的专家演示数据——前不久美国创业公司Generalist发布的Gen E-1模型,凭借海量的UMI(手持夹爪采集)数据集做到了多项任务99%的成功率,执行速度比π0快3倍。但不是每个团队都有资源搭建这样的数据采集流水线。

让机器人自己在环境中试错、自己采集数据、自己变强——这正是RL(强化学习)后训练的核心价值。


VLA的三阶段训练范式

2025年下半年以来,VLA社区逐渐形成了三阶段训练共识:

阶段一:大规模预训练(互联网数据 + 机器人数据)
    ↓
阶段二:多任务监督微调(SFT,可选)
    ↓
阶段三:针对特定任务的强化学习精调(RL Fine-tuning)

值得注意的是,这三个阶段并非强制串联:

  • 如果预训练阶段已经包含足够多的机器人操作数据,可以直接从阶段一跳到阶段三
  • 如果任务本身不太复杂(非长程、非高精度),阶段二的多任务SFT也可能跳过
  • 部分工作甚至完全跳过SFT,直接用RL从零开始在仿真环境中训练

阶段三的优势很明显:在特定任务上收敛极快、性能极高。但它也有代价——灾难性遗忘。针对任务A做了RL微调后,模型在任务B上的表现可能大幅下降。这对多任务泛化场景是一个挑战。


在线RL方法:当前主流

大部分VLA的RL后训练工作都采用在线强化学习,即模型(Policy)直接与环境交互,边交互边学习。以下是几个代表性工作:

SimpleVLA:最简单的RL方案

SimpleVLA的思路非常直接——直接把大语言模型的PPO/GRPO训练范式搬到VLA上:

  1. 先用监督学习阶段的少量数据做Warm-up(热身),让Policy有一个合理的初始参数
  2. 在仿真环境(如LIBERO、RoboTwin)中搭建交互环境
  3. 用PPO或GRPO进行在线训练:Policy与环境交互产生轨迹 → 计算Advantage Function → 更新网络参数
  4. 在仿真中测试验证

SimpleVLA的特点就是简单、可复现,是快速验证RL微调效果的基线方法。它使用稀疏奖励(成功=1,失败=0),无需设计复杂的奖励函数。

VLA-RL:引入过程奖励模型(PRM)

VLA-RL在SimpleVLA的基础上做了关键改进:

  • 轨迹级优化:不仅看最终的成败,而是对整个执行轨迹的每个步骤进行评估
  • 过程奖励模型(PRM):训练一个专门的奖励模型来提供稠密奖励信号。这个PRM本质上是利用VLM对轨迹的每个中间状态进行自动标注——"当前这一步离成功还有多远?"
  • Leave-One-Out策略:在计算Advantage时,排除当前轮次的数据,使用其他轮次的轨迹来计算baseline。这样做可以消除当前轮次的bias,加速收敛

VLA-RL使用的是OpenVLA-3B作为基座模型,在LIBERO基准上做了测试。

RINF:一个统一的RL微调框架

RINF(Reinforcement Learning Fine-tuning Framework for VLA)是目前最完善的工作之一。它不只是一个算法,而是一套框架

  • 支持多种RL算法:PPO、GRPO、SAC(Soft Actor-Critic)等
  • 提供标准化的环境接口、数据收集管道、训练循环
  • 目标是让研究者避免重复造轮子,直接调用框架中的算法进行实验

如果你对SAC感兴趣,可以直接在RINF中配置SAC的参数,测试它在某些任务上的探索能力。不过需要注意的是,RINF对GPU资源的要求较高。


RL-T:一种全新的"测试时强化学习"

Physical Intelligence(π0的团队)近期提出的**RL-T(Reinforcement Learning Token)**采用了一种与众不同的思路:

核心思想:冻结VLA的全部主干参数,只训练一个极小的"总结网络"。

具体来说:

  1. VLA的主干网络(包括视觉编码器、语言模型、动作解码器)完全冻结,参数不变
  2. 引入一个轻量级的编码器,将VLA输出的动作序列压缩成少量Token(Action Tokens)
  3. 这些Token作为"对VLA表现好坏的一种表征",输入到一个极小的RL网络中
  4. 通过对这个小型RL网络的训练,间接优化机器人的行为策略

这种设计的精妙之处在于:

  • 几乎不增加推理开销:小网络的计算量可以忽略不计
  • 保留预训练知识:VLA主体的所有能力被完整保留,不会出现灾难性遗忘
  • 快速适配新任务:只需要训练这个小网络,不需要重新训练整个VLA

目前RL-T尚未开源代码,但考虑到PI团队的风格(π0已开源),未来开源的希望很大。


离线RL与混合方法:另一种思路

除了主流的在线RL,还有一派在探索离线RL混合方法

离线RL:EVIL

EVIL是一套维护得相当完善的离线真机RL代码库(虽然论文可能尚未正式发表)。它的思路是:用已有的人类遥操作数据 + 标注好的奖励信号,不与环境交互,直接从数据中学习。

优点是安全、不需要搭建仿真或真机环境。缺点也很明显——数据采集和奖励标注的成本依然存在。

混合方法:QF.T 和 Robot2One

  • QF.T:通过"动作分块"的方式做离线RL微调。将连续的机器人动作序列切分成块(chunk),在块级别做强化学习优化,避免了在线交互的需求,同时提高了训练效率
  • Robot2One:在推理阶段做强化学习增强。不同任务阶段采用不同的策略规划,用RL来增强VLA的推理能力,而不是在训练阶段修改模型参数

奖励函数设计:从稀疏到智能

RL训练的灵魂在于奖励函数。VLA领域的奖励函数设计经历了三个阶段:

第一阶段:手工设计

  • 稀疏奖励(Sparse Reward):成功=1,失败=0。简单粗暴,但信号极其稀疏——只有任务完全执行完才知道结果。收敛慢,长程任务几乎无法训练。
  • 稠密奖励(Dense Reward):每一步都给出一个奖励值。比如"末端执行器离目标物体近了+0.1","抓住了+0.5"。但这种奖励高度任务特定——拧螺丝的奖励函数拿去抓方块就完全失效,不具备泛化能力。

第二阶段:VLM驱动的奖励

借助视觉语言模型(VLM)的语义理解能力来生成奖励:

  • 用预训练或微调过的VLM对每一帧的操作状态进行评估
  • "当前画面离目标状态还有多大差距?"
  • 可以生成任务无关的稠密奖励,具备一定泛化能力

VLA-RL中的PRM(过程奖励模型)就是这种思路的典型代表。

第三阶段:价值模型替代

不再依赖人工设计的奖励函数,而是直接训练一个**价值模型(Value Model)**来估计每一步的"好坏":

  • 价值模型输出的是期望回报的估计值
  • 可以替代传统的奖励信号来指导Policy的训练
  • π0.6-Star就采用了类似思路,用一个小的Q/V网络提供价值估计

混合奖励:稀疏 + 稠密 + 自适应权重

最前沿的方向是将多种奖励融合:

总奖励 = α × 稀疏奖励(成功/失败)+ β × 稠密奖励(VLM过程评估)

其中α和β可以是自适应权重——当稀疏奖励的置信度高时增大α,当任务状态难以判断时更多依赖稠密信号。这个权重调节本身也可以作为RL的一个学习目标。


未来研究方向

VLA + RL这个方向还处于早期阶段,有很多值得探索的方向:

  1. 探索能力的量化与泛化:RL的探索能力在物理世界(而非语言空间)如何度量?对于未见过的物体、未见过的任务,模型的探索策略有多强?目前几乎没有系统性的工作

  2. 长程任务中的RL效率:当前大部分工作测试的是短程任务(< 10步),如何让RL在50步以上的长程任务中高效收敛?

  3. 跨本体的RL迁移:在一个机器人上训练好的RL策略,如何迁移到另一台形态不同的机器人?

  4. Sim2Real RL:仿真中训练的RL策略如何稳定迁移到真机?Domain Randomization + System Identification + 真机微调的pipeline怎么设计?

  5. RL的数据飞轮:至简动力、Physical Intelligence等公司正在将机器人部署到真实场景,当部署量达到百台、千台级别时,如何利用这些真实交互数据形成RL的数据飞轮?


总结

方法 类型 特点 基座模型
SimpleVLA 在线RL PPO/GRPO,最简单基线 多种VLA
VLA-RL 在线RL + PRM 过程奖励模型,稠密信号 OpenVLA-3B
RINF 在线RL框架 多算法支持,标准化 多种VLA
EVIL 离线RL 不与环境交互 -
RL-T 测试时RL 冻结VLA,小网络微调 π0系列
QF.T 离线混合 动作分块微调 -

VLA + RL的后训练范式正在快速演进。从"完全依赖人类遥操作数据"到"让机器人在真实世界中自我进化",这不仅是技术路线的转变,更是具身智能从Demo走向量产的关键一步。


本文基于B站视频 【VLA是如何通过RL微调的?一个case详解VLA后训练全流程】 整理撰写,对原文内容进行了重新组织结构、补充背景知识和扩展分析。

Author: 月儿
Date:2026年08月11日

Comments