RL 基础与 VLA 后训练:公式、方法与论文对照
研究笔记 01 · 2026-10-02
面向双臂/灵巧手 VLA、offline-to-online RL,以及 Humanoid + ACT。根据本地论文原文整理;“REACP”按 RECAP 处理。核心方法展开目标函数,其余方法用速查表压缩。文中的论文简称链接到本地 PDF;末尾列出核对版本与原始来源。
阅读顺序:先读 1–5 节基础,再读 6–11 节算法,最后读 12–14 节 VLA 对接与选型。这里统一了不同论文的符号,公式保留算法核心,工程上的 ensemble、归一化、辅助损失以原文为准。
1. 统一符号与问题设定
1.1 环境、策略与网络
| 符号 | 定义 |
|---|---|
| ; | 状态空间、动作空间;时刻 的状态与动作。动作可以是关节目标、末端位姿增量,也可以是后文定义的动作块。 |
| 环境交互步;一条有限轨迹共有 次动作, 为终止状态。 | |
| 状态转移分布与初始状态分布;撇号表示下一状态。 | |
| 执行 、转移到 后获得的标量奖励; 是其条件均值。 | |
| 每个环境步的折扣因子。持续任务通常取 ;有限任务可取 。 | |
| 表示这次转移使任务真正终止,否则为 ; 是继续 bootstrap 的掩码。 | |
| 待优化策略与采集数据的行为策略; 为 actor 参数。连续动作下是概率密度。 | |
| 通用数据集/replay buffer、固定离线数据、在线新收集的数据;基础记录为 。 | |
| 分别由参数 表示的动作价值、状态价值网络;critic 是估计器,不等于真实价值函数。 | |
| 上横线、上帽子 | 为慢更新/冻结的目标网络参数; 等为估计量。 |
| stop-gradient:前向取 ,反向不通过 求导。 | |
| 期望、梯度、条件成立取 的指示函数、欧氏范数。 为自然对数。 | |
| 待最小化的损失、正的学习率;目标 通常待最大化。 |
默认转移与奖励机制不直接依赖 。有限时域问题若奖励/最优策略依赖剩余时间,应把时间并入状态,或给 加时间下标;下文采用前者,避免省略时间造成 Bellman 方程歧义。
1.2 VLA 中什么才是状态
令 为任务语言, 为相机、关节等观测, 为历史上下文。机器人通常是部分可观测问题:理论中的 可理解为满足 Markov 性的完整状态或 belief state,实际模型则计算 。仅用当前图像代替完整状态是建模近似。
语言可作为状态的一部分。动作若是电机关节目标,动力学 仍包含伺服器、接触和机体动力学;“直接输出关节目标”不等于网络输出电机电流,也不自动等于全身控制已端到端训练。
2. Reward → Return → Q / V / A → J
2.1 即时奖励、累计回报、优化目标
Reward 只评价当前一次转移;return 是从当前开始的折扣累计奖励; 是策略在初始任务分布上的期望回报:
期望覆盖初始状态、策略采样和环境随机性。单条轨迹的 只是一次样本,不是 。若只在最后成功时给 , 时 等于成功概率;若 ,它还偏好更早成功。若每步给 ,则偏好少用步数;如果失败也会提前结束,必须设计失败代价,避免“尽早失败”反而得分更高。
2.2 三种价值量
先固定策略 。定义状态价值 、动作价值 和优势 :
问“到这里之后,按这个策略做能得多少分”; 问“这里先做这个动作,再按策略做能得多少分”; 问“这个动作比该策略在此处的平均动作好多少”。因此:
优势为正不代表一定成功,只代表比当前基准更好。论文中 IQL 的 expectile 、SAC 的 soft 有不同定义,不能直接套用上面的“普通策略平均价值”。
2.3 Bellman 方程从哪里来
把 放进条件期望,用全期望公式即可得到 Bellman expectation equation:
令 、。当最大值可达时,Bellman optimality equation 为:
这形成两种基本操作:policy evaluation 固定策略估计价值;policy improvement 根据价值改善策略。Actor–Critic 将二者交替进行。连续高维动作下,直接求 很难,actor 的一个作用就是近似这个优化步骤。
3. MC、TD、n-step 与 GAE
3.1 MC return 与 TD target
Monte Carlo(MC) 等到完整轨迹结束,用观测到的 监督价值:
Temporal Difference(TD) 用“真实一步奖励 + 下一状态价值估计”作目标。令 为一步目标、 为 TD error:
表格型 TD(0) 的更新是 。目标网络不是 TD 定义的一部分,而是深度 RL 常用的稳定化手段。Q 网络也可用 TD;区别只是目标中的后续价值从哪里来。
| 比较项 | MC | TD |
|---|---|---|
| 监督信号 | 后面实际发生的完整回报 | 实际奖励 + 估计的后续价值 |
| 是否 bootstrap | 否 | 是 |
| 是否等到终止 | 完整 MC 通常需要 | 一步 TD 不需要 |
| 主要统计特点 | 对产生轨迹的策略,完整 return 是无偏价值样本;通常方差较高 | 近似价值会带入 bootstrap 误差;通常方差较低 |
| 主要局限 | 长任务、稀疏奖励时归因困难;历史轨迹回报不直接等于当前策略价值 | critic 错误可通过目标传播;不是“一定比 MC 更准” |
| 库中例子 | RECAP 的分布式 用 MC return 训练 | IQL、RLPD、RL Token、Q-VGM 的 critic 用 TD/多步目标 |
离线数据由多个策略产生时,直接 MC 回归通常对应数据行为混合的条件回报,不自动得到新策略的 。TD 也不会自动解决 off-policy 问题,仍要检查目标策略、数据覆盖与校正方式。
3.2 n-step return:两者之间的桥
令 为向前使用的实际奖励步数;,空乘积 。终止后按吸收状态零奖励补齐。定义:
是一步 TD;到真正终止且不再 bootstrap,就是 MC。它同时影响方差、bootstrap 误差与 off-policy 误差:若中间动作来自不同的行为策略,多步目标通常不能未经校正就当作目标策略的无偏 return。
终止不等于截断。 成功、失败等真正终止令 ;仅因采样 batch 满了而截断,应保留 bootstrap,并用截断前的最后观测。若超时本身定义为任务失败,它才是该任务的终止条件。
3.3 为什么 TD error 能估计 Advantage
如果 且后续遵循 ,那么:
因此 可作为一步优势估计。GAE(Generalized Advantage Estimation) 用多个 TD residual 平滑这个估计。令 为 GAE 混合参数, 为当前 rollout 中剩余步数;令 为本轮计算优势时冻结的价值网络, 也由它计算:
为一步 TD 优势; 为该 rollout 的多步 return 减 baseline,只有 rollout 到真正终止才化为 。GAE 原论文;VLA 应用见 VLA-RL。
小例子。 三步奖励为 ,,最后一步终止,则 。若三个状态的价值估计为 ,则 TD error 为 ;取 ,。
4. Policy Gradient 与两种 Actor–Critic
4.1 从 J 推到策略梯度
令 为完整轨迹, 为其概率;用 表示环境的状态、奖励联合转移。由环境不依赖 :
用 ,再利用“当前动作不能影响过去奖励”,得到:
任取不依赖当前动作的 baseline ,因为:
可将 换成 ;取 就得到优势形式。离散动作把积分换成求和。
若 ,定义归一化折扣状态占用分布 ,则还可写为:
实践中常用均匀采样时间步的 surrogate,省略外部 ;这不是对上述有限轨迹目标的逐项恒等改写,阅读实现时要检查采样分布。
4.2 Q Actor–Critic 与 Advantage Actor–Critic
这两个名称首先描述 critic/actor 信号的选择;“Q Actor–Critic”并不是唯一确定的一篇算法。
| 形式 | Critic 学什么 | Actor 用什么 | 特点 |
|---|---|---|---|
| Q Actor–Critic | score-function 梯度中的 ,或直接对动作求 | 能比较/优化不同动作;连续动作中常见于 DDPG、TD3、SAC 家族 | |
| Advantage Actor–Critic | 常学 ,由 TD/GAE 构造 ;也可同时学 | 减去状态 baseline 以降低方差;A2C、PPO 常用 |
取 为采样时冻结的策略。最基本的 on-policy advantage actor–critic 在当前采样参数处,最小化以下局部损失:
梯度估计在 处对应新鲜 rollout;若对同一批数据大幅更新很多次,就要考虑策略变化,PPO 用概率比值和 clipping 处理这一点。REINFORCE 用 MC return 的策略梯度;如果仅用 return 而不学价值网络,就没有 learned critic。
A2C 通常指同步采样/更新的 Advantage Actor–Critic;A3C 是其异步多 worker 版本。二者与 PPO 有共同基础,但 A2C 没有 PPO 的 clipped ratio 目标。A3C 原论文。
对确定性 actor,令 为直接输出的动作。在固定 replay 状态分布上,常最小化 ;链式法则给出:
更新 actor 时冻结 critic 参数,但保留 对输入动作的梯度。这个 replay surrogate 不应未经说明就称为原始 on-policy 的精确梯度。DDPG、TD3。
5. Offline / Online 与 On-policy / Off-policy 是两个维度
5.1 四个词分别在问什么
| 维度 | 定义 | 典型例子 |
|---|---|---|
| Offline RL | 学习阶段只访问固定数据,不能靠新交互纠正错误 | IQL、CQL;CO-RFT 的离线阶段 |
| Online RL | 学习期间继续与环境交互,采集新数据 | PPO、在线 SAC、RLPD |
| Offline-to-online RL | 先用固定数据初始化,再交互微调 | Cal-QL;BORA、Q-VGM |
| On-policy | 用当前/近期采样策略的数据,估计并改善该策略;严格性要看更新公式 | A2C、PPO;PPO 允许一批新 rollout 内多轮受限更新 |
| Off-policy | 能从行为策略 与目标策略 不同的数据中学习 | Q-learning、SAC、TD3、IQL |
Online 可以是 off-policy:SAC 一边收集新数据一边从历史 replay 学习。固定数据也可来自某个恰好等于目标策略的行为策略:此时可做 on-policy evaluation;但固定数据通常无法支持策略不断变化后的标准 on-policy control。
PPO 的 ratio 不意味着它可以直接复用任意旧数据;SAC 是 off-policy 也不意味着把它直接运行在固定数据上就一定有效。BC/SFT 使用离线数据,但没有利用奖励改善策略时,应叫模仿学习而非 offline RL。
5.2 分布不匹配与重要性采样
令 为动作重要性比值, 为前缀比值;要求目标策略会选择的动作在行为数据中有非零概率。对相同初始分布和环境,任意可积轨迹函数 满足:
精确轨迹校正的方差可能随时域剧增。只乘当前一步的比值,通常不能同时校正不同的状态分布和未来行为。很多 off-policy 算法依靠 Bellman 回归、目标网络、行为约束等机制,而非完整轨迹 importance sampling。
Offline 的核心困难:OOD 动作误差。 OOD 指数据分布外。actor 最大化估计 时可能选中数据中没见过、却被 critic 高估的动作;bootstrap 再传播该错误。IQL 限制价值学习时查询的动作来源,CQL 压低不受支持的价值,BC/KL 正则约束策略偏离。三者处理的是相关但不同的问题。
6. Q-learning、TD3 与 SAC:通过 Q 改善动作
6.1 SARSA、Q-learning、DQN
令 为 TD 目标、 为下一动作。二者共享表格更新 ,但目标不同:
SARSA 在跟随并评估实际行为策略时是 on-policy;Q-learning 的目标是 greedy 策略,即使数据来自探索策略也可更新,因而是 off-policy。深度版本 DQN 用神经网络、replay 和目标网络代替表格。Double DQN 用在线网络选动作、目标网络评价,减轻“同一噪声同时选和估”造成的高估:
原始文献:DQN、Double DQN。对灵巧手所有连续关节组合直接离散枚举通常代价很大。库中 HIL-SERL 对离散夹爪动作使用 DQN grasp critic;连续机械臂部分采用另一套 actor–critic。
6.2 DDPG → TD3
DDPG 用确定性 actor 近似连续动作优化。TD3 增加 双 Q 取较小值、延迟 actor 更新、目标动作平滑。令 标识两个 critic, 为截断的零均值高斯噪声, 为裁剪到合法动作范围:
critic 回归 ;actor 最大化通常选定的一个 critic 。与 SAC 的关键差别是:标准 TD3 没有最大熵目标,actor 是确定性映射。DDPG 原论文、TD3 原论文。RL Token 使用 TD3-style critic / Q 最大化加参考动作约束,但整体结构并非逐项照搬标准 TD3。
6.3 SAC:最大熵 Off-policy Actor–Critic
Soft Actor–Critic 在奖励之外奖励策略熵。定义熵 ,温度 控制熵权重:
用上标 明确区分普通价值与 soft 价值。SAC 的约定是 不含当前动作处的熵奖励、 含当前状态熵:
以下 均拟合 soft 。现代双 critic SAC 无需单独的 网络,三个核心步骤为:
随机 actor 常通过重参数化 、 获得梯度, 为单位协方差矩阵。若使用 tanh 限幅, 要包含变量变换的 Jacobian 修正。目标 critic 常用 Polyak 更新;令 为目标网络更新率:
可学习温度:令 、 为目标熵,一个常用的 log-temperature 损失是:
实际熵过低时,最小化该损失会提高 ,鼓励探索。SAC 适合连续控制和 replay 复用;直接用于纯离线数据仍可能遭受 OOD 高估。
原始方法: SAC、Algorithms and Applications。库中使用: DSRL 的 DSRL-SAC 在生成策略的噪声/潜变量空间运行 SAC。RLPD、HIL-SERL 属于相关 off-policy actor–critic 路线,但具体 entropy backup 有变体,不能把标准 SAC 的每一项直接套上去。
7. Offline RL:IQL、AWR / AWAC、CQL / Cal-QL
7.1 IQL:Expectile value + TD critic + 加权模仿
Implicit Q-Learning 的价值学习不需要查询 actor 生成的分布外动作。令 为 expectile 参数,通常 ;令 为 expectile 回归残差,定义不对称平方损失:
正残差 的权重为 ,负残差的权重为 ,因此 偏向数据中较好的动作价值。IQL 三步如下:
这里 可取双 Q 的较小值。定义用于策略提取的分数 ; 为优势温度, 为可选权重上限:
这是“好动作多学、差动作少学”的加权 BC。某些论文用逆温度写成 ;本笔记统一采用除以温度的写法。
注意: 是数据动作 的上 expectile,通常不是 ;因此 也不满足第 2 节关于 的所有恒等式。IQL 避开了价值目标中的 OOD 动作查询,但不保证有限数据与函数逼近下完全消除外推误差。
原始方法: IQL。库中继承: BORA 离线阶段用 IQL 式 critic,但 actor 为 masked clipping + BC;Q-VGM 离线 critic 用 IQL bootstrap,actor 为速度场更新。两者都不能简写为“完整使用 IQL 的三个 loss”。
7.2 AWR / AWAC:为什么会出现 exp(Advantage)
固定一个状态与动作打分函数 ,设 为有足够支持的参考行为分布; 为待求的新动作分布, 为约束强度。定义 。考虑单状态、固定 Q 的优化:
拉格朗日一阶条件给出:
减去任何仅依赖状态的 baseline,都会在归一化时抵消,所以也可写成与 成正比。用参数化策略拟合这个改进分布,就得到优势加权回归。严格投影包含状态相关的 ;很多实用版本省略它或归一化/裁剪样本权重。
AWR 用优势加权监督学习更新策略;AWAC 将这种 actor 更新与 off-policy Q 学习结合,面向离线数据预训练后快速在线微调;IQL 借用相近的策略提取形式,但 critic 的 expectile 构造不同。AWR、AWAC;库中 IQL 是理解这种 actor 的直接入口。
上面的闭式解是固定 的局部优化,不是“一次指数加权就精确解出了整个机器人任务的最优策略”。
7.3 CQL:压低数据外动作的 Q
Conservative Q-Learning 在 Bellman 回归上加入保守正则。令 为其强度, 为普通 critic 的平方 TD 损失;离散动作下的典型形式是:
第一项倾向压低整体动作价值,第二项保留数据动作的相对价值。连续动作要用积分及采样/重要性估计,不能枚举全部关节动作。保守性有助于离线学习,但过强的悲观估计可能阻碍在线探索。CQL 原论文。
7.4 Cal-QL:对保守价值进行标定
Calibrated Q-Learning 处理从离线到在线时过于保守、价值尺度不合适的问题。令 为参考行为价值, 为当前策略采样的动作。CO-RFT 使用的一个校准正则核心写作:
将 加到 TD 损失,其中 。当某个策略动作的 已低于参考价值时,第一项不再通过它继续向下施压。这个校准并不是对整个神经网络所有输出强制实施硬下界;完整 Cal-QL 的采样与保守项形式见 Cal-QL。
库中使用: CO-RFT 将 Cal-QL 扩展到动作块,做 offline VLA post-training。Cal-QL 原方法可用于 offline-to-online,并不意味着 CO-RFT 这篇也做了在线 RL。不要把 CO-RFT 记成 IQL。
8. PPO、RLOO、GRPO:通过采样回报改善策略
8.1 PPO:概率比值 + Clipping
用 收集一批 rollout,估计并冻结 (通常为 GAE);定义概率比 、裁剪阈值 ,以及把数值限制在下界 、上界 之间的函数 :
令 分别为价值损失与熵奖励系数,一个常用的联合最小化目标为:
若 ,继续增大“好动作”概率的收益在上侧被截平;若 ,继续减小“坏动作”概率的收益在下侧被截平。Clipping 裁剪的是 surrogate 的收益,不是把所有概率比/KL 硬性限制在区间内。 因此仍可配合 KL 监控与提前停止。
PPO 通常每轮采新数据,在该批数据上做若干次更新后刷新 rollout,属于常见 on-policy 路线。TRPO 则显式使用平均 KL 约束来构造 trust region;PPO 是更便于一阶优化的近似路线。PPO、TRPO。
库中使用: VLA-RL 明确采用 PPO + GAE + learned value critic;SENTINEL 用于 residual 策略;HumanPlus 的低层 humanoid 控制使用 PPO,高层技能学习另属模仿学习。BORA 的离线 actor 虽含 PPO-style clip,因使用固定演示数据和专门掩码,不能据此归为标准 on-policy PPO。
8.2 RLOO / GRPO:不训练价值网络也能估计优势
对相同任务/初始条件采样 条轨迹。令 为第 条轨迹的总回报,, 为组内标准差; 防止除零。
RLOO(REINFORCE Leave-One-Out) 用其他轨迹平均回报作为 baseline:
GRPO(Group Relative Policy Optimization) 常用组内归一化分数:
再把这些轨迹级分数送入 policy-gradient/PPO-style clipped objective,按论文定义分配给动作或 token;可另加参考策略 KL。它们无需 learned value critic,但需要多次 rollout,回报相同时可能没有有效区分信号。组内分数不是每个机器人状态真实 的精确估计。
库中对应: RIPT-VLA 的 LOOP 使用 RLOO + PPO clipping;SimpleVLA-RL 使用 GRPO,不要记成 learned-critic PPO;FetchMan 采用 Flow-GRPO 的扩展,动作分布/flow 的处理需看其具体构造。
动作 token 的 log-probability 与环境动作的 log-probability 要区分:自回归动作序列的联合 log-probability 是各 token 条件 log-probability 之和,但把每个 token 视作独立环境步会改变时域与归因。
9. RLPD、REDQ 与 Human-in-the-loop
RLPD(RL with Prior Data) 把演示/已有离线数据与新交互数据混合,用高样本效率的 off-policy actor–critic 学习。令 为 batch 中离线样本比例;采样分布记为:
这里是采样分布的混合,不是数值相加两个文件集合。RLPD 的典型设置等量混合 prior 与 online 数据;配合 critic ensemble、较高 update-to-data ratio 等设计。UTD 定义为每新增一个环境样本所做的梯度更新次数;高 UTD 能多用数据,也更需要控制过拟合和价值误差。REDQ 是理解 ensemble 与高 UTD 的相关基础。
HIL-SERL 使用 RLPD 路线,将 demonstrations、在线自主数据和人工接管数据接入训练,并学习任务奖励分类器。其正文的 critic backup 未写 SAC 的 entropy 项,而 actor 含熵奖励;因此准确说法是 RLPD / SAC-family 变体,不能直接声称其 critic 完全等于第 6.3 节标准 SAC。
BORA 先离线训练 VLA 与 critic,再冻结 VLA,在线训练动作块 residual,并用 RLPD 混合 replay;还利用接管与恢复信号。它体现了“offline critic 初始化 → online off-policy residual”的路线。
Human-in-the-loop 只是数据/交互机制,不限定算法。人工纠正动作可以用于 BC,也可以进入 RL replay;只有纠正数据监督训练、没有 reward/value 改善目标时,应归为交互式模仿学习。Hand-in-the-Loop 属于后者,不能因持续采数据就称为 online RL。
10. RECAP:MC 价值学习 + Advantage-conditioned Policy
RECAP = RL with Experience and Corrections via Advantage-conditioned Policies,是 π*0.6 / RECAP 的核心方法。它通过自主执行、任务结果标签和可选人工纠正反复改进 VLA。
10.1 用完整轨迹训练分布式 V
该论文取有限任务中的 ,奖励结合每步代价与失败惩罚,并按任务归一化回报。以下统一记归一化后的 MC 标签为 。令 为价值区间数、 为区间代表值, 为把数值映射到区间编号的函数;价值网络输出概率 ,:
论文使用 。这里是 对 MC return 分桶做分类回归,不是 IQL expectile,也不是 SAC 的 TD critic。 表示累计数据隐含的参考行为混合,包含演示、人类纠正与不同阶段的机器人策略;原文用其价值解释上述估计。
10.2 从价值生成“较好动作”标签
令 为优势估计使用的步数; 表示与价值标签采用相同任务尺度的奖励, 为任务相关阈值, 为二值 improvement indicator:
此式统一了终止掩码与时间编号;原论文取 。实现时必须确保 reward 与 的归一化尺度一致;若用了仿射平移,需处理相应边界项,不能直接把原始 reward 与归一化 相加。论文将人工纠正样本标为 ,相当于相信这些纠正有改进作用。
10.3 用条件建模提取策略
令 为条件项权重。理想化、可计算动作密度时的目标是:
训练同时学习无条件与 indicator 条件分布;执行时令 。Bayes 公式说明其机制:
它提高“被判为改进”的动作在条件分布中的概率。与 IQL / AWR 的区别是:优势成为输入条件/标签,而非只变成每个样本的指数 loss 权重。 与 PPO 的区别是:不依靠 old-policy probability ratio 的 clipped objective。
实际 π*0.6 同时有离散输出与连续 flow 动作,连续部分用 条件 flow matching 实现上述策略建模思想,不能把理想化 原样当成已可精确计算的 flow loss。数据增长后重训价值和条件策略,形成迭代改进。参考原文 §IV–V,而非只看算法名字。
11. 生成式 VLA 的 RL:关键是 Actor 怎样接收改进信号
11.1 BC / ACT 与 Flow Matching 的基础目标
对于可计算动作密度的策略,behavior cloning 为 。ACT / ALOHA 用条件 VAE 与动作块模仿学习;Diffusion-Policy 用去噪生成动作。它们是策略建模/模仿学习基础,本身不等于 RL。
为解释 flow,令 为动作块长度、 为单步动作维度, 为实数动作块; 为同维高斯噪声, 为生成过程时间,与环境时间 区分; 为参数为 的速度网络。以线性路径为例:
表示区间均匀采样;范数对动作块展平后计算。推理积分 ,从 到 ;记整个生成映射为 。π0 是库中基础入口。
多峰、长动作块有利于表示灵巧操作,但也使 RL 接口变复杂:最终动作的精确 往往不易得到;把 的梯度穿过整个采样器会增加成本。Flow matching 的平方损失不恒等于精确负 log-likelihood。
11.2 Q 引导、约束与蒸馏
FQL。 FQL 分开训练 BC flow 与一步 actor 。令 为蒸馏权重:
两个 actor 使用同一个 对齐生成结果。critic 用当前一步 actor 采样下一动作做 TD;RL 梯度不需要穿过整条 BC flow 的 ODE 求解。
RL Token。 RL Token 压缩冻结 VLA 的视觉语言前缀;令 为压缩 token 与本体感觉组成的输入, 为冻结 VLA 的参考动作块, 为 actor 均值, 为固定标准差:
其 critic 使用 TD3-style chunk TD;actor 既追求高 ,又被参考动作约束。参考动作是 actor 的条件输入,不能把论文粗略写成“在原 VLA 上跑标准 SAC”。
Q-VGM。 Q-VGM 离线用 IQL 式 critic,在线切换到 policy-sampled TD;actor 用 Q 改善的终点构造局部、靠近去噪末端的速度目标,以局部回归更新速度场,避免对完整生成链做 RL 反传。应分别阅读其 critic 与 actor,不能因 critic 用了 IQL 就把 actor 也写成加权 BC。
BORA。 BORA 离线 actor 是 validity-masked clipped surrogate 与 BC 的组合;在线冻结基础 VLA,用 RLPD 学习 residual。概念上,令 为学到的修正块:。实际还需遵守动作归一化、限幅和控制接口。
11.3 其他生成策略 RL 方法速查
| 方法/本地论文 | 改进信号如何进入生成策略 | 与基础算法的关系 |
|---|---|---|
| DSRL | 冻结生成式动作解码器,优化输入噪声/潜变量的策略 | DSRL-SAC 在潜变量空间用 SAC;DSRL-NA 是另一变体,不应合称一个 SAC loss |
| DPPO | 将去噪过程构造成扩展 MDP,对去噪转移执行策略优化 | PPO;使用去噪步骤的条件密度,不等于直接获得最终动作边缘密度 |
| ReinFlow | 给 flow 引入可学习随机性,形成可计算转移概率的随机过程 | 将 flow 接入 policy-gradient / PPO 路线 |
| FPO | 用 flow-matching loss 构造 PPO-inspired surrogate | on-policy;使用似然替代量,不能写成“FM loss 就是精确 log-prob” |
| RL-100 | diffusion policy 的 RL 优化与 consistency distillation 结合 | 去噪层面的 clipped PPO;离线阶段用 IQL 优势,在线阶段用 GAE;其“迭代离线”会在轮次间增添 rollout |
| EFM-QIPO | 以价值/能量对 flow matching 加权,做离线策略改进 | 更接近价值引导的生成模型拟合;看能量与权重如何由 critic 构造 |
| Learning-While-Deploying | DIVL 学分布式价值,QAM 用 adjoint matching 提取 flow 策略 | 多步、分位数 bootstrap + Q 引导;不能因“分布式 V”就归为 RECAP 的 MC 训练 |
12. 动作块、双臂与人形控制:公式如何落到机器人上
12.1 Chunk Q 与环境时钟
令 为预测长度、 为本次实际连续执行的步数。记 为预测块、 为实际执行的块;只有全部执行且没有中途改动时,二者才相同。定义折扣块奖励和块终止掩码:
将 步视为一个决策转移,价值目标为:
这里 的含义是承诺执行该块后再遵循后续策略;若机器人在块中途重规划、人工覆盖动作,训练必须记录并处理真实执行过程。不能用未执行的 步预测去配 步奖励;也不能一边用 步奖励,一边仍只乘一步折扣 ,除非已把该 重新定义为每块折扣。
Q-Chunking、Adaptive-Q-Chunking 是这一主题的入口;CO-RFT、RL Token、BORA、Q-VGM 将 chunk critic 用到 VLA 后训练。可变块长度时,还要处理不同时间尺度的价值/优势可比性。
12.2 结构设计与 RL 算法是不同层面的选择
| 研究方向 | 阅读时要明确的对象 | 与本笔记的连接 |
|---|---|---|
| 双臂 + 灵巧手 VLA | 动作是末端位姿还是所有手臂/手指关节?双臂是否联合输出?手是夹爪还是多自由度手? | 高维、多峰策略需要合理动作表示;Q/优势必须评价同一实际动作接口 |
| Offline → Online | 哪些参数在线更新:整个 VLA、action head、latent policy,还是 residual?是否继承 critic? | IQL / Cal-QL 解决离线价值学习;SAC / RLPD 等承担在线更新;actor 接口可另选 |
| Humanoid + ACT | ACT 控制上肢还是全身?是否另有 locomotion/tracking controller?任务语言是否进入最终动作策略? | ACT 是动作块模仿学习架构;低层用了 PPO 不代表高层 ACT 也用了 RL |
| 真正端到端任务执行 | 从任务、视觉、本体感觉到关节目标的完整路径;奖励归因与训练梯度到哪里为止? | “端到端推理”“联合训练”“无独立运动控制器”是不同主张,应分别核验 |
HumanPlus 等工作应按高层技能与低层控制分别记录;任务级策略输出关节目标依然通常由底层伺服执行。价值学习算法本身不决定是否端到端。
13. 方法—论文对应总表与补充方法
13.1 本地论文的实际用法
“使用”表示该文方法的一部分;“继承”表示只借用了相应组件。列入参考文献或作为 baseline,不足以支持“该论文使用此算法”的归类。
| 方法 | 数据/更新范式 | 库中实际对应与边界 |
|---|---|---|
| PPO + GAE | 通常 online on-policy | VLA-RL;SENTINEL 的 residual;HumanPlus 的低层控制 |
| PPO-style 离线目标 | offline,专门的行为约束/掩码 | BORA 离线 actor;不是标准 on-policy PPO |
| GRPO / Flow-GRPO | rollout 的组相对优化 | SimpleVLA-RL / FetchMan |
| RLOO + clipping | rollout、无 learned value critic | RIPT-VLA 的 LOOP |
| SAC | online off-policy | DSRL 中 DSRL-SAC;作用于 latent noise policy |
| TD3-style chunk critic | online off-policy | RL Token,actor 另有参考动作约束 |
| IQL | offline,可接在线微调 | IQL 原法;BORA、Q-VGM 继承 critic;RL-100 离线阶段用 IQL 优势,actor 均有不同设计 |
| CQL → Cal-QL | offline / offline-to-online | Cal-QL 原法;CO-RFT 使用 chunked Cal-QL 做离线训练 |
| RLPD | online off-policy + prior replay | RLPD;HIL-SERL;BORA 在线 residual |
| MC distributional V + 优势条件策略 | 累计数据上训练,交互后迭代 | π*0.6 / RECAP;不能强行归为标准 PPO 或 SAC |
| Q 引导 flow | 依方法而定 | FQL、Q-VGM、EFM-QIPO;actor 的 Q 梯度/加权路径不同 |
| DIVL + QAM | offline-to-online/持续部署 | Learning-While-Deploying;分布式价值与 adjoint matching |
| PPO + offline supervision | online RL 配合离线监督正则 | Offline-Supervision-VLA-RL;用了离线 BC 不代表整个方法为 offline RL |
| PPO + 探索机制 | online RL | Uncertainty-Gated-Exploration;应同时阅读其失败/局限分析 |
| BC、交互式模仿、上下文适应 | 不应自动归为 RL | ACT / ALOHA、Hand-in-the-Loop、Self-Adaptive-VLA |
13.2 常见补充方法:读到时能定位即可
| 方法 | 核心思想/最小公式 | 对当前方向的用途与来源 |
|---|---|---|
| TD3+BC | 令 ,actor 最小化 ;不同实现会归一化 Q 或调整权重 | 简单离线基线;参考动作约束与 RL Token 有直观关联,但不能因此认定 RL Token 就是 TD3+BC。原论文 |
| BCQ | 从行为生成模型候选动作中选择高 Q 动作,并限制修正幅度 | 了解“限制动作支持集”的离线 RL 路线。原论文 |
| AWR / AWAC | 优势指数加权回归;AWAC 结合 off-policy Q | 理解 IQL actor 与离线到在线行为约束。AWR、AWAC |
| TRPO | 最大化局部策略收益,约束相对旧策略的平均 KL | PPO 的理论背景;机器人连续控制常见基础。原论文 |
| REDQ | Q ensemble、随机子集目标、高 UTD | 理解 RLPD 的数据效率和 critic 稳定化背景。原论文 |
| Decision Transformer | 以目标 return-to-go、状态和动作历史为条件进行序列建模 | 理解 return-conditioned policy;RECAP 条件是优势派生 indicator,二者不等价。原论文 |
| BC / SFT、交互式模仿 | 模仿示范动作;交互收集纠正可缓解部署分布偏移 | ACT / VLA 的起点;见 ACT / ALOHA、Hand-in-the-Loop,无奖励优化时不叫 RL |
| 奖励建模 | 学一个评价状态/轨迹的 reward model,供训练或评价使用 | RoboReward;它提供学习信号,不单独规定 actor–critic 算法 |
这里优先保留与库内 manipulation / VLA 直接相连的方法;model-based planning、世界模型 RL、多智能体信用分配另成后续笔记,不在本篇展开。
14. 阅读与实验时的最小核对清单
- Reward 和 return 分开。 稀疏成功奖励、每步代价、失败罚分、折扣和归一化共同决定实际优化目标。
- 写出 critic 的完整 target。 下一项来自 、、actor 采样、数据动作、MC 还是分位数?有没有 entropy 和终止掩码?
- 再写 actor 的 loss。 PPO ratio、加权 BC、条件建模、Q 梯度、局部速度回归,是不同的改进接口。
- 注明行为策略与训练阶段。 Offline / online 描述数据能否增长;on-policy / off-policy 描述更新与采样策略的关系。
- 对齐动作与时钟。 单步、动作块、去噪步、token 步不可混用; 与真正执行长度要一致。
- 检查 partial observability 和干预。 人工接管改变行为;历史观测可能影响 Markov 性;replay 必须记录真实执行动作。
- 区分方法、变体、baseline。 引用了 SAC 或 IQL,不等于使用完整算法;用了 clip,也不自动等于 on-policy PPO。
- 只对可验证控制链说“端到端”。 高层 VLA、ACT、全身 controller、关节伺服分别是什么,先画清楚输入输出。
针对你的方向,建议首轮精读顺序: IQL → RLPD / Cal-QL → RECAP → CO-RFT / BORA → RL Token / Q-VGM;并行读 PPO + GAE → VLA-RL → RIPT-VLA / SimpleVLA-RL。Flow 线先读 FQL,再比较 DPPO、ReinFlow、FPO。ACT / Humanoid 的网络与控制栈细节适合接着单独整理。
15. 本地引用与核对版本
以下为正文实际引用的本地论文。版本对应当前整理后的 PDF;方法归类以正文方法章节为依据。外部经典算法原文已在相关小节直接链接,未假定它们全部已下载进本地库。
| 本地 PDF | 论文题目 | 核对版本/原始来源 |
|---|---|---|
| VLA-RL | VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning | 2505.18719v1 |
| HIL-SERL | Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning | 2410.21845v3 |
| RL Token | RL Token: Bootstrapping Online RL with Vision-Language-Action Models | 2604.23073v2 |
| DSRL | Steering Your Diffusion Policy with Latent Space Reinforcement Learning | 2506.15799v2 |
| RLPD | Efficient Online Reinforcement Learning with Offline Data | 2302.02948v4 |
| IQL | Offline Reinforcement Learning with Implicit Q-Learning | 2110.06169v1 |
| BORA | BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models | 2605.30226v2 |
| Q-VGM | Q-VGM: Q-Guided Value-Gradient Matching for Offline-to-Online RL of Flow-Matching VLA Policies | 2606.08015v5 |
| CO-RFT | CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning | 2508.02219v1 |
| Cal-QL | Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning | 2303.05479v4 |
| SENTINEL | SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control | 2511.19236v1 |
| HumanPlus | HumanPlus: Humanoid Shadowing and Imitation from Humans | 2406.10454v1 |
| RIPT-VLA | Interactive Post-Training for Vision-Language-Action Models | 2505.17016v1 |
| SimpleVLA-RL | SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning | 2509.09674v1 |
| FetchMan | FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences | 2608.17027v2 |
| Hand-in-the-Loop | Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention | 2605.15157v2 |
| π*0.6 / RECAP | : a VLA That Learns From Experience | 2511.14759v2 |
| ACT / ALOHA | Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware | 2304.13705v1 |
| Diffusion-Policy | Diffusion Policy: Visuomotor Policy Learning via Action Diffusion | 2303.04137v5 |
| π0 | : A Vision-Language-Action Flow Model for General Robot Control | 2410.24164v4 |
| FQL | Flow Q-Learning | 2502.02538v2 |
| DPPO | Diffusion Policy Policy Optimization | 2409.00588v3 |
| ReinFlow | ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning | 2505.22094v7 |
| FPO | Flow Matching Policy Gradients | 2507.21053v2 |
| RL-100 | RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning | 2510.14830v4 |
| EFM-QIPO | Energy-Weighted Flow Matching for Offline Reinforcement Learning | 2503.04975v1 |
| Learning-While-Deploying | Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies | 2605.00416v4 |
| Q-Chunking | Reinforcement Learning with Action Chunking | 2507.07969v4 |
| Adaptive-Q-Chunking | Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning | 2605.05544v1 |
| Offline-Supervision-VLA-RL | Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models | 2607.19399v1 |
| Uncertainty-Gated-Exploration | Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy | 2609.28838v1 |
| Self-Adaptive-VLA | Self-Adaptive VLA for Robust Robot Deployment | 2609.30092v1 |
| RoboReward | RoboReward: General-Purpose Vision-Language Reward Models for Robotics | 2601.00675v2 |