← MaRs Lab 论文库研究笔记 01 · 基础与方法 · 2026-10-02Markdown 原稿

RL 基础与 VLA 后训练:公式、方法与论文对照

研究笔记 01 · 2026-10-02
面向双臂/灵巧手 VLA、offline-to-online RL,以及 Humanoid + ACT。根据本地论文原文整理;“REACP”按 RECAP 处理。核心方法展开目标函数,其余方法用速查表压缩。文中的论文简称链接到本地 PDF;末尾列出核对版本与原始来源。

阅读顺序:先读 1–5 节基础,再读 6–11 节算法,最后读 12–14 节 VLA 对接与选型。这里统一了不同论文的符号,公式保留算法核心,工程上的 ensemble、归一化、辅助损失以原文为准。

1. 统一符号与问题设定

1.1 环境、策略与网络

符号 定义
S,A\mathcal S,\mathcal A;st,ats_t,a_t 状态空间、动作空间;时刻 tt 的状态与动作。动作可以是关节目标、末端位姿增量,也可以是后文定义的动作块。
t=0,…,T−1t=0,\ldots,T-1 环境交互步;一条有限轨迹共有 TT 次动作,sTs_T 为终止状态。
P(s′∣s,a),ρ0(s)P(s'\mid s,a),\rho_0(s) 状态转移分布与初始状态分布;撇号表示下一状态。
rt,rˉ(s,a)r_t,\bar r(s,a) 执行 ata_t、转移到 st+1s_{t+1} 后获得的标量奖励;rˉ(s,a)=E[rt∣st=s,at=a]\bar r(s,a)=\mathbb E[r_t\mid s_t=s,a_t=a] 是其条件均值。
γ∈[0,1]\gamma\in[0,1] 每个环境步的折扣因子。持续任务通常取 γ<1\gamma<1;有限任务可取 γ=1\gamma=1。
et,mte_t,m_t et=1e_t=1 表示这次转移使任务真正终止,否则为 00;mt=1−etm_t=1-e_t 是继续 bootstrap 的掩码。
πθ(a∣s),μ(a∣s)\pi_\theta(a\mid s),\mu(a\mid s) 待优化策略与采集数据的行为策略;θ\theta 为 actor 参数。连续动作下是概率密度。
D,Doff,Don\mathcal D,\mathcal D_{\rm off},\mathcal D_{\rm on} 通用数据集/replay buffer、固定离线数据、在线新收集的数据;基础记录为 (s,a,r,s′,e)(s,a,r,s',e)。
Qϕ,VψQ_\phi,V_\psi 分别由参数 ϕ,ψ\phi,\psi 表示的动作价值、状态价值网络;critic 是估计器,不等于真实价值函数。
上横线、上帽子 ϕˉ\bar\phi 为慢更新/冻结的目标网络参数;A^,G^\widehat A,\widehat G 等为估计量。
sg⁡(x)\operatorname{sg}(x) stop-gradient:前向取 xx,反向不通过 xx 求导。
E,∇,1[⋅],∥⋅∥2\mathbb E,\nabla,\mathbf1[\cdot],\|\cdot\|_2 期望、梯度、条件成立取 11 的指示函数、欧氏范数。log⁡\log 为自然对数。
L,η\mathcal L,\eta 待最小化的损失、正的学习率;目标 JJ 通常待最大化。

默认转移与奖励机制不直接依赖 θ\theta。有限时域问题若奖励/最优策略依赖剩余时间,应把时间并入状态,或给 Q,V,πQ,V,\pi 加时间下标;下文采用前者,避免省略时间造成 Bellman 方程歧义。

1.2 VLA 中什么才是状态

令 ℓ\ell 为任务语言,oto_t 为相机、关节等观测,ct=(ℓ,o0:t,a0:t−1)c_t=(\ell,o_{0:t},a_{0:t-1}) 为历史上下文。机器人通常是部分可观测问题:理论中的 sts_t 可理解为满足 Markov 性的完整状态或 belief state,实际模型则计算 πθ(at∣ct)\pi_\theta(a_t\mid c_t)。仅用当前图像代替完整状态是建模近似。

语言可作为状态的一部分。动作若是电机关节目标,动力学 PP 仍包含伺服器、接触和机体动力学;“直接输出关节目标”不等于网络输出电机电流,也不自动等于全身控制已端到端训练。

2. Reward → Return → Q / V / A → J

2.1 即时奖励、累计回报、优化目标

Reward rtr_t 只评价当前一次转移;return GtG_t 是从当前开始的折扣累计奖励;J(θ)J(\theta) 是策略在初始任务分布上的期望回报:

Gt=∑j=0T−t−1γjrt+j,GT=0,Gt=rt+γmtGt+1.G_t=\sum_{j=0}^{T-t-1}\gamma^j r_{t+j},\qquad G_T=0,\qquad G_t=r_t+\gamma m_tG_{t+1}.
J(θ)=Es0∼ρ0, πθ,P[G0],θ∗∈arg⁡max⁡θJ(θ).J(\theta)=\mathbb E_{s_0\sim\rho_0,\,\pi_\theta,P}[G_0], \qquad \theta^*\in\arg\max_\theta J(\theta).

期望覆盖初始状态、策略采样和环境随机性。单条轨迹的 G0G_0 只是一次样本,不是 JJ。若只在最后成功时给 11,γ=1\gamma=1 时 JJ 等于成功概率;若 γ<1\gamma<1,它还偏好更早成功。若每步给 −1-1,则偏好少用步数;如果失败也会提前结束,必须设计失败代价,避免“尽早失败”反而得分更高。

2.2 三种价值量

先固定策略 π\pi。定义状态价值 VπV^\pi、动作价值 QπQ^\pi 和优势 AπA^\pi:

Vπ(s)=Eπ[Gt∣st=s],Qπ(s,a)=Eπ[Gt∣st=s,at=a].V^\pi(s)=\mathbb E_\pi[G_t\mid s_t=s],\qquad Q^\pi(s,a)=\mathbb E_\pi[G_t\mid s_t=s,a_t=a].
Vπ(s)=Ea∼π(⋅∣s)Qπ(s,a),Aπ(s,a)=Qπ(s,a)−Vπ(s).V^\pi(s)=\mathbb E_{a\sim\pi(\cdot\mid s)}Q^\pi(s,a),\qquad A^\pi(s,a)=Q^\pi(s,a)-V^\pi(s).

VV 问“到这里之后,按这个策略做能得多少分”;QQ 问“这里先做这个动作,再按策略做能得多少分”;AA 问“这个动作比该策略在此处的平均动作好多少”。因此:

Ea∼π(⋅∣s)Aπ(s,a)=0,J(θ)=Es0∼ρ0Vπθ(s0).\mathbb E_{a\sim\pi(\cdot\mid s)}A^\pi(s,a)=0, \qquad J(\theta)=\mathbb E_{s_0\sim\rho_0}V^{\pi_\theta}(s_0).

优势为正不代表一定成功,只代表比当前基准更好。论文中 IQL 的 expectile VV、SAC 的 soft VV 有不同定义,不能直接套用上面的“普通策略平均价值”。

2.3 Bellman 方程从哪里来

把 Gt=rt+γmtGt+1G_t=r_t+\gamma m_tG_{t+1} 放进条件期望,用全期望公式即可得到 Bellman expectation equation:

Qπ(s,a)=Er,s′,e∣s,a[r+γ(1−e)Vπ(s′)],Vπ(s)=Ea∼π, r,s′,e∣s,a[r+γ(1−e)Vπ(s′)].\begin{aligned} Q^\pi(s,a) &=\mathbb E_{r,s',e\mid s,a}\left[r+\gamma(1-e)V^\pi(s')\right],\\ V^\pi(s) &=\mathbb E_{a\sim\pi,\,r,s',e\mid s,a} \left[r+\gamma(1-e)V^\pi(s')\right]. \end{aligned}

令 V∗(s)=sup⁡πVπ(s)V^*(s)=\sup_\pi V^\pi(s)、Q∗(s,a)=sup⁡πQπ(s,a)Q^*(s,a)=\sup_\pi Q^\pi(s,a)。当最大值可达时,Bellman optimality equation 为:

V∗(s)=max⁡aQ∗(s,a),Q∗(s,a)=E[r+γ(1−e)max⁡a′Q∗(s′,a′)∣s,a].V^*(s)=\max_aQ^*(s,a),\qquad Q^*(s,a)=\mathbb E\left[r+\gamma(1-e)\max_{a'}Q^*(s',a')\mid s,a\right].

这形成两种基本操作:policy evaluation 固定策略估计价值;policy improvement 根据价值改善策略。Actor–Critic 将二者交替进行。连续高维动作下,直接求 max⁡aQ(s,a)\max_aQ(s,a) 很难,actor 的一个作用就是近似这个优化步骤。

3. MC、TD、n-step 与 GAE

3.1 MC return 与 TD target

Monte Carlo(MC) 等到完整轨迹结束,用观测到的 GtG_t 监督价值:

LVMC(ψ)=E(st,Gt)∼D[(Vψ(st)−Gt)2].\mathcal L_V^{\rm MC}(\psi) =\mathbb E_{(s_t,G_t)\sim\mathcal D} \left[(V_\psi(s_t)-G_t)^2\right].

Temporal Difference(TD) 用“真实一步奖励 + 下一状态价值估计”作目标。令 ytTDy_t^{\rm TD} 为一步目标、δt\delta_t 为 TD error:

ytTD=rt+γmtVψˉ(st+1),δt=rt+γmtVψ(st+1)−Vψ(st).y_t^{\rm TD}=r_t+\gamma m_t V_{\bar\psi}(s_{t+1}),\qquad \delta_t=r_t+\gamma m_tV_\psi(s_{t+1})-V_\psi(s_t).
LVTD(ψ)=ED[(Vψ(st)−sg⁡(ytTD))2].\mathcal L_V^{\rm TD}(\psi) =\mathbb E_{\mathcal D} \left[(V_\psi(s_t)-\operatorname{sg}(y_t^{\rm TD}))^2\right].

表格型 TD(0) 的更新是 V(st)←V(st)+ηδtV(s_t)\leftarrow V(s_t)+\eta\delta_t。目标网络不是 TD 定义的一部分,而是深度 RL 常用的稳定化手段。Q 网络也可用 TD;区别只是目标中的后续价值从哪里来。

比较项 MC TD
监督信号 后面实际发生的完整回报 实际奖励 + 估计的后续价值
是否 bootstrap 否 是
是否等到终止 完整 MC 通常需要 一步 TD 不需要
主要统计特点 对产生轨迹的策略,完整 return 是无偏价值样本;通常方差较高 近似价值会带入 bootstrap 误差;通常方差较低
主要局限 长任务、稀疏奖励时归因困难;历史轨迹回报不直接等于当前策略价值 critic 错误可通过目标传播;不是“一定比 MC 更准”
库中例子 RECAP 的分布式 VV 用 MC return 训练 IQL、RLPD、RL Token、Q-VGM 的 critic 用 TD/多步目标

离线数据由多个策略产生时,直接 MC 回归通常对应数据行为混合的条件回报,不自动得到新策略的 VπθV^{\pi_\theta}。TD 也不会自动解决 off-policy 问题,仍要检查目标策略、数据覆盖与校正方式。

3.2 n-step return:两者之间的桥

令 nn 为向前使用的实际奖励步数;Mt,j=∏i=0j−1mt+iM_{t,j}=\prod_{i=0}^{j-1}m_{t+i},空乘积 Mt,0=1M_{t,0}=1。终止后按吸收状态零奖励补齐。定义:

Yt(n)=∑j=0n−1γjMt,jrt+j+γnMt,nVψˉ(st+n).Y_t^{(n)}= \sum_{j=0}^{n-1}\gamma^jM_{t,j}r_{t+j} +\gamma^nM_{t,n}V_{\bar\psi}(s_{t+n}).

n=1n=1 是一步 TD;到真正终止且不再 bootstrap,就是 MC。它同时影响方差、bootstrap 误差与 off-policy 误差:若中间动作来自不同的行为策略,多步目标通常不能未经校正就当作目标策略的无偏 return。

终止不等于截断。 成功、失败等真正终止令 mt=0m_t=0;仅因采样 batch 满了而截断,应保留 bootstrap,并用截断前的最后观测。若超时本身定义为任务失败,它才是该任务的终止条件。

3.3 为什么 TD error 能估计 Advantage

如果 Vψ=VπV_\psi=V^\pi 且后续遵循 π\pi,那么:

E[rt+γmtVπ(st+1)−Vπ(st)∣st=s,at=a]=Qπ(s,a)−Vπ(s)=Aπ(s,a).\mathbb E\left[r_t+\gamma m_tV^\pi(s_{t+1})-V^\pi(s_t) \mid s_t=s,a_t=a\right] =Q^\pi(s,a)-V^\pi(s)=A^\pi(s,a).

因此 δt\delta_t 可作为一步优势估计。GAE(Generalized Advantage Estimation) 用多个 TD residual 平滑这个估计。令 λ∈[0,1]\lambda\in[0,1] 为 GAE 混合参数,LL 为当前 rollout 中剩余步数;令 VoldV_{\rm old} 为本轮计算优势时冻结的价值网络,δ\delta 也由它计算:

A^tGAE=∑j=0L−1(γλ)jMt,jδt+j,V^ttarget=sg⁡(A^tGAE+Vold(st)).\widehat A_t^{\rm GAE} =\sum_{j=0}^{L-1}(\gamma\lambda)^jM_{t,j}\delta_{t+j}, \qquad \widehat V_t^{\rm target} =\operatorname{sg}\left(\widehat A_t^{\rm GAE}+V_{\rm old}(s_t)\right).

λ=0\lambda=0 为一步 TD 优势;λ=1\lambda=1 为该 rollout 的多步 return 减 baseline,只有 rollout 到真正终止才化为 Gt−Vold(st)G_t-V_{\rm old}(s_t)。GAE 原论文;VLA 应用见 VLA-RL。

小例子。 三步奖励为 (0,0,1)(0,0,1),γ=0.9\gamma=0.9,最后一步终止,则 (G0,G1,G2)=(0.81,0.9,1)(G_0,G_1,G_2)=(0.81,0.9,1)。若三个状态的价值估计为 (0.2,0.3,0.6)(0.2,0.3,0.6),则 TD error 为 (0.07,0.24,0.4)(0.07,0.24,0.4);取 λ=1\lambda=1,A^0=0.07+0.9×0.24+0.92×0.4=0.61=G0−0.2\widehat A_0=0.07+0.9\times0.24+0.9^2\times0.4=0.61=G_0-0.2。

4. Policy Gradient 与两种 Actor–Critic

4.1 从 J 推到策略梯度

令 ξ=(s0,a0,r0,…,sT)\xi=(s_0,a_0,r_0,\ldots,s_T) 为完整轨迹,pθ(ξ)p_\theta(\xi) 为其概率;用 P(s′,r∣s,a)P(s',r\mid s,a) 表示环境的状态、奖励联合转移。由环境不依赖 θ\theta:

pθ(ξ)=ρ0(s0)∏t=0T−1πθ(at∣st)P(st+1,rt∣st,at),∇θlog⁡pθ(ξ)=∑t=0T−1∇θlog⁡πθ(at∣st).p_\theta(\xi)=\rho_0(s_0)\prod_{t=0}^{T-1} \pi_\theta(a_t\mid s_t)P(s_{t+1},r_t\mid s_t,a_t), \qquad \nabla_\theta\log p_\theta(\xi) =\sum_{t=0}^{T-1}\nabla_\theta\log\pi_\theta(a_t\mid s_t).

用 ∇p=p∇log⁡p\nabla p=p\nabla\log p,再利用“当前动作不能影响过去奖励”,得到:

∇θJ(θ)=Eξ∼pθ[G0∑t∇θlog⁡πθ(at∣st)]=Eξ∼pθ[∑tγt∇θlog⁡πθ(at∣st)Gt]=Eξ∼pθ[∑tγt∇θlog⁡πθ(at∣st)Qπθ(st,at)].\begin{aligned} \nabla_\theta J(\theta) &=\mathbb E_{\xi\sim p_\theta} \left[G_0\sum_t\nabla_\theta\log\pi_\theta(a_t\mid s_t)\right]\\ &=\mathbb E_{\xi\sim p_\theta} \left[\sum_t\gamma^t\nabla_\theta\log\pi_\theta(a_t\mid s_t)G_t\right]\\ &=\mathbb E_{\xi\sim p_\theta} \left[\sum_t\gamma^t\nabla_\theta\log\pi_\theta(a_t\mid s_t) Q^{\pi_\theta}(s_t,a_t)\right]. \end{aligned}

任取不依赖当前动作的 baseline b(s)b(s),因为:

Ea∼πθ[∇θlog⁡πθ(a∣s)b(s)]=b(s)∇θ∫πθ(a∣s) da=0,\mathbb E_{a\sim\pi_\theta} \left[\nabla_\theta\log\pi_\theta(a\mid s)b(s)\right] =b(s)\nabla_\theta\int\pi_\theta(a\mid s)\,da=0,

可将 QQ 换成 Q−bQ-b;取 b=Vπb=V^\pi 就得到优势形式。离散动作把积分换成求和。

若 γ<1\gamma<1,定义归一化折扣状态占用分布 dγπ(s)=(1−γ)∑t≥0γtPr⁡π(st=s)d_\gamma^\pi(s)=(1-\gamma)\sum_{t\ge0}\gamma^t\Pr_\pi(s_t=s),则还可写为:

∇θJ=11−γEs∼dγπ, a∼πθ[∇θlog⁡πθ(a∣s)Aπ(s,a)].\nabla_\theta J =\frac{1}{1-\gamma} \mathbb E_{s\sim d_\gamma^\pi,\,a\sim\pi_\theta} \left[\nabla_\theta\log\pi_\theta(a\mid s)A^\pi(s,a)\right].

实践中常用均匀采样时间步的 surrogate,省略外部 γt\gamma^t;这不是对上述有限轨迹目标的逐项恒等改写,阅读实现时要检查采样分布。

4.2 Q Actor–Critic 与 Advantage Actor–Critic

这两个名称首先描述 critic/actor 信号的选择;“Q Actor–Critic”并不是唯一确定的一篇算法。

形式 Critic 学什么 Actor 用什么 特点
Q Actor–Critic Qϕ(s,a)Q_\phi(s,a) score-function 梯度中的 QQ,或直接对动作求 ∇aQ\nabla_aQ 能比较/优化不同动作;连续动作中常见于 DDPG、TD3、SAC 家族
Advantage Actor–Critic 常学 Vψ(s)V_\psi(s),由 TD/GAE 构造 A^\widehat A;也可同时学 Q,VQ,V ∇log⁡π A^\nabla\log\pi\,\widehat A 减去状态 baseline 以降低方差;A2C、PPO 常用

取 πold\pi_{\rm old} 为采样时冻结的策略。最基本的 on-policy advantage actor–critic 在当前采样参数处,最小化以下局部损失:

Lactor(θ)=−Eξ∼πold[∑tγtsg⁡(A^t)log⁡πθ(at∣st)],Lcritic(ψ)=E[(Vψ(st)−V^ttarget)2].\mathcal L_{\rm actor}(\theta) =-\mathbb E_{\xi\sim\pi_{\rm old}} \left[\sum_t\gamma^t\operatorname{sg}(\widehat A_t) \log\pi_\theta(a_t\mid s_t)\right], \qquad \mathcal L_{\rm critic}(\psi) =\mathbb E\left[(V_\psi(s_t)-\widehat V_t^{\rm target})^2\right].

梯度估计在 θ=θold\theta=\theta_{\rm old} 处对应新鲜 rollout;若对同一批数据大幅更新很多次,就要考虑策略变化,PPO 用概率比值和 clipping 处理这一点。REINFORCE 用 MC return 的策略梯度;如果仅用 return 而不学价值网络,就没有 learned critic。

A2C 通常指同步采样/更新的 Advantage Actor–Critic;A3C 是其异步多 worker 版本。二者与 PPO 有共同基础,但 A2C 没有 PPO 的 clipped ratio 目标。A3C 原论文。

对确定性 actor,令 fθ(s)f_\theta(s) 为直接输出的动作。在固定 replay 状态分布上,常最小化 Lactor=−Es∼DQϕ(s,fθ(s))\mathcal L_{\rm actor}=-\mathbb E_{s\sim\mathcal D}Q_\phi(s,f_\theta(s));链式法则给出:

−∇θLactor=Es∼D[∇θfθ(s) ∇aQϕ(s,a)∣a=fθ(s)].-\nabla_\theta\mathcal L_{\rm actor} =\mathbb E_{s\sim\mathcal D} \left[\nabla_\theta f_\theta(s)\, \nabla_aQ_\phi(s,a)\big|_{a=f_\theta(s)}\right].

更新 actor 时冻结 critic 参数,但保留 QQ 对输入动作的梯度。这个 replay surrogate 不应未经说明就称为原始 on-policy JJ 的精确梯度。DDPG、TD3。

5. Offline / Online 与 On-policy / Off-policy 是两个维度

5.1 四个词分别在问什么

维度 定义 典型例子
Offline RL 学习阶段只访问固定数据,不能靠新交互纠正错误 IQL、CQL;CO-RFT 的离线阶段
Online RL 学习期间继续与环境交互,采集新数据 PPO、在线 SAC、RLPD
Offline-to-online RL 先用固定数据初始化,再交互微调 Cal-QL;BORA、Q-VGM
On-policy 用当前/近期采样策略的数据,估计并改善该策略;严格性要看更新公式 A2C、PPO;PPO 允许一批新 rollout 内多轮受限更新
Off-policy 能从行为策略 μ\mu 与目标策略 π\pi 不同的数据中学习 Q-learning、SAC、TD3、IQL

Online 可以是 off-policy:SAC 一边收集新数据一边从历史 replay 学习。固定数据也可来自某个恰好等于目标策略的行为策略:此时可做 on-policy evaluation;但固定数据通常无法支持策略不断变化后的标准 on-policy control。

PPO 的 ratio 不意味着它可以直接复用任意旧数据;SAC 是 off-policy 也不意味着把它直接运行在固定数据上就一定有效。BC/SFT 使用离线数据,但没有利用奖励改善策略时,应叫模仿学习而非 offline RL。

5.2 分布不匹配与重要性采样

令 wt=π(at∣st)/μ(at∣st)w_t=\pi(a_t\mid s_t)/\mu(a_t\mid s_t) 为动作重要性比值,W0:t=∏i=0twiW_{0:t}=\prod_{i=0}^{t}w_i 为前缀比值;要求目标策略会选择的动作在行为数据中有非零概率。对相同初始分布和环境,任意可积轨迹函数 f(ξ)f(\xi) 满足:

Eξ∼π[f(ξ)]=Eξ∼μ[W0:T−1f(ξ)].\mathbb E_{\xi\sim\pi}[f(\xi)] =\mathbb E_{\xi\sim\mu}[W_{0:T-1}f(\xi)].

精确轨迹校正的方差可能随时域剧增。只乘当前一步的比值,通常不能同时校正不同的状态分布和未来行为。很多 off-policy 算法依靠 Bellman 回归、目标网络、行为约束等机制,而非完整轨迹 importance sampling。

Offline 的核心困难:OOD 动作误差。 OOD 指数据分布外。actor 最大化估计 QQ 时可能选中数据中没见过、却被 critic 高估的动作;bootstrap 再传播该错误。IQL 限制价值学习时查询的动作来源,CQL 压低不受支持的价值,BC/KL 正则约束策略偏离。三者处理的是相关但不同的问题。

6. Q-learning、TD3 与 SAC:通过 Q 改善动作

6.1 SARSA、Q-learning、DQN

令 yy 为 TD 目标、a′a' 为下一动作。二者共享表格更新 Q(s,a)←Q(s,a)+η[y−Q(s,a)]Q(s,a)\leftarrow Q(s,a)+\eta[y-Q(s,a)],但目标不同:

ySARSA=r+γ(1−e)Q(s′,a′),a′∼π(⋅∣s′),yQL=r+γ(1−e)max⁡a′Q(s′,a′).\begin{aligned} y_{\rm SARSA}&=r+\gamma(1-e)Q(s',a'),\quad a'\sim\pi(\cdot\mid s'),\\ y_{\rm QL}&=r+\gamma(1-e)\max_{a'}Q(s',a'). \end{aligned}

SARSA 在跟随并评估实际行为策略时是 on-policy;Q-learning 的目标是 greedy 策略,即使数据来自探索策略也可更新,因而是 off-policy。深度版本 DQN 用神经网络、replay 和目标网络代替表格。Double DQN 用在线网络选动作、目标网络评价,减轻“同一噪声同时选和估”造成的高估:

yDoubleDQN=r+γ(1−e)Qϕˉ(s′,arg⁡max⁡a′Qϕ(s′,a′)).y_{\rm DoubleDQN} =r+\gamma(1-e) Q_{\bar\phi}\left(s',\arg\max_{a'}Q_\phi(s',a')\right).

原始文献:DQN、Double DQN。对灵巧手所有连续关节组合直接离散枚举通常代价很大。库中 HIL-SERL 对离散夹爪动作使用 DQN grasp critic;连续机械臂部分采用另一套 actor–critic。

6.2 DDPG → TD3

DDPG 用确定性 actor fθf_\theta 近似连续动作优化。TD3 增加 双 Q 取较小值、延迟 actor 更新、目标动作平滑。令 i∈{1,2}i\in\{1,2\} 标识两个 critic,ϵsmooth\epsilon_{\rm smooth} 为截断的零均值高斯噪声,clip⁡A\operatorname{clip}_{\mathcal A} 为裁剪到合法动作范围:

a′=clip⁡A(fθˉ(s′)+ϵsmooth),y=r+γ(1−e)min⁡i=1,2Qϕˉi(s′,a′).a'=\operatorname{clip}_{\mathcal A} \left(f_{\bar\theta}(s')+\epsilon_{\rm smooth}\right),\qquad y=r+\gamma(1-e)\min_{i=1,2}Q_{\bar\phi_i}(s',a').

critic 回归 yy;actor 最大化通常选定的一个 critic Qϕ1(s,fθ(s))Q_{\phi_1}(s,f_\theta(s))。与 SAC 的关键差别是:标准 TD3 没有最大熵目标,actor 是确定性映射。DDPG 原论文、TD3 原论文。RL Token 使用 TD3-style critic / Q 最大化加参考动作约束,但整体结构并非逐项照搬标准 TD3。

6.3 SAC:最大熵 Off-policy Actor–Critic

Soft Actor–Critic 在奖励之外奖励策略熵。定义熵 H(π(⋅∣s))=−Ea∼πlog⁡π(a∣s)\mathcal H(\pi(\cdot\mid s))=-\mathbb E_{a\sim\pi}\log\pi(a\mid s),温度 α>0\alpha>0 控制熵权重:

Jα(θ)=Eπθ[∑tγt(rt+αH(πθ(⋅∣st)))].J_\alpha(\theta)=\mathbb E_{\pi_\theta} \left[\sum_t\gamma^t\left(r_t+\alpha\mathcal H(\pi_\theta(\cdot\mid s_t))\right)\right].

用上标 soft\mathrm{soft} 明确区分普通价值与 soft 价值。SAC 的约定是 Qπ,softQ^{\pi,\mathrm{soft}} 不含当前动作处的熵奖励、Vπ,softV^{\pi,\mathrm{soft}} 含当前状态熵:

Vπ,soft(s)=Ea∼π[Qπ,soft(s,a)−αlog⁡π(a∣s)],Qπ,soft(s,a)=E[r+γ(1−e)Vπ,soft(s′)∣s,a].\begin{aligned} V^{\pi,\mathrm{soft}}(s) &=\mathbb E_{a\sim\pi}\left[Q^{\pi,\mathrm{soft}}(s,a)-\alpha\log\pi(a\mid s)\right],\\ Q^{\pi,\mathrm{soft}}(s,a) &=\mathbb E\left[r+\gamma(1-e)V^{\pi,\mathrm{soft}}(s')\mid s,a\right]. \end{aligned}

以下 QϕiQ_{\phi_i} 均拟合 soft QQ。现代双 critic SAC 无需单独的 VV 网络,三个核心步骤为:

a′∼πθ(⋅∣s′),ySAC=r+γ(1−e)[min⁡i=1,2Qϕˉi(s′,a′)−αlog⁡πθ(a′∣s′)],LQi(ϕi)=ED[(Qϕi(s,a)−sg⁡(ySAC))2],Lπ(θ)=Es∼D, a∼πθ[αlog⁡πθ(a∣s)−min⁡i=1,2Qϕi(s,a)].\begin{aligned} a'&\sim\pi_\theta(\cdot\mid s'),\\ y^{\rm SAC} &=r+\gamma(1-e)\left[\min_{i=1,2}Q_{\bar\phi_i}(s',a') -\alpha\log\pi_\theta(a'\mid s')\right],\\ \mathcal L_{Q_i}(\phi_i) &=\mathbb E_{\mathcal D}\left[ \left(Q_{\phi_i}(s,a)-\operatorname{sg}(y^{\rm SAC})\right)^2\right],\\ \mathcal L_\pi(\theta) &=\mathbb E_{s\sim\mathcal D,\,a\sim\pi_\theta} \left[\alpha\log\pi_\theta(a\mid s)-\min_{i=1,2}Q_{\phi_i}(s,a)\right]. \end{aligned}

随机 actor 常通过重参数化 a=fθ(s,z)a=f_\theta(s,z)、z∼N(0,I)z\sim\mathcal N(0,I) 获得梯度,II 为单位协方差矩阵。若使用 tanh 限幅,log⁡π\log\pi 要包含变量变换的 Jacobian 修正。目标 critic 常用 Polyak 更新;令 ηtar∈(0,1]\eta_{\rm tar}\in(0,1] 为目标网络更新率:

ϕˉi←(1−ηtar)ϕˉi+ηtarϕi.\bar\phi_i\leftarrow(1-\eta_{\rm tar})\bar\phi_i+\eta_{\rm tar}\phi_i.

可学习温度:令 uα=log⁡αu_\alpha=\log\alpha、Htarget\mathcal H_{\rm target} 为目标熵,一个常用的 log-temperature 损失是:

Lα(uα)=−E[uαsg⁡(log⁡πθ(a∣s)+Htarget)].\mathcal L_\alpha(u_\alpha) =-\mathbb E\left[u_\alpha\operatorname{sg} \left(\log\pi_\theta(a\mid s)+\mathcal H_{\rm target}\right)\right].

实际熵过低时,最小化该损失会提高 α\alpha,鼓励探索。SAC 适合连续控制和 replay 复用;直接用于纯离线数据仍可能遭受 OOD 高估。

原始方法: SAC、Algorithms and Applications。库中使用: DSRL 的 DSRL-SAC 在生成策略的噪声/潜变量空间运行 SAC。RLPD、HIL-SERL 属于相关 off-policy actor–critic 路线,但具体 entropy backup 有变体,不能把标准 SAC 的每一项直接套上去。

7. Offline RL:IQL、AWR / AWAC、CQL / Cal-QL

7.1 IQL:Expectile value + TD critic + 加权模仿

Implicit Q-Learning 的价值学习不需要查询 actor 生成的分布外动作。令 κ∈(0,1)\kappa\in(0,1) 为 expectile 参数,通常 κ>0.5\kappa>0.5;令 δexp\delta_{\rm exp} 为 expectile 回归残差,定义不对称平方损失:

ρκ(δexp)=∣κ−1[δexp<0]∣δexp2.\rho_\kappa(\delta_{\rm exp})=|\kappa-\mathbf1[\delta_{\rm exp}<0]|\delta_{\rm exp}^2.

正残差 Q−V>0Q-V>0 的权重为 κ\kappa,负残差的权重为 1−κ1-\kappa,因此 VV 偏向数据中较好的动作价值。IQL 三步如下:

LV(ψ)=E(s,a)∼D[ρκ(sg⁡(Qϕˉ(s,a))−Vψ(s))],yIQL=r+γ(1−e)Vψ(s′),LQ(ϕ)=ED[(Qϕ(s,a)−sg⁡(yIQL))2].\begin{aligned} \mathcal L_V(\psi) &=\mathbb E_{(s,a)\sim\mathcal D} \left[\rho_\kappa\left(\operatorname{sg}(Q_{\bar\phi}(s,a))-V_\psi(s)\right)\right],\\ y^{\rm IQL}&=r+\gamma(1-e)V_\psi(s'),\\ \mathcal L_Q(\phi) &=\mathbb E_{\mathcal D} \left[\left(Q_\phi(s,a)-\operatorname{sg}(y^{\rm IQL})\right)^2\right]. \end{aligned}

这里 QϕˉQ_{\bar\phi} 可取双 Q 的较小值。定义用于策略提取的分数 A^IQL=Qϕˉ(s,a)−Vψ(s)\widehat A^{\rm IQL}=Q_{\bar\phi}(s,a)-V_\psi(s);βAWR>0\beta_{\rm AWR}>0 为优势温度,wmax⁡>0w_{\max}>0 为可选权重上限:

w(s,a)=min⁡(wmax⁡,exp⁡(A^IQL(s,a)/βAWR)),Lπ(θ)=−E(s,a)∼D[sg⁡(w(s,a))log⁡πθ(a∣s)].\begin{aligned} w(s,a)&=\min\left(w_{\max},\exp\left(\widehat A^{\rm IQL}(s,a)/\beta_{\rm AWR}\right)\right),\\ \mathcal L_\pi(\theta) &=-\mathbb E_{(s,a)\sim\mathcal D} \left[\operatorname{sg}(w(s,a))\log\pi_\theta(a\mid s)\right]. \end{aligned}

这是“好动作多学、差动作少学”的加权 BC。某些论文用逆温度写成 exp⁡(βA^)\exp(\beta\widehat A);本笔记统一采用除以温度的写法。

注意: VψV_\psi 是数据动作 QQ 的上 expectile,通常不是 Ea∼μQ(s,a)\mathbb E_{a\sim\mu}Q(s,a);因此 A^IQL\widehat A^{\rm IQL} 也不满足第 2 节关于 AπA^\pi 的所有恒等式。IQL 避开了价值目标中的 OOD 动作查询,但不保证有限数据与函数逼近下完全消除外推误差。

原始方法: IQL。库中继承: BORA 离线阶段用 IQL 式 critic,但 actor 为 masked clipping + BC;Q-VGM 离线 critic 用 IQL bootstrap,actor 为速度场更新。两者都不能简写为“完整使用 IQL 的三个 loss”。

7.2 AWR / AWAC:为什么会出现 exp(Advantage)

固定一个状态与动作打分函数 Q(s,a)Q(s,a),设 μ(a∣s)\mu(a\mid s) 为有足够支持的参考行为分布;q(a∣s)q(a\mid s) 为待求的新动作分布,βKL>0\beta_{\rm KL}>0 为约束强度。定义 DKL(q∥μ)=Ea∼qlog⁡[q(a∣s)/μ(a∣s)]D_{\rm KL}(q\|\mu)=\mathbb E_{a\sim q}\log[q(a\mid s)/\mu(a\mid s)]。考虑单状态、固定 Q 的优化:

max⁡q{Ea∼qQ(s,a)−βKLDKL(q∥μ)},∫q(a∣s) da=1.\max_q\left\{ \mathbb E_{a\sim q}Q(s,a)-\beta_{\rm KL}D_{\rm KL}(q\|\mu) \right\},\qquad \int q(a\mid s)\,da=1.

拉格朗日一阶条件给出:

q∗(a∣s)=μ(a∣s)exp⁡(Q(s,a)/βKL)Z(s),Z(s)=∫μ(a∣s)exp⁡(Q(s,a)/βKL) da.q^*(a\mid s)=\frac{\mu(a\mid s)\exp(Q(s,a)/\beta_{\rm KL})}{Z(s)}, \qquad Z(s)=\int\mu(a\mid s)\exp(Q(s,a)/\beta_{\rm KL})\,da.

减去任何仅依赖状态的 baseline,都会在归一化时抵消,所以也可写成与 μexp⁡(A/βKL)\mu\exp(A/\beta_{\rm KL}) 成正比。用参数化策略拟合这个改进分布,就得到优势加权回归。严格投影包含状态相关的 Z(s)Z(s);很多实用版本省略它或归一化/裁剪样本权重。

AWR 用优势加权监督学习更新策略;AWAC 将这种 actor 更新与 off-policy Q 学习结合,面向离线数据预训练后快速在线微调;IQL 借用相近的策略提取形式,但 critic 的 expectile 构造不同。AWR、AWAC;库中 IQL 是理解这种 actor 的直接入口。

上面的闭式解是固定 s,Qs,Q 的局部优化,不是“一次指数加权就精确解出了整个机器人任务的最优策略”。

7.3 CQL:压低数据外动作的 Q

Conservative Q-Learning 在 Bellman 回归上加入保守正则。令 βCQL>0\beta_{\rm CQL}>0 为其强度,LTD\mathcal L_{\rm TD} 为普通 critic 的平方 TD 损失;离散动作下的典型形式是:

LQCQL=LTD+βCQL[Es∼Dlog⁡∑a∈Aexp⁡Qϕ(s,a)−E(s,a)∼DQϕ(s,a)].\mathcal L_Q^{\rm CQL} =\mathcal L_{\rm TD} +\beta_{\rm CQL}\left[ \mathbb E_{s\sim\mathcal D}\log\sum_{a\in\mathcal A}\exp Q_\phi(s,a) -\mathbb E_{(s,a)\sim\mathcal D}Q_\phi(s,a) \right].

第一项倾向压低整体动作价值,第二项保留数据动作的相对价值。连续动作要用积分及采样/重要性估计,不能枚举全部关节动作。保守性有助于离线学习,但过强的悲观估计可能阻碍在线探索。CQL 原论文。

7.4 Cal-QL:对保守价值进行标定

Calibrated Q-Learning 处理从离线到在线时过于保守、价值尺度不合适的问题。令 Vref(s)V^{\rm ref}(s) 为参考行为价值,aπa^\pi 为当前策略采样的动作。CO-RFT 使用的一个校准正则核心写作:

RCal(ϕ)=Es∼D, aπ∼π[max⁡(Qϕ(s,aπ),Vref(s))]−E(s,a)∼DQϕ(s,a).\mathcal R_{\rm Cal}(\phi) =\mathbb E_{s\sim\mathcal D,\,a^\pi\sim\pi} \left[\max\left(Q_\phi(s,a^\pi),V^{\rm ref}(s)\right)\right] -\mathbb E_{(s,a)\sim\mathcal D}Q_\phi(s,a).

将 βCalRCal\beta_{\rm Cal}\mathcal R_{\rm Cal} 加到 TD 损失,其中 βCal>0\beta_{\rm Cal}>0。当某个策略动作的 QQ 已低于参考价值时,第一项不再通过它继续向下施压。这个校准并不是对整个神经网络所有输出强制实施硬下界;完整 Cal-QL 的采样与保守项形式见 Cal-QL。

库中使用: CO-RFT 将 Cal-QL 扩展到动作块,做 offline VLA post-training。Cal-QL 原方法可用于 offline-to-online,并不意味着 CO-RFT 这篇也做了在线 RL。不要把 CO-RFT 记成 IQL。

8. PPO、RLOO、GRPO:通过采样回报改善策略

8.1 PPO:概率比值 + Clipping

用 πold\pi_{\rm old} 收集一批 rollout,估计并冻结 A^t\widehat A_t(通常为 GAE);定义概率比 wt(θ)w_t(\theta)、裁剪阈值 ϵclip>0\epsilon_{\rm clip}>0,以及把数值限制在下界 lclipl_{\rm clip}、上界 uclipu_{\rm clip} 之间的函数 clip⁡(x,lclip,uclip)\operatorname{clip}(x,l_{\rm clip},u_{\rm clip}):

wt(θ)=πθ(at∣st)πold(at∣st),w_t(\theta)=\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\rm old}(a_t\mid s_t)},
SPPO(θ)=Erollout[min⁡(wt(θ)A^t,clip⁡(wt(θ),1−ϵclip,1+ϵclip)A^t)].\mathcal S_{\rm PPO}(\theta) =\mathbb E_{\rm rollout}\left[ \min\left( w_t(\theta)\widehat A_t, \operatorname{clip}(w_t(\theta),1-\epsilon_{\rm clip},1+\epsilon_{\rm clip})\widehat A_t \right)\right].

令 cV,cH≥0c_V,c_H\ge0 分别为价值损失与熵奖励系数,一个常用的联合最小化目标为:

LPPO(θ,ψ)=−SPPO(θ)+cVE[(Vψ(st)−V^ttarget)2]−cHEH(πθ(⋅∣st)).\mathcal L_{\rm PPO}(\theta,\psi) =-\mathcal S_{\rm PPO}(\theta) +c_V\mathbb E\left[(V_\psi(s_t)-\widehat V_t^{\rm target})^2\right] -c_H\mathbb E\mathcal H(\pi_\theta(\cdot\mid s_t)).

若 A^t>0\widehat A_t>0,继续增大“好动作”概率的收益在上侧被截平;若 A^t<0\widehat A_t<0,继续减小“坏动作”概率的收益在下侧被截平。Clipping 裁剪的是 surrogate 的收益,不是把所有概率比/KL 硬性限制在区间内。 因此仍可配合 KL 监控与提前停止。

PPO 通常每轮采新数据,在该批数据上做若干次更新后刷新 rollout,属于常见 on-policy 路线。TRPO 则显式使用平均 KL 约束来构造 trust region;PPO 是更便于一阶优化的近似路线。PPO、TRPO。

库中使用: VLA-RL 明确采用 PPO + GAE + learned value critic;SENTINEL 用于 residual 策略;HumanPlus 的低层 humanoid 控制使用 PPO,高层技能学习另属模仿学习。BORA 的离线 actor 虽含 PPO-style clip,因使用固定演示数据和专门掩码,不能据此归为标准 on-policy PPO。

8.2 RLOO / GRPO:不训练价值网络也能估计优势

对相同任务/初始条件采样 K≥2K\ge2 条轨迹。令 RiR_i 为第 ii 条轨迹的总回报,Rˉ=K−1∑j=1KRj\bar R=K^{-1}\sum_{j=1}^KR_j,sR=K−1∑j(Rj−Rˉ)2s_R=\sqrt{K^{-1}\sum_j(R_j-\bar R)^2} 为组内标准差;εnum>0\varepsilon_{\rm num}>0 防止除零。

RLOO(REINFORCE Leave-One-Out) 用其他轨迹平均回报作为 baseline:

biLOO=1K−1∑j≠iRj,A^iRLOO=Ri−biLOO.b_i^{\rm LOO}=\frac{1}{K-1}\sum_{j\ne i}R_j, \qquad \widehat A_i^{\rm RLOO}=R_i-b_i^{\rm LOO}.

GRPO(Group Relative Policy Optimization) 常用组内归一化分数:

A^iGRPO=Ri−RˉsR+εnum.\widehat A_i^{\rm GRPO}=\frac{R_i-\bar R}{s_R+\varepsilon_{\rm num}}.

再把这些轨迹级分数送入 policy-gradient/PPO-style clipped objective,按论文定义分配给动作或 token;可另加参考策略 KL。它们无需 learned value critic,但需要多次 rollout,回报相同时可能没有有效区分信号。组内分数不是每个机器人状态真实 Aπ(st,at)A^\pi(s_t,a_t) 的精确估计。

库中对应: RIPT-VLA 的 LOOP 使用 RLOO + PPO clipping;SimpleVLA-RL 使用 GRPO,不要记成 learned-critic PPO;FetchMan 采用 Flow-GRPO 的扩展,动作分布/flow 的处理需看其具体构造。

动作 token 的 log-probability 与环境动作的 log-probability 要区分:自回归动作序列的联合 log-probability 是各 token 条件 log-probability 之和,但把每个 token 视作独立环境步会改变时域与归因。

9. RLPD、REDQ 与 Human-in-the-loop

RLPD(RL with Prior Data) 把演示/已有离线数据与新交互数据混合,用高样本效率的 off-policy actor–critic 学习。令 ζ∈[0,1]\zeta\in[0,1] 为 batch 中离线样本比例;采样分布记为:

Dmix=ζDoff+(1−ζ)Don.\mathcal D_{\rm mix}=\zeta\mathcal D_{\rm off}+(1-\zeta)\mathcal D_{\rm on}.

这里是采样分布的混合,不是数值相加两个文件集合。RLPD 的典型设置等量混合 prior 与 online 数据;配合 critic ensemble、较高 update-to-data ratio 等设计。UTD 定义为每新增一个环境样本所做的梯度更新次数;高 UTD 能多用数据,也更需要控制过拟合和价值误差。REDQ 是理解 ensemble 与高 UTD 的相关基础。

HIL-SERL 使用 RLPD 路线,将 demonstrations、在线自主数据和人工接管数据接入训练,并学习任务奖励分类器。其正文的 critic backup 未写 SAC 的 entropy 项,而 actor 含熵奖励;因此准确说法是 RLPD / SAC-family 变体,不能直接声称其 critic 完全等于第 6.3 节标准 SAC。

BORA 先离线训练 VLA 与 critic,再冻结 VLA,在线训练动作块 residual,并用 RLPD 混合 replay;还利用接管与恢复信号。它体现了“offline critic 初始化 → online off-policy residual”的路线。

Human-in-the-loop 只是数据/交互机制,不限定算法。人工纠正动作可以用于 BC,也可以进入 RL replay;只有纠正数据监督训练、没有 reward/value 改善目标时,应归为交互式模仿学习。Hand-in-the-Loop 属于后者,不能因持续采数据就称为 online RL。

10. RECAP:MC 价值学习 + Advantage-conditioned Policy

RECAP = RL with Experience and Corrections via Advantage-conditioned Policies,是 π*0.6 / RECAP 的核心方法。它通过自主执行、任务结果标签和可选人工纠正反复改进 VLA。

10.1 用完整轨迹训练分布式 V

该论文取有限任务中的 γ=1\gamma=1,奖励结合每步代价与失败惩罚,并按任务归一化回报。以下统一记归一化后的 MC 标签为 G~t\widetilde G_t。令 BB 为价值区间数、v1,…,vBv_1,\ldots,v_B 为区间代表值,b(x)b(x) 为把数值映射到区间编号的函数;价值网络输出概率 pψ(j∣s,ℓ)p_\psi(j\mid s,\ell),j∈{1,…,B}j\in\{1,\ldots,B\}:

LVRECAP(ψ)=−EDlog⁡pψ(b(G~t)∣st,ℓ),V^ψ(s,ℓ)=∑j=1Bvjpψ(j∣s,ℓ).\mathcal L_V^{\rm RECAP}(\psi) =-\mathbb E_{\mathcal D}\log p_\psi\left(b(\widetilde G_t)\mid s_t,\ell\right), \qquad \widehat V_\psi(s,\ell)=\sum_{j=1}^{B}v_jp_\psi(j\mid s,\ell).

论文使用 B=201B=201。这里是 对 MC return 分桶做分类回归,不是 IQL expectile,也不是 SAC 的 TD critic。πref\pi_{\rm ref} 表示累计数据隐含的参考行为混合,包含演示、人类纠正与不同阶段的机器人策略;原文用其价值解释上述估计。

10.2 从价值生成“较好动作”标签

令 nn 为优势估计使用的步数;r~t\widetilde r_t 表示与价值标签采用相同任务尺度的奖励,ϵℓ\epsilon_\ell 为任务相关阈值,ItI_t 为二值 improvement indicator:

A^tRECAP=∑j=0n−1γjMt,jr~t+j+γnMt,nV^ψ(st+n,ℓ)−V^ψ(st,ℓ),It=1[A^tRECAP>ϵℓ].\widehat A_t^{\rm RECAP} =\sum_{j=0}^{n-1}\gamma^jM_{t,j}\widetilde r_{t+j} +\gamma^nM_{t,n}\widehat V_\psi(s_{t+n},\ell) -\widehat V_\psi(s_t,\ell), \qquad I_t=\mathbf1[\widehat A_t^{\rm RECAP}>\epsilon_\ell].

此式统一了终止掩码与时间编号;原论文取 γ=1\gamma=1。实现时必须确保 reward 与 VV 的归一化尺度一致;若用了仿射平移,需处理相应边界项,不能直接把原始 reward 与归一化 VV 相加。论文将人工纠正样本标为 I=1I=1,相当于相信这些纠正有改进作用。

10.3 用条件建模提取策略

令 βcond≥0\beta_{\rm cond}\ge0 为条件项权重。理想化、可计算动作密度时的目标是:

LπRECAP(θ)=−E(s,a,ℓ,I)∼D[log⁡πθ(a∣s,ℓ)+βcondlog⁡πθ(a∣s,ℓ,I)].\mathcal L_\pi^{\rm RECAP}(\theta) =-\mathbb E_{(s,a,\ell,I)\sim\mathcal D} \left[\log\pi_\theta(a\mid s,\ell) +\beta_{\rm cond}\log\pi_\theta(a\mid s,\ell,I)\right].

训练同时学习无条件与 indicator 条件分布;执行时令 I=1I=1。Bayes 公式说明其机制:

πref(a∣s,ℓ,I=1)=πref(a∣s,ℓ)Pr⁡(I=1∣s,a,ℓ)Pr⁡(I=1∣s,ℓ).\pi_{\rm ref}(a\mid s,\ell,I=1) =\frac{\pi_{\rm ref}(a\mid s,\ell)\Pr(I=1\mid s,a,\ell)} {\Pr(I=1\mid s,\ell)}.

它提高“被判为改进”的动作在条件分布中的概率。与 IQL / AWR 的区别是:优势成为输入条件/标签,而非只变成每个样本的指数 loss 权重。 与 PPO 的区别是:不依靠 old-policy probability ratio 的 clipped objective。

实际 π*0.6 同时有离散输出与连续 flow 动作,连续部分用 条件 flow matching 实现上述策略建模思想,不能把理想化 −log⁡π-\log\pi 原样当成已可精确计算的 flow loss。数据增长后重训价值和条件策略,形成迭代改进。参考原文 §IV–V,而非只看算法名字。

11. 生成式 VLA 的 RL:关键是 Actor 怎样接收改进信号

11.1 BC / ACT 与 Flow Matching 的基础目标

对于可计算动作密度的策略,behavior cloning 为 LBC=−E(s,a)∼Dlog⁡πθ(a∣s)\mathcal L_{\rm BC}=-\mathbb E_{(s,a)\sim\mathcal D}\log\pi_\theta(a\mid s)。ACT / ALOHA 用条件 VAE 与动作块模仿学习;Diffusion-Policy 用去噪生成动作。它们是策略建模/模仿学习基础,本身不等于 RL。

为解释 flow,令 HH 为动作块长度、dad_a 为单步动作维度,U∈RH×daU\in\mathbb R^{H\times d_a} 为实数动作块;z∼N(0,I)z\sim\mathcal N(0,I) 为同维高斯噪声,u∈[0,1]u\in[0,1] 为生成过程时间,与环境时间 tt 区分;vνv_\nu 为参数为 ν\nu 的速度网络。以线性路径为例:

yu=(1−u)z+uU,LFM(ν)=E(s,U)∼D, z, u∼Unif⁡[0,1][∥vν(yu,u,s)−(U−z)∥22].y_u=(1-u)z+uU,\qquad \mathcal L_{\rm FM}(\nu) =\mathbb E_{(s,U)\sim\mathcal D,\,z,\,u\sim\operatorname{Unif}[0,1]} \left[\|v_\nu(y_u,u,s)-(U-z)\|_2^2\right].

Unif⁡[0,1]\operatorname{Unif}[0,1] 表示区间均匀采样;范数对动作块展平后计算。推理积分 dyu/du=vν(yu,u,s)dy_u/du=v_\nu(y_u,u,s),从 y0=zy_0=z 到 y1y_1;记整个生成映射为 Fν(s,z)=y1F_\nu(s,z)=y_1。π0 是库中基础入口。

多峰、长动作块有利于表示灵巧操作,但也使 RL 接口变复杂:最终动作的精确 log⁡π\log\pi 往往不易得到;把 QQ 的梯度穿过整个采样器会增加成本。Flow matching 的平方损失不恒等于精确负 log-likelihood。

11.2 Q 引导、约束与蒸馏

FQL。 FQL 分开训练 BC flow FνF_\nu 与一步 actor fθ(s,z)f_\theta(s,z)。令 βdist>0\beta_{\rm dist}>0 为蒸馏权重:

LπFQL(θ)=Es∼D,z[−Qϕ(s,fθ(s,z))+βdist∥fθ(s,z)−sg⁡(Fν(s,z))∥22].\mathcal L_\pi^{\rm FQL}(\theta) =\mathbb E_{s\sim\mathcal D,z} \left[-Q_\phi(s,f_\theta(s,z)) +\beta_{\rm dist}\|f_\theta(s,z)-\operatorname{sg}(F_\nu(s,z))\|_2^2\right].

两个 actor 使用同一个 zz 对齐生成结果。critic 用当前一步 actor 采样下一动作做 TD;RL 梯度不需要穿过整条 BC flow 的 ODE 求解。

RL Token。 RL Token 压缩冻结 VLA 的视觉语言前缀;令 xx 为压缩 token 与本体感觉组成的输入,U~\widetilde U 为冻结 VLA 的参考动作块,fθ(x,U~)f_\theta(x,\widetilde U) 为 actor 均值,σ>0\sigma>0 为固定标准差:

πθ(U∣x,U~)=N(fθ(x,U~),σ2I),\pi_\theta(U\mid x,\widetilde U) =\mathcal N\left(f_\theta(x,\widetilde U),\sigma^2I\right),
LπRLToken(θ)=E[−Qϕ(x,U)+βref∥U−U~∥22],U∼πθ(⋅∣x,U~),βref>0.\mathcal L_\pi^{\rm RLToken}(\theta) =\mathbb E\left[-Q_\phi(x,U)+\beta_{\rm ref}\|U-\widetilde U\|_2^2\right], \quad U\sim\pi_\theta(\cdot\mid x,\widetilde U),\quad \beta_{\rm ref}>0.

其 critic 使用 TD3-style chunk TD;actor 既追求高 QQ,又被参考动作约束。参考动作是 actor 的条件输入,不能把论文粗略写成“在原 VLA 上跑标准 SAC”。

Q-VGM。 Q-VGM 离线用 IQL 式 critic,在线切换到 policy-sampled TD;actor 用 Q 改善的终点构造局部、靠近去噪末端的速度目标,以局部回归更新速度场,避免对完整生成链做 RL 反传。应分别阅读其 critic 与 actor,不能因 critic 用了 IQL 就把 actor 也写成加权 BC。

BORA。 BORA 离线 actor 是 validity-masked clipped surrogate 与 BC 的组合;在线冻结基础 VLA,用 RLPD 学习 residual。概念上,令 ΔUθ\Delta U_\theta 为学到的修正块:Uexec=Ubase+ΔUθU_{\rm exec}=U_{\rm base}+\Delta U_\theta。实际还需遵守动作归一化、限幅和控制接口。

11.3 其他生成策略 RL 方法速查

方法/本地论文 改进信号如何进入生成策略 与基础算法的关系
DSRL 冻结生成式动作解码器,优化输入噪声/潜变量的策略 DSRL-SAC 在潜变量空间用 SAC;DSRL-NA 是另一变体,不应合称一个 SAC loss
DPPO 将去噪过程构造成扩展 MDP,对去噪转移执行策略优化 PPO;使用去噪步骤的条件密度,不等于直接获得最终动作边缘密度
ReinFlow 给 flow 引入可学习随机性,形成可计算转移概率的随机过程 将 flow 接入 policy-gradient / PPO 路线
FPO 用 flow-matching loss 构造 PPO-inspired surrogate on-policy;使用似然替代量,不能写成“FM loss 就是精确 log-prob”
RL-100 diffusion policy 的 RL 优化与 consistency distillation 结合 去噪层面的 clipped PPO;离线阶段用 IQL 优势,在线阶段用 GAE;其“迭代离线”会在轮次间增添 rollout
EFM-QIPO 以价值/能量对 flow matching 加权,做离线策略改进 更接近价值引导的生成模型拟合;看能量与权重如何由 critic 构造
Learning-While-Deploying DIVL 学分布式价值,QAM 用 adjoint matching 提取 flow 策略 多步、分位数 bootstrap + Q 引导;不能因“分布式 V”就归为 RECAP 的 MC 训练

12. 动作块、双臂与人形控制:公式如何落到机器人上

12.1 Chunk Q 与环境时钟

令 HH 为预测长度、C≤HC\le H 为本次实际连续执行的步数。记 U^t(H)\widehat U_t^{(H)} 为预测块、Ut(C)=(at,…,at+C−1)U_t^{(C)}=(a_t,\ldots,a_{t+C-1}) 为实际执行的块;只有全部执行且没有中途改动时,二者才相同。定义折扣块奖励和块终止掩码:

Rt(C)=∑j=0C−1γjMt,jrt+j,mt(C)=Mt,C.R_t^{(C)}=\sum_{j=0}^{C-1}\gamma^jM_{t,j}r_{t+j}, \qquad m_t^{(C)}=M_{t,C}.

将 CC 步视为一个决策转移,价值目标为:

yt,IQL(C)=Rt(C)+γCmt(C)Vψ(st+C),yt,π(C)=Rt(C)+γCmt(C)EU′∼π(⋅∣st+C)Qϕˉ(st+C,U′).\begin{aligned} y_{t,\rm IQL}^{(C)} &=R_t^{(C)}+\gamma^C m_t^{(C)}V_\psi(s_{t+C}),\\ y_{t,\pi}^{(C)} &=R_t^{(C)}+\gamma^C m_t^{(C)} \mathbb E_{U'\sim\pi(\cdot\mid s_{t+C})}Q_{\bar\phi}(s_{t+C},U'). \end{aligned}

这里 Q(s,U)Q(s,U) 的含义是承诺执行该块后再遵循后续策略;若机器人在块中途重规划、人工覆盖动作,训练必须记录并处理真实执行过程。不能用未执行的 HH 步预测去配 HH 步奖励;也不能一边用 CC 步奖励,一边仍只乘一步折扣 γ\gamma,除非已把该 γ\gamma 重新定义为每块折扣。

Q-Chunking、Adaptive-Q-Chunking 是这一主题的入口;CO-RFT、RL Token、BORA、Q-VGM 将 chunk critic 用到 VLA 后训练。可变块长度时,还要处理不同时间尺度的价值/优势可比性。

12.2 结构设计与 RL 算法是不同层面的选择

研究方向 阅读时要明确的对象 与本笔记的连接
双臂 + 灵巧手 VLA 动作是末端位姿还是所有手臂/手指关节?双臂是否联合输出?手是夹爪还是多自由度手? 高维、多峰策略需要合理动作表示;Q/优势必须评价同一实际动作接口
Offline → Online 哪些参数在线更新:整个 VLA、action head、latent policy,还是 residual?是否继承 critic? IQL / Cal-QL 解决离线价值学习;SAC / RLPD 等承担在线更新;actor 接口可另选
Humanoid + ACT ACT 控制上肢还是全身?是否另有 locomotion/tracking controller?任务语言是否进入最终动作策略? ACT 是动作块模仿学习架构;低层用了 PPO 不代表高层 ACT 也用了 RL
真正端到端任务执行 从任务、视觉、本体感觉到关节目标的完整路径;奖励归因与训练梯度到哪里为止? “端到端推理”“联合训练”“无独立运动控制器”是不同主张,应分别核验

HumanPlus 等工作应按高层技能与低层控制分别记录;任务级策略输出关节目标依然通常由底层伺服执行。价值学习算法本身不决定是否端到端。

13. 方法—论文对应总表与补充方法

13.1 本地论文的实际用法

“使用”表示该文方法的一部分;“继承”表示只借用了相应组件。列入参考文献或作为 baseline,不足以支持“该论文使用此算法”的归类。

方法 数据/更新范式 库中实际对应与边界
PPO + GAE 通常 online on-policy VLA-RL;SENTINEL 的 residual;HumanPlus 的低层控制
PPO-style 离线目标 offline,专门的行为约束/掩码 BORA 离线 actor;不是标准 on-policy PPO
GRPO / Flow-GRPO rollout 的组相对优化 SimpleVLA-RL / FetchMan
RLOO + clipping rollout、无 learned value critic RIPT-VLA 的 LOOP
SAC online off-policy DSRL 中 DSRL-SAC;作用于 latent noise policy
TD3-style chunk critic online off-policy RL Token,actor 另有参考动作约束
IQL offline,可接在线微调 IQL 原法;BORA、Q-VGM 继承 critic;RL-100 离线阶段用 IQL 优势,actor 均有不同设计
CQL → Cal-QL offline / offline-to-online Cal-QL 原法;CO-RFT 使用 chunked Cal-QL 做离线训练
RLPD online off-policy + prior replay RLPD;HIL-SERL;BORA 在线 residual
MC distributional V + 优势条件策略 累计数据上训练,交互后迭代 π*0.6 / RECAP;不能强行归为标准 PPO 或 SAC
Q 引导 flow 依方法而定 FQL、Q-VGM、EFM-QIPO;actor 的 Q 梯度/加权路径不同
DIVL + QAM offline-to-online/持续部署 Learning-While-Deploying;分布式价值与 adjoint matching
PPO + offline supervision online RL 配合离线监督正则 Offline-Supervision-VLA-RL;用了离线 BC 不代表整个方法为 offline RL
PPO + 探索机制 online RL Uncertainty-Gated-Exploration;应同时阅读其失败/局限分析
BC、交互式模仿、上下文适应 不应自动归为 RL ACT / ALOHA、Hand-in-the-Loop、Self-Adaptive-VLA

13.2 常见补充方法:读到时能定位即可

方法 核心思想/最小公式 对当前方向的用途与来源
TD3+BC 令 βBC>0\beta_{\rm BC}>0,actor 最小化 E[−Qϕ(s,fθ(s))+βBC∥fθ(s)−a∥22]\mathbb E[-Q_\phi(s,f_\theta(s))+\beta_{\rm BC}\|f_\theta(s)-a\|_2^2];不同实现会归一化 Q 或调整权重 简单离线基线;参考动作约束与 RL Token 有直观关联,但不能因此认定 RL Token 就是 TD3+BC。原论文
BCQ 从行为生成模型候选动作中选择高 Q 动作,并限制修正幅度 了解“限制动作支持集”的离线 RL 路线。原论文
AWR / AWAC 优势指数加权回归;AWAC 结合 off-policy Q 理解 IQL actor 与离线到在线行为约束。AWR、AWAC
TRPO 最大化局部策略收益,约束相对旧策略的平均 KL PPO 的理论背景;机器人连续控制常见基础。原论文
REDQ Q ensemble、随机子集目标、高 UTD 理解 RLPD 的数据效率和 critic 稳定化背景。原论文
Decision Transformer 以目标 return-to-go、状态和动作历史为条件进行序列建模 理解 return-conditioned policy;RECAP 条件是优势派生 indicator,二者不等价。原论文
BC / SFT、交互式模仿 模仿示范动作;交互收集纠正可缓解部署分布偏移 ACT / VLA 的起点;见 ACT / ALOHA、Hand-in-the-Loop,无奖励优化时不叫 RL
奖励建模 学一个评价状态/轨迹的 reward model,供训练或评价使用 RoboReward;它提供学习信号,不单独规定 actor–critic 算法

这里优先保留与库内 manipulation / VLA 直接相连的方法;model-based planning、世界模型 RL、多智能体信用分配另成后续笔记,不在本篇展开。

14. 阅读与实验时的最小核对清单

  1. Reward 和 return 分开。 稀疏成功奖励、每步代价、失败罚分、折扣和归一化共同决定实际优化目标。
  2. 写出 critic 的完整 target。 下一项来自 VV、QQ、actor 采样、数据动作、MC 还是分位数?有没有 entropy 和终止掩码?
  3. 再写 actor 的 loss。 PPO ratio、加权 BC、条件建模、Q 梯度、局部速度回归,是不同的改进接口。
  4. 注明行为策略与训练阶段。 Offline / online 描述数据能否增长;on-policy / off-policy 描述更新与采样策略的关系。
  5. 对齐动作与时钟。 单步、动作块、去噪步、token 步不可混用;γC\gamma^C 与真正执行长度要一致。
  6. 检查 partial observability 和干预。 人工接管改变行为;历史观测可能影响 Markov 性;replay 必须记录真实执行动作。
  7. 区分方法、变体、baseline。 引用了 SAC 或 IQL,不等于使用完整算法;用了 clip,也不自动等于 on-policy PPO。
  8. 只对可验证控制链说“端到端”。 高层 VLA、ACT、全身 controller、关节伺服分别是什么,先画清楚输入输出。

针对你的方向,建议首轮精读顺序: IQL → RLPD / Cal-QL → RECAP → CO-RFT / BORA → RL Token / Q-VGM;并行读 PPO + GAE → VLA-RL → RIPT-VLA / SimpleVLA-RL。Flow 线先读 FQL,再比较 DPPO、ReinFlow、FPO。ACT / Humanoid 的网络与控制栈细节适合接着单独整理。

15. 本地引用与核对版本

以下为正文实际引用的本地论文。版本对应当前整理后的 PDF;方法归类以正文方法章节为依据。外部经典算法原文已在相关小节直接链接,未假定它们全部已下载进本地库。

本地 PDF 论文题目 核对版本/原始来源
VLA-RL VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning 2505.18719v1
HIL-SERL Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning 2410.21845v3
RL Token RL Token: Bootstrapping Online RL with Vision-Language-Action Models 2604.23073v2
DSRL Steering Your Diffusion Policy with Latent Space Reinforcement Learning 2506.15799v2
RLPD Efficient Online Reinforcement Learning with Offline Data 2302.02948v4
IQL Offline Reinforcement Learning with Implicit Q-Learning 2110.06169v1
BORA BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models 2605.30226v2
Q-VGM Q-VGM: Q-Guided Value-Gradient Matching for Offline-to-Online RL of Flow-Matching VLA Policies 2606.08015v5
CO-RFT CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning 2508.02219v1
Cal-QL Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning 2303.05479v4
SENTINEL SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control 2511.19236v1
HumanPlus HumanPlus: Humanoid Shadowing and Imitation from Humans 2406.10454v1
RIPT-VLA Interactive Post-Training for Vision-Language-Action Models 2505.17016v1
SimpleVLA-RL SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning 2509.09674v1
FetchMan FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences 2608.17027v2
Hand-in-the-Loop Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention 2605.15157v2
π*0.6 / RECAP π0.6∗\pi^{*}_{0.6}: a VLA That Learns From Experience 2511.14759v2
ACT / ALOHA Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware 2304.13705v1
Diffusion-Policy Diffusion Policy: Visuomotor Policy Learning via Action Diffusion 2303.04137v5
π0 π0\pi_0: A Vision-Language-Action Flow Model for General Robot Control 2410.24164v4
FQL Flow Q-Learning 2502.02538v2
DPPO Diffusion Policy Policy Optimization 2409.00588v3
ReinFlow ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning 2505.22094v7
FPO Flow Matching Policy Gradients 2507.21053v2
RL-100 RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning 2510.14830v4
EFM-QIPO Energy-Weighted Flow Matching for Offline Reinforcement Learning 2503.04975v1
Learning-While-Deploying Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies 2605.00416v4
Q-Chunking Reinforcement Learning with Action Chunking 2507.07969v4
Adaptive-Q-Chunking Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning 2605.05544v1
Offline-Supervision-VLA-RL Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models 2607.19399v1
Uncertainty-Gated-Exploration Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy 2609.28838v1
Self-Adaptive-VLA Self-Adaptive VLA for Robust Robot Deployment 2609.30092v1
RoboReward RoboReward: General-Purpose Vision-Language Reward Models for Robotics 2601.00675v2