# RL 基础与 VLA 后训练:公式、方法与论文对照 **研究笔记 01 · 2026-10-02** 面向双臂/灵巧手 VLA、offline-to-online RL,以及 Humanoid + ACT。根据本地论文原文整理;“REACP”按 **RECAP** 处理。核心方法展开目标函数,其余方法用速查表压缩。文中的论文简称链接到本地 PDF;末尾列出核对版本与原始来源。 阅读顺序:先读 **1–5 节基础**,再读 **6–11 节算法**,最后读 **12–14 节 VLA 对接与选型**。这里统一了不同论文的符号,公式保留算法核心,工程上的 ensemble、归一化、辅助损失以原文为准。 ## 1. 统一符号与问题设定 ### 1.1 环境、策略与网络 | 符号 | 定义 | |---|---| | $\mathcal S,\mathcal A$;$s_t,a_t$ | 状态空间、动作空间;时刻 $t$ 的状态与动作。动作可以是关节目标、末端位姿增量,也可以是后文定义的动作块。 | | $t=0,\ldots,T-1$ | 环境交互步;一条有限轨迹共有 $T$ 次动作,$s_T$ 为终止状态。 | | $P(s'\mid s,a),\rho_0(s)$ | 状态转移分布与初始状态分布;撇号表示下一状态。 | | $r_t,\bar r(s,a)$ | 执行 $a_t$、转移到 $s_{t+1}$ 后获得的标量奖励;$\bar r(s,a)=\mathbb E[r_t\mid s_t=s,a_t=a]$ 是其条件均值。 | | $\gamma\in[0,1]$ | 每个环境步的折扣因子。持续任务通常取 $\gamma<1$;有限任务可取 $\gamma=1$。 | | $e_t,m_t$ | $e_t=1$ 表示这次转移使任务真正终止,否则为 $0$;$m_t=1-e_t$ 是继续 bootstrap 的掩码。 | | $\pi_\theta(a\mid s),\mu(a\mid s)$ | 待优化策略与采集数据的行为策略;$\theta$ 为 actor 参数。连续动作下是概率密度。 | | $\mathcal D,\mathcal D_{\rm off},\mathcal D_{\rm on}$ | 通用数据集/replay buffer、固定离线数据、在线新收集的数据;基础记录为 $(s,a,r,s',e)$。 | | $Q_\phi,V_\psi$ | 分别由参数 $\phi,\psi$ 表示的动作价值、状态价值网络;**critic 是估计器,不等于真实价值函数**。 | | 上横线、上帽子 | $\bar\phi$ 为慢更新/冻结的目标网络参数;$\widehat A,\widehat G$ 等为估计量。 | | $\operatorname{sg}(x)$ | stop-gradient:前向取 $x$,反向不通过 $x$ 求导。 | | $\mathbb E,\nabla,\mathbf1[\cdot],\|\cdot\|_2$ | 期望、梯度、条件成立取 $1$ 的指示函数、欧氏范数。$\log$ 为自然对数。 | | $\mathcal L,\eta$ | 待最小化的损失、正的学习率;目标 $J$ 通常待最大化。 | 默认转移与奖励机制不直接依赖 $\theta$。有限时域问题若奖励/最优策略依赖剩余时间,应把时间并入状态,或给 $Q,V,\pi$ 加时间下标;下文采用前者,避免省略时间造成 Bellman 方程歧义。 ### 1.2 VLA 中什么才是状态 令 $\ell$ 为任务语言,$o_t$ 为相机、关节等观测,$c_t=(\ell,o_{0:t},a_{0:t-1})$ 为历史上下文。机器人通常是部分可观测问题:理论中的 $s_t$ 可理解为满足 Markov 性的完整状态或 belief state,实际模型则计算 $\pi_\theta(a_t\mid c_t)$。仅用当前图像代替完整状态是建模近似。 语言可作为状态的一部分。动作若是电机关节目标,动力学 $P$ 仍包含伺服器、接触和机体动力学;“直接输出关节目标”不等于网络输出电机电流,也不自动等于全身控制已端到端训练。 ## 2. Reward → Return → Q / V / A → J ### 2.1 即时奖励、累计回报、优化目标 **Reward $r_t$** 只评价当前一次转移;**return $G_t$** 是从当前开始的折扣累计奖励;**$J(\theta)$** 是策略在初始任务分布上的期望回报: $$ G_t=\sum_{j=0}^{T-t-1}\gamma^j r_{t+j},\qquad G_T=0,\qquad G_t=r_t+\gamma m_tG_{t+1}. $$ $$ J(\theta)=\mathbb E_{s_0\sim\rho_0,\,\pi_\theta,P}[G_0], \qquad \theta^*\in\arg\max_\theta J(\theta). $$ 期望覆盖初始状态、策略采样和环境随机性。单条轨迹的 $G_0$ 只是一次样本,不是 $J$。若只在最后成功时给 $1$,$\gamma=1$ 时 $J$ 等于成功概率;若 $\gamma<1$,它还偏好更早成功。若每步给 $-1$,则偏好少用步数;如果失败也会提前结束,必须设计失败代价,避免“尽早失败”反而得分更高。 ### 2.2 三种价值量 先固定策略 $\pi$。定义状态价值 $V^\pi$、动作价值 $Q^\pi$ 和优势 $A^\pi$: $$ V^\pi(s)=\mathbb E_\pi[G_t\mid s_t=s],\qquad Q^\pi(s,a)=\mathbb E_\pi[G_t\mid s_t=s,a_t=a]. $$ $$ V^\pi(s)=\mathbb E_{a\sim\pi(\cdot\mid s)}Q^\pi(s,a),\qquad A^\pi(s,a)=Q^\pi(s,a)-V^\pi(s). $$ $V$ 问“到这里之后,按这个策略做能得多少分”;$Q$ 问“这里先做这个动作,再按策略做能得多少分”;$A$ 问“这个动作比该策略在此处的平均动作好多少”。因此: $$ \mathbb E_{a\sim\pi(\cdot\mid s)}A^\pi(s,a)=0, \qquad J(\theta)=\mathbb E_{s_0\sim\rho_0}V^{\pi_\theta}(s_0). $$ 优势为正不代表一定成功,只代表比当前基准更好。论文中 IQL 的 expectile $V$、SAC 的 soft $V$ 有不同定义,不能直接套用上面的“普通策略平均价值”。 ### 2.3 Bellman 方程从哪里来 把 $G_t=r_t+\gamma m_tG_{t+1}$ 放进条件期望,用全期望公式即可得到 **Bellman expectation equation**: $$ \begin{aligned} Q^\pi(s,a) &=\mathbb E_{r,s',e\mid s,a}\left[r+\gamma(1-e)V^\pi(s')\right],\\ V^\pi(s) &=\mathbb E_{a\sim\pi,\,r,s',e\mid s,a} \left[r+\gamma(1-e)V^\pi(s')\right]. \end{aligned} $$ 令 $V^*(s)=\sup_\pi V^\pi(s)$、$Q^*(s,a)=\sup_\pi Q^\pi(s,a)$。当最大值可达时,**Bellman optimality equation** 为: $$ V^*(s)=\max_aQ^*(s,a),\qquad Q^*(s,a)=\mathbb E\left[r+\gamma(1-e)\max_{a'}Q^*(s',a')\mid s,a\right]. $$ 这形成两种基本操作:**policy evaluation** 固定策略估计价值;**policy improvement** 根据价值改善策略。Actor–Critic 将二者交替进行。连续高维动作下,直接求 $\max_aQ(s,a)$ 很难,actor 的一个作用就是近似这个优化步骤。 ## 3. MC、TD、n-step 与 GAE ### 3.1 MC return 与 TD target **Monte Carlo(MC)** 等到完整轨迹结束,用观测到的 $G_t$ 监督价值: $$ \mathcal L_V^{\rm MC}(\psi) =\mathbb E_{(s_t,G_t)\sim\mathcal D} \left[(V_\psi(s_t)-G_t)^2\right]. $$ **Temporal Difference(TD)** 用“真实一步奖励 + 下一状态价值估计”作目标。令 $y_t^{\rm TD}$ 为一步目标、$\delta_t$ 为 TD error: $$ y_t^{\rm TD}=r_t+\gamma m_t V_{\bar\psi}(s_{t+1}),\qquad \delta_t=r_t+\gamma m_tV_\psi(s_{t+1})-V_\psi(s_t). $$ $$ \mathcal L_V^{\rm TD}(\psi) =\mathbb E_{\mathcal D} \left[(V_\psi(s_t)-\operatorname{sg}(y_t^{\rm TD}))^2\right]. $$ 表格型 TD(0) 的更新是 $V(s_t)\leftarrow V(s_t)+\eta\delta_t$。目标网络不是 TD 定义的一部分,而是深度 RL 常用的稳定化手段。Q 网络也可用 TD;区别只是目标中的后续价值从哪里来。 | 比较项 | MC | TD | |---|---|---| | 监督信号 | 后面实际发生的完整回报 | 实际奖励 + 估计的后续价值 | | 是否 bootstrap | 否 | 是 | | 是否等到终止 | 完整 MC 通常需要 | 一步 TD 不需要 | | 主要统计特点 | 对产生轨迹的策略,完整 return 是无偏价值样本;通常方差较高 | 近似价值会带入 bootstrap 误差;通常方差较低 | | 主要局限 | 长任务、稀疏奖励时归因困难;历史轨迹回报不直接等于当前策略价值 | critic 错误可通过目标传播;不是“一定比 MC 更准” | | 库中例子 | RECAP 的分布式 $V$ 用 MC return 训练 | IQL、RLPD、RL Token、Q-VGM 的 critic 用 TD/多步目标 | 离线数据由多个策略产生时,直接 MC 回归通常对应**数据行为混合的条件回报**,不自动得到新策略的 $V^{\pi_\theta}$。TD 也不会自动解决 off-policy 问题,仍要检查目标策略、数据覆盖与校正方式。 ### 3.2 n-step return:两者之间的桥 令 $n$ 为向前使用的实际奖励步数;$M_{t,j}=\prod_{i=0}^{j-1}m_{t+i}$,空乘积 $M_{t,0}=1$。终止后按吸收状态零奖励补齐。定义: $$ Y_t^{(n)}= \sum_{j=0}^{n-1}\gamma^jM_{t,j}r_{t+j} +\gamma^nM_{t,n}V_{\bar\psi}(s_{t+n}). $$ $n=1$ 是一步 TD;到真正终止且不再 bootstrap,就是 MC。它同时影响方差、bootstrap 误差与 off-policy 误差:若中间动作来自不同的行为策略,多步目标通常不能未经校正就当作目标策略的无偏 return。 **终止不等于截断。** 成功、失败等真正终止令 $m_t=0$;仅因采样 batch 满了而截断,应保留 bootstrap,并用截断前的最后观测。若超时本身定义为任务失败,它才是该任务的终止条件。 ### 3.3 为什么 TD error 能估计 Advantage 如果 $V_\psi=V^\pi$ 且后续遵循 $\pi$,那么: $$ \mathbb E\left[r_t+\gamma m_tV^\pi(s_{t+1})-V^\pi(s_t) \mid s_t=s,a_t=a\right] =Q^\pi(s,a)-V^\pi(s)=A^\pi(s,a). $$ 因此 $\delta_t$ 可作为一步优势估计。**GAE(Generalized Advantage Estimation)** 用多个 TD residual 平滑这个估计。令 $\lambda\in[0,1]$ 为 GAE 混合参数,$L$ 为当前 rollout 中剩余步数;令 $V_{\rm old}$ 为本轮计算优势时冻结的价值网络,$\delta$ 也由它计算: $$ \widehat A_t^{\rm GAE} =\sum_{j=0}^{L-1}(\gamma\lambda)^jM_{t,j}\delta_{t+j}, \qquad \widehat V_t^{\rm target} =\operatorname{sg}\left(\widehat A_t^{\rm GAE}+V_{\rm old}(s_t)\right). $$ $\lambda=0$ 为一步 TD 优势;$\lambda=1$ 为该 rollout 的多步 return 减 baseline,只有 rollout 到真正终止才化为 $G_t-V_{\rm old}(s_t)$。[GAE 原论文](https://arxiv.org/abs/1506.02438);VLA 应用见 [VLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__VLA-RL__Towards-Masterful-and-General-Robotic-Manipulation-with-Scalable-Reinforcement-Learning__arXiv-2505.18719v1.pdf)。 **小例子。** 三步奖励为 $(0,0,1)$,$\gamma=0.9$,最后一步终止,则 $(G_0,G_1,G_2)=(0.81,0.9,1)$。若三个状态的价值估计为 $(0.2,0.3,0.6)$,则 TD error 为 $(0.07,0.24,0.4)$;取 $\lambda=1$,$\widehat A_0=0.07+0.9\times0.24+0.9^2\times0.4=0.61=G_0-0.2$。 ## 4. Policy Gradient 与两种 Actor–Critic ### 4.1 从 J 推到策略梯度 令 $\xi=(s_0,a_0,r_0,\ldots,s_T)$ 为完整轨迹,$p_\theta(\xi)$ 为其概率;用 $P(s',r\mid s,a)$ 表示环境的状态、奖励联合转移。由环境不依赖 $\theta$: $$ p_\theta(\xi)=\rho_0(s_0)\prod_{t=0}^{T-1} \pi_\theta(a_t\mid s_t)P(s_{t+1},r_t\mid s_t,a_t), \qquad \nabla_\theta\log p_\theta(\xi) =\sum_{t=0}^{T-1}\nabla_\theta\log\pi_\theta(a_t\mid s_t). $$ 用 $\nabla p=p\nabla\log p$,再利用“当前动作不能影响过去奖励”,得到: $$ \begin{aligned} \nabla_\theta J(\theta) &=\mathbb E_{\xi\sim p_\theta} \left[G_0\sum_t\nabla_\theta\log\pi_\theta(a_t\mid s_t)\right]\\ &=\mathbb E_{\xi\sim p_\theta} \left[\sum_t\gamma^t\nabla_\theta\log\pi_\theta(a_t\mid s_t)G_t\right]\\ &=\mathbb E_{\xi\sim p_\theta} \left[\sum_t\gamma^t\nabla_\theta\log\pi_\theta(a_t\mid s_t) Q^{\pi_\theta}(s_t,a_t)\right]. \end{aligned} $$ 任取不依赖当前动作的 baseline $b(s)$,因为: $$ \mathbb E_{a\sim\pi_\theta} \left[\nabla_\theta\log\pi_\theta(a\mid s)b(s)\right] =b(s)\nabla_\theta\int\pi_\theta(a\mid s)\,da=0, $$ 可将 $Q$ 换成 $Q-b$;取 $b=V^\pi$ 就得到优势形式。离散动作把积分换成求和。 若 $\gamma<1$,定义归一化折扣状态占用分布 $d_\gamma^\pi(s)=(1-\gamma)\sum_{t\ge0}\gamma^t\Pr_\pi(s_t=s)$,则还可写为: $$ \nabla_\theta J =\frac{1}{1-\gamma} \mathbb E_{s\sim d_\gamma^\pi,\,a\sim\pi_\theta} \left[\nabla_\theta\log\pi_\theta(a\mid s)A^\pi(s,a)\right]. $$ 实践中常用均匀采样时间步的 surrogate,省略外部 $\gamma^t$;这不是对上述有限轨迹目标的逐项恒等改写,阅读实现时要检查采样分布。 ### 4.2 Q Actor–Critic 与 Advantage Actor–Critic 这两个名称首先描述 **critic/actor 信号的选择**;“Q Actor–Critic”并不是唯一确定的一篇算法。 | 形式 | Critic 学什么 | Actor 用什么 | 特点 | |---|---|---|---| | Q Actor–Critic | $Q_\phi(s,a)$ | score-function 梯度中的 $Q$,或直接对动作求 $\nabla_aQ$ | 能比较/优化不同动作;连续动作中常见于 DDPG、TD3、SAC 家族 | | Advantage Actor–Critic | 常学 $V_\psi(s)$,由 TD/GAE 构造 $\widehat A$;也可同时学 $Q,V$ | $\nabla\log\pi\,\widehat A$ | 减去状态 baseline 以降低方差;A2C、PPO 常用 | 取 $\pi_{\rm old}$ 为采样时冻结的策略。最基本的 on-policy advantage actor–critic 在当前采样参数处,最小化以下局部损失: $$ \mathcal L_{\rm actor}(\theta) =-\mathbb E_{\xi\sim\pi_{\rm old}} \left[\sum_t\gamma^t\operatorname{sg}(\widehat A_t) \log\pi_\theta(a_t\mid s_t)\right], \qquad \mathcal L_{\rm critic}(\psi) =\mathbb E\left[(V_\psi(s_t)-\widehat V_t^{\rm target})^2\right]. $$ 梯度估计在 $\theta=\theta_{\rm old}$ 处对应新鲜 rollout;若对同一批数据大幅更新很多次,就要考虑策略变化,PPO 用概率比值和 clipping 处理这一点。**REINFORCE** 用 MC return 的策略梯度;如果仅用 return 而不学价值网络,就没有 learned critic。 **A2C** 通常指同步采样/更新的 Advantage Actor–Critic;**A3C** 是其异步多 worker 版本。二者与 PPO 有共同基础,但 A2C 没有 PPO 的 clipped ratio 目标。[A3C 原论文](https://arxiv.org/abs/1602.01783)。 对确定性 actor,令 $f_\theta(s)$ 为直接输出的动作。在固定 replay 状态分布上,常最小化 $\mathcal L_{\rm actor}=-\mathbb E_{s\sim\mathcal D}Q_\phi(s,f_\theta(s))$;链式法则给出: $$ -\nabla_\theta\mathcal L_{\rm actor} =\mathbb E_{s\sim\mathcal D} \left[\nabla_\theta f_\theta(s)\, \nabla_aQ_\phi(s,a)\big|_{a=f_\theta(s)}\right]. $$ 更新 actor 时冻结 critic 参数,但保留 $Q$ 对输入动作的梯度。这个 replay surrogate 不应未经说明就称为原始 on-policy $J$ 的精确梯度。[DDPG](https://arxiv.org/abs/1509.02971)、[TD3](https://arxiv.org/abs/1802.09477)。 ## 5. Offline / Online 与 On-policy / Off-policy 是两个维度 ### 5.1 四个词分别在问什么 | 维度 | 定义 | 典型例子 | |---|---|---| | Offline RL | 学习阶段只访问固定数据,不能靠新交互纠正错误 | IQL、CQL;CO-RFT 的离线阶段 | | Online RL | 学习期间继续与环境交互,采集新数据 | PPO、在线 SAC、RLPD | | Offline-to-online RL | 先用固定数据初始化,再交互微调 | Cal-QL;BORA、Q-VGM | | On-policy | 用当前/近期采样策略的数据,估计并改善该策略;严格性要看更新公式 | A2C、PPO;PPO 允许一批新 rollout 内多轮受限更新 | | Off-policy | 能从行为策略 $\mu$ 与目标策略 $\pi$ 不同的数据中学习 | Q-learning、SAC、TD3、IQL | **Online 可以是 off-policy**:SAC 一边收集新数据一边从历史 replay 学习。**固定数据也可来自某个恰好等于目标策略的行为策略**:此时可做 on-policy evaluation;但固定数据通常无法支持策略不断变化后的标准 on-policy control。 PPO 的 ratio 不意味着它可以直接复用任意旧数据;SAC 是 off-policy 也不意味着把它直接运行在固定数据上就一定有效。BC/SFT 使用离线数据,但没有利用奖励改善策略时,应叫模仿学习而非 offline RL。 ### 5.2 分布不匹配与重要性采样 令 $w_t=\pi(a_t\mid s_t)/\mu(a_t\mid s_t)$ 为动作重要性比值,$W_{0:t}=\prod_{i=0}^{t}w_i$ 为前缀比值;要求目标策略会选择的动作在行为数据中有非零概率。对相同初始分布和环境,任意可积轨迹函数 $f(\xi)$ 满足: $$ \mathbb E_{\xi\sim\pi}[f(\xi)] =\mathbb E_{\xi\sim\mu}[W_{0:T-1}f(\xi)]. $$ 精确轨迹校正的方差可能随时域剧增。只乘当前一步的比值,通常不能同时校正不同的状态分布和未来行为。很多 off-policy 算法依靠 Bellman 回归、目标网络、行为约束等机制,而非完整轨迹 importance sampling。 **Offline 的核心困难:OOD 动作误差。** OOD 指数据分布外。actor 最大化估计 $Q$ 时可能选中数据中没见过、却被 critic 高估的动作;bootstrap 再传播该错误。IQL 限制价值学习时查询的动作来源,CQL 压低不受支持的价值,BC/KL 正则约束策略偏离。三者处理的是相关但不同的问题。 ## 6. Q-learning、TD3 与 SAC:通过 Q 改善动作 ### 6.1 SARSA、Q-learning、DQN 令 $y$ 为 TD 目标、$a'$ 为下一动作。二者共享表格更新 $Q(s,a)\leftarrow Q(s,a)+\eta[y-Q(s,a)]$,但目标不同: $$ \begin{aligned} y_{\rm SARSA}&=r+\gamma(1-e)Q(s',a'),\quad a'\sim\pi(\cdot\mid s'),\\ y_{\rm QL}&=r+\gamma(1-e)\max_{a'}Q(s',a'). \end{aligned} $$ SARSA 在跟随并评估实际行为策略时是 on-policy;Q-learning 的目标是 greedy 策略,即使数据来自探索策略也可更新,因而是 off-policy。深度版本 **DQN** 用神经网络、replay 和目标网络代替表格。**Double DQN** 用在线网络选动作、目标网络评价,减轻“同一噪声同时选和估”造成的高估: $$ y_{\rm DoubleDQN} =r+\gamma(1-e) Q_{\bar\phi}\left(s',\arg\max_{a'}Q_\phi(s',a')\right). $$ 原始文献:[DQN](https://arxiv.org/abs/1312.5602)、[Double DQN](https://arxiv.org/abs/1509.06461)。对灵巧手所有连续关节组合直接离散枚举通常代价很大。库中 [HIL-SERL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2024__HIL-SERL__Precise-and-Dexterous-Robotic-Manipulation-via-Human-in-the-Loop-Reinforcement-Learning__arXiv-2410.21845v3.pdf) 对离散夹爪动作使用 DQN grasp critic;连续机械臂部分采用另一套 actor–critic。 ### 6.2 DDPG → TD3 DDPG 用确定性 actor $f_\theta$ 近似连续动作优化。TD3 增加 **双 Q 取较小值、延迟 actor 更新、目标动作平滑**。令 $i\in\{1,2\}$ 标识两个 critic,$\epsilon_{\rm smooth}$ 为截断的零均值高斯噪声,$\operatorname{clip}_{\mathcal A}$ 为裁剪到合法动作范围: $$ a'=\operatorname{clip}_{\mathcal A} \left(f_{\bar\theta}(s')+\epsilon_{\rm smooth}\right),\qquad y=r+\gamma(1-e)\min_{i=1,2}Q_{\bar\phi_i}(s',a'). $$ critic 回归 $y$;actor 最大化通常选定的一个 critic $Q_{\phi_1}(s,f_\theta(s))$。与 SAC 的关键差别是:标准 TD3 没有最大熵目标,actor 是确定性映射。[DDPG 原论文](https://arxiv.org/abs/1509.02971)、[TD3 原论文](https://arxiv.org/abs/1802.09477)。[RL Token](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__RL-Token__Bootstrapping-Online-RL-with-Vision-Language-Action-Models__arXiv-2604.23073v2.pdf) 使用 **TD3-style critic / Q 最大化加参考动作约束**,但整体结构并非逐项照搬标准 TD3。 ### 6.3 SAC:最大熵 Off-policy Actor–Critic **Soft Actor–Critic** 在奖励之外奖励策略熵。定义熵 $\mathcal H(\pi(\cdot\mid s))=-\mathbb E_{a\sim\pi}\log\pi(a\mid s)$,温度 $\alpha>0$ 控制熵权重: $$ J_\alpha(\theta)=\mathbb E_{\pi_\theta} \left[\sum_t\gamma^t\left(r_t+\alpha\mathcal H(\pi_\theta(\cdot\mid s_t))\right)\right]. $$ 用上标 $\mathrm{soft}$ 明确区分普通价值与 soft 价值。SAC 的约定是 $Q^{\pi,\mathrm{soft}}$ 不含当前动作处的熵奖励、$V^{\pi,\mathrm{soft}}$ 含当前状态熵: $$ \begin{aligned} V^{\pi,\mathrm{soft}}(s) &=\mathbb E_{a\sim\pi}\left[Q^{\pi,\mathrm{soft}}(s,a)-\alpha\log\pi(a\mid s)\right],\\ Q^{\pi,\mathrm{soft}}(s,a) &=\mathbb E\left[r+\gamma(1-e)V^{\pi,\mathrm{soft}}(s')\mid s,a\right]. \end{aligned} $$ 以下 $Q_{\phi_i}$ 均拟合 soft $Q$。现代双 critic SAC 无需单独的 $V$ 网络,三个核心步骤为: $$ \begin{aligned} a'&\sim\pi_\theta(\cdot\mid s'),\\ y^{\rm SAC} &=r+\gamma(1-e)\left[\min_{i=1,2}Q_{\bar\phi_i}(s',a') -\alpha\log\pi_\theta(a'\mid s')\right],\\ \mathcal L_{Q_i}(\phi_i) &=\mathbb E_{\mathcal D}\left[ \left(Q_{\phi_i}(s,a)-\operatorname{sg}(y^{\rm SAC})\right)^2\right],\\ \mathcal L_\pi(\theta) &=\mathbb E_{s\sim\mathcal D,\,a\sim\pi_\theta} \left[\alpha\log\pi_\theta(a\mid s)-\min_{i=1,2}Q_{\phi_i}(s,a)\right]. \end{aligned} $$ 随机 actor 常通过重参数化 $a=f_\theta(s,z)$、$z\sim\mathcal N(0,I)$ 获得梯度,$I$ 为单位协方差矩阵。若使用 tanh 限幅,$\log\pi$ 要包含变量变换的 Jacobian 修正。目标 critic 常用 Polyak 更新;令 $\eta_{\rm tar}\in(0,1]$ 为目标网络更新率: $$ \bar\phi_i\leftarrow(1-\eta_{\rm tar})\bar\phi_i+\eta_{\rm tar}\phi_i. $$ 可学习温度:令 $u_\alpha=\log\alpha$、$\mathcal H_{\rm target}$ 为目标熵,一个常用的 log-temperature 损失是: $$ \mathcal L_\alpha(u_\alpha) =-\mathbb E\left[u_\alpha\operatorname{sg} \left(\log\pi_\theta(a\mid s)+\mathcal H_{\rm target}\right)\right]. $$ 实际熵过低时,最小化该损失会提高 $\alpha$,鼓励探索。SAC 适合连续控制和 replay 复用;直接用于纯离线数据仍可能遭受 OOD 高估。 **原始方法:** [SAC](https://arxiv.org/abs/1801.01290)、[Algorithms and Applications](https://arxiv.org/abs/1812.05905)。**库中使用:** [DSRL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__DSRL__Steering-Your-Diffusion-Policy-with-Latent-Space-Reinforcement-Learning__arXiv-2506.15799v2.pdf) 的 **DSRL-SAC** 在生成策略的噪声/潜变量空间运行 SAC。[RLPD](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2023__RLPD__Efficient-Online-Reinforcement-Learning-with-Offline-Data__arXiv-2302.02948v4.pdf)、[HIL-SERL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2024__HIL-SERL__Precise-and-Dexterous-Robotic-Manipulation-via-Human-in-the-Loop-Reinforcement-Learning__arXiv-2410.21845v3.pdf) 属于相关 off-policy actor–critic 路线,但具体 entropy backup 有变体,不能把标准 SAC 的每一项直接套上去。 ## 7. Offline RL:IQL、AWR / AWAC、CQL / Cal-QL ### 7.1 IQL:Expectile value + TD critic + 加权模仿 **Implicit Q-Learning** 的价值学习不需要查询 actor 生成的分布外动作。令 $\kappa\in(0,1)$ 为 expectile 参数,通常 $\kappa>0.5$;令 $\delta_{\rm exp}$ 为 expectile 回归残差,定义不对称平方损失: $$ \rho_\kappa(\delta_{\rm exp})=|\kappa-\mathbf1[\delta_{\rm exp}<0]|\delta_{\rm exp}^2. $$ 正残差 $Q-V>0$ 的权重为 $\kappa$,负残差的权重为 $1-\kappa$,因此 $V$ 偏向数据中较好的动作价值。IQL 三步如下: $$ \begin{aligned} \mathcal L_V(\psi) &=\mathbb E_{(s,a)\sim\mathcal D} \left[\rho_\kappa\left(\operatorname{sg}(Q_{\bar\phi}(s,a))-V_\psi(s)\right)\right],\\ y^{\rm IQL}&=r+\gamma(1-e)V_\psi(s'),\\ \mathcal L_Q(\phi) &=\mathbb E_{\mathcal D} \left[\left(Q_\phi(s,a)-\operatorname{sg}(y^{\rm IQL})\right)^2\right]. \end{aligned} $$ 这里 $Q_{\bar\phi}$ 可取双 Q 的较小值。定义用于策略提取的分数 $\widehat A^{\rm IQL}=Q_{\bar\phi}(s,a)-V_\psi(s)$;$\beta_{\rm AWR}>0$ 为优势温度,$w_{\max}>0$ 为可选权重上限: $$ \begin{aligned} w(s,a)&=\min\left(w_{\max},\exp\left(\widehat A^{\rm IQL}(s,a)/\beta_{\rm AWR}\right)\right),\\ \mathcal L_\pi(\theta) &=-\mathbb E_{(s,a)\sim\mathcal D} \left[\operatorname{sg}(w(s,a))\log\pi_\theta(a\mid s)\right]. \end{aligned} $$ 这是“好动作多学、差动作少学”的加权 BC。某些论文用逆温度写成 $\exp(\beta\widehat A)$;本笔记统一采用除以温度的写法。 **注意:** $V_\psi$ 是数据动作 $Q$ 的上 expectile,通常不是 $\mathbb E_{a\sim\mu}Q(s,a)$;因此 $\widehat A^{\rm IQL}$ 也不满足第 2 节关于 $A^\pi$ 的所有恒等式。IQL 避开了价值目标中的 OOD 动作查询,但不保证有限数据与函数逼近下完全消除外推误差。 **原始方法:** [IQL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2021__IQL__Offline-Reinforcement-Learning-with-Implicit-Q-Learning__arXiv-2110.06169v1.pdf)。**库中继承:** [BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf) 离线阶段用 IQL 式 critic,但 actor 为 masked clipping + BC;[Q-VGM](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Q-VGM__Q-Guided-Value-Gradient-Matching-for-Offline-to-Online-RL-of-Flow-Matching-VLA-Policies__arXiv-2606.08015v5.pdf) 离线 critic 用 IQL bootstrap,actor 为速度场更新。两者都不能简写为“完整使用 IQL 的三个 loss”。 ### 7.2 AWR / AWAC:为什么会出现 exp(Advantage) 固定一个状态与动作打分函数 $Q(s,a)$,设 $\mu(a\mid s)$ 为有足够支持的参考行为分布;$q(a\mid s)$ 为待求的新动作分布,$\beta_{\rm KL}>0$ 为约束强度。定义 $D_{\rm KL}(q\|\mu)=\mathbb E_{a\sim q}\log[q(a\mid s)/\mu(a\mid s)]$。考虑**单状态、固定 Q** 的优化: $$ \max_q\left\{ \mathbb E_{a\sim q}Q(s,a)-\beta_{\rm KL}D_{\rm KL}(q\|\mu) \right\},\qquad \int q(a\mid s)\,da=1. $$ 拉格朗日一阶条件给出: $$ q^*(a\mid s)=\frac{\mu(a\mid s)\exp(Q(s,a)/\beta_{\rm KL})}{Z(s)}, \qquad Z(s)=\int\mu(a\mid s)\exp(Q(s,a)/\beta_{\rm KL})\,da. $$ 减去任何仅依赖状态的 baseline,都会在归一化时抵消,所以也可写成与 $\mu\exp(A/\beta_{\rm KL})$ 成正比。用参数化策略拟合这个改进分布,就得到优势加权回归。严格投影包含状态相关的 $Z(s)$;很多实用版本省略它或归一化/裁剪样本权重。 **AWR** 用优势加权监督学习更新策略;**AWAC** 将这种 actor 更新与 off-policy Q 学习结合,面向离线数据预训练后快速在线微调;**IQL** 借用相近的策略提取形式,但 critic 的 expectile 构造不同。[AWR](https://arxiv.org/abs/1910.00177)、[AWAC](https://arxiv.org/abs/2006.09359);库中 [IQL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2021__IQL__Offline-Reinforcement-Learning-with-Implicit-Q-Learning__arXiv-2110.06169v1.pdf) 是理解这种 actor 的直接入口。 上面的闭式解是固定 $s,Q$ 的局部优化,不是“一次指数加权就精确解出了整个机器人任务的最优策略”。 ### 7.3 CQL:压低数据外动作的 Q **Conservative Q-Learning** 在 Bellman 回归上加入保守正则。令 $\beta_{\rm CQL}>0$ 为其强度,$\mathcal L_{\rm TD}$ 为普通 critic 的平方 TD 损失;离散动作下的典型形式是: $$ \mathcal L_Q^{\rm CQL} =\mathcal L_{\rm TD} +\beta_{\rm CQL}\left[ \mathbb E_{s\sim\mathcal D}\log\sum_{a\in\mathcal A}\exp Q_\phi(s,a) -\mathbb E_{(s,a)\sim\mathcal D}Q_\phi(s,a) \right]. $$ 第一项倾向压低整体动作价值,第二项保留数据动作的相对价值。连续动作要用积分及采样/重要性估计,不能枚举全部关节动作。保守性有助于离线学习,但过强的悲观估计可能阻碍在线探索。[CQL 原论文](https://arxiv.org/abs/2006.04779)。 ### 7.4 Cal-QL:对保守价值进行标定 **Calibrated Q-Learning** 处理从离线到在线时过于保守、价值尺度不合适的问题。令 $V^{\rm ref}(s)$ 为参考行为价值,$a^\pi$ 为当前策略采样的动作。[CO-RFT](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__CO-RFT__Efficient-Fine-Tuning-of-Vision-Language-Action-Models-through-Chunked-Offline-Reinforce__arXiv-2508.02219v1.pdf) 使用的一个校准正则核心写作: $$ \mathcal R_{\rm Cal}(\phi) =\mathbb E_{s\sim\mathcal D,\,a^\pi\sim\pi} \left[\max\left(Q_\phi(s,a^\pi),V^{\rm ref}(s)\right)\right] -\mathbb E_{(s,a)\sim\mathcal D}Q_\phi(s,a). $$ 将 $\beta_{\rm Cal}\mathcal R_{\rm Cal}$ 加到 TD 损失,其中 $\beta_{\rm Cal}>0$。当某个策略动作的 $Q$ 已低于参考价值时,第一项不再通过它继续向下施压。这个校准并不是对整个神经网络所有输出强制实施硬下界;完整 Cal-QL 的采样与保守项形式见 [Cal-QL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2023__Cal-QL__Calibrated-Offline-RL-Pre-Training-for-Efficient-Online-Fine-Tuning__arXiv-2303.05479v4.pdf)。 **库中使用:** [CO-RFT](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__CO-RFT__Efficient-Fine-Tuning-of-Vision-Language-Action-Models-through-Chunked-Offline-Reinforce__arXiv-2508.02219v1.pdf) 将 Cal-QL 扩展到动作块,做 **offline VLA post-training**。Cal-QL 原方法可用于 offline-to-online,并不意味着 CO-RFT 这篇也做了在线 RL。不要把 CO-RFT 记成 IQL。 ## 8. PPO、RLOO、GRPO:通过采样回报改善策略 ### 8.1 PPO:概率比值 + Clipping 用 $\pi_{\rm old}$ 收集一批 rollout,估计并冻结 $\widehat A_t$(通常为 GAE);定义概率比 $w_t(\theta)$、裁剪阈值 $\epsilon_{\rm clip}>0$,以及把数值限制在下界 $l_{\rm clip}$、上界 $u_{\rm clip}$ 之间的函数 $\operatorname{clip}(x,l_{\rm clip},u_{\rm clip})$: $$ w_t(\theta)=\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\rm old}(a_t\mid s_t)}, $$ $$ \mathcal S_{\rm PPO}(\theta) =\mathbb E_{\rm rollout}\left[ \min\left( w_t(\theta)\widehat A_t, \operatorname{clip}(w_t(\theta),1-\epsilon_{\rm clip},1+\epsilon_{\rm clip})\widehat A_t \right)\right]. $$ 令 $c_V,c_H\ge0$ 分别为价值损失与熵奖励系数,一个常用的联合最小化目标为: $$ \mathcal L_{\rm PPO}(\theta,\psi) =-\mathcal S_{\rm PPO}(\theta) +c_V\mathbb E\left[(V_\psi(s_t)-\widehat V_t^{\rm target})^2\right] -c_H\mathbb E\mathcal H(\pi_\theta(\cdot\mid s_t)). $$ 若 $\widehat A_t>0$,继续增大“好动作”概率的收益在上侧被截平;若 $\widehat A_t<0$,继续减小“坏动作”概率的收益在下侧被截平。**Clipping 裁剪的是 surrogate 的收益,不是把所有概率比/KL 硬性限制在区间内。** 因此仍可配合 KL 监控与提前停止。 PPO 通常每轮采新数据,在该批数据上做若干次更新后刷新 rollout,属于常见 on-policy 路线。**TRPO** 则显式使用平均 KL 约束来构造 trust region;PPO 是更便于一阶优化的近似路线。[PPO](https://arxiv.org/abs/1707.06347)、[TRPO](https://arxiv.org/abs/1502.05477)。 **库中使用:** [VLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__VLA-RL__Towards-Masterful-and-General-Robotic-Manipulation-with-Scalable-Reinforcement-Learning__arXiv-2505.18719v1.pdf) 明确采用 PPO + GAE + learned value critic;[SENTINEL](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/02_%E4%BB%BB%E5%8A%A1%E8%AF%AD%E8%A8%80%E5%88%B0%E5%8A%A8%E4%BD%9C%E6%8E%A5%E5%8F%A3/2025__SENTINEL__A-Fully-End-to-End-Language-Action-Model-for-Humanoid-Whole-Body-Control__arXiv-2511.19236v1.pdf) 用于 residual 策略;[HumanPlus](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2024__HumanPlus__Humanoid-Shadowing-and-Imitation-from-Humans__arXiv-2406.10454v1.pdf) 的低层 humanoid 控制使用 PPO,高层技能学习另属模仿学习。[BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf) 的离线 actor 虽含 PPO-style clip,因使用固定演示数据和专门掩码,不能据此归为标准 on-policy PPO。 ### 8.2 RLOO / GRPO:不训练价值网络也能估计优势 对相同任务/初始条件采样 $K\ge2$ 条轨迹。令 $R_i$ 为第 $i$ 条轨迹的总回报,$\bar R=K^{-1}\sum_{j=1}^KR_j$,$s_R=\sqrt{K^{-1}\sum_j(R_j-\bar R)^2}$ 为组内标准差;$\varepsilon_{\rm num}>0$ 防止除零。 **RLOO(REINFORCE Leave-One-Out)** 用其他轨迹平均回报作为 baseline: $$ b_i^{\rm LOO}=\frac{1}{K-1}\sum_{j\ne i}R_j, \qquad \widehat A_i^{\rm RLOO}=R_i-b_i^{\rm LOO}. $$ **GRPO(Group Relative Policy Optimization)** 常用组内归一化分数: $$ \widehat A_i^{\rm GRPO}=\frac{R_i-\bar R}{s_R+\varepsilon_{\rm num}}. $$ 再把这些轨迹级分数送入 policy-gradient/PPO-style clipped objective,按论文定义分配给动作或 token;可另加参考策略 KL。它们无需 learned value critic,但需要多次 rollout,回报相同时可能没有有效区分信号。组内分数不是每个机器人状态真实 $A^\pi(s_t,a_t)$ 的精确估计。 **库中对应:** [RIPT-VLA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__RIPT-VLA__Interactive-Post-Training-for-Vision-Language-Action-Models__arXiv-2505.17016v1.pdf) 的 LOOP 使用 **RLOO + PPO clipping**;[SimpleVLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__SimpleVLA-RL__Scaling-VLA-Training-via-Reinforcement-Learning__arXiv-2509.09674v1.pdf) 使用 **GRPO**,不要记成 learned-critic PPO;[FetchMan](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/02_%E4%BB%BB%E5%8A%A1%E8%AF%AD%E8%A8%80%E5%88%B0%E5%8A%A8%E4%BD%9C%E6%8E%A5%E5%8F%A3/2026__FetchMan__Learning-Visual-Humanoid-Loco-Manipulation-Policies-from-Simulated-Experiences__arXiv-2608.17027v2.pdf) 采用 **Flow-GRPO** 的扩展,动作分布/flow 的处理需看其具体构造。 动作 token 的 log-probability 与环境动作的 log-probability 要区分:自回归动作序列的联合 log-probability 是各 token 条件 log-probability 之和,但把每个 token 视作独立环境步会改变时域与归因。 ## 9. RLPD、REDQ 与 Human-in-the-loop **RLPD(RL with Prior Data)** 把演示/已有离线数据与新交互数据混合,用高样本效率的 off-policy actor–critic 学习。令 $\zeta\in[0,1]$ 为 batch 中离线样本比例;采样分布记为: $$ \mathcal D_{\rm mix}=\zeta\mathcal D_{\rm off}+(1-\zeta)\mathcal D_{\rm on}. $$ 这里是**采样分布的混合**,不是数值相加两个文件集合。[RLPD](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2023__RLPD__Efficient-Online-Reinforcement-Learning-with-Offline-Data__arXiv-2302.02948v4.pdf) 的典型设置等量混合 prior 与 online 数据;配合 critic ensemble、较高 update-to-data ratio 等设计。UTD 定义为每新增一个环境样本所做的梯度更新次数;高 UTD 能多用数据,也更需要控制过拟合和价值误差。[REDQ](https://arxiv.org/abs/2101.05982) 是理解 ensemble 与高 UTD 的相关基础。 **[HIL-SERL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2024__HIL-SERL__Precise-and-Dexterous-Robotic-Manipulation-via-Human-in-the-Loop-Reinforcement-Learning__arXiv-2410.21845v3.pdf)** 使用 RLPD 路线,将 demonstrations、在线自主数据和人工接管数据接入训练,并学习任务奖励分类器。其正文的 critic backup 未写 SAC 的 entropy 项,而 actor 含熵奖励;因此准确说法是 **RLPD / SAC-family 变体**,不能直接声称其 critic 完全等于第 6.3 节标准 SAC。 **[BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf)** 先离线训练 VLA 与 critic,再冻结 VLA,在线训练动作块 residual,并用 RLPD 混合 replay;还利用接管与恢复信号。它体现了“offline critic 初始化 → online off-policy residual”的路线。 Human-in-the-loop 只是数据/交互机制,不限定算法。人工纠正动作可以用于 BC,也可以进入 RL replay;只有纠正数据监督训练、没有 reward/value 改善目标时,应归为交互式模仿学习。[Hand-in-the-Loop](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2026__Hand-in-the-Loop__Improving-VLA-Policies-for-Dexterous-Manipulation-via-Seamless-Hand-Arm-Interv__arXiv-2605.15157v2.pdf) 属于后者,不能因持续采数据就称为 online RL。 ## 10. RECAP:MC 价值学习 + Advantage-conditioned Policy **RECAP = RL with Experience and Corrections via Advantage-conditioned Policies**,是 [π*0.6 / RECAP](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__pi-star-0.6-RECAP__pi-0-6-a-VLA-That-Learns-From-Experience__arXiv-2511.14759v2.pdf) 的核心方法。它通过自主执行、任务结果标签和可选人工纠正反复改进 VLA。 ### 10.1 用完整轨迹训练分布式 V 该论文取有限任务中的 $\gamma=1$,奖励结合每步代价与失败惩罚,并按任务归一化回报。以下统一记归一化后的 MC 标签为 $\widetilde G_t$。令 $B$ 为价值区间数、$v_1,\ldots,v_B$ 为区间代表值,$b(x)$ 为把数值映射到区间编号的函数;价值网络输出概率 $p_\psi(j\mid s,\ell)$,$j\in\{1,\ldots,B\}$: $$ \mathcal L_V^{\rm RECAP}(\psi) =-\mathbb E_{\mathcal D}\log p_\psi\left(b(\widetilde G_t)\mid s_t,\ell\right), \qquad \widehat V_\psi(s,\ell)=\sum_{j=1}^{B}v_jp_\psi(j\mid s,\ell). $$ 论文使用 $B=201$。这里是 **对 MC return 分桶做分类回归**,不是 IQL expectile,也不是 SAC 的 TD critic。$\pi_{\rm ref}$ 表示累计数据隐含的参考行为混合,包含演示、人类纠正与不同阶段的机器人策略;原文用其价值解释上述估计。 ### 10.2 从价值生成“较好动作”标签 令 $n$ 为优势估计使用的步数;$\widetilde r_t$ 表示与价值标签采用相同任务尺度的奖励,$\epsilon_\ell$ 为任务相关阈值,$I_t$ 为二值 improvement indicator: $$ \widehat A_t^{\rm RECAP} =\sum_{j=0}^{n-1}\gamma^jM_{t,j}\widetilde r_{t+j} +\gamma^nM_{t,n}\widehat V_\psi(s_{t+n},\ell) -\widehat V_\psi(s_t,\ell), \qquad I_t=\mathbf1[\widehat A_t^{\rm RECAP}>\epsilon_\ell]. $$ 此式统一了终止掩码与时间编号;原论文取 $\gamma=1$。实现时必须确保 reward 与 $V$ 的归一化尺度一致;若用了仿射平移,需处理相应边界项,不能直接把原始 reward 与归一化 $V$ 相加。论文将人工纠正样本标为 $I=1$,相当于相信这些纠正有改进作用。 ### 10.3 用条件建模提取策略 令 $\beta_{\rm cond}\ge0$ 为条件项权重。理想化、可计算动作密度时的目标是: $$ \mathcal L_\pi^{\rm RECAP}(\theta) =-\mathbb E_{(s,a,\ell,I)\sim\mathcal D} \left[\log\pi_\theta(a\mid s,\ell) +\beta_{\rm cond}\log\pi_\theta(a\mid s,\ell,I)\right]. $$ 训练同时学习无条件与 indicator 条件分布;执行时令 $I=1$。Bayes 公式说明其机制: $$ \pi_{\rm ref}(a\mid s,\ell,I=1) =\frac{\pi_{\rm ref}(a\mid s,\ell)\Pr(I=1\mid s,a,\ell)} {\Pr(I=1\mid s,\ell)}. $$ 它提高“被判为改进”的动作在条件分布中的概率。与 IQL / AWR 的区别是:**优势成为输入条件/标签,而非只变成每个样本的指数 loss 权重。** 与 PPO 的区别是:**不依靠 old-policy probability ratio 的 clipped objective。** 实际 π*0.6 同时有离散输出与连续 flow 动作,连续部分用 **条件 flow matching** 实现上述策略建模思想,不能把理想化 $-\log\pi$ 原样当成已可精确计算的 flow loss。数据增长后重训价值和条件策略,形成迭代改进。参考原文 §IV–V,而非只看算法名字。 ## 11. 生成式 VLA 的 RL:关键是 Actor 怎样接收改进信号 ### 11.1 BC / ACT 与 Flow Matching 的基础目标 对于可计算动作密度的策略,behavior cloning 为 $\mathcal L_{\rm BC}=-\mathbb E_{(s,a)\sim\mathcal D}\log\pi_\theta(a\mid s)$。[ACT / ALOHA](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2023__ACT-ALOHA__Learning-Fine-Grained-Bimanual-Manipulation-with-Low-Cost-Hardware__arXiv-2304.13705v1.pdf) 用条件 VAE 与动作块模仿学习;[Diffusion-Policy](../05_VLA%E4%B8%8E%E7%94%9F%E6%88%90%E7%AD%96%E7%95%A5%E5%9F%BA%E7%A1%80/2023__Diffusion-Policy__Visuomotor-Policy-Learning-via-Action-Diffusion__arXiv-2303.04137v5.pdf) 用去噪生成动作。它们是策略建模/模仿学习基础,本身不等于 RL。 为解释 flow,令 $H$ 为动作块长度、$d_a$ 为单步动作维度,$U\in\mathbb R^{H\times d_a}$ 为实数动作块;$z\sim\mathcal N(0,I)$ 为同维高斯噪声,$u\in[0,1]$ 为**生成过程时间**,与环境时间 $t$ 区分;$v_\nu$ 为参数为 $\nu$ 的速度网络。以线性路径为例: $$ y_u=(1-u)z+uU,\qquad \mathcal L_{\rm FM}(\nu) =\mathbb E_{(s,U)\sim\mathcal D,\,z,\,u\sim\operatorname{Unif}[0,1]} \left[\|v_\nu(y_u,u,s)-(U-z)\|_2^2\right]. $$ $\operatorname{Unif}[0,1]$ 表示区间均匀采样;范数对动作块展平后计算。推理积分 $dy_u/du=v_\nu(y_u,u,s)$,从 $y_0=z$ 到 $y_1$;记整个生成映射为 $F_\nu(s,z)=y_1$。[π0](../05_VLA%E4%B8%8E%E7%94%9F%E6%88%90%E7%AD%96%E7%95%A5%E5%9F%BA%E7%A1%80/2024__pi-0__A-Vision-Language-Action-Flow-Model-for-General-Robot-Control__arXiv-2410.24164v4.pdf) 是库中基础入口。 多峰、长动作块有利于表示灵巧操作,但也使 RL 接口变复杂:最终动作的精确 $\log\pi$ 往往不易得到;把 $Q$ 的梯度穿过整个采样器会增加成本。**Flow matching 的平方损失不恒等于精确负 log-likelihood。** ### 11.2 Q 引导、约束与蒸馏 **FQL。** [FQL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__FQL__Flow-Q-Learning__arXiv-2502.02538v2.pdf) 分开训练 BC flow $F_\nu$ 与一步 actor $f_\theta(s,z)$。令 $\beta_{\rm dist}>0$ 为蒸馏权重: $$ \mathcal L_\pi^{\rm FQL}(\theta) =\mathbb E_{s\sim\mathcal D,z} \left[-Q_\phi(s,f_\theta(s,z)) +\beta_{\rm dist}\|f_\theta(s,z)-\operatorname{sg}(F_\nu(s,z))\|_2^2\right]. $$ 两个 actor 使用同一个 $z$ 对齐生成结果。critic 用当前一步 actor 采样下一动作做 TD;RL 梯度不需要穿过整条 BC flow 的 ODE 求解。 **RL Token。** [RL Token](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__RL-Token__Bootstrapping-Online-RL-with-Vision-Language-Action-Models__arXiv-2604.23073v2.pdf) 压缩冻结 VLA 的视觉语言前缀;令 $x$ 为压缩 token 与本体感觉组成的输入,$\widetilde U$ 为冻结 VLA 的参考动作块,$f_\theta(x,\widetilde U)$ 为 actor 均值,$\sigma>0$ 为固定标准差: $$ \pi_\theta(U\mid x,\widetilde U) =\mathcal N\left(f_\theta(x,\widetilde U),\sigma^2I\right), $$ $$ \mathcal L_\pi^{\rm RLToken}(\theta) =\mathbb E\left[-Q_\phi(x,U)+\beta_{\rm ref}\|U-\widetilde U\|_2^2\right], \quad U\sim\pi_\theta(\cdot\mid x,\widetilde U),\quad \beta_{\rm ref}>0. $$ 其 critic 使用 TD3-style chunk TD;actor 既追求高 $Q$,又被参考动作约束。参考动作是 actor 的条件输入,不能把论文粗略写成“在原 VLA 上跑标准 SAC”。 **Q-VGM。** [Q-VGM](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Q-VGM__Q-Guided-Value-Gradient-Matching-for-Offline-to-Online-RL-of-Flow-Matching-VLA-Policies__arXiv-2606.08015v5.pdf) 离线用 IQL 式 critic,在线切换到 policy-sampled TD;actor 用 Q 改善的终点构造**局部、靠近去噪末端的速度目标**,以局部回归更新速度场,避免对完整生成链做 RL 反传。应分别阅读其 critic 与 actor,不能因 critic 用了 IQL 就把 actor 也写成加权 BC。 **BORA。** [BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf) 离线 actor 是 validity-masked clipped surrogate 与 BC 的组合;在线冻结基础 VLA,用 RLPD 学习 residual。概念上,令 $\Delta U_\theta$ 为学到的修正块:$U_{\rm exec}=U_{\rm base}+\Delta U_\theta$。实际还需遵守动作归一化、限幅和控制接口。 ### 11.3 其他生成策略 RL 方法速查 | 方法/本地论文 | 改进信号如何进入生成策略 | 与基础算法的关系 | |---|---|---| | [DSRL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__DSRL__Steering-Your-Diffusion-Policy-with-Latent-Space-Reinforcement-Learning__arXiv-2506.15799v2.pdf) | 冻结生成式动作解码器,优化输入噪声/潜变量的策略 | DSRL-SAC 在潜变量空间用 SAC;DSRL-NA 是另一变体,不应合称一个 SAC loss | | [DPPO](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2024__DPPO__Diffusion-Policy-Policy-Optimization__arXiv-2409.00588v3.pdf) | 将去噪过程构造成扩展 MDP,对去噪转移执行策略优化 | PPO;使用去噪步骤的条件密度,不等于直接获得最终动作边缘密度 | | [ReinFlow](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__ReinFlow__Fine-tuning-Flow-Matching-Policy-with-Online-Reinforcement-Learning__arXiv-2505.22094v7.pdf) | 给 flow 引入可学习随机性,形成可计算转移概率的随机过程 | 将 flow 接入 policy-gradient / PPO 路线 | | [FPO](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__FPO__Flow-Matching-Policy-Gradients__arXiv-2507.21053v2.pdf) | 用 flow-matching loss 构造 PPO-inspired surrogate | on-policy;使用似然替代量,不能写成“FM loss 就是精确 log-prob” | | [RL-100](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2025__RL-100__Performant-Robotic-Manipulation-with-Real-World-Reinforcement-Learning__arXiv-2510.14830v4.pdf) | diffusion policy 的 RL 优化与 consistency distillation 结合 | 去噪层面的 clipped PPO;离线阶段用 IQL 优势,在线阶段用 GAE;其“迭代离线”会在轮次间增添 rollout | | [EFM-QIPO](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__EFM-QIPO__Energy-Weighted-Flow-Matching-for-Offline-Reinforcement-Learning__arXiv-2503.04975v1.pdf) | 以价值/能量对 flow matching 加权,做离线策略改进 | 更接近价值引导的生成模型拟合;看能量与权重如何由 critic 构造 | | [Learning-While-Deploying](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Learning-While-Deploying__Fleet-Scale-Reinforcement-Learning-for-Generalist-Robot-Policies__arXiv-2605.00416v4.pdf) | DIVL 学分布式价值,QAM 用 adjoint matching 提取 flow 策略 | 多步、分位数 bootstrap + Q 引导;不能因“分布式 V”就归为 RECAP 的 MC 训练 | ## 12. 动作块、双臂与人形控制:公式如何落到机器人上 ### 12.1 Chunk Q 与环境时钟 令 $H$ 为预测长度、$C\le H$ 为本次实际连续执行的步数。记 $\widehat U_t^{(H)}$ 为预测块、$U_t^{(C)}=(a_t,\ldots,a_{t+C-1})$ 为**实际执行的块**;只有全部执行且没有中途改动时,二者才相同。定义折扣块奖励和块终止掩码: $$ R_t^{(C)}=\sum_{j=0}^{C-1}\gamma^jM_{t,j}r_{t+j}, \qquad m_t^{(C)}=M_{t,C}. $$ 将 $C$ 步视为一个决策转移,价值目标为: $$ \begin{aligned} y_{t,\rm IQL}^{(C)} &=R_t^{(C)}+\gamma^C m_t^{(C)}V_\psi(s_{t+C}),\\ y_{t,\pi}^{(C)} &=R_t^{(C)}+\gamma^C m_t^{(C)} \mathbb E_{U'\sim\pi(\cdot\mid s_{t+C})}Q_{\bar\phi}(s_{t+C},U'). \end{aligned} $$ 这里 $Q(s,U)$ 的含义是承诺执行该块后再遵循后续策略;若机器人在块中途重规划、人工覆盖动作,训练必须记录并处理真实执行过程。不能用未执行的 $H$ 步预测去配 $H$ 步奖励;也不能一边用 $C$ 步奖励,一边仍只乘一步折扣 $\gamma$,除非已把该 $\gamma$ 重新定义为每块折扣。 [Q-Chunking](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__Q-Chunking__Reinforcement-Learning-with-Action-Chunking__arXiv-2507.07969v4.pdf)、[Adaptive-Q-Chunking](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2026__Adaptive-Q-Chunking__for-Offline-to-Online-Reinforcement-Learning__arXiv-2605.05544v1.pdf) 是这一主题的入口;[CO-RFT](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__CO-RFT__Efficient-Fine-Tuning-of-Vision-Language-Action-Models-through-Chunked-Offline-Reinforce__arXiv-2508.02219v1.pdf)、[RL Token](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__RL-Token__Bootstrapping-Online-RL-with-Vision-Language-Action-Models__arXiv-2604.23073v2.pdf)、[BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf)、[Q-VGM](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Q-VGM__Q-Guided-Value-Gradient-Matching-for-Offline-to-Online-RL-of-Flow-Matching-VLA-Policies__arXiv-2606.08015v5.pdf) 将 chunk critic 用到 VLA 后训练。可变块长度时,还要处理不同时间尺度的价值/优势可比性。 ### 12.2 结构设计与 RL 算法是不同层面的选择 | 研究方向 | 阅读时要明确的对象 | 与本笔记的连接 | |---|---|---| | 双臂 + 灵巧手 VLA | 动作是末端位姿还是所有手臂/手指关节?双臂是否联合输出?手是夹爪还是多自由度手? | 高维、多峰策略需要合理动作表示;Q/优势必须评价同一实际动作接口 | | Offline → Online | 哪些参数在线更新:整个 VLA、action head、latent policy,还是 residual?是否继承 critic? | IQL / Cal-QL 解决离线价值学习;SAC / RLPD 等承担在线更新;actor 接口可另选 | | Humanoid + ACT | ACT 控制上肢还是全身?是否另有 locomotion/tracking controller?任务语言是否进入最终动作策略? | ACT 是动作块模仿学习架构;低层用了 PPO 不代表高层 ACT 也用了 RL | | 真正端到端任务执行 | 从任务、视觉、本体感觉到关节目标的完整路径;奖励归因与训练梯度到哪里为止? | “端到端推理”“联合训练”“无独立运动控制器”是不同主张,应分别核验 | [HumanPlus](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2024__HumanPlus__Humanoid-Shadowing-and-Imitation-from-Humans__arXiv-2406.10454v1.pdf) 等工作应按高层技能与低层控制分别记录;任务级策略输出关节目标依然通常由底层伺服执行。价值学习算法本身不决定是否端到端。 ## 13. 方法—论文对应总表与补充方法 ### 13.1 本地论文的实际用法 “使用”表示该文方法的一部分;“继承”表示只借用了相应组件。列入参考文献或作为 baseline,不足以支持“该论文使用此算法”的归类。 | 方法 | 数据/更新范式 | 库中实际对应与边界 | |---|---|---| | PPO + GAE | 通常 online on-policy | [VLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__VLA-RL__Towards-Masterful-and-General-Robotic-Manipulation-with-Scalable-Reinforcement-Learning__arXiv-2505.18719v1.pdf);[SENTINEL](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/02_%E4%BB%BB%E5%8A%A1%E8%AF%AD%E8%A8%80%E5%88%B0%E5%8A%A8%E4%BD%9C%E6%8E%A5%E5%8F%A3/2025__SENTINEL__A-Fully-End-to-End-Language-Action-Model-for-Humanoid-Whole-Body-Control__arXiv-2511.19236v1.pdf) 的 residual;[HumanPlus](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2024__HumanPlus__Humanoid-Shadowing-and-Imitation-from-Humans__arXiv-2406.10454v1.pdf) 的低层控制 | | PPO-style 离线目标 | offline,专门的行为约束/掩码 | [BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf) 离线 actor;不是标准 on-policy PPO | | GRPO / Flow-GRPO | rollout 的组相对优化 | [SimpleVLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__SimpleVLA-RL__Scaling-VLA-Training-via-Reinforcement-Learning__arXiv-2509.09674v1.pdf) / [FetchMan](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/02_%E4%BB%BB%E5%8A%A1%E8%AF%AD%E8%A8%80%E5%88%B0%E5%8A%A8%E4%BD%9C%E6%8E%A5%E5%8F%A3/2026__FetchMan__Learning-Visual-Humanoid-Loco-Manipulation-Policies-from-Simulated-Experiences__arXiv-2608.17027v2.pdf) | | RLOO + clipping | rollout、无 learned value critic | [RIPT-VLA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__RIPT-VLA__Interactive-Post-Training-for-Vision-Language-Action-Models__arXiv-2505.17016v1.pdf) 的 LOOP | | SAC | online off-policy | [DSRL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__DSRL__Steering-Your-Diffusion-Policy-with-Latent-Space-Reinforcement-Learning__arXiv-2506.15799v2.pdf) 中 DSRL-SAC;作用于 latent noise policy | | TD3-style chunk critic | online off-policy | [RL Token](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__RL-Token__Bootstrapping-Online-RL-with-Vision-Language-Action-Models__arXiv-2604.23073v2.pdf),actor 另有参考动作约束 | | IQL | offline,可接在线微调 | [IQL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2021__IQL__Offline-Reinforcement-Learning-with-Implicit-Q-Learning__arXiv-2110.06169v1.pdf) 原法;[BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf)、[Q-VGM](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Q-VGM__Q-Guided-Value-Gradient-Matching-for-Offline-to-Online-RL-of-Flow-Matching-VLA-Policies__arXiv-2606.08015v5.pdf) **继承 critic**;[RL-100](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2025__RL-100__Performant-Robotic-Manipulation-with-Real-World-Reinforcement-Learning__arXiv-2510.14830v4.pdf) 离线阶段用 IQL 优势,actor 均有不同设计 | | CQL → Cal-QL | offline / offline-to-online | [Cal-QL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2023__Cal-QL__Calibrated-Offline-RL-Pre-Training-for-Efficient-Online-Fine-Tuning__arXiv-2303.05479v4.pdf) 原法;[CO-RFT](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__CO-RFT__Efficient-Fine-Tuning-of-Vision-Language-Action-Models-through-Chunked-Offline-Reinforce__arXiv-2508.02219v1.pdf) 使用 chunked Cal-QL 做离线训练 | | RLPD | online off-policy + prior replay | [RLPD](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2023__RLPD__Efficient-Online-Reinforcement-Learning-with-Offline-Data__arXiv-2302.02948v4.pdf);[HIL-SERL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2024__HIL-SERL__Precise-and-Dexterous-Robotic-Manipulation-via-Human-in-the-Loop-Reinforcement-Learning__arXiv-2410.21845v3.pdf);[BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf) 在线 residual | | MC distributional V + 优势条件策略 | 累计数据上训练,交互后迭代 | [π*0.6 / RECAP](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__pi-star-0.6-RECAP__pi-0-6-a-VLA-That-Learns-From-Experience__arXiv-2511.14759v2.pdf);不能强行归为标准 PPO 或 SAC | | Q 引导 flow | 依方法而定 | [FQL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__FQL__Flow-Q-Learning__arXiv-2502.02538v2.pdf)、[Q-VGM](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Q-VGM__Q-Guided-Value-Gradient-Matching-for-Offline-to-Online-RL-of-Flow-Matching-VLA-Policies__arXiv-2606.08015v5.pdf)、[EFM-QIPO](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__EFM-QIPO__Energy-Weighted-Flow-Matching-for-Offline-Reinforcement-Learning__arXiv-2503.04975v1.pdf);actor 的 Q 梯度/加权路径不同 | | DIVL + QAM | offline-to-online/持续部署 | [Learning-While-Deploying](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Learning-While-Deploying__Fleet-Scale-Reinforcement-Learning-for-Generalist-Robot-Policies__arXiv-2605.00416v4.pdf);分布式价值与 adjoint matching | | PPO + offline supervision | online RL 配合离线监督正则 | [Offline-Supervision-VLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Offline-Supervision-VLA-RL__Leveraging-Offline-Supervision-for-Efficient-and-Generalizable-Reinforcement-Learning-in-Large__arXiv-2607.19399v1.pdf);用了离线 BC 不代表整个方法为 offline RL | | PPO + 探索机制 | online RL | [Uncertainty-Gated-Exploration](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Uncertainty-Gated-Exploration__Noise-Suppresses-Task-Collapse-in-Online-RL-Fine-Tuning-of-a-Flow__arXiv-2609.28838v1.pdf);应同时阅读其失败/局限分析 | | BC、交互式模仿、上下文适应 | 不应自动归为 RL | [ACT / ALOHA](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2023__ACT-ALOHA__Learning-Fine-Grained-Bimanual-Manipulation-with-Low-Cost-Hardware__arXiv-2304.13705v1.pdf)、[Hand-in-the-Loop](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2026__Hand-in-the-Loop__Improving-VLA-Policies-for-Dexterous-Manipulation-via-Seamless-Hand-Arm-Interv__arXiv-2605.15157v2.pdf)、[Self-Adaptive-VLA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Self-Adaptive-VLA__for-Robust-Robot-Deployment__arXiv-2609.30092v1.pdf) | ### 13.2 常见补充方法:读到时能定位即可 | 方法 | 核心思想/最小公式 | 对当前方向的用途与来源 | |---|---|---| | TD3+BC | 令 $\beta_{\rm BC}>0$,actor 最小化 $\mathbb E[-Q_\phi(s,f_\theta(s))+\beta_{\rm BC}\|f_\theta(s)-a\|_2^2]$;不同实现会归一化 Q 或调整权重 | 简单离线基线;参考动作约束与 RL Token 有直观关联,但不能因此认定 RL Token 就是 TD3+BC。[原论文](https://arxiv.org/abs/2106.06860) | | BCQ | 从行为生成模型候选动作中选择高 Q 动作,并限制修正幅度 | 了解“限制动作支持集”的离线 RL 路线。[原论文](https://arxiv.org/abs/1812.02900) | | AWR / AWAC | 优势指数加权回归;AWAC 结合 off-policy Q | 理解 IQL actor 与离线到在线行为约束。[AWR](https://arxiv.org/abs/1910.00177)、[AWAC](https://arxiv.org/abs/2006.09359) | | TRPO | 最大化局部策略收益,约束相对旧策略的平均 KL | PPO 的理论背景;机器人连续控制常见基础。[原论文](https://arxiv.org/abs/1502.05477) | | REDQ | Q ensemble、随机子集目标、高 UTD | 理解 RLPD 的数据效率和 critic 稳定化背景。[原论文](https://arxiv.org/abs/2101.05982) | | Decision Transformer | 以目标 return-to-go、状态和动作历史为条件进行序列建模 | 理解 return-conditioned policy;RECAP 条件是优势派生 indicator,二者不等价。[原论文](https://arxiv.org/abs/2106.01345) | | BC / SFT、交互式模仿 | 模仿示范动作;交互收集纠正可缓解部署分布偏移 | ACT / VLA 的起点;见 [ACT / ALOHA](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2023__ACT-ALOHA__Learning-Fine-Grained-Bimanual-Manipulation-with-Low-Cost-Hardware__arXiv-2304.13705v1.pdf)、[Hand-in-the-Loop](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2026__Hand-in-the-Loop__Improving-VLA-Policies-for-Dexterous-Manipulation-via-Seamless-Hand-Arm-Interv__arXiv-2605.15157v2.pdf),无奖励优化时不叫 RL | | 奖励建模 | 学一个评价状态/轨迹的 reward model,供训练或评价使用 | [RoboReward](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/05_%E5%A5%96%E5%8A%B1%E6%A8%A1%E5%9E%8B/2026__RoboReward__General-Purpose-Vision-Language-Reward-Models-for-Robotics__arXiv-2601.00675v2.pdf);它提供学习信号,不单独规定 actor–critic 算法 | 这里优先保留与库内 manipulation / VLA 直接相连的方法;model-based planning、世界模型 RL、多智能体信用分配另成后续笔记,不在本篇展开。 ## 14. 阅读与实验时的最小核对清单 1. **Reward 和 return 分开。** 稀疏成功奖励、每步代价、失败罚分、折扣和归一化共同决定实际优化目标。 2. **写出 critic 的完整 target。** 下一项来自 $V$、$Q$、actor 采样、数据动作、MC 还是分位数?有没有 entropy 和终止掩码? 3. **再写 actor 的 loss。** PPO ratio、加权 BC、条件建模、Q 梯度、局部速度回归,是不同的改进接口。 4. **注明行为策略与训练阶段。** Offline / online 描述数据能否增长;on-policy / off-policy 描述更新与采样策略的关系。 5. **对齐动作与时钟。** 单步、动作块、去噪步、token 步不可混用;$\gamma^C$ 与真正执行长度要一致。 6. **检查 partial observability 和干预。** 人工接管改变行为;历史观测可能影响 Markov 性;replay 必须记录真实执行动作。 7. **区分方法、变体、baseline。** 引用了 SAC 或 IQL,不等于使用完整算法;用了 clip,也不自动等于 on-policy PPO。 8. **只对可验证控制链说“端到端”。** 高层 VLA、ACT、全身 controller、关节伺服分别是什么,先画清楚输入输出。 **针对你的方向,建议首轮精读顺序:** IQL → RLPD / Cal-QL → RECAP → CO-RFT / BORA → RL Token / Q-VGM;并行读 PPO + GAE → VLA-RL → RIPT-VLA / SimpleVLA-RL。Flow 线先读 FQL,再比较 DPPO、ReinFlow、FPO。ACT / Humanoid 的网络与控制栈细节适合接着单独整理。 ## 15. 本地引用与核对版本 以下为正文实际引用的本地论文。版本对应当前整理后的 PDF;方法归类以正文方法章节为依据。外部经典算法原文已在相关小节直接链接,未假定它们全部已下载进本地库。 | 本地 PDF | 论文题目 | 核对版本/原始来源 | |---|---|---| | [VLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__VLA-RL__Towards-Masterful-and-General-Robotic-Manipulation-with-Scalable-Reinforcement-Learning__arXiv-2505.18719v1.pdf) | VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning | [2505.18719v1](https://arxiv.org/abs/2505.18719v1) | | [HIL-SERL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2024__HIL-SERL__Precise-and-Dexterous-Robotic-Manipulation-via-Human-in-the-Loop-Reinforcement-Learning__arXiv-2410.21845v3.pdf) | Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning | [2410.21845v3](https://arxiv.org/abs/2410.21845v3) | | [RL Token](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__RL-Token__Bootstrapping-Online-RL-with-Vision-Language-Action-Models__arXiv-2604.23073v2.pdf) | RL Token: Bootstrapping Online RL with Vision-Language-Action Models | [2604.23073v2](https://arxiv.org/abs/2604.23073v2) | | [DSRL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__DSRL__Steering-Your-Diffusion-Policy-with-Latent-Space-Reinforcement-Learning__arXiv-2506.15799v2.pdf) | Steering Your Diffusion Policy with Latent Space Reinforcement Learning | [2506.15799v2](https://arxiv.org/abs/2506.15799v2) | | [RLPD](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2023__RLPD__Efficient-Online-Reinforcement-Learning-with-Offline-Data__arXiv-2302.02948v4.pdf) | Efficient Online Reinforcement Learning with Offline Data | [2302.02948v4](https://arxiv.org/abs/2302.02948v4) | | [IQL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2021__IQL__Offline-Reinforcement-Learning-with-Implicit-Q-Learning__arXiv-2110.06169v1.pdf) | Offline Reinforcement Learning with Implicit Q-Learning | [2110.06169v1](https://arxiv.org/abs/2110.06169v1) | | [BORA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__BORA__Bridging-Offline-Reinforcement-Learning-and-Online-Residual-Adaptation-for-Real-World-Dext__arXiv-2605.30226v2.pdf) | BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models | [2605.30226v2](https://arxiv.org/abs/2605.30226v2) | | [Q-VGM](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Q-VGM__Q-Guided-Value-Gradient-Matching-for-Offline-to-Online-RL-of-Flow-Matching-VLA-Policies__arXiv-2606.08015v5.pdf) | Q-VGM: Q-Guided Value-Gradient Matching for Offline-to-Online RL of Flow-Matching VLA Policies | [2606.08015v5](https://arxiv.org/abs/2606.08015v5) | | [CO-RFT](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__CO-RFT__Efficient-Fine-Tuning-of-Vision-Language-Action-Models-through-Chunked-Offline-Reinforce__arXiv-2508.02219v1.pdf) | CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning | [2508.02219v1](https://arxiv.org/abs/2508.02219v1) | | [Cal-QL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2023__Cal-QL__Calibrated-Offline-RL-Pre-Training-for-Efficient-Online-Fine-Tuning__arXiv-2303.05479v4.pdf) | Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning | [2303.05479v4](https://arxiv.org/abs/2303.05479v4) | | [SENTINEL](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/02_%E4%BB%BB%E5%8A%A1%E8%AF%AD%E8%A8%80%E5%88%B0%E5%8A%A8%E4%BD%9C%E6%8E%A5%E5%8F%A3/2025__SENTINEL__A-Fully-End-to-End-Language-Action-Model-for-Humanoid-Whole-Body-Control__arXiv-2511.19236v1.pdf) | SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control | [2511.19236v1](https://arxiv.org/abs/2511.19236v1) | | [HumanPlus](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2024__HumanPlus__Humanoid-Shadowing-and-Imitation-from-Humans__arXiv-2406.10454v1.pdf) | HumanPlus: Humanoid Shadowing and Imitation from Humans | [2406.10454v1](https://arxiv.org/abs/2406.10454v1) | | [RIPT-VLA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__RIPT-VLA__Interactive-Post-Training-for-Vision-Language-Action-Models__arXiv-2505.17016v1.pdf) | Interactive Post-Training for Vision-Language-Action Models | [2505.17016v1](https://arxiv.org/abs/2505.17016v1) | | [SimpleVLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__SimpleVLA-RL__Scaling-VLA-Training-via-Reinforcement-Learning__arXiv-2509.09674v1.pdf) | SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning | [2509.09674v1](https://arxiv.org/abs/2509.09674v1) | | [FetchMan](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/02_%E4%BB%BB%E5%8A%A1%E8%AF%AD%E8%A8%80%E5%88%B0%E5%8A%A8%E4%BD%9C%E6%8E%A5%E5%8F%A3/2026__FetchMan__Learning-Visual-Humanoid-Loco-Manipulation-Policies-from-Simulated-Experiences__arXiv-2608.17027v2.pdf) | FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences | [2608.17027v2](https://arxiv.org/abs/2608.17027v2) | | [Hand-in-the-Loop](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2026__Hand-in-the-Loop__Improving-VLA-Policies-for-Dexterous-Manipulation-via-Seamless-Hand-Arm-Interv__arXiv-2605.15157v2.pdf) | Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention | [2605.15157v2](https://arxiv.org/abs/2605.15157v2) | | [π*0.6 / RECAP](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2025__pi-star-0.6-RECAP__pi-0-6-a-VLA-That-Learns-From-Experience__arXiv-2511.14759v2.pdf) | $\pi^{*}_{0.6}$: a VLA That Learns From Experience | [2511.14759v2](https://arxiv.org/abs/2511.14759v2) | | [ACT / ALOHA](../03_%E4%BA%BA%E5%BD%A2%E6%9C%BA%E5%99%A8%E4%BA%BA%E4%B8%8EACT/01_ACT%E4%B8%8E%E6%A8%A1%E4%BB%BF%E5%AD%A6%E4%B9%A0/2023__ACT-ALOHA__Learning-Fine-Grained-Bimanual-Manipulation-with-Low-Cost-Hardware__arXiv-2304.13705v1.pdf) | Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware | [2304.13705v1](https://arxiv.org/abs/2304.13705v1) | | [Diffusion-Policy](../05_VLA%E4%B8%8E%E7%94%9F%E6%88%90%E7%AD%96%E7%95%A5%E5%9F%BA%E7%A1%80/2023__Diffusion-Policy__Visuomotor-Policy-Learning-via-Action-Diffusion__arXiv-2303.04137v5.pdf) | Diffusion Policy: Visuomotor Policy Learning via Action Diffusion | [2303.04137v5](https://arxiv.org/abs/2303.04137v5) | | [π0](../05_VLA%E4%B8%8E%E7%94%9F%E6%88%90%E7%AD%96%E7%95%A5%E5%9F%BA%E7%A1%80/2024__pi-0__A-Vision-Language-Action-Flow-Model-for-General-Robot-Control__arXiv-2410.24164v4.pdf) | $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control | [2410.24164v4](https://arxiv.org/abs/2410.24164v4) | | [FQL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__FQL__Flow-Q-Learning__arXiv-2502.02538v2.pdf) | Flow Q-Learning | [2502.02538v2](https://arxiv.org/abs/2502.02538v2) | | [DPPO](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2024__DPPO__Diffusion-Policy-Policy-Optimization__arXiv-2409.00588v3.pdf) | Diffusion Policy Policy Optimization | [2409.00588v3](https://arxiv.org/abs/2409.00588v3) | | [ReinFlow](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__ReinFlow__Fine-tuning-Flow-Matching-Policy-with-Online-Reinforcement-Learning__arXiv-2505.22094v7.pdf) | ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning | [2505.22094v7](https://arxiv.org/abs/2505.22094v7) | | [FPO](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/03_Diffusion%E4%B8%8EFlow%E7%AD%96%E7%95%A5%E4%BC%98%E5%8C%96/2025__FPO__Flow-Matching-Policy-Gradients__arXiv-2507.21053v2.pdf) | Flow Matching Policy Gradients | [2507.21053v2](https://arxiv.org/abs/2507.21053v2) | | [RL-100](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/04_%E7%9C%9F%E6%9C%BA%E5%9C%A8%E7%BA%BF%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%B9%B2%E9%A2%84/2025__RL-100__Performant-Robotic-Manipulation-with-Real-World-Reinforcement-Learning__arXiv-2510.14830v4.pdf) | RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning | [2510.14830v4](https://arxiv.org/abs/2510.14830v4) | | [EFM-QIPO](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__EFM-QIPO__Energy-Weighted-Flow-Matching-for-Offline-Reinforcement-Learning__arXiv-2503.04975v1.pdf) | Energy-Weighted Flow Matching for Offline Reinforcement Learning | [2503.04975v1](https://arxiv.org/abs/2503.04975v1) | | [Learning-While-Deploying](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Learning-While-Deploying__Fleet-Scale-Reinforcement-Learning-for-Generalist-Robot-Policies__arXiv-2605.00416v4.pdf) | Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies | [2605.00416v4](https://arxiv.org/abs/2605.00416v4) | | [Q-Chunking](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2025__Q-Chunking__Reinforcement-Learning-with-Action-Chunking__arXiv-2507.07969v4.pdf) | Reinforcement Learning with Action Chunking | [2507.07969v4](https://arxiv.org/abs/2507.07969v4) | | [Adaptive-Q-Chunking](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/01_Offline%E4%B8%8EOffline-to-Online%E5%9F%BA%E7%A1%80/2026__Adaptive-Q-Chunking__for-Offline-to-Online-Reinforcement-Learning__arXiv-2605.05544v1.pdf) | Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning | [2605.05544v1](https://arxiv.org/abs/2605.05544v1) | | [Offline-Supervision-VLA-RL](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Offline-Supervision-VLA-RL__Leveraging-Offline-Supervision-for-Efficient-and-Generalizable-Reinforcement-Learning-in-Large__arXiv-2607.19399v1.pdf) | Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models | [2607.19399v1](https://arxiv.org/abs/2607.19399v1) | | [Uncertainty-Gated-Exploration](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Uncertainty-Gated-Exploration__Noise-Suppresses-Task-Collapse-in-Online-RL-Fine-Tuning-of-a-Flow__arXiv-2609.28838v1.pdf) | Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy | [2609.28838v1](https://arxiv.org/abs/2609.28838v1) | | [Self-Adaptive-VLA](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/02_VLA%E5%90%8E%E8%AE%AD%E7%BB%83/2026__Self-Adaptive-VLA__for-Robust-Robot-Deployment__arXiv-2609.30092v1.pdf) | Self-Adaptive VLA for Robust Robot Deployment | [2609.30092v1](https://arxiv.org/abs/2609.30092v1) | | [RoboReward](../02_RL%E5%90%8E%E8%AE%AD%E7%BB%83/05_%E5%A5%96%E5%8A%B1%E6%A8%A1%E5%9E%8B/2026__RoboReward__General-Purpose-Vision-Language-Reward-Models-for-Robotics__arXiv-2601.00675v2.pdf) | RoboReward: General-Purpose Vision-Language Reward Models for Robotics | [2601.00675v2](https://arxiv.org/abs/2601.00675v2) |