MARS LAB · RESEARCH READING LIBRARY

从双手操作,走向
能持续学习的全身策略。

围绕双臂灵巧手 VLA、offline / online / offline-to-online RL 后训练,以及 Humanoid + ACT,建立可追溯的阅读路径。

65篇独立论文
42篇新增下载
13篇优先精读
2026.10.02检索与核验日期

先沿问题读,再沿模型读

A

双臂 + 双灵巧手 VLA

ACT-ALOHA → pi-0 → Dexora → GR-Dexter → SkillVLA → DeCAL → T-Rex

核心区分:双夹爪、单臂灵巧手、双臂双手;技能组合、接触反应与数据规模分别解决什么问题。

最值得先精读的 13 篇

优先级表示与你研究方向的匹配度和前置作用,并非论文质量或性能排名。P0 先精读;P1 作为方法/系统支撑;P2 按实验需要选读。

#论文 / 本地 PDF为何值得读精读问题
01Dexora2026 · v1与你第一方向最直接的开源系统候选,覆盖高维双手、混合遥操作与数据质量加权。双臂/双手动作维度、仿真和真机数据比例、discriminator 权重的消融。
02GR-Dexter2025 · v2核心系统参照,硬件、双手遥操作、跨 embodiment 数据与模型共同设计。手部自由度、遮挡、长任务数据组织及跨 embodiment 数据消融。
03BORA2026 · v2与你前两个方向交集最直接:离线动作块 critic,再用真机在线残差修正。critic 是否对动作敏感、离线到在线初始化、chunk-wise residual 与人工干预。
04RL-Token2026 · v2研究 VLA 表征与轻量 actor-critic 之间的接口,有利于控制真机交互和算力成本。RL token 如何获得、动作锚定项、训练参数范围及秒级/小时级预算。
05Q-VGM2026 · v5直接以 critic 引导 flow action expert,适合与冻结主干的残差路线对照。IQL 离线 critic、在线 TD、局部 velocity target 如何绕过 denoising BPTT。
06pi-star-0.6-RECAP2025 · v2把示范、自主执行和人工纠正放进 RECAP,是理解通用 VLA 从经验改进的主线。advantage conditioning、价值估计、数据混合与吞吐量评价。
07Q-Chunking2025 · v4同时连接 ACT 的动作块与 RL 的价值学习,是三个方向的共同方法基础。chunked action space、n-step backup 的条件、连续探索与边界截断。
08HIL-SERL2024 · v3搭建实机后训练实验时最值得借鉴的系统基线之一。干预数据、奖励分类器、样本效率与 cycle time。
09ACT-ALOHA2023 · v1第三方向必读起点:动作块和 temporal ensembling,直接预测双臂关节目标。CVAE、chunk 长度、训练标签为何用 leader 而非 follower 关节位置。
10HumanPlus2024 · v1直接研究 ACT 如何改成 HIT,连接全身采集、第一视角视觉与高 DoF 操作。decoder-only、50 步目标姿态、未来视觉特征辅助损失。
11TACT2025 · v1第三方向的直接相关工作:在 ACT 中加入全身触觉,完成抱持等接触操作。TACT 模态编码、预测的人体运动命令、触觉消融与接触稳定性。
12SENTINEL2025 · v1最接近你定义的任务语义到全身低层动作,值得研究其多时尺度状态与残差后训练。29 维动作到关节目标的映射、flow action chunk、teacher 数据和 residual head。
13DeCAL2026 · v1补齐视觉遮挡后的接触反馈:理解、潜空间预测和动作专家联合建模。contact-aware gating、visual-tactile dynamics、触觉与预测模块各自贡献。

后训练论文,按更新对象比较

“用了离线数据”“可以在线部署”“有人类纠正”都不足以判定算法属于 offline-to-online RL。先检查奖励、critic、策略更新与交互阶段。

论文学习范式优化接口与你的实验关系
BORA离线 critic → 在线残差 RLcognition token + action chunk critic;冻结 VLA,在线训练 chunk residual高维灵巧手真机;最贴合前两个方向
RL-Token在线 RLVLA 提供紧凑表征与动作先验,训练轻量 actor-critic先看 token 训练、在线参数范围及锚定损失
Q-VGM离线 IQL → 在线 TDcritic 指导 flow action expert 的局部 velocity matching与冻结 base 的残差路线做同预算对照;读 v5
QGF离线训练 + 推理时策略改进BC Flow 与 critic 分开训练;以近似干净动作处的 Q 梯度引导去噪,冻结策略参数对照 Q-VGM 的训练时 action-expert 更新;OGBench 仿真,VLA / 双手真机迁移待验证
pi-star-0.6-RECAP离线预训练 + 部署迭代优势条件策略,混合示范、自主轨迹与纠正数据研究多任务能力与持续改进,不简化为 PPO
DSRL在线 RL优化 diffusion 的 latent noise,base policy 不更新黑盒适配与探索空间受限之间的取舍
CO-RFTOffline RL在 chunk action 空间中做 TD 与策略改进离线数据实验;不是完整在线学习系统
Hand-in-the-Loop交互式模仿学习无跳变的人工接管、收集纠正数据再训练应与 RL 方法分开;可作为 RL 系统的数据组件
Self-Adaptive-VLA上下文适配根据 rollout context 调整动作,使用 shift-conditioned 监督不要标为部署时在线 RL

推荐第一组公平对照:固定同一个双臂/灵巧手 VLA、相同示范与真实交互预算,比较 BC / 纠正数据微调、BORA 式 chunk 残差、RL Token 式小网络,以及 Q-VGM 式 action-expert 更新。奖励成功率之外,记录周期时间、每次成功所需人工干预、泛化保持和接触失败类型。这是由文献推导的实验建议,不是上述论文已共同验证的结论。

“任务到电机关节目标”要核对运行时接口

本导读按你的定义:任务条件策略输出实际使用的关节目标,底层电机 PD/PID 可以保留。若网络输出姿态参考、末端目标、速度命令或力目标,再交给独立的运动跟踪策略 / IK / WBC 生成电机关节目标,则标记为分层。关节空间表示本身不足以证明满足这一边界。

论文策略输入部署输出链路判断与原文位置
ACT-ALOHA图像 + 当前关节双臂未来关节目标 → 电机 PID达到手臂关节目标边界;原版无语言、无双足平衡核对位置:§IV
HumanPlus双目第一视角 + 本体状态HIT 目标姿态 → Shadowing Transformer → PDACT 的直接衍生;运行时仍分层核对位置:§5–6 / Fig.4
TACT视觉 + 本体 + 触觉人体运动命令 → 重定向 + LIPM + QP/IK → PDACT + 人形接触操作;不能算全部关节直接输出核对位置:§III–V / Fig.2–3
SENTINEL语言 + 多时尺度本体状态flow 动作块 + 残差 → 29 维关节目标接近低层任务语义到动作;尚不能代表视觉双手操作核对位置:§3–4 / Eq.1,7
WholeBodyVLA图像 + 语言上身关节 + 下身 locomotion command → LMO RL上身较直接,下身仍有独立控制器核对位置:§3 / Fig.2
FetchMan视觉 + 本体状态15 维上层命令 → 上身 PD / 下身 SONIC连接 IL 与 RL 的实用分层对照;主要是单臂取物核对位置:§3 / Hierarchical Control
TANGO图像 + 语言 + 关节29 DoF 运动参考 → SONIC tracker → 电机关节命令输出关节表示仍可能只是跟踪参考;任务是导航核对位置:§3.3–3.4 / Fig.3
Opt2VLA视觉 + 语言几何目标 + 接触力参考 → 任务特定 FCT → PD力接口很有价值,但仍是分层 VLA/WBC核对位置:§III-A–B / Eq.3

最值得研究的交集是:语言/视觉任务条件 + 接触反馈 + 高维全身动作块 + 稳定的真机后训练。SENTINEL 提供较直接的语言到关节路线,HumanPlus/TACT 提供操作数据和 ACT 经验,BORA/RL Token 提供后训练接口;将它们组合成可靠的视觉双手全身策略,仍需要独立验证。

四轮阅读,形成可做的实验

  1. 建立动作与数据接口。 ACT、π0、Dexora、GR-Dexter。画清 observations → policy → action → motor 的链路,列出每个关节和传感器频率。
  2. 确定后训练基线。 IQL、RLPD、Q-chunking、HIL-SERL,再读 BORA、RL Token、Q-VGM。列清奖励、critic 输入、可训练参数和真实交互预算。
  3. 核对人形部署边界。 HumanPlus、TACT、SENTINEL、WholeBodyVLA。把实际电机目标、跟踪参考和高层命令分别画出,明确下肢平衡由谁负责。
  4. 选一个可证伪的研究问题。 例如:接触事件驱动的自适应 chunk 是否提升双手纠错效率?触觉状态能否改善 chunk critic 的动作敏感性?蒸馏运行时 tracker 后能否保持操作和平衡成功率?建议分别对照 AQC/DeCAL、BORA/Q-VGM、HumanPlus/SENTINEL,并设相同数据与计算预算。

全部论文:可检索、可筛选、可追溯

P0触觉双手 VLA2026 · v1

DeCAL

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

补齐视觉遮挡后的接触反馈:理解、潜空间预测和动作专家联合建模。

精读重点
contact-aware gating、visual-tactile dynamics、触觉与预测模块各自贡献。
适用边界
新近工作;设备触觉配置和数据量可能决定复现门槛。
原文来源 ↗新增下载 · 21 页 · 2609.09119
P0双臂双灵巧手 VLA2026 · v1

Dexora

Dexora: Open-source VLA for High-DoF Bimanual Dexterity

与你第一方向最直接的开源系统候选,覆盖高维双手、混合遥操作与数据质量加权。

精读重点
双臂/双手动作维度、仿真和真机数据比例、discriminator 权重的消融。
适用边界
“开源”依论文/项目描述;实际复现前仍要核对权重、数据、硬件配置是否齐全。
原文来源 ↗原有论文 · 8 页 · 2605.18722
P0双臂双灵巧手 VLA2025 · v2

GR-Dexter

GR-Dexter Technical Report

核心系统参照,硬件、双手遥操作、跨 embodiment 数据与模型共同设计。

精读重点
手部自由度、遮挡、长任务数据组织及跨 embodiment 数据消融。
适用边界
硬件 DoF 与独立驱动维数要分别核对;技术报告结果不代表所有灵巧手可直接迁移。
原文来源 ↗原有论文 · 17 页 · 2512.24210
P1触觉 VLA / RL 技能2026 · v1

MoDE-VLA-IMCopilot

Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA

连接 RL 原子技能、采集辅助与多模态 VLA,适合接触丰富的双手任务。

精读重点
IMCopilot 调用接口、MoE 融合、力与触觉残差注入。
适用边界
包含可调用低层技能,不能据整体任务表现宣称全部关节由单一 VLA 直接控制。
原文来源 ↗原有论文 · 9 页 · 2603.08122
P1双臂技能组合 VLA2026 · v1

SkillVLA

SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse

直接对应两臂动作组合爆炸和技能复用,适合研究协同与独立执行的切换。

精读重点
单臂技能拆分、左右臂复用、未见组合与协作任务。
适用边界
双臂组合泛化不等于灵巧手指接触泛化;两种维度应分开评测。
原文来源 ↗原有论文 · 16 页 · 2603.03836
P1高频触觉 VLA2026 · v2

T-Rex

T-Rex: Tactile-Reactive Dexterous Manipulation

研究 VLA 低频视觉与高频触觉的协同,对灵巧手接触反应很重要。

精读重点
variable-rate MoT、temporal tactile VQ-VAE 与触觉 primitive 数据。
适用边界
收益依赖触觉传感器和时间同步,不能直接迁移到只有相机的系统。
原文来源 ↗新增下载 · 30 页 · 2606.17055
P1Arm-hand VLA / 共享自主2025 · v2

DexVLA-Seed-Shared-Autonomy

End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy: VR Teleoperation Augmented by Autonomous Hand VLA Policy for Efficient Data Collection

把人控制宏观手臂运动与自主手部控制结合,用于降低采集负担。

精读重点
数据采集时的分工、最终 arm-hand VLA 的联合训练与失败纠正。
适用边界
分清采集阶段的分层控制和部署阶段的端到端策略;不要与另一篇 DexVLA 混淆。
原文来源 ↗原有论文 · 36 页 · 2511.00139
P0动作块 Offline-to-online RL2025 · v4

Q-Chunking

Reinforcement Learning with Action Chunking

同时连接 ACT 的动作块与 RL 的价值学习,是三个方向的共同方法基础。

精读重点
chunked action space、n-step backup 的条件、连续探索与边界截断。
适用边界
并非所有重叠 chunk 或任意 off-policy n-step 回报都无偏;需核对数据和执行条件。
原文来源 ↗新增下载 · 29 页 · 2507.07969
P1自适应动作块 O2O RL2026 · v1

Adaptive-Q-Chunking

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

将接触阶段的短时反应与自由运动的长时规划联系起来。

精读重点
不同 horizon 的价值尺度偏差、优势归一化、选择器。
适用边界
自适应时域会改变数据分布与执行频率,需报告真实控制时延。
原文来源 ↗新增下载 · 37 页 · 2605.05544
P1Offline flow RL2025 · v2

FQL

Flow Q-Learning

用一步策略配合 expressive flow prior,为高维动作快速策略提取提供基础。

精读重点
one-step guidance/蒸馏、避免递归反传、数据支持约束。
适用边界
通用 RL benchmark 不构成 VLA 真机部署证据。
原文来源 ↗新增下载 · 24 页 · 2502.02538
P1Offline-to-online RL 基础2023 · v4

Cal-QL

Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning

解释离线 critic 与在线改进之间的价值尺度问题。

精读重点
calibration、conservatism、online fine-tuning 的初始性能退化。
适用边界
不是 VLA 专用方法,迁移成本在 critic 表征与高维 chunk。
原文来源 ↗新增下载 · 26 页 · 2303.05479
P1Offline data + Online RL2023 · v4

RLPD

Efficient Online Reinforcement Learning with Offline Data

为真机少量示范启动在线学习提供简洁强基线。

精读重点
offline/online replay 混合、critic ensemble、update-to-data ratio。
适用边界
利用离线数据做在线学习不等于先完成离线策略训练;与严格 O2O 要区别。
原文来源 ↗新增下载 · 18 页 · 2302.02948
P1Offline RL 基础2021 · v1

IQL

Offline Reinforcement Learning with Implicit Q-Learning

理解不显式评估分布外动作的价值学习,是多个 VLA critic 的前置。

精读重点
expectile value regression、advantage-weighted policy extraction。
适用边界
标量单步动作的推导迁移到动作块时要重新处理折扣与时域。
原文来源 ↗新增下载 · 13 页 · 2110.06169
P2Offline RL / flow2025 · v1

EFM-QIPO

Energy-Weighted Flow Matching for Offline Reinforcement Learning

为 flow/diffusion 动作生成提供能量加权训练视角,与 Q 引导后训练相连。

精读重点
能量权重如何进入 flow matching,QIPO 的策略改进与数据支持范围。
适用边界
通用 offline RL 方法,不能把 benchmark 结果直接当作双手 VLA 真机证据。
原文来源 ↗原有论文 · 28 页 · 2503.04975
P0灵巧手 VLA offline-to-online RL2026 · v2

BORA

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models

与你前两个方向交集最直接:离线动作块 critic,再用真机在线残差修正。

精读重点
critic 是否对动作敏感、离线到在线初始化、chunk-wise residual 与人工干预。
适用边界
在线阶段冻结 VLA 主体;需区分残差适配收益与端到端更新主模型的收益。
原文来源 ↗原有论文 · 23 页 · 2605.30226
P0Flow VLA offline-to-online RL2026 · v5

Q-VGM

Q-VGM: Q-Guided Value-Gradient Matching for Offline-to-Online RL of Flow-Matching VLA Policies

直接以 critic 引导 flow action expert,适合与冻结主干的残差路线对照。

精读重点
IQL 离线 critic、在线 TD、局部 velocity target 如何绕过 denoising BPTT。
适用边界
请读归档的 v5;本地 v2 题名不同,不能混用各版实验和结论。
原文来源 ↗原有论文补充可核验版本 · 8 页 · 2606.08015
P0轻量真机在线 RL2026 · v2

RL-Token

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

研究 VLA 表征与轻量 actor-critic 之间的接口,有利于控制真机交互和算力成本。

精读重点
RL token 如何获得、动作锚定项、训练参数范围及秒级/小时级预算。
适用边界
精密任务证据很强但不等于已验证高维双灵巧手和全身控制。
原文来源 ↗原有论文 · 13 页 · 2604.23073
P0VLA offline-to-online RL2025 · v2

pi-star-0.6-RECAP

$\pi^{*}_{0.6}$: a VLA That Learns From Experience

把示范、自主执行和人工纠正放进 RECAP,是理解通用 VLA 从经验改进的主线。

精读重点
advantage conditioning、价值估计、数据混合与吞吐量评价。
适用边界
不是简单给现有 BC 模型套 PPO;预训练配方和数据规模会影响可复现性。
原文来源 ↗原有论文补充可核验版本 · 18 页 · 2511.14759
P1多机器人 VLA O2O RL2026 · v4

Learning-While-Deploying

Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies

将 offline-to-online 扩展到跨机器人持续部署,兼顾共享经验与价值估计。

精读重点
DIVL、QAM、干预与自主数据混合、策略版本迭代。
适用边界
机器人群规模与单机实验室不同;优先抽取算法与数据协议而非直接比较总吞吐。
原文来源 ↗新增下载 · 18 页 · 2605.00416
P1动作块 Offline VLA RL2025 · v1

CO-RFT

CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning

将 chunk 纳入 TD 更新,直接服务离线数据上的 VLA 策略改进。

精读重点
Chunked RL Bellman backup、离线 critic、少示范微调协议。
适用边界
论文为 offline RL,不应只因动作块与 Q-learning 就称为完整 O2O 系统。
原文来源 ↗新增下载 · 9 页 · 2508.02219
P1VLA 在线后训练2025 · v1

RIPT-VLA

Interactive Post-Training for Vision-Language-Action Models

用稀疏成功奖励探索交互后训练,作为简单 RL 起点。

精读重点
采样、成功奖励、少示范条件下对 SFT 的增益。
适用边界
主要关心交互 RL;不能将 simulation episode 数直接替换为真机训练时间。
原文来源 ↗新增下载 · 14 页 · 2505.17016
P1规模化 VLA 在线 RL2025 · v1

SimpleVLA-RL

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning

研究训练系统效率与探索,便于搭建可扩展实验。

精读重点
并行 rollout、渲染、loss 与探索策略的分离消融。
适用边界
对 OpenVLA-OFT 的结论要与 flow VLA、真实灵巧手另行对照。
原文来源 ↗新增下载 · 24 页 · 2509.09674
P1VLA 在线 RL2025 · v1

VLA-RL

VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning

建立规模化 VLA RL 的基本流程,并与后续高效改进方法对照。

精读重点
轨迹采样、任务奖励、训练稳定化与分布外泛化协议。
适用边界
仿真采样预算与真机可承受预算不同;不要跨论文直接排名成功率。
原文来源 ↗原有论文 · 15 页 · 2505.18719
P2离线监督正则化 RL2026 · v1

Offline-Supervision-VLA-RL

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

比较用 reference policy 或示范数据约束 online RL,适合研究稳定性与泛化保持。

精读重点
RefKL 和 DataBC 的公平对比、OOD 协议及数据预算。
适用边界
专题范围较窄,优先作为消融思路;离线监督不等同离线 RL。
原文来源 ↗新增下载 · 8 页 · 2607.19399
P2上下文适配后训练2026 · v1

Self-Adaptive-VLA

Self-Adaptive VLA for Robust Robot Deployment

研究硬件偏置和工作站变化下的经验上下文,有助于分离标定问题与策略问题。

精读重点
人为注入 shift、context encoder、动作预补偿与逐次自校正。
适用边界
不等于部署时在线 RL;新近结果应验证未知类型 shift。
原文来源 ↗新增下载 · 8 页 · 2609.30092
P2在线 RL 失败模式2026 · v1

Uncertainty-Gated-Exploration

Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy

关注平均分掩盖的单任务崩塌,为长期后训练设计诊断指标。

精读重点
逐任务曲线、探索噪声、随机种子与数值精度。
适用边界
论文该预算下各方案均未超过 BC;作为失败分析阅读,不作为性能突破。
原文来源 ↗新增下载 · 38 页 · 2609.28838
P1Offline RL / Flow 推理时引导2026 · v1

QGF

Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning

为冻结 Flow 策略增加推理时的 Q 梯度引导,可与 FQL、Q-VGM 的训练时策略改进对照,研究高维动作块的改进方式。

精读重点
§5 / Eq.7–9 / Algorithm 1:单步 Euler 近似干净动作,在该动作处求 Q 梯度并省略 Flow Jacobian;§6:IQL critic、动作块 h=5、引导强度及推理计算预算。
适用边界
证据来自 OGBench 单任务和目标条件离线 RL 仿真;未验证 VLA 或双灵巧手真机。推理时不更新策略参数,效果依赖 critic 质量,并增加逐步 Q 梯度计算成本。
原文来源 ↗新增下载 · 28 页 · 2606.11087
P1潜空间在线 RL2025 · v2

DSRL

Steering Your Diffusion Policy with Latent Space Reinforcement Learning

通过优化 diffusion 初始噪声改进行为,是低成本后训练的重要对照。

精读重点
latent-noise policy 的 critic、探索范围以及是否修改 base policy。
适用边界
冻结基模型可能限制可达行为,需与动作残差和 action-head 更新公平比较。
原文来源 ↗原有论文 · 26 页 · 2506.15799
P1On-policy flow RL2025 · v2

FPO

Flow Matching Policy Gradients

学习用 flow-matching loss 构造策略优化目标,是优化 flow action head 的重要方法参照。

精读重点
替代似然比、优势加权、与 PPO 的关系及适用假设。
适用边界
主要提供通用 flow 策略优化方法;需要另行验证 VLA 规模与高维手的稳定性。
原文来源 ↗原有论文 · 23 页 · 2507.21053
P1Flow 在线 RL2025 · v7

ReinFlow

ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning

通过向 flow 采样注入可学习噪声建立可优化的随机策略。

精读重点
离散 Markov 过程、精确条件似然、探索噪声与少步采样。
适用边界
方法收益和 sampler 设置耦合;应匹配推理步数与 wall-clock 预算。
原文来源 ↗新增下载 · 38 页 · 2505.22094
P1Diffusion 在线 RL2024 · v3

DPPO

Diffusion Policy Policy Optimization

把 denoising 链纳入 policy optimization,是理解生成策略 RL 的关键基线。

精读重点
双层时间结构、PPO 更新与 diffusion 采样过程。
适用边界
diffusion 与 flow 的似然计算不同,不能直接把损失照搬到任意 VLA。
原文来源 ↗新增下载 · 46 页 · 2409.00588
P0真机人机协同 RL2024 · v3

HIL-SERL

Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning

搭建实机后训练实验时最值得借鉴的系统基线之一。

精读重点
干预数据、奖励分类器、样本效率与 cycle time。
适用边界
dexterous 指精细操作,不保证使用多指灵巧手,也不等于大型 VLA。
原文来源 ↗新增下载 · 54 页 · 2410.21845
P1交互式模仿学习2026 · v2

Hand-in-the-Loop

Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention

无跳变的手臂/手部人工接管,是在线纠错和后训练系统的重要组件。

精读重点
gesture jump 的来源、控制混合和 intervention 数据采样。
适用边界
这是 IIL/纠正数据路线,不应因 human-in-the-loop 就标成 RL 算法。
原文来源 ↗新增下载 · 13 页 · 2605.15157
P1真机 RL / diffusion2025 · v4

RL-100

RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning

关注离线与在线阶段的 diffusion 策略改进以及执行加速。

精读重点
denoising 内 PPO、动作块、单步蒸馏和周期时间。
适用边界
visuomotor diffusion 策略不自动等于语言条件 VLA;100% 指论文所测有限试验。
原文来源 ↗原有论文 · 46 页 · 2510.14830
P1机器人奖励模型2026 · v2

RoboReward

RoboReward: General-Purpose Vision-Language Reward Models for Robotics

奖励获取是 online RL 的现实瓶颈;用于研究自动奖励与任务成功判定。

精读重点
负样本构造、近成功失败的区分、跨任务校准与奖励被利用的问题。
适用边界
奖励模型评价与闭环 RL 增益是两件事,不能只比较离线分类准确率。
原文来源 ↗原有论文 · 33 页 · 2601.00675
P0触觉 ACT / 人形接触操作2025 · v1

TACT

TACT: Humanoid Whole-body Contact Manipulation through Deep Imitation Learning with Tactile Modality

第三方向的直接相关工作:在 ACT 中加入全身触觉,完成抱持等接触操作。

精读重点
TACT 模态编码、预测的人体运动命令、触觉消融与接触稳定性。
适用边界
部署经过 retargeting、LIPM 和 QP/IK;保留为 ACT+humanoid 强参照,而非严格全关节端到端。
原文来源 ↗新增下载 · 10 页 · 2506.15146
P0ACT 衍生人形 IL2024 · v1

HumanPlus

HumanPlus: Humanoid Shadowing and Imitation from Humans

直接研究 ACT 如何改成 HIT,连接全身采集、第一视角视觉与高 DoF 操作。

精读重点
decoder-only、50 步目标姿态、未来视觉特征辅助损失。
适用边界
HIT 输出给 Humanoid Shadowing Transformer,属于分层;不是语言条件全身电机策略。
原文来源 ↗新增下载 · 17 页 · 2406.10454
P0ACT / 双臂模仿学习2023 · v1

ACT-ALOHA

Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

第三方向必读起点:动作块和 temporal ensembling,直接预测双臂关节目标。

精读重点
CVAE、chunk 长度、训练标签为何用 leader 而非 follower 关节位置。
适用边界
原版没有语言条件,也没有人形平衡;保留电机 PID 符合“输出关节目标”的边界。
原文来源 ↗新增下载 · 18 页 · 2304.13705
P1移动双臂 ACT2024 · v1

Mobile-ALOHA

Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation

从固定双臂扩展到移动操作,学习任务与底盘协同的数据配方。

精读重点
移动底盘动作与手臂动作对齐、co-training 和长任务演示。
适用边界
轮式底盘不是双足人形,平衡难度与控制接口不同。
原文来源 ↗新增下载 · 20 页 · 2401.02117
P0语言到关节目标2025 · v1

SENTINEL

SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control

最接近你定义的任务语义到全身低层动作,值得研究其多时尺度状态与残差后训练。

精读重点
29 维动作到关节目标的映射、flow action chunk、teacher 数据和 residual head。
适用边界
核心输入为语言和本体状态;以动作/导航为主,不能当作成熟视觉双手操作方案,也不是原版 ACT。
原文来源 ↗新增下载 · 23 页 · 2511.19236
P1人形视觉策略 + RL2026 · v2

FetchMan

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

连接大规模合成示范、flow 策略后训练与真机 loco-manipulation。

精读重点
Flow-GRPO、示范阶段边界、模拟到真机和成功奖励。
适用边界
15 维命令含底盘速度/高度及上身目标,下身交给 SONIC;且主要是单臂抓取。
原文来源 ↗新增下载 · 14 页 · 2608.17027
P1力感知分层人形 VLA2026 · v1

Opt2VLA

Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation

研究几何动作之外的力接口,与你的接触丰富操作目标紧密相关。

精读重点
VLA 的几何/力输出、轨迹优化数据、FCT 低层训练及 torque supervision。
适用边界
VLA 输出力和几何参考,交由任务特定 WBC;并非 VLA 直接预测电机扭矩。
原文来源 ↗新增下载 · 18 页 · 2609.23968
P1人形 VLA 基础2025 · v2

GR00T-N1

GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

学习通用人形操作模型的双系统架构和异构数据组合。

精读重点
VLM + flow action expert、合成数据、双臂操作与跨 embodiment。
适用边界
“humanoid”不意味着所有双足关节均由 VLA 直接输出;以各实验 embodiment 为准。
原文来源 ↗新增下载 · 36 页 · 2503.14734
P1分层全身 VLA2025 · v2

WholeBodyVLA

WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control

为大工作空间中的行走与操作协同提供强系统参照。

精读重点
latent action、上身关节与下身命令分解、LMO 控制器。
适用边界
下肢仍由独立 RL 控制器执行,不符合单一任务策略直接输出全部关节目标的严格边界。
原文来源 ↗新增下载 · 23 页 · 2512.11047
P2语言视觉全身导航2026 · v1

TANGO

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

作为关节空间表示与低频 VLA/高频执行的近期参照。

精读重点
29 DoF motion chunk、RTC、SONIC tracker 的运行时接口。
适用边界
本文是导航;预测关节参考后仍经 SONIC 跟踪,不能据摘要当作直接电机关节控制。
原文来源 ↗新增下载 · 24 页 · 2609.09158
P1全身控制基础2026 · v1

Scaling-BFM

Scaling Behavior Foundation Model for Humanoid Robots

研究全身运动跟踪的规模化配方,理解能支撑操作策略的低层控制先验。

精读重点
全局坐标跟踪、数据多样性、rollout 数与 Transformer 容量。
适用边界
原目录 PRM 容易误导;这里是行为基础模型,不是过程奖励模型,也不是任务语言驱动操作 VLA。
原文来源 ↗原有论文 · 40 页 · 2607.15163
P1人形数据采集系统2025 · v1

TWIST2

TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System

补齐便携、可扩展的 whole-body 数据来源与第一视角观测。

精读重点
VR 全身控制、头颈视角、动作数据接口与采集复现。
适用边界
数据采集系统和任务策略的端到端程度要分开评估。
原文来源 ↗新增下载 · 11 页 · 2511.02832
P1全身遥操作与学习2024 · v1

OmniH2O

OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning

理解统一运动学姿态接口以及灵巧手与身体协调的数据采集。

精读重点
retargeting、teacher-student RL、动作接口和自主任务训练。
适用边界
统一接口不等于部署无中间运动参考;需区分遥操作演示和自主实验。
原文来源 ↗新增下载 · 25 页 · 2406.08858
P2全身控制与遥操作2025 · v1

TWIST

TWIST: Teleoperated Whole-Body Imitation System

了解高度协调的全身技能如何由统一低层网络实现。

精读重点
运动重定向、跟踪奖励、全身接触与 sim-to-real。
适用边界
不是语言/视觉任务策略,也不是 ACT;用作低层基线。
原文来源 ↗新增下载 · 12 页 · 2505.02833
P1人类数据到 VLA2026 · v1

Ego-Pi

Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data

研究人类第一视角与机器人数据共同微调,与你的数据扩充需求相关。

精读重点
跨 embodiment 的观测、动作对齐及少样本 robot fine-tuning。
适用边界
人类视频带来的迁移不能替代机器人接触动力学验证;原件版本未标明,已补 arXiv 版。
原文来源 ↗原有论文补充可核验版本 · 12 页 · 2606.08107
P1灵巧手人类数据2026 · v1

EgoScale

EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data

考察人类 egocentric 数据规模如何服务灵巧操作。

精读重点
预训练数据多样性、机器人数据量、跨场景迁移的控制变量。
适用边界
规模化数据结果不自动等于少量数据实验室可复现;关注实际采集成本。
原文来源 ↗原有论文 · 22 页 · 2602.16710
P1灵巧手数据采集2025 · v3

DexUMI

DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation

用人手接口和外骨骼缩小运动学与视觉差距,适合双手数据采集设计。

精读重点
硬件映射、视觉 inpainting、haptic feedback 与跨手迁移。
适用边界
需核算设备和标定成本;数据接口不是通用 VLA/RL 算法。
原文来源 ↗新增下载 · 23 页 · 2505.21864
P2灵巧手动捕与模仿2024 · v2

DexCap

DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation

理解可携带动捕、遮挡鲁棒性与动作重定向。

精读重点
SLAM/电磁跟踪、点云模仿、人工纠错的数据收益。
适用边界
DexIL 不等于语言条件 VLA;作为数据采集与模仿学习参考。
原文来源 ↗新增下载 · 20 页 · 2403.07788
P2机器人无关采集接口2024 · v3

UMI

Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots

为第一视角数据、延迟匹配与 action representation 提供基础设计经验。

精读重点
数据采集与部署的视觉/时间一致性及动作接口。
适用边界
原版以夹爪为主;灵巧手扩展应结合 DexUMI。
原文来源 ↗新增下载 · 18 页 · 2402.10329
P1双臂评测与数据2025 · v2

RoboTwin-2.0

RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation

为双臂技能、域随机化、跨 embodiment 测试提供统一参照。

精读重点
训练测试随机化、成功判定、数据生成与相同预算比较。
适用边界
许多双臂任务面向夹爪;夹爪成绩不能直接代表灵巧手能力。
原文来源 ↗新增下载 · 24 页 · 2506.18088
P1双臂灵巧仿真数据2024 · v2

DexMimicGen

DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning

用少量示范合成大规模双手轨迹,适合构造可重复的 RL 与 IL 测试。

精读重点
双臂协同事件、轨迹变换有效性和 real-to-sim-to-real。
适用边界
合成轨迹可执行性与真实接触动力学之间仍有差距。
原文来源 ↗新增下载 · 10 页 · 2410.24185
P1VLA 高效微调2025 · v2

OpenVLA-OFT

Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success

为实时推理与 action chunking 提供可实现基线,也连接 SimpleVLA-RL。

精读重点
并行动作解码、连续动作表示与训练/推理效率。
适用边界
OFT 是监督微调配方,区别于 RL 后训练。
原文来源 ↗新增下载 · 24 页 · 2502.19645
P1通用 VLA2025 · v1

pi-0.5

$\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization

理解跨机器人、高层语义和低层动作的异构共训练,对双臂泛化有基础价值。

精读重点
高层子任务预测与低层 action expert 的接口,以及跨场景评测。
适用边界
含语义分解;不能据标题等同于单网络全身电机关节控制。
原文来源 ↗原有论文 · 19 页 · 2504.16054
P1通用 VLA2024 · v3

OpenVLA

OpenVLA: An Open-Source Vision-Language-Action Model

了解标准 VLM 到动作 token 的基线,利于理解 VLA-RL 与微调差异。

精读重点
动作离散化、预训练数据、微调与模型推理成本。
适用边界
原版动作表示和频率未专门针对双灵巧手;不应直接当作最佳高维控制方案。
原文来源 ↗新增下载 · 37 页 · 2406.09246
P1Flow VLA2024 · v4

pi-0

$\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

理解高维连续动作块的 flow-matching VLA,是多篇后训练论文的起点。

精读重点
VLM 与 action expert 的信息交互、flow loss 和动作 chunk。
适用边界
通用操作模型的成功不等于已完成双足全身语义到关节的统一控制。
原文来源 ↗新增下载 · 17 页 · 2410.24164
P1生成式模仿学习2023 · v5

Diffusion-Policy

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

构成 flow/diffusion VLA 和其 RL 后训练的技术前置。

精读重点
receding horizon、动作分布多模态、观测与执行窗口。
适用边界
本身是模仿学习;action chunking 不意味着使用 ACT 架构。
原文来源 ↗新增下载 · 19 页 · 2303.04137
P2VLA 架构基础2025 · v3

DexVLA

DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control

读插件式 diffusion expert 与 VLM 的结合,理解动作专家设计。

精读重点
分阶段训练、动作专家容量、跨机器人控制接口。
适用边界
DexVLA 与 ByteDance 的 arm-hand shared-autonomy 论文是不同工作;名称含 Dex 不能直接视作双灵巧手证据。
原文来源 ↗原有论文 · 22 页 · 2502.05855
P2世界动作模型2026 · v1

DreamZero

World Action Models are Zero-shot Policies

用动作与未来视觉联合建模拓展泛化思路。

精读重点
跨 embodiment 和零样本的具体定义、训练数据覆盖、部署计算。
适用边界
论文中的 zero-shot 要按评测协议理解,不表示任意机器人任意新任务。
原文来源 ↗原有论文 · 36 页 · 2602.15922
P2世界动作模型2026 · v2

LingBot-VA

Causal World Modeling for Robot Control

研究因果视频世界建模如何服务机器人动作生成,作为 VLA 之外的结构参照。

精读重点
视频与动作的因果关系、在线推理延迟、动作监督来源。
适用边界
属于拓展路线,先完成双手 VLA / RL / ACT 主线再读。
原文来源 ↗原有论文 · 31 页 · 2601.21998
P2世界动作模型2026 · v5

MotuBrain

Motubrain: An Advanced World Action Model for Robot Control

保留你已有的世界动作模型路线,用于比较视频先验与静态 VLM 先验。

精读重点
动作与视频联合预测、控制延迟以及具体部署接口。
适用边界
优先级低于你的三个主线;已将 v2 单独归档并补 v5。
原文来源 ↗原有论文补充可核验版本 · 21 页 · 2604.27792

整理方式与核验范围

文件与版本

原有 26 个 PDF:按你的要求删除 AirSim360;一组字节完全相同的 BORA 合并;1 份 RL Token 中文译文单独保留。保留的原有独立论文为 23 篇,新增 42 篇,主库共 65 篇。

另外下载 π*0.6 v2、Q-VGM v5、MotuBrain v5,并补充 Ego-Pi 的 arXiv v1。四份原始文件位于旧版归档;Ego-Pi 原件未标版本,不擅自认定其修订号。其他原文件按字节保留。

文件名采用:初次预印本年份__方法名__可辨识题名__arXiv-ID版本.pdf。年份不等同正式会议年份。

检索与证据

来源采用 arXiv 原文、作者项目页和论文正文。检索包含双臂/双手 VLA、共享自主、触觉、动作块 offline-to-online RL、diffusion/flow 后训练、ACT 人形模仿与全身控制,并补查 2026 年 8–9 月相关工作。

65 篇均核对题名与来源,下载文件检查 PDF 格式、页数和 arXiv 编号;推荐理由基于摘要及相关方法内容。关键控制链路查到正文位置。未声称逐篇完整复现或系统性穷尽检索。

未单独核实所有论文的正式录用状态或开源资源完备性;统一以可核验的 arXiv 版本引用。不要跨论文直接比较不同硬件、任务和试验预算的成功率。

旧笔记正文保持原样,仅修复论文链接,可能不反映新版内容。目录与参考文献可离线使用;外部来源链接需要网络。检索截止:2026-10-02。