双臂 + 双灵巧手 VLA
ACT-ALOHA → pi-0 → Dexora → GR-Dexter → SkillVLA → DeCAL → T-Rex
核心区分:双夹爪、单臂灵巧手、双臂双手;技能组合、接触反应与数据规模分别解决什么问题。
围绕双臂灵巧手 VLA、offline / online / offline-to-online RL 后训练,以及 Humanoid + ACT,建立可追溯的阅读路径。
ACT-ALOHA → pi-0 → Dexora → GR-Dexter → SkillVLA → DeCAL → T-Rex
核心区分:双夹爪、单臂灵巧手、双臂双手;技能组合、接触反应与数据规模分别解决什么问题。
IQL → RLPD → Q-Chunking → BORA → RL-Token → Q-VGM → pi-star-0.6-RECAP → Learning-While-Deploying
先建立 critic 与 chunk 的基础,再比较更新位置:latent noise、残差、小型 RL head、flow action expert、优势条件策略。
ACT-ALOHA → HumanPlus → TACT → SENTINEL → WholeBodyVLA → FetchMan → Opt2VLA
ACT 是特定的 CVAE/Transformer 模仿学习方法;使用动作块的 flow VLA 并不自动属于 ACT。
优先级表示与你研究方向的匹配度和前置作用,并非论文质量或性能排名。P0 先精读;P1 作为方法/系统支撑;P2 按实验需要选读。
| # | 论文 / 本地 PDF | 为何值得读 | 精读问题 |
|---|---|---|---|
| 01 | Dexora2026 · v1 | 与你第一方向最直接的开源系统候选,覆盖高维双手、混合遥操作与数据质量加权。 | 双臂/双手动作维度、仿真和真机数据比例、discriminator 权重的消融。 |
| 02 | GR-Dexter2025 · v2 | 核心系统参照,硬件、双手遥操作、跨 embodiment 数据与模型共同设计。 | 手部自由度、遮挡、长任务数据组织及跨 embodiment 数据消融。 |
| 03 | BORA2026 · v2 | 与你前两个方向交集最直接:离线动作块 critic,再用真机在线残差修正。 | critic 是否对动作敏感、离线到在线初始化、chunk-wise residual 与人工干预。 |
| 04 | RL-Token2026 · v2 | 研究 VLA 表征与轻量 actor-critic 之间的接口,有利于控制真机交互和算力成本。 | RL token 如何获得、动作锚定项、训练参数范围及秒级/小时级预算。 |
| 05 | Q-VGM2026 · v5 | 直接以 critic 引导 flow action expert,适合与冻结主干的残差路线对照。 | IQL 离线 critic、在线 TD、局部 velocity target 如何绕过 denoising BPTT。 |
| 06 | pi-star-0.6-RECAP2025 · v2 | 把示范、自主执行和人工纠正放进 RECAP,是理解通用 VLA 从经验改进的主线。 | advantage conditioning、价值估计、数据混合与吞吐量评价。 |
| 07 | Q-Chunking2025 · v4 | 同时连接 ACT 的动作块与 RL 的价值学习,是三个方向的共同方法基础。 | chunked action space、n-step backup 的条件、连续探索与边界截断。 |
| 08 | HIL-SERL2024 · v3 | 搭建实机后训练实验时最值得借鉴的系统基线之一。 | 干预数据、奖励分类器、样本效率与 cycle time。 |
| 09 | ACT-ALOHA2023 · v1 | 第三方向必读起点:动作块和 temporal ensembling,直接预测双臂关节目标。 | CVAE、chunk 长度、训练标签为何用 leader 而非 follower 关节位置。 |
| 10 | HumanPlus2024 · v1 | 直接研究 ACT 如何改成 HIT,连接全身采集、第一视角视觉与高 DoF 操作。 | decoder-only、50 步目标姿态、未来视觉特征辅助损失。 |
| 11 | TACT2025 · v1 | 第三方向的直接相关工作:在 ACT 中加入全身触觉,完成抱持等接触操作。 | TACT 模态编码、预测的人体运动命令、触觉消融与接触稳定性。 |
| 12 | SENTINEL2025 · v1 | 最接近你定义的任务语义到全身低层动作,值得研究其多时尺度状态与残差后训练。 | 29 维动作到关节目标的映射、flow action chunk、teacher 数据和 residual head。 |
| 13 | DeCAL2026 · v1 | 补齐视觉遮挡后的接触反馈:理解、潜空间预测和动作专家联合建模。 | contact-aware gating、visual-tactile dynamics、触觉与预测模块各自贡献。 |
“用了离线数据”“可以在线部署”“有人类纠正”都不足以判定算法属于 offline-to-online RL。先检查奖励、critic、策略更新与交互阶段。
| 论文 | 学习范式 | 优化接口 | 与你的实验关系 |
|---|---|---|---|
| BORA | 离线 critic → 在线残差 RL | cognition token + action chunk critic;冻结 VLA,在线训练 chunk residual | 高维灵巧手真机;最贴合前两个方向 |
| RL-Token | 在线 RL | VLA 提供紧凑表征与动作先验,训练轻量 actor-critic | 先看 token 训练、在线参数范围及锚定损失 |
| Q-VGM | 离线 IQL → 在线 TD | critic 指导 flow action expert 的局部 velocity matching | 与冻结 base 的残差路线做同预算对照;读 v5 |
| QGF | 离线训练 + 推理时策略改进 | BC Flow 与 critic 分开训练;以近似干净动作处的 Q 梯度引导去噪,冻结策略参数 | 对照 Q-VGM 的训练时 action-expert 更新;OGBench 仿真,VLA / 双手真机迁移待验证 |
| pi-star-0.6-RECAP | 离线预训练 + 部署迭代 | 优势条件策略,混合示范、自主轨迹与纠正数据 | 研究多任务能力与持续改进,不简化为 PPO |
| DSRL | 在线 RL | 优化 diffusion 的 latent noise,base policy 不更新 | 黑盒适配与探索空间受限之间的取舍 |
| CO-RFT | Offline RL | 在 chunk action 空间中做 TD 与策略改进 | 离线数据实验;不是完整在线学习系统 |
| Hand-in-the-Loop | 交互式模仿学习 | 无跳变的人工接管、收集纠正数据再训练 | 应与 RL 方法分开;可作为 RL 系统的数据组件 |
| Self-Adaptive-VLA | 上下文适配 | 根据 rollout context 调整动作,使用 shift-conditioned 监督 | 不要标为部署时在线 RL |
推荐第一组公平对照:固定同一个双臂/灵巧手 VLA、相同示范与真实交互预算,比较 BC / 纠正数据微调、BORA 式 chunk 残差、RL Token 式小网络,以及 Q-VGM 式 action-expert 更新。奖励成功率之外,记录周期时间、每次成功所需人工干预、泛化保持和接触失败类型。这是由文献推导的实验建议,不是上述论文已共同验证的结论。
本导读按你的定义:任务条件策略输出实际使用的关节目标,底层电机 PD/PID 可以保留。若网络输出姿态参考、末端目标、速度命令或力目标,再交给独立的运动跟踪策略 / IK / WBC 生成电机关节目标,则标记为分层。关节空间表示本身不足以证明满足这一边界。
| 论文 | 策略输入 | 部署输出链路 | 判断与原文位置 |
|---|---|---|---|
| ACT-ALOHA | 图像 + 当前关节 | 双臂未来关节目标 → 电机 PID | 达到手臂关节目标边界;原版无语言、无双足平衡核对位置:§IV |
| HumanPlus | 双目第一视角 + 本体状态 | HIT 目标姿态 → Shadowing Transformer → PD | ACT 的直接衍生;运行时仍分层核对位置:§5–6 / Fig.4 |
| TACT | 视觉 + 本体 + 触觉 | 人体运动命令 → 重定向 + LIPM + QP/IK → PD | ACT + 人形接触操作;不能算全部关节直接输出核对位置:§III–V / Fig.2–3 |
| SENTINEL | 语言 + 多时尺度本体状态 | flow 动作块 + 残差 → 29 维关节目标 | 接近低层任务语义到动作;尚不能代表视觉双手操作核对位置:§3–4 / Eq.1,7 |
| WholeBodyVLA | 图像 + 语言 | 上身关节 + 下身 locomotion command → LMO RL | 上身较直接,下身仍有独立控制器核对位置:§3 / Fig.2 |
| FetchMan | 视觉 + 本体状态 | 15 维上层命令 → 上身 PD / 下身 SONIC | 连接 IL 与 RL 的实用分层对照;主要是单臂取物核对位置:§3 / Hierarchical Control |
| TANGO | 图像 + 语言 + 关节 | 29 DoF 运动参考 → SONIC tracker → 电机关节命令 | 输出关节表示仍可能只是跟踪参考;任务是导航核对位置:§3.3–3.4 / Fig.3 |
| Opt2VLA | 视觉 + 语言 | 几何目标 + 接触力参考 → 任务特定 FCT → PD | 力接口很有价值,但仍是分层 VLA/WBC核对位置:§III-A–B / Eq.3 |
最值得研究的交集是:语言/视觉任务条件 + 接触反馈 + 高维全身动作块 + 稳定的真机后训练。SENTINEL 提供较直接的语言到关节路线,HumanPlus/TACT 提供操作数据和 ACT 经验,BORA/RL Token 提供后训练接口;将它们组合成可靠的视觉双手全身策略,仍需要独立验证。
DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
补齐视觉遮挡后的接触反馈:理解、潜空间预测和动作专家联合建模。
Dexora: Open-source VLA for High-DoF Bimanual Dexterity
与你第一方向最直接的开源系统候选,覆盖高维双手、混合遥操作与数据质量加权。
GR-Dexter Technical Report
核心系统参照,硬件、双手遥操作、跨 embodiment 数据与模型共同设计。
Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA
连接 RL 原子技能、采集辅助与多模态 VLA,适合接触丰富的双手任务。
SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse
直接对应两臂动作组合爆炸和技能复用,适合研究协同与独立执行的切换。
T-Rex: Tactile-Reactive Dexterous Manipulation
研究 VLA 低频视觉与高频触觉的协同,对灵巧手接触反应很重要。
End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy: VR Teleoperation Augmented by Autonomous Hand VLA Policy for Efficient Data Collection
把人控制宏观手臂运动与自主手部控制结合,用于降低采集负担。
Reinforcement Learning with Action Chunking
同时连接 ACT 的动作块与 RL 的价值学习,是三个方向的共同方法基础。
Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning
将接触阶段的短时反应与自由运动的长时规划联系起来。
Flow Q-Learning
用一步策略配合 expressive flow prior,为高维动作快速策略提取提供基础。
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
解释离线 critic 与在线改进之间的价值尺度问题。
Efficient Online Reinforcement Learning with Offline Data
为真机少量示范启动在线学习提供简洁强基线。
Offline Reinforcement Learning with Implicit Q-Learning
理解不显式评估分布外动作的价值学习,是多个 VLA critic 的前置。
Energy-Weighted Flow Matching for Offline Reinforcement Learning
为 flow/diffusion 动作生成提供能量加权训练视角,与 Q 引导后训练相连。
BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models
与你前两个方向交集最直接:离线动作块 critic,再用真机在线残差修正。
Q-VGM: Q-Guided Value-Gradient Matching for Offline-to-Online RL of Flow-Matching VLA Policies
直接以 critic 引导 flow action expert,适合与冻结主干的残差路线对照。
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
研究 VLA 表征与轻量 actor-critic 之间的接口,有利于控制真机交互和算力成本。
$\pi^{*}_{0.6}$: a VLA That Learns From Experience
把示范、自主执行和人工纠正放进 RECAP,是理解通用 VLA 从经验改进的主线。
Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies
将 offline-to-online 扩展到跨机器人持续部署,兼顾共享经验与价值估计。
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
将 chunk 纳入 TD 更新,直接服务离线数据上的 VLA 策略改进。
Interactive Post-Training for Vision-Language-Action Models
用稀疏成功奖励探索交互后训练,作为简单 RL 起点。
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
研究训练系统效率与探索,便于搭建可扩展实验。
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
建立规模化 VLA RL 的基本流程,并与后续高效改进方法对照。
Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models
比较用 reference policy 或示范数据约束 online RL,适合研究稳定性与泛化保持。
Self-Adaptive VLA for Robust Robot Deployment
研究硬件偏置和工作站变化下的经验上下文,有助于分离标定问题与策略问题。
Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy
关注平均分掩盖的单任务崩塌,为长期后训练设计诊断指标。
Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning
为冻结 Flow 策略增加推理时的 Q 梯度引导,可与 FQL、Q-VGM 的训练时策略改进对照,研究高维动作块的改进方式。
Steering Your Diffusion Policy with Latent Space Reinforcement Learning
通过优化 diffusion 初始噪声改进行为,是低成本后训练的重要对照。
Flow Matching Policy Gradients
学习用 flow-matching loss 构造策略优化目标,是优化 flow action head 的重要方法参照。
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
通过向 flow 采样注入可学习噪声建立可优化的随机策略。
Diffusion Policy Policy Optimization
把 denoising 链纳入 policy optimization,是理解生成策略 RL 的关键基线。
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning
搭建实机后训练实验时最值得借鉴的系统基线之一。
Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention
无跳变的手臂/手部人工接管,是在线纠错和后训练系统的重要组件。
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
关注离线与在线阶段的 diffusion 策略改进以及执行加速。
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
奖励获取是 online RL 的现实瓶颈;用于研究自动奖励与任务成功判定。
TACT: Humanoid Whole-body Contact Manipulation through Deep Imitation Learning with Tactile Modality
第三方向的直接相关工作:在 ACT 中加入全身触觉,完成抱持等接触操作。
HumanPlus: Humanoid Shadowing and Imitation from Humans
直接研究 ACT 如何改成 HIT,连接全身采集、第一视角视觉与高 DoF 操作。
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
第三方向必读起点:动作块和 temporal ensembling,直接预测双臂关节目标。
Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation
从固定双臂扩展到移动操作,学习任务与底盘协同的数据配方。
SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control
最接近你定义的任务语义到全身低层动作,值得研究其多时尺度状态与残差后训练。
FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences
连接大规模合成示范、flow 策略后训练与真机 loco-manipulation。
Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation
研究几何动作之外的力接口,与你的接触丰富操作目标紧密相关。
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
学习通用人形操作模型的双系统架构和异构数据组合。
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
为大工作空间中的行走与操作协同提供强系统参照。
TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
作为关节空间表示与低频 VLA/高频执行的近期参照。
Scaling Behavior Foundation Model for Humanoid Robots
研究全身运动跟踪的规模化配方,理解能支撑操作策略的低层控制先验。
TWIST2: Scalable, Portable, and Holistic Humanoid Data Collection System
补齐便携、可扩展的 whole-body 数据来源与第一视角观测。
OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning
理解统一运动学姿态接口以及灵巧手与身体协调的数据采集。
TWIST: Teleoperated Whole-Body Imitation System
了解高度协调的全身技能如何由统一低层网络实现。
Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data
研究人类第一视角与机器人数据共同微调,与你的数据扩充需求相关。
EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data
考察人类 egocentric 数据规模如何服务灵巧操作。
DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation
用人手接口和外骨骼缩小运动学与视觉差距,适合双手数据采集设计。
DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation
理解可携带动捕、遮挡鲁棒性与动作重定向。
Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
为第一视角数据、延迟匹配与 action representation 提供基础设计经验。
RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
为双臂技能、域随机化、跨 embodiment 测试提供统一参照。
DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning
用少量示范合成大规模双手轨迹,适合构造可重复的 RL 与 IL 测试。
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
为实时推理与 action chunking 提供可实现基线,也连接 SimpleVLA-RL。
$\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
理解跨机器人、高层语义和低层动作的异构共训练,对双臂泛化有基础价值。
OpenVLA: An Open-Source Vision-Language-Action Model
了解标准 VLM 到动作 token 的基线,利于理解 VLA-RL 与微调差异。
$\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
理解高维连续动作块的 flow-matching VLA,是多篇后训练论文的起点。
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
构成 flow/diffusion VLA 和其 RL 后训练的技术前置。
DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control
读插件式 diffusion expert 与 VLM 的结合,理解动作专家设计。
World Action Models are Zero-shot Policies
用动作与未来视觉联合建模拓展泛化思路。
Causal World Modeling for Robot Control
研究因果视频世界建模如何服务机器人动作生成,作为 VLA 之外的结构参照。
Motubrain: An Advanced World Action Model for Robot Control
保留你已有的世界动作模型路线,用于比较视频先验与静态 VLM 先验。
没有匹配的论文。试试更短的关键词或清除筛选。
原有 26 个 PDF:按你的要求删除 AirSim360;一组字节完全相同的 BORA 合并;1 份 RL Token 中文译文单独保留。保留的原有独立论文为 23 篇,新增 42 篇,主库共 65 篇。
另外下载 π*0.6 v2、Q-VGM v5、MotuBrain v5,并补充 Ego-Pi 的 arXiv v1。四份原始文件位于旧版归档;Ego-Pi 原件未标版本,不擅自认定其修订号。其他原文件按字节保留。
文件名采用:初次预印本年份__方法名__可辨识题名__arXiv-ID版本.pdf。年份不等同正式会议年份。
来源采用 arXiv 原文、作者项目页和论文正文。检索包含双臂/双手 VLA、共享自主、触觉、动作块 offline-to-online RL、diffusion/flow 后训练、ACT 人形模仿与全身控制,并补查 2026 年 8–9 月相关工作。
65 篇均核对题名与来源,下载文件检查 PDF 格式、页数和 arXiv 编号;推荐理由基于摘要及相关方法内容。关键控制链路查到正文位置。未声称逐篇完整复现或系统性穷尽检索。
未单独核实所有论文的正式录用状态或开源资源完备性;统一以可核验的 arXiv 版本引用。不要跨论文直接比较不同硬件、任务和试验预算的成功率。
旧笔记正文保持原样,仅修复论文链接,可能不反映新版内容。目录与参考文献可离线使用;外部来源链接需要网络。检索截止:2026-10-02。