摘要:面向"从人类演示数据让机器人学习技能"的纵深路线,从时序建模基础到 ASE / Diffusion Policy,按 Stage 0–6 串通核心方法;本路线是 运动控制主路线 的一条分支。
flowchart LR
S0["<b>Stage 0</b><br/>时序建模基础<br/><em>LSTM / Transformer</em>"]
S1["<b>Stage 1</b><br/>BC / DAgger<br/><em>核心概念</em>"]
S2["<b>Stage 2</b><br/>Motion Retargeting<br/><em>MoCap → 机器人</em>"]
S3["<b>Stage 3</b><br/>Diffusion Policy<br/><em>生成式动作</em>"]
S4["<b>Stage 4</b><br/>Skill Embedding<br/><em>ASE / 对抗式</em>"]
S5["<b>Stage 5</b><br/>Sim2Real<br/><em>真机迁移</em>"]
S6["<b>Stage 6</b><br/>进阶方向<br/><em>Video / 多模态 / 长时程</em>"]
S0 --> S1 --> S2 --> S3 --> S4 --> S5 --> S6
classDef stage fill:#142a3a,stroke:#9b59b6,stroke-width:2px,color:#fff
class S0,S1,S2,S3,S4,S5,S6 stage
- 目标读者是有深度学习基础、想理解如何让机器人从人类演示中学习技能的人
- 重点不是理论证明,而是:从数据到策略的完整 pipeline
- 每个阶段都有前置知识、核心问题、推荐做什么、推荐读什么、学完输出什么
和主路线的关系:
- 模仿学习(IL)和强化学习(RL)在很多实际项目里是组合使用,不是非此即彼
- 本路径和 RL 纵深 在 Stage 3 之后有很多交叉
- 如果你不知道该走哪条,先走 IL 路径,因为它更容易出可感知的结果
如果已经有 PyTorch 熟练度和序列模型基础,可以跳过。
- Python 熟练
- 理解 MLP、loss、梯度反向传播
- 知道什么叫监督学习
- 序列数据(关节角、MoCap、动作)怎么用神经网络建模
- RNN / LSTM / Transformer 在时序建模上的核心区别是什么
- diffusion model 在生成式建模里是什么角色
- 用 PyTorch 跑一个 LSTM 预测简单时序数据的 Demo
- 对比 MLP 和 LSTM 在时序任务上的表现差异
- "Illustrated Guide to LSTM" (Google Blog)
- Transformer 与 Diffusion Model(本仓库)
- 跑通一个 Motion Transformer 官方 Demo(如果能访问)
- 能解释为什么时序数据需要特殊建模方法
- 能用 LSTM 对简单序列做预测
- Stage 0 内容
- 理解什么是监督学习
- Behavior Cloning 的核心思想是什么
- 为什么 BC 会有 compounding error(复合累积误差)
- DAgger 为什么能缓解 compounding error
- 模仿学习和强化学习的根本区别是什么
- 用 BC 训练一个简单机械臂跟随演示轨迹
- 对比 BC 和 DAgger 在长时程任务上的效果差异
- "A Reduction of Imitation Learning and Stochastic Gradient Descent to Online Learning" (Ross & Bagnell, 2010)
- Imitation Learning(本仓库)
- Behavior Cloning 与 DAgger(本仓库)
- RL vs IL 对比(本仓库)
- 能解释 compounding error 是什么、为什么出现
- 能在简单任务里用 BC 训练一个可用的策略
这是人形机器人技能学习的核心技术:从人类动作到机器人动作。
- Stage 1 内容
- 理解 kinematics 和 inverse kinematics 基础
- 为什么不能直接把人类关节角度映射到机器人(骨骼结构不同)
- 怎么用 IK 或 learning-based 方法做 retargeting
- 人体动作数据的不同来源(MoCap、VRI、视频)各有什么优缺
- retargeting 后的数据还需要哪些后处理(时间对齐、重采样、姿态约束)
- 用一套 MoCap 数据,通过 IK 或 retargeting 方法迁移到人形机器人模型上
- 观察迁移后动作的可行性(关节限位、自碰撞、地面穿透)
- Motion Retargeting 与 Motion Retargeting Pipeline(本仓库)
- GMR vs NMR vs ReACTOR 重定向方案对比(本仓库)
- 人形参考动作数据集对比(本仓库)
- "ASE: Adversarial Skill Embeddings" (Peng et al., 2022) — 有 retargeting pipeline 描述
- 一段成功 retargeting 到人形机器人模型上的人类走路数据
- 对骨骼结构差异导致的问题有第一手直觉
Diffusion Policy 是 2023-2024 年在机器人模仿学习里最活跃的方向。
- Stage 2 内容
- 理解 diffusion model 的基本原理(不需要能写,但需要懂去噪过程)
- Diffusion Policy 和传统 BC 的核心区别是什么
- 为什么 diffusion model 在高维动作空间表现更好
- 怎么把视觉输入结合进 diffusion policy
- diffusion 采样时间过长怎么解决
- 用一个开源 Diffusion Policy 实现(如 RoboDiff、Diffusion Policy 官方)跑一个简单任务
- 对比 diffusion policy 和 LSTM BC 在同样任务上的效果
- "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion" (Chi et al., 2023)
- Diffusion Policy(本仓库)
- Action Chunking 与 BC with Transformer(本仓库)— ACT 一系的核心机制
- 一个用 Diffusion Policy 训练的动作策略
- 能解释 diffusion process 在机器人动作生成里的优势
单个技能会了,怎么让机器人同时掌握多个技能、并在新场景里组合?
- Stage 3 内容
- 什么是 skill embedding,为什么需要把技能压缩到隐空间
- 对抗式模仿学习(ASE)和普通 BC 的区别是什么
- 怎么在一个隐空间里做技能插值和组合
- 为什么 latent variable 能帮助解决 compounding error
- 读懂 ASE 的方法 pipeline
- 在能找到的开源代码上跑一个 two-skill interpolation 实验
- ASE 与 AMP Reward(本仓库)
- Learning from Play (LMP)(本仓库)
- 人形 AMP / Motion Prior 综述地图(本仓库)— AMP 家族全景
- "Learning Latent Plans from Play" (Lynch et al., 2020)
- 能解释 skill embedding 的意义
- 对对抗式学习方法在机器人技能学习里的作用有直观理解
模仿学习训练的策略,迁移到真实机器人上会遇到哪些问题?
- Stage 4 内容
- 理解 sim2real gap 的基本概念
- IL 训练数据和真实机器人动作空间的差异怎么处理
- 观测空间不匹配(相机角度、传感器噪声)怎么处理
- 在线微调(online fine-tuning)对 IL 策略有没有用
- 怎么判断一个 IL 策略是"真的学会了"还是"在记忆演示"
- 给 Stage 2/3 训练的策略加动作空间噪声和观测噪声,观察鲁棒性
- 设计一个简单的 domain randomization 实验
- Sim2Real(本仓库)
- Domain Randomization(本仓库)
- 对 IL 策略的 sim2real 差距有第一手认识
- 能设计针对性的 DR 实验来提升策略鲁棒性
- Stage 5 内容
方向 A:Video-based IL
- 用 RGB 视频而非 MoCap 做动作迁移
- 关键词:Pose estimation、Video imitation、Mimic-Video、WiLoR
方向 B:Multi-modal IL
- 结合视觉、触觉、力传感器做多模态技能学习
- 关键词:multimodal、haptic、视触融合
方向 C:Long-horizon 任务 / VLA
方向 D:Humanoid 全身动作跟踪
- 走路、跑步、跳跃、平衡等全身技能跟踪
- 关键词:Whole-Body Tracking Pipeline、BeyondMimic、Sonic
- 选型参考:Query:人形动作跟踪方法选型
| 阶段 | 核心问题 | 本仓库入口 |
|---|---|---|
| Stage 0 | 时序建模基础 | Transformer |
| Stage 1 | BC / DAgger | Behavior Cloning |
| Stage 2 | Motion Retargeting | Motion Retargeting Pipeline |
| Stage 3 | Diffusion Policy | Diffusion Policy |
| Stage 4 | Skill Embedding | ASE |
| Stage 5 | Sim2Real | Sim2Real |
- 完整成长路线参考:主路线:运动控制算法工程师成长路线
- 其它纵深路径:
- 遥操作(人形全身遥操作 + 手指遥操作 → 示范数据/实时接管)
- 人形 RL 运动控制
- 力矩控制电机设计(指标 → 电磁热 → FOC 力矩闭环)
- 传统模型控制(LIP/ZMP → MPC → WBC)
- 人形整机硬件设计(指标预算 → 机械 → 电气 → 通信 → 整机验收)
- 安全控制(CLF/CBF)
- 接触丰富的操作任务
- 感知越障(Perceptive Locomotion)
- 导航(SLAM → VLN → 导航 VLA)
- Loco-Manipulation(移动操作)
- 动作重定向(人体动作 → 机器人参考轨迹) — Stage 2 的展开版
- 动作生成(文本/多模态 → 人形动作) — Stage 3 生成式建模在人体动作侧的展开版
- VLA(视觉-语言-动作模型) — Stage 6 方向 C 的展开版
- WAM(世界–动作模型)
- BFM(人形行为基础模型) — Stage 6 方向 D 的展开版
- 人形足球(全向行走 → 感知踢球 → 多机战术)
- 人形群控展演(群舞同步 → 编队走位 → 群体特技)
- 人形拳击(动作跟踪 → 潜空间技能 → 对抗自博弈)
- Sim2Real(域差画像 → 执行器对齐 → 鲁棒训练 → 真机部署)
- Real2Sim(真实世界 → 可仿真资产/场景/孪生)
- 人形控制全景图:Humanoid Control Roadmap
- 技术栈地图:tech-map/dependency-graph.md
本路线基于以下原始资料的归纳:
- Imitation Learning
- Behavior Cloning
- DAgger
- Motion Retargeting
- "Diffusion Policy" (Chi et al., 2023)
- "ASE: Adversarial Skill Embeddings" (Peng et al., 2022)