Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 52

AnyTeleop

23 min read · 8121 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过遥操作、灵巧手、运动重定向"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

要教机器人干活,得先有人"手把手"演示——这个"人远程操控机器人"的过程叫遥操作(teleoperation)。过去的视觉遥操作系统都是"一套系统只配一款机器人、一个环境",换机器人就得重做。AnyTeleop 做了一套通用系统:只用普通摄像头,就能操控任意机械臂+任意灵巧手,在仿真里、在真机上、甚至跨地理位置远程都能用,还支持多人协作。而且它虽然通用,性能却不输专用系统——真机 10 个任务里 8 个成功率更高,仿真里训出的模仿学习策略 6 个任务里 5 个更好。

所以这一节是想说:AnyTeleop 的核心就一句话——一套只靠摄像头的遥操作系统,通吃各种机器人/仿真器/相机配置,还性能不打折,为大规模采集机器人示范数据打地基。


这是个什么场景

想教机器人"把杯子叠起来"。最直接的办法:让人操控机器人亲手演示几十遍,把这些演示(示范)录下来,再用机器学习让机器人模仿。这就是**从示范学习(imitation learning)**的第一步——采数据。

问题在于"怎么操控"。灵巧手(多指机械手,自由度高)特别难操控。过去要么戴 VR 头盔、要么穿数据手套、要么贴动捕标记点、要么用力反馈手套——这些设备又贵、又难装、又麻烦

后来有了视觉遥操作:只用摄像头拍人的手,把人手的动作"翻译"成机器人手的动作。便宜、对操作者不打扰。但现有视觉遥操作系统有个大毛病:每套系统只为一款特定机器人、一个特定环境定制。比如某系统只支持 Kuka 臂 + Allegro 手,某系统的手部追踪模型只在特定摄影棚采的数据上训过。机器人型号一多、环境一变,就得从头再做——根本没法规模化采数据

AnyTeleop 要解的题:能不能做一套通用的视觉遥操作系统,一次支持各种机械臂、各种灵巧手、仿真和真机、各种相机配置、还能多人协作?

所以这一节是想说:采机器人示范数据靠遥操作,但现有视觉遥操作系统"一套只配一款机器人",规模化采数据卡在这——AnyTeleop 要做那个通用底座。


AnyTeleop — 场景示意:这论文要解决的现实问题
Plate Nº IAnyTeleop — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:专用硬件设备(VR、数据手套、动捕、力反馈) 用专业设备捕捉人手动作。类比:为了拍电影专门搭一个昂贵的动捕棚。问题:贵、装配麻烦、对操作者有侵入性,难以规模化。

  • 方案 B:为特定机器人定制的视觉遥操作(DexPilot、Telekinesis 等) 用摄像头,但系统写死了某款机器人。类比:一把钥匙只开一把锁。问题:依赖为特定机器人训练的重定向模型或碰撞检测模型,换机器人(如从 Allegro 换成 Shadow 手)就得重训重做,扩展性差。

  • 方案 C:绑定单一"现实"的系统(只在真机 / 只在某仿真器) 比如 HAPTIX 动捕只为 MuJoCo 环境开发。问题:要么只能真机、要么只能某个仿真器,无法同时兼顾"仿真里大规模采数据 + 真机验证 + 缩小 sim-to-real 差距"。

  • 方案 D:单人单机器人设置 大多系统只支持一个操作者控一个机器人。问题:教不了"机器人和机器人协作""机器人和人协作"这类需要多智能体的任务。

  • 核心难题:怎么把"任意机械臂+任意灵巧手""仿真+真机""任意相机""远程""多人协作"全塞进一套系统,而且性能还不能因为通用而变差?

所以这一节是想说:专用设备贵、专用系统换机器人就废、绑定单一现实、只支持单人——缺一个真正通用又高性能的遥操作系统。


这篇论文的新想法

类比:以前的遥操作系统像"定制西装"——合身但只合一个人;AnyTeleop 像一套"高级模块化系统",通过标准接口,能快速适配任何身材。

AnyTeleop 的核心判断:要通用,就必须去掉"为特定机器人训练的学习模型",改用不需要训练、只靠几何和优化就能实时算出来的模块。

三个关键设计:

  1. 免学习的重定向 + 免学习的碰撞避免:开发了一个高性能的运动重定向库(把人手动作实时翻译成机器人动作,不用训练模型),碰撞避免用 CUDA 加速的几何查询(也不用学习)。给新机器人时,只要提供它的运动学模型(URDF 文件)就能适配——不用重训任何模型。

  2. 模块化 + 标准软件接口:把遥操作系统拆成四个模块(手部检测、多相机融合、重定向、运动生成),每个模块有明确定义的输入输出接口。像乐高积木——换机器人、换相机、换仿真器/真机,只需替换对应积木。

  3. 面向通信的设计 + Web 可视化 + 容器化:重计算放在强力服务器上,操作者端轻量;开发了浏览器网页可视化器,实现跨互联网远程遥操作和多人协作同步;整个系统打包成 Docker 镜像,一键部署,免去装依赖的痛苦。

【定制系统 vs AnyTeleop 模块化】

旧(DexPilot/Telekinesis):为某款机器人训练重定向/碰撞模型
                          └▶ 换机器人 = 重训重做(扩展性差)

AnyTeleop(4 个可替换模块 + 标准接口):
  [手部检测] ─▶ [多相机融合] ─▶ [免学习重定向] ─▶ [免学习运动生成/避碰]
      │              │               │                    │
   换相机        换视角         换机器人只需URDF       仿真/真机通吃
  重计算在服务器 + Web 可视化 ─▶ 远程/多人协作;Docker 一键部署

所以这一节是想说:AnyTeleop 靠"免学习模块 + 标准接口 + 通信/Web/容器化"这三招,实现了"一套系统通吃"且不用为每款机器人重新训练。


它分几步做的(方法)

AnyTeleop 的核心是遥操作服务器,它吃摄像头画面,吐出机器人的平滑、无碰撞控制指令。整体架构如下:

 摄像头(RGB或RGB-D, 单个或多个)
   │
   ▼ [模块1] 手部姿态检测: MediaPipe出21关键点 + 手腕6D位姿
   │
   ▼ [模块2] 多相机检测融合: 用手当标记自动标定 + SMPL-X置信度选最优
   │
   ▼ [模块3] 手部重定向(优化): 人手关键点向量 → 机器人手关节角
   │
   ▼ [模块4] 运动生成(CuRobo): 25Hz末端位姿 → 120Hz无碰撞关节轨迹
   │
   ▼ 通过网络发给客户端 → 控制仿真/真机机器人
   │
 [Web可视化器] meshcat+Three.js, 浏览器远程看画面/多人同步

下面逐个模块拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 模块一:手部姿态检测(看懂人手在哪、怎么弯)

类比:先看清人手的骨架长什么样、手腕朝哪。

输入:一个或多个摄像头的 RGB 或 RGB-D 画面。

处理

  • 手指关键点检测:用 MediaPipe(一个轻量、只用 RGB、能在 CPU 上实时跑的手部检测工具),定位 21 个手部关节的 3D 坐标(在手腕坐标系里)和 2D 图像坐标。只需要 RGB。
  • 手腕位姿检测(RGB-D 版):用检测到的关键点像素位置去深度图取深度值,配合相机内参算出关键点的 3D 位置,再用 PnP(Perspective-n-Point,透视 n 点)算法估计手腕 6D 位姿。
  • 手腕位姿检测(纯 RGB 版):朝向可以直接从关键点局部位置解析算出;但位置没有深度就难定。借鉴 FrankMocap 的做法,加一个小神经网络预测手的"弱透视变换缩放系数"(弱透视假设物体离相机比它自身尺寸远),配合内参近似出手的 3D 位置。误差比深度相机大,但很多任务够用。

输出:手指关键点局部位置 + 手腕全局 6D 位姿。

小结:MediaPipe 出手指关键点,RGB-D 用 PnP、纯 RGB 用弱透视网络估手腕位姿——设计原则是"有深度就用深度,没有也能靠单 RGB 干活"。

5.2 模块二:多相机检测融合(多角度看,防遮挡)

类比:一个人从一个角度看你的手会被手指互相遮挡,多找几个人从不同角度看再综合。

输入:多个相机各自的手部检测结果。

处理:多相机融合有两个难点——(1) 每个相机只在自己的坐标系里估手,坐标系不统一;(2) 没有现成指标衡量哪个相机的检测更可信。

  • 难点一(自动标定):用人手当天然标记物。取前 N 帧多相机的检测结果,算出相机之间的相对旋转(在 SO(3) 群里表示)。发现纯 RGB 下手的绝对位置不准,但相邻帧之间的相对运动更鲁棒。有了相机间朝向,就能把不同相机的相对运动转到同一坐标系。
  • 难点二(置信度):借鉴 Qin et al.,用检测模块预测的 SMPL-X 手形状参数当置信度线索。同一操作者的真实手形状应该恒定,自遮挡时预测的形状参数误差会变大——且形状误差大往往对应位姿误差大。取前 N 帧形状参数均值当参考,实时比对误差。要求操作者前 N 帧张开手指以获得准确参考。选置信度最高的相机的相对运动往下传。实现里 N=50

输出:融合后、统一坐标系下的最可信手部运动。

小结:用人手当标记自动标定多相机、用 SMPL-X 形状参数误差当置信度选最优相机——多相机既解自遮挡又不需要外参标定。

5.3 模块三:手部重定向(把人手翻译成机器人手)

类比:人手和机器人手结构不一样(手指数、长度不同),得找一组机器人关节角,让机器人手"摆出和人手最像的姿势"。

输入:人手关键点向量。

处理:把重定向写成一个优化问题——找机器人手关节角 q_t,让"人手关键点向量"和"机器人手前向运动学算出的关键点向量"差距最小,同时加一个平滑惩罚项(让相邻时刻的关节角别跳变),并满足关节上下限约束。公式(人话):

最小化 [ α·人手关键点 − 机器人手关键点(q) ]² + β·[ q_t − q_{t-1} ]²,约束 q 在关节范围内。

其中 α 是缩放系数(补偿人手和机器人手大小差异),β 是平滑权重。换不同形态的手(如 D'Claw)时,只需手动指定机器人手指和人手指的关键点对应关系。这个模块只管手,不管臂。

输出:机器人手的关节角。

小结:把"人手→机器人手"写成"关键点对齐 + 平滑 + 关节限制"的优化,免训练、换手只需改对应关系。

5.4 模块四:运动生成(让机械臂平滑无碰撞地到位)

类比:手的姿势有了,还得让整条手臂平滑、不撞东西地把手送到目标位置。

输入:检测到的手腕/末端目标位姿(低频,25Hz)。

处理:要实时又平滑又无碰撞。前人(DexPilot)用黎曼运动策略(RMP)实时算加速度场,但朝目标的加速度不保证自然轨迹。AnyTeleop 改用 CuRobo——一个 GPU 高度并行、无碰撞的机器人运动生成库,实时生成自然、反应式的机器人运动。它接收 25Hz 的末端笛卡尔位姿,在关节限制内生成 120Hz 的无碰撞关节空间轨迹,交给阻抗控制器在仿真或真机上安全执行。

输出:120Hz 的无碰撞关节轨迹。

小结:CuRobo 用 GPU 并行把 25Hz 的目标位姿变成 120Hz 的平滑无碰撞轨迹,比 RMP 更自然、能保证无自碰撞。

5.5 Web 可视化器与整体设计原则(远程 + 协作)

类比:给远方的操作者开一扇"能看到机器人现场"的窗户,还能让两个人看同一个场景一起干活。

输入:仿真/真机的状态。

处理:基于 meshcat 库开发、用 Three.js 渲染的浏览器可视化器。每次仿真迭代后把结果推到浏览器,操作者从浏览器窗口获得视觉反馈、移动手来控制机器人。支持同步可视化——两个操作者做同一协作任务时,各自本地视口看到的是同步的同一场景。整个系统遵循三原则:模块化(各模块标准输入输出接口)、面向通信(重计算放服务器、支持远程和协作)、容器化(Docker 一键部署)。

输出:可远程访问、可多人同步的可视化 + 一套易部署的通用系统。

小结:meshcat+Three.js 的网页可视化器实现跨互联网远程与多人同步,配合模块化/通信/容器化三原则,让系统既通用又好部署。


AnyTeleop — 方法示意:核心 pipeline
Plate Nº IIAnyTeleop — 方法示意:核心 pipeline

关键数字(What works)

数字来自原文,重点看"通用系统"到底有没有牺牲性能。

数字 1:真机遥操作(AnyTeleop vs 专用系统 Telekinesis,成功率)

同一台 XArm6 机器人 + Allegro 手,复现 Telekinesis 的 10 个任务,各跑 10 次。

任务 AnyTeleop Telekinesis(专用)
Pickup Box Object 1.0 0.9
Pickup Fabric Toy 1.0 0.9
Box Rotation 0.6 0.6
Scissor Pickup 0.8 0.7
Cup Stack 0.9 0.6
Two Cup Stacking 0.7 0.3
Pouring Cubes onto Plate 0.7 0.7
Cup Into Plate 1.0 0.8
Open Drawer 1.0 0.9
Open Drawer and Pickup 0.9 0.6

关键含义:AnyTeleop 在 8/10 任务上成功率更高、2/10 持平。通用系统竟然打赢了为该硬件专门定制的系统——尤其在薄壁物体(叠杯)上优势明显,因为优化式重定向能更好地闭合指尖距离。

数字 2:仿真模仿学习(SAPIEN,用不同系统采的数据训同一算法,成功率)

任务(arm-hand 变体) RL Baseline[43] AnyTeleop
Relocate 33.7±29.3 40.3±36.7 70.0±9.8
Flip Mug 31.0±28.7 36.0±32.4 53.7±24.0
Open Door 34.7±31.7 51.3±30.7 79.7±15.5

关键含义:用 AnyTeleop 采的数据训出的模仿学习策略,在 arm-hand(手臂+手)设置下大幅领先——因为它采的轨迹更平滑、且显式支持臂手系统并保证无自碰撞,而基线靠重定向生成臂轨迹容易自碰撞。整体 6 个任务里 5 个更好。

数字 3:相机配置对比(IsaacGym 弹钢琴任务)

相机配置 完成时间 错误率
单 RGB 109s 28.1%
单 RGB-D 87s 21.8%
双 RGB-D 74s 12.5%

关键含义:只用单个 RGB 也能干活;加深度、加相机数量,完成更快、错误更少——用户可按需在"成本 vs 效率"间权衡。

数字 4:各模块耗时(Profiling,同机同时跑)

模块 台式(RTX3090) 笔记本(RTX2070)
手部姿态(RGB) 26±5 ms 34±5 ms
融合 1±0 ms 1±0 ms
重定向 9±7 ms 10±9 ms
运动生成 8±3 ms 11±5 ms

关键含义:最耗时的是手部检测(跑在 GPU 上),设计上限 25Hz,台式和笔记本都能满足。运动生成想跑满 120Hz 需要单独机器——面向通信的设计正是为此。

所以这一节是想说:数字证明三件事——通用系统性能不输甚至超过专用系统、采的数据更利于模仿学习、且能灵活权衡相机成本与效率。


实验结果说明了什么

问题一:为了通用,性能会不会打折? 不会,反而更好。同一台 XArm6+Allegro 上,通用的 AnyTeleop 在 8/10 任务超过专门为该硬件定制的 Telekinesis。关键在于优化式重定向能精确闭合指尖距离(抓薄壁杯子更稳),而基于网络的重定向难以把人的精细捏取翻译给机器人。这说明"免学习的优化方法"在通用性和精度上都可能优于"为特定机器人训练的模型"。

问题二:采的数据质量对下游模仿学习有多重要? 非常重要。用 AnyTeleop 采的数据训出的策略在 arm-hand 设置下大幅领先(Open Door 79.7 vs 51.3)。两个原因:(1) 轨迹更平滑,状态-动作对更一致,网络更好学;(2) 显式支持臂手系统并保证无自碰撞,而基线用重定向生成臂轨迹会有自碰撞。这提示我们:遥操作系统的质量直接决定了下游学习的天花板。

问题三:单 RGB 相机够用吗? 够用但有取舍。弹钢琴任务里单 RGB 也能完成(109s、28.1% 错误),加深度和相机能显著提升(双 RGB-D 74s、12.5%)。这个"可降级、可升级"的特性让系统既能低成本部署、又能在需要时提精度。

问题四:能做以前做不到的事吗? 能。AnyTeleop 首次实现了视觉遥操作下的灵巧手协作操作——两个操作者(可不在同一地点)各控一个机器人,协作完成物体交接。这是靠模块化设计 + Web 可视化实现的,是文献里之前没有的。

所以这一节是想说:实验回答了四个问题——通用不牺牲性能、数据质量决定下游天花板、单 RGB 可用且可升级、还首次实现了跨地点灵巧手协作。


你应该懂的几个新词

遥操作(teleoperation):人远程操控机器人。是采集机器人示范数据、教机器人干活的主要手段。

灵巧手(dexterous hand):多指机械手(如 Allegro、Shadow),自由度高、能做精细操作,但也特别难操控。

视觉遥操作(vision-based teleoperation):只用摄像头拍人手来操控机器人,比 VR/手套/动捕便宜、不侵入。

运动重定向(motion retargeting):把人手的动作"翻译"成结构不同的机器人手的动作,本文用优化实现。

MediaPipe:谷歌的轻量手部检测工具,只用 RGB、CPU 实时出 21 个手关键点。AnyTeleop 的手部检测底座。

PnP(Perspective-n-Point)算法:已知一组 3D 点及其 2D 投影,反解相机/物体位姿。用于 RGB-D 手腕位姿估计。

弱透视变换(weak perspective):假设物体离相机远于其自身尺寸的简化相机模型,用一个缩放系数近似 3D 位置。纯 RGB 估手腕位置用。

SMPL-X:一个参数化人体/手模型,其形状参数在本文被用来当"检测置信度"的线索。

CuRobo:NVIDIA 的 GPU 并行、无碰撞机器人运动生成库。AnyTeleop 的运动生成模块。

URDF:描述机器人运动学结构的标准文件。AnyTeleop 靠它免训练适配新机器人。

模仿学习 / 从示范学习(imitation learning):让机器人模仿人类示范来学技能。遥操作是它的数据来源。

所以这一节是想说:这些词是读任何"遥操作 + 灵巧手 + 数据采集"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 快速手部运动会丢追踪:论文明确列出的失败模式一——人手动作太快时会丢失追踪,触发暂停和重检测。变通办法是让操作者放慢手速。
  • 自遮挡下手部姿态不可靠:失败模式二——手与相机平面垂直等自遮挡情况下检测不准。需要多相机才能缓解,单相机做不到。
  • 纯 RGB 手腕位置误差大:没有深度时靠弱透视网络近似位置,误差明显大于 RGB-D。精细任务仍建议用深度相机。
  • 重定向需人工指定映射:换到差异大的手形态(如 D'Claw)时,需要手动指定机器人手指和人手指的关键点对应关系,不是全自动。
  • 满频运动生成需独立机器:想跑满 120Hz 运动生成,在单机同时跑所有模块难达标,得靠面向通信的设计把控制模块放到单独机器上。
  • 仍需人在环、需训练操作者:实验里由"训练过的操作者"执行,遥操作本质上还是要人实时参与,不是自动化采数据。

所以这一节是想说:AnyTeleop 做到了通用高性能,但快速运动丢追踪、自遮挡、纯 RGB 精度、需人工映射和满频算力这些工程约束仍在。


它和别的论文是什么关系

  • 上游(被它借用)
    • MediaPipe / FrankMocap / SMPL-X:手部检测、纯 RGB 位姿近似、形状参数置信度的来源。
    • CuRobo(Sundaralingam et al. 2023):运动生成的核心库。
    • DexPilot(Handa et al. 2020):视觉遥操作臂手系统的前驱,AnyTeleop 改进了它的重定向和运动生成(RMP→CuRobo)。
    • Qin et al. 2022(单相机遥操作):多相机融合置信度思路的来源,也是仿真对比基线。
  • 对比关系
    • Telekinesis(Sivakumar et al. 2022):真机对比基线,AnyTeleop 8/10 更优。
    • 各专用系统(DexPilot、Holo-Dex、TeachNet 等):表 I 系统对比中,AnyTeleop 是唯一支持多种臂 + 协作、且是仅有的两个支持多种灵巧手之一。
  • 下游 / 同族:AnyTeleop 是"用遥操作规模化采灵巧操作数据"这条线的基础设施,和本仓库的 dexcap、dexmv(从人类视频/动捕学灵巧操作)、以及 aloha 系列(低成本双臂遥操作)同族。它采的数据直接喂给模仿学习(如 Diffusion Policy、dp3)。

所以这一节是想说:AnyTeleop 站在 MediaPipe + CuRobo + DexPilot 的肩膀上,做出了一套通用遥操作底座,为整个"采数据→模仿学习"流水线提供了可规模化的入口。


和本导读的关系

本笔记对应导读 Ch14:模仿学习 中"数据从哪来"的部分。

导读 Ch14 讲了模仿学习的完整链条:采数据(遥操作/示范)→ 学策略(行为克隆、Diffusion Policy 等)→ 泛化部署。AnyTeleop 深入的正是最上游、最容易被忽视的一环——采数据的工具。很多人只关注策略算法,但数据的质量(平滑、无自碰撞、多样)直接决定策略的上限,本文的实验就证明了这点。读完本笔记,建议:接着看 dexcap / dexmv(另两种采灵巧操作数据的方式——动捕手套、人类视频),再看 diffusion-policy / bet(拿这些数据训策略的算法)。把"采数据→学策略"连起来,才是模仿学习的全貌。

所以这一节是想说:本笔记是导读 Ch14"数据来源"这一环的深度展开,读它能理解为什么"好的遥操作系统"是模仿学习不可或缺的地基。


思考题

以下问题检验你是否真正理解了 AnyTeleop 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:AnyTeleop 为了"通用",特意避免使用"为特定机器人训练的学习模型",改用免学习的优化和几何方法。这个选择的深层原因是什么?

提示

因为"为特定机器人训练的模型"天生和那款机器人/环境绑定——换机器人就得重新采数据、重新训练,这正是旧系统无法规模化的根源。免学习的方法(优化式重定向、几何碰撞查询)只依赖机器人的运动学模型(URDF),给个新机器人的 URDF 就能立刻适配,不需要任何训练数据。这是"通用性"的必要条件。有意思的是,实验还证明免学习的优化式重定向精度甚至超过基于网络的重定向(抓薄壁杯子更稳)——所以这个选择不仅换来通用,还换来更好的精度。

Q2:多相机融合时,论文用"人手当天然标记物"来自动标定相机间的相对位姿。为什么不用传统的棋盘格标定?用手当标记有什么巧妙之处和局限?

提示

巧妙之处:遥操作时人手本来就在场景里、且被所有相机看到,用它当标记就免去了额外摆棋盘格、做标定流程的麻烦——真正实现"即插即用、零标定负担",这正是通用系统需要的。做法上,论文发现纯 RGB 下手的绝对位置不准,但相邻帧的相对运动更鲁棒,所以用前 50 帧算相机间的相对旋转。局限:精度不如专业棋盘格标定;依赖手在多相机中都可见;且要求操作者初始张开手指以获得稳定参考。这是"部署便利性"和"标定精度"之间的权衡。

Q3:论文用 SMPL-X 的"手形状参数误差"来当作检测置信度。为什么形状参数误差能反映位姿检测的可信度?

提示

关键洞察:同一个操作者的真实手形状是恒定不变的。所以理想情况下,不管手怎么动,检测出的形状参数都应该一样。但当自遮挡发生(手指互相挡住)导致检测困难时,模型对形状参数的预测就会出错、偏离真值。论文观察到"形状参数误差大"往往和"位姿误差大"同时出现——因为它们源于同一个困难(自遮挡使检测不可靠)。于是就能用"形状参数偏离参考值的程度"当作一个免费的置信度代理,去挑选当前最可信的那个相机。这是一个聪明的间接度量。

Q4:运动生成模块接收 25Hz 的末端位姿,却输出 120Hz 的关节轨迹。为什么要做这个"低频进、高频出"的转换?

提示

因为两端的需求不同。手部检测受限于摄像头帧率和检测计算量,只能到 25Hz——这是"人手意图"的更新频率,够用。但机器人要平滑、安全地运动,底层控制器需要高频(120Hz)的关节指令,否则轨迹会顿挫、甚至危险。所以 CuRobo 的作用是"插值+规划":把稀疏的目标位姿(25Hz)扩展成密集、平滑、无碰撞的关节轨迹(120Hz),交给阻抗控制器执行。这解耦了"人的意图频率"和"机器人的控制频率",是遥操作系统的关键工程设计。

Q5:实验发现用 AnyTeleop 采的数据训出的模仿学习策略在"arm-hand"(手臂+手)设置下优势特别大。为什么手臂的加入会放大数据质量的影响?

提示

因为手臂引入了自碰撞和轨迹平滑的新难题。基线系统只能采"浮空手"(floating hand)数据,再用重定向硬转成臂手数据,这个转换容易产生手臂自碰撞、轨迹不平滑。AnyTeleop 则显式支持臂手系统、且 CuRobo 保证无自碰撞、轨迹自然。对模仿学习来说,训练数据里如果有大量自碰撞、跳变的坏样本,网络就学到坏行为;数据越平滑一致,网络越好学。手臂自由度多、更容易产生这些问题,所以数据质量的差异在 arm-hand 设置下被放大了。这也解释了为什么 Flip Mug 是唯一例外——带臂采集该任务本身太难,影响了数据质量。

Q6:AnyTeleop 支持"仿真 + 真机"两种现实。为什么同时支持这两者对机器人学习特别重要?

提示

因为它们互补,缺一不可。仿真的优势:不需要真机硬件就能大规模、并行采数据,且有"上帝视角"的完整世界信息(物体真实位姿等),成本低、安全。真机的优势:没有仿真到现实的差距(sim-to-real gap),采的数据直接可用于真实部署。同时支持两者,就能"在仿真里海量采数据预训练 + 在真机上采少量数据微调/验证 + 研究如何缩小 sim-to-real 差距"。旧系统绑定单一现实(只真机或只某仿真器),无法打通这条完整链路。用同一套系统同时支持两者,还能保证仿真和真机采集流程一致,减少额外的不一致误差。

Q7:如果让你用 AnyTeleop 去大规模采集数据训练一个通用操作策略,你会怎么设计采集流程来最大化数据的价值?会遇到什么瓶颈?

提示

设计思路:(1) 利用其通用性,用多种机械臂+多种灵巧手采集同一批任务,获得跨机体的多样数据,利于训练泛化策略;(2) 用其仿真+真机能力,先在仿真里海量并行采集打底,再用真机少量数据校正 sim-to-real;(3) 用多相机配置提升数据质量(减少遮挡、更准),关键任务用双 RGB-D;(4) 利用协作能力采集多机器人协作数据。瓶颈:仍需人在环实时操作,采集速度受限于人(不是自动化);需要训练操作者;快速运动和自遮挡会产生坏样本需过滤;纯 RGB 精度不足以支撑最精细的任务;满频运动生成的算力需要多机部署。核心瓶颈是"人的参与"——这也是后续工作(如从人类视频学、自主数据生成)想突破的方向。

所以这一节是想说:能回答这 7 题,你就真正理解了 AnyTeleop 为什么用免学习模块、用手做标定、用形状参数当置信度、低频进高频出,以及数据质量对下游学习的决定性影响。


一些好奇心问答(FAQ)

Q1:AnyTeleop 到底"通用"在哪? 五个维度:任意臂+手(给 URDF 就行)、任意现实(仿真或真机)、任意地点(Web 远程)、任意相机配置(RGB/RGB-D、单/多)、任意数量操作者-机器人组合(支持协作)。

Q2:只用一个普通摄像头真的能操控灵巧手吗? 能。用 MediaPipe 从单 RGB 出 21 个手关键点,纯 RGB 靠弱透视网络近似手腕位置。精度不如 RGB-D,但很多任务够用(弹钢琴单 RGB 也能完成)。

Q3:它需要给每个机器人重新训练模型吗? 不需要。重定向和碰撞避免都是免学习的,给新机器人只需提供 URDF 运动学模型。这是它能通用的关键。

Q4:为什么强调"面向通信"的设计? 因为重计算(手部检测、运动生成)可以放在强力服务器上,操作者端只要一台带摄像头的普通电脑+浏览器。这样既支持跨互联网远程和多人协作,又降低操作者端的算力要求。

Q5:和 ALOHA 那种双臂遥操作比呢? ALOHA 用"主从臂"物理设备遥操作双臂夹爪;AnyTeleop 用纯视觉操控任意臂+灵巧手。两者都是采数据的遥操作系统,但 AnyTeleop 更通用、更便宜(只要摄像头)、专攻灵巧手。

Q6:为什么它对模仿学习这么重要? 因为模仿学习的上限由数据质量决定。AnyTeleop 采的轨迹平滑、无自碰撞、多样,实验证明用它的数据训出的策略明显更好。它是"采数据"这个上游环节的高质量工具。

所以这一节是想说:AnyTeleop 的实操问题(通用维度、单相机可行性、免训练、通信设计、与 ALOHA 区别、对模仿学习的价值)都有明确答案。


如果你想再深入

按"前驱系统 → 核心组件 → 数据用途 → 同族"排序:

  1. 前驱系统:DexPilot(Handa et al. 2020) — 视觉遥操作臂手系统的直接前身,理解 AnyTeleop 改进了什么(RMP→CuRobo)。
  2. 核心组件:CuRobo(Sundaralingam et al. 2023) — GPU 无碰撞运动生成,理解运动生成模块。
  3. 手部检测:MediaPipe Hands / FrankMocap — 理解手关键点和纯 RGB 位姿估计。
  4. 数据用途:Diffusion Policy / dp3 / BeT — 拿遥操作采的数据训策略的算法,本仓库有深读笔记。
  5. 同族采数据:DexCap / DexMV / ALOHA — 其他采灵巧操作数据的方式(动捕手套、人类视频、双臂主从),本仓库有相关笔记。

所以这一节是想说:把 DexPilot + CuRobo + Diffusion Policy 连起来读,就能看清"采数据→学策略"这条模仿学习流水线的全貌。


原文信息

BibTeX

@inproceedings{qin2023anyteleop,
  title     = {AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System},
  author    = {Qin, Yuzhe and Yang, Wei and Huang, Binghao and Van Wyk, Karl and Su, Hao and Wang, Xiaolong and Chao, Yu-Wei and Fox, Dieter},
  booktitle = {Proceedings of Robotics: Science and Systems (RSS)},
  year      = {2023}
}

链接

所以这一节是想说:这是 Qin et al. 2023 年的工作(RSS 发表),用"免学习模块 + 模块化 + 通信/Web/容器化"做出了一套通用高性能的视觉遥操作系统,为大规模采集机器人示范数据打下地基。

引用本笔记 / Cite this note
BibTeX
@online{eai_anyteleop_2026,
  title       = {(readable note) AnyTeleop},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/anyteleop/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?