AnyTeleop
这是一份写给"没接触过遥操作、灵巧手、运动重定向"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。
一句话讲什么(TL;DR)
要教机器人干活,得先有人"手把手"演示——这个"人远程操控机器人"的过程叫遥操作(teleoperation)。过去的视觉遥操作系统都是"一套系统只配一款机器人、一个环境",换机器人就得重做。AnyTeleop 做了一套通用系统:只用普通摄像头,就能操控任意机械臂+任意灵巧手,在仿真里、在真机上、甚至跨地理位置远程都能用,还支持多人协作。而且它虽然通用,性能却不输专用系统——真机 10 个任务里 8 个成功率更高,仿真里训出的模仿学习策略 6 个任务里 5 个更好。
所以这一节是想说:AnyTeleop 的核心就一句话——一套只靠摄像头的遥操作系统,通吃各种机器人/仿真器/相机配置,还性能不打折,为大规模采集机器人示范数据打地基。
这是个什么场景
想教机器人"把杯子叠起来"。最直接的办法:让人操控机器人亲手演示几十遍,把这些演示(示范)录下来,再用机器学习让机器人模仿。这就是**从示范学习(imitation learning)**的第一步——采数据。
问题在于"怎么操控"。灵巧手(多指机械手,自由度高)特别难操控。过去要么戴 VR 头盔、要么穿数据手套、要么贴动捕标记点、要么用力反馈手套——这些设备又贵、又难装、又麻烦。
后来有了视觉遥操作:只用摄像头拍人的手,把人手的动作"翻译"成机器人手的动作。便宜、对操作者不打扰。但现有视觉遥操作系统有个大毛病:每套系统只为一款特定机器人、一个特定环境定制。比如某系统只支持 Kuka 臂 + Allegro 手,某系统的手部追踪模型只在特定摄影棚采的数据上训过。机器人型号一多、环境一变,就得从头再做——根本没法规模化采数据。
AnyTeleop 要解的题:能不能做一套通用的视觉遥操作系统,一次支持各种机械臂、各种灵巧手、仿真和真机、各种相机配置、还能多人协作?
所以这一节是想说:采机器人示范数据靠遥操作,但现有视觉遥操作系统"一套只配一款机器人",规模化采数据卡在这——AnyTeleop 要做那个通用底座。

之前的人怎么做的,为什么不够好
方案 A:专用硬件设备(VR、数据手套、动捕、力反馈) 用专业设备捕捉人手动作。类比:为了拍电影专门搭一个昂贵的动捕棚。问题:贵、装配麻烦、对操作者有侵入性,难以规模化。
方案 B:为特定机器人定制的视觉遥操作(DexPilot、Telekinesis 等) 用摄像头,但系统写死了某款机器人。类比:一把钥匙只开一把锁。问题:依赖为特定机器人训练的重定向模型或碰撞检测模型,换机器人(如从 Allegro 换成 Shadow 手)就得重训重做,扩展性差。
方案 C:绑定单一"现实"的系统(只在真机 / 只在某仿真器) 比如 HAPTIX 动捕只为 MuJoCo 环境开发。问题:要么只能真机、要么只能某个仿真器,无法同时兼顾"仿真里大规模采数据 + 真机验证 + 缩小 sim-to-real 差距"。
方案 D:单人单机器人设置 大多系统只支持一个操作者控一个机器人。问题:教不了"机器人和机器人协作""机器人和人协作"这类需要多智能体的任务。
核心难题:怎么把"任意机械臂+任意灵巧手""仿真+真机""任意相机""远程""多人协作"全塞进一套系统,而且性能还不能因为通用而变差?
所以这一节是想说:专用设备贵、专用系统换机器人就废、绑定单一现实、只支持单人——缺一个真正通用又高性能的遥操作系统。
这篇论文的新想法
类比:以前的遥操作系统像"定制西装"——合身但只合一个人;AnyTeleop 像一套"高级模块化系统",通过标准接口,能快速适配任何身材。
AnyTeleop 的核心判断:要通用,就必须去掉"为特定机器人训练的学习模型",改用不需要训练、只靠几何和优化就能实时算出来的模块。
三个关键设计:
免学习的重定向 + 免学习的碰撞避免:开发了一个高性能的运动重定向库(把人手动作实时翻译成机器人动作,不用训练模型),碰撞避免用 CUDA 加速的几何查询(也不用学习)。给新机器人时,只要提供它的运动学模型(URDF 文件)就能适配——不用重训任何模型。
模块化 + 标准软件接口:把遥操作系统拆成四个模块(手部检测、多相机融合、重定向、运动生成),每个模块有明确定义的输入输出接口。像乐高积木——换机器人、换相机、换仿真器/真机,只需替换对应积木。
面向通信的设计 + Web 可视化 + 容器化:重计算放在强力服务器上,操作者端轻量;开发了浏览器网页可视化器,实现跨互联网远程遥操作和多人协作同步;整个系统打包成 Docker 镜像,一键部署,免去装依赖的痛苦。
【定制系统 vs AnyTeleop 模块化】
旧(DexPilot/Telekinesis):为某款机器人训练重定向/碰撞模型
└▶ 换机器人 = 重训重做(扩展性差)
AnyTeleop(4 个可替换模块 + 标准接口):
[手部检测] ─▶ [多相机融合] ─▶ [免学习重定向] ─▶ [免学习运动生成/避碰]
│ │ │ │
换相机 换视角 换机器人只需URDF 仿真/真机通吃
重计算在服务器 + Web 可视化 ─▶ 远程/多人协作;Docker 一键部署
所以这一节是想说:AnyTeleop 靠"免学习模块 + 标准接口 + 通信/Web/容器化"这三招,实现了"一套系统通吃"且不用为每款机器人重新训练。
它分几步做的(方法)
AnyTeleop 的核心是遥操作服务器,它吃摄像头画面,吐出机器人的平滑、无碰撞控制指令。整体架构如下:
摄像头(RGB或RGB-D, 单个或多个)
│
▼ [模块1] 手部姿态检测: MediaPipe出21关键点 + 手腕6D位姿
│
▼ [模块2] 多相机检测融合: 用手当标记自动标定 + SMPL-X置信度选最优
│
▼ [模块3] 手部重定向(优化): 人手关键点向量 → 机器人手关节角
│
▼ [模块4] 运动生成(CuRobo): 25Hz末端位姿 → 120Hz无碰撞关节轨迹
│
▼ 通过网络发给客户端 → 控制仿真/真机机器人
│
[Web可视化器] meshcat+Three.js, 浏览器远程看画面/多人同步
下面逐个模块拆开,每步按"输入 → 处理 → 输出"讲清楚。
5.1 模块一:手部姿态检测(看懂人手在哪、怎么弯)
类比:先看清人手的骨架长什么样、手腕朝哪。
输入:一个或多个摄像头的 RGB 或 RGB-D 画面。
处理:
- 手指关键点检测:用 MediaPipe(一个轻量、只用 RGB、能在 CPU 上实时跑的手部检测工具),定位 21 个手部关节的 3D 坐标(在手腕坐标系里)和 2D 图像坐标。只需要 RGB。
- 手腕位姿检测(RGB-D 版):用检测到的关键点像素位置去深度图取深度值,配合相机内参算出关键点的 3D 位置,再用 PnP(Perspective-n-Point,透视 n 点)算法估计手腕 6D 位姿。
- 手腕位姿检测(纯 RGB 版):朝向可以直接从关键点局部位置解析算出;但位置没有深度就难定。借鉴 FrankMocap 的做法,加一个小神经网络预测手的"弱透视变换缩放系数"(弱透视假设物体离相机比它自身尺寸远),配合内参近似出手的 3D 位置。误差比深度相机大,但很多任务够用。
输出:手指关键点局部位置 + 手腕全局 6D 位姿。
小结:MediaPipe 出手指关键点,RGB-D 用 PnP、纯 RGB 用弱透视网络估手腕位姿——设计原则是"有深度就用深度,没有也能靠单 RGB 干活"。
5.2 模块二:多相机检测融合(多角度看,防遮挡)
类比:一个人从一个角度看你的手会被手指互相遮挡,多找几个人从不同角度看再综合。
输入:多个相机各自的手部检测结果。
处理:多相机融合有两个难点——(1) 每个相机只在自己的坐标系里估手,坐标系不统一;(2) 没有现成指标衡量哪个相机的检测更可信。
- 难点一(自动标定):用人手当天然标记物。取前 N 帧多相机的检测结果,算出相机之间的相对旋转(在 SO(3) 群里表示)。发现纯 RGB 下手的绝对位置不准,但相邻帧之间的相对运动更鲁棒。有了相机间朝向,就能把不同相机的相对运动转到同一坐标系。
- 难点二(置信度):借鉴 Qin et al.,用检测模块预测的 SMPL-X 手形状参数当置信度线索。同一操作者的真实手形状应该恒定,自遮挡时预测的形状参数误差会变大——且形状误差大往往对应位姿误差大。取前 N 帧形状参数均值当参考,实时比对误差。要求操作者前 N 帧张开手指以获得准确参考。选置信度最高的相机的相对运动往下传。实现里 N=50。
输出:融合后、统一坐标系下的最可信手部运动。
小结:用人手当标记自动标定多相机、用 SMPL-X 形状参数误差当置信度选最优相机——多相机既解自遮挡又不需要外参标定。
5.3 模块三:手部重定向(把人手翻译成机器人手)
类比:人手和机器人手结构不一样(手指数、长度不同),得找一组机器人关节角,让机器人手"摆出和人手最像的姿势"。
输入:人手关键点向量。
处理:把重定向写成一个优化问题——找机器人手关节角 q_t,让"人手关键点向量"和"机器人手前向运动学算出的关键点向量"差距最小,同时加一个平滑惩罚项(让相邻时刻的关节角别跳变),并满足关节上下限约束。公式(人话):
最小化 [ α·人手关键点 − 机器人手关键点(q) ]² + β·[ q_t − q_{t-1} ]²,约束 q 在关节范围内。
其中 α 是缩放系数(补偿人手和机器人手大小差异),β 是平滑权重。换不同形态的手(如 D'Claw)时,只需手动指定机器人手指和人手指的关键点对应关系。这个模块只管手,不管臂。
输出:机器人手的关节角。
小结:把"人手→机器人手"写成"关键点对齐 + 平滑 + 关节限制"的优化,免训练、换手只需改对应关系。
5.4 模块四:运动生成(让机械臂平滑无碰撞地到位)
类比:手的姿势有了,还得让整条手臂平滑、不撞东西地把手送到目标位置。
输入:检测到的手腕/末端目标位姿(低频,25Hz)。
处理:要实时又平滑又无碰撞。前人(DexPilot)用黎曼运动策略(RMP)实时算加速度场,但朝目标的加速度不保证自然轨迹。AnyTeleop 改用 CuRobo——一个 GPU 高度并行、无碰撞的机器人运动生成库,实时生成自然、反应式的机器人运动。它接收 25Hz 的末端笛卡尔位姿,在关节限制内生成 120Hz 的无碰撞关节空间轨迹,交给阻抗控制器在仿真或真机上安全执行。
输出:120Hz 的无碰撞关节轨迹。
小结:CuRobo 用 GPU 并行把 25Hz 的目标位姿变成 120Hz 的平滑无碰撞轨迹,比 RMP 更自然、能保证无自碰撞。
5.5 Web 可视化器与整体设计原则(远程 + 协作)
类比:给远方的操作者开一扇"能看到机器人现场"的窗户,还能让两个人看同一个场景一起干活。
输入:仿真/真机的状态。
处理:基于 meshcat 库开发、用 Three.js 渲染的浏览器可视化器。每次仿真迭代后把结果推到浏览器,操作者从浏览器窗口获得视觉反馈、移动手来控制机器人。支持同步可视化——两个操作者做同一协作任务时,各自本地视口看到的是同步的同一场景。整个系统遵循三原则:模块化(各模块标准输入输出接口)、面向通信(重计算放服务器、支持远程和协作)、容器化(Docker 一键部署)。
输出:可远程访问、可多人同步的可视化 + 一套易部署的通用系统。
小结:meshcat+Three.js 的网页可视化器实现跨互联网远程与多人同步,配合模块化/通信/容器化三原则,让系统既通用又好部署。

关键数字(What works)
数字来自原文,重点看"通用系统"到底有没有牺牲性能。
数字 1:真机遥操作(AnyTeleop vs 专用系统 Telekinesis,成功率)
同一台 XArm6 机器人 + Allegro 手,复现 Telekinesis 的 10 个任务,各跑 10 次。
| 任务 | AnyTeleop | Telekinesis(专用) |
|---|---|---|
| Pickup Box Object | 1.0 | 0.9 |
| Pickup Fabric Toy | 1.0 | 0.9 |
| Box Rotation | 0.6 | 0.6 |
| Scissor Pickup | 0.8 | 0.7 |
| Cup Stack | 0.9 | 0.6 |
| Two Cup Stacking | 0.7 | 0.3 |
| Pouring Cubes onto Plate | 0.7 | 0.7 |
| Cup Into Plate | 1.0 | 0.8 |
| Open Drawer | 1.0 | 0.9 |
| Open Drawer and Pickup | 0.9 | 0.6 |
关键含义:AnyTeleop 在 8/10 任务上成功率更高、2/10 持平。通用系统竟然打赢了为该硬件专门定制的系统——尤其在薄壁物体(叠杯)上优势明显,因为优化式重定向能更好地闭合指尖距离。
数字 2:仿真模仿学习(SAPIEN,用不同系统采的数据训同一算法,成功率)
| 任务(arm-hand 变体) | RL | Baseline[43] | AnyTeleop |
|---|---|---|---|
| Relocate | 33.7±29.3 | 40.3±36.7 | 70.0±9.8 |
| Flip Mug | 31.0±28.7 | 36.0±32.4 | 53.7±24.0 |
| Open Door | 34.7±31.7 | 51.3±30.7 | 79.7±15.5 |
关键含义:用 AnyTeleop 采的数据训出的模仿学习策略,在 arm-hand(手臂+手)设置下大幅领先——因为它采的轨迹更平滑、且显式支持臂手系统并保证无自碰撞,而基线靠重定向生成臂轨迹容易自碰撞。整体 6 个任务里 5 个更好。
数字 3:相机配置对比(IsaacGym 弹钢琴任务)
| 相机配置 | 完成时间 | 错误率 |
|---|---|---|
| 单 RGB | 109s | 28.1% |
| 单 RGB-D | 87s | 21.8% |
| 双 RGB-D | 74s | 12.5% |
关键含义:只用单个 RGB 也能干活;加深度、加相机数量,完成更快、错误更少——用户可按需在"成本 vs 效率"间权衡。
数字 4:各模块耗时(Profiling,同机同时跑)
| 模块 | 台式(RTX3090) | 笔记本(RTX2070) |
|---|---|---|
| 手部姿态(RGB) | 26±5 ms | 34±5 ms |
| 融合 | 1±0 ms | 1±0 ms |
| 重定向 | 9±7 ms | 10±9 ms |
| 运动生成 | 8±3 ms | 11±5 ms |
关键含义:最耗时的是手部检测(跑在 GPU 上),设计上限 25Hz,台式和笔记本都能满足。运动生成想跑满 120Hz 需要单独机器——面向通信的设计正是为此。
所以这一节是想说:数字证明三件事——通用系统性能不输甚至超过专用系统、采的数据更利于模仿学习、且能灵活权衡相机成本与效率。
实验结果说明了什么
问题一:为了通用,性能会不会打折? 不会,反而更好。同一台 XArm6+Allegro 上,通用的 AnyTeleop 在 8/10 任务超过专门为该硬件定制的 Telekinesis。关键在于优化式重定向能精确闭合指尖距离(抓薄壁杯子更稳),而基于网络的重定向难以把人的精细捏取翻译给机器人。这说明"免学习的优化方法"在通用性和精度上都可能优于"为特定机器人训练的模型"。
问题二:采的数据质量对下游模仿学习有多重要? 非常重要。用 AnyTeleop 采的数据训出的策略在 arm-hand 设置下大幅领先(Open Door 79.7 vs 51.3)。两个原因:(1) 轨迹更平滑,状态-动作对更一致,网络更好学;(2) 显式支持臂手系统并保证无自碰撞,而基线用重定向生成臂轨迹会有自碰撞。这提示我们:遥操作系统的质量直接决定了下游学习的天花板。
问题三:单 RGB 相机够用吗? 够用但有取舍。弹钢琴任务里单 RGB 也能完成(109s、28.1% 错误),加深度和相机能显著提升(双 RGB-D 74s、12.5%)。这个"可降级、可升级"的特性让系统既能低成本部署、又能在需要时提精度。
问题四:能做以前做不到的事吗? 能。AnyTeleop 首次实现了视觉遥操作下的灵巧手协作操作——两个操作者(可不在同一地点)各控一个机器人,协作完成物体交接。这是靠模块化设计 + Web 可视化实现的,是文献里之前没有的。
所以这一节是想说:实验回答了四个问题——通用不牺牲性能、数据质量决定下游天花板、单 RGB 可用且可升级、还首次实现了跨地点灵巧手协作。
你应该懂的几个新词
遥操作(teleoperation):人远程操控机器人。是采集机器人示范数据、教机器人干活的主要手段。
灵巧手(dexterous hand):多指机械手(如 Allegro、Shadow),自由度高、能做精细操作,但也特别难操控。
视觉遥操作(vision-based teleoperation):只用摄像头拍人手来操控机器人,比 VR/手套/动捕便宜、不侵入。
运动重定向(motion retargeting):把人手的动作"翻译"成结构不同的机器人手的动作,本文用优化实现。
MediaPipe:谷歌的轻量手部检测工具,只用 RGB、CPU 实时出 21 个手关键点。AnyTeleop 的手部检测底座。
PnP(Perspective-n-Point)算法:已知一组 3D 点及其 2D 投影,反解相机/物体位姿。用于 RGB-D 手腕位姿估计。
弱透视变换(weak perspective):假设物体离相机远于其自身尺寸的简化相机模型,用一个缩放系数近似 3D 位置。纯 RGB 估手腕位置用。
SMPL-X:一个参数化人体/手模型,其形状参数在本文被用来当"检测置信度"的线索。
CuRobo:NVIDIA 的 GPU 并行、无碰撞机器人运动生成库。AnyTeleop 的运动生成模块。
URDF:描述机器人运动学结构的标准文件。AnyTeleop 靠它免训练适配新机器人。
模仿学习 / 从示范学习(imitation learning):让机器人模仿人类示范来学技能。遥操作是它的数据来源。
所以这一节是想说:这些词是读任何"遥操作 + 灵巧手 + 数据采集"论文都会反复出现的基础词汇。
它有什么搞不定的
- 快速手部运动会丢追踪:论文明确列出的失败模式一——人手动作太快时会丢失追踪,触发暂停和重检测。变通办法是让操作者放慢手速。
- 自遮挡下手部姿态不可靠:失败模式二——手与相机平面垂直等自遮挡情况下检测不准。需要多相机才能缓解,单相机做不到。
- 纯 RGB 手腕位置误差大:没有深度时靠弱透视网络近似位置,误差明显大于 RGB-D。精细任务仍建议用深度相机。
- 重定向需人工指定映射:换到差异大的手形态(如 D'Claw)时,需要手动指定机器人手指和人手指的关键点对应关系,不是全自动。
- 满频运动生成需独立机器:想跑满 120Hz 运动生成,在单机同时跑所有模块难达标,得靠面向通信的设计把控制模块放到单独机器上。
- 仍需人在环、需训练操作者:实验里由"训练过的操作者"执行,遥操作本质上还是要人实时参与,不是自动化采数据。
所以这一节是想说:AnyTeleop 做到了通用高性能,但快速运动丢追踪、自遮挡、纯 RGB 精度、需人工映射和满频算力这些工程约束仍在。
它和别的论文是什么关系
- 上游(被它借用):
- MediaPipe / FrankMocap / SMPL-X:手部检测、纯 RGB 位姿近似、形状参数置信度的来源。
- CuRobo(Sundaralingam et al. 2023):运动生成的核心库。
- DexPilot(Handa et al. 2020):视觉遥操作臂手系统的前驱,AnyTeleop 改进了它的重定向和运动生成(RMP→CuRobo)。
- Qin et al. 2022(单相机遥操作):多相机融合置信度思路的来源,也是仿真对比基线。
- 对比关系:
- 和 Telekinesis(Sivakumar et al. 2022):真机对比基线,AnyTeleop 8/10 更优。
- 和 各专用系统(DexPilot、Holo-Dex、TeachNet 等):表 I 系统对比中,AnyTeleop 是唯一支持多种臂 + 协作、且是仅有的两个支持多种灵巧手之一。
- 下游 / 同族:AnyTeleop 是"用遥操作规模化采灵巧操作数据"这条线的基础设施,和本仓库的 dexcap、dexmv(从人类视频/动捕学灵巧操作)、以及 aloha 系列(低成本双臂遥操作)同族。它采的数据直接喂给模仿学习(如 Diffusion Policy、dp3)。
所以这一节是想说:AnyTeleop 站在 MediaPipe + CuRobo + DexPilot 的肩膀上,做出了一套通用遥操作底座,为整个"采数据→模仿学习"流水线提供了可规模化的入口。
和本导读的关系
本笔记对应导读 Ch14:模仿学习 中"数据从哪来"的部分。
导读 Ch14 讲了模仿学习的完整链条:采数据(遥操作/示范)→ 学策略(行为克隆、Diffusion Policy 等)→ 泛化部署。AnyTeleop 深入的正是最上游、最容易被忽视的一环——采数据的工具。很多人只关注策略算法,但数据的质量(平滑、无自碰撞、多样)直接决定策略的上限,本文的实验就证明了这点。读完本笔记,建议:接着看 dexcap / dexmv(另两种采灵巧操作数据的方式——动捕手套、人类视频),再看 diffusion-policy / bet(拿这些数据训策略的算法)。把"采数据→学策略"连起来,才是模仿学习的全貌。
所以这一节是想说:本笔记是导读 Ch14"数据来源"这一环的深度展开,读它能理解为什么"好的遥操作系统"是模仿学习不可或缺的地基。
思考题
以下问题检验你是否真正理解了 AnyTeleop 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:AnyTeleop 为了"通用",特意避免使用"为特定机器人训练的学习模型",改用免学习的优化和几何方法。这个选择的深层原因是什么?
提示
因为"为特定机器人训练的模型"天生和那款机器人/环境绑定——换机器人就得重新采数据、重新训练,这正是旧系统无法规模化的根源。免学习的方法(优化式重定向、几何碰撞查询)只依赖机器人的运动学模型(URDF),给个新机器人的 URDF 就能立刻适配,不需要任何训练数据。这是"通用性"的必要条件。有意思的是,实验还证明免学习的优化式重定向精度甚至超过基于网络的重定向(抓薄壁杯子更稳)——所以这个选择不仅换来通用,还换来更好的精度。
Q2:多相机融合时,论文用"人手当天然标记物"来自动标定相机间的相对位姿。为什么不用传统的棋盘格标定?用手当标记有什么巧妙之处和局限?
提示
巧妙之处:遥操作时人手本来就在场景里、且被所有相机看到,用它当标记就免去了额外摆棋盘格、做标定流程的麻烦——真正实现"即插即用、零标定负担",这正是通用系统需要的。做法上,论文发现纯 RGB 下手的绝对位置不准,但相邻帧的相对运动更鲁棒,所以用前 50 帧算相机间的相对旋转。局限:精度不如专业棋盘格标定;依赖手在多相机中都可见;且要求操作者初始张开手指以获得稳定参考。这是"部署便利性"和"标定精度"之间的权衡。
Q3:论文用 SMPL-X 的"手形状参数误差"来当作检测置信度。为什么形状参数误差能反映位姿检测的可信度?
提示
关键洞察:同一个操作者的真实手形状是恒定不变的。所以理想情况下,不管手怎么动,检测出的形状参数都应该一样。但当自遮挡发生(手指互相挡住)导致检测困难时,模型对形状参数的预测就会出错、偏离真值。论文观察到"形状参数误差大"往往和"位姿误差大"同时出现——因为它们源于同一个困难(自遮挡使检测不可靠)。于是就能用"形状参数偏离参考值的程度"当作一个免费的置信度代理,去挑选当前最可信的那个相机。这是一个聪明的间接度量。
Q4:运动生成模块接收 25Hz 的末端位姿,却输出 120Hz 的关节轨迹。为什么要做这个"低频进、高频出"的转换?
提示
因为两端的需求不同。手部检测受限于摄像头帧率和检测计算量,只能到 25Hz——这是"人手意图"的更新频率,够用。但机器人要平滑、安全地运动,底层控制器需要高频(120Hz)的关节指令,否则轨迹会顿挫、甚至危险。所以 CuRobo 的作用是"插值+规划":把稀疏的目标位姿(25Hz)扩展成密集、平滑、无碰撞的关节轨迹(120Hz),交给阻抗控制器执行。这解耦了"人的意图频率"和"机器人的控制频率",是遥操作系统的关键工程设计。
Q5:实验发现用 AnyTeleop 采的数据训出的模仿学习策略在"arm-hand"(手臂+手)设置下优势特别大。为什么手臂的加入会放大数据质量的影响?
提示
因为手臂引入了自碰撞和轨迹平滑的新难题。基线系统只能采"浮空手"(floating hand)数据,再用重定向硬转成臂手数据,这个转换容易产生手臂自碰撞、轨迹不平滑。AnyTeleop 则显式支持臂手系统、且 CuRobo 保证无自碰撞、轨迹自然。对模仿学习来说,训练数据里如果有大量自碰撞、跳变的坏样本,网络就学到坏行为;数据越平滑一致,网络越好学。手臂自由度多、更容易产生这些问题,所以数据质量的差异在 arm-hand 设置下被放大了。这也解释了为什么 Flip Mug 是唯一例外——带臂采集该任务本身太难,影响了数据质量。
Q6:AnyTeleop 支持"仿真 + 真机"两种现实。为什么同时支持这两者对机器人学习特别重要?
提示
因为它们互补,缺一不可。仿真的优势:不需要真机硬件就能大规模、并行采数据,且有"上帝视角"的完整世界信息(物体真实位姿等),成本低、安全。真机的优势:没有仿真到现实的差距(sim-to-real gap),采的数据直接可用于真实部署。同时支持两者,就能"在仿真里海量采数据预训练 + 在真机上采少量数据微调/验证 + 研究如何缩小 sim-to-real 差距"。旧系统绑定单一现实(只真机或只某仿真器),无法打通这条完整链路。用同一套系统同时支持两者,还能保证仿真和真机采集流程一致,减少额外的不一致误差。
Q7:如果让你用 AnyTeleop 去大规模采集数据训练一个通用操作策略,你会怎么设计采集流程来最大化数据的价值?会遇到什么瓶颈?
提示
设计思路:(1) 利用其通用性,用多种机械臂+多种灵巧手采集同一批任务,获得跨机体的多样数据,利于训练泛化策略;(2) 用其仿真+真机能力,先在仿真里海量并行采集打底,再用真机少量数据校正 sim-to-real;(3) 用多相机配置提升数据质量(减少遮挡、更准),关键任务用双 RGB-D;(4) 利用协作能力采集多机器人协作数据。瓶颈:仍需人在环实时操作,采集速度受限于人(不是自动化);需要训练操作者;快速运动和自遮挡会产生坏样本需过滤;纯 RGB 精度不足以支撑最精细的任务;满频运动生成的算力需要多机部署。核心瓶颈是"人的参与"——这也是后续工作(如从人类视频学、自主数据生成)想突破的方向。
所以这一节是想说:能回答这 7 题,你就真正理解了 AnyTeleop 为什么用免学习模块、用手做标定、用形状参数当置信度、低频进高频出,以及数据质量对下游学习的决定性影响。
一些好奇心问答(FAQ)
Q1:AnyTeleop 到底"通用"在哪? 五个维度:任意臂+手(给 URDF 就行)、任意现实(仿真或真机)、任意地点(Web 远程)、任意相机配置(RGB/RGB-D、单/多)、任意数量操作者-机器人组合(支持协作)。
Q2:只用一个普通摄像头真的能操控灵巧手吗? 能。用 MediaPipe 从单 RGB 出 21 个手关键点,纯 RGB 靠弱透视网络近似手腕位置。精度不如 RGB-D,但很多任务够用(弹钢琴单 RGB 也能完成)。
Q3:它需要给每个机器人重新训练模型吗? 不需要。重定向和碰撞避免都是免学习的,给新机器人只需提供 URDF 运动学模型。这是它能通用的关键。
Q4:为什么强调"面向通信"的设计? 因为重计算(手部检测、运动生成)可以放在强力服务器上,操作者端只要一台带摄像头的普通电脑+浏览器。这样既支持跨互联网远程和多人协作,又降低操作者端的算力要求。
Q5:和 ALOHA 那种双臂遥操作比呢? ALOHA 用"主从臂"物理设备遥操作双臂夹爪;AnyTeleop 用纯视觉操控任意臂+灵巧手。两者都是采数据的遥操作系统,但 AnyTeleop 更通用、更便宜(只要摄像头)、专攻灵巧手。
Q6:为什么它对模仿学习这么重要? 因为模仿学习的上限由数据质量决定。AnyTeleop 采的轨迹平滑、无自碰撞、多样,实验证明用它的数据训出的策略明显更好。它是"采数据"这个上游环节的高质量工具。
所以这一节是想说:AnyTeleop 的实操问题(通用维度、单相机可行性、免训练、通信设计、与 ALOHA 区别、对模仿学习的价值)都有明确答案。
如果你想再深入
按"前驱系统 → 核心组件 → 数据用途 → 同族"排序:
- 前驱系统:DexPilot(Handa et al. 2020) — 视觉遥操作臂手系统的直接前身,理解 AnyTeleop 改进了什么(RMP→CuRobo)。
- 核心组件:CuRobo(Sundaralingam et al. 2023) — GPU 无碰撞运动生成,理解运动生成模块。
- 手部检测:MediaPipe Hands / FrankMocap — 理解手关键点和纯 RGB 位姿估计。
- 数据用途:Diffusion Policy / dp3 / BeT — 拿遥操作采的数据训策略的算法,本仓库有深读笔记。
- 同族采数据:DexCap / DexMV / ALOHA — 其他采灵巧操作数据的方式(动捕手套、人类视频、双臂主从),本仓库有相关笔记。
所以这一节是想说:把 DexPilot + CuRobo + Diffusion Policy 连起来读,就能看清"采数据→学策略"这条模仿学习流水线的全貌。
原文信息
BibTeX
@inproceedings{qin2023anyteleop,
title = {AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System},
author = {Qin, Yuzhe and Yang, Wei and Huang, Binghao and Van Wyk, Karl and Su, Hao and Wang, Xiaolong and Chao, Yu-Wei and Fox, Dieter},
booktitle = {Proceedings of Robotics: Science and Systems (RSS)},
year = {2023}
}
链接
所以这一节是想说:这是 Qin et al. 2023 年的工作(RSS 发表),用"免学习模块 + 模块化 + 通信/Web/容器化"做出了一套通用高性能的视觉遥操作系统,为大规模采集机器人示范数据打下地基。
◼
引用本笔记 / Cite this note
@online{eai_anyteleop_2026,
title = {(readable note) AnyTeleop},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2023 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/anyteleop/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?