同一主题下,哪几篇该先读?
把每个主题里的论文按 era 排一排,每条带年份和一句话定位。一眼看到"祖师爷 → 经典 → 前沿"的关系。
I VLM Foundation 视觉-语言基座
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 祖师爷 | 2023 | LLaVA: Visual Instruction Tuning | NeurIPS | 给一个只会打字聊天的 AI 装上眼睛——你随手拍张照片发过去,它能看着图陪你说话。 |
| 经典 | 2023 | 3DShape2VecSet: 3D Shape Representation for Diffusion Models | SIGGRAPH | 把一个 3D 物体(比如一只椅子)压缩成 512 张小卡片,每张卡片只记录"特征"不记录"位置";电脑学会这些卡片的规律之后,就能从一团随机噪声里凭空造出全新的 3D 模型——还能根据文字描述、单张照片、或半个点云来指挥它造什么。 |
| 祖师爷 | 2021 | Learning Transferable Visual Models From Natural Language Supervision | ICML | 教 AI 同时认图和认字,把 4 亿对网上图文塞进同一张坐标。之后你说"一只猫",它就能从新图里挑出猫——不用为新任务再训一遍。 |
| 祖师爷 | 2022 | Flamingo: a Visual Language Model for Few-Shot Learning | NeurIPS | 教一个会聊天的 AI 也学会看图,给它看两三个示范,它就能照着做新题。 |
| 经典 | 2022 | BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation | ICML | 一句话:让一个模型同时学会看图和写字,再让它帮自己把网上烂配文重写干净,回头再用干净数据训一遍——多个任务全线变强。 三个关键贡献: MED(Multimodal mixture of Encoder-Decoder):一个模型三种身份切换——纯编码器、看图的文本编码器、看图的文 |
| 经典 | 2022 | FILIP: Fine-grained Interactive Language-Image Pre-Training | ICLR | CLIP 是"整张图配整句话"看个大概像不像;FILIP 让图里的每一小块(patch)和句子里的每个词各自去对面找最像的伙伴,模型因此学会"狗在左下角、草地在右边"这种细节——而且只改了对比损失,没牺牲 CLIP 那种"能离线预存特征、检索超快"的效率。 |
| 经典 | 2023 | BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models | ICML | 不动两个大模型——一个负责看图、一个负责说话——只在中间训练一个小"翻译官",就让 AI 学会了看图说话,而且比动辄 800 亿参数的 [Flamingo](flamingo.md) 效果更好、成本低一个数量级。 |
| 经典 | 2023 | EVA-CLIP: Improved Training Techniques for CLIP at Scale | arXiv | EVA-CLIP 不改 CLIP 的架构,只换了三个训练技巧——用一个已经"懂图"的视觉模型当起点、换个不闪腰的大 batch 优化器、训练时随机只看半张图——就用远少于对手的数据和算力,训出了更强的看图模型。最大的 EVA-02-CLIP-E/14+(50 亿参数、90 亿样本 |
| 经典 | 2023 | Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond | arXiv | 阿里 2023 年开源的 Qwen-VL:在会中英双语聊天的 Qwen-7B 语言模型上,接一个 ViT-bigG(19 亿参数)视觉编码器 + 一个把图压成 256 个 token 的位置感知适配器,用三阶段训练教它一次学会看图、念中英文招牌(OCR)、用框指出物体(groun |
| 经典 | 2023 | Sigmoid Loss for Language Image Pre-Training | ICCV | 教模型"图配文字",CLIP 的做法是让全班一起排名打分(softmax 对比),SigLIP 改成一对一判断"这俩是不是一对"(sigmoid 判断题)。改这一行损失函数,就换来了算得快、省内存、小批量也能学。 |
| 经典 | 2024 | DeepSeek-VL: Towards Real-World Vision-Language Understanding | arXiv | DeepSeek 在 2024 年开源的"会看图"模型(1.3B 和 7B 两档),核心不是堆参数,而是给模型配了一双"广角镜头 + 微距镜头"的眼睛(SigLIP + SAM 混合视觉编码器)、能吃 1024×1024 高分辨率,还专门用真实世界的发票、PPT、图表、UI 截图 |
| 经典 | 2024 | Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks | CVPR | 一个相对小的看图模型:你跟它说"描述这张图""圈出所有的猫""图里红车在哪""把这段文字读出来",它都用同一个脑子处理,输出统一的一段文字。靠一个 5.4 亿标注 / 1.26 亿张图的超大数据集 FLD-5B 撑起来,让参数量不大的模型在检测、分割、caption、ground |
| 经典 | 2024 | InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks | CVPR | 让"看图的脑子"也长到 60 亿参数,和"会说话的脑子"一样大,AI 看图说话才不偏科,而且开源就能用。 |
| 经典 | 2024 | Improved Baselines with Visual Instruction Tuning | CVPR | 给初代 [LLaVA](llava.md) 换了四个零件——更厚的镜片(两层 MLP)、更高的分辨率(336px)、更丰富的教材(665K 混合数据)、更聪明的大脑(Vicuna-1.5)——模型本身一行代码没改,就在 12 个看图答题榜单上拿了开源第一。 |
| 前沿 | 2024 | What matters when building vision-language models? | NeurIPS | 做"看图说话大模型"时,大家凭感觉选零件(用哪个语言模型、图和文怎么拼、图切多少块),却很少做对照实验。这篇论文把每个选择单独拎出来做受控实验,整理成一份"避坑清单",再照着清单训了一个 8B 的模型 Idefics2 当样板——它在同尺寸里最强,有些指标甚至追平大它 4 倍的模 |
| 前沿 | 2024 | Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling | arXiv | InternVL 2.5 把"模型规模、训练数据、推理时算力"三根轴一起往上推,让完全开源、免费可下载的"看图模型"第一次在大学综合考试 MMMU 上突破 70 分(70.1),追平甚至叫板 GPT-4o、Claude-3.5-Sonnet 这些顶级闭源模型——而且把怎么做到的每 |
| 前沿 | 2024 | The Llama 3 Herd of Models | arXiv | Meta 把训练 Llama 3 大模型的全套"菜谱"公开了——用了什么料、多少张卡、跑多久、考多少分,从后厨到摆盘一条龙。 |
| 前沿 | 2024 | LLaVA-NeXT-Interleave | arXiv | 教 AI 像刷图文并茂的小红书:图和字按顺序穿着读,多图、视频、3D 都用这一招,不用各训一个模型。 |
| 前沿 | 2024 | LLaVA-OneVision: Easy Visual Task Transfer | arXiv | 一套配方教会一个模型同时看懂单张图、几张图和视频,开源圈第一次在视频上明显接近顶级闭源模型。 |
| 前沿 | 2024 | Long-CLIP: Unlocking the Long-Text Capability of CLIP | ECCV | 给一个只能读 77 字短纸条、而且实际上超过 20 个字就看糊的 CLIP,做两个精准的小手术,让它能读 248 字的长描述,同时又没忘掉原来认识的那些短词——而且换上去就能用,不用改下游任何代码。 |
| 前沿 | 2024 | Pixtral 12B | arXiv | Mistral 开源的一个 120 亿参数的多模态大模型:它用一个从零训练的新视觉编码器,能按图片原始分辨率和长宽比直接读图(你想用多少 token 描述一张图都行),在 12.8 万 token 的超长上下文里塞进任意多张图;它在多模态测评上超过同级甚至更大的开源模型,同时文字 |
| 前沿 | 2024 | A call for embodied AI | ICML | 这篇论文提出一个很直接的立场:如果 AI 想走向真正的 general intelligence,不能只靠静态文本数据和离线训练,而要进入 Embodied AI,也就是让智能体拥有感知、行动、记忆和学习能力,在环境中持续互动并从反馈中成长。 作者不是否定 LLM,而是说 LLM |
II High-Level Planning 高层任务规划
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 祖师爷 | 2022 | SayCan: Do As I Can, Not As I Say | CoRL | 让"见多识广但出不了门的 AI"出主意,让机器人自己摸口袋说"这事我现在能做",两边都点头才动手——AI 出嘴,机器人出手,两个分数相乘选下一步。 |
| 祖师爷 | 2022 | Inner Monologue: Embodied Reasoning through Planning with Language Models | CoRL | 让机器人边干活边在心里念叨:看到啥、做成没、人改主意没,全翻成文字塞回 AI,它就能边做边改计划。 |
| 祖师爷 | 2023 | Code as Policies: Language Model Programs for Embodied Control | ICRA | 让 LLM 直接写 Python 代码作为机器人的策略(policy),而不是从预训练技能库中选动作。代码可以包含循环、条件判断、NumPy 运算、递归函数定义,因此能在不做任何额外训练的情况下,通过 few-shot prompting 让机器人执行任意复杂度的新指令——只要感 |
| 祖师爷 | 2023 | LLM+P: Empowering LLMs with Optimal Planning | arXiv | 让 LLM 只当翻译——把你说的话翻译成机器格式,真正的规划交给老牌算法去算。LLM 管说话,算法管动脑子。 |
| 祖师爷 | 2023 | PaLM-E: An Embodied Multimodal Language Model | ICML | 教 ChatGPT 长出眼睛和手脚:你说一句话 + 让它瞄一眼现场,它直接列出机器人该做的几步。 |
| 祖师爷 | 2023 | ProgPrompt | ICRA | 让大语言模型(LLM)不要用大白话写机器人的行动计划,而是写成一段 Python 程序——把机器人能做的动作写成函数、把现场有的物体写成一个列表、再给几个示范程序,LLM 就能照葫芦画瓢生成一段可执行、还自带检查的计划代码。这招在 VirtualHome 家务任务上做到当时最强, |
| 经典 | 2023 | ChatGPT for Robotics | IEEE Access | 这是微软的一篇"设计原则 + 能力研究"论文:它教你怎么用一套方法(提示工程 + 高层函数库 + 人在环把关),让 ChatGPT 把人的大白话指令翻译成机器人能执行的代码。核心招数是——不让 ChatGPT 直接写底层电机代码,而是给它一套"起好名字的高层函数"(如 detec |
| 经典 | 2023 | VoxPoser | CoRL | VoxPoser 让大模型给机器人画两张 3D 地图:红色地方要去、灰色地方要躲,机器人照着地图规划出动作——全程不训练任何新模型。 |
| 经典 | 2024 | GenSim | ICLR | 让 ChatGPT 当"出题老师",自动给机器人编一堆练习关卡,连标准答案(专家怎么解)也一起写好。 |
| 经典 | 2024 | RoboFlamingo | ICLR | 拿一个现成的开源视觉语言大模型(OpenFlamingo,会看图 + 读文字),给它加一个专门负责"看历史、出动作"的小脑袋(policy head),再用机器人的模仿数据轻轻微调一下,就得到一个能听懂语言指令、看着画面去操作的机器人——在 CALVIN 这个语言指令操作基准上大 |
| 经典 | 2024 | Tree-Planner | ICLR | 让大模型一次写好十份"菜谱",把重复步骤合成一棵树,做事时照树走,错了就换条岔路,全程不用反复打电话问。既省 LLM 调用,又自带纠错。 |
| 前沿 | 2024 | SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems | arXiv | SafeEmbodAI 关注的是一个很现实的问题:如果移动机器人把摄像头、LiDAR、用户语言指令都交给 LLM 推理,攻击者就可能用 prompt injection 或恶意命令让机器人绕路、撞障碍、忽略安全传感器,甚至进入危险区域。论文提出 SafeEmbodAI,一个把 s |
| 前沿 | 2025 | LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks | arXiv | LoHoVLA 处理长程具身任务:机器人不只要做一个动作,而要把“把所有积木按规则摆好”拆成一串子任务,并在每一步执行低层动作。它用 PaliGemma 这类 VLM 同时生成 sub-task 文本和 action token,再用分层闭环控制决定什么时候只重试动作、什么时候重 |
| 前沿 | 2026 | What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else? | arXiv | 这篇论文问了一个很关键的问题:具身 AI 的安全问题,到底是 LLM 漏洞、传统 cyber-physical system(CPS)漏洞,还是一种新的系统级失效?作者的答案是:三者都有,但最危险的部分往往来自 perception、reasoning 和 action 被组合到 |
III End-to-End VLA 端到端视觉-语言-动作
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 经典 | 2024 | OpenVLA: An Open-Source Vision-Language-Action Model | CoRL | 把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。 |
| 祖师爷 | 2022 | RT-1: Robotics Transformer for Real-World Control at Scale | RSS | Google 用 13 台机器人花 17 个月录下 13 万段人类示范,训出一个 35M 参数的小 Transformer,让机器人听一句指令就能在真办公室厨房里完成 700 多种操作,并首次证明"大数据 + Transformer"的范式在物理世界同样有效。 |
| 经典 | 2023 | RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control | CoRL | 把机器人动作翻译成一句话,让会看图聊天的 AI 用写句子的方式开口指挥机器人——它会写字,就能动手。 |
| 经典 | 2023 | RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches | ICLR | 教机器人做新动作,光说话不够、给一张完成图也不够。这篇论文说:在画面上画一条"手该走的路"——机器人立刻照着做。核心贡献是提出 RT-Trajectory,用 2D 轨迹草图(trajectory sketch)作为策略条件(policy conditioning),在同样的训练 |
| 经典 | 2024 | 3D Diffusion Policy (DP3) | RSS | Diffusion Policy 用 2D 图像当"眼睛",需要上百个示范才学得会。DP3 把眼睛换成"稀疏点云 + 一个极简 MLP 编码器"——只用 10 个示范就能搞定大多数任务,72 个仿真任务平均比 Diffusion Policy 相对提升 24.2%,真机 4 个任 |
| 经典 | 2024 | Octo: An Open-Source Generalist Robot Policy | RSS | 输入(可插拔的 token) |
| 前沿 | 2024 | 3D-VLA | ICML | 现在主流的 VLA(视觉-语言-动作模型,如 RT-2、OpenVLA)都是"看 2D 照片 → 直接出动作",缺了三维空间感,也不会"想象未来"。3D-VLA 做了两件事:(1) 把眼睛从 2D 图像换成 3D 点云;(2) 在动手之前,先用扩散模型"脑补"出任务完成后的画面( |
| 前沿 | 2024 | GR-2: Generative Video-Language-Action Model | arXiv | 让机器人先刷大量网络视频攒常识,再练动手;它干活时脑子里会先"预演"下一秒的画面,再从这个预演里读出动作。 |
| 前沿 | 2024 | RDT-1B: Diffusion Foundation Model for Bimanual Manipulation | ICLR | 清华团队给双臂机器人造的"大脑":用扩散模型(diffusion)当动作生成器、Diffusion Transformer(DiT)当骨架,把参数推到 12 亿(1.2B)——目前最大的扩散式机器人操作基础模型。它先在 46 个多机器人数据集(约 100 万条轨迹)上预训练,再在 |
| 前沿 | 2024 | RoboMamba | NeurIPS | 机器人的"大脑"原来是用 Transformer 搭的,反应慢、显存吃紧。RoboMamba 把大脑主干换成 Mamba(一种"流水线式"的新架构),让机器人既能听懂指令、看懂画面,又能快速吐出手臂动作,而且推理开销大幅下降。 |
| 前沿 | 2024 | TinyVLA | RA-L | 把会听话的机器人大脑瘦身到约 1.4B,动作生成换成"先乱后凿"的扩散头,不靠云端也能在边缘设备上实时干活。 |
| 前沿 | 2024 | TraceVLA: Visual Trace Prompting | ICLR | 机器人的手刚走过哪里?TraceVLA 把这条路径直接画在它看到的照片上,让它"看见自己的足迹",再决定下一步往哪动。做法极简:在 OpenVLA 上用自采的 15 万条轨迹做视觉轨迹提示(visual trace prompting)微调,不加新模块、不加历史文本。结果在 Si |
| 前沿 | 2024 | CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation | arXiv | CogACT 认为,把大视觉语言模型直接改成“吐动作 token”的 OpenVLA 式做法还不够会动。它把 VLA 拆成两层:VLM 负责看图、读指令、理解任务,专门的 diffusion transformer action module 负责生成连续动作序列。结果是在模拟和 |
| 前沿 | 2025 | DexVLA | arXiv | 现在的 VLA 模型(如 OpenVLA、π0)都在拼命把"视觉语言模型(VLM)"那部分做大,却忽略了真正产生动作的"动作专家"太小、动作表示是瓶颈。DexVLA 反其道而行——把扩散动作专家放大到 10 亿参数、做成多头结构支持跨机体,再配一套"具身课程学习"三阶段训练,还让 |
| 前沿 | 2025 | OpenHelix | arXiv | 指令:"把红色瓶子递过来" + 当前画面 |
| 前沿 | 2025 | OpenVLA-OFT | RSS | 原版机器人大模型 OpenVLA 输出动作时像"一个字一个字念口令"——慢、抖、长任务掉链子。OpenVLA-OFT 把微调这件事拆成三个可以各自打开的开关——并行解码(一口气说完)、动作分块(一段段说)、连续动作表征(说准确的小数),再配一个极简的 L1 回归目标,把 LIBE |
| 前沿 | 2025 | SpatialVLA | arXiv | 教机器人两件事:用普通摄像头也能看出远近(Ego-3D 位置编码);把常用动作存成"肌肉记忆"、不常用的粗着存(自适应动作网格)。两招合起来,让 VLA 跨机器人、跨任务迁移更稳。 |
| 前沿 | 2025 | Universal Actions for Enhanced Embodied Foundation Models | arXiv | 机器人数据最大的问题不是没有数据,而是每台机器人说的“动作语言”不同:有的输出末端位置,有的输出关节角,有的输出速度,有的还是双臂。Universal Actions 提出 UniAct,让模型先学一套跨机器人共享的“通用动作空间”,再用每台机器人的 decoder 把通用动作翻 |
| 前沿 | 2025 | EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control | arXiv | EO-1 认为,机器人不能只在最后一步输出动作;真实交互里,人会边看、边想、边说出中间判断、边行动。它提出 EO-Robotics:3B 的 EO-1 模型、EO-Data1.5M 数据集和 EO-Bench 评测,把 image、text、video、action 交错成同一条 |
| 前沿 | 2025 | LLaDA-VLA: Vision Language Diffusion Action Models | arXiv | LLaDA-VLA 的核心问题是:既然扩散语言模型可以通过反复 mask-denoise 生成文本,那能不能也让它从全是 mask 的动作序列一步步还原出机器人动作?论文答案是可以,但要给动作 token 单独设计分类目标和分层解码。 如果只记一个直觉:它不是在问机器人能不能完成 |
| 前沿 | 2025 | Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies | arXiv | Discrete Diffusion VLA 把动作生成放回一个统一 transformer 里:视觉、语言和动作都在同一骨干中融合,动作不是 autoregressive 左到右吐 token,而是通过离散扩散从全 mask 的 action chunk 逐步还原。 如果只记一 |
| 前沿 | 2025 | Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning | arXiv | Vlaser 关注一个很容易被忽略的问题:VLM 会推理,不等于 VLA 会控制;如果上游具身推理数据和下游动作策略训练之间没有桥,模型可能会在问答 benchmark 上变强,却不一定让机器人做得更好。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人 |
| 前沿 | 2025 | X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model | arXiv | X-VLA 解决的是跨机器人预训练的稳定性问题:同一批数据里机器人、相机、动作空间、遥操作风格都不同,直接混训容易崩;它用每个数据源一组 learnable soft prompts,让主干学 embodiment-agnostic 能力。 如果只记一个直觉:第 2 批都在回答同 |
| 前沿 | 2025 | Embodiment Transfer Learning for Vision-Language-Action Models | arXiv | ET-VLA 讨论的是一个很实际的问题:OpenVLA 这类自回归 VLA 在单机械臂上表现不错,但一到双臂/多机器人协作,就容易生成错误数量的动作 token、分不清哪个机器人该做哪一步。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人、单一任务、单 |
| 前沿 | 2025 | HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies | arXiv | HiMoE-VLA 的核心判断是:机器人数据的异构性不是一种东西,而是好几种东西叠在一起;动作空间差异、身体差异、相机差异和控制频率差异,应该由不同层级的专家模块分别处理。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人、单一任务、单一动作空间,走向跨 |
| 前沿 | 2025 | MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation | arXiv | MoS-VLA 把策略看成一组 learned basis functions 的线性组合。新环境来了,不用梯度微调,只要一条专家轨迹,就能求出组合系数,生成适配该环境的新 policy。 如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人需要低 |
| 前沿 | 2025 | Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation | arXiv | DuoCore-FS 面向全身机器人控制:慢系统用 3B VLM 做语义推理,快系统以 25–30Hz 生成连续全身动作,两者通过 bridge buffer 异步连接,不再让快控制等待慢推理。 如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人 |
| 前沿 | 2025 | A Survey on Efficient Vision-Language-Action Models | arXiv | 这篇综述整理 efficient VLA 的研究地图:VLA 要落地到机器人,不能只追求更大模型和更高 benchmark 分数,还要处理实时控制、算力成本和数据采集成本。论文把现有工作归纳为三个核心支柱:Efficient Model Design、Efficient Trai |
| 前沿 | 2025 | Survey of Vision-Language-Action Models for Embodied Manipulation | arXiv | 这篇综述系统整理面向具身操作的 VLA 模型。它从具身智能系统视角出发,把 VLA 发展历程分成 3 个阶段,并从 5 个关键维度分析当前研究:VLA model structures、training datasets、pre-training methods、post-tra |
| 前沿 | 2025 | Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review | arXiv | 这篇系统综述讨论 foundation models 如何用于 mobile service robots。它把移动服务机器人面临的核心挑战归纳为四类:把自然语言指令翻译成可执行动作、多模态感知、不确定性估计、板载计算约束。论文再分析 LLM、VLM、MLLM 和 VLA 如何分 |
| 前沿 | 2025 | Toward Embodied AGI: A Review of Embodied AI and the Road Ahead | arXiv | 这篇综述提出 Embodied AGI 的五级路线图 L1-L5,并用四个能力维度评估当前差距:omnimodal capabilities、humanoid cognitive abilities、real-time responsiveness、generalization。 |
| 前沿 | 2025 | RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI | arXiv | RoboNeuron 提出一个 embodied AI 中间层,用来连接 agent tool calling 生态和 ROS2 机器人中间件。它把 ROS message schema 自动派生成 agent 可调用的 MCP tools,让 LLM agent 可以通过统一工 |
| 前沿 | 2025 | Embodied Navigation Foundation Model | arXiv | Embodied Navigation Foundation Model 提出 NavFoM,一个跨任务、跨本体的导航基础模型。论文报告模型训练在八百万导航样本上,覆盖 quadrupeds、drones、wheeled robots、vehicles,并跨 vision-and |
| 前沿 | 2025 | MiMo-Embodied: X-Embodied Foundation Model Technical Report | arXiv | MiMo-Embodied 是小米团队发布的 X-Embodied foundation model technical report。它尝试把 autonomous driving 和 embodied AI 放进同一个 vision-language model 里训练,让模 |
| 前沿 | 2025 | LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation | arXiv | LACY 的核心问题是:现在很多机器人策略只学习 language-to-action,也就是“听一句话,做一个动作”。论文认为这太单向了。一个真正稳的机器人不只要会执行语言,还应该能反过来解释动作、判断语言和动作是否语义一致。LACY 因此把三件事放进同一个 vision-la |
| 前沿 | 2025 | villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models | arXiv | villa-X 的问题是:VLA 模型很想从海量视频中学习动作,但视频通常没有机器人 action labels。人类视频、互联网视频和不同机器人 embodiment 的视频里都有“发生了什么变化”,却没有统一的 7D 末端执行器动作。villa-X 提出 Vision-Lan |
| 前沿 | 2026 | Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments | arXiv | Qwen-VLA 想证明一件事:操作、导航、人类第一视角轨迹和视觉语言理解,不一定要拆成四套系统,可以统一成看图、读指令、理解当前身体,然后预测未来动作或轨迹的同一个 VLA 问题。 如果只记一个直觉:它不是在问机器人能不能完成某个固定任务,而是在问能不能把看见、听懂、知道自己是 |
| 前沿 | 2026 | Green-VLA: Staged Vision-Language-Action Model for Generalist Robots | arXiv | Green-VLA 的核心不是单纯扩大模型,而是把 VLA 从网页视觉语言基座、机器人预训练、具体身体适配到 RL 对齐,拆成 L0/L1/R0/R1/R2 五个阶段,目标是让同一个策略覆盖单臂、双臂和 Green 人形机器人。 如果只记一个直觉:第 3 批从“模型能不能统一”推 |
| 前沿 | 2026 | AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation | arXiv | AC²-VLA 关心 VLA 部署时的延迟瓶颈:每个控制步都跑完整 VLM 太慢,而视觉复杂度不一定等于动作难度,所以它让 action context 来决定缓存复用、token pruning 和 layer skipping。 如果只记一个直觉:第 3 批从“模型能不能统一 |
| 前沿 | 2026 | VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models | arXiv | VLA-Forget 研究一个很现实的问题:VLA 模型学到了不安全、错误或隐私敏感的行为后,能不能只删掉这部分行为,同时保留视觉理解、语言 grounding 和正常动作控制能力。它把 VLA unlearning 拆成三件事:targeted forgetting、perce |
| 前沿 | 2026 | Membership Inference Attacks on Vision-Language-Action Models | arXiv | 这篇论文研究 VLA 模型的隐私风险:攻击者能不能通过观察模型输出,判断某个 transition 或完整 robot trajectory 是否在训练数据里。论文把 VLA membership inference 分成 sample-level 和 trajectory-le |
| 前沿 | 2026 | Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation | arXiv | Gaze2Act 想解决一个很日常但很难的机器人交互问题:用户说“把那个杯子递给我”时,房间里可能有很多杯子;用户说“抓住锤子的这里”时,语言很难精确表达“这里”;用户执行到一半又想换目标时,静态指令也跟不上。论文提出把人的 gaze(视线 / 注视点)作为 VLA policy |
| 前沿 | 2026 | InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation | ICLR | InstructVLA 想解决 VLA 的一个核心矛盾:如果只把 VLM fine-tune 成机器人 action generator,模型可能会忘掉原来的视觉语言推理能力;如果保留 VLM 推理,又可能动作控制不够强。论文提出 Vision-Language-Action I |
| 前沿 | 2026 | A Survey of Language-Conditioned Robot Manipulation | IJRR | 这篇综述系统整理 language-conditioned robot manipulation,也就是机器人如何根据自然语言完成操作任务。它的核心贡献不是提出一个新 policy,而是给领域建立一套分类框架:语言可以作为 state evaluation、policy cond |
IV Diffusion Policy 扩散策略与流匹配
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 祖师爷 | 2023 | Diffusion Policy: Visuomotor Policy Learning via Action Diffusion | RSS | 让机器人像调电视雪花一样产生动作:从满屏乱码开始,擦几下,下一步该怎么动就擦出来了。 |
| 经典 | 2024 | 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations | RSS | 让机器人改看 3D 立体形状(点云)而不是 2D 照片来学动作,10 条示范就够,72 个任务平均比原版强 24.2%,真机成功率从 35% 涨到 85%,安全违规率 0%。 |
| 经典 | 2024 | Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation | RSS | 机器人选下一步动作本来要慢慢搅 100 下才出一步,这篇教它一下就跳到答案——快约十倍,连笔记本都跑得动。 |
| 经典 | 2024 | EquiBot: SIM(3)-Equivariant Diffusion Policy | CoRL | 教机器人几次就够了。物体挪个位置、转个方向、换个大小都不用重学——因为"这件事和位置朝向大小无关"这个常识被直接焊进了网络结构里,而不是靠堆数据让它慢慢悟。 |
| 前沿 | 2024 | Affordance-based Robot Manipulation with Flow Matching | IROS | 教机器人做事时,先让它看懂"物体能怎么用",再用一种"画直线"式的方法直接生成动作——比扩散模型更快、训练更简单。 |
| 前沿 | 2024 | π₀: A Vision-Language-Action Flow Model for General Robot Control | arXiv | Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 种机器人、68 任务、1 万+ 小时数据 |
| 前沿 | 2024 | DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting | arXiv | DISCO 提出一个 zero-shot、open-vocabulary 的 language-guided manipulation 框架。它不直接把语言塞进 diffusion policy,而是先用现成 VLM(论文里举 ChatGPT4 / ChatGPT4o)把自然语言 |
| 前沿 | 2025 | DiT-Policy | ICRA | 扩散策略强在"多模态",Transformer 强在"可扩展",但把两者硬凑到一起训练极不稳定(原版 Diffusion Policy 的 Transformer 实现几乎训不动)。这篇论文找到了正确配方——用 adaLN-Zero 注意力块 + ResNet 图像分词器,让扩散 |
| 前沿 | 2025 | Diffusion Policy Policy Optimization (DPPO) | ICLR | 先跟着老师傅模仿,再自己上手练。DPPO 把"自己练"那一步拆成很多个小动作,让一套很常规的强化学习算法(PPO)也能稳稳地调教"扩散策略"这种脑子里要打好几遍草稿才动手的机器人。 |
| 前沿 | 2025 | FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching | AAAI | 让机器人不再"在脑子里画 100 张草稿才动手",而是看一眼立体世界就一步给出动作——又快又稳,真机能跑得动。 |
| 前沿 | 2025 | FAST: Efficient Action Tokenization for VLA | RSS | 给机器人的连续动作找一种更聪明的"切词方式":不再逐个维度、逐个时刻粗暴分格,而是先把一段动作用"频率变换 + 压缩"编成紧凑的 token。这一改,让自回归式的视觉-语言-动作模型(VLA)第一次能学会那些高频、灵巧的操作技能;配上 π0,训练速度比扩散式 VLA 快最多 5 |
| 前沿 | 2025 | pi_0.5: VLA with Open-World Generalization | arXiv | Physical Intelligence 的 π0.5:在前作 π0 的"VLM 大脑 + flow matching 动作专家"基础上,靠异构联训(co-training)——约 400 小时移动机器人数据(100 个真实家庭)+ 大量其他机器人数据 + 网页图文/VQA + |
| 前沿 | 2025 | Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation | arXiv | Time-Unified Diffusion Policy with Action Discrimination 提出 TUDP,用于更高效、更准确地生成机器人动作。它的出发点是:普通 diffusion policy 要经过很多 denoising iterations,且不同 |
| 前沿 | 2025 | Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation | ICRA | Discrete Policy 处理的是多任务机器人操作里的“动作空间纠缠”问题。一个任务可能有多种成功轨迹,多个任务混在一起训练时,动作分布会变得更复杂、更像几团缠在一起的线。直接用 Behavior Cloning 或 Diffusion Policy 从 observati |
| 前沿 | 2026 | Learning Diffusion Policy from Primitive Skills for Robot Manipulation | arXiv | Learning Diffusion Policy from Primitive Skills for Robot Manipulation 提出 Skill-conditioned Diffusion Policy,简称 SDP。它认为很多 diffusion policy 直 |
| 前沿 | 2026 | Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation | arXiv | Trace-Focused Diffusion Policy 提出 TF-DP,用于解决 long-horizon robotic manipulation 中的 multi-modal action ambiguity,论文简称 MA2。问题是:长程任务里,视觉上很像的观察会在 |
V Imitation Learning 模仿学习与遥操作
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 祖师爷 | 2011 | A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning | AISTATS | 光看老师开车的录像不够 -- 学生一走偏就越错越离谱。DAgger 让学生自己先开几圈,把走偏的地方拿去问老师答案,再训,反复几轮就稳了。 |
| 祖师爷 | 2016 | Generative Adversarial Imitation Learning | NeurIPS | 让 AI 看大厨做菜的录像,再找个"挑刺老师"分辨它做得像不像,靠这种较劲学会做事,不用猜大厨心里的打分标准。 |
| 经典 | 2021 | Implicit Behavioral Cloning | CoRL | 别让模型直接报"动作是这个",而是让它给一堆候选动作打分、挑最低分那个——机器人的手就突然变巧了。 |
| 经典 | 2022 | Behavior Transformers: Cloning k Modes with One Stone | NeurIPS | 同一件事人类有好几种做法(左绕、右绕都行)。传统 AI 会把这些做法"取平均"成一个四不像。BeT 先用 k-means 把动作分成 k 个"流派",让 Transformer 先选流派、再微调细节——一个模型克隆出人类示范里的所有主流做法。 |
| 经典 | 2023 | Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA) | RSS | 用约 2 万美元搭一套"主从臂遥操 + 四摄像头"的双臂系统(ALOHA),让人示范 50 次约 10 分钟,再用 ACT 算法让机器人一次预测未来 100 步动作而不是一步一步猜——开调料杯、插电池这类毫米级精细活,成功率能到 80–96%。 |
| 经典 | 2023 | AnyTeleop | CoRL | 要教机器人干活,得先有人"手把手"演示——这个"人远程操控机器人"的过程叫遥操作(teleoperation)。过去的视觉遥操作系统都是"一套系统只配一款机器人、一个环境",换机器人就得重做。AnyTeleop 做了一套通用系统:只用普通摄像头,就能操控任意机械臂+任意灵巧手,在 |
| 经典 | 2023 | RoboCat | TMLR | DeepMind 造的一个"通用机器人操作大脑":它能同时控制多种不同的机械臂、做多种任务,只要给它一张"目标长啥样"的图片就知道该干什么;遇到新任务或新机器人,用 100–1000 个示范就能快速上手;更关键的是,它能用自己练出的能力去生成新数据,再拿这些数据把自己练得更强,形 |
| 前沿 | 2024 | ALOHA 2 | Tech Report | 人(操作员) 机器(工作端) |
| 前沿 | 2024 | HumanPlus | CoRL | 给一台成人尺寸的人形机器人搭一整套"从人身上学"的流水线:先用一个普通摄像头把人的全身动作实时抄到机器人身上(叫"影子模仿 / shadowing",人怎么动它怎么动),用这种方式一个人就能遥控它采数据;再拿采到的数据训一个策略,让机器人看着自己头上的摄像头自主复现技能——只用不 |
| 前沿 | 2024 | Mobile ALOHA | CoRL | 给原来只能趴在桌上干活的双臂机器人焊一辆能跑的小车,让一个人同时"手控双臂 + 腰推底盘"把整套家务动作录下来;再用一个很朴素的招数——把新录的"移动家务"数据和以前攒的一大堆"桌面双臂"数据混在一起训——就能让机器人只看 50 次示范,学会炒虾、擦红酒渍、进电梯这种"边走边用两 |
| 前沿 | 2024 | Universal Manipulation Interface | RSS | 做一个和机器人末端一模一样的手持夹爪 + GoPro(约 371 美元),人去厨房、咖啡馆随便示范;视频经视觉-惯性 SLAM 还原 6D 轨迹,再训 Diffusion Policy——机器人不在场也能采数据,洗碗、抛球、叠毛衣、摆咖啡杯都能零样本泛化到新环境,分布外测试综合成 |
| 前沿 | 2024 | Behavior Generation with Latent Actions (VQ-BeT) | ICML | 机器人本来要画一条平滑曲线动作,VQ-BeT 让它改成"先从菜单里选一个动作词、再小修一点"——就像挑表情包再加文字,比硬画曲线更不容易出怪招,还比扩散策略快得多。 |
| 前沿 | 2024 | DexCap | RSS | DexCap 是斯坦福做的一套便携动捕系统:一件背心 + 手套 + 几个小相机,人穿上它在任何地方(厨房、客厅)徒手干活,就能实时(60Hz)录下"手腕 6 自由度位姿 + 手指动作 + 3D 环境点云"。配套算法 DexIL 把这些人手数据翻译成机器人动作、用点云扩散策略学习, |
| 前沿 | 2025 | Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3) | RSS | 让人形机器人用"自己眼睛"的视角看世界(而不是死记房间地图),换间屋子也照样干活,不用重学。 |
| 前沿 | 2025 | SmolVLA | arXiv | Hugging Face 推出的小型机器人模型:把"看到 + 听到 + 动手"塞进一张游戏显卡就能训的小脑袋,还全部用社区公开数据训练——让没有数据中心的人也能在家玩具身 AI。 |
VI World Model & Video Policy 世界模型与视频策略
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 前沿 | 2025 | Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control | arXiv | 把一个会"脑补下一秒视频"的大模型,再练一遍,就能让它指挥机械臂做家务——不改模型结构、不加新零件,只是把机器人动作、未来画面和评分全伪装成视频帧塞进去,让模型按原来处理视频的方式一起学会三件事。 |
| 祖师爷 | 2018 | World Models | NeurIPS | 让 AI 先在自己脑子里反复"做白日梦"练打游戏,练熟了再去真游戏里上场——居然真能赢。 |
| 祖师爷 | 2020 | Dream to Control: Learning Behaviors by Latent Imagination | ICLR | 教 AI 在脑子里反复"做白日梦"演练动作,不用真去摔跤,就能学会跑步、翻跟头这种复杂动作。具体而言:先从少量真实经验中学一个压缩版的"脑内世界模型",然后在这个模型里想象几千条未来轨迹,用精确的数学导数告诉策略网络"刚才哪步该往哪个方向调",最终以 1/20 的真实交互量超越了 |
| 经典 | 2021 | Mastering Atari with Discrete World Models | ICLR | 让 AI 闭眼"做白日梦"练打老游戏,第一次只靠脑子里想象就打到人类水平。具体做法:把脑内模拟器的"快照"从连续数字(高斯)换成离散选项(32 组 x 32 类 categorical),再用一个叫 KL balancing 的二八开技巧来让"猜测"尽量贴近"亲眼看到"的状态,最 |
| 经典 | 2022 | DayDreamer | CoRL | 让一只四足机器人不靠仿真、不靠遥控示范,直接在真实地面上边走边"在脑子里做梦演练",1 小时从零学会站起来和走路。 |
| 经典 | 2023 | Transformers are Sample-Efficient World Models | ICLR | 把游戏画面切成一格格"积木",让 AI 像写句子一样接龙下一帧,然后让它在脑子里"自己跟自己玩"练强化学习——只玩两小时就接近人类水平。 |
| 经典 | 2023 | TWM: Transformer-based World Models | ICLR | 智能体(agent)在脑子里"做梦"练本事。这篇把梦的引擎从 RNN 换成 Transformer,记得更长、做得更准,在样本效率基准 Atari 100k 上有竞争力。 |
| 经典 | 2025 | Dreamer V3: Mastering Diverse Domains through World Models | Nature | DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。 |
| 前沿 | 2023 | GAIA-1 | arXiv | GAIA-1 是个会做梦的开车模拟器:给它一段街景视频的开头,加一句"我现在打方向盘",它能接着画出后面几秒街上看到的画面。 |
| 前沿 | 2023 | Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis | arXiv | 这篇综述问的是:foundation model 到底怎样帮助机器人走向 general-purpose robots?它把问题拆成两类路线:一类是把已有视觉/语言 foundation model 插进机器人系统,比如用 VLM 做开放词表感知、用 LLM 做任务规划;另一类是 |
| 前沿 | 2024 | Genie: Generative Interactive Environments | ICML | Genie 从海量无标注游戏录屏里,自己"猜"出每两帧之间按了什么键,再用这个猜出来的虚拟按键续画下一帧——把死视频变成单张图片就能开玩的互动世界。 |
| 前沿 | 2024 | UniSim | ICLR | 看过海量视频后,你给它一个动作(说一句话 / 推一下机械臂 / 挪一下镜头),它就生成"接下来世界长什么样"的视频——像一台会脑补现实的"游戏机",还能拿它当机器人的训练场。 |
| 前沿 | 2024 | The Essential Role of Causality in Foundation World Models for Embodied AI | ICML | 这篇论文的核心问题是:具身智能要在真实世界里行动,单靠“看过很多图像和文字”的 foundation model 不够,因为机器人真正需要的是知道“我做这个动作后,世界会怎样变化”。作者提出 Foundation Veridical World Model(FVWM,基础可信世界 |
| 前沿 | 2025 | Cosmos World Foundation Model | arXiv | Cosmos 是英伟达做的一个"世界基础模型(World Foundation Model, WFM)平台":核心是一个会"看过去的视频 + 一个动作/指令 → 生成未来会发生什么视频"的大模型。它像给机器人和自动驾驶造了一个"数字世界的沙盘",让物理 AI 能先在里面安全预演, |
| 前沿 | 2025 | 1X World Model Challenge | arXiv | 给机器人两个不同难度的"脑补未来"考题:一个是直接画出未来的像素画面(采样赛道),一个是预测未来的压缩编码(压缩赛道)。冠军队一个用现成视频大模型 Wan-2.2 微调、一个从零训小 Transformer,双双夺冠——还比亚军快一个数量级。 |
| 前沿 | 2025 | Navigation World Models | CVPR | 训练一个"导航世界模型"(NWM):给它当前看到的画面和一串打算走的动作,它就能像放电影一样预测出"这样走下去画面会变成什么样"。有了这个"脑内模拟器",智能体可以先在脑子里把好几条路线各走一遍、看哪条能到目的地,再挑最好的去执行——甚至在从没去过的环境里,只凭一张照片就想象出一 |
VII Multimodal Ecology 多模态交互与数据生态
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 前沿 | 2025 | VLAS: VLA Model With Speech Instructions | ICLR | 把一个会"看图说话"的 AI(LLaVA)改造成会"听声音 + 认嗓音 + 动手"的机器人模型:用 Whisper 编码器当耳朵、用"声纹查档案"(Voice RAG)解决"我的杯子是哪只"这种个性化问题,最终在定制化任务上比纯文字 VLA 高出 4 倍(86.5% vs 19. |
| 前沿 | 2024 | MLA: Multisensory Language-Action Model | arXiv | 让机器人不只用眼睛看,还会用"手感"和"空间感",并且大脑自己直接听三种感官(不请翻译),训练时还要脑补未来的画面、形状和触感——推理时省掉脑补这步,相当于白嫖了一波理解力,最终在接触密集操作任务上大幅超越前辈。 |
| 祖师爷 | 2019 | Connecting Touch and Vision via Cross-Modal Prediction | CVPR | 教 AI"看一眼就猜出摸起来什么感觉、摸一下就猜出在摸哪儿",让视觉和触觉互相翻译。 |
| 祖师爷 | 2023 | ImageBind: One Embedding Space To Bind Them All | CVPR | 把图片当翻译官,六种感官(图、文、声、深度、热、动作)就能互相听懂彼此说话——而且不需要让它们两两见过面。 |
| 经典 | 2022 | X-VLM: Multi-Grained Vision Language Pre-Training | ICML | X-VLM 教 AI 看图,不只学"整张图配整句话",还同时学"图里某个物体配某个词"——而且不靠外部的物体检测器,一个模型端到端把整图、区域、物体三种粒度的图文对齐一起学,于是问图里某个细节时也能答准。 |
| 经典 | 2023 | AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model | EACL | Meta AnyMAL 在 LLaMA-2-70B-chat 全程冻结 的前提下,为 图 / 视频 / 音 / IMU 各训一个 投影层(aligner),把模态信号映进 LLM 词嵌入空间 当「伪 token」;再用自标 60K MM-IT + 合成 150K 做指令微调。零样 |
| 经典 | 2023 | AudioPaLM | arXiv | 现在最强的文本大模型(如 PaLM-2)会读会写,但"听不见、不会说"。AudioPaLM 的想法很直接:把语音也切成一个个"词元(token)",塞进文本大模型的词表里,让同一个模型既能吃文字又能吃声音、既能吐文字又能吐声音。这样一个模型就能同时做语音识别、语音翻译、语音到语音 |
| 经典 | 2023 | FROMAGe: Grounding LLMs to Images | ICML | 把一个会说话的大模型整个冻住不动,只在它前后各加一层薄薄的"翻译片",就让它能看图、找图、还能图文混着聊天。 |
| 经典 | 2023 | OBELICS | NeurIPS | HuggingFace OBELICS 从 Common Crawl 抽出 1.41 亿 英文网页、3.53 亿 张图、1150 亿 text token,按 DOM 原生顺序 保留「段–图–段–图」交错结构;在此上训 IDEFICS-80B 后 4-shot VQAv2 63. |
| 经典 | 2024 | OneLLM | CVPR | 用一套统一的框架,把图像、音频、视频、点云、深度图、法线图、惯性传感器(IMU)、甚至大脑 fMRI 信号这八种完全不同的感官输入,全都翻译成语言模型能听懂的形式,接到同一个大语言模型上——不再为每一种感官单独造一个专用编码器和专用对齐模块。 |
| 前沿 | 2024 | Sparsh: Self-supervised Touch Representations | CoRL | 以前每个触觉任务都得从零标注、从零训练。Sparsh 先让模型在 46 万张以上无标签触觉图上自学一遍"触觉词汇",之后做任何具体触觉任务只要少量例子就能追平甚至超过专门训练的模型——平均超出 95.1%。 |
| 前沿 | 2024 | AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding | arXiv | AlanaVLM 是一个面向 egocentric video understanding 的 multimodal embodied AI foundation model。它关注第一视角视频,也就是从人或机器人“自己眼睛”看到的画面,而不是第三人称摄像机拍到的场景。论文提出 |
| 前沿 | 2025 | Tactile Beyond Pixels (Sparsh-X) | CoRL | 让机器人的手指不止"看"接触画面,还能听响声、感力度、察打滑——四路信号一起自监督学习,摸东西才像人。学出来的是一个通用"手感"编码器,下游任务贴一顶小帽子就能用。 |
| 前沿 | 2025 | Tactile-VLA | CoRL | 给已经会看、会听、会动的机器人补上"手感"这一课:不仅让它摸得到接触的力,还让它听懂"轻轻插"和"用力插"的区别——而且这份"手感常识"很大一部分是从大模型脑子里唤醒出来的,不是从零训出来的。 |
| 前沿 | 2025 | TLA: Tactile-Language-Action | ICRA | 让机器人像你闭眼摸钥匙那样——靠"一段持续变化的触感"加上一句话指令,自己决定下一步该怎么用手。关键是把触觉当成带时间的模态,而不是一张压力快照。 |
VIII RF Perception & Mapping 射频感知与空间建图
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 经典 | 2023 | CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches | MobiCom 2025 (Best Artifact Award) | 给机器人装一颗几百块的毫米波小雷达,让它一边走一边画出厘米级精度的 3D 地图。关键创新是让 AI 学会说"我对这个预测不太确定",从而自动忽略不靠谱的测量,最终在 14 层楼的实测中打败了所有相机方案。 |
| 经典 | 2024 | mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment | SenSys 2024 | 用对比学习把毫米波雷达信号「翻译」进 CLIP 的文本语义空间——训练时见过走路、跑步,部署时只要写一句「太极拳」的文字描述,雷达就能认出来,不需要为新动作再采雷达数据。 |
| 前沿 | 2023 | mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation | MobiSys 2025 | 不直接问"东西在哪儿",而是先猜"它的皮朝哪边翘"——用便宜的毫米波雷达就能隔着纸箱重建出里面物体的精确 3D 形状,F-Score 达到 96%,把旧方法的 78% 远远甩在身后。 |
| 祖师爷 | 2019 | Can WiFi Estimate Person Pose? | ICCV | 想象你家路由器除了上网,还能告诉你"屋里那个人正在做啥姿势"——胳膊抬到哪、腿怎么弯,全画给你看。这篇论文用一对普通商用 WiFi 网卡(3 天线发射 + 3 天线接收),配一个摄像头当"老师",让神经网络学会从 WiFi 信道状态信息(CSI)直接画出 18 个人体关节点。核心 |
| 祖师爷 | 2020 | See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar | MobiSys | 机器人在浓烟里也能画出清晰的房间地图——靠一颗几十块的小雷达加一个会"脑补"的神经网络。 具体两招: 训练时让贵的激光雷达(lidar)和便宜的雷达坐同一辆车,把 lidar 的清晰图当作业答案喂给神经网络(cGAN),教雷达学会脑补。学完老师下车,雷达单飞。 认门/墙/玻璃/电 |
| 经典 | 2019 | Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm | arXiv |  |
| 经典 | 2020 | milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion | SenSys | 用一颗几十块钱、单芯片的毫米波雷达,加上一套专门设计的神经网络,让一个移动设备(人、机器人、无人机)在黑暗、烟雾、无纹理墙面这些摄像头会失灵的环境里,也能准确算出"自己往哪儿走了、走了多远",3D 轨迹误差低到约 1.3%。 |
| 经典 | 2020 | RadarSLAM: Radar based Large-Scale SLAM in All Weathers | BMVC | 大雪 / 大雾 / 黑夜 |
| 经典 | 2021 | 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning | IPCCC | 用两级 GAN(对抗生成网络)把便宜毫米波雷达那团"糊糊的电波能量云"翻译成清晰的深度图,再拼成一朵稠密平滑的 3D 点云——烟雾、灰尘、黑暗里也能"看清"物体的完整形状。 |
| 经典 | 2022 | RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals | TMM | 毫米波雷达(两台,互相垂直) |
| 经典 | 2023 | High Resolution Point Clouds from mmWave Radar | ICRA | 训练一个端到端的神经网络,把一颗便宜的单芯片毫米波雷达"看糊的、又稀又乱的"数据,翻译成接近激光雷达(LiDAR)那样清晰、稠密的点云——而且在浓烟弥漫、雷达没见过的房间里也照样管用,生成的点云还好到能直接喂给现成的激光雷达建图/里程计软件。 |
| 经典 | 2023 | RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory | TCSVT | 用无线电波(RF 信号)估计人体的三维姿态(骨架关节位置)——关键创新是:不像以前那样在"信号层面"硬凑,而是先用最优传输(Optimal Transport)理论,把 RF 信号的特征"搬运"到姿态的特征空间,再从搬运后的特征生成人体骨架。这样即使隔墙、遮挡、在室外,也能比以前 |
| 前沿 | 2024 | Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on | SenSys | 想实时知道一个人全身姿态(比如健身教练看你深蹲标不标准),传统办法要么靠摄像头(怕黑、有隐私、会被遮挡),要么靠昂贵的动捕棚。Argus 换个思路:在耳机/VR 头显左右两侧各磁吸一个指甲盖大小、7.5 克、0.35 瓦的毫米波雷达,从"第一视角(戴在头上往下看身体)"双视角感知 |
| 前沿 | 2024 | Diffusion Model is a Good Pose Estimator from 3D RF-Vision | CVPR | 毫米波雷达拍出的人像像隔了层毛玻璃、还在闪。mmDiff 让 AI 从一团噪点出发、以雷达信号为参照,一步步"擦"出稳定又符合人体常识的 3D 骨架,比"一口气猜"准得多、稳得多。CVPR 2024 收录,是第一个用扩散模型做毫米波雷达人体姿态估计的工作。 |
| 前沿 | 2024 | Enabling Visual Recognition at Radio Frequency (PanoRadar) | MobiCom | *PanoRadar 把 TI AWR1843 单芯片 mmWave 雷达装到 8 cm 半径、2 Hz 转台上,合成 8×1200 圆柱虚拟阵列;再用 RF 自运动估计 + 2D CNN 提仰角分辨率,从纯射频信号生成 360° range image,在 12 栋建筑 lea |
| 前沿 | 2025 | Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion | arXiv | 毫米波信号能穿过纸箱、布帘,Wave-Former 把弹回来的模糊回声拼成藏在背后的杯子、瓶子的完整 3D 形状——用"物理先验清洗信号 + Transformer 补全形状"这套混合架构。 |
IX Auditory & Acoustic 听觉智能与声学空间交互
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 前沿 | 2024 | Proactive Hearing Assistants that Isolate Egocentric Conversations | UIST | 戴上这副耳机,它自动听出"现在你在跟谁聊天",把同伴的声音放大、把陌生人和噪音压下去——你一个按钮都不用按,甚至不用提前录入任何人的声音。它靠的不是"认声音",而是"认对话节奏"。 |
| 经典 | 2024 | NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators | MobiCom | 在咖啡馆听不清对面说话?让助听器自己降噪,不连手机、不连云——把一个原本跑在显卡上的"降噪大脑"拆骨瘦身 100 倍,再教它用"粗糙的算盘"(8 位整数芯片)照样算出接近原来的答案,最终全部塞进一只挂在耳朵后面的小壳子里,处理一帧音频只要 5.54 毫秒,功耗只有 71 毫瓦,2 |
| 祖师爷 | 2023 | Creating speech zones with self-distributing acoustic swarms | Nature | 七个骰子大小的小机器人,从充电底座自己爬上桌子、散成一圈,靠互相"喊一嗓子"算出各自的精确坐标,然后联手把桌旁几个同时说话的人一一分清——谁在哪、说了啥,全部搞定。整个过程不需要头顶装摄像头、不需要人手摆放、不需要扯一根线。 |
| 祖师爷 | 2019 | Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation | IEEE/ACM TASLP | 两人同时讲话的混音,喂给一个网络,它能把每个人的声音分别还原。比老方法(看频谱图)更准、更快、更小。 |
| 祖师爷 | 2022 | SoundStream: An End-to-End Neural Audio Codec | IEEE/ACM TASLP | 让 AI 自己学怎么把声音"打包又拆开",3 kbps 的小包听起来反而比传统方案 12 kbps 还清楚。 |
| 经典 | 2020 | Conformer | Interspeech | Transformer 擅长看"全局大局",卷积擅长抠"局部细节",Conformer 把两者塞进同一个模块里——让语音识别既看得远又看得清,用更少的参数刷出了 LibriSpeech 的最好成绩(测试集 word 错误率低到 1.9%/3.9%)。 |
| 经典 | 2020 | Dual-path RNN | ICASSP | 混音波形(32000 个采样点,超长) |
| 经典 | 2021 | Meta-StyleSpeech | ICML | 给一个文字转语音(TTS)系统装上"听一句就模仿声线"的能力——只要给它一段 1 到 3 秒的陌生人录音,它就能用那个人的音色把任意文字念出来,而且不需要为这个人重新训练模型。 |
| 经典 | 2023 | AudioLM | TASLP | Google AudioLM 把波形变成 两套离散 token——w2v-BERT 语义 token(25 Hz) 管长程内容,SoundStream 声学 token(50 Hz×12 层 RVQ) 管高保真音色——再用 三个 0.3B Transformer 分阶段自回归续写 |
| 经典 | 2023 | EnCodec | TMLR | EnCodec 教神经网络把一段声音压成一串很小的整数、再几乎无损地还原回来——既比传统编解码器在极低码率下更清晰,又因为声音变成了"整数序列",让 AI 能像写字一样"写"出声音。 |
| 经典 | 2023 | MusicLM | arXiv | 给一句文字描述,比如"一段舒缓的小提琴旋律配上失真吉他 riff",MusicLM 就能生成一段 24kHz、能连贯保持好几分钟的高保真音乐;还能让你哼一段跑调的旋律,它按你的文字风格把它"重新演奏"出来。 |
| 经典 | 2023 | Robust Speech Recognition via Large-Scale Weak Supervision | ICML | Whisper 用互联网上 68 万小时的弱标注(音频 + 自动/人工字幕)数据,喂进标准 Encoder-Decoder Transformer,训出一个多语种多任务语音模型。不微调直接用(zero-shot),在 12 个分布外数据集上平均 WER 比 Wav2Vec 2.0 |
| 前沿 | 2023 | SeamlessM4T | arXiv | 一个模型搞定近 100 种语言的"听懂、翻译、说出来",把以前需要三四个 App 接力才能完成的跨语言沟通,塞进一张端到端的网络里。 它一口气会做五件事,名字像缩写,其实只是"输入 → 输出"的简写: ASR(语音识别):语音 → 同语言文字 S2TT(语音转文本翻译):语音 → |
| 前沿 | 2024 | Stable Audio | ICML | 打几个字描述你想要的声音,AI 就能做出几十秒到一两分钟的高音质音乐或音效,长度还能精确到秒。技术上靠"先把音频压进潜空间、再在潜空间跑扩散、还带上时长条件"。 |
| 前沿 | 2024 | Universal Source Separation with Weakly Labelled Data | TASLP | 给电脑一段嘈杂录音,告诉它"我只要狗叫",它就把狗叫从混音里抠出来。一个模型覆盖 527 类日常声音,而且训练只用了"贴了标签但没拆开"的脏数据。 |
X Datasets & Benchmarks 数据集与评测基准
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 祖师爷 | 2019 | Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning | CoRL | 给那些号称"会举一反三"的机器人算法办一场 50 道动手题的统一考试,看它们是不是真的会。结论:没人及格。 |
| 祖师爷 | 2019 | RLBench: The Robot Learning Benchmark & Learning Environment | RA-L | 给机器人手臂出了一套 100 道题的"统考卷",从此大家都做同一套题,第一次能公平比谁更厉害。 |
| 祖师爷 | 2020 | robosuite: A Modular Simulation Framework and Benchmark for Robot Learning | arXiv | robosuite 是机器人 AI 的"标准考场"——基于 MuJoCo 物理引擎,把机器人仿真的每个部件(机器人本体、夹爪、控制器、任务、物体、传感器)拆成可拼接的"乐高积木",配套 9 个标准操作任务和 SAC 基线,让全球研究者在同一张考卷、同一把尺子下公平比较算法好坏。 |
| 经典 | 2021 | What Matters in Learning from Offline Human Demonstrations for Robot Manipulation | CoRL | 这篇论文不发明新算法,而是把"机器人看录像学操作"这件事里的每个变量——算法、数据质量、看什么、要不要记忆——挨个换一遍,然后老实告诉你:哪些真有用,哪些是白忙。它顺手还开源了一整套仿真环境、数据集和代码,成了后来所有操作模仿学习论文的"默认评测台"。 |
| 经典 | 2022 | CALVIN | RA-L | 要让机器人听懂人话干活,得有个统一的"考卷"来比较不同方法的好坏。CALVIN 就是这样一份考卷(基准 benchmark):它在仿真里搭了 4 个桌面环境,让一个机器人根据自然语言指令连续完成一长串任务(比如"打开抽屉→拿起蓝色积木→把积木推进抽屉→打开滑门")。它提供约 24 |
| 经典 | 2023 | LIBERO | NeurIPS | *LIBERO 用 Robosuite 程序化生成 130 个语言条件桌面任务,拆成 Spatial / Object / Goal / 100 四套卷,每任务 50 条专家遥操作示范;系统评测 终身学习(LLDM) 中 陈述性 vs 程序性知识 迁移,并意外发现:顺序微调(Se |
| 经典 | 2023 | RH20T | RSS Workshop | 一个在真实世界采集的超大机器人操作数据集:11 万多条接触丰富(要用力、要手感)的操作序列,覆盖约 150 种技能、多种机器人、多种视角,每条都同时录了画面、力觉、声音、动作四种信息,还配了对应的人类示范视频和语言描述——目标是让机器人不只会推捡,而是学会切、插、倒、折这种需要视 |
| 前沿 | 2023 | Open X-Embodiment | ICRA | *21 家机构把 60 个子数据集、22 种机器人形态统一成 RLDS 标准格式,凑出 100 万+ 真机轨迹;再用 RT-1-X / RT-2-X 混训证明:多机器人数据一起学,比每家只学自己的数据更好——小数据域平均成功率 高约 50%,大数据域 涌现技能 成功率 约 3 倍 |
| 前沿 | 2023 | BridgeData V2 | CoRL | BridgeData V2 是伯克利等校做的一份大规模真机操作数据集:用一台约 4000 美元、谁都买得到的 WidowX 机械臂,在 24 个环境里采了 60096 条轨迹、13 种技能。它专门设计成"多方法通用 + 跨环境跨机构泛化"——同一份数据能喂给 6 种主流学习算法( |
| 前沿 | 2024 | DROID | RSS | *13 家机构、18 台同款 Franka 在 564 个真实场景(厨房/办公室/宿舍等)遥操作采集 7.6 万段示范;用 Diffusion Policy 50/50 共训 后,新任务成功率比「只训本域数据」和「混 Open X-Embodiment」分别平均 高约 22%(i |
| 前沿 | 2024 | RoboCasa | RSS | 一个专门模拟"日常家务"(尤其是厨房)的大规模仿真平台:它用生成式 AI 工具造出 120 个厨房场景和 2500 多个 3D 物体,用大语言模型帮忙设计各种任务,支持移动机械臂和人形机器人,还配了超过 10 万条演示轨迹——目标是给"通用家务机器人"提供一个又大、又多样、又逼真 |
| 前沿 | 2024 | AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents | arXiv | AutoRT 不是一个单独的机器人策略,而是一套用 VLM/LLM 编排真实机器人采集数据的系统。VLM 描述场景,LLM 生成任务并做安全/可行性过滤,机器人再通过脚本策略、已有策略或遥操作执行。论文报告 AutoRT 在 4 栋楼、7 个月、20+ 台机器人上收集了 77k |
| 前沿 | 2025 | RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI | arXiv | RealMirror 不是又一个单独模型,而是一套面向人形机器人和灵巧操作的开源平台:从数据采集、模型训练、推理评测到高保真仿真和 zero-shot Sim2Real,都想放进一条可复现流水线。 如果只记一个直觉:它不是在问机器人能不能完成某个固定任务,而是在问能不能把看见、听 |
| 前沿 | 2025 | Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy | ICRA | GEMBench 的出发点很直接:很多 vision-language robotic manipulation benchmark 主要测训练中见过的任务,或者只测轻微扰动,无法真正回答“机器人能不能泛化到新任务”。论文提出 GEMBench,一个基于 RLBench 的仿真 |
| 前沿 | 2026 | LeRobot: An Open-Source Library for End-to-End Robot Learning | ICLR | LeRobot 不是某一个“机器人大脑”,而是一整套把机器人学习串起来的开源流水线:左边接真实机器人和遥操作,中间把数据存成统一格式,右边训练、评估、部署 ACT / Diffusion / SmolVLA / π0 等策略。它解决的核心问题不是“提出一个新模型”,而是“让普通研 |
| 前沿 | 2026 | Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics | arXiv | Open-H-Embodiment 是一个面向 medical robotics 的大规模开放数据集项目。论文报告它包含 119 个 datasets、780 小时 paired video and kinematic data,来自 50+ institutions,覆盖 20 |
XI Simulation & Sim2Real 仿真与真实迁移
| era | year | title | venue | tldr |
|---|---|---|---|---|
| 祖师爷 | 2019 | Habitat: A Platform for Embodied AI Research | ICCV | 给家用机器人造一个跑得飞快的"VR 房子",让它在里面绕路撞墙练几千万步,再上岗去你家。 |
| 祖师爷 | 2021 | Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning | NeurIPS Datasets | 一句话:把"算物理"和"训神经网络"塞进同一张显卡,机器人学走路从"几千台 CPU 跑一晚"压成"一张卡跑几分钟"。 类比:以前训机器人像切菜、炒菜、装盘分三个房间,端来端去比真做菜还累;Isaac Gym 把厨房合并,菜不动、工具换着上。 效果对照:OpenAI 训魔方机械手用 |
| 经典 | 2020 | SAPIEN: A SimulAted Part-based Interactive ENvironment | CVPR | 给机器人造了一个虚拟宜家展厅,2,346 件家具每个抽屉、每扇门、每个瓶盖都能真的拉开、推开、拧开。 |
| 经典 | 2021 | Habitat 2.0 | NeurIPS | 上一代 Habitat 只能在虚拟房子里走路看;2.0 让小机器人能真的开冰箱、把杯子从厨房拿到客厅做家务。 |
| 经典 | 2021 | ManiSkill | NeurIPS | ManiSkill 是教机器人开抽屉、开柜门、推椅子、搬水桶这类"带关节的家具操作"的统一标准考场——它的核心考点是:机器人练完几十上百个不同形状的柜子之后,能不能上手一个从没见过的新柜子。 |
| 经典 | 2022 | ProcTHOR | NeurIPS | 用一套程序自动"造房子":想要多少个不重样的、可交互的、带家具的虚拟房子都能生成。用它造出的 1 万个房子预训练一个简单的神经网络机器人,只靠 RGB 摄像头、不建地图、不用人给任务监督,就在 6 个具身 AI 基准(导航、重排、机械臂操作)上刷到当时最强,甚至不微调直接零样本也 |
| 经典 | 2022 | DexMV | ECCV | DexMV 搭了一套"人手视频 → 机器人示范"的转换流水线:用普通 RGB-D 相机录人手做家务(倒水、放东西、搬运),估计出 3D 手和物体姿态,再通过一套"动作重定向 + 动作反推"的方法,把人手轨迹翻译成 30 自由度机械手能执行的示范,最后用模仿学习训策略。结果:在纯强 |
| 前沿 | 2024 | SimplerEnv | NeurIPS | *SIMPLER(SimplerEnv 套件)在 SAPIEN 里重建 Google Robot / WidowX BridgeV2 真机评测场景,用 SysID 控物理 + Visual Matching 绿幕贴图 缩小 real-to-sim 鸿沟;对 6 个开源 VLA c |
| 前沿 | 2024 | BEHAVIOR-1K | CoRL | BEHAVIOR-1K 是斯坦福搭的"机器人家务驾校":先问了 1461 个真人"你最想让机器人帮你干啥",从答案里挑出 1000 道最实用的家务题(洗地、擦浴缸、做饭……),配上 50 个场景、9000 多件带"使用说明"的物品,跑在一个能模拟流体、软体、温度的新仿真器 Omn |
| 前沿 | 2024 | Habitat 3.0 | ICLR | 在虚拟的家里加一个会走会动的"假人",让机器人练习扫地搬东西时,得学会一边干活一边躲人、配合人。 |
| 前沿 | 2025 | Isaac Lab | arXiv | 机器人在电脑里"练功"的虚拟训练场。以前练得飞快但看不清画面,画面漂亮又练得慢;Isaac Lab 把这两件事捏到了一起。 |
| 前沿 | 2025 | MuJoCo Playground | arXiv | 一个完全开源、"pip install playground" 一句就能装的机器人学习框架:它把物理仿真、批量渲染、训练环境打包在一起,全部跑在 GPU 上,让研究者在单块显卡上几分钟训出策略,并且能零样本(zero-shot)迁移到真实机器人——不管是四足狗、人形、灵巧手还是机 |
| 前沿 | 2026 | 3D Generation for Embodied AI and Robotic Simulation: A Survey | arXiv | 这篇 survey 讨论 3D generation 如何服务 embodied AI and robotic simulation。它不是普通“3D 生成技术综述”,而是从机器人需要什么出发,把 3D generation 分成三个角色:Data Generator、Simul |