Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Papers · full browse 202 notes · 11 topics

把全量论文留在需要查证的时候。

按主题、难度、era 与内容状态筛选。想先建立主线,请回首页或 Guide;这里负责检索和逐篇进入。

论文笔记库 · 202 papers ↘

教程之外,这里是 202 篇论文的详细笔记——每篇含架构图、实验数据、踩坑提醒。可按主题、难度、era 筛选。

I

VLM Foundation 视觉-语言基座

22 papers
VLM Foundation — 视觉-语言基座

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 01 deep VLM Foundation

LLaVA: Visual Instruction Tuning

入门 24min · 8419字

给一个只会打字聊天的 AI 装上眼睛——你随手拍张照片发过去,它能看着图陪你说话。

№ 02 deep VLM Foundation

3DShape2VecSet: 3D Shape Representation for Diffusion Models

硬核 29min · 10053字

把一个 3D 物体(比如一只椅子)压缩成 512 张小卡片,每张卡片只记录"特征"不记录"位置";电脑学会这些卡片的规律之后,就能从一团随机噪声里凭空造出全新的 3D 模型——还能根据文字描述、单张照片、或半个点云来指挥它造什么。

№ 128 deep VLM Foundation

DeepSeek-VL: Towards Real-World Vision-Language Understanding

进阶 24min · 8408字

DeepSeek 在 2024 年开源的"会看图"模型(1.3B 和 7B 两档),核心不是堆参数,而是给模型配了一双"广角镜头 + 微距镜头"的眼睛(SigLIP + SAM 混合视觉编码器)、能吃 1024×1024 高分辨率,还专门用真实世界的发票、PPT、图表、UI 截图

№ 129 deep VLM Foundation

EVA-CLIP: Improved Training Techniques for CLIP at Scale

进阶 24min · 8359字

EVA-CLIP 不改 CLIP 的架构,只换了三个训练技巧——用一个已经"懂图"的视觉模型当起点、换个不闪腰的大 batch 优化器、训练时随机只看半张图——就用远少于对手的数据和算力,训出了更强的看图模型。最大的 EVA-02-CLIP-E/14+(50 亿参数、90 亿样本

№ 130 deep VLM Foundation

FILIP: Fine-grained Interactive Language-Image Pre-Training

进阶 25min · 8888字

CLIP 是"整张图配整句话"看个大概像不像;FILIP 让图里的每一小块(patch)和句子里的每个词各自去对面找最像的伙伴,模型因此学会"狗在左下角、草地在右边"这种细节——而且只改了对比损失,没牺牲 CLIP 那种"能离线预存特征、检索超快"的效率。

№ 131 deep VLM Foundation

Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks

进阶 16min · 5753字

一个相对小的看图模型:你跟它说"描述这张图""圈出所有的猫""图里红车在哪""把这段文字读出来",它都用同一个脑子处理,输出统一的一段文字。靠一个 5.4 亿标注 / 1.26 亿张图的超大数据集 FLD-5B 撑起来,让参数量不大的模型在检测、分割、caption、ground

№ 133 deep VLM Foundation

Improved Baselines with Visual Instruction Tuning

入门 33min · 11577字

给初代 [LLaVA](llava.md) 换了四个零件——更厚的镜片(两层 MLP)、更高的分辨率(336px)、更丰富的教材(665K 混合数据)、更聪明的大脑(Vicuna-1.5)——模型本身一行代码没改,就在 12 个看图答题榜单上拿了开源第一。

№ 136 deep VLM Foundation

Sigmoid Loss for Language Image Pre-Training

进阶 13min · 4567字

教模型"图配文字",CLIP 的做法是让全班一起排名打分(softmax 对比),SigLIP 改成一对一判断"这俩是不是一对"(sigmoid 判断题)。改这一行损失函数,就换来了算得快、省内存、小批量也能学。

№ 137 deep VLM Foundation

What matters when building vision-language models?

进阶 25min · 8687字

做"看图说话大模型"时,大家凭感觉选零件(用哪个语言模型、图和文怎么拼、图切多少块),却很少做对照实验。这篇论文把每个选择单独拎出来做受控实验,整理成一份"避坑清单",再照着清单训了一个 8B 的模型 Idefics2 当样板——它在同尺寸里最强,有些指标甚至追平大它 4 倍的模

№ 139 deep VLM Foundation

The Llama 3 Herd of Models

硬核 15min · 5305字

Meta 把训练 Llama 3 大模型的全套"菜谱"公开了——用了什么料、多少张卡、跑多久、考多少分,从后厨到摆盘一条龙。

№ 140 deep VLM Foundation

LLaVA-NeXT-Interleave

进阶 15min · 5255字

教 AI 像刷图文并茂的小红书:图和字按顺序穿着读,多图、视频、3D 都用这一招,不用各训一个模型。

№ 141 deep VLM Foundation

LLaVA-OneVision: Easy Visual Task Transfer

进阶 14min · 5054字

一套配方教会一个模型同时看懂单张图、几张图和视频,开源圈第一次在视频上明显接近顶级闭源模型。

№ 142 deep VLM Foundation

Long-CLIP: Unlocking the Long-Text Capability of CLIP

进阶 17min · 5776字

给一个只能读 77 字短纸条、而且实际上超过 20 个字就看糊的 CLIP,做两个精准的小手术,让它能读 248 字的长描述,同时又没忘掉原来认识的那些短词——而且换上去就能用,不用改下游任何代码。

№ 143 deep VLM Foundation

Pixtral 12B

进阶 13min · 4434字

Mistral 开源的一个 120 亿参数的多模态大模型:它用一个从零训练的新视觉编码器,能按图片原始分辨率和长宽比直接读图(你想用多少 token 描述一张图都行),在 12.8 万 token 的超长上下文里塞进任意多张图;它在多模态测评上超过同级甚至更大的开源模型,同时文字

№ 200 deep VLM Foundation

A call for embodied AI

进阶 12min · 4105字

这篇论文提出一个很直接的立场:如果 AI 想走向真正的 general intelligence,不能只靠静态文本数据和离线训练,而要进入 Embodied AI,也就是让智能体拥有感知、行动、记忆和学习能力,在环境中持续互动并从反馈中成长。 作者不是否定 LLM,而是说 LLM

II

High-Level Planning 高层任务规划

14 papers
High-Level Planning — 高层任务规划

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 03 deep High-Level Planning

SayCan: Do As I Can, Not As I Say

入门 25min · 8767字

让"见多识广但出不了门的 AI"出主意,让机器人自己摸口袋说"这事我现在能做",两边都点头才动手——AI 出嘴,机器人出手,两个分数相乘选下一步。

№ 75 deep High-Level Planning

Code as Policies: Language Model Programs for Embodied Control

进阶 26min · 8984字

让 LLM 直接写 Python 代码作为机器人的策略(policy),而不是从预训练技能库中选动作。代码可以包含循环、条件判断、NumPy 运算、递归函数定义,因此能在不做任何额外训练的情况下,通过 few-shot prompting 让机器人执行任意复杂度的新指令——只要感

№ 77 deep High-Level Planning

LLM+P: Empowering LLMs with Optimal Planning

进阶 15min · 5290字

让 LLM 只当翻译——把你说的话翻译成机器格式,真正的规划交给老牌算法去算。LLM 管说话,算法管动脑子。

№ 78 deep High-Level Planning

PaLM-E: An Embodied Multimodal Language Model

硬核 38min · 13176字

教 ChatGPT 长出眼睛和手脚:你说一句话 + 让它瞄一眼现场,它直接列出机器人该做的几步。

№ 79 deep High-Level Planning

ProgPrompt

入门 12min · 4369字

让大语言模型(LLM)不要用大白话写机器人的行动计划,而是写成一段 Python 程序——把机器人能做的动作写成函数、把现场有的物体写成一个列表、再给几个示范程序,LLM 就能照葫芦画瓢生成一段可执行、还自带检查的计划代码。这招在 VirtualHome 家务任务上做到当时最强,

№ 80 deep High-Level Planning

ChatGPT for Robotics

入门 27min · 9491字

这是微软的一篇"设计原则 + 能力研究"论文:它教你怎么用一套方法(提示工程 + 高层函数库 + 人在环把关),让 ChatGPT 把人的大白话指令翻译成机器人能执行的代码。核心招数是——不让 ChatGPT 直接写底层电机代码,而是给它一套"起好名字的高层函数"(如 detec

№ 81 deep High-Level Planning

GenSim

进阶 15min · 5220字

让 ChatGPT 当"出题老师",自动给机器人编一堆练习关卡,连标准答案(专家怎么解)也一起写好。

№ 82 deep High-Level Planning

RoboFlamingo

硬核 12min · 4316字

拿一个现成的开源视觉语言大模型(OpenFlamingo,会看图 + 读文字),给它加一个专门负责"看历史、出动作"的小脑袋(policy head),再用机器人的模仿数据轻轻微调一下,就得到一个能听懂语言指令、看着画面去操作的机器人——在 CALVIN 这个语言指令操作基准上大

№ 83 deep High-Level Planning

Tree-Planner

进阶 12min · 4321字

让大模型一次写好十份"菜谱",把重复步骤合成一棵树,做事时照树走,错了就换条岔路,全程不用反复打电话问。既省 LLM 调用,又自带纠错。

№ 84 deep High-Level Planning

VoxPoser

硬核 13min · 4597字

VoxPoser 让大模型给机器人画两张 3D 地图:红色地方要去、灰色地方要躲,机器人照着地图规划出动作——全程不训练任何新模型。

№ 160 deep High-Level Planning

LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks

进阶 11min · 3994字

LoHoVLA 处理长程具身任务:机器人不只要做一个动作,而要把“把所有积木按规则摆好”拆成一串子任务,并在每一步执行低层动作。它用 PaliGemma 这类 VLM 同时生成 sub-task 文本和 action token,再用分层闭环控制决定什么时候只重试动作、什么时候重

№ 198 deep High-Level Planning

SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems

进阶 12min · 4160字

SafeEmbodAI 关注的是一个很现实的问题:如果移动机器人把摄像头、LiDAR、用户语言指令都交给 LLM 推理,攻击者就可能用 prompt injection 或恶意命令让机器人绕路、撞障碍、忽略安全传感器,甚至进入危险区域。论文提出 SafeEmbodAI,一个把 s

№ 202 deep High-Level Planning

What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?

硬核 11min · 4005字

这篇论文问了一个很关键的问题:具身 AI 的安全问题,到底是 LLM 漏洞、传统 cyber-physical system(CPS)漏洞,还是一种新的系统级失效?作者的答案是:三者都有,但最危险的部分往往来自 perception、reasoning 和 action 被组合到

III

End-to-End VLA 端到端视觉-语言-动作

44 papers
End-to-End VLA — 端到端视觉-语言-动作

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 04 deep End-to-End VLA

OpenVLA: An Open-Source Vision-Language-Action Model

进阶 20min · 6938字

把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。

№ 109 deep End-to-End VLA

RT-1: Robotics Transformer for Real-World Control at Scale

进阶 36min · 12465字

Google 用 13 台机器人花 17 个月录下 13 万段人类示范,训出一个 35M 参数的小 Transformer,让机器人听一句指令就能在真办公室厨房里完成 700 多种操作,并首次证明"大数据 + Transformer"的范式在物理世界同样有效。

№ 110 deep End-to-End VLA

3D Diffusion Policy (DP3)

进阶 21min · 7404字

Diffusion Policy 用 2D 图像当"眼睛",需要上百个示范才学得会。DP3 把眼睛换成"稀疏点云 + 一个极简 MLP 编码器"——只用 10 个示范就能搞定大多数任务,72 个仿真任务平均比 Diffusion Policy 相对提升 24.2%,真机 4 个任

№ 113 deep End-to-End VLA

RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches

硬核 42min · 14806字

教机器人做新动作,光说话不够、给一张完成图也不够。这篇论文说:在画面上画一条"手该走的路"——机器人立刻照着做。核心贡献是提出 RT-Trajectory,用 2D 轨迹草图(trajectory sketch)作为策略条件(policy conditioning),在同样的训练

№ 114 deep End-to-End VLA

3D-VLA

硬核 22min · 7722字

现在主流的 VLA(视觉-语言-动作模型,如 RT-2、OpenVLA)都是"看 2D 照片 → 直接出动作",缺了三维空间感,也不会"想象未来"。3D-VLA 做了两件事:(1) 把眼睛从 2D 图像换成 3D 点云;(2) 在动手之前,先用扩散模型"脑补"出任务完成后的画面(

№ 116 deep End-to-End VLA

GR-2: Generative Video-Language-Action Model

硬核 16min · 5631字

让机器人先刷大量网络视频攒常识,再练动手;它干活时脑子里会先"预演"下一秒的画面,再从这个预演里读出动作。

№ 117 deep End-to-End VLA

DexVLA

硬核 26min · 9132字

现在的 VLA 模型(如 OpenVLA、π0)都在拼命把"视觉语言模型(VLM)"那部分做大,却忽略了真正产生动作的"动作专家"太小、动作表示是瓶颈。DexVLA 反其道而行——把扩散动作专家放大到 10 亿参数、做成多头结构支持跨机体,再配一套"具身课程学习"三阶段训练,还让

№ 117 deep End-to-End VLA

OpenHelix

进阶 28min · 9769字

指令:"把红色瓶子递过来" + 当前画面

№ 118 deep End-to-End VLA

OpenVLA-OFT

进阶 18min · 6211字

原版机器人大模型 OpenVLA 输出动作时像"一个字一个字念口令"——慢、抖、长任务掉链子。OpenVLA-OFT 把微调这件事拆成三个可以各自打开的开关——并行解码(一口气说完)、动作分块(一段段说)、连续动作表征(说准确的小数),再配一个极简的 L1 回归目标,把 LIBE

№ 119 deep End-to-End VLA

RDT-1B: Diffusion Foundation Model for Bimanual Manipulation

硬核 19min · 6717字

清华团队给双臂机器人造的"大脑":用扩散模型(diffusion)当动作生成器、Diffusion Transformer(DiT)当骨架,把参数推到 12 亿(1.2B)——目前最大的扩散式机器人操作基础模型。它先在 46 个多机器人数据集(约 100 万条轨迹)上预训练,再在

№ 120 deep End-to-End VLA

RoboMamba

进阶 15min · 5406字

机器人的"大脑"原来是用 Transformer 搭的,反应慢、显存吃紧。RoboMamba 把大脑主干换成 Mamba(一种"流水线式"的新架构),让机器人既能听懂指令、看懂画面,又能快速吐出手臂动作,而且推理开销大幅下降。

№ 121 deep End-to-End VLA

SpatialVLA

硬核 13min · 4489字

教机器人两件事:用普通摄像头也能看出远近(Ego-3D 位置编码);把常用动作存成"肌肉记忆"、不常用的粗着存(自适应动作网格)。两招合起来,让 VLA 跨机器人、跨任务迁移更稳。

№ 122 deep End-to-End VLA

TinyVLA

进阶 12min · 4356字

把会听话的机器人大脑瘦身到约 1.4B,动作生成换成"先乱后凿"的扩散头,不靠云端也能在边缘设备上实时干活。

№ 123 deep End-to-End VLA

TraceVLA: Visual Trace Prompting

进阶 16min · 5710字

机器人的手刚走过哪里?TraceVLA 把这条路径直接画在它看到的照片上,让它"看见自己的足迹",再决定下一步往哪动。做法极简:在 OpenVLA 上用自采的 15 万条轨迹做视觉轨迹提示(visual trace prompting)微调,不加新模块、不加历史文本。结果在 Si

№ 159 deep End-to-End VLA

Universal Actions for Enhanced Embodied Foundation Models

硬核 12min · 4028字

机器人数据最大的问题不是没有数据,而是每台机器人说的“动作语言”不同:有的输出末端位置,有的输出关节角,有的输出速度,有的还是双臂。Universal Actions 提出 UniAct,让模型先学一套跨机器人共享的“通用动作空间”,再用每台机器人的 decoder 把通用动作翻

№ 162 deep End-to-End VLA

EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control

硬核 11min · 3988字

EO-1 认为,机器人不能只在最后一步输出动作;真实交互里,人会边看、边想、边说出中间判断、边行动。它提出 EO-Robotics:3B 的 EO-1 模型、EO-Data1.5M 数据集和 EO-Bench 评测,把 image、text、video、action 交错成同一条

№ 163 deep End-to-End VLA

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

硬核 15min · 5274字

Qwen-VLA 想证明一件事:操作、导航、人类第一视角轨迹和视觉语言理解,不一定要拆成四套系统,可以统一成看图、读指令、理解当前身体,然后预测未来动作或轨迹的同一个 VLA 问题。 如果只记一个直觉:它不是在问机器人能不能完成某个固定任务,而是在问能不能把看见、听懂、知道自己是

№ 165 deep End-to-End VLA

LLaDA-VLA: Vision Language Diffusion Action Models

硬核 15min · 5178字

LLaDA-VLA 的核心问题是:既然扩散语言模型可以通过反复 mask-denoise 生成文本,那能不能也让它从全是 mask 的动作序列一步步还原出机器人动作?论文答案是可以,但要给动作 token 单独设计分类目标和分层解码。 如果只记一个直觉:它不是在问机器人能不能完成

№ 167 deep End-to-End VLA

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

硬核 12min · 4182字

Vlaser 关注一个很容易被忽略的问题:VLM 会推理,不等于 VLA 会控制;如果上游具身推理数据和下游动作策略训练之间没有桥,模型可能会在问答 benchmark 上变强,却不一定让机器人做得更好。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人

№ 168 deep End-to-End VLA

X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

硬核 12min · 4148字

X-VLA 解决的是跨机器人预训练的稳定性问题:同一批数据里机器人、相机、动作空间、遥操作风格都不同,直接混训容易崩;它用每个数据源一组 learnable soft prompts,让主干学 embodiment-agnostic 能力。 如果只记一个直觉:第 2 批都在回答同

№ 169 deep End-to-End VLA

Embodiment Transfer Learning for Vision-Language-Action Models

硬核 12min · 4077字

ET-VLA 讨论的是一个很实际的问题:OpenVLA 这类自回归 VLA 在单机械臂上表现不错,但一到双臂/多机器人协作,就容易生成错误数量的动作 token、分不清哪个机器人该做哪一步。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人、单一任务、单

№ 170 deep End-to-End VLA

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

硬核 12min · 4046字

HiMoE-VLA 的核心判断是:机器人数据的异构性不是一种东西,而是好几种东西叠在一起;动作空间差异、身体差异、相机差异和控制频率差异,应该由不同层级的专家模块分别处理。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人、单一任务、单一动作空间,走向跨

№ 171 deep End-to-End VLA

Green-VLA: Staged Vision-Language-Action Model for Generalist Robots

硬核 12min · 4086字

Green-VLA 的核心不是单纯扩大模型,而是把 VLA 从网页视觉语言基座、机器人预训练、具体身体适配到 RL 对齐,拆成 L0/L1/R0/R1/R2 五个阶段,目标是让同一个策略覆盖单臂、双臂和 Green 人形机器人。 如果只记一个直觉:第 3 批从“模型能不能统一”推

№ 173 deep End-to-End VLA

MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation

硬核 12min · 4069字

MoS-VLA 把策略看成一组 learned basis functions 的线性组合。新环境来了,不用梯度微调,只要一条专家轨迹,就能求出组合系数,生成适配该环境的新 policy。 如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人需要低

№ 174 deep End-to-End VLA

Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation

硬核 12min · 4068字

DuoCore-FS 面向全身机器人控制:慢系统用 3B VLM 做语义推理,快系统以 25–30Hz 生成连续全身动作,两者通过 bridge buffer 异步连接,不再让快控制等待慢推理。 如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人

№ 175 deep End-to-End VLA

VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models

硬核 12min · 4193字

VLA-Forget 研究一个很现实的问题:VLA 模型学到了不安全、错误或隐私敏感的行为后,能不能只删掉这部分行为,同时保留视觉理解、语言 grounding 和正常动作控制能力。它把 VLA unlearning 拆成三件事:targeted forgetting、perce

№ 176 deep End-to-End VLA

Membership Inference Attacks on Vision-Language-Action Models

硬核 12min · 4056字

这篇论文研究 VLA 模型的隐私风险:攻击者能不能通过观察模型输出,判断某个 transition 或完整 robot trajectory 是否在训练数据里。论文把 VLA membership inference 分成 sample-level 和 trajectory-le

№ 177 deep End-to-End VLA

A Survey on Efficient Vision-Language-Action Models

进阶 12min · 4028字

这篇综述整理 efficient VLA 的研究地图:VLA 要落地到机器人,不能只追求更大模型和更高 benchmark 分数,还要处理实时控制、算力成本和数据采集成本。论文把现有工作归纳为三个核心支柱:Efficient Model Design、Efficient Trai

№ 178 deep End-to-End VLA

Survey of Vision-Language-Action Models for Embodied Manipulation

进阶 12min · 4073字

这篇综述系统整理面向具身操作的 VLA 模型。它从具身智能系统视角出发,把 VLA 发展历程分成 3 个阶段,并从 5 个关键维度分析当前研究:VLA model structures、training datasets、pre-training methods、post-tra

№ 179 deep End-to-End VLA

Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review

进阶 12min · 4153字

这篇系统综述讨论 foundation models 如何用于 mobile service robots。它把移动服务机器人面临的核心挑战归纳为四类:把自然语言指令翻译成可执行动作、多模态感知、不确定性估计、板载计算约束。论文再分析 LLM、VLM、MLLM 和 VLA 如何分

№ 180 deep End-to-End VLA

Toward Embodied AGI: A Review of Embodied AI and the Road Ahead

进阶 12min · 4045字

这篇综述提出 Embodied AGI 的五级路线图 L1-L5,并用四个能力维度评估当前差距:omnimodal capabilities、humanoid cognitive abilities、real-time responsiveness、generalization。

№ 182 deep End-to-End VLA

Embodied Navigation Foundation Model

硬核 12min · 4049字

Embodied Navigation Foundation Model 提出 NavFoM,一个跨任务、跨本体的导航基础模型。论文报告模型训练在八百万导航样本上,覆盖 quadrupeds、drones、wheeled robots、vehicles,并跨 vision-and

№ 183 deep End-to-End VLA

MiMo-Embodied: X-Embodied Foundation Model Technical Report

硬核 12min · 4330字

MiMo-Embodied 是小米团队发布的 X-Embodied foundation model technical report。它尝试把 autonomous driving 和 embodied AI 放进同一个 vision-language model 里训练,让模

№ 191 deep End-to-End VLA

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

硬核 13min · 4523字

Gaze2Act 想解决一个很日常但很难的机器人交互问题:用户说“把那个杯子递给我”时,房间里可能有很多杯子;用户说“抓住锤子的这里”时,语言很难精确表达“这里”;用户执行到一半又想换目标时,静态指令也跟不上。论文提出把人的 gaze(视线 / 注视点)作为 VLA policy

№ 192 deep End-to-End VLA

LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation

硬核 12min · 4042字

LACY 的核心问题是:现在很多机器人策略只学习 language-to-action,也就是“听一句话,做一个动作”。论文认为这太单向了。一个真正稳的机器人不只要会执行语言,还应该能反过来解释动作、判断语言和动作是否语义一致。LACY 因此把三件事放进同一个 vision-la

№ 193 deep End-to-End VLA

villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models

硬核 12min · 4316字

villa-X 的问题是:VLA 模型很想从海量视频中学习动作,但视频通常没有机器人 action labels。人类视频、互联网视频和不同机器人 embodiment 的视频里都有“发生了什么变化”,却没有统一的 7D 末端执行器动作。villa-X 提出 Vision-Lan

№ 197 deep End-to-End VLA

A Survey of Language-Conditioned Robot Manipulation

进阶 12min · 4224字

这篇综述系统整理 language-conditioned robot manipulation,也就是机器人如何根据自然语言完成操作任务。它的核心贡献不是提出一个新 policy,而是给领域建立一套分类框架:语言可以作为 state evaluation、policy cond

IV

Diffusion Policy 扩散策略与流匹配

16 papers
Diffusion Policy — 扩散策略与流匹配

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 41 deep Diffusion Policy

EquiBot: SIM(3)-Equivariant Diffusion Policy

硬核 17min · 5939字

教机器人几次就够了。物体挪个位置、转个方向、换个大小都不用重学——因为"这件事和位置朝向大小无关"这个常识被直接焊进了网络结构里,而不是靠堆数据让它慢慢悟。

№ 42 deep Diffusion Policy

DiT-Policy

硬核 22min · 7635字

扩散策略强在"多模态",Transformer 强在"可扩展",但把两者硬凑到一起训练极不稳定(原版 Diffusion Policy 的 Transformer 实现几乎训不动)。这篇论文找到了正确配方——用 adaLN-Zero 注意力块 + ResNet 图像分词器,让扩散

№ 43 deep Diffusion Policy

Diffusion Policy Policy Optimization (DPPO)

硬核 20min · 7035字

先跟着老师傅模仿,再自己上手练。DPPO 把"自己练"那一步拆成很多个小动作,让一套很常规的强化学习算法(PPO)也能稳稳地调教"扩散策略"这种脑子里要打好几遍草稿才动手的机器人。

№ 44 deep Diffusion Policy

Affordance-based Robot Manipulation with Flow Matching

进阶 16min · 5576字

教机器人做事时,先让它看懂"物体能怎么用",再用一种"画直线"式的方法直接生成动作——比扩散模型更快、训练更简单。

№ 46 deep Diffusion Policy

FAST: Efficient Action Tokenization for VLA

硬核 13min · 4700字

给机器人的连续动作找一种更聪明的"切词方式":不再逐个维度、逐个时刻粗暴分格,而是先把一段动作用"频率变换 + 压缩"编成紧凑的 token。这一改,让自回归式的视觉-语言-动作模型(VLA)第一次能学会那些高频、灵巧的操作技能;配上 π0,训练速度比扩散式 VLA 快最多 5

№ 47 deep Diffusion Policy

π₀: A Vision-Language-Action Flow Model for General Robot Control

硬核 16min · 5481字

Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 种机器人、68 任务、1 万+ 小时数据

№ 48 deep Diffusion Policy

pi_0.5: VLA with Open-World Generalization

硬核 20min · 6865字

Physical Intelligence 的 π0.5:在前作 π0 的"VLM 大脑 + flow matching 动作专家"基础上,靠异构联训(co-training)——约 400 小时移动机器人数据(100 个真实家庭)+ 大量其他机器人数据 + 网页图文/VQA +

№ 195 deep Diffusion Policy

Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation

硬核 12min · 4255字

Discrete Policy 处理的是多任务机器人操作里的“动作空间纠缠”问题。一个任务可能有多种成功轨迹,多个任务混在一起训练时,动作分布会变得更复杂、更像几团缠在一起的线。直接用 Behavior Cloning 或 Diffusion Policy 从 observati

V

Imitation Learning 模仿学习与遥操作

15 papers
Imitation Learning — 模仿学习与遥操作

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 50 deep Imitation Learning

Generative Adversarial Imitation Learning

硬核 34min · 11912字

让 AI 看大厨做菜的录像,再找个"挑刺老师"分辨它做得像不像,靠这种较劲学会做事,不用猜大厨心里的打分标准。

№ 51 deep Imitation Learning

Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)

进阶 14min · 4863字

用约 2 万美元搭一套"主从臂遥操 + 四摄像头"的双臂系统(ALOHA),让人示范 50 次约 10 分钟,再用 ACT 算法让机器人一次预测未来 100 步动作而不是一步一步猜——开调料杯、插电池这类毫米级精细活,成功率能到 80–96%。

№ 52 deep Imitation Learning

AnyTeleop

进阶 23min · 8121字

要教机器人干活,得先有人"手把手"演示——这个"人远程操控机器人"的过程叫遥操作(teleoperation)。过去的视觉遥操作系统都是"一套系统只配一款机器人、一个环境",换机器人就得重做。AnyTeleop 做了一套通用系统:只用普通摄像头,就能操控任意机械臂+任意灵巧手,在

№ 53 deep Imitation Learning

Behavior Transformers: Cloning k Modes with One Stone

进阶 22min · 7563字

同一件事人类有好几种做法(左绕、右绕都行)。传统 AI 会把这些做法"取平均"成一个四不像。BeT 先用 k-means 把动作分成 k 个"流派",让 Transformer 先选流派、再微调细节——一个模型克隆出人类示范里的所有主流做法。

№ 54 deep Imitation Learning

Implicit Behavioral Cloning

硬核 30min · 10617字

别让模型直接报"动作是这个",而是让它给一堆候选动作打分、挑最低分那个——机器人的手就突然变巧了。

№ 55 deep Imitation Learning

RoboCat

硬核 13min · 4630字

DeepMind 造的一个"通用机器人操作大脑":它能同时控制多种不同的机械臂、做多种任务,只要给它一张"目标长啥样"的图片就知道该干什么;遇到新任务或新机器人,用 100–1000 个示范就能快速上手;更关键的是,它能用自己练出的能力去生成新数据,再拿这些数据把自己练得更强,形

№ 56 deep Imitation Learning

ALOHA 2

入门 26min · 9015字

人(操作员) 机器(工作端)

№ 58 deep Imitation Learning

HumanPlus

硬核 22min · 7703字

给一台成人尺寸的人形机器人搭一整套"从人身上学"的流水线:先用一个普通摄像头把人的全身动作实时抄到机器人身上(叫"影子模仿 / shadowing",人怎么动它怎么动),用这种方式一个人就能遥控它采数据;再拿采到的数据训一个策略,让机器人看着自己头上的摄像头自主复现技能——只用不

№ 60 deep Imitation Learning

Mobile ALOHA

进阶 22min · 7844字

给原来只能趴在桌上干活的双臂机器人焊一辆能跑的小车,让一个人同时"手控双臂 + 腰推底盘"把整套家务动作录下来;再用一个很朴素的招数——把新录的"移动家务"数据和以前攒的一大堆"桌面双臂"数据混在一起训——就能让机器人只看 50 次示范,学会炒虾、擦红酒渍、进电梯这种"边走边用两

№ 61 deep Imitation Learning

SmolVLA

进阶 13min · 4482字

Hugging Face 推出的小型机器人模型:把"看到 + 听到 + 动手"塞进一张游戏显卡就能训的小脑袋,还全部用社区公开数据训练——让没有数据中心的人也能在家玩具身 AI。

№ 62 deep Imitation Learning

Universal Manipulation Interface

进阶 13min · 4721字

做一个和机器人末端一模一样的手持夹爪 + GoPro(约 371 美元),人去厨房、咖啡馆随便示范;视频经视觉-惯性 SLAM 还原 6D 轨迹,再训 Diffusion Policy——机器人不在场也能采数据,洗碗、抛球、叠毛衣、摆咖啡杯都能零样本泛化到新环境,分布外测试综合成

№ 63 deep Imitation Learning

Behavior Generation with Latent Actions (VQ-BeT)

硬核 13min · 4406字

机器人本来要画一条平滑曲线动作,VQ-BeT 让它改成"先从菜单里选一个动作词、再小修一点"——就像挑表情包再加文字,比硬画曲线更不容易出怪招,还比扩散策略快得多。

№ 109 deep Imitation Learning

DexCap

硬核 24min · 8418字

DexCap 是斯坦福做的一套便携动捕系统:一件背心 + 手套 + 几个小相机,人穿上它在任何地方(厨房、客厅)徒手干活,就能实时(60Hz)录下"手腕 6 自由度位姿 + 手指动作 + 3D 环境点云"。配套算法 DexIL 把这些人手数据翻译成机器人动作、用点云扩散策略学习,

VI

World Model & Video Policy 世界模型与视频策略

16 papers
World Model & Video Policy — 世界模型与视频策略

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 07 deep World Model & Video Policy

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control

硬核 33min · 11451字

把一个会"脑补下一秒视频"的大模型,再练一遍,就能让它指挥机械臂做家务——不改模型结构、不加新零件,只是把机器人动作、未来画面和评分全伪装成视频帧塞进去,让模型按原来处理视频的方式一起学会三件事。

№ 144 deep World Model & Video Policy

Dream to Control: Learning Behaviors by Latent Imagination

硬核 30min · 10564字

教 AI 在脑子里反复"做白日梦"演练动作,不用真去摔跤,就能学会跑步、翻跟头这种复杂动作。具体而言:先从少量真实经验中学一个压缩版的"脑内世界模型",然后在这个模型里想象几千条未来轨迹,用精确的数学导数告诉策略网络"刚才哪步该往哪个方向调",最终以 1/20 的真实交互量超越了

№ 145 deep World Model & Video Policy

World Models

进阶 31min · 10942字

让 AI 先在自己脑子里反复"做白日梦"练打游戏,练熟了再去真游戏里上场——居然真能赢。

№ 146 deep World Model & Video Policy

DayDreamer

进阶 26min · 8974字

让一只四足机器人不靠仿真、不靠遥控示范,直接在真实地面上边走边"在脑子里做梦演练",1 小时从零学会站起来和走路。

№ 147 deep World Model & Video Policy

Mastering Atari with Discrete World Models

硬核 36min · 12665字

让 AI 闭眼"做白日梦"练打老游戏,第一次只靠脑子里想象就打到人类水平。具体做法:把脑内模拟器的"快照"从连续数字(高斯)换成离散选项(32 组 x 32 类 categorical),再用一个叫 KL balancing 的二八开技巧来让"猜测"尽量贴近"亲眼看到"的状态,最

№ 148 deep World Model & Video Policy

Dreamer V3: Mastering Diverse Domains through World Models

硬核 19min · 6497字

DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。

№ 149 deep World Model & Video Policy

Transformers are Sample-Efficient World Models

硬核 15min · 5347字

把游戏画面切成一格格"积木",让 AI 像写句子一样接龙下一帧,然后让它在脑子里"自己跟自己玩"练强化学习——只玩两小时就接近人类水平。

№ 150 deep World Model & Video Policy

TWM: Transformer-based World Models

硬核 13min · 4416字

智能体(agent)在脑子里"做梦"练本事。这篇把梦的引擎从 RNN 换成 Transformer,记得更长、做得更准,在样本效率基准 Atari 100k 上有竞争力。

№ 118 deep World Model & Video Policy

Cosmos World Foundation Model

硬核 28min · 9740字

Cosmos 是英伟达做的一个"世界基础模型(World Foundation Model, WFM)平台":核心是一个会"看过去的视频 + 一个动作/指令 → 生成未来会发生什么视频"的大模型。它像给机器人和自动驾驶造了一个"数字世界的沙盘",让物理 AI 能先在里面安全预演,

№ 151 deep World Model & Video Policy

1X World Model Challenge

进阶 23min · 7890字

给机器人两个不同难度的"脑补未来"考题:一个是直接画出未来的像素画面(采样赛道),一个是预测未来的压缩编码(压缩赛道)。冠军队一个用现成视频大模型 Wan-2.2 微调、一个从零训小 Transformer,双双夺冠——还比亚军快一个数量级。

№ 153 deep World Model & Video Policy

GAIA-1

硬核 16min · 5664字

GAIA-1 是个会做梦的开车模拟器:给它一段街景视频的开头,加一句"我现在打方向盘",它能接着画出后面几秒街上看到的画面。

№ 154 deep World Model & Video Policy

Genie: Generative Interactive Environments

硬核 20min · 6865字

Genie 从海量无标注游戏录屏里,自己"猜"出每两帧之间按了什么键,再用这个猜出来的虚拟按键续画下一帧——把死视频变成单张图片就能开玩的互动世界。

№ 155 deep World Model & Video Policy

Navigation World Models

硬核 14min · 4908字

训练一个"导航世界模型"(NWM):给它当前看到的画面和一串打算走的动作,它就能像放电影一样预测出"这样走下去画面会变成什么样"。有了这个"脑内模拟器",智能体可以先在脑子里把好几条路线各走一遍、看哪条能到目的地,再挑最好的去执行——甚至在从没去过的环境里,只凭一张照片就想象出一

№ 156 deep World Model & Video Policy

UniSim

硬核 13min · 4589字

看过海量视频后,你给它一个动作(说一句话 / 推一下机械臂 / 挪一下镜头),它就生成"接下来世界长什么样"的视频——像一台会脑补现实的"游戏机",还能拿它当机器人的训练场。

№ 199 deep World Model & Video Policy

The Essential Role of Causality in Foundation World Models for Embodied AI

硬核 12min · 4093字

这篇论文的核心问题是:具身智能要在真实世界里行动,单靠“看过很多图像和文字”的 foundation model 不够,因为机器人真正需要的是知道“我做这个动作后,世界会怎样变化”。作者提出 Foundation Veridical World Model(FVWM,基础可信世界

№ 201 deep World Model & Video Policy

Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis

硬核 12min · 4101字

这篇综述问的是:foundation model 到底怎样帮助机器人走向 general-purpose robots?它把问题拆成两类路线:一类是把已有视觉/语言 foundation model 插进机器人系统,比如用 VLM 做开放词表感知、用 LLM 做任务规划;另一类是

VII

Multimodal Ecology 多模态交互与数据生态

15 papers
Multimodal Ecology — 多模态交互与数据生态

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 05 deep Multimodal Ecology

VLAS: VLA Model With Speech Instructions

进阶 30min · 10640字

把一个会"看图说话"的 AI(LLaVA)改造成会"听声音 + 认嗓音 + 动手"的机器人模型:用 Whisper 编码器当耳朵、用"声纹查档案"(Voice RAG)解决"我的杯子是哪只"这种个性化问题,最终在定制化任务上比纯文字 VLA 高出 4 倍(86.5% vs 19.

№ 06 deep Multimodal Ecology

MLA: Multisensory Language-Action Model

硬核 33min · 11675字

让机器人不只用眼睛看,还会用"手感"和"空间感",并且大脑自己直接听三种感官(不请翻译),训练时还要脑补未来的画面、形状和触感——推理时省掉脑补这步,相当于白嫖了一波理解力,最终在接触密集操作任务上大幅超越前辈。

№ 64 deep Multimodal Ecology

ImageBind: One Embedding Space To Bind Them All

进阶 41min · 14270字

把图片当翻译官,六种感官(图、文、声、深度、热、动作)就能互相听懂彼此说话——而且不需要让它们两两见过面。

№ 66 deep Multimodal Ecology

AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model

进阶 12min · 4074字

Meta AnyMAL 在 LLaMA-2-70B-chat 全程冻结 的前提下,为 图 / 视频 / 音 / IMU 各训一个 投影层(aligner),把模态信号映进 LLM 词嵌入空间 当「伪 token」;再用自标 60K MM-IT + 合成 150K 做指令微调。零样

№ 67 deep Multimodal Ecology

AudioPaLM

硬核 24min · 8421字

现在最强的文本大模型(如 PaLM-2)会读会写,但"听不见、不会说"。AudioPaLM 的想法很直接:把语音也切成一个个"词元(token)",塞进文本大模型的词表里,让同一个模型既能吃文字又能吃声音、既能吐文字又能吐声音。这样一个模型就能同时做语音识别、语音翻译、语音到语音

№ 68 deep Multimodal Ecology

FROMAGe: Grounding LLMs to Images

进阶 15min · 5391字

把一个会说话的大模型整个冻住不动,只在它前后各加一层薄薄的"翻译片",就让它能看图、找图、还能图文混着聊天。

№ 69 deep Multimodal Ecology

OneLLM

进阶 14min · 4729字

用一套统一的框架,把图像、音频、视频、点云、深度图、法线图、惯性传感器(IMU)、甚至大脑 fMRI 信号这八种完全不同的感官输入,全都翻译成语言模型能听懂的形式,接到同一个大语言模型上——不再为每一种感官单独造一个专用编码器和专用对齐模块。

№ 70 deep Multimodal Ecology

X-VLM: Multi-Grained Vision Language Pre-Training

硬核 18min · 6290字

X-VLM 教 AI 看图,不只学"整张图配整句话",还同时学"图里某个物体配某个词"——而且不靠外部的物体检测器,一个模型端到端把整图、区域、物体三种粒度的图文对齐一起学,于是问图里某个细节时也能答准。

№ 134 deep Multimodal Ecology

OBELICS

进阶 12min · 4154字

HuggingFace OBELICS 从 Common Crawl 抽出 1.41 亿 英文网页、3.53 亿 张图、1150 亿 text token,按 DOM 原生顺序 保留「段–图–段–图」交错结构;在此上训 IDEFICS-80B 后 4-shot VQAv2 63.

№ 71 deep Multimodal Ecology

Tactile Beyond Pixels (Sparsh-X)

硬核 13min · 4612字

让机器人的手指不止"看"接触画面,还能听响声、感力度、察打滑——四路信号一起自监督学习,摸东西才像人。学出来的是一个通用"手感"编码器,下游任务贴一顶小帽子就能用。

№ 72 deep Multimodal Ecology

Sparsh: Self-supervised Touch Representations

硬核 25min · 8719字

以前每个触觉任务都得从零标注、从零训练。Sparsh 先让模型在 46 万张以上无标签触觉图上自学一遍"触觉词汇",之后做任何具体触觉任务只要少量例子就能追平甚至超过专门训练的模型——平均超出 95.1%。

№ 73 deep Multimodal Ecology

Tactile-VLA

硬核 27min · 9385字

给已经会看、会听、会动的机器人补上"手感"这一课:不仅让它摸得到接触的力,还让它听懂"轻轻插"和"用力插"的区别——而且这份"手感常识"很大一部分是从大模型脑子里唤醒出来的,不是从零训出来的。

№ 74 deep Multimodal Ecology

TLA: Tactile-Language-Action

硬核 13min · 4506字

让机器人像你闭眼摸钥匙那样——靠"一段持续变化的触感"加上一句话指令,自己决定下一步该怎么用手。关键是把触觉当成带时间的模态,而不是一张压力快照。

VIII

RF Perception & Mapping 射频感知与空间建图

16 papers
RF Perception & Mapping — 射频感知与空间建图

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 08 deep RF Perception & Mapping

CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches

硬核 35min · 12123字

给机器人装一颗几百块的毫米波小雷达,让它一边走一边画出厘米级精度的 3D 地图。关键创新是让 AI 学会说"我对这个预测不太确定",从而自动忽略不靠谱的测量,最终在 14 层楼的实测中打败了所有相机方案。

№ 09 deep RF Perception & Mapping

mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment

硬核 13min · 4517字

用对比学习把毫米波雷达信号「翻译」进 CLIP 的文本语义空间——训练时见过走路、跑步,部署时只要写一句「太极拳」的文字描述,雷达就能认出来,不需要为新动作再采雷达数据。

№ 85 deep RF Perception & Mapping

See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar

进阶 48min · 16816字

机器人在浓烟里也能画出清晰的房间地图——靠一颗几十块的小雷达加一个会"脑补"的神经网络。 具体两招: 训练时让贵的激光雷达(lidar)和便宜的雷达坐同一辆车,把 lidar 的清晰图当作业答案喂给神经网络(cGAN),教雷达学会脑补。学完老师下车,雷达单飞。 认门/墙/玻璃/电

№ 86 deep RF Perception & Mapping

Can WiFi Estimate Person Pose?

进阶 42min · 14733字

想象你家路由器除了上网,还能告诉你"屋里那个人正在做啥姿势"——胳膊抬到哪、腿怎么弯,全画给你看。这篇论文用一对普通商用 WiFi 网卡(3 天线发射 + 3 天线接收),配一个摄像头当"老师",让神经网络学会从 WiFi 信道状态信息(CSI)直接画出 18 个人体关节点。核心

№ 88 deep RF Perception & Mapping

milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion

进阶 14min · 4870字

用一颗几十块钱、单芯片的毫米波雷达,加上一套专门设计的神经网络,让一个移动设备(人、机器人、无人机)在黑暗、烟雾、无纹理墙面这些摄像头会失灵的环境里,也能准确算出"自己往哪儿走了、走了多远",3D 轨迹误差低到约 1.3%。

№ 89 deep RF Perception & Mapping

High Resolution Point Clouds from mmWave Radar

进阶 13min · 4578字

训练一个端到端的神经网络,把一颗便宜的单芯片毫米波雷达"看糊的、又稀又乱的"数据,翻译成接近激光雷达(LiDAR)那样清晰、稠密的点云——而且在浓烟弥漫、雷达没见过的房间里也照样管用,生成的点云还好到能直接喂给现成的激光雷达建图/里程计软件。

№ 93 deep RF Perception & Mapping

RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory

硬核 13min · 4572字

用无线电波(RF 信号)估计人体的三维姿态(骨架关节位置)——关键创新是:不像以前那样在"信号层面"硬凑,而是先用最优传输(Optimal Transport)理论,把 RF 信号的特征"搬运"到姿态的特征空间,再从搬运后的特征生成人体骨架。这样即使隔墙、遮挡、在室外,也能比以前

№ 94 deep RF Perception & Mapping

Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on

硬核 24min · 8446字

想实时知道一个人全身姿态(比如健身教练看你深蹲标不标准),传统办法要么靠摄像头(怕黑、有隐私、会被遮挡),要么靠昂贵的动捕棚。Argus 换个思路:在耳机/VR 头显左右两侧各磁吸一个指甲盖大小、7.5 克、0.35 瓦的毫米波雷达,从"第一视角(戴在头上往下看身体)"双视角感知

№ 95 deep RF Perception & Mapping

Diffusion Model is a Good Pose Estimator from 3D RF-Vision

硬核 25min · 8603字

毫米波雷达拍出的人像像隔了层毛玻璃、还在闪。mmDiff 让 AI 从一团噪点出发、以雷达信号为参照,一步步"擦"出稳定又符合人体常识的 3D 骨架,比"一口气猜"准得多、稳得多。CVPR 2024 收录,是第一个用扩散模型做毫米波雷达人体姿态估计的工作。

№ 96 deep RF Perception & Mapping

Enabling Visual Recognition at Radio Frequency (PanoRadar)

硬核 12min · 4048字

*PanoRadar 把 TI AWR1843 单芯片 mmWave 雷达装到 8 cm 半径、2 Hz 转台上,合成 8×1200 圆柱虚拟阵列;再用 RF 自运动估计 + 2D CNN 提仰角分辨率,从纯射频信号生成 360° range image,在 12 栋建筑 lea

IX

Auditory & Acoustic 听觉智能与声学空间交互

15 papers
Auditory & Acoustic — 听觉智能与声学空间交互

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 11 deep Auditory & Acoustic

Proactive Hearing Assistants that Isolate Egocentric Conversations

进阶 33min · 11682字

戴上这副耳机,它自动听出"现在你在跟谁聊天",把同伴的声音放大、把陌生人和噪音压下去——你一个按钮都不用按,甚至不用提前录入任何人的声音。它靠的不是"认声音",而是"认对话节奏"。

№ 12 deep Auditory & Acoustic

NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators

进阶 36min · 12518字

在咖啡馆听不清对面说话?让助听器自己降噪,不连手机、不连云——把一个原本跑在显卡上的"降噪大脑"拆骨瘦身 100 倍,再教它用"粗糙的算盘"(8 位整数芯片)照样算出接近原来的答案,最终全部塞进一只挂在耳朵后面的小壳子里,处理一帧音频只要 5.54 毫秒,功耗只有 71 毫瓦,2

№ 13 deep Auditory & Acoustic

Creating speech zones with self-distributing acoustic swarms

进阶 36min · 12710字

七个骰子大小的小机器人,从充电底座自己爬上桌子、散成一圈,靠互相"喊一嗓子"算出各自的精确坐标,然后联手把桌旁几个同时说话的人一一分清——谁在哪、说了啥,全部搞定。整个过程不需要头顶装摄像头、不需要人手摆放、不需要扯一根线。

№ 16 deep Auditory & Acoustic

AudioLM

硬核 13min · 4491字

Google AudioLM 把波形变成 两套离散 token——w2v-BERT 语义 token(25 Hz) 管长程内容,SoundStream 声学 token(50 Hz×12 层 RVQ) 管高保真音色——再用 三个 0.3B Transformer 分阶段自回归续写

№ 17 deep Auditory & Acoustic

Conformer

进阶 21min · 7405字

Transformer 擅长看"全局大局",卷积擅长抠"局部细节",Conformer 把两者塞进同一个模块里——让语音识别既看得远又看得清,用更少的参数刷出了 LibriSpeech 的最好成绩(测试集 word 错误率低到 1.9%/3.9%)。

№ 18 deep Auditory & Acoustic

Dual-path RNN

硬核 25min · 8890字

混音波形(32000 个采样点,超长)

№ 19 deep Auditory & Acoustic

EnCodec

硬核 25min · 8585字

EnCodec 教神经网络把一段声音压成一串很小的整数、再几乎无损地还原回来——既比传统编解码器在极低码率下更清晰,又因为声音变成了"整数序列",让 AI 能像写字一样"写"出声音。

№ 20 deep Auditory & Acoustic

Meta-StyleSpeech

进阶 14min · 4750字

给一个文字转语音(TTS)系统装上"听一句就模仿声线"的能力——只要给它一段 1 到 3 秒的陌生人录音,它就能用那个人的音色把任意文字念出来,而且不需要为这个人重新训练模型。

№ 21 deep Auditory & Acoustic

MusicLM

硬核 13min · 4517字

给一句文字描述,比如"一段舒缓的小提琴旋律配上失真吉他 riff",MusicLM 就能生成一段 24kHz、能连贯保持好几分钟的高保真音乐;还能让你哼一段跑调的旋律,它按你的文字风格把它"重新演奏"出来。

№ 22 deep Auditory & Acoustic

Robust Speech Recognition via Large-Scale Weak Supervision

进阶 42min · 14561字

Whisper 用互联网上 68 万小时的弱标注(音频 + 自动/人工字幕)数据,喂进标准 Encoder-Decoder Transformer,训出一个多语种多任务语音模型。不微调直接用(zero-shot),在 12 个分布外数据集上平均 WER 比 Wav2Vec 2.0

№ 23 deep Auditory & Acoustic

SeamlessM4T

硬核 14min · 4730字

一个模型搞定近 100 种语言的"听懂、翻译、说出来",把以前需要三四个 App 接力才能完成的跨语言沟通,塞进一张端到端的网络里。 它一口气会做五件事,名字像缩写,其实只是"输入 → 输出"的简写: ASR(语音识别):语音 → 同语言文字 S2TT(语音转文本翻译):语音 →

№ 24 deep Auditory & Acoustic

Stable Audio

硬核 13min · 4494字

打几个字描述你想要的声音,AI 就能做出几十秒到一两分钟的高音质音乐或音效,长度还能精确到秒。技术上靠"先把音频压进潜空间、再在潜空间跑扩散、还带上时长条件"。

№ 25 deep Auditory & Acoustic

Universal Source Separation with Weakly Labelled Data

硬核 13min · 4511字

给电脑一段嘈杂录音,告诉它"我只要狗叫",它就把狗叫从混音里抠出来。一个模型覆盖 527 类日常声音,而且训练只用了"贴了标签但没拆开"的脏数据。

X

Datasets & Benchmarks 数据集与评测基准

16 papers
Datasets & Benchmarks — 数据集与评测基准

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 28 deep Datasets & Benchmarks

robosuite: A Modular Simulation Framework and Benchmark for Robot Learning

入门 33min · 11601字

robosuite 是机器人 AI 的"标准考场"——基于 MuJoCo 物理引擎,把机器人仿真的每个部件(机器人本体、夹爪、控制器、任务、物体、传感器)拆成可拼接的"乐高积木",配套 9 个标准操作任务和 SAC 基线,让全球研究者在同一张考卷、同一把尺子下公平比较算法好坏。

№ 30 deep Datasets & Benchmarks

CALVIN

进阶 24min · 8488字

要让机器人听懂人话干活,得有个统一的"考卷"来比较不同方法的好坏。CALVIN 就是这样一份考卷(基准 benchmark):它在仿真里搭了 4 个桌面环境,让一个机器人根据自然语言指令连续完成一长串任务(比如"打开抽屉→拿起蓝色积木→把积木推进抽屉→打开滑门")。它提供约 24

№ 31 deep Datasets & Benchmarks

LIBERO

进阶 15min · 5101字

*LIBERO 用 Robosuite 程序化生成 130 个语言条件桌面任务,拆成 Spatial / Object / Goal / 100 四套卷,每任务 50 条专家遥操作示范;系统评测 终身学习(LLDM) 中 陈述性 vs 程序性知识 迁移,并意外发现:顺序微调(Se

№ 32 deep Datasets & Benchmarks

RH20T

进阶 14min · 4810字

一个在真实世界采集的超大机器人操作数据集:11 万多条接触丰富(要用力、要手感)的操作序列,覆盖约 150 种技能、多种机器人、多种视角,每条都同时录了画面、力觉、声音、动作四种信息,还配了对应的人类示范视频和语言描述——目标是让机器人不只会推捡,而是学会切、插、倒、折这种需要视

№ 33 deep Datasets & Benchmarks

What Matters in Learning from Offline Human Demonstrations for Robot Manipulation

进阶 15min · 5115字

这篇论文不发明新算法,而是把"机器人看录像学操作"这件事里的每个变量——算法、数据质量、看什么、要不要记忆——挨个换一遍,然后老实告诉你:哪些真有用,哪些是白忙。它顺手还开源了一整套仿真环境、数据集和代码,成了后来所有操作模仿学习论文的"默认评测台"。

№ 34 deep Datasets & Benchmarks

DROID

进阶 14min · 5064字

*13 家机构、18 台同款 Franka 在 564 个真实场景(厨房/办公室/宿舍等)遥操作采集 7.6 万段示范;用 Diffusion Policy 50/50 共训 后,新任务成功率比「只训本域数据」和「混 Open X-Embodiment」分别平均 高约 22%(i

№ 35 deep Datasets & Benchmarks

Open X-Embodiment

进阶 15min · 5176字

*21 家机构把 60 个子数据集、22 种机器人形态统一成 RLDS 标准格式,凑出 100 万+ 真机轨迹;再用 RT-1-X / RT-2-X 混训证明:多机器人数据一起学,比每家只学自己的数据更好——小数据域平均成功率 高约 50%,大数据域 涌现技能 成功率 约 3 倍

№ 36 deep Datasets & Benchmarks

RoboCasa

进阶 12min · 4285字

一个专门模拟"日常家务"(尤其是厨房)的大规模仿真平台:它用生成式 AI 工具造出 120 个厨房场景和 2500 多个 3D 物体,用大语言模型帮忙设计各种任务,支持移动机械臂和人形机器人,还配了超过 10 万条演示轨迹——目标是给"通用家务机器人"提供一个又大、又多样、又逼真

№ 106 deep Datasets & Benchmarks

BridgeData V2

进阶 24min · 8439字

BridgeData V2 是伯克利等校做的一份大规模真机操作数据集:用一台约 4000 美元、谁都买得到的 WidowX 机械臂,在 24 个环境里采了 60096 条轨迹、13 种技能。它专门设计成"多方法通用 + 跨环境跨机构泛化"——同一份数据能喂给 6 种主流学习算法(

№ 157 deep Datasets & Benchmarks

LeRobot: An Open-Source Library for End-to-End Robot Learning

进阶 14min · 5065字

LeRobot 不是某一个“机器人大脑”,而是一整套把机器人学习串起来的开源流水线:左边接真实机器人和遥操作,中间把数据存成统一格式,右边训练、评估、部署 ACT / Diffusion / SmolVLA / π0 等策略。它解决的核心问题不是“提出一个新模型”,而是“让普通研

№ 161 deep Datasets & Benchmarks

AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents

进阶 11min · 3985字

AutoRT 不是一个单独的机器人策略,而是一套用 VLM/LLM 编排真实机器人采集数据的系统。VLM 描述场景,LLM 生成任务并做安全/可行性过滤,机器人再通过脚本策略、已有策略或遥操作执行。论文报告 AutoRT 在 4 栋楼、7 个月、20+ 台机器人上收集了 77k

№ 164 deep Datasets & Benchmarks

RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI

进阶 15min · 5205字

RealMirror 不是又一个单独模型,而是一套面向人形机器人和灵巧操作的开源平台:从数据采集、模型训练、推理评测到高保真仿真和 zero-shot Sim2Real,都想放进一条可复现流水线。 如果只记一个直觉:它不是在问机器人能不能完成某个固定任务,而是在问能不能把看见、听

XI

Simulation & Sim2Real 仿真与真实迁移

13 papers
Simulation & Sim2Real — 仿真与真实迁移

按演进顺序:祖师爷 → 现代经典 → 前沿延伸

№ 98 deep Simulation & Sim2Real

Habitat: A Platform for Embodied AI Research

入门 33min · 11711字

给家用机器人造一个跑得飞快的"VR 房子",让它在里面绕路撞墙练几千万步,再上岗去你家。

№ 99 deep Simulation & Sim2Real

Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning

进阶 38min · 13406字

一句话:把"算物理"和"训神经网络"塞进同一张显卡,机器人学走路从"几千台 CPU 跑一晚"压成"一张卡跑几分钟"。 类比:以前训机器人像切菜、炒菜、装盘分三个房间,端来端去比真做菜还累;Isaac Gym 把厨房合并,菜不动、工具换着上。 效果对照:OpenAI 训魔方机械手用

№ 101 deep Simulation & Sim2Real

Habitat 2.0

进阶 15min · 5202字

上一代 Habitat 只能在虚拟房子里走路看;2.0 让小机器人能真的开冰箱、把杯子从厨房拿到客厅做家务。

№ 102 deep Simulation & Sim2Real

ManiSkill

进阶 14min · 4978字

ManiSkill 是教机器人开抽屉、开柜门、推椅子、搬水桶这类"带关节的家具操作"的统一标准考场——它的核心考点是:机器人练完几十上百个不同形状的柜子之后,能不能上手一个从没见过的新柜子。

№ 103 deep Simulation & Sim2Real

ProcTHOR

进阶 13min · 4435字

用一套程序自动"造房子":想要多少个不重样的、可交互的、带家具的虚拟房子都能生成。用它造出的 1 万个房子预训练一个简单的神经网络机器人,只靠 RGB 摄像头、不建地图、不用人给任务监督,就在 6 个具身 AI 基准(导航、重排、机械臂操作)上刷到当时最强,甚至不微调直接零样本也

№ 108 deep Simulation & Sim2Real

DexMV

硬核 25min · 8839字

DexMV 搭了一套"人手视频 → 机器人示范"的转换流水线:用普通 RGB-D 相机录人手做家务(倒水、放东西、搬运),估计出 3D 手和物体姿态,再通过一套"动作重定向 + 动作反推"的方法,把人手轨迹翻译成 30 自由度机械手能执行的示范,最后用模仿学习训策略。结果:在纯强

№ 37 deep Simulation & Sim2Real

SimplerEnv

硬核 12min · 4096字

*SIMPLER(SimplerEnv 套件)在 SAPIEN 里重建 Google Robot / WidowX BridgeV2 真机评测场景,用 SysID 控物理 + Visual Matching 绿幕贴图 缩小 real-to-sim 鸿沟;对 6 个开源 VLA c

№ 105 deep Simulation & Sim2Real

BEHAVIOR-1K

硬核 23min · 8190字

BEHAVIOR-1K 是斯坦福搭的"机器人家务驾校":先问了 1461 个真人"你最想让机器人帮你干啥",从答案里挑出 1000 道最实用的家务题(洗地、擦浴缸、做饭……),配上 50 个场景、9000 多件带"使用说明"的物品,跑在一个能模拟流体、软体、温度的新仿真器 Omn

№ 106 deep Simulation & Sim2Real

Habitat 3.0

进阶 15min · 5236字

在虚拟的家里加一个会走会动的"假人",让机器人练习扫地搬东西时,得学会一边干活一边躲人、配合人。

№ 107 deep Simulation & Sim2Real

Isaac Lab

进阶 15min · 5155字

机器人在电脑里"练功"的虚拟训练场。以前练得飞快但看不清画面,画面漂亮又练得慢;Isaac Lab 把这两件事捏到了一起。

№ 108 deep Simulation & Sim2Real

MuJoCo Playground

进阶 13min · 4482字

一个完全开源、"pip install playground" 一句就能装的机器人学习框架:它把物理仿真、批量渲染、训练环境打包在一起,全部跑在 GPU 上,让研究者在单块显卡上几分钟训出策略,并且能零样本(zero-shot)迁移到真实机器人——不管是四足狗、人形、灵巧手还是机

№ 186 deep Simulation & Sim2Real

3D Generation for Embodied AI and Robotic Simulation: A Survey

硬核 12min · 4319字

这篇 survey 讨论 3D generation 如何服务 embodied AI and robotic simulation。它不是普通“3D 生成技术综述”,而是从机器人需要什么出发,把 3D generation 分成三个角色:Data Generator、Simul