前沿 · Frontier
2024-2025 还在火热推进的方向。架构试错、规模扩展、模态融合都还没有定论。这一档变化最快——今天的 SOTA 半年后就可能被新方法替代。
I VLM Foundation 8 篇
-
2024
What matters when building vision-language models?
做"看图说话大模型"时,大家凭感觉选零件(用哪个语言模型、图和文怎么拼、图切多少块),却很少做对照实验。这篇论文把每个选择单独拎出来做受控实验,整理成一份"避坑清单",再照着清单训了一个 8B 的模型 Idefics2 当样板——它在同尺寸里最强,有些指标甚至追平大它 4 倍的模
-
2024
Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
InternVL 2.5 把"模型规模、训练数据、推理时算力"三根轴一起往上推,让完全开源、免费可下载的"看图模型"第一次在大学综合考试 MMMU 上突破 70 分(70.1),追平甚至叫板 GPT-4o、Claude-3.5-Sonnet 这些顶级闭源模型——而且把怎么做到的每
-
2024
The Llama 3 Herd of Models
Meta 把训练 Llama 3 大模型的全套"菜谱"公开了——用了什么料、多少张卡、跑多久、考多少分,从后厨到摆盘一条龙。
-
2024
LLaVA-NeXT-Interleave
教 AI 像刷图文并茂的小红书:图和字按顺序穿着读,多图、视频、3D 都用这一招,不用各训一个模型。
-
2024
LLaVA-OneVision: Easy Visual Task Transfer
一套配方教会一个模型同时看懂单张图、几张图和视频,开源圈第一次在视频上明显接近顶级闭源模型。
-
2024
Long-CLIP: Unlocking the Long-Text Capability of CLIP
给一个只能读 77 字短纸条、而且实际上超过 20 个字就看糊的 CLIP,做两个精准的小手术,让它能读 248 字的长描述,同时又没忘掉原来认识的那些短词——而且换上去就能用,不用改下游任何代码。
-
2024
Pixtral 12B
Mistral 开源的一个 120 亿参数的多模态大模型:它用一个从零训练的新视觉编码器,能按图片原始分辨率和长宽比直接读图(你想用多少 token 描述一张图都行),在 12.8 万 token 的超长上下文里塞进任意多张图;它在多模态测评上超过同级甚至更大的开源模型,同时文字
-
2024
A call for embodied AI
这篇论文提出一个很直接的立场:如果 AI 想走向真正的 general intelligence,不能只靠静态文本数据和离线训练,而要进入 Embodied AI,也就是让智能体拥有感知、行动、记忆和学习能力,在环境中持续互动并从反馈中成长。 作者不是否定 LLM,而是说 LLM
II High-Level Planning 3 篇
-
2024
SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
SafeEmbodAI 关注的是一个很现实的问题:如果移动机器人把摄像头、LiDAR、用户语言指令都交给 LLM 推理,攻击者就可能用 prompt injection 或恶意命令让机器人绕路、撞障碍、忽略安全传感器,甚至进入危险区域。论文提出 SafeEmbodAI,一个把 s
-
2025
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
LoHoVLA 处理长程具身任务:机器人不只要做一个动作,而要把“把所有积木按规则摆好”拆成一串子任务,并在每一步执行低层动作。它用 PaliGemma 这类 VLM 同时生成 sub-task 文本和 action token,再用分层闭环控制决定什么时候只重试动作、什么时候重
-
2026
What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?
这篇论文问了一个很关键的问题:具身 AI 的安全问题,到底是 LLM 漏洞、传统 cyber-physical system(CPS)漏洞,还是一种新的系统级失效?作者的答案是:三者都有,但最危险的部分往往来自 perception、reasoning 和 action 被组合到
III End-to-End VLA 38 篇
-
2024
3D-VLA
现在主流的 VLA(视觉-语言-动作模型,如 RT-2、OpenVLA)都是"看 2D 照片 → 直接出动作",缺了三维空间感,也不会"想象未来"。3D-VLA 做了两件事:(1) 把眼睛从 2D 图像换成 3D 点云;(2) 在动手之前,先用扩散模型"脑补"出任务完成后的画面(
-
2024
GR-2: Generative Video-Language-Action Model
让机器人先刷大量网络视频攒常识,再练动手;它干活时脑子里会先"预演"下一秒的画面,再从这个预演里读出动作。
-
2024
RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
清华团队给双臂机器人造的"大脑":用扩散模型(diffusion)当动作生成器、Diffusion Transformer(DiT)当骨架,把参数推到 12 亿(1.2B)——目前最大的扩散式机器人操作基础模型。它先在 46 个多机器人数据集(约 100 万条轨迹)上预训练,再在
-
2024
RoboMamba
机器人的"大脑"原来是用 Transformer 搭的,反应慢、显存吃紧。RoboMamba 把大脑主干换成 Mamba(一种"流水线式"的新架构),让机器人既能听懂指令、看懂画面,又能快速吐出手臂动作,而且推理开销大幅下降。
-
2024
TinyVLA
把会听话的机器人大脑瘦身到约 1.4B,动作生成换成"先乱后凿"的扩散头,不靠云端也能在边缘设备上实时干活。
-
2024
TraceVLA: Visual Trace Prompting
机器人的手刚走过哪里?TraceVLA 把这条路径直接画在它看到的照片上,让它"看见自己的足迹",再决定下一步往哪动。做法极简:在 OpenVLA 上用自采的 15 万条轨迹做视觉轨迹提示(visual trace prompting)微调,不加新模块、不加历史文本。结果在 Si
-
2024
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
CogACT 认为,把大视觉语言模型直接改成“吐动作 token”的 OpenVLA 式做法还不够会动。它把 VLA 拆成两层:VLM 负责看图、读指令、理解任务,专门的 diffusion transformer action module 负责生成连续动作序列。结果是在模拟和
-
2025
DexVLA
现在的 VLA 模型(如 OpenVLA、π0)都在拼命把"视觉语言模型(VLM)"那部分做大,却忽略了真正产生动作的"动作专家"太小、动作表示是瓶颈。DexVLA 反其道而行——把扩散动作专家放大到 10 亿参数、做成多头结构支持跨机体,再配一套"具身课程学习"三阶段训练,还让
-
2025
OpenHelix
指令:"把红色瓶子递过来" + 当前画面
-
2025
OpenVLA-OFT
原版机器人大模型 OpenVLA 输出动作时像"一个字一个字念口令"——慢、抖、长任务掉链子。OpenVLA-OFT 把微调这件事拆成三个可以各自打开的开关——并行解码(一口气说完)、动作分块(一段段说)、连续动作表征(说准确的小数),再配一个极简的 L1 回归目标,把 LIBE
-
2025
SpatialVLA
教机器人两件事:用普通摄像头也能看出远近(Ego-3D 位置编码);把常用动作存成"肌肉记忆"、不常用的粗着存(自适应动作网格)。两招合起来,让 VLA 跨机器人、跨任务迁移更稳。
-
2025
Universal Actions for Enhanced Embodied Foundation Models
机器人数据最大的问题不是没有数据,而是每台机器人说的“动作语言”不同:有的输出末端位置,有的输出关节角,有的输出速度,有的还是双臂。Universal Actions 提出 UniAct,让模型先学一套跨机器人共享的“通用动作空间”,再用每台机器人的 decoder 把通用动作翻
-
2025
EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
EO-1 认为,机器人不能只在最后一步输出动作;真实交互里,人会边看、边想、边说出中间判断、边行动。它提出 EO-Robotics:3B 的 EO-1 模型、EO-Data1.5M 数据集和 EO-Bench 评测,把 image、text、video、action 交错成同一条
-
2025
LLaDA-VLA: Vision Language Diffusion Action Models
LLaDA-VLA 的核心问题是:既然扩散语言模型可以通过反复 mask-denoise 生成文本,那能不能也让它从全是 mask 的动作序列一步步还原出机器人动作?论文答案是可以,但要给动作 token 单独设计分类目标和分层解码。 如果只记一个直觉:它不是在问机器人能不能完成
-
2025
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
Discrete Diffusion VLA 把动作生成放回一个统一 transformer 里:视觉、语言和动作都在同一骨干中融合,动作不是 autoregressive 左到右吐 token,而是通过离散扩散从全 mask 的 action chunk 逐步还原。 如果只记一
-
2025
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
Vlaser 关注一个很容易被忽略的问题:VLM 会推理,不等于 VLA 会控制;如果上游具身推理数据和下游动作策略训练之间没有桥,模型可能会在问答 benchmark 上变强,却不一定让机器人做得更好。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人
-
2025
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
X-VLA 解决的是跨机器人预训练的稳定性问题:同一批数据里机器人、相机、动作空间、遥操作风格都不同,直接混训容易崩;它用每个数据源一组 learnable soft prompts,让主干学 embodiment-agnostic 能力。 如果只记一个直觉:第 2 批都在回答同
-
2025
Embodiment Transfer Learning for Vision-Language-Action Models
ET-VLA 讨论的是一个很实际的问题:OpenVLA 这类自回归 VLA 在单机械臂上表现不错,但一到双臂/多机器人协作,就容易生成错误数量的动作 token、分不清哪个机器人该做哪一步。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人、单一任务、单
-
2025
HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
HiMoE-VLA 的核心判断是:机器人数据的异构性不是一种东西,而是好几种东西叠在一起;动作空间差异、身体差异、相机差异和控制频率差异,应该由不同层级的专家模块分别处理。 如果只记一个直觉:第 2 批都在回答同一个大问题:VLA 怎么从单一机器人、单一任务、单一动作空间,走向跨
-
2025
MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
MoS-VLA 把策略看成一组 learned basis functions 的线性组合。新环境来了,不用梯度微调,只要一条专家轨迹,就能求出组合系数,生成适配该环境的新 policy。 如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人需要低
-
2025
Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
DuoCore-FS 面向全身机器人控制:慢系统用 3B VLM 做语义推理,快系统以 25–30Hz 生成连续全身动作,两者通过 bridge buffer 异步连接,不再让快控制等待慢推理。 如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人
-
2025
A Survey on Efficient Vision-Language-Action Models
这篇综述整理 efficient VLA 的研究地图:VLA 要落地到机器人,不能只追求更大模型和更高 benchmark 分数,还要处理实时控制、算力成本和数据采集成本。论文把现有工作归纳为三个核心支柱:Efficient Model Design、Efficient Trai
-
2025
Survey of Vision-Language-Action Models for Embodied Manipulation
这篇综述系统整理面向具身操作的 VLA 模型。它从具身智能系统视角出发,把 VLA 发展历程分成 3 个阶段,并从 5 个关键维度分析当前研究:VLA model structures、training datasets、pre-training methods、post-tra
-
2025
Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
这篇系统综述讨论 foundation models 如何用于 mobile service robots。它把移动服务机器人面临的核心挑战归纳为四类:把自然语言指令翻译成可执行动作、多模态感知、不确定性估计、板载计算约束。论文再分析 LLM、VLM、MLLM 和 VLA 如何分
-
2025
Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
这篇综述提出 Embodied AGI 的五级路线图 L1-L5,并用四个能力维度评估当前差距:omnimodal capabilities、humanoid cognitive abilities、real-time responsiveness、generalization。
-
2025
RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
RoboNeuron 提出一个 embodied AI 中间层,用来连接 agent tool calling 生态和 ROS2 机器人中间件。它把 ROS message schema 自动派生成 agent 可调用的 MCP tools,让 LLM agent 可以通过统一工
-
2025
Embodied Navigation Foundation Model
Embodied Navigation Foundation Model 提出 NavFoM,一个跨任务、跨本体的导航基础模型。论文报告模型训练在八百万导航样本上,覆盖 quadrupeds、drones、wheeled robots、vehicles,并跨 vision-and
-
2025
MiMo-Embodied: X-Embodied Foundation Model Technical Report
MiMo-Embodied 是小米团队发布的 X-Embodied foundation model technical report。它尝试把 autonomous driving 和 embodied AI 放进同一个 vision-language model 里训练,让模
-
2025
LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
LACY 的核心问题是:现在很多机器人策略只学习 language-to-action,也就是“听一句话,做一个动作”。论文认为这太单向了。一个真正稳的机器人不只要会执行语言,还应该能反过来解释动作、判断语言和动作是否语义一致。LACY 因此把三件事放进同一个 vision-la
-
2025
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
villa-X 的问题是:VLA 模型很想从海量视频中学习动作,但视频通常没有机器人 action labels。人类视频、互联网视频和不同机器人 embodiment 的视频里都有“发生了什么变化”,却没有统一的 7D 末端执行器动作。villa-X 提出 Vision-Lan
-
2026
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
Qwen-VLA 想证明一件事:操作、导航、人类第一视角轨迹和视觉语言理解,不一定要拆成四套系统,可以统一成看图、读指令、理解当前身体,然后预测未来动作或轨迹的同一个 VLA 问题。 如果只记一个直觉:它不是在问机器人能不能完成某个固定任务,而是在问能不能把看见、听懂、知道自己是
-
2026
Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
Green-VLA 的核心不是单纯扩大模型,而是把 VLA 从网页视觉语言基座、机器人预训练、具体身体适配到 RL 对齐,拆成 L0/L1/R0/R1/R2 五个阶段,目标是让同一个策略覆盖单臂、双臂和 Green 人形机器人。 如果只记一个直觉:第 3 批从“模型能不能统一”推
-
2026
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
AC²-VLA 关心 VLA 部署时的延迟瓶颈:每个控制步都跑完整 VLM 太慢,而视觉复杂度不一定等于动作难度,所以它让 action context 来决定缓存复用、token pruning 和 layer skipping。 如果只记一个直觉:第 3 批从“模型能不能统一
-
2026
VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
VLA-Forget 研究一个很现实的问题:VLA 模型学到了不安全、错误或隐私敏感的行为后,能不能只删掉这部分行为,同时保留视觉理解、语言 grounding 和正常动作控制能力。它把 VLA unlearning 拆成三件事:targeted forgetting、perce
-
2026
Membership Inference Attacks on Vision-Language-Action Models
这篇论文研究 VLA 模型的隐私风险:攻击者能不能通过观察模型输出,判断某个 transition 或完整 robot trajectory 是否在训练数据里。论文把 VLA membership inference 分成 sample-level 和 trajectory-le
-
2026
Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
Gaze2Act 想解决一个很日常但很难的机器人交互问题:用户说“把那个杯子递给我”时,房间里可能有很多杯子;用户说“抓住锤子的这里”时,语言很难精确表达“这里”;用户执行到一半又想换目标时,静态指令也跟不上。论文提出把人的 gaze(视线 / 注视点)作为 VLA policy
-
2026
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
InstructVLA 想解决 VLA 的一个核心矛盾:如果只把 VLM fine-tune 成机器人 action generator,模型可能会忘掉原来的视觉语言推理能力;如果保留 VLM 推理,又可能动作控制不够强。论文提出 Vision-Language-Action I
-
2026
A Survey of Language-Conditioned Robot Manipulation
这篇综述系统整理 language-conditioned robot manipulation,也就是机器人如何根据自然语言完成操作任务。它的核心贡献不是提出一个新 policy,而是给领域建立一套分类框架:语言可以作为 state evaluation、policy cond
IV Diffusion Policy 12 篇
-
2024
Affordance-based Robot Manipulation with Flow Matching
教机器人做事时,先让它看懂"物体能怎么用",再用一种"画直线"式的方法直接生成动作——比扩散模型更快、训练更简单。
-
2024
π₀: A Vision-Language-Action Flow Model for General Robot Control
Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 种机器人、68 任务、1 万+ 小时数据
-
2024
DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
DISCO 提出一个 zero-shot、open-vocabulary 的 language-guided manipulation 框架。它不直接把语言塞进 diffusion policy,而是先用现成 VLM(论文里举 ChatGPT4 / ChatGPT4o)把自然语言
-
2025
DiT-Policy
扩散策略强在"多模态",Transformer 强在"可扩展",但把两者硬凑到一起训练极不稳定(原版 Diffusion Policy 的 Transformer 实现几乎训不动)。这篇论文找到了正确配方——用 adaLN-Zero 注意力块 + ResNet 图像分词器,让扩散
-
2025
Diffusion Policy Policy Optimization (DPPO)
先跟着老师傅模仿,再自己上手练。DPPO 把"自己练"那一步拆成很多个小动作,让一套很常规的强化学习算法(PPO)也能稳稳地调教"扩散策略"这种脑子里要打好几遍草稿才动手的机器人。
-
2025
FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
让机器人不再"在脑子里画 100 张草稿才动手",而是看一眼立体世界就一步给出动作——又快又稳,真机能跑得动。
-
2025
FAST: Efficient Action Tokenization for VLA
给机器人的连续动作找一种更聪明的"切词方式":不再逐个维度、逐个时刻粗暴分格,而是先把一段动作用"频率变换 + 压缩"编成紧凑的 token。这一改,让自回归式的视觉-语言-动作模型(VLA)第一次能学会那些高频、灵巧的操作技能;配上 π0,训练速度比扩散式 VLA 快最多 5
-
2025
pi_0.5: VLA with Open-World Generalization
Physical Intelligence 的 π0.5:在前作 π0 的"VLM 大脑 + flow matching 动作专家"基础上,靠异构联训(co-training)——约 400 小时移动机器人数据(100 个真实家庭)+ 大量其他机器人数据 + 网页图文/VQA +
-
2025
Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
Time-Unified Diffusion Policy with Action Discrimination 提出 TUDP,用于更高效、更准确地生成机器人动作。它的出发点是:普通 diffusion policy 要经过很多 denoising iterations,且不同
-
2025
Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
Discrete Policy 处理的是多任务机器人操作里的“动作空间纠缠”问题。一个任务可能有多种成功轨迹,多个任务混在一起训练时,动作分布会变得更复杂、更像几团缠在一起的线。直接用 Behavior Cloning 或 Diffusion Policy 从 observati
-
2026
Learning Diffusion Policy from Primitive Skills for Robot Manipulation
Learning Diffusion Policy from Primitive Skills for Robot Manipulation 提出 Skill-conditioned Diffusion Policy,简称 SDP。它认为很多 diffusion policy 直
-
2026
Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
Trace-Focused Diffusion Policy 提出 TF-DP,用于解决 long-horizon robotic manipulation 中的 multi-modal action ambiguity,论文简称 MA2。问题是:长程任务里,视觉上很像的观察会在
V Imitation Learning 8 篇
-
2024
ALOHA 2
人(操作员) 机器(工作端)
-
2024
HumanPlus
给一台成人尺寸的人形机器人搭一整套"从人身上学"的流水线:先用一个普通摄像头把人的全身动作实时抄到机器人身上(叫"影子模仿 / shadowing",人怎么动它怎么动),用这种方式一个人就能遥控它采数据;再拿采到的数据训一个策略,让机器人看着自己头上的摄像头自主复现技能——只用不
-
2024
Mobile ALOHA
给原来只能趴在桌上干活的双臂机器人焊一辆能跑的小车,让一个人同时"手控双臂 + 腰推底盘"把整套家务动作录下来;再用一个很朴素的招数——把新录的"移动家务"数据和以前攒的一大堆"桌面双臂"数据混在一起训——就能让机器人只看 50 次示范,学会炒虾、擦红酒渍、进电梯这种"边走边用两
-
2024
Universal Manipulation Interface
做一个和机器人末端一模一样的手持夹爪 + GoPro(约 371 美元),人去厨房、咖啡馆随便示范;视频经视觉-惯性 SLAM 还原 6D 轨迹,再训 Diffusion Policy——机器人不在场也能采数据,洗碗、抛球、叠毛衣、摆咖啡杯都能零样本泛化到新环境,分布外测试综合成
-
2024
Behavior Generation with Latent Actions (VQ-BeT)
机器人本来要画一条平滑曲线动作,VQ-BeT 让它改成"先从菜单里选一个动作词、再小修一点"——就像挑表情包再加文字,比硬画曲线更不容易出怪招,还比扩散策略快得多。
-
2024
DexCap
DexCap 是斯坦福做的一套便携动捕系统:一件背心 + 手套 + 几个小相机,人穿上它在任何地方(厨房、客厅)徒手干活,就能实时(60Hz)录下"手腕 6 自由度位姿 + 手指动作 + 3D 环境点云"。配套算法 DexIL 把这些人手数据翻译成机器人动作、用点云扩散策略学习,
-
2025
Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
让人形机器人用"自己眼睛"的视角看世界(而不是死记房间地图),换间屋子也照样干活,不用重学。
-
2025
SmolVLA
Hugging Face 推出的小型机器人模型:把"看到 + 听到 + 动手"塞进一张游戏显卡就能训的小脑袋,还全部用社区公开数据训练——让没有数据中心的人也能在家玩具身 AI。
VI World Model & Video Policy 9 篇
-
2023
GAIA-1
GAIA-1 是个会做梦的开车模拟器:给它一段街景视频的开头,加一句"我现在打方向盘",它能接着画出后面几秒街上看到的画面。
-
2023
Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
这篇综述问的是:foundation model 到底怎样帮助机器人走向 general-purpose robots?它把问题拆成两类路线:一类是把已有视觉/语言 foundation model 插进机器人系统,比如用 VLM 做开放词表感知、用 LLM 做任务规划;另一类是
-
2024
Genie: Generative Interactive Environments
Genie 从海量无标注游戏录屏里,自己"猜"出每两帧之间按了什么键,再用这个猜出来的虚拟按键续画下一帧——把死视频变成单张图片就能开玩的互动世界。
-
2024
UniSim
看过海量视频后,你给它一个动作(说一句话 / 推一下机械臂 / 挪一下镜头),它就生成"接下来世界长什么样"的视频——像一台会脑补现实的"游戏机",还能拿它当机器人的训练场。
-
2024
The Essential Role of Causality in Foundation World Models for Embodied AI
这篇论文的核心问题是:具身智能要在真实世界里行动,单靠“看过很多图像和文字”的 foundation model 不够,因为机器人真正需要的是知道“我做这个动作后,世界会怎样变化”。作者提出 Foundation Veridical World Model(FVWM,基础可信世界
-
2025
Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
把一个会"脑补下一秒视频"的大模型,再练一遍,就能让它指挥机械臂做家务——不改模型结构、不加新零件,只是把机器人动作、未来画面和评分全伪装成视频帧塞进去,让模型按原来处理视频的方式一起学会三件事。
-
2025
Cosmos World Foundation Model
Cosmos 是英伟达做的一个"世界基础模型(World Foundation Model, WFM)平台":核心是一个会"看过去的视频 + 一个动作/指令 → 生成未来会发生什么视频"的大模型。它像给机器人和自动驾驶造了一个"数字世界的沙盘",让物理 AI 能先在里面安全预演,
-
2025
1X World Model Challenge
给机器人两个不同难度的"脑补未来"考题:一个是直接画出未来的像素画面(采样赛道),一个是预测未来的压缩编码(压缩赛道)。冠军队一个用现成视频大模型 Wan-2.2 微调、一个从零训小 Transformer,双双夺冠——还比亚军快一个数量级。
-
2025
Navigation World Models
训练一个"导航世界模型"(NWM):给它当前看到的画面和一串打算走的动作,它就能像放电影一样预测出"这样走下去画面会变成什么样"。有了这个"脑内模拟器",智能体可以先在脑子里把好几条路线各走一遍、看哪条能到目的地,再挑最好的去执行——甚至在从没去过的环境里,只凭一张照片就想象出一
VII Multimodal Ecology 7 篇
-
2024
MLA: Multisensory Language-Action Model
让机器人不只用眼睛看,还会用"手感"和"空间感",并且大脑自己直接听三种感官(不请翻译),训练时还要脑补未来的画面、形状和触感——推理时省掉脑补这步,相当于白嫖了一波理解力,最终在接触密集操作任务上大幅超越前辈。
-
2024
Sparsh: Self-supervised Touch Representations
以前每个触觉任务都得从零标注、从零训练。Sparsh 先让模型在 46 万张以上无标签触觉图上自学一遍"触觉词汇",之后做任何具体触觉任务只要少量例子就能追平甚至超过专门训练的模型——平均超出 95.1%。
-
2024
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
AlanaVLM 是一个面向 egocentric video understanding 的 multimodal embodied AI foundation model。它关注第一视角视频,也就是从人或机器人“自己眼睛”看到的画面,而不是第三人称摄像机拍到的场景。论文提出
-
2025
VLAS: VLA Model With Speech Instructions
把一个会"看图说话"的 AI(LLaVA)改造成会"听声音 + 认嗓音 + 动手"的机器人模型:用 Whisper 编码器当耳朵、用"声纹查档案"(Voice RAG)解决"我的杯子是哪只"这种个性化问题,最终在定制化任务上比纯文字 VLA 高出 4 倍(86.5% vs 19.
-
2025
Tactile Beyond Pixels (Sparsh-X)
让机器人的手指不止"看"接触画面,还能听响声、感力度、察打滑——四路信号一起自监督学习,摸东西才像人。学出来的是一个通用"手感"编码器,下游任务贴一顶小帽子就能用。
-
2025
Tactile-VLA
给已经会看、会听、会动的机器人补上"手感"这一课:不仅让它摸得到接触的力,还让它听懂"轻轻插"和"用力插"的区别——而且这份"手感常识"很大一部分是从大模型脑子里唤醒出来的,不是从零训出来的。
-
2025
TLA: Tactile-Language-Action
让机器人像你闭眼摸钥匙那样——靠"一段持续变化的触感"加上一句话指令,自己决定下一步该怎么用手。关键是把触觉当成带时间的模态,而不是一张压力快照。
VIII RF Perception & Mapping 5 篇
-
2023
mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
不直接问"东西在哪儿",而是先猜"它的皮朝哪边翘"——用便宜的毫米波雷达就能隔着纸箱重建出里面物体的精确 3D 形状,F-Score 达到 96%,把旧方法的 78% 远远甩在身后。
-
2024
Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
想实时知道一个人全身姿态(比如健身教练看你深蹲标不标准),传统办法要么靠摄像头(怕黑、有隐私、会被遮挡),要么靠昂贵的动捕棚。Argus 换个思路:在耳机/VR 头显左右两侧各磁吸一个指甲盖大小、7.5 克、0.35 瓦的毫米波雷达,从"第一视角(戴在头上往下看身体)"双视角感知
-
2024
Diffusion Model is a Good Pose Estimator from 3D RF-Vision
毫米波雷达拍出的人像像隔了层毛玻璃、还在闪。mmDiff 让 AI 从一团噪点出发、以雷达信号为参照,一步步"擦"出稳定又符合人体常识的 3D 骨架,比"一口气猜"准得多、稳得多。CVPR 2024 收录,是第一个用扩散模型做毫米波雷达人体姿态估计的工作。
-
2024
Enabling Visual Recognition at Radio Frequency (PanoRadar)
*PanoRadar 把 TI AWR1843 单芯片 mmWave 雷达装到 8 cm 半径、2 Hz 转台上,合成 8×1200 圆柱虚拟阵列;再用 RF 自运动估计 + 2D CNN 提仰角分辨率,从纯射频信号生成 360° range image,在 12 栋建筑 lea
-
2025
Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
毫米波信号能穿过纸箱、布帘,Wave-Former 把弹回来的模糊回声拼成藏在背后的杯子、瓶子的完整 3D 形状——用"物理先验清洗信号 + Transformer 补全形状"这套混合架构。
IX Auditory & Acoustic 4 篇
-
2023
SeamlessM4T
一个模型搞定近 100 种语言的"听懂、翻译、说出来",把以前需要三四个 App 接力才能完成的跨语言沟通,塞进一张端到端的网络里。 它一口气会做五件事,名字像缩写,其实只是"输入 → 输出"的简写: ASR(语音识别):语音 → 同语言文字 S2TT(语音转文本翻译):语音 →
-
2024
Proactive Hearing Assistants that Isolate Egocentric Conversations
戴上这副耳机,它自动听出"现在你在跟谁聊天",把同伴的声音放大、把陌生人和噪音压下去——你一个按钮都不用按,甚至不用提前录入任何人的声音。它靠的不是"认声音",而是"认对话节奏"。
-
2024
Stable Audio
打几个字描述你想要的声音,AI 就能做出几十秒到一两分钟的高音质音乐或音效,长度还能精确到秒。技术上靠"先把音频压进潜空间、再在潜空间跑扩散、还带上时长条件"。
-
2024
Universal Source Separation with Weakly Labelled Data
给电脑一段嘈杂录音,告诉它"我只要狗叫",它就把狗叫从混音里抠出来。一个模型覆盖 527 类日常声音,而且训练只用了"贴了标签但没拆开"的脏数据。
X Datasets & Benchmarks 9 篇
-
2023
Open X-Embodiment
*21 家机构把 60 个子数据集、22 种机器人形态统一成 RLDS 标准格式,凑出 100 万+ 真机轨迹;再用 RT-1-X / RT-2-X 混训证明:多机器人数据一起学,比每家只学自己的数据更好——小数据域平均成功率 高约 50%,大数据域 涌现技能 成功率 约 3 倍
-
2023
BridgeData V2
BridgeData V2 是伯克利等校做的一份大规模真机操作数据集:用一台约 4000 美元、谁都买得到的 WidowX 机械臂,在 24 个环境里采了 60096 条轨迹、13 种技能。它专门设计成"多方法通用 + 跨环境跨机构泛化"——同一份数据能喂给 6 种主流学习算法(
-
2024
DROID
*13 家机构、18 台同款 Franka 在 564 个真实场景(厨房/办公室/宿舍等)遥操作采集 7.6 万段示范;用 Diffusion Policy 50/50 共训 后,新任务成功率比「只训本域数据」和「混 Open X-Embodiment」分别平均 高约 22%(i
-
2024
RoboCasa
一个专门模拟"日常家务"(尤其是厨房)的大规模仿真平台:它用生成式 AI 工具造出 120 个厨房场景和 2500 多个 3D 物体,用大语言模型帮忙设计各种任务,支持移动机械臂和人形机器人,还配了超过 10 万条演示轨迹——目标是给"通用家务机器人"提供一个又大、又多样、又逼真
-
2024
AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
AutoRT 不是一个单独的机器人策略,而是一套用 VLM/LLM 编排真实机器人采集数据的系统。VLM 描述场景,LLM 生成任务并做安全/可行性过滤,机器人再通过脚本策略、已有策略或遥操作执行。论文报告 AutoRT 在 4 栋楼、7 个月、20+ 台机器人上收集了 77k
-
2025
RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
RealMirror 不是又一个单独模型,而是一套面向人形机器人和灵巧操作的开源平台:从数据采集、模型训练、推理评测到高保真仿真和 zero-shot Sim2Real,都想放进一条可复现流水线。 如果只记一个直觉:它不是在问机器人能不能完成某个固定任务,而是在问能不能把看见、听
-
2025
Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
GEMBench 的出发点很直接:很多 vision-language robotic manipulation benchmark 主要测训练中见过的任务,或者只测轻微扰动,无法真正回答“机器人能不能泛化到新任务”。论文提出 GEMBench,一个基于 RLBench 的仿真
-
2026
LeRobot: An Open-Source Library for End-to-End Robot Learning
LeRobot 不是某一个“机器人大脑”,而是一整套把机器人学习串起来的开源流水线:左边接真实机器人和遥操作,中间把数据存成统一格式,右边训练、评估、部署 ACT / Diffusion / SmolVLA / π0 等策略。它解决的核心问题不是“提出一个新模型”,而是“让普通研
-
2026
Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
Open-H-Embodiment 是一个面向 medical robotics 的大规模开放数据集项目。论文报告它包含 119 个 datasets、780 小时 paired video and kinematic data,来自 50+ institutions,覆盖 20
XI Simulation & Sim2Real 6 篇
-
2024
SimplerEnv
*SIMPLER(SimplerEnv 套件)在 SAPIEN 里重建 Google Robot / WidowX BridgeV2 真机评测场景,用 SysID 控物理 + Visual Matching 绿幕贴图 缩小 real-to-sim 鸿沟;对 6 个开源 VLA c
-
2024
BEHAVIOR-1K
BEHAVIOR-1K 是斯坦福搭的"机器人家务驾校":先问了 1461 个真人"你最想让机器人帮你干啥",从答案里挑出 1000 道最实用的家务题(洗地、擦浴缸、做饭……),配上 50 个场景、9000 多件带"使用说明"的物品,跑在一个能模拟流体、软体、温度的新仿真器 Omn
-
2024
Habitat 3.0
在虚拟的家里加一个会走会动的"假人",让机器人练习扫地搬东西时,得学会一边干活一边躲人、配合人。
-
2025
Isaac Lab
机器人在电脑里"练功"的虚拟训练场。以前练得飞快但看不清画面,画面漂亮又练得慢;Isaac Lab 把这两件事捏到了一起。
-
2025
MuJoCo Playground
一个完全开源、"pip install playground" 一句就能装的机器人学习框架:它把物理仿真、批量渲染、训练环境打包在一起,全部跑在 GPU 上,让研究者在单块显卡上几分钟训出策略,并且能零样本(zero-shot)迁移到真实机器人——不管是四足狗、人形、灵巧手还是机
-
2026
3D Generation for Embodied AI and Robotic Simulation: A Survey
这篇 survey 讨论 3D generation 如何服务 embodied AI and robotic simulation。它不是普通“3D 生成技术综述”,而是从机器人需要什么出发,把 3D generation 分成三个角色:Data Generator、Simul