经典 · Classic
每个领域里被反复引用、几乎成事实标准的工作。它们不必是第一篇,但是绕不开的。读这一档你能拿到该领域的核心认知。
I VLM Foundation 11 篇
-
2022
BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
一句话:让一个模型同时学会看图和写字,再让它帮自己把网上烂配文重写干净,回头再用干净数据训一遍——多个任务全线变强。 三个关键贡献: MED(Multimodal mixture of Encoder-Decoder):一个模型三种身份切换——纯编码器、看图的文本编码器、看图的文
-
2022
FILIP: Fine-grained Interactive Language-Image Pre-Training
CLIP 是"整张图配整句话"看个大概像不像;FILIP 让图里的每一小块(patch)和句子里的每个词各自去对面找最像的伙伴,模型因此学会"狗在左下角、草地在右边"这种细节——而且只改了对比损失,没牺牲 CLIP 那种"能离线预存特征、检索超快"的效率。
-
2023
3DShape2VecSet: 3D Shape Representation for Diffusion Models
把一个 3D 物体(比如一只椅子)压缩成 512 张小卡片,每张卡片只记录"特征"不记录"位置";电脑学会这些卡片的规律之后,就能从一团随机噪声里凭空造出全新的 3D 模型——还能根据文字描述、单张照片、或半个点云来指挥它造什么。
-
2023
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
不动两个大模型——一个负责看图、一个负责说话——只在中间训练一个小"翻译官",就让 AI 学会了看图说话,而且比动辄 800 亿参数的 [Flamingo](flamingo.md) 效果更好、成本低一个数量级。
-
2023
EVA-CLIP: Improved Training Techniques for CLIP at Scale
EVA-CLIP 不改 CLIP 的架构,只换了三个训练技巧——用一个已经"懂图"的视觉模型当起点、换个不闪腰的大 batch 优化器、训练时随机只看半张图——就用远少于对手的数据和算力,训出了更强的看图模型。最大的 EVA-02-CLIP-E/14+(50 亿参数、90 亿样本
-
2023
Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
阿里 2023 年开源的 Qwen-VL:在会中英双语聊天的 Qwen-7B 语言模型上,接一个 ViT-bigG(19 亿参数)视觉编码器 + 一个把图压成 256 个 token 的位置感知适配器,用三阶段训练教它一次学会看图、念中英文招牌(OCR)、用框指出物体(groun
-
2023
Sigmoid Loss for Language Image Pre-Training
教模型"图配文字",CLIP 的做法是让全班一起排名打分(softmax 对比),SigLIP 改成一对一判断"这俩是不是一对"(sigmoid 判断题)。改这一行损失函数,就换来了算得快、省内存、小批量也能学。
-
2024
DeepSeek-VL: Towards Real-World Vision-Language Understanding
DeepSeek 在 2024 年开源的"会看图"模型(1.3B 和 7B 两档),核心不是堆参数,而是给模型配了一双"广角镜头 + 微距镜头"的眼睛(SigLIP + SAM 混合视觉编码器)、能吃 1024×1024 高分辨率,还专门用真实世界的发票、PPT、图表、UI 截图
-
2024
Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
一个相对小的看图模型:你跟它说"描述这张图""圈出所有的猫""图里红车在哪""把这段文字读出来",它都用同一个脑子处理,输出统一的一段文字。靠一个 5.4 亿标注 / 1.26 亿张图的超大数据集 FLD-5B 撑起来,让参数量不大的模型在检测、分割、caption、ground
-
2024
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
让"看图的脑子"也长到 60 亿参数,和"会说话的脑子"一样大,AI 看图说话才不偏科,而且开源就能用。
-
2024
Improved Baselines with Visual Instruction Tuning
给初代 [LLaVA](llava.md) 换了四个零件——更厚的镜片(两层 MLP)、更高的分辨率(336px)、更丰富的教材(665K 混合数据)、更聪明的大脑(Vicuna-1.5)——模型本身一行代码没改,就在 12 个看图答题榜单上拿了开源第一。
II High-Level Planning 5 篇
-
2023
ChatGPT for Robotics
这是微软的一篇"设计原则 + 能力研究"论文:它教你怎么用一套方法(提示工程 + 高层函数库 + 人在环把关),让 ChatGPT 把人的大白话指令翻译成机器人能执行的代码。核心招数是——不让 ChatGPT 直接写底层电机代码,而是给它一套"起好名字的高层函数"(如 detec
-
2023
VoxPoser
VoxPoser 让大模型给机器人画两张 3D 地图:红色地方要去、灰色地方要躲,机器人照着地图规划出动作——全程不训练任何新模型。
-
2024
GenSim
让 ChatGPT 当"出题老师",自动给机器人编一堆练习关卡,连标准答案(专家怎么解)也一起写好。
-
2024
RoboFlamingo
拿一个现成的开源视觉语言大模型(OpenFlamingo,会看图 + 读文字),给它加一个专门负责"看历史、出动作"的小脑袋(policy head),再用机器人的模仿数据轻轻微调一下,就得到一个能听懂语言指令、看着画面去操作的机器人——在 CALVIN 这个语言指令操作基准上大
-
2024
Tree-Planner
让大模型一次写好十份"菜谱",把重复步骤合成一棵树,做事时照树走,错了就换条岔路,全程不用反复打电话问。既省 LLM 调用,又自带纠错。
III End-to-End VLA 5 篇
-
2023
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
把机器人动作翻译成一句话,让会看图聊天的 AI 用写句子的方式开口指挥机器人——它会写字,就能动手。
-
2023
RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
教机器人做新动作,光说话不够、给一张完成图也不够。这篇论文说:在画面上画一条"手该走的路"——机器人立刻照着做。核心贡献是提出 RT-Trajectory,用 2D 轨迹草图(trajectory sketch)作为策略条件(policy conditioning),在同样的训练
-
2024
OpenVLA: An Open-Source Vision-Language-Action Model
把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。
-
2024
3D Diffusion Policy (DP3)
Diffusion Policy 用 2D 图像当"眼睛",需要上百个示范才学得会。DP3 把眼睛换成"稀疏点云 + 一个极简 MLP 编码器"——只用 10 个示范就能搞定大多数任务,72 个仿真任务平均比 Diffusion Policy 相对提升 24.2%,真机 4 个任
-
2024
Octo: An Open-Source Generalist Robot Policy
输入(可插拔的 token)
IV Diffusion Policy 3 篇
-
2024
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
让机器人改看 3D 立体形状(点云)而不是 2D 照片来学动作,10 条示范就够,72 个任务平均比原版强 24.2%,真机成功率从 35% 涨到 85%,安全违规率 0%。
-
2024
Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
机器人选下一步动作本来要慢慢搅 100 下才出一步,这篇教它一下就跳到答案——快约十倍,连笔记本都跑得动。
-
2024
EquiBot: SIM(3)-Equivariant Diffusion Policy
教机器人几次就够了。物体挪个位置、转个方向、换个大小都不用重学——因为"这件事和位置朝向大小无关"这个常识被直接焊进了网络结构里,而不是靠堆数据让它慢慢悟。
V Imitation Learning 5 篇
-
2021
Implicit Behavioral Cloning
别让模型直接报"动作是这个",而是让它给一堆候选动作打分、挑最低分那个——机器人的手就突然变巧了。
-
2022
Behavior Transformers: Cloning k Modes with One Stone
同一件事人类有好几种做法(左绕、右绕都行)。传统 AI 会把这些做法"取平均"成一个四不像。BeT 先用 k-means 把动作分成 k 个"流派",让 Transformer 先选流派、再微调细节——一个模型克隆出人类示范里的所有主流做法。
-
2023
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
用约 2 万美元搭一套"主从臂遥操 + 四摄像头"的双臂系统(ALOHA),让人示范 50 次约 10 分钟,再用 ACT 算法让机器人一次预测未来 100 步动作而不是一步一步猜——开调料杯、插电池这类毫米级精细活,成功率能到 80–96%。
-
2023
AnyTeleop
要教机器人干活,得先有人"手把手"演示——这个"人远程操控机器人"的过程叫遥操作(teleoperation)。过去的视觉遥操作系统都是"一套系统只配一款机器人、一个环境",换机器人就得重做。AnyTeleop 做了一套通用系统:只用普通摄像头,就能操控任意机械臂+任意灵巧手,在
-
2023
RoboCat
DeepMind 造的一个"通用机器人操作大脑":它能同时控制多种不同的机械臂、做多种任务,只要给它一张"目标长啥样"的图片就知道该干什么;遇到新任务或新机器人,用 100–1000 个示范就能快速上手;更关键的是,它能用自己练出的能力去生成新数据,再拿这些数据把自己练得更强,形
VI World Model & Video Policy 5 篇
-
2021
Mastering Atari with Discrete World Models
让 AI 闭眼"做白日梦"练打老游戏,第一次只靠脑子里想象就打到人类水平。具体做法:把脑内模拟器的"快照"从连续数字(高斯)换成离散选项(32 组 x 32 类 categorical),再用一个叫 KL balancing 的二八开技巧来让"猜测"尽量贴近"亲眼看到"的状态,最
-
2022
DayDreamer
让一只四足机器人不靠仿真、不靠遥控示范,直接在真实地面上边走边"在脑子里做梦演练",1 小时从零学会站起来和走路。
-
2023
Transformers are Sample-Efficient World Models
把游戏画面切成一格格"积木",让 AI 像写句子一样接龙下一帧,然后让它在脑子里"自己跟自己玩"练强化学习——只玩两小时就接近人类水平。
-
2023
TWM: Transformer-based World Models
智能体(agent)在脑子里"做梦"练本事。这篇把梦的引擎从 RNN 换成 Transformer,记得更长、做得更准,在样本效率基准 Atari 100k 上有竞争力。
-
2025
Dreamer V3: Mastering Diverse Domains through World Models
DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。
VII Multimodal Ecology 6 篇
-
2022
X-VLM: Multi-Grained Vision Language Pre-Training
X-VLM 教 AI 看图,不只学"整张图配整句话",还同时学"图里某个物体配某个词"——而且不靠外部的物体检测器,一个模型端到端把整图、区域、物体三种粒度的图文对齐一起学,于是问图里某个细节时也能答准。
-
2023
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
Meta AnyMAL 在 LLaMA-2-70B-chat 全程冻结 的前提下,为 图 / 视频 / 音 / IMU 各训一个 投影层(aligner),把模态信号映进 LLM 词嵌入空间 当「伪 token」;再用自标 60K MM-IT + 合成 150K 做指令微调。零样
-
2023
AudioPaLM
现在最强的文本大模型(如 PaLM-2)会读会写,但"听不见、不会说"。AudioPaLM 的想法很直接:把语音也切成一个个"词元(token)",塞进文本大模型的词表里,让同一个模型既能吃文字又能吃声音、既能吐文字又能吐声音。这样一个模型就能同时做语音识别、语音翻译、语音到语音
-
2023
FROMAGe: Grounding LLMs to Images
把一个会说话的大模型整个冻住不动,只在它前后各加一层薄薄的"翻译片",就让它能看图、找图、还能图文混着聊天。
-
2023
OBELICS
HuggingFace OBELICS 从 Common Crawl 抽出 1.41 亿 英文网页、3.53 亿 张图、1150 亿 text token,按 DOM 原生顺序 保留「段–图–段–图」交错结构;在此上训 IDEFICS-80B 后 4-shot VQAv2 63.
-
2024
OneLLM
用一套统一的框架,把图像、音频、视频、点云、深度图、法线图、惯性传感器(IMU)、甚至大脑 fMRI 信号这八种完全不同的感官输入,全都翻译成语言模型能听懂的形式,接到同一个大语言模型上——不再为每一种感官单独造一个专用编码器和专用对齐模块。
VIII RF Perception & Mapping 9 篇
-
2019
Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm

-
2020
milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
用一颗几十块钱、单芯片的毫米波雷达,加上一套专门设计的神经网络,让一个移动设备(人、机器人、无人机)在黑暗、烟雾、无纹理墙面这些摄像头会失灵的环境里,也能准确算出"自己往哪儿走了、走了多远",3D 轨迹误差低到约 1.3%。
- 2020
-
2021
3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
用两级 GAN(对抗生成网络)把便宜毫米波雷达那团"糊糊的电波能量云"翻译成清晰的深度图,再拼成一朵稠密平滑的 3D 点云——烟雾、灰尘、黑暗里也能"看清"物体的完整形状。
- 2022
-
2023
CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
给机器人装一颗几百块的毫米波小雷达,让它一边走一边画出厘米级精度的 3D 地图。关键创新是让 AI 学会说"我对这个预测不太确定",从而自动忽略不靠谱的测量,最终在 14 层楼的实测中打败了所有相机方案。
-
2023
High Resolution Point Clouds from mmWave Radar
训练一个端到端的神经网络,把一颗便宜的单芯片毫米波雷达"看糊的、又稀又乱的"数据,翻译成接近激光雷达(LiDAR)那样清晰、稠密的点云——而且在浓烟弥漫、雷达没见过的房间里也照样管用,生成的点云还好到能直接喂给现成的激光雷达建图/里程计软件。
-
2023
RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
用无线电波(RF 信号)估计人体的三维姿态(骨架关节位置)——关键创新是:不像以前那样在"信号层面"硬凑,而是先用最优传输(Optimal Transport)理论,把 RF 信号的特征"搬运"到姿态的特征空间,再从搬运后的特征生成人体骨架。这样即使隔墙、遮挡、在室外,也能比以前
-
2024
mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
用对比学习把毫米波雷达信号「翻译」进 CLIP 的文本语义空间——训练时见过走路、跑步,部署时只要写一句「太极拳」的文字描述,雷达就能认出来,不需要为新动作再采雷达数据。
IX Auditory & Acoustic 8 篇
-
2020
Conformer
Transformer 擅长看"全局大局",卷积擅长抠"局部细节",Conformer 把两者塞进同一个模块里——让语音识别既看得远又看得清,用更少的参数刷出了 LibriSpeech 的最好成绩(测试集 word 错误率低到 1.9%/3.9%)。
-
2020
Dual-path RNN
混音波形(32000 个采样点,超长)
-
2021
Meta-StyleSpeech
给一个文字转语音(TTS)系统装上"听一句就模仿声线"的能力——只要给它一段 1 到 3 秒的陌生人录音,它就能用那个人的音色把任意文字念出来,而且不需要为这个人重新训练模型。
-
2023
AudioLM
Google AudioLM 把波形变成 两套离散 token——w2v-BERT 语义 token(25 Hz) 管长程内容,SoundStream 声学 token(50 Hz×12 层 RVQ) 管高保真音色——再用 三个 0.3B Transformer 分阶段自回归续写
-
2023
EnCodec
EnCodec 教神经网络把一段声音压成一串很小的整数、再几乎无损地还原回来——既比传统编解码器在极低码率下更清晰,又因为声音变成了"整数序列",让 AI 能像写字一样"写"出声音。
-
2023
MusicLM
给一句文字描述,比如"一段舒缓的小提琴旋律配上失真吉他 riff",MusicLM 就能生成一段 24kHz、能连贯保持好几分钟的高保真音乐;还能让你哼一段跑调的旋律,它按你的文字风格把它"重新演奏"出来。
-
2023
Robust Speech Recognition via Large-Scale Weak Supervision
Whisper 用互联网上 68 万小时的弱标注(音频 + 自动/人工字幕)数据,喂进标准 Encoder-Decoder Transformer,训出一个多语种多任务语音模型。不微调直接用(zero-shot),在 12 个分布外数据集上平均 WER 比 Wav2Vec 2.0
-
2024
NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
在咖啡馆听不清对面说话?让助听器自己降噪,不连手机、不连云——把一个原本跑在显卡上的"降噪大脑"拆骨瘦身 100 倍,再教它用"粗糙的算盘"(8 位整数芯片)照样算出接近原来的答案,最终全部塞进一只挂在耳朵后面的小壳子里,处理一帧音频只要 5.54 毫秒,功耗只有 71 毫瓦,2
X Datasets & Benchmarks 4 篇
-
2021
What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
这篇论文不发明新算法,而是把"机器人看录像学操作"这件事里的每个变量——算法、数据质量、看什么、要不要记忆——挨个换一遍,然后老实告诉你:哪些真有用,哪些是白忙。它顺手还开源了一整套仿真环境、数据集和代码,成了后来所有操作模仿学习论文的"默认评测台"。
-
2022
CALVIN
要让机器人听懂人话干活,得有个统一的"考卷"来比较不同方法的好坏。CALVIN 就是这样一份考卷(基准 benchmark):它在仿真里搭了 4 个桌面环境,让一个机器人根据自然语言指令连续完成一长串任务(比如"打开抽屉→拿起蓝色积木→把积木推进抽屉→打开滑门")。它提供约 24
-
2023
LIBERO
*LIBERO 用 Robosuite 程序化生成 130 个语言条件桌面任务,拆成 Spatial / Object / Goal / 100 四套卷,每任务 50 条专家遥操作示范;系统评测 终身学习(LLDM) 中 陈述性 vs 程序性知识 迁移,并意外发现:顺序微调(Se
-
2023
RH20T
一个在真实世界采集的超大机器人操作数据集:11 万多条接触丰富(要用力、要手感)的操作序列,覆盖约 150 种技能、多种机器人、多种视角,每条都同时录了画面、力觉、声音、动作四种信息,还配了对应的人类示范视频和语言描述——目标是让机器人不只会推捡,而是学会切、插、倒、折这种需要视
XI Simulation & Sim2Real 5 篇
-
2020
SAPIEN: A SimulAted Part-based Interactive ENvironment
给机器人造了一个虚拟宜家展厅,2,346 件家具每个抽屉、每扇门、每个瓶盖都能真的拉开、推开、拧开。
-
2021
Habitat 2.0
上一代 Habitat 只能在虚拟房子里走路看;2.0 让小机器人能真的开冰箱、把杯子从厨房拿到客厅做家务。
-
2021
ManiSkill
ManiSkill 是教机器人开抽屉、开柜门、推椅子、搬水桶这类"带关节的家具操作"的统一标准考场——它的核心考点是:机器人练完几十上百个不同形状的柜子之后,能不能上手一个从没见过的新柜子。
-
2022
ProcTHOR
用一套程序自动"造房子":想要多少个不重样的、可交互的、带家具的虚拟房子都能生成。用它造出的 1 万个房子预训练一个简单的神经网络机器人,只靠 RGB 摄像头、不建地图、不用人给任务监督,就在 6 个具身 AI 基准(导航、重排、机械臂操作)上刷到当时最强,甚至不微调直接零样本也
-
2022
DexMV
DexMV 搭了一套"人手视频 → 机器人示范"的转换流水线:用普通 RGB-D 相机录人手做家务(倒水、放东西、搬运),估计出 3D 手和物体姿态,再通过一套"动作重定向 + 动作反推"的方法,把人手轨迹翻译成 30 自由度机械手能执行的示范,最后用模仿学习训策略。结果:在纯强