Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Era

经典 · Classic

每个领域里被反复引用、几乎成事实标准的工作。它们不必是第一篇,但是绕不开的。读这一档你能拿到该领域的核心认知。

66总篇数
11覆盖主题
2019–2025年份跨度
499,165

祖师爷 · Founder →前沿 · Frontier →

I VLM Foundation 11 篇

  • 2022
    BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation ICML · ⭐⭐⭐

    一句话:让一个模型同时学会看图和写字,再让它帮自己把网上烂配文重写干净,回头再用干净数据训一遍——多个任务全线变强。 三个关键贡献: MED(Multimodal mixture of Encoder-Decoder):一个模型三种身份切换——纯编码器、看图的文本编码器、看图的文

  • 2022
    FILIP: Fine-grained Interactive Language-Image Pre-Training ICLR · ⭐⭐⭐

    CLIP 是"整张图配整句话"看个大概像不像;FILIP 让图里的每一小块(patch)和句子里的每个词各自去对面找最像的伙伴,模型因此学会"狗在左下角、草地在右边"这种细节——而且只改了对比损失,没牺牲 CLIP 那种"能离线预存特征、检索超快"的效率。

  • 2023
    3DShape2VecSet: 3D Shape Representation for Diffusion Models SIGGRAPH · ⭐⭐⭐⭐

    把一个 3D 物体(比如一只椅子)压缩成 512 张小卡片,每张卡片只记录"特征"不记录"位置";电脑学会这些卡片的规律之后,就能从一团随机噪声里凭空造出全新的 3D 模型——还能根据文字描述、单张照片、或半个点云来指挥它造什么。

  • 2023
    BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models ICML · ⭐⭐⭐⭐

    不动两个大模型——一个负责看图、一个负责说话——只在中间训练一个小"翻译官",就让 AI 学会了看图说话,而且比动辄 800 亿参数的 [Flamingo](flamingo.md) 效果更好、成本低一个数量级。

  • 2023
    EVA-CLIP: Improved Training Techniques for CLIP at Scale arXiv · ⭐⭐⭐

    EVA-CLIP 不改 CLIP 的架构,只换了三个训练技巧——用一个已经"懂图"的视觉模型当起点、换个不闪腰的大 batch 优化器、训练时随机只看半张图——就用远少于对手的数据和算力,训出了更强的看图模型。最大的 EVA-02-CLIP-E/14+(50 亿参数、90 亿样本

  • 2023
    Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond arXiv · ⭐⭐⭐

    阿里 2023 年开源的 Qwen-VL:在会中英双语聊天的 Qwen-7B 语言模型上,接一个 ViT-bigG(19 亿参数)视觉编码器 + 一个把图压成 256 个 token 的位置感知适配器,用三阶段训练教它一次学会看图、念中英文招牌(OCR)、用框指出物体(groun

  • 2023
    Sigmoid Loss for Language Image Pre-Training ICCV · ⭐⭐⭐

    教模型"图配文字",CLIP 的做法是让全班一起排名打分(softmax 对比),SigLIP 改成一对一判断"这俩是不是一对"(sigmoid 判断题)。改这一行损失函数,就换来了算得快、省内存、小批量也能学。

  • 2024
    DeepSeek-VL: Towards Real-World Vision-Language Understanding arXiv · ⭐⭐⭐

    DeepSeek 在 2024 年开源的"会看图"模型(1.3B 和 7B 两档),核心不是堆参数,而是给模型配了一双"广角镜头 + 微距镜头"的眼睛(SigLIP + SAM 混合视觉编码器)、能吃 1024×1024 高分辨率,还专门用真实世界的发票、PPT、图表、UI 截图

  • 2024
    Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks CVPR · ⭐⭐⭐

    一个相对小的看图模型:你跟它说"描述这张图""圈出所有的猫""图里红车在哪""把这段文字读出来",它都用同一个脑子处理,输出统一的一段文字。靠一个 5.4 亿标注 / 1.26 亿张图的超大数据集 FLD-5B 撑起来,让参数量不大的模型在检测、分割、caption、ground

  • 2024
    InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks CVPR · ⭐⭐⭐⭐

    让"看图的脑子"也长到 60 亿参数,和"会说话的脑子"一样大,AI 看图说话才不偏科,而且开源就能用。

  • 2024
    Improved Baselines with Visual Instruction Tuning CVPR · ⭐⭐

    给初代 [LLaVA](llava.md) 换了四个零件——更厚的镜片(两层 MLP)、更高的分辨率(336px)、更丰富的教材(665K 混合数据)、更聪明的大脑(Vicuna-1.5)——模型本身一行代码没改,就在 12 个看图答题榜单上拿了开源第一。

II High-Level Planning 5 篇

  • 2023
    ChatGPT for Robotics IEEE Access · ⭐⭐

    这是微软的一篇"设计原则 + 能力研究"论文:它教你怎么用一套方法(提示工程 + 高层函数库 + 人在环把关),让 ChatGPT 把人的大白话指令翻译成机器人能执行的代码。核心招数是——不让 ChatGPT 直接写底层电机代码,而是给它一套"起好名字的高层函数"(如 detec

  • 2023
    VoxPoser CoRL · ⭐⭐⭐⭐

    VoxPoser 让大模型给机器人画两张 3D 地图:红色地方要去、灰色地方要躲,机器人照着地图规划出动作——全程不训练任何新模型。

  • 2024
    GenSim ICLR · ⭐⭐⭐

    让 ChatGPT 当"出题老师",自动给机器人编一堆练习关卡,连标准答案(专家怎么解)也一起写好。

  • 2024
    RoboFlamingo ICLR · ⭐⭐⭐⭐

    拿一个现成的开源视觉语言大模型(OpenFlamingo,会看图 + 读文字),给它加一个专门负责"看历史、出动作"的小脑袋(policy head),再用机器人的模仿数据轻轻微调一下,就得到一个能听懂语言指令、看着画面去操作的机器人——在 CALVIN 这个语言指令操作基准上大

  • 2024
    Tree-Planner ICLR · ⭐⭐⭐

    让大模型一次写好十份"菜谱",把重复步骤合成一棵树,做事时照树走,错了就换条岔路,全程不用反复打电话问。既省 LLM 调用,又自带纠错。

III End-to-End VLA 5 篇

  • 2023
    RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control CoRL · ⭐⭐⭐⭐

    把机器人动作翻译成一句话,让会看图聊天的 AI 用写句子的方式开口指挥机器人——它会写字,就能动手。

  • 2023
    RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches ICLR · 3

    教机器人做新动作,光说话不够、给一张完成图也不够。这篇论文说:在画面上画一条"手该走的路"——机器人立刻照着做。核心贡献是提出 RT-Trajectory,用 2D 轨迹草图(trajectory sketch)作为策略条件(policy conditioning),在同样的训练

  • 2024
    OpenVLA: An Open-Source Vision-Language-Action Model CoRL · ⭐⭐⭐

    把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。

  • 2024
    3D Diffusion Policy (DP3) RSS · ⭐⭐⭐

    Diffusion Policy 用 2D 图像当"眼睛",需要上百个示范才学得会。DP3 把眼睛换成"稀疏点云 + 一个极简 MLP 编码器"——只用 10 个示范就能搞定大多数任务,72 个仿真任务平均比 Diffusion Policy 相对提升 24.2%,真机 4 个任

  • 2024
    Octo: An Open-Source Generalist Robot Policy RSS · ⭐⭐⭐

    输入(可插拔的 token)

IV Diffusion Policy 3 篇

V Imitation Learning 5 篇

  • 2021
    Implicit Behavioral Cloning CoRL · ⭐⭐⭐⭐

    别让模型直接报"动作是这个",而是让它给一堆候选动作打分、挑最低分那个——机器人的手就突然变巧了。

  • 2022
    Behavior Transformers: Cloning k Modes with One Stone NeurIPS · ⭐⭐⭐

    同一件事人类有好几种做法(左绕、右绕都行)。传统 AI 会把这些做法"取平均"成一个四不像。BeT 先用 k-means 把动作分成 k 个"流派",让 Transformer 先选流派、再微调细节——一个模型克隆出人类示范里的所有主流做法。

  • 2023
    Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA) RSS · ⭐⭐⭐

    用约 2 万美元搭一套"主从臂遥操 + 四摄像头"的双臂系统(ALOHA),让人示范 50 次约 10 分钟,再用 ACT 算法让机器人一次预测未来 100 步动作而不是一步一步猜——开调料杯、插电池这类毫米级精细活,成功率能到 80–96%。

  • 2023
    AnyTeleop CoRL · ⭐⭐⭐

    要教机器人干活,得先有人"手把手"演示——这个"人远程操控机器人"的过程叫遥操作(teleoperation)。过去的视觉遥操作系统都是"一套系统只配一款机器人、一个环境",换机器人就得重做。AnyTeleop 做了一套通用系统:只用普通摄像头,就能操控任意机械臂+任意灵巧手,在

  • 2023
    RoboCat TMLR · ⭐⭐⭐⭐

    DeepMind 造的一个"通用机器人操作大脑":它能同时控制多种不同的机械臂、做多种任务,只要给它一张"目标长啥样"的图片就知道该干什么;遇到新任务或新机器人,用 100–1000 个示范就能快速上手;更关键的是,它能用自己练出的能力去生成新数据,再拿这些数据把自己练得更强,形

VI World Model & Video Policy 5 篇

  • 2021
    Mastering Atari with Discrete World Models ICLR · ⭐⭐⭐⭐

    让 AI 闭眼"做白日梦"练打老游戏,第一次只靠脑子里想象就打到人类水平。具体做法:把脑内模拟器的"快照"从连续数字(高斯)换成离散选项(32 组 x 32 类 categorical),再用一个叫 KL balancing 的二八开技巧来让"猜测"尽量贴近"亲眼看到"的状态,最

  • 2022
    DayDreamer CoRL · ⭐⭐⭐

    让一只四足机器人不靠仿真、不靠遥控示范,直接在真实地面上边走边"在脑子里做梦演练",1 小时从零学会站起来和走路。

  • 2023
    Transformers are Sample-Efficient World Models ICLR · ⭐⭐⭐⭐

    把游戏画面切成一格格"积木",让 AI 像写句子一样接龙下一帧,然后让它在脑子里"自己跟自己玩"练强化学习——只玩两小时就接近人类水平。

  • 2023
    TWM: Transformer-based World Models ICLR · ⭐⭐⭐⭐

    智能体(agent)在脑子里"做梦"练本事。这篇把梦的引擎从 RNN 换成 Transformer,记得更长、做得更准,在样本效率基准 Atari 100k 上有竞争力。

  • 2025
    Dreamer V3: Mastering Diverse Domains through World Models Nature · ⭐⭐⭐⭐

    DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。

VII Multimodal Ecology 6 篇

  • 2022
    X-VLM: Multi-Grained Vision Language Pre-Training ICML · ⭐⭐⭐⭐

    X-VLM 教 AI 看图,不只学"整张图配整句话",还同时学"图里某个物体配某个词"——而且不靠外部的物体检测器,一个模型端到端把整图、区域、物体三种粒度的图文对齐一起学,于是问图里某个细节时也能答准。

  • 2023
    AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model EACL · ⭐⭐⭐

    Meta AnyMAL 在 LLaMA-2-70B-chat 全程冻结 的前提下,为 图 / 视频 / 音 / IMU 各训一个 投影层(aligner),把模态信号映进 LLM 词嵌入空间 当「伪 token」;再用自标 60K MM-IT + 合成 150K 做指令微调。零样

  • 2023
    AudioPaLM arXiv · ⭐⭐⭐⭐

    现在最强的文本大模型(如 PaLM-2)会读会写,但"听不见、不会说"。AudioPaLM 的想法很直接:把语音也切成一个个"词元(token)",塞进文本大模型的词表里,让同一个模型既能吃文字又能吃声音、既能吐文字又能吐声音。这样一个模型就能同时做语音识别、语音翻译、语音到语音

  • 2023
    FROMAGe: Grounding LLMs to Images ICML · ⭐⭐⭐

    把一个会说话的大模型整个冻住不动,只在它前后各加一层薄薄的"翻译片",就让它能看图、找图、还能图文混着聊天。

  • 2023
    OBELICS NeurIPS · ⭐⭐⭐

    HuggingFace OBELICS 从 Common Crawl 抽出 1.41 亿 英文网页、3.53 亿 张图、1150 亿 text token,按 DOM 原生顺序 保留「段–图–段–图」交错结构;在此上训 IDEFICS-80B 后 4-shot VQAv2 63.

  • 2024
    OneLLM CVPR · ⭐⭐⭐

    用一套统一的框架,把图像、音频、视频、点云、深度图、法线图、惯性传感器(IMU)、甚至大脑 fMRI 信号这八种完全不同的感官输入,全都翻译成语言模型能听懂的形式,接到同一个大语言模型上——不再为每一种感官单独造一个专用编码器和专用对齐模块。

VIII RF Perception & Mapping 9 篇

IX Auditory & Acoustic 8 篇

  • 2020
    Conformer Interspeech · ⭐⭐⭐

    Transformer 擅长看"全局大局",卷积擅长抠"局部细节",Conformer 把两者塞进同一个模块里——让语音识别既看得远又看得清,用更少的参数刷出了 LibriSpeech 的最好成绩(测试集 word 错误率低到 1.9%/3.9%)。

  • 2020
    Dual-path RNN ICASSP · ⭐⭐⭐⭐

    混音波形(32000 个采样点,超长)

  • 2021
    Meta-StyleSpeech ICML · ⭐⭐⭐

    给一个文字转语音(TTS)系统装上"听一句就模仿声线"的能力——只要给它一段 1 到 3 秒的陌生人录音,它就能用那个人的音色把任意文字念出来,而且不需要为这个人重新训练模型。

  • 2023
    AudioLM TASLP · ⭐⭐⭐⭐

    Google AudioLM 把波形变成 两套离散 token——w2v-BERT 语义 token(25 Hz) 管长程内容,SoundStream 声学 token(50 Hz×12 层 RVQ) 管高保真音色——再用 三个 0.3B Transformer 分阶段自回归续写

  • 2023
    EnCodec TMLR · ⭐⭐⭐⭐

    EnCodec 教神经网络把一段声音压成一串很小的整数、再几乎无损地还原回来——既比传统编解码器在极低码率下更清晰,又因为声音变成了"整数序列",让 AI 能像写字一样"写"出声音。

  • 2023
    MusicLM arXiv · ⭐⭐⭐⭐

    给一句文字描述,比如"一段舒缓的小提琴旋律配上失真吉他 riff",MusicLM 就能生成一段 24kHz、能连贯保持好几分钟的高保真音乐;还能让你哼一段跑调的旋律,它按你的文字风格把它"重新演奏"出来。

  • 2023
    Robust Speech Recognition via Large-Scale Weak Supervision ICML · ⭐⭐⭐

    Whisper 用互联网上 68 万小时的弱标注(音频 + 自动/人工字幕)数据,喂进标准 Encoder-Decoder Transformer,训出一个多语种多任务语音模型。不微调直接用(zero-shot),在 12 个分布外数据集上平均 WER 比 Wav2Vec 2.0

  • 2024
    NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators MobiCom · ⭐⭐⭐

    在咖啡馆听不清对面说话?让助听器自己降噪,不连手机、不连云——把一个原本跑在显卡上的"降噪大脑"拆骨瘦身 100 倍,再教它用"粗糙的算盘"(8 位整数芯片)照样算出接近原来的答案,最终全部塞进一只挂在耳朵后面的小壳子里,处理一帧音频只要 5.54 毫秒,功耗只有 71 毫瓦,2

X Datasets & Benchmarks 4 篇

  • 2021
    What Matters in Learning from Offline Human Demonstrations for Robot Manipulation CoRL · ⭐⭐⭐

    这篇论文不发明新算法,而是把"机器人看录像学操作"这件事里的每个变量——算法、数据质量、看什么、要不要记忆——挨个换一遍,然后老实告诉你:哪些真有用,哪些是白忙。它顺手还开源了一整套仿真环境、数据集和代码,成了后来所有操作模仿学习论文的"默认评测台"。

  • 2022
    CALVIN RA-L · ⭐⭐⭐

    要让机器人听懂人话干活,得有个统一的"考卷"来比较不同方法的好坏。CALVIN 就是这样一份考卷(基准 benchmark):它在仿真里搭了 4 个桌面环境,让一个机器人根据自然语言指令连续完成一长串任务(比如"打开抽屉→拿起蓝色积木→把积木推进抽屉→打开滑门")。它提供约 24

  • 2023
    LIBERO NeurIPS · ⭐⭐⭐

    *LIBERO 用 Robosuite 程序化生成 130 个语言条件桌面任务,拆成 Spatial / Object / Goal / 100 四套卷,每任务 50 条专家遥操作示范;系统评测 终身学习(LLDM) 中 陈述性 vs 程序性知识 迁移,并意外发现:顺序微调(Se

  • 2023
    RH20T RSS Workshop · ⭐⭐⭐

    一个在真实世界采集的超大机器人操作数据集:11 万多条接触丰富(要用力、要手感)的操作序列,覆盖约 150 种技能、多种机器人、多种视角,每条都同时录了画面、力觉、声音、动作四种信息,还配了对应的人类示范视频和语言描述——目标是让机器人不只会推捡,而是学会切、插、倒、折这种需要视

XI Simulation & Sim2Real 5 篇

  • 2020
    SAPIEN: A SimulAted Part-based Interactive ENvironment CVPR · ⭐⭐⭐

    给机器人造了一个虚拟宜家展厅,2,346 件家具每个抽屉、每扇门、每个瓶盖都能真的拉开、推开、拧开。

  • 2021
    Habitat 2.0 NeurIPS · ⭐⭐⭐

    上一代 Habitat 只能在虚拟房子里走路看;2.0 让小机器人能真的开冰箱、把杯子从厨房拿到客厅做家务。

  • 2021
    ManiSkill NeurIPS · ⭐⭐⭐

    ManiSkill 是教机器人开抽屉、开柜门、推椅子、搬水桶这类"带关节的家具操作"的统一标准考场——它的核心考点是:机器人练完几十上百个不同形状的柜子之后,能不能上手一个从没见过的新柜子。

  • 2022
    ProcTHOR NeurIPS · ⭐⭐⭐

    用一套程序自动"造房子":想要多少个不重样的、可交互的、带家具的虚拟房子都能生成。用它造出的 1 万个房子预训练一个简单的神经网络机器人,只靠 RGB 摄像头、不建地图、不用人给任务监督,就在 6 个具身 AI 基准(导航、重排、机械臂操作)上刷到当时最强,甚至不微调直接零样本也

  • 2022
    DexMV ECCV · ⭐⭐⭐⭐

    DexMV 搭了一套"人手视频 → 机器人示范"的转换流水线:用普通 RGB-D 相机录人手做家务(倒水、放东西、搬运),估计出 3D 手和物体姿态,再通过一套"动作重定向 + 动作反推"的方法,把人手轨迹翻译成 30 自由度机械手能执行的示范,最后用模仿学习训策略。结果:在纯强