Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 24

Stable Audio

13 min read · 4494 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

打几个字描述你想要的声音,AI 就能做出几十秒到一两分钟的高音质音乐或音效,长度还能精确到秒。技术上靠"先把音频压进潜空间、再在潜空间跑扩散、还带上时长条件"。

所以这一节是想说:Stable Audio 是"文字生成可控时长、高采样率长音频"的潜空间扩散模型。


这是个什么场景

刷短视频时常冒出这种念头:这段画面配点紧张鼓点就好了,或者"再多 10 秒刚好踩到镜头切换"。但你不会作曲、也没买曲库,只能去音乐网站翻半天,运气好找到差不多的,运气不好就放弃。打游戏想要一段"开门吱呀声 + 远处脚步声"的环境音,市面成品要么不够长、要么风格不对。

Stable Audio 解决的就是这件事:你打字描述"电子舞曲,128 BPM,紧张感,47 秒",它直接给你一段 47 秒的高音质音频,像跟厨师点菜——既能说菜名(文本提示)又能指定分量(时长)。

"47 秒"这个能精准指定的长度是关键——之前同类工具大多只能做固定 10 秒的小片段,多 1 秒少 1 秒都做不到。

潜空间(latent space):先用一个网络把原始信号压成一个小很多的"压缩表示",在这个压缩空间里做生成,再解压回原始信号。图像里的 Stable Diffusion 就是这么干的——不在像素上画画,而是在"压缩图"上画。

音频为什么必须压?原始波形每秒有 44100 个采样点,一分钟就是 264 万个数。直接在这么长的波形上跑扩散根本跑不动,所以必须先压。

所以这一节是想说:Stable Audio 面对的是"文字生成音频,但要长、要高音质、时长还要可控"这个此前没被同时满足的需求。


Stable Audio — 场景示意:这论文要解决的现实问题
Plate Nº IStable Audio — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • AudioLDM / AudioLDM2:也是潜空间扩散 + 文本条件,但生成多是 10 秒级固定长度,时长不可控,长音乐做不了。
  • MusicLM / MusicGen(Meta):走 token 路线,把音频离散化成 codec token,再用 Transformer 自回归生成;质量好但慢,长音频要一个 token 一个 token 蹦。
  • Riffusion:把音频转成频谱图当图像,复用 Stable Diffusion 生图;hack 味重,时长也短。
  • Jukebox(OpenAI, 2020):层级化 VQ-VAE + 自回归 Transformer,能生成长音乐,但训练和采样都极慢,质量不稳。
  • 共同短板:要么时长短且不可控,要么采样慢,要么采样率低(多为 24 kHz,达不到 CD 级 44.1 kHz)。

所以这一节是想说:以前的音频生成,"长""高音质""快""时长可控"这四个属性没人能同时拿下。


这篇论文的新想法

三个关键动作叠在一起:

  1. 专门为音频训的 VAE——像给乐谱设计一套专用速记法。 不复用图像那套压缩工具,而是从头训一个专门把 44.1 kHz 立体声波形压到"低帧率潜空间"的自编码器(编码器负责压、解码器负责还原)。压完数据量小很多,扩散才跑得动。
  2. 时长作为条件信号——像点菜时直接说"分量给我做 47 秒那么大"。 把"目标秒数"和"在原音频里的起止位置"编码成数字喂进去,扩散模型不再被动接受固定长度,而是知道该铺多长的画布。
  3. Diffusion Transformer(DiT 风格)on 1D latent——换一种握笔方式,能写更长的字。 用 Transformer 而非 U-Net 在潜序列上去噪,长序列建模更稳,能撑几十秒到 95 秒的输出。

收益:一次推理出长音频、时长可控、质量逼近 CD 级、采样比"一个 token 一个 token 蹦"的自回归模型快很多。

所以这一节是想说:Stable Audio 的新意是"专用音频 VAE + 时长条件 + DiT 潜空间扩散"三件套的组合。


它分几步做的(方法)

这一节是全篇核心,拆成"音频 VAE、文本编码、时长条件、潜空间扩散"四步。

整体数据流 ASCII 示意:

   波形 x ──► 音频 VAE 编码器 ──► 潜表示 z(低帧率)
   文本 prompt ──► CLAP 文本塔 ──► condition embedding ┐
   时长/位置 ──► 傅立叶位置编码 ─────────────────────┤
                                                       ├─► DiT 在 z 上去噪 ─► z' ─► VAE 解码器 ─► 波形
   随机噪声 ──────────────────────────────────────────┘

第 1 步:训音频 VAE——招一位专门的"音频压缩员"

输入:44.1 kHz 立体声波形 x。

处理:教一个网络把 x 编码成潜表示 z,再解码回 x'。目标函数是重构 loss + 对抗 loss + 多尺度 STFT loss(这套组合是音频生成常见配方,借鉴 SoundStream、EnCodec、Descript Audio Codec 这条线)。压完后 z 的"帧率"远低于原波形采样率。

输出:一个能把长波形压成短潜序列、又能高保真还原的 VAE。注意这里是连续潜空间,不是 codec 那种离散 token。

等等,先慢一拍——VAE 是什么?变分自编码器(Variational Autoencoder),把高维信号压成连续向量再还原。和 codec 路线(把声音切成离散 token 像打字发)不同,VAE 给的是连续的"压缩图",更适合后面扩散在上面"画画"。

第 2 步:文本编码——找翻译官把人话翻成向量

输入:prompt,如"电子舞曲,128 BPM,渐强 drop"。

处理:用一个预训练的文本-音频对比学习编码器(CLAP 文本塔之类)把 prompt 编码成一组数字(condition embedding)。这组数字通过 cross-attention(交叉注意力)注入扩散主干。

输出:一段能驱动生成"听起来符合描述"的条件向量。

CLAP:Contrastive Language-Audio Pretraining,对标 CLIP 的音频版,把文本和音频映射到同一语义空间。

第 3 步:时长/位置条件——在裁缝店标"袖长 47 公分"

输入:训练时从一段更长的音频里随机截一个窗口。

处理:把"这段窗口在原音频中的起始秒数 + 总秒数"做傅立叶位置编码后拼进 condition。这样模型学会"给定时长就铺满对应长度"。

输出:推理时你说"我要 60 秒,从 0 开始",模型就明白要铺满 60 秒;也可以指定"从 10 秒到 50 秒"做局部生成。这正是"时长可控"的来源。

第 4 步:潜空间扩散主干——在压缩图上一笔笔擦掉雪花

输入:潜表示 z(训练时是加噪的 z,推理时是纯噪声)。

处理:在 z 上跑标准扩散(v-prediction 或 EDM 框架,具体配置需查原文),主干是 1D Diffusion Transformer。推理时用 DDIM 类采样器跑几十到上百步出干净的 z'。

输出:干净潜表示 z' 过 VAE 解码器还原成波形。整体是"先压、再扩散、再解压"的三明治。

等等,先慢一拍——为什么非得先压进潜空间,不能直接在波形上扩散?

关键在于音频的数据量大得惊人。CD 音质是每秒 44100 个采样点,立体声就是每秒近 9 万个数字,一段 90 秒的音乐就是几百万个采样点。如果直接在这么长的原始波形上跑扩散,每一步去噪都要处理几百万维的数据,几十上百步下来算力根本扛不住,而且模型很难在这么长的序列上抓住"旋律""节奏"这种长时间跨度的结构。音频 VAE 先把波形压成一段短得多的潜表示(可能压掉几十倍长度),扩散就在这个"缩略图"上进行——既大幅省算力,又让模型能在更宏观的尺度上组织音乐结构,最后再由解码器把缩略图还原成高保真波形。这正是它敢做"90 秒长音频、还能实时级出结果"的底气,也是它继承自 Stable Diffusion(图像领域同款"潜空间扩散"思路)的核心招数。

所以这一节是想说:Stable Audio 的方法 = 专用音频 VAE 压缩 + CLAP 文本条件 + 傅立叶时长条件 + DiT 潜空间扩散,四步组成一条端到端的可控生成链,而"先压进潜空间"是它能处理长音频、跑得快的根本前提。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Stable Audio · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Stable Audio — 方法示意:核心 pipeline
Plate Nº IIStable Audio — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体 FAD/CLAP 分数请查原文,此处不编造。

维度 说明
采样率 44.1 kHz 立体声(CD 级)
最长输出 约 95 秒(业界报道)
潜空间 连续(VAE),非离散 codec token
去噪主干 1D Diffusion Transformer (DiT)
文本条件 CLAP 文本塔 + cross-attention
时长条件 起止秒数的傅立叶编码
数据来源 AudioSparx 等授权音频库(回应版权质疑的关键)
主指标 FAD(越低越像真实)、CLAP score(语义对齐)

关键卖点:长 + 高采样率 + 时长可控 + 采样快——相比 MusicGen 那种自回归 token 模型,生成一分钟级音频的挂钟时间显著更短。

所以这一节是想说:数字告诉我们,潜空间扩散这条路在"长音频 + 高音质 + 可控时长 + 快"上同时达标,是对自回归 token 路线的一次全面反超。


实验结果说明了什么

  • 文本到音乐/音效:在 AudioCaps、MusicCaps 等基准上比 FAD、CLAP score、人评分,对照 AudioLDM2、MusicGen。
  • 时长可控性消融:验证给定不同 duration 时输出实际秒数是否准确、质量是否随时长退化。
  • 采样率消融:44.1 kHz vs 16/24 kHz,证明高采样率带来主观音质提升。
  • 采样速度:对比自回归 token 模型,潜空间扩散在生成一分钟级音频时挂钟时间显著短。
  • 版权:训练数据来自 AudioSparx 授权库,不是乱爬 YouTube——这是 Stability AI 当时回应版权质疑的关键卖点。

所以这一节是想说:实验证明了潜空间扩散不仅质量好,还在"长度可控"和"速度"两个自回归的传统弱项上实现了反超。


你应该懂的几个新词

  • 潜空间扩散(latent diffusion):不在原始信号上扩散,先用 VAE 压到低维潜空间再扩散。Stable Diffusion 让它出圈。
  • VAE(变分自编码器):编码器压成连续向量、解码器还原;和 codec 的离散 token 是不同路线。
  • CLAP:音频版 CLIP,把文本和音频映射到同一语义空间。
  • DiT(Diffusion Transformer):去噪主干用 Transformer 而非 U-Net,长序列更友好。
  • 44.1 kHz / 立体声:CD 标准采样率 + 双声道,行业公认的"听感过关"下限。
  • FAD(Fréchet Audio Distance):音频版 FID,衡量生成音频和真实分布的距离,越低越好。
  • 多尺度 STFT loss:在多个时频尺度上比对生成与真实音频的频谱,音频重构常用。

所以这一节是想说:这几个词是理解"潜空间扩散做音频"的通用基础。


它有什么搞不定的

  • 长度仍有上限:约 95 秒,做不了整首几分钟的复杂结构曲目(这要等 Stable Audio 2)。
  • 文本控制粒度有限:能控风格、BPM、时长,但对"第 30 秒进人声、第 45 秒转调"这种精细结构控制弱。
  • VAE 是信息瓶颈:压缩必然丢一部分高频细节,极致 hi-fi 场景可能听得出。
  • 依赖授权数据:为了合规用授权库,风格覆盖不如爬全网的模型广。
  • 非实时:扩散要几十上百步采样,不适合"边听边生成"的交互式场景。

所以这一节是想说:Stable Audio 的短板集中在"长度上限、精细结构控制、VAE 瓶颈"上——它解决了"长且可控",但离"任意长任意精细"还有距离。


它和别的几篇是什么关系

  • 上游基石:Stable Diffusion(图像潜空间扩散范式)直接搬到音频。
  • VAE/codec 邻居:SoundStream、EnCodec、Descript Audio Codec——同样用 GAN + STFT loss 训音频压缩,但它们做离散 codec 给自回归用,Stable Audio 留连续 latent 给扩散用。
  • 同代竞品:MusicGen(自回归 token)、AudioLDM2(潜空间扩散但短)、Jukebox(老派层级 VQ)。Stable Audio 的差异点是"长 + 高采样率 + 时长可控"。
  • 下游演化:Stable Audio Open(开源版)、Stable Audio 2(更长 3 分钟、加 audio-to-audio);后来 Suno、Udio 等商业产品的技术取向也在向"潜空间扩散 + Transformer"靠拢。
  • 和具身 AI:作为听觉 frontier 论文,它代表"声音生成进入可控长序列时代",对机器人做声音反馈、非语音音效、环境音模拟有间接影响。

所以这一节是想说:Stable Audio 是"图像潜空间扩散范式成功移植到音频"的代表作,是理解后续音频生成产品内核的钥匙。


和本导读的关系

本篇对应导读 Ch20: 听觉智能。Ch20 覆盖机器"听"与"发声"的能力栈,Stable Audio 是"发声/生成"这一端的代表——它把图像生成里成熟的潜空间扩散范式带进音频,让"可控地造声音"成为现实。读完本篇,配合同章的语音翻译(SeamlessM4T)、声音分离(USS)工作,能拼出"机器怎么听、怎么懂、怎么造声音"的全貌。

所以这一节是想说:把 Stable Audio 放进 Ch20 的听觉栈里读,它是"生成声音"这一格的代表。


思考题

Q1:为什么音频生成必须先压进潜空间,不能直接在波形上跑扩散?

提示

44.1 kHz 一分钟就有 264 万个采样点,直接在这么长的序列上跑扩散,计算和显存都撑不住。VAE 压成低帧率潜表示后序列短得多,扩散才可行。

Q2:Stable Audio 用连续 VAE latent,而 MusicGen 用离散 codec token,这两条路各自的优劣是什么?

提示

连续 latent + 扩散:一次出整段、快、时长可控;离散 token + 自回归:逐 token 生成、慢、但天然支持流式和可变长。前者赢在速度和整体一致性,后者赢在灵活性。

Q3:时长条件是怎么让模型"知道该铺多长"的?训练时的关键技巧是什么?

提示

训练时从长音频随机截窗口,把"窗口的起止秒数 + 总秒数"做傅立叶编码喂进 condition。模型于是学会"给定这个时长信号,就生成对应长度的内容"。

Q4:为什么 Stable Audio 强调训练数据来自授权库?这对模型本身有什么影响?

提示

回应版权质疑(合规)。代价是授权库的风格覆盖不如爬全网广,可能在某些冷门风格上表现受限。合规和数据多样性之间有取舍。

Q5:VAE 的压缩比越高,扩散越好跑,但会有什么风险?

提示

压得越狠丢的高频细节越多,解码回来的音质越可能下降。压缩比是"扩散可行性"和"重构保真度"之间的权衡。

Q6:如果要把 Stable Audio 改造成"边生成边播放"的实时系统,最大障碍是什么?

提示

扩散是"整段一起去噪几十上百步",不是从左到右逐段生成,天然不流式。要实时得改成能增量生成的架构,或大幅削减去噪步数(如一致性蒸馏)。

所以这一节是想说:这几个问题带你把"为什么压、连续 vs 离散、时长条件、合规、压缩比、实时性"这些核心权衡自己推一遍。


一些好奇心问答(FAQ)

Q1:Stable Audio 能生成人声唱歌吗?

初代主打器乐/音效,人声不是强项。想要更完整的音乐(含人声结构)看 Stable Audio 2 或 Suno/Udio 这类产品。

Q2:它开源吗?

初代是产品/论文,Stability 后来发布了 Stable Audio Open 的开源版本,可用于研究和二创。

Q3:为什么用 DiT 而不是像 Stable Diffusion 那样用 U-Net?

音频潜表示是长的一维序列,Transformer 的长序列建模比 U-Net 更稳,更适合几十秒的长音频。

Q4:生成一段音频要多久?

比自回归 token 模型快很多(几十到上百步扩散一次出整段),但仍非实时,通常几秒到几十秒量级,取决于时长和步数。

Q5:和 Stable Diffusion 到底像不像?

框架几乎同构——都是"VAE 压缩 → 潜空间扩散 → 解码"。区别是把二维图像空间换成一维时间序列,且多了 CLAP 文本条件和时长条件。

Q6:读完 Stable Audio 接下来看什么?

想看自回归对照路线看 MusicGen;想看压缩底座看 EnCodec;想看升级看 Stable Audio 2。

所以这一节是想说:能不能生成人声、开不开源、多快、和 SD 像不像——这些实操问题都有明确答案。


如果你想再深入

按"范式源头 → 压缩底座 → 对照 → 升级"排序:

  1. 范式源头:Stable Diffusion —— 潜空间扩散的原型,理解它音频版就好懂。
  2. 压缩底座:EnCodec / SoundStream —— 音频压缩的 loss 组合与思路来源。
  3. 对照:MusicGen —— 自回归 token 路线,和扩散形成对比。
  4. 升级:Stable Audio 2 / Stable Audio Open —— 更长、开源、audio-to-audio。

所以这一节是想说:把 Stable Diffusion + EnCodec + Stable Audio + MusicGen 连起来读,就能把"音频生成"这条线的两大范式串通。


原文信息

BibTeX:

@inproceedings{evans2024stableaudio,
  title     = {Fast Timing-Conditioned Latent Audio Diffusion},
  author    = {Evans, Zach and Carr, CJ and Taylor, Josiah and others},
  booktitle = {International Conference on Machine Learning (ICML)},
  year      = {2024},
  url       = {https://arxiv.org/abs/2402.04825}
}

所以整篇是想说:Stable Audio 把图像界成熟的"潜空间扩散"搬进音频,再加上一个精巧的时长条件——让"打几个字就生成一段指定长度的高音质音频"这件事,第一次又快又好地成立了。

引用本笔记 / Cite this note
BibTeX
@online{eai_stable_audio_2026,
  title       = {(readable note) Stable Audio},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/stable-audio/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?