Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 20

Meta-StyleSpeech

14 min read · 4750 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过语音合成"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么只用一句 1–3 秒的录音就能克隆一个人的声音,Meta-StyleSpeech 的两把关键钥匙是什么"。

一句话讲什么(TL;DR)

给一个文字转语音(TTS)系统装上"听一句就模仿声线"的能力——只要给它一段 1 到 3 秒的陌生人录音,它就能用那个人的音色把任意文字念出来,而且不需要为这个人重新训练模型

所以这一节是想说:这篇论文做的是"一句话克隆音色"的语音合成,且对全新说话人也能即时适配。


这是个什么场景

你在用一个有声书 App,想让它用你奶奶的声音给孙子念睡前故事。你手里只有奶奶一段几秒钟的语音留言。理想情况是:把这几秒喂给系统,它立刻就能用奶奶的音色、语调,把整本故事念出来。

这件事对人来说不难——我们听几秒就能模仿一个人的说话腔调。但对机器很难。传统的个性化 TTS 有两条老路,都别扭:

  • 给每个新说话人单独微调(fine-tune)模型:效果好,但要为每个人再训练一遍,慢、贵、还得有较多录音。
  • 不微调、直接套用:快,但用陌生人短短一句去合成时,音色像得不够、质量也差。

Meta-StyleSpeech 要的就是"两全":不微调,也能只凭一句短录音,合成出高质量、且真的像那个人的语音

所以这一节是想说:目标是"零微调、一句话、还得像"的个性化语音合成,这是个高需求但很难两全的问题。


Meta-StyleSpeech — 场景示意:这论文要解决的现实问题
Plate Nº IMeta-StyleSpeech — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 为每个说话人 fine-tune:质量高但需要该说话人的较多数据 + 额外训练时间,不实用(你不可能为奶奶专门训一晚上)。
  • 多说话人 TTS + speaker embedding:给每个说话人学一个"身份向量",合成时查一下。问题是对训练时没见过的新说话人,这个身份向量学不好,音色相似度低。
  • 不微调的 zero-shot 方案:速度快,但论文指出这类方法"adaptation quality 低"——也就是像归像,细节和自然度不够。
  • 共同短板:要么牺牲速度(微调),要么牺牲相似度/质量(不微调)。而且大家用的参考音频往往还得比较长,"1–3 秒短音频"这个更苛刻的设定很少有人做好。

所以这一节是想说:以前是"要么慢要么不像",而且很少能在 1–3 秒极短参考下做好。


这篇论文的新想法

作者分两层出招,对应论文里的两个名字:先做出 StyleSpeech,再升级成 Meta-StyleSpeech

第一层(StyleSpeech)的核心洞察:一个人的"声线风格"(音色、语调、节奏)可以从一段参考音频里抽成一个"风格向量",然后用它去调制文字合成的每一层——具体做法叫 SALN(Style-Adaptive Layer Normalization,风格自适应层归一化)。通俗说:文字先被转成一串中性的、没有个人色彩的特征,SALN 再根据风格向量,给这串特征"上色"(调整每层的放大倍数 gain 和偏移量 bias),让它带上目标说话人的味道。

第二层(Meta-StyleSpeech)的核心洞察:光会"上色"还不够,要让它对没见过的新说话人也上色得像。于是作者引入元学习(meta-learning,学会学习)式的 episodic 训练——每次训练都模拟一次"只给一句陌生人录音"的考试场景,并加入两个判别器(discriminator),用"风格原型(style prototype)"来监督,逼模型把风格抽得更准、合成得更像。

所以这一节是想说:先用 SALN 把"风格向量"注入合成每一层(会上色),再用元学习 + 双判别器逼它对陌生人也上色得像(上色到位)。


它分几步做的(方法)

方法分四块:骨干 TTS、风格抽取、SALN 调制、以及 Meta 训练(双判别器 + episodic)。逐块按"输入 → 处理 → 输出"讲。

1. 骨干 TTS:先把文字变成中性的声音特征

输入。 一段文字(音素序列)。

处理。 用一个 Transformer 式的非自回归 TTS 骨干(与 FastSpeech2 类似的结构:文字 → 编码 → 预测时长/音高 → 解码成 mel 频谱)。这里先不带任何个人色彩,产出的是"标准普通话腔"的中性声音特征。

mel 频谱(mel-spectrogram):把声音在时间和频率上摊开的一张"热力图",横轴时间、纵轴频率、亮度是能量。TTS 通常先生成 mel 频谱,再用声码器(vocoder)把它变成能听的波形。

输出。 一串中性的、还没上色的声音特征(mel 频谱的中间表示)。

所以这一节是想说:先用非自回归骨干把文字转成"没有个人色彩"的声音特征,留待后面上色。

2. 风格编码器:从一句录音里榨出"风格向量"

输入。 目标说话人的一段参考音频(哪怕只有 1–3 秒)。

处理。 一个风格编码器(style encoder)把这段音频压成一个固定长度的风格向量 w——它浓缩了这个人的音色、语调等身份信息。关键是这一步只需要单条、短时音频就能工作。

输出。 一个代表"这个人怎么说话"的风格向量 w。

所以这一节是想说:风格编码器负责把"一句陌生人录音"榨成一个能代表其声线的风格向量。

3. SALN:用风格向量给每层特征上色

这是 StyleSpeech 的核心机件。

类比。 普通的层归一化(Layer Normalization)像给每层特征"做标准化处理"——先把它拉成均值 0、方差 1,再乘一个固定的放大倍数(gain γ)、加一个固定的偏移(bias β)。这套 γ、β 对所有人是一样的。SALN 的改动是:让 γ 和 β 不再固定,而是由风格向量 w 现算出来

输入。 中性声音特征 + 风格向量 w。

处理。 SALN 先把特征标准化,再用"从 w 算出来的" gain 和 bias 去缩放和平移它。人话:风格向量说"这个人声音偏低沉、尾音上扬",SALN 就把相应的特征维度放大或压低。这个操作插在合成网络的多层里,让风格从头到尾渗透进去。

层归一化(Layer Normalization):深度网络里常用的稳定训练手段,把一层的输出拉到统一尺度。SALN 把它的"固定缩放偏移"换成了"由风格决定的缩放偏移",从而实现风格注入。

输出。 带上了目标说话人味道的声音特征——也就是"上过色"的 mel 频谱。

所以这一节是想说:SALN 把风格向量翻译成"每层特征的放大与偏移",实现"听一句就上色"。

4. Meta 训练:双判别器 + episodic,逼它对陌生人也像

只有 SALN,模型对训练里见过的说话人会像,对陌生人未必。Meta-StyleSpeech 用两招补上。

输入。 大量说话人的音频,训练时按"episode(一次小考试)"组织:每个 episode 假装"只给一句某说话人的录音",考模型能否合成得像。

处理。

  • 两个判别器(discriminator):判别器是"打假的裁判",判断合成语音是不是真、像不像目标说话人。论文用两个判别器——一个盯"整体真假/质量",一个盯"是不是这个说话人的风格",并用**风格原型(style prototype,某说话人风格的代表向量)**来监督后者。合成网络(生成器)则努力骗过裁判,从而被逼着把风格做得更准、更自然。这是一种对抗训练(GAN 式)。
  • episodic / 元学习:每个 episode 都模拟"新说话人、只有一句"的实战场景,让模型学会"如何快速从一句录音适配",而不是死记训练里那几个人。

输出。 一个对训练时没见过的新说话人也能只凭 1–3 秒、零微调合成出高相似度语音的模型。

下面用 ASCII 图串起整条流程:

   文字(音素) ──► TTS骨干(非自回归) ──► 中性声音特征 ─┐
                                                        │
   参考音频(1~3s) ──► 风格编码器 ──► 风格向量 w ──► SALN(用w算gain/bias给特征上色)
                                                        │
                                                        ▼
                                              带风格的 mel 频谱 ──► 声码器 ──► 波形
                                                        │
                          训练时: 判别器①(真假/质量) + 判别器②(风格原型监督)
                                  episodic 训练(每次模拟"新人+一句")

再用一张 ASCII 图看 SALN"给特征上色"的直觉(普通归一化 vs 风格自适应):

   普通 LayerNorm:  特征 ─标准化─► ×固定γ +固定β ──► (所有人一个样)
   SALN:            特征 ─标准化─► ×γ(w) +β(w) ──► (γ、β 由风格向量 w 现算, 带上此人音色)
                                      ▲
                              风格向量 w(来自1~3s参考音频)

所以这一整节是想说:Meta-StyleSpeech = 非自回归骨干 + 风格编码器 + SALN 上色 + (双判别器 + episodic) 逼近新说话人,四步合起来实现"一句话零微调克隆"。


Meta-StyleSpeech — 方法示意:核心 pipeline
Plate Nº IIMeta-StyleSpeech — 方法示意:核心 pipeline

关键数字(What works)

下面数字来自论文摘要(arXiv:2106.03153);具体的 MOS(主观评分)、相似度分数、与各 baseline 的差距等细项属正文表格,摘要未逐条给出,标注"需读原文"。

项目 数值/结论 说明
参考音频时长 1–3 秒(单条短音频) 极端苛刻设定
新说话人适配 零微调(无需再训练) 直接前向即可
风格注入机件 SALN(风格自适应层归一化) 用 w 生成 gain/bias
判别器数量 2 个 一个盯质量、一个盯风格原型
训练范式 episodic / 元学习 模拟"新人+一句"考试
相较 baseline 显著更优(质量 + 相似度) 具体数字需读原文

要传达的信号:第一,1–3 秒 + 零微调是这篇最硬的卖点,比同期很多需要更长参考或需微调的方法更实用;第二,SALN 是一个非常"经济"的风格注入方式(只改归一化层的 γ、β,不加大量参数);第三,双判别器 + episodic 是把"泛化到新说话人"从愿望变成能力的关键工程。

所以这一节是想说:用最省的 SALN + 元学习式训练,换来了"一句话、零微调、还像"的实用能力。


实验结果说明了什么

论文实验主要证明三件事:

  • 一句短录音就够:在 1–3 秒的单条参考音频下,合成语音在"自然度"和"说话人相似度"上都显著超过 baseline,验证了 SALN + 风格编码器的有效性。
  • 对新说话人零微调也行:这是 Meta-StyleSpeech 相对 StyleSpeech 的增量——加了双判别器和 episodic 训练后,对训练时没见过的说话人,相似度进一步提升,说明元学习确实帮到了泛化。
  • 消融验证两把钥匙都重要:去掉 SALN 或去掉判别器/episodic,效果都会下降(具体幅度需读原文),说明"上色机件"和"逼近新说话人的训练"缺一不可。

所以这一节是想说:实验证明"SALN 让它会上色、元学习+双判别器让它对陌生人也上色到位"这两点缺一不可。


你应该懂的几个新词

  • TTS(Text-to-Speech):文字转语音,把文字念成声音。
  • mel 频谱 / 声码器(vocoder):mel 频谱是声音的时频"热力图";声码器把它还原成能听的波形。
  • speaker embedding / 风格向量:把一个人的声线浓缩成的向量,代表"这个人怎么说话"。
  • SALN(Style-Adaptive Layer Normalization):本文核心。把层归一化里固定的缩放/偏移,换成由风格向量算出来的,实现风格注入。
  • 判别器(discriminator)/ 对抗训练(GAN):判别器当裁判判真假/像不像,生成器努力骗过它,互相博弈中变强。
  • 风格原型(style prototype):某说话人风格的代表向量,用来监督判别器判断"是不是这个人"。
  • 元学习(meta-learning)/ episodic 训练:让模型"学会快速适配新任务",训练时把每次都设计成一场"新说话人 + 一句录音"的小考试。
  • zero-shot 适配:对训练时没见过的对象,不再训练就能直接用。

所以这一节是想说:SALN、判别器、元学习是本篇三个必须吃透的关键词,也是语音/多模态里反复出现的通用概念。


它有什么搞不定的

  • 参考音频质量敏感:1–3 秒虽短,但若这段录音有噪声、混响或情绪极端,抽出的风格向量会失真,克隆效果打折。
  • 音色像不等于情感/韵律全对:SALN 主要抓音色和整体腔调,细腻的情感起伏、特定语气(讽刺、哽咽)未必能复现。
  • 语言/口音泛化有限:训练数据覆盖不到的语言、方言、口音,克隆质量会下降。
  • 依赖声码器:最终波形质量还受声码器限制,声码器的瑕疵会叠加进来。
  • 滥用风险(deepfake 语音):一句话就能克隆声音,天然带来伪造、诈骗的伦理与安全隐患——这是能力越强越突出的问题。

所以这一节是想说:它在音色相似上很强,但在情感细节、跨语言、以及伦理安全上都有明显边界。


它和别的几篇是什么关系

  • 骨干上游:FastSpeech / FastSpeech2(非自回归 TTS)是它的合成骨干思路来源;Tacotron 系是更早的自回归 TTS。
  • 同代个性化 TTS:各类 speaker-embedding + 少样本适配方法是它的直接对手,区别在"1–3 秒 + 零微调 + 元学习"。
  • 风格注入思想邻居:SALN 与图像里的 AdaIN(自适应实例归一化,风格迁移常用)思想相通——都是"用风格信号去调制归一化的缩放/偏移"。
  • 后续潮流:后来大规模的 zero-shot TTS(如基于神经音频 codec 的 VALL-E 等)把"一句话克隆"推到更强,但 Meta-StyleSpeech 是这条路上较早把"短参考 + 零微调 + 元学习"讲清楚的代表。

所以这一节是想说:它上承非自回归 TTS,借鉴了图像风格迁移的 AdaIN 思想,下启后来更大规模的 zero-shot 语音克隆。


和本导读的关系

本笔记对应导读 Ch20: 听觉智能。Ch20 覆盖从语音识别(Whisper)、语音编码(SoundStream/EnCodec)到语音/音乐生成(AudioLM、MusicLM)的听觉栈。Meta-StyleSpeech 在这条线里代表"个性化语音合成"这一支——它展示了"如何用一个风格向量 + 归一化调制"把身份信息注入生成过程,这种"风格注入"的思想在后面的音频、图像生成里反复出现。读完本篇再看同章的 musiclm(把生成建成 token 语言模型)、encodec(音频离散化),能拼出"听觉生成"的多种技术路线。

所以这一节是想说:把 Meta-StyleSpeech 放进 Ch20 的听觉生成语境里,你能看清"风格注入"这条通用思路。


思考题

Q1:SALN 只改了层归一化的 gain 和 bias,为什么这么小的改动就能注入"整个人的声线"?

提示

归一化层在网络里到处都是,每一层的缩放/偏移被风格向量控制,累加起来就能大范围地改变特征分布。想想"很多小旋钮一起拧"的效果。

Q2:为什么对"新说话人"泛化需要 episodic 训练,而不能只靠更多说话人的普通训练?

提示

普通训练容易让模型记住训练里的说话人。episodic 训练每次模拟"新人+一句"的考试,逼它学"如何适配"而非"记住谁"。

Q3:两个判别器分别盯什么?如果只用一个"整体真假"判别器会怎样?

提示

一个盯质量/真假,一个盯"是不是这个人的风格"。只有前者,合成语音可能很自然但不像目标说话人。

Q4:SALN 和图像里的 AdaIN 有什么共同点?这种"归一化即风格控制"为什么这么好用?

提示

都用风格信号去替换归一化的仿射参数。它把"内容"和"风格"解耦:归一化去掉个体差异,仿射参数再注入风格。

Q5:参考音频只有 1 秒和有 10 秒相比,风格向量的可靠性会差多少?极限在哪?

提示

太短可能采不到这个人完整的音色特征(比如没出现某些音)。想想"信息量"和"估计方差"的权衡。

Q6:一句话就能克隆声音,会带来哪些滥用风险?技术上能加什么防护?

提示

诈骗、伪造发言。可考虑水印、合成检测、使用授权/同意机制。想想"能力"和"可控"要一起设计。

Q7:如果要让它复现"情感"(如生气、哭腔)而不只是音色,你会怎么改风格向量或训练目标?

提示

音色和情感是两种不同的风格维度。可以把风格向量拆成"身份 + 情感"两部分,或引入情感标注/参考做条件。想想解耦的思路。


一些好奇心问答(FAQ)

Q:它和后来的 VALL-E 那种"一句话克隆"有什么区别?

Meta-StyleSpeech 走的是"mel 频谱 + SALN 风格注入 + 元学习"的路线;VALL-E 走的是"神经音频 codec token + 语言模型"的路线。后者规模更大、更强,但 Meta-StyleSpeech 更早、更轻,把"短参考 + 零微调"讲清楚了。

Q:我需要多少数据才能训练它?

需要一个多说话人语音语料(很多人、每人若干句)来做 episodic 训练。训练完之后,对新说话人只要 1–3 秒即可,无需其数据再训练。

Q:为什么非自回归骨干(FastSpeech 式)比自回归(Tacotron 式)更适合这里?

非自回归合成快、稳定、不易出现漏字重复,也更容易把 SALN 插进每一层做风格注入。

Q:SALN 会不会让训练变得不稳定?

对抗训练(判别器)本身就比较难调,但 SALN 只是把归一化的仿射参数变成可控的,主要风险在 GAN 部分而非 SALN。

所以这一节是想说:它是"轻量早期版"的一句话克隆,路线不同于后来的 codec-LM 系,但思想相通。


如果你想再深入

  1. 骨干:FastSpeech2 — 理解非自回归 TTS 的时长/音高预测机制。
  2. 风格迁移邻居:AdaIN(图像) — 看"归一化即风格控制"在图像里的原型。
  3. 对抗训练:GAN 基础 — 理解判别器/生成器博弈。
  4. 后续:VALL-E / 神经 codec TTS — 看"一句话克隆"如何被规模化推进。
  5. 元学习基础:MAML / episodic training — 理解"学会快速适配"的训练范式。

所以这一节是想说:把 FastSpeech2 → Meta-StyleSpeech → codec-LM 系 TTS 串起来,能看清个性化语音合成的演进。


原文信息

  • 标题:Meta-StyleSpeech: Multi-Speaker Adaptive Text-to-Speech Generation
  • 作者:Dongchan Min, Dong Bok Lee, Eunho Yang, Sung Ju Hwang
  • 会议:ICML 2021
  • arXiv:https://arxiv.org/abs/2106.03153
@inproceedings{min2021metastylespeech,
  title     = {Meta-StyleSpeech: Multi-Speaker Adaptive Text-to-Speech Generation},
  author    = {Min, Dongchan and Lee, Dong Bok and Yang, Eunho and Hwang, Sung Ju},
  booktitle = {International Conference on Machine Learning (ICML)},
  year      = {2021},
  url       = {https://arxiv.org/abs/2106.03153}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_meta_stylespeech_2026,
  title       = {(readable note) Meta-StyleSpeech},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2021 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/meta-stylespeech/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?