Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 23

SeamlessM4T

14 min read · 4730 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。缩写第一次出现一定展开 + 类比,公式翻译成人话。

一句话讲什么(TL;DR)

一个模型搞定近 100 种语言的"听懂、翻译、说出来",把以前需要三四个 App 接力才能完成的跨语言沟通,塞进一张端到端的网络里。

它一口气会做五件事,名字像缩写,其实只是"输入 → 输出"的简写:

  • ASR(语音识别):语音 → 同语言文字
  • S2TT(语音转文本翻译):语音 → 另一种语言的文字
  • S2ST(语音转语音翻译):语音 → 另一种语言的语音
  • T2TT(文本翻译):文字 → 另一种语言文字
  • T2ST(文本转语音翻译):文字 → 另一种语言的语音

所以这一节是想说:SeamlessM4T 是"一个大脑同时管耳朵、嘴巴和翻译"的多语种多任务统一模型。


这是个什么场景

设想你在曼谷转机,旁边一位泰国老奶奶想问你洗手间在哪,但你一句泰语都不会。用手机的老办法得这样接力:

  1. 先打开"语音识别 App",把奶奶的泰语转成泰文文字。
  2. 再切到"翻译 App",把泰文翻成中文。
  3. 想回话还得开"语音合成 App",把你打的中文读成泰语。

三个 App 一条流水线(pipeline),每一段都可能出错,而且错误会叠加——第一步漏听一个词,第二步翻偏意思,第三步念出来已经驴唇不对马嘴。像传话游戏,传到最后全变味。

SeamlessM4T 想做的是一只全能翻译耳机:奶奶说泰语它直接听懂,你想看文字它给文字、想听语音它直接说出来,中间不再拆成"先转文字、再翻译、再合成"三段。

端到端(end-to-end):从原始输入直接算到最终输出,中间不拆成独立训练的多个模块。好处是没有模块之间的误差叠加,坏处是需要"输入-输出直连"的成对数据,而这种数据往往稀缺。

所以这一节是想说:SeamlessM4T 要取代的是"多个专用 App 串成流水线"这种既笨重又爱出错的跨语言方案。


SeamlessM4T — 场景示意:这论文要解决的现实问题
Plate Nº ISeamlessM4T — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Cascade 流水线(ASR → MT → TTS 三段独立):错误叠加是老问题,ASR 听错一个词,后面全跟着错。
  • 每对语言一个模型:英→中、英→法、中→法……近 100 种语言两两组合接近 1 万种,工程上不可能维护。
  • 多语种文本翻译(如 Meta 的 NLLB-200):把文本翻译做到一个模型 200 语,但只管文字,语音是另一套。
  • 直接语音翻语音(如 Translatotron):尝试语音直翻语音,但语种少、质量不如 cascade。
  • Whisper(OpenAI, 2022):99 语的 ASR + S2TT 一个模型,很强,但不输出语音,也不做 T2ST/S2ST。

总困境:模态(语音/文字)× 任务方向(→文字/→语音)× 语言数量这三个维度,此前无法同时拉满。

所以这一节是想说:以前要么误差叠加、要么模型爆炸、要么只覆盖部分模态和方向,没人把"多语种 + 多模态 + 多方向"一锅端。


这篇论文的新想法

核心一句话:用一个共享的多任务 UnitY 框架,把 ASR、S2TT、T2TT、T2ST、S2ST 全部映射到统一的中间表示,再分头解码。

像一个会很多语言的同传翻译——不管你写在纸上递过去还是张嘴说,他脑子里先理解成"意思本身",再决定用打字还是说话回答你。

三个关键设计:

  1. 共享语义空间:不管输入是语音还是文字,先编码到同一个语义向量空间。等于把不同语言的便条都先翻成一种"内部速记",100 种语言的语音和文字都能在这套速记里对齐。
  2. 离散语音单元(speech units):语音翻译不直接预测波形(声音的连续震动曲线),而是先预测"语音版 token"——一串离散编号(类似 HuBERT 学出来的聚类 ID),再用声码器(vocoder)把编号串还原成可听的声音。这样语音任务就能像文本一样用 Transformer 训练。
  3. 两阶段解码(UnitY 架构):先解码出文本表示,再从文本表示解码出语音单元。等于在心里"先想清楚要说什么、再考虑怎么发音",跟人先打腹稿一个道理。

等等,先慢一拍——"离散语音单元"是啥?你可以想成把连续的语音流切成上千个"音素积木块",每块给一个编号。模型只要预测编号串,比直接预测原始声波容易得多,因为把"生成连续信号"降级成了"生成一串符号"。

所以这一节是想说:SeamlessM4T 的新意是"先把一切统一成语义,再两阶段解码——先出文本、再出语音单元",让一个网络能覆盖所有任务组合。


它分几步做的(方法)

这一节是全篇核心,拆成"数据、骨干、多任务训练、公平性"四块。

整体数据流的 ASCII 示意:

   语音 ──► w2v-BERT 2.0 编码器 ┐
                                ├─► 共享语义空间 ─► Transformer ─► (阶段1) 目标语言文本
   文本 ──► 文本编码器 ─────────┘                              └─► (阶段2) 语音单元 ─► HiFi-GAN 声码器 ─► 语音

第 1 步:数据——SeamlessAlign(最被低估的贡献)

输入:需要海量"语音-语音 / 语音-文本"的平行数据,覆盖近百种语言。这种数据现实中极其稀缺。

处理:他们用一套自动挖掘流程(基于 SONAR 多模态句子 embedding + 名为 stopes 的挖矿工具),从公开音频和文本里自动对齐出约 47 万小时的平行数据,覆盖 100+ 语言。原理是:把不同语言、不同模态的句子都编码到同一个 embedding 空间,谁离谁近就认作"意思相同的一对"。

输出:一个前所未有规模的多语种、多模态平行语料库。

SONAR:Meta 的多语种、多模态句子 embedding,能把不同语言的语音和文本都映射到同一空间,用来大规模挖掘"意思相同"的成对样本。

第 2 步:骨干——UnitY 架构

输入:语音或文本。

处理

  • 输入端两套编码器:w2v-BERT 2.0(Meta 的语音自监督编码器,wav2vec 2.0 的升级版)编码语音,文本编码器编码文本,两者输出投影到同一语义空间。
  • 中间是共享的 Transformer encoder-decoder。
  • 输出端两阶段:第一阶段解码目标语言的文本 token(这一步本质就是在做翻译);第二阶段以文本为条件解码语音单元。
  • 最后用一个多语种 HiFi-GAN 声码器把语音单元转成可听波形。

输出:按任务需求,产出文本、语音,或两者都要。

等等,先慢一拍——为什么要"先出文本再出语音"?

因为直接从"源语音"跳到"目标语音"跨度太大,中间隔着"翻译 + 发音"两件难事。UnitY 把它拆成两步:先把"意思"落成目标语言的文字(解决翻译),再把文字铺成发音单元(解决发音)。每一步都变简单,而且第一阶段的文本还能顺便当成 S2TT 的输出,一举两得。

第 3 步:多任务联合训练

输入:同一个训练 batch 里混合 ASR、S2TT、T2TT、S2ST、T2ST 五种样本。

处理:用任务标签区分不同任务,让一个模型同时学多个能力。关键收益是任务间迁移——资源丰富的文本翻译(T2TT)数据能帮助低资源语言的语音翻译(S2TT),因为它们共享同一个语义空间。

输出:一个五项全能、且低资源语言也不至于太差的模型。

第 4 步:毒性与性别偏差缓解

输入:端到端模型的输出可能携带训练数据里的偏见和毒性。

处理:在评测里专门加入 ETOX、MuTox 这类毒性检测指标,并对"添加女性/男性词形"的翻译做公平性分析,尽量抑制"加毒"(added toxicity,翻译里凭空冒出源文没有的脏话/冒犯词)。

输出:一份带公平性与安全性评估的负责任发布。具体数字需查原文。

所以这一节是想说:SeamlessM4T 的方法 = 自动挖 47 万小时平行数据 + UnitY 两阶段解码骨干 + 五任务联合训练 + 公平性评估,四件事缺一不可。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【SeamlessM4T · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

SeamlessM4T — 方法示意:核心 pipeline
Plate Nº IISeamlessM4T — 方法示意:核心 pipeline

关键数字(What works)

下表整理论文的关键设定与定性结论。具体 BLEU/WER 数值请查原文的大表,此处不编造。

维度 数值/说明
支持语言 近 100 种(不同任务覆盖数略有差异)
自动挖掘平行数据 SeamlessAlign 约 47 万小时
语音编码器 w2v-BERT 2.0
声码器 多语种 HiFi-GAN
语音输出方式 离散语音单元(非直接波形)
主评测集 FLEURS、CoVoST 2 等
ASR 表现 与 Whisper 相当或更强,同时多出语音输出能力
S2ST 里程碑 direct(端到端)首次在大规模多语种上接近甚至超过 cascade

关键定性结论:direct S2ST 第一次在大规模、多语种场景上追平乃至超过 cascade 流水线,这是历史性的一步——它证明"端到端语音翻语音"不再只是小规模的玩具。

所以这一节是想说:数字告诉我们,端到端多任务这条路在大规模多语种上真的走通了,不再逊于串流水线的老办法。


实验结果说明了什么

  • ASR:在 FLEURS(100 语种语音基准)上与 Whisper 相当或更强,同时它还能输出语音,功能更全。
  • S2TT:在 FLEURS、CoVoST 2 上对比 cascade 和 Whisper,证明 direct 能追平甚至超过 cascade。
  • S2ST:用 ASR-BLEU(把生成的语音再转回文字和参考翻译比 BLEU)等指标,对比 Translatotron 2 和 cascade,证明 direct 大规模可用。
  • T2TT 不退化:多模态联合训练后,纯文本翻译没有明显变笨——这是"加了新能力不掉旧能力"的关键测试。
  • 鲁棒性与公平性:噪声、口音、语速扰动测试 + 性别偏差 + 毒性输出比例。

所以这一节是想说:实验共同证明了一个模型可以同时把多种模态、多种方向、近百种语言做到接近或超过各自专用系统的水平。


你应该懂的几个新词

  • ASR / S2TT / S2ST / T2TT / T2ST:见 TL;DR,前一个字母是输入模态、后一个是输出模态。
  • Cascade vs Direct:cascade 是"ASR → 翻译 → TTS"的流水线;direct 是端到端一步到位。direct 没有误差叠加,但缺数据。
  • 语音单元(speech units):把连续语音量化成一串离散编号,让语音能像文本一样被 Transformer 处理。
  • 声码器(vocoder):把声学特征/单元序列还原成可听波形的网络,这里用 HiFi-GAN。
  • w2v-BERT 2.0:Meta 的语音自监督预训练编码器。
  • SONAR / stopes:多模态句子 embedding + 挖矿工具,用来大规模自动对齐平行数据。
  • ASR-BLEU:评估语音翻译输出的代理指标——把生成语音转回文字再比 BLEU。

所以这一节是想说:这几个词是理解"多语种语音翻译"这条线的钥匙,看后续 Seamless 系列都会用到。


它有什么搞不定的

  • 低资源语言仍偏弱:虽然靠任务迁移拉了一把,但数据极少的语言质量和高资源语言差距明显。
  • 语音单元有信息损失:把语音离散化会丢掉一部分音色、语调、情感细节——这正是后续 SeamlessExpressive 要补的。
  • 非流式:M4T 是"整句进整句出",做不到边说边译的同传——这要等 SeamlessStreaming。
  • 偏见与毒性无法根除:只能缓解,端到端模型仍可能继承并放大训练数据里的偏见。
  • 计算与数据成本高:47 万小时数据挖掘 + 大模型训练不是普通团队能复现的规模。

所以这一节是想说:SeamlessM4T 是地基性工作,但在低资源、表现力、流式、公平性上都留了明确的后续空间。


它和别的几篇是什么关系

  • NLLB-200(Meta, 2022):先驱多语种文本翻译,SeamlessM4T 把它扩展到语音模态。
  • Whisper(OpenAI, 2022):强 ASR/S2TT 基线,但不输出语音;SeamlessM4T 直接对标它并补齐语音生成。
  • Translatotron / Translatotron 2(Google):早期 direct S2ST,语种少质量差;SeamlessM4T 把这条线推到实用规模。
  • AudioPaLM(Google, 2023):同期用 LLM 框架统一语音文本任务,思路相近但侧重不同。
  • 后续 Seamless 系列:SeamlessExpressive(保留语调情感)、SeamlessStreaming(流式同传),M4T 是它们的地基。
  • 和具身 AI 的关系:作为听觉(auditory)frontier 模型,未来能听会说、跨语种交互的机器人绕不开这类能力栈。

所以这一节是想说:SeamlessM4T 是"多语种翻译从纯文本走向语音、从流水线走向端到端"的集大成节点。


和本导读的关系

本篇对应导读 Ch20: 听觉智能。Ch20 把听觉系统拆成"感知—理解—生成"几个环节,SeamlessM4T 正好横跨"理解(听懂、翻译)"和"生成(说出来)"两端,是听觉智能里最接近"完整交互闭环"的一个大模型样本。读完本篇,再看同章的语音分离、声音生成工作,你能拼出"机器怎么听、怎么懂、怎么说"的全貌。

所以这一节是想说:把 SeamlessM4T 放进 Ch20 的听觉闭环里读,它是"懂 + 说"这半边的代表作。


思考题

Q1:为什么 direct(端到端)S2ST 长期打不过 cascade 流水线?SeamlessM4T 靠什么翻盘?

提示

direct 需要"源语音-目标语音"的成对数据,这种数据极稀缺。cascade 可以分别用大量 ASR、翻译、TTS 数据。SeamlessM4T 靠 SeamlessAlign 自动挖出 47 万小时平行数据 + 多任务迁移,补上了数据这块短板。

Q2:UnitY 为什么要"先解码文本再解码语音单元",而不直接从源语音生成目标语音?

提示

直接跨越"翻译 + 发音"两件难事跨度太大。拆成两步各自变简单,而且中间的文本还能复用为 S2TT 的输出。

Q3:把语音离散化成"语音单元"带来了什么好处,又牺牲了什么?

提示

好处:语音能像文本一样被 Transformer 建模,训练和生成都简化。牺牲:量化会丢音色、语调、情感等连续细节——这是 SeamlessExpressive 要补的坑。

Q4:多任务联合训练里,为什么资源丰富的文本翻译(T2TT)能帮到低资源语言的语音翻译(S2TT)?

提示

它们共享同一个语义空间和部分参数。文本翻译学到的"意思对齐"能力可以迁移到语音翻译,尤其在语音数据稀缺的语言上受益最大。

Q5:如果要把 SeamlessM4T 改造成能"边说边译"的同传系统,最大的技术障碍是什么?

提示

M4T 是整句进整句出,要流式就得在"信息还没说完"时就开始输出,涉及"何时可以安全地开口"的策略(读写平衡)。这正是 SeamlessStreaming 处理的问题。

Q6:为什么端到端翻译模型会出现"added toxicity"(凭空冒出源文没有的脏话)?怎么缓解?

提示

模型从海量噪声网络数据里学到了不该有的关联,在不确定时可能"脑补"出毒性词。缓解手段包括毒性检测过滤(ETOX/MuTox)、训练数据清洗、输出端约束。无法根除,只能压低。

所以这一节是想说:这几个问题带你把"端到端 vs 流水线、语义统一、离散化、任务迁移、流式、安全"这些核心议题自己推一遍。


一些好奇心问答(FAQ)

Q1:SeamlessM4T 开源吗?我能用吗?

Meta 以研究许可发布了模型和代码(seamless_communication 仓库),可用于研究。它有 medium 和 large 两档规模,medium 对个人更友好。

Q2:它和 Whisper 到底谁强?

不同定位。Whisper 专注 ASR/S2TT,非常强且成熟。SeamlessM4T 在 ASR 上与其相当,但多出 S2ST/T2ST 的语音输出能力,功能面更广。要"只做识别"可能 Whisper 更省;要"能听会说"就得 SeamlessM4T。

Q3:为什么支持的语言数各任务不一样?

不同任务依赖不同数据。文本翻译的语料最多、覆盖语言最广;语音输出因为要语音数据 + 声码器,覆盖会窄一些。这是数据可得性决定的。

Q4:它能保留说话人的音色/情感吗?

M4T 基本不保留——输出是"标准嗓音"。要保留语调、节奏、情感,得用后续的 SeamlessExpressive。

Q5:47 万小时数据是人工标的吗?

不是。核心是自动挖掘(SeamlessAlign + SONAR embedding + stopes),靠"意思相近就配对"的思路从公开数据里挖,再辅以已有的标注语料。这正是它工程上最聪明的地方。

Q6:读完 SeamlessM4T 接下来看什么?

想看"保留情感/表现力"看 SeamlessExpressive;想看"实时同传"看 SeamlessStreaming;想看"用 LLM 统一语音文本"看 AudioPaLM。

所以这一节是想说:能不能用、和 Whisper 怎么选、数据哪来的、后续看什么,这些实际问题都有清楚答案。


如果你想再深入

按"前置 → 同期 → 后续"排序:

  1. 前置:NLLB-200 —— 多语种文本翻译的先驱,理解它才懂 SeamlessM4T 在文本侧站在谁肩上。
  2. 前置:Whisper —— 最强 ASR/S2TT 基线,是 SeamlessM4T 的主要对标对象。
  3. 前置:wav2vec 2.0 / HuBERT —— 语音自监督表征与离散单元的来源。
  4. 后续:SeamlessExpressive / SeamlessStreaming —— 补齐表现力和流式两块短板。
  5. 同期:AudioPaLM —— 用 LLM 框架统一语音文本,另一条技术路线。

所以这一节是想说:把 NLLB + Whisper + SeamlessM4T + Seamless 系列连起来读,就能看懂"多语种语音翻译"这条线的完整演进。


原文信息

  • 标题:SeamlessM4T: Massively Multilingual & Multimodal Machine Translation
  • arXiv:https://arxiv.org/abs/2308.11596
  • 发表:Meta AI(arXiv, 2023)
  • 年份:2023

BibTeX:

@article{seamless2023m4t,
  title   = {SeamlessM4T: Massively Multilingual and Multimodal Machine Translation},
  author  = {{Seamless Communication Team}},
  journal = {arXiv preprint arXiv:2308.11596},
  year    = {2023},
  url     = {https://arxiv.org/abs/2308.11596}
}

所以整篇是想说:SeamlessM4T 把过去需要多个专用 App 串起来的跨语言沟通,压进一个端到端多任务模型——它证明了"一个大脑同时听懂、翻译、说出近百种语言"不再是幻想。

引用本笔记 / Cite this note
BibTeX
@online{eai_seamless_m4t_2026,
  title       = {(readable note) SeamlessM4T},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/seamless-m4t/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?