SeamlessM4T
这是一份写给"完全没接触过 AI"的读者看的精读笔记。缩写第一次出现一定展开 + 类比,公式翻译成人话。
一句话讲什么(TL;DR)
一个模型搞定近 100 种语言的"听懂、翻译、说出来",把以前需要三四个 App 接力才能完成的跨语言沟通,塞进一张端到端的网络里。
它一口气会做五件事,名字像缩写,其实只是"输入 → 输出"的简写:
- ASR(语音识别):语音 → 同语言文字
- S2TT(语音转文本翻译):语音 → 另一种语言的文字
- S2ST(语音转语音翻译):语音 → 另一种语言的语音
- T2TT(文本翻译):文字 → 另一种语言文字
- T2ST(文本转语音翻译):文字 → 另一种语言的语音
所以这一节是想说:SeamlessM4T 是"一个大脑同时管耳朵、嘴巴和翻译"的多语种多任务统一模型。
这是个什么场景
设想你在曼谷转机,旁边一位泰国老奶奶想问你洗手间在哪,但你一句泰语都不会。用手机的老办法得这样接力:
- 先打开"语音识别 App",把奶奶的泰语转成泰文文字。
- 再切到"翻译 App",把泰文翻成中文。
- 想回话还得开"语音合成 App",把你打的中文读成泰语。
三个 App 一条流水线(pipeline),每一段都可能出错,而且错误会叠加——第一步漏听一个词,第二步翻偏意思,第三步念出来已经驴唇不对马嘴。像传话游戏,传到最后全变味。
SeamlessM4T 想做的是一只全能翻译耳机:奶奶说泰语它直接听懂,你想看文字它给文字、想听语音它直接说出来,中间不再拆成"先转文字、再翻译、再合成"三段。
端到端(end-to-end):从原始输入直接算到最终输出,中间不拆成独立训练的多个模块。好处是没有模块之间的误差叠加,坏处是需要"输入-输出直连"的成对数据,而这种数据往往稀缺。
所以这一节是想说:SeamlessM4T 要取代的是"多个专用 App 串成流水线"这种既笨重又爱出错的跨语言方案。

之前的人怎么做的,为什么不够好
- Cascade 流水线(ASR → MT → TTS 三段独立):错误叠加是老问题,ASR 听错一个词,后面全跟着错。
- 每对语言一个模型:英→中、英→法、中→法……近 100 种语言两两组合接近 1 万种,工程上不可能维护。
- 多语种文本翻译(如 Meta 的 NLLB-200):把文本翻译做到一个模型 200 语,但只管文字,语音是另一套。
- 直接语音翻语音(如 Translatotron):尝试语音直翻语音,但语种少、质量不如 cascade。
- Whisper(OpenAI, 2022):99 语的 ASR + S2TT 一个模型,很强,但不输出语音,也不做 T2ST/S2ST。
总困境:模态(语音/文字)× 任务方向(→文字/→语音)× 语言数量这三个维度,此前无法同时拉满。
所以这一节是想说:以前要么误差叠加、要么模型爆炸、要么只覆盖部分模态和方向,没人把"多语种 + 多模态 + 多方向"一锅端。
这篇论文的新想法
核心一句话:用一个共享的多任务 UnitY 框架,把 ASR、S2TT、T2TT、T2ST、S2ST 全部映射到统一的中间表示,再分头解码。
像一个会很多语言的同传翻译——不管你写在纸上递过去还是张嘴说,他脑子里先理解成"意思本身",再决定用打字还是说话回答你。
三个关键设计:
- 共享语义空间:不管输入是语音还是文字,先编码到同一个语义向量空间。等于把不同语言的便条都先翻成一种"内部速记",100 种语言的语音和文字都能在这套速记里对齐。
- 离散语音单元(speech units):语音翻译不直接预测波形(声音的连续震动曲线),而是先预测"语音版 token"——一串离散编号(类似 HuBERT 学出来的聚类 ID),再用声码器(vocoder)把编号串还原成可听的声音。这样语音任务就能像文本一样用 Transformer 训练。
- 两阶段解码(UnitY 架构):先解码出文本表示,再从文本表示解码出语音单元。等于在心里"先想清楚要说什么、再考虑怎么发音",跟人先打腹稿一个道理。
等等,先慢一拍——"离散语音单元"是啥?你可以想成把连续的语音流切成上千个"音素积木块",每块给一个编号。模型只要预测编号串,比直接预测原始声波容易得多,因为把"生成连续信号"降级成了"生成一串符号"。
所以这一节是想说:SeamlessM4T 的新意是"先把一切统一成语义,再两阶段解码——先出文本、再出语音单元",让一个网络能覆盖所有任务组合。
它分几步做的(方法)
这一节是全篇核心,拆成"数据、骨干、多任务训练、公平性"四块。
整体数据流的 ASCII 示意:
语音 ──► w2v-BERT 2.0 编码器 ┐
├─► 共享语义空间 ─► Transformer ─► (阶段1) 目标语言文本
文本 ──► 文本编码器 ─────────┘ └─► (阶段2) 语音单元 ─► HiFi-GAN 声码器 ─► 语音
第 1 步:数据——SeamlessAlign(最被低估的贡献)
输入:需要海量"语音-语音 / 语音-文本"的平行数据,覆盖近百种语言。这种数据现实中极其稀缺。
处理:他们用一套自动挖掘流程(基于 SONAR 多模态句子 embedding + 名为 stopes 的挖矿工具),从公开音频和文本里自动对齐出约 47 万小时的平行数据,覆盖 100+ 语言。原理是:把不同语言、不同模态的句子都编码到同一个 embedding 空间,谁离谁近就认作"意思相同的一对"。
输出:一个前所未有规模的多语种、多模态平行语料库。
SONAR:Meta 的多语种、多模态句子 embedding,能把不同语言的语音和文本都映射到同一空间,用来大规模挖掘"意思相同"的成对样本。
第 2 步:骨干——UnitY 架构
输入:语音或文本。
处理:
- 输入端两套编码器:w2v-BERT 2.0(Meta 的语音自监督编码器,wav2vec 2.0 的升级版)编码语音,文本编码器编码文本,两者输出投影到同一语义空间。
- 中间是共享的 Transformer encoder-decoder。
- 输出端两阶段:第一阶段解码目标语言的文本 token(这一步本质就是在做翻译);第二阶段以文本为条件解码语音单元。
- 最后用一个多语种 HiFi-GAN 声码器把语音单元转成可听波形。
输出:按任务需求,产出文本、语音,或两者都要。
等等,先慢一拍——为什么要"先出文本再出语音"?
因为直接从"源语音"跳到"目标语音"跨度太大,中间隔着"翻译 + 发音"两件难事。UnitY 把它拆成两步:先把"意思"落成目标语言的文字(解决翻译),再把文字铺成发音单元(解决发音)。每一步都变简单,而且第一阶段的文本还能顺便当成 S2TT 的输出,一举两得。
第 3 步:多任务联合训练
输入:同一个训练 batch 里混合 ASR、S2TT、T2TT、S2ST、T2ST 五种样本。
处理:用任务标签区分不同任务,让一个模型同时学多个能力。关键收益是任务间迁移——资源丰富的文本翻译(T2TT)数据能帮助低资源语言的语音翻译(S2TT),因为它们共享同一个语义空间。
输出:一个五项全能、且低资源语言也不至于太差的模型。
第 4 步:毒性与性别偏差缓解
输入:端到端模型的输出可能携带训练数据里的偏见和毒性。
处理:在评测里专门加入 ETOX、MuTox 这类毒性检测指标,并对"添加女性/男性词形"的翻译做公平性分析,尽量抑制"加毒"(added toxicity,翻译里凭空冒出源文没有的脏话/冒犯词)。
输出:一份带公平性与安全性评估的负责任发布。具体数字需查原文。
所以这一节是想说:SeamlessM4T 的方法 = 自动挖 47 万小时平行数据 + UnitY 两阶段解码骨干 + 五任务联合训练 + 公平性评估,四件事缺一不可。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【SeamlessM4T · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
下表整理论文的关键设定与定性结论。具体 BLEU/WER 数值请查原文的大表,此处不编造。
| 维度 | 数值/说明 |
|---|---|
| 支持语言 | 近 100 种(不同任务覆盖数略有差异) |
| 自动挖掘平行数据 | SeamlessAlign 约 47 万小时 |
| 语音编码器 | w2v-BERT 2.0 |
| 声码器 | 多语种 HiFi-GAN |
| 语音输出方式 | 离散语音单元(非直接波形) |
| 主评测集 | FLEURS、CoVoST 2 等 |
| ASR 表现 | 与 Whisper 相当或更强,同时多出语音输出能力 |
| S2ST 里程碑 | direct(端到端)首次在大规模多语种上接近甚至超过 cascade |
关键定性结论:direct S2ST 第一次在大规模、多语种场景上追平乃至超过 cascade 流水线,这是历史性的一步——它证明"端到端语音翻语音"不再只是小规模的玩具。
所以这一节是想说:数字告诉我们,端到端多任务这条路在大规模多语种上真的走通了,不再逊于串流水线的老办法。
实验结果说明了什么
- ASR:在 FLEURS(100 语种语音基准)上与 Whisper 相当或更强,同时它还能输出语音,功能更全。
- S2TT:在 FLEURS、CoVoST 2 上对比 cascade 和 Whisper,证明 direct 能追平甚至超过 cascade。
- S2ST:用 ASR-BLEU(把生成的语音再转回文字和参考翻译比 BLEU)等指标,对比 Translatotron 2 和 cascade,证明 direct 大规模可用。
- T2TT 不退化:多模态联合训练后,纯文本翻译没有明显变笨——这是"加了新能力不掉旧能力"的关键测试。
- 鲁棒性与公平性:噪声、口音、语速扰动测试 + 性别偏差 + 毒性输出比例。
所以这一节是想说:实验共同证明了一个模型可以同时把多种模态、多种方向、近百种语言做到接近或超过各自专用系统的水平。
你应该懂的几个新词
- ASR / S2TT / S2ST / T2TT / T2ST:见 TL;DR,前一个字母是输入模态、后一个是输出模态。
- Cascade vs Direct:cascade 是"ASR → 翻译 → TTS"的流水线;direct 是端到端一步到位。direct 没有误差叠加,但缺数据。
- 语音单元(speech units):把连续语音量化成一串离散编号,让语音能像文本一样被 Transformer 处理。
- 声码器(vocoder):把声学特征/单元序列还原成可听波形的网络,这里用 HiFi-GAN。
- w2v-BERT 2.0:Meta 的语音自监督预训练编码器。
- SONAR / stopes:多模态句子 embedding + 挖矿工具,用来大规模自动对齐平行数据。
- ASR-BLEU:评估语音翻译输出的代理指标——把生成语音转回文字再比 BLEU。
所以这一节是想说:这几个词是理解"多语种语音翻译"这条线的钥匙,看后续 Seamless 系列都会用到。
它有什么搞不定的
- 低资源语言仍偏弱:虽然靠任务迁移拉了一把,但数据极少的语言质量和高资源语言差距明显。
- 语音单元有信息损失:把语音离散化会丢掉一部分音色、语调、情感细节——这正是后续 SeamlessExpressive 要补的。
- 非流式:M4T 是"整句进整句出",做不到边说边译的同传——这要等 SeamlessStreaming。
- 偏见与毒性无法根除:只能缓解,端到端模型仍可能继承并放大训练数据里的偏见。
- 计算与数据成本高:47 万小时数据挖掘 + 大模型训练不是普通团队能复现的规模。
所以这一节是想说:SeamlessM4T 是地基性工作,但在低资源、表现力、流式、公平性上都留了明确的后续空间。
它和别的几篇是什么关系
- NLLB-200(Meta, 2022):先驱多语种文本翻译,SeamlessM4T 把它扩展到语音模态。
- Whisper(OpenAI, 2022):强 ASR/S2TT 基线,但不输出语音;SeamlessM4T 直接对标它并补齐语音生成。
- Translatotron / Translatotron 2(Google):早期 direct S2ST,语种少质量差;SeamlessM4T 把这条线推到实用规模。
- AudioPaLM(Google, 2023):同期用 LLM 框架统一语音文本任务,思路相近但侧重不同。
- 后续 Seamless 系列:SeamlessExpressive(保留语调情感)、SeamlessStreaming(流式同传),M4T 是它们的地基。
- 和具身 AI 的关系:作为听觉(auditory)frontier 模型,未来能听会说、跨语种交互的机器人绕不开这类能力栈。
所以这一节是想说:SeamlessM4T 是"多语种翻译从纯文本走向语音、从流水线走向端到端"的集大成节点。
和本导读的关系
本篇对应导读 Ch20: 听觉智能。Ch20 把听觉系统拆成"感知—理解—生成"几个环节,SeamlessM4T 正好横跨"理解(听懂、翻译)"和"生成(说出来)"两端,是听觉智能里最接近"完整交互闭环"的一个大模型样本。读完本篇,再看同章的语音分离、声音生成工作,你能拼出"机器怎么听、怎么懂、怎么说"的全貌。
所以这一节是想说:把 SeamlessM4T 放进 Ch20 的听觉闭环里读,它是"懂 + 说"这半边的代表作。
思考题
Q1:为什么 direct(端到端)S2ST 长期打不过 cascade 流水线?SeamlessM4T 靠什么翻盘?
提示
direct 需要"源语音-目标语音"的成对数据,这种数据极稀缺。cascade 可以分别用大量 ASR、翻译、TTS 数据。SeamlessM4T 靠 SeamlessAlign 自动挖出 47 万小时平行数据 + 多任务迁移,补上了数据这块短板。
Q2:UnitY 为什么要"先解码文本再解码语音单元",而不直接从源语音生成目标语音?
提示
直接跨越"翻译 + 发音"两件难事跨度太大。拆成两步各自变简单,而且中间的文本还能复用为 S2TT 的输出。
Q3:把语音离散化成"语音单元"带来了什么好处,又牺牲了什么?
提示
好处:语音能像文本一样被 Transformer 建模,训练和生成都简化。牺牲:量化会丢音色、语调、情感等连续细节——这是 SeamlessExpressive 要补的坑。
Q4:多任务联合训练里,为什么资源丰富的文本翻译(T2TT)能帮到低资源语言的语音翻译(S2TT)?
提示
它们共享同一个语义空间和部分参数。文本翻译学到的"意思对齐"能力可以迁移到语音翻译,尤其在语音数据稀缺的语言上受益最大。
Q5:如果要把 SeamlessM4T 改造成能"边说边译"的同传系统,最大的技术障碍是什么?
提示
M4T 是整句进整句出,要流式就得在"信息还没说完"时就开始输出,涉及"何时可以安全地开口"的策略(读写平衡)。这正是 SeamlessStreaming 处理的问题。
Q6:为什么端到端翻译模型会出现"added toxicity"(凭空冒出源文没有的脏话)?怎么缓解?
提示
模型从海量噪声网络数据里学到了不该有的关联,在不确定时可能"脑补"出毒性词。缓解手段包括毒性检测过滤(ETOX/MuTox)、训练数据清洗、输出端约束。无法根除,只能压低。
所以这一节是想说:这几个问题带你把"端到端 vs 流水线、语义统一、离散化、任务迁移、流式、安全"这些核心议题自己推一遍。
一些好奇心问答(FAQ)
Q1:SeamlessM4T 开源吗?我能用吗?
Meta 以研究许可发布了模型和代码(seamless_communication 仓库),可用于研究。它有 medium 和 large 两档规模,medium 对个人更友好。
Q2:它和 Whisper 到底谁强?
不同定位。Whisper 专注 ASR/S2TT,非常强且成熟。SeamlessM4T 在 ASR 上与其相当,但多出 S2ST/T2ST 的语音输出能力,功能面更广。要"只做识别"可能 Whisper 更省;要"能听会说"就得 SeamlessM4T。
Q3:为什么支持的语言数各任务不一样?
不同任务依赖不同数据。文本翻译的语料最多、覆盖语言最广;语音输出因为要语音数据 + 声码器,覆盖会窄一些。这是数据可得性决定的。
Q4:它能保留说话人的音色/情感吗?
M4T 基本不保留——输出是"标准嗓音"。要保留语调、节奏、情感,得用后续的 SeamlessExpressive。
Q5:47 万小时数据是人工标的吗?
不是。核心是自动挖掘(SeamlessAlign + SONAR embedding + stopes),靠"意思相近就配对"的思路从公开数据里挖,再辅以已有的标注语料。这正是它工程上最聪明的地方。
Q6:读完 SeamlessM4T 接下来看什么?
想看"保留情感/表现力"看 SeamlessExpressive;想看"实时同传"看 SeamlessStreaming;想看"用 LLM 统一语音文本"看 AudioPaLM。
所以这一节是想说:能不能用、和 Whisper 怎么选、数据哪来的、后续看什么,这些实际问题都有清楚答案。
如果你想再深入
按"前置 → 同期 → 后续"排序:
- 前置:NLLB-200 —— 多语种文本翻译的先驱,理解它才懂 SeamlessM4T 在文本侧站在谁肩上。
- 前置:Whisper —— 最强 ASR/S2TT 基线,是 SeamlessM4T 的主要对标对象。
- 前置:wav2vec 2.0 / HuBERT —— 语音自监督表征与离散单元的来源。
- 后续:SeamlessExpressive / SeamlessStreaming —— 补齐表现力和流式两块短板。
- 同期:AudioPaLM —— 用 LLM 框架统一语音文本,另一条技术路线。
所以这一节是想说:把 NLLB + Whisper + SeamlessM4T + Seamless 系列连起来读,就能看懂"多语种语音翻译"这条线的完整演进。
原文信息
- 标题:SeamlessM4T: Massively Multilingual & Multimodal Machine Translation
- arXiv:https://arxiv.org/abs/2308.11596
- 发表:Meta AI(arXiv, 2023)
- 年份:2023
BibTeX:
@article{seamless2023m4t,
title = {SeamlessM4T: Massively Multilingual and Multimodal Machine Translation},
author = {{Seamless Communication Team}},
journal = {arXiv preprint arXiv:2308.11596},
year = {2023},
url = {https://arxiv.org/abs/2308.11596}
}
所以整篇是想说:SeamlessM4T 把过去需要多个专用 App 串起来的跨语言沟通,压进一个端到端多任务模型——它证明了"一个大脑同时听懂、翻译、说出近百种语言"不再是幻想。
◼
引用本笔记 / Cite this note
@online{eai_seamless_m4t_2026,
title = {(readable note) SeamlessM4T},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2023 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/seamless-m4t/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?