Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 25

Universal Source Separation with Weakly Labelled Data

13 min read · 4511 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

给电脑一段嘈杂录音,告诉它"我只要狗叫",它就把狗叫从混音里抠出来。一个模型覆盖 527 类日常声音,而且训练只用了"贴了标签但没拆开"的脏数据。

所以这一节是想说:这篇用弱标注大数据做出了一个能按提示抠出任意一类声音的通用源分离模型。


这是个什么场景

你周末在咖啡馆给朋友拍了段 vlog,回家一看素材傻了:咖啡机嘶嘶响、隔壁桌大声八卦、店里放着背景音乐、门口铃铛叮叮当当。你只想留下朋友说话那部分,把别的全删掉——这件事就叫源分离(source separation),把一锅"声音浓汤"重新分成几碗清汤。

按老办法做,像开一家专业录音棚:先花大钱录一万段"只有咖啡机"的纯净样本、再录一万段"只有人声"的,然后人工把它们叠起来当作业喂给模型学。问题有两个:纯净样本极难收集(现实里哪有真空环境只录咖啡机),而且每多一种新声音都要重头录一轮。

这篇论文换思路——既然 YouTube 上已经有几百万段视频,每段都贴了"含狗叫/含钢琴/含警笛"的标签,那就直接用这种没拆开、只贴了标签的脏数据(AudioSet)来训。模型从没听过"纯净狗叫",但它能从大量"含狗叫的混音"里慢慢猜出狗叫长什么样,最后学会拆 527 类声音。

源分离(source separation):把一段混合音频拆成多个独立"源"(说话人、乐器、声音事件)的任务。

弱标注(weakly labelled):只给段级标签("这段里有狗叫"),不给时间戳、也不给干净的单独源样本。对应的"强标注"是带时间戳和干净轨道。

所以这一节是想说:USS 面对的是"传统源分离要干净配对数据、类别还少,扩不到日常声音长尾"这个瓶颈。


Universal Source Separation with Weakly Labelled Data — 场景示意:这论文要解决的现实问题
Plate Nº IUniversal Source Separation with Weakly Labelled Data — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 音乐源分离(MSS)专用模型:Spleeter / Demucs / Open-Unmix,只拆人声/鼓/贝斯/其他四轨,需要 MUSDB 这种成对干净轨数据。
  • 语音增强(speech enhancement):只针对"语音 vs 噪声"两类,不通用。
  • PIT(排列不变训练)类方法:能盲分离 N 个说话人,但类别不可控,且 N 固定。
  • 声音事件检测(SED)+ masking:先检测有什么类,再用类别条件做 mask,但类别数通常 < 50,且依赖强标注(带时间戳)。
  • 共同瓶颈:要么类别数有限,要么需要干净源/时间戳标注,难扩到日常声音的长尾。

所以这一节是想说:以前的源分离要么类别少、要么要干净数据/时间戳,没人能便宜地做到"527 类通用、只用弱标注"。


这篇论文的新想法

核心赌注:弱标注本身就够用了——只要数据规模够大(AudioSet 约 200 万段、527 类),可以通过两阶段间接监督让模型学会分离。

关键设计:

  1. 用一个预训练好的**声音事件检测器(SED)**给每段音频打"哪些秒含有 class X"的伪时间戳。
  2. 把含 X 的片段当作"伪干净源",与其他随机片段混合,构造 (混音, query, 目标) 的训练对。
  3. 分离网络以 class embedding(类别向量) 作为条件输入,告诉它"这次抠哪一类"——这样一个模型就能覆盖 527 类,而不是每类训一个。

通俗讲:模型从没见过"纯净狗叫",但它见过"很可能含狗叫的片段"和"几乎不含狗叫的片段",把两者混起来再让模型还原前者,狗叫的能力就涌现出来了。

所以这一节是想说:USS 的新意是"用 SED 把弱标注变成伪干净源 + 用类别向量做 query 驱动分离",让弱标注撑起 527 类通用分离。


它分几步做的(方法)

这一节是全篇核心,拆成"弱标注转伪源、构造混音训练、网络结构、推理灵活性"四块。

整体流程 ASCII 示意:

   AudioSet(弱标注) ─► SED(PANNs) 打伪时间戳 ─► 挑出"含 A 片段"当伪干净源
   伪源 A + 伪源 B ─► 相加成混音 ┐
   class A 的 embedding(query) ──┼─► ResUNet(FiLM 注入 query) ─► 抠出 A ─► 和原 A 比 loss
                                 ┘
   推理: query 可以是 527 类之一 / 一段参考音频(few-shot)

第 1 步:弱标注 → 伪强标注——让"声音助教"先批一遍作业

输入:AudioSet 的 10 秒音频 + 段级弱标签。

处理:先在 AudioSet 上训一个 SED 模型(如 PANNs),让它给每段音频输出"每一秒出现哪类声音"的概率。再用一个阈值(比如概率 > 0.5)挑出"这一秒大概率含狗叫"的短片段,当作"伪干净狗叫样本"。助教批错几道没关系,主模型对这点噪声扛得住。

输出:一堆带类别的"伪干净源"片段。

等等,先慢一拍——SED(sound event detection,声音事件检测) 是什么?就是听一段录音,告诉你"第 3 到 5 秒有狗叫、第 7 到 8 秒有钢琴"的模型。它只输出"哪一秒有什么",不负责把声音抠出来。这里只是借它圈出"哪几秒值得当训练素材"。

第 2 步:构造混音并训练分离器——把两份作业叠在一张纸上让学生只描 A 的字迹

输入:两段伪干净片段(一段含 class A,一段含 class B)。

处理:数学上直接相加得到一段混音。再把 "class A 的描述向量"(来自预训练的 audio tagging 模型的 embedding)作为 query("我要 A、不要 B"的提示牌)输给分离网络,让它从混音里还原 A。损失函数就是"还原结果和原 A 段差多远",用 L1 或 MSE 算。

输出:一个学会"按 query 抠出对应那一类"的分离器。这就是 query-based separation(提示驱动分离)

第 3 步:网络结构——频谱图上的 U-Net + FiLM 注入 query

输入:混音的频谱图 + query 向量。

处理:主干像图像分割里的 U-Net,但用在频谱图上——叫 ResUNet(频域 U-Net + 残差块),也可换成时域的 Conv-TasNet。Query 通过 FiLM(feature-wise linear modulation,按通道做缩放和平移的小调制层)一层层注入网络,相当于在每一层提醒网络"记住,要的是 A"。

输出:一张 mask(盖在频谱图上把不要的部分压掉)或直接吐出波形。

FiLM(特征线性调制):一种轻量的条件注入方式——用条件向量算出每个通道的缩放和平移系数,逐层作用到特征上。让"要抠哪一类"贯穿整个网络。

第 4 步:推理时的灵活性——527 类里挑,或塞一段参考音频

输入:用户的分离需求。

处理:给提示牌的方式很自由——可以从 527 类里直接挑一个 class embedding("给我警笛声"),也可以塞一段参考音频("我录了我家狗的叫声,把视频里类似的全抠出来"),让模型把这段音频编码成 embedding 再驱动分离。

输出:抠出对应源。后一种就是 few-shot——训练时压根没见过的新声音也能现场学着抠,这才配得上 universal(通用)这个词。

等等,先慢一拍——"弱标注 + 大数据"凭什么能替代"干净配对数据"?

传统源分离要"干净配对数据":一段纯净的狗叫 + 同一段混进背景噪声的版本,一一对应,这样才能教模型"从混音里还原干净源"。可现实中这种成对干净录音极稀缺、极贵。USS 换了个思路:AudioSet 这类数据只有"这段 10 秒里出现过狗叫"这种粗标注(弱标注,不告诉你狗叫具体在第几秒、也没有纯净版本),但它的量极大(几百万段、527 类)。USS 先用一个声音事件检测器(SED)在这些弱标注音频里挑出"这一小段大概率就是纯狗叫"的片段,当作"伪干净源";再把不同类的伪干净源相加,人工合成出"混音 + 已知成分"的配对。于是海量但粗糙的弱标注,经过 SED 这道加工,就变出了训练所需的成对样本——用数据规模的广度,弥补了标注精度的不足。这就是它能覆盖 527 类、还能泛化到没见过的声音的根本原因。

所以这一节是想说:USS 的方法 = SED 把弱标注变伪源 + 相加造混音 + ResUNet/FiLM 按 query 分离 + 灵活的 embedding/参考音频提示,四步把弱标注变成通用分离能力,核心是用大规模弱标注经 SED 加工"造出"配对数据。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Universal Source Separation with We… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Universal Source Separation with Weakly Labelled Data — 方法示意:核心 pipeline
Plate Nº IIUniversal Source Separation with Weakly Labelled Data — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体 SDR 数值请查原文,此处不编造。

维度 说明
训练数据 AudioSet 约 200 万段、527 类,弱标注
覆盖类别 527 类日常声音(比专用模型多一两个数量级)
伪源来源 SED(PANNs)打伪时间戳
query 形式 class embedding 或参考音频(few-shot)
网络 ResUNet(频域)或 Conv-TasNet(时域)+ FiLM
主指标 SDR / SI-SDR(越大越好)
通用 vs 专用 在专用基准上通常略逊专用模型 1-3 dB,但类别覆盖远超

关键结论:通用模型在专用基准上略逊专用模型 1-3 dB,但能覆盖的类别多出一两个数量级——用小幅质量损失换来了巨大的通用性,这正是"通用化"的典型代价与收益。

所以这一节是想说:数字告诉我们,弱标注 + 间接监督真能撑起 527 类通用分离,代价只是相对专用模型掉几 dB。


实验结果说明了什么

  • 主指标:SDR 和 SI-SDR(尺度不变 SDR,避免靠单纯放大幅度刷分)。
  • 对比基线:在 MUSDB18(音乐分离)、VCTK + DEMAND(语音增强)、ESC-50 / FSDKaggle(通用声音)上和各自专用 SOTA 比,看通用模型能否接近专用。
  • 零样本/少样本:用 AudioSet 之外的类(如某种特定鸟叫)当 query,验证泛化。
  • 消融:SED 质量、阈值选择、query embedding 来源、混音策略对最终 SDR 的影响。

所以这一节是想说:实验证明"弱标注大数据 + query 分离"这条路在通用性上成立,且在专用基准上代价可控。


你应该懂的几个新词

  • 源分离:把混音拆成多个独立源,源可以是说话人、乐器、声音事件。
  • 弱标注:只给段级标签,不给时间戳、不给干净源。
  • AudioSet:Google 的约 200 万段 YouTube 10 秒切片、527 类层级标签,是声音领域的"ImageNet"。
  • query-based separation:给模型一个目标提示(class id / embedding / 参考音频),模型按提示抠出对应源。
  • SED(声音事件检测):检测音频里何时出现何类声音,输出帧级类别概率。
  • PANNs:在 AudioSet 上预训练的 CNN 音频标签模型,常当通用声音特征提取器。
  • SI-SDR:尺度不变 SDR,源分离公认指标。
  • FiLM:按通道缩放平移的轻量条件注入层。

所以这一节是想说:这几个词是理解"通用音频分离 + 弱监督"这条线的通用语。


它有什么搞不定的

  • 略逊专用模型:在音乐/语音这些有干净数据的专用基准上,通常比专用 SOTA 差 1-3 dB。
  • 依赖 SED 质量:伪源来自 SED,SED 错得多,伪源就脏,分离质量受连累。
  • 同类多源难分:两只不同的狗同时叫(同一类的多个实例),按类别 query 分不开。
  • 重叠严重时崩:声音在时频上高度重叠(如两件相近乐器)时,分离质量下降。
  • 参考音频质量敏感:few-shot 用参考音频驱动时,参考音频不干净会影响效果。

所以这一节是想说:USS 的短板集中在"略逊专用、依赖 SED、同类多源难分"上——通用是有代价的。


它和别的几篇是什么关系

  • 上游基础:依赖 AudioSet(Gemmeke 2017)、PANNs(Kong 2020)的弱标注分类与特征。
  • 同代 universal 路线:与 SoundFilter、CLIPSep(用 CLIP 文本 query)思路相近,区别在 query 空间和训练数据规模。
  • 音乐分离邻居Conv-TasNet、Demucs、HTDemucs 是专攻分离的强基线,本文目标是"不专攻的前提下接近它们"。
  • 下游延伸:可当"声音版 SAM"——给一段音频和一个 prompt,输出对应 mask;自然延伸到 text-queried separation 和 multi-modal(视频 + 音频)分离。
  • 机器人/具身相关:在声学感知链路里,USS 可作前端,把环境混音先拆成"机械声/人声/物体碰撞",再交给下游策略。

所以这一节是想说:USS 是"声音领域通用化"的关键一步,是 vision 有了 SAM/CLIP 之后 audio 的对应尝试。


和本导读的关系

本篇对应导读 Ch20: 听觉智能。Ch20 把听觉系统拆成"感知—理解—生成",USS 属于"感知/前处理"这一环——它把嘈杂的现实声场按类别拆开,是听觉场景理解的地基组件。读完本篇,配合同章的 Conv-TasNet(分离网络骨架)、SeamlessM4T(语音理解),能理解"机器怎么先把声音听清楚、再听懂"这条链路。

所以这一节是想说:把 USS 放进 Ch20 的听觉栈里读,它是"把混音拆干净"这一格的通用化代表。


思考题

Q1:为什么"弱标注 + 大数据"能替代"干净配对数据"?直觉是什么?

提示

模型没见过纯净狗叫,但见过大量"含狗叫"和"不含狗叫"的片段。把两者混起来让它还原前者,狗叫的共性会在海量样本里"涌现"出来。规模大到一定程度,弱信号也能积累成强监督。

Q2:SED 在这个方法里扮演什么角色?它出错会怎样?

提示

SED 负责从弱标注里圈出"哪几秒当伪干净源"。SED 错得多,伪源就脏(把不含狗叫的当成狗叫),分离器学到的"狗叫"就跑偏。SED 质量是上游瓶颈。

Q3:为什么用 class embedding 做 query,而不是给每类训一个模型?

提示

527 类各训一个模型成本爆炸且不能扩展。用 embedding 当条件,一个模型就能覆盖所有类,还能靠参考音频扩到训练时没见过的新类(few-shot)。

Q4:为什么用 SI-SDR 而不是普通 SDR 或直接比波形?

提示

SI-SDR 尺度不变,防止模型靠"单纯放大幅度"刷分。直接比波形对相位/尺度太敏感。SI-SDR 更能反映"抠得干不干净"的本质。

Q5:如果两只不同的狗同时叫,USS 能分开吗?为什么?

提示

难。query 是按"类别"给的(狗叫),两只狗是同一类的两个实例,模型没有区分同类不同实例的信号。要分开需要更细的 query(如声纹)或不同的范式。

Q6:把 query 从 class embedding 换成"文本 prompt"(如 CLIPSep 那样),会带来什么好处?

提示

文本 query 更自由——可以描述训练类别表里没有的声音("金属刮擦声"),泛化和易用性更强。代价是需要一个把文本和音频对齐的编码器(如 CLAP)。

所以这一节是想说:这几个问题带你把"弱监督涌现、SED 依赖、query 条件化、评估指标、同类多源"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:USS 能实时跑吗?

取决于骨干和音频长度。ResUNet/Conv-TasNet 类模型可以做到接近实时或流式,但论文主要关注质量而非实时性,具体延迟看实现。

Q2:527 类是哪来的?

来自 AudioSet 的类别体系——一个覆盖日常声音的层级标签表。USS 直接复用这套类别当可分离的目标集。

Q3:我能用它抠出训练时没有的声音吗?

能(few-shot)。给一段参考音频当 query,模型把它编码成 embedding 来驱动分离,即使这类声音训练时没见过。

Q4:它比 Demucs 差多少?

在音乐分离这个 Demucs 的专长领域通常差 1-3 dB。但 USS 覆盖 527 类,Demucs 只拆四轨音乐。通用 vs 专用的取舍。

Q5:为什么叫 universal(通用)?

因为一个模型 + 灵活 query 就能分离几百类声音,甚至现场学新类,而不是"一类一模型"。

Q6:读完 USS 接下来看什么?

想看分离骨架看 Conv-TasNet;想看文本 query 路线看 CLIPSep;想看下游语音理解看 SeamlessM4T。

所以这一节是想说:能不能实时、527 类哪来的、能不能抠新声音、比 Demucs 差多少——这些实操问题都有明确答案。


如果你想再深入

按"数据/特征基础 → 分离骨架 → 同代路线"排序:

  1. 基础:AudioSet / PANNs —— 弱标注数据和音频特征的来源。
  2. 骨架:Conv-TasNet —— 源分离的经典网络。
  3. 同代:SoundFilter / CLIPSep —— 另外的 query 空间(文本)路线。
  4. 下游:SeamlessM4T —— 声音拆开后怎么理解。

所以这一节是想说:把 AudioSet + Conv-TasNet + USS + CLIPSep 连起来读,就能看懂"通用音频分离"这条线。


原文信息

  • 标题:Universal Source Separation with Weakly Labelled Data
  • arXiv:https://arxiv.org/abs/2305.07447
  • 期刊:IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)
  • 年份:2024

BibTeX:

@article{kong2024uss,
  title   = {Universal Source Separation with Weakly Labelled Data},
  author  = {Kong, Qiuqiang and Chen, Ke and Liu, Haohe and others},
  journal = {IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)},
  year    = {2024},
  url     = {https://arxiv.org/abs/2305.07447}
}

所以整篇是想说:USS 证明了不必花大钱录干净样本——用 YouTube 那种"只贴了标签的脏数据",配上 SED 造伪源 + query 驱动分离,就能训出一个能按提示抠出 527 类声音的通用分离器。

引用本笔记 / Cite this note
BibTeX
@online{eai_uss_weakly_labelled_2026,
  title       = {(readable note) Universal Source Separation with Weakly Labelled Data},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/uss-weakly-labelled/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?