Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 18

Dual-path RNN

25 min read · 8890 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI、也没学过信号处理"的读者看的精读笔记。所有公式都翻成人话,类比都来自日常生活。数字全部来自原文,没有的地方会写明"原文未报告"。

   混音波形(32000 个采样点,超长)
        │  Encoder(可学习的 1D 卷积,替代 STFT)
        ▼
   特征序列 N×L
        │  Segmentation:切成 S 个块,每块长 K
        ▼
   3D 张量 (N, K, S)
        │  ┌─────────────── DPRNN block × 6 ───────────────┐
        │  │  Intra-chunk RNN(块内,沿 K,双向 BLSTM)      │
        │  │        ↕ 交替                                  │
        │  │  Inter-chunk RNN(块间,沿 S,双向 BLSTM)      │
        │  └────────────────────────────────────────────────┘
        ▼
   预测每个说话人的 mask
        │  Overlap-Add + Decoder(反卷积)
        ▼
   分离出的每个人的干净波形

1. 一句话讲什么(TL;DR)

DPRNN 把超长录音切成小块,让 RNN 先在"块内"跑一遍、再在"块间"跑一遍,两路交替叠六层,就能把两个人同时说话的混音拆成各自干净的声音——而且模型只有 2.6M 参数,比当时的最强系统小 20 倍,性能却创了新纪录。

更具体一点:时域语音分离要处理几万个采样点的超长序列,普通 RNN 训不动、TCN(空洞卷积)感受野又受限。DPRNN 的招数是把长度 L 的序列切成 S 个长度 K 的块,组成一个 3D 张量 (N, K, S),然后交替做两件事——块内 RNN(沿 K 方向,处理局部细节)和块间 RNN(沿 S 方向,处理全局依赖)。当 K≈S 时,每个 RNN 只需处理 √L 量级的短序列,优化难度骤降。把它塞进 TasNet 框架替换掉原来的 TCN,在标准 benchmark WSJ0-2mix 上做到 18.8 dB SI-SNRi 的新 SOTA。

所以这一节是想说:这篇论文用"分块 + 块内/块间两路 RNN 交替"这个极简架构,破解了"RNN 处理超长序列训不动"的老大难,用一个小 20 倍的模型刷新了语音分离纪录。


2. 这是个什么场景

你跟朋友在吵闹的火锅店聊天,邻桌两个人也在大声讲话,还有背景音乐。手机放桌上录了 4 秒,回家想把"朋友的声音""邻桌甲的声音""邻桌乙的声音"分别洗成几条干净的轨道——这就是语音分离(speech separation)。人耳能轻松"挑一个声音听",机器却搞了几十年都不灵,这个难题学术上叫鸡尾酒会问题(cocktail party problem)

吃力在哪?关键是序列太长。原文点破了时域方法的死穴:时域分离系统输入的是波形采样点,一段几秒的录音就有几万个时间步(8kHz 采样率下 4 秒 = 32000 点)。这就好比让你读一本 32000 个字的小说然后复述每个细节:

  • 普通 RNN 像记性不好的人,从第一页读到最后就忘了开头——原文说得很直白:RNN 因为"优化困难(optimization difficulties)"没法有效建模这么长的序列(梯度消失/爆炸,训不动)。
  • 1D 卷积(TCN/Conv-TasNet) 想用固定大小的"尺子"去量,但原文指出:当卷积的感受野小于序列长度时,它根本利用不上句子级别的全局依赖。
  • 聪明的读法是先一段一段精读(块内),再翻回去串章节脉络(块间),两件事交替做。

DPRNN 干的就是把这种"分块读 + 反复串"的阅读策略,变成一个神经网络架构。

落到具体产品上,语音分离的最终归宿是:助听器(爷爷在饭店听不清孙女讲话)、电话会议(两人抢话变一坨)、语音助手前置(先去掉背景人声,Siri 才能听清指令)。这些场景对模型大小和延迟都很挑剔——所以"小 20 倍还更准"这件事不只是好看,是真能落地。

所以这一节是想说:语音分离的核心难点是"如何用循环结构处理几万步的超长序列还不训崩",而它的落地场景(助听器、会议、语音助手)对模型的小巧和性能都很苛刻。


Dual-path RNN — 场景示意:这论文要解决的现实问题
Plate Nº IDual-path RNN — 场景示意:这论文要解决的现实问题

3. 之前的人怎么做的,为什么不够好

原文把时域方法分成两类:自适应前端(adaptive front-end)直接回归(direct regression),它们都绕不开"超长序列建模"这个共同难题。

  • 传统频域方法(STFT + 掩码):先做短时傅立叶变换把波形变成频谱图,再在频谱上估一个 mask 乘回去。问题:STFT 强制把信号拆成幅度 + 相位,绝大多数方法只预测幅度、丢掉相位,导致即使理论最优 mask 也重建不出原声——天花板被钉死。而且窗口越小性能越好,但会让序列更长,反而更难建模。

  • TasNet(时域鼻祖,同一作者 Yi Luo):直接在波形上分离,用可学习的卷积前端替代 STFT,证明了端到端时域方法可行。但它用 LSTM 处理超长序列,效率低、训不动。

  • Conv-TasNet(2019 SOTA):把 TasNet 的 LSTM 换成堆叠的空洞卷积(TCN)。速度快、效果好,2019 年是 SOTA(15.3 dB SI-SNRi,5.1M 参数)。但感受野是固定的——原文明说 TCN 只能做"局部建模",超过感受野的依赖抓不住。

  • 直接堆 LSTM:理论上能处理全局依赖(RNN 有动态感受野),但几万步的序列会让 LSTM 梯度消失,训练崩溃。

核心痛点:RNN 有全局建模能力但训不动长序列;TCN 训得动但只有局部视野。原文要的是"鱼和熊掌兼得"——用循环结构处理几万步序列、同时保留全局建模能力。这就是 DPRNN 切入的位置。

所以这一节是想说:前人要么用 TCN(能训但视野局部),要么用 LSTM(视野全局但训不动长序列);本文的空位是"既保留 RNN 的全局建模、又让它能处理几万步的超长序列"。


4. 这篇论文的新想法

类比:一个班 320 人没法一起开会。聪明的做法是先按 100 人一组开小组讨论(组内),再让每组代表坐到一起开圆桌(组间),来回开几轮,全班信息就都串起来了。RNN 不擅长开长会,但开短会很在行——那就别让它一个人扛 32000 步,把它拆成"两班倒"。

核心想法:把长序列切成块,用两个 RNN 交替处理"块内"和"块间",每个 RNN 只面对 √L 量级的短序列。

具体怎么做:

  1. 把长度 L 的特征序列切成 S 个块,每块长度 K(K 远小于 L)。
  2. 整理成一个 3D 张量 (特征维 N, 块内位置 K, 块编号 S)
  3. 块内 RNN(intra-chunk):固定块编号,沿 K 维跑 RNN,处理块内局部依赖(一个音素的细节)。
  4. 块间 RNN(inter-chunk):固定块内位置,沿 S 维跑 RNN,处理跨块的全局依赖(说话人在整段中的连贯性)。
  5. 把 step 3 + step 4 当作一个 DPRNN block,叠 6 层(论文用 B=6),相当于"小组—圆桌"反复开 6 轮。

关键直觉与数学:原文推导得很漂亮。当块间重叠率设为 50%(hop size P = K/2)时,块数 S = 2L/K + 1。两个 RNN 的输入长度之和是 K + S = K + 2L/K + 1。要让这个和最小,K 应取 √(2L),此时 S 也≈√(2L)≈K。于是每个 RNN 的输入长度是 O(√L)(次线性),而不是原来的 O(L)(线性)。这就是它能训动超长序列的数学根源——把"读 32000 步"变成了"读两次约 180 步"。

等等,先慢一拍——为什么 RNN 能比 TCN 强? 因为块间 RNN 沿 S 维跑双向 LSTM,理论上能覆盖全部 S 个块,相当于无界感受野;而 TCN 的感受野受限于"层数 × 空洞率",超出去就抓不到。代价是 RNN 不能像 TCN 那样完全并行,但因为每次只跑 √L 长度的短序列(而非 L),并行度其实还不错。

所以这一节是想说:本文的核心创新是"分块 + 块内/块间两路 RNN 交替",把每个 RNN 的输入从 O(L) 降到 O(√L),既解决了 RNN 训不动长序列的问题,又通过块间 RNN 保住了全局建模能力。


5. 它分几步做的(方法)

DPRNN 本身是一个通用的长序列建模模块,本文把它装进 TasNet 框架做语音分离。整体是 encoder → separator → decoder 三段,DPRNN 是 separator 的核心。下面逐段拆开。

5.1 Encoder:把波形切碎、每片编码成向量(可学习的 STFT)

类比:把一卷胶卷剪成小片,每片举到光下有独特的光斑模式,给每片拍一个"光谱指纹"(一串数字)。

输入:一维混音波形(一长串 -1~1 之间的数)。

处理:一个线性的 1D 卷积层把波形切成重叠小段,每段映射成一个 N 维向量。本文滤波器数 N=64。这一步等价于"可学习的 STFT"——但它不像 STFT 那样强制拆成幅度和相位,相位信息隐式编码在向量里,重建时不会丢。

输出:一个 N×L 的特征序列(L 是帧数,仍然很长)。

为什么不用 STFT? STFT 是通用变换、不为分离优化,还丢相位。可学习的卷积前端能和后面的分离器一起端到端训练,学出专门适合分离的表示。

所以这一节是想说:Encoder 用一个可学习的卷积把波形编码成特征序列,绕开了 STFT 丢相位的天花板,是三段流水线的入口。

5.2 Segmentation:把长序列切成块,组成 3D 张量

类比:把一长条纸带按固定长度剪开,前后两段留一半重叠,然后把所有小段叠成一摞——从"一维长条"变成"三维方块"。

输入:N×L 的特征序列 W。

处理:用长度 K、跳步 P 的滑动窗口把 W 切成 S 个块,每块是 N×K。第一个和最后一个块补零(zero-pad),保证每个采样点恰好出现在 K/P 个块里。本文用 50% 重叠(P = K/2)。所有块沿新维度拼起来,形成一个 3D 张量 T ∈ R^(N×K×S)。K 按 K≈√(2L) 经验选取。

输出:3D 张量 (N, K, S)。

为什么要重叠? 因为最后要用 overlap-add 拼回去。相邻块留一半重叠,拼接处才平滑,不会出现"咔嗒"的断裂声。

所以这一节是想说:Segmentation 把一维长序列切成带重叠的块、堆成 3D 张量,是把 O(L) 问题降维成两个 O(√L) 子问题的关键第一步。

5.3 DPRNN Block:块内 + 块间两路 RNN 交替(本文灵魂)

类比:Excel 里先按行操作、再按列操作,看似每次只动一维,实则覆盖了整个二维表。

输入:3D 张量 T_b ∈ R^(N×K×S)(第一个 block 的输入是 T_1 = T)。

处理分两个子模块,串起来是一个 block,共叠 B=6 层:

块内 RNN(intra-chunk,公式 1-3):沿第二维(K,块内位置)跑。对每个块 i 独立地跑一个 RNN——本文用双向 LSTM(BLSTM),每方向 128 个隐藏单元。为什么可以双向?因为块内的未来是可以看的(离线处理)。RNN 输出后接一个全连接层把维度变回 N,再做层归一化(LayerNorm)(公式 3,原文强调这对泛化很重要),最后加一个残差连接(公式 7)T̂_b = T_b + LN(...)。块内 RNN 负责处理局部依赖,比如一个音素内部的波形细节。

块间 RNN(inter-chunk,公式 8):沿第三维(S,块编号)跑。对每个块内位置 i 独立地跑一个 BLSTM,把所有 S 个块的信息聚合起来。因为块内 RNN 是双向的,每个块内位置已经包含了整个块的信息,所以块间 RNN 能做真正的句子级(utterance-level)全局建模。同样接全连接 + LayerNorm + 残差。

两个子模块交替、叠 6 层,信息就在整个 32000 步里来回流动。

输出:和输入同形状的 3D 张量,喂给下一个 block(最后一层喂给输出投影)。

BLSTM(双向 LSTM):LSTM 从前往后跑一遍、再从后往前跑一遍,两个方向拼起来。好处是每个位置都能看到过去和未来的上下文。

残差连接 + LayerNorm:残差让梯度能跳过中间层直接回传(深网络好训),LayerNorm 让数值稳定。原文实测 LayerNorm 对模型泛化"很重要"。

为什么这步是灵魂:这就是 dual-path 的全部精髓。每层 RNN 只跑长度 K 或 S 的短序列(√L 量级),但通过反复切换块内/块间两个维度,信息能覆盖整个超长序列。块内管局部、块间管全局,交替叠加就同时拿到了两者。

所以这一节是想说:DPRNN block 用块内 RNN(管局部)和块间 RNN(管全局)交替处理 3D 张量的两个维度,每个 RNN 只面对短序列,是整篇论文最核心、也最优雅的设计。

5.4 Overlap-Add + Decoder:拼回长序列、还原波形

类比:把处理过的一摞小纸片按原来的重叠位置拼回一条长纸带,重叠区加权平均让接缝平滑;再把"加了 mask 的特征"反推回波形。

输入:最后一个 DPRNN block 的输出 3D 张量。

处理:先过 PReLU + 1D 卷积,为 C 个说话人(本文 C=2)各预测一份 mask。用 overlap-add 把 S 个块按重叠位置加权拼回长度 L 的序列。mask 逐元素乘到 encoder 输出上,得到每个说话人的特征。最后过一个 1D 反卷积(decoder)把特征还原成波形。

输出:C 个说话人各自的分离波形。

overlap-add(重叠相加):信号处理的标准拼接技巧。块之间留重叠、重叠区加权平均,避免块边界处的不连续(咔嗒声)。

所以这一节是想说:这一步把 DPRNN 处理后的块拼回长序列、用 mask 分离出每个人的特征、再反卷积还原成波形,是三段流水线的出口。

5.5 训练目标:SI-SNR + uPIT

类比:教学徒切土豆丝,怎么打分?先把两份丝缩放对齐(不管绝对粗细),再比形状有多像——这就是 SI-SNR。而"哪一路输出对应哪个人"顺序不定,就把两种顺序都算一遍取最优——这就是 uPIT。

输入:估计的分离波形 + 干净的目标波形。

处理:用 SI-SNR(尺度不变信噪比) 当损失——先把估计信号投影到真实信号方向、算"目标分量能量 / 残差能量"取 log。它对音量缩放免疫,训练更稳。配合 uPIT(句子级排列不变训练)——两个说话人有 2 种排列,枚举所有排列、取损失最小的那个当梯度方向,解决"输出 1 到底对应谁"的歧义。

训练配置:100 个 epoch,4 秒片段;初始学习率 1e-3,每两个 epoch 衰减 0.98;连续 10 个 epoch 验证集不涨就早停;Adam 优化器;梯度裁剪 L2 范数上限 5。分离用 WSJ0-2mix(8kHz)。

输出:训练好的模型权重。

所以这一节是想说:训练目标直接优化最终评测指标 SI-SNR(缩放不变、更稳),用 uPIT 解决说话人排列歧义——目标和评测完全对齐。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Dual-path RNN · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   DPRNN          ──► 2.6M                   ──► …
   DPRNN-TasNet   ──► 2.6M                   ──► …
   DPRNN          ──► 2.6M                   ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Dual-path RNN — 方法示意:核心 pipeline
Plate Nº IIDual-path RNN — 方法示意:核心 pipeline

6. 关键数字(What works)

6.1 不同分离器 / 配置对比(WSJ0-2mix,TasNet 框架)

分离器 模型大小 窗口(采样点) 块大小(帧) SI-SNRi (dB) SDRi (dB)
TCN(Conv-TasNet) 5.1M 16 15.2 15.5
DPRNN 16 100 16.0 16.2
DPRNN 8 150 17.0 17.3
DPRNN 4 200 17.9 18.1
DPRNN 2.6M 2 250 18.8 19.0

核心趋势:窗口(滤波器长度)越短,性能越高——窗口 2 采样点时 encoder 输出超过 30000 帧,这对普通 RNN/CNN 几乎不可能建模,但 DPRNN 做到了。仅把 TCN 换成 DPRNN(同窗口 16)就带来 4.6% 相对提升且模型小 49%。

6.2 与其他系统对比(WSJ0-2mix)

方法 模型大小 SI-SNRi (dB) SDRi (dB)
DPCL++ 13.6M 10.8
uPIT-BLSTM-ST 92.7M 10.0
ADANet 9.1M 10.4 10.8
WA-MISI-5 32.9M 12.6 13.1
Conv-TasNet-gLN 5.1M 15.3 15.6
Deep CASA 12.8M 17.7 18.0
FurcaNeXt(旧 SOTA) 51.4M 18.4
DPRNN-TasNet 2.6M 18.8 19.0

DPRNN-TasNet 用比旧 SOTA FurcaNeXt 小 20 倍的模型(2.6M vs 51.4M)刷新了 SI-SNRi 纪录。

6.3 噪声 + 混响条件下的分离与识别

分离器 模型大小 SI-SNRi (dB) WER (%)
TCN 5.1M 7.6 28.7
DPRNN 2.6M 8.4 25.9
无噪声混响参考 9.1

窗口设为 32 采样点、块大小 100 帧。DPRNN 在更真实的噪声混响条件下也全面超过 TCN(SI-SNRi 更高、词错误率更低),证明它不只在干净数据上有效。

生活语言解读:18.8 dB 的 SI-SNRi 意味着分离后信号比"直接拿混音当输出"提升了近 19 dB——人耳对 1 dB 的差别就能听出来,19 dB 是天壤之别。而这个成绩是用2.6M 参数(约 10MB 模型文件)拿到的,比旧 SOTA 小 20 倍。这传递了一个重要信号:WSJ0-2mix 这个 benchmark 可以用小模型解决,说明社区需要更难、更真实的数据集(原文原话)。6.1 表最有意思:窗口从 16 一路缩到 2,性能一路涨——这是 LSTM 时代做梦都不敢想的,因为窗口越短序列越长、LSTM 越训不动,而 DPRNN 把这个限制打破了。

所以这一节是想说:数据证明"分块 + 双路 RNN + 极短窗口"三件套能用小 20 倍的模型刷新纪录,而且在噪声混响下也稳——超短窗口能训动正是 DPRNN 独有的能力。


7. 实验结果说明了什么

原文的实验回答了四个关键问题:

问题一:DPRNN 真的比 TCN 强吗? Table 1 做了直接对照——在同样的 TasNet 框架、同样窗口 16 下,仅把 TCN 换成 DPRNN,SI-SNRi 从 15.2 涨到 16.0(相对 +4.6%),而模型小了 49%。这证明"局部 + 全局交替建模"确实优于 TCN 的"只做局部"。

问题二:窗口能缩到多短? 这是本文最惊人的发现。Table 1 显示窗口从 16 → 8 → 4 → 2,性能单调上升到 18.8 dB。窗口 2 采样点时 encoder 输出超过 30000 帧——原文强调这"对普通 RNN 或 CNN 极难甚至不可能"。DPRNN 通过 √L 降维让超短窗口变得可训,而超短窗口带来更细的时间分辨率、更高的性能。这是一个"新架构解锁了旧架构做不到的配置"的典范。

问题三:能用多小的模型达到 SOTA? Table 2 对比历史系统。DPRNN-TasNet 用 2.6M 参数超过了 51.4M 的 FurcaNeXt(小 20 倍)。原文由此引出一个前瞻观点:WSJ0-2mix 已经能被小模型解决,说明这个 benchmark 太容易了,社区应该转向更难更真实的数据集——这个判断后来确实推动了带噪声、混响、更多说话人的新数据集出现。

问题四:在真实(噪声 + 混响)条件下还行吗? Table 3 用 200 小时人工混响噪声数据训练、在噪声混响测试集上评估。DPRNN 在 SI-SNRi 和词错误率(WER)上都优于 TCN(8.4 vs 7.6 dB,25.9% vs 28.7%)。这说明 DPRNN 不是只在干净的玩具数据上有效,作为一个通用的长序列建模模块,它在挑战性声学条件下同样能替代传统序列模块。

所以这一节是想说:四组实验分别验证了"DPRNN 胜过 TCN""超短窗口解锁更高性能""小 20 倍模型创 SOTA""噪声混响下也稳"——每条都有对照实验支撑,还顺带推动了社区反思 benchmark 难度。


8. 你应该懂的几个新词

语音分离(speech separation):从一段多人同时讲话的混音里,把每个人的声音拆成独立轨道。鸡尾酒会问题的工程版。类比:把一锅乱炖的声音重新分成几盘干净的菜。

时域 vs 频域方法:传统方法先 STFT 把波形变成频谱(频域)再处理;时域方法直接在波形上做。TasNet 系列都是时域方法,好处是能联合建模幅度和相位、直接优化。

STFT(短时傅立叶变换)与相位问题:把声音切窗、每窗算频率成分 + 相位。多数方法只预测幅度、丢掉相位,导致重建有天花板。DPRNN 用可学习前端绕开了这个问题。

TasNet / Conv-TasNet:时域语音分离的奠基工作(同一作者 Yi Luo)。TasNet 用 LSTM,Conv-TasNet 用空洞卷积(TCN)。DPRNN 是这条线的下一站,把 TCN 换成 dual-path RNN。

RNN / LSTM / BLSTM:循环神经网络按时间一格一格处理序列。LSTM 用门控机制缓解梯度消失、能记较长依赖。BLSTM 是双向版本,能同时看过去和未来。本文块内/块间都用 BLSTM。

TCN / 感受野:时序卷积网络,用堆叠(空洞)卷积处理序列,可并行但感受野固定。感受野 = 网络某个输出"看得到多长的输入"。TCN 感受野小于序列长度时抓不住全局。

dual-path(双路径):本文核心思想——把长序列切块,交替做块内(intra,局部)和块间(inter,全局)两路处理。让每个 RNN 只处理 √L 量级的短序列。

SI-SNR(尺度不变信噪比):分离质量指标,对整体音量缩放免疫,单位 dB,越高越好。本文的训练目标和评测指标。SI-SNRi 是"分离后相对分离前的提升"。

uPIT(句子级排列不变训练):训练时不知道输出 1/输出 2 对应哪个说话人,枚举所有排列取损失最小的那个,绕开顺序歧义。

overlap-add(重叠相加):把分块处理结果拼回长序列的标准技巧,块间留重叠、重叠区加权,避免边界不连续。

所以这一节是想说:读懂本文的关键是把"语音分离术语(STFT/相位/SI-SNR/uPIT)""序列建模术语(RNN/LSTM/TCN/感受野/dual-path)"两套词摸一遍。


9. 它有什么搞不定的

RNN 不能完全并行,推理速度不占优:这是 dual-path 的固有代价。虽然每个 RNN 只跑 √L 的短序列缓解了这个问题,但相比完全并行的 TCN,DPRNN 的推理速度理论上更慢(原文重点在精度,端到端速度对比未详细报告)。对助听器这种要求极低延迟的场景,这是需要权衡的点。

在线(因果)性能未评估:原文提到块间 RNN 可以改成单向来支持在线处理,最小延迟由块大小 K 决定,但明确说"在线与离线设置的性能差异超出本文范围"。也就是说,本文报告的都是能看整段录音的离线(非因果)结果,实时因果版本能做到多好,论文没回答。

固定说话人数:模型需要预先知道混音里有几个人(本文主要做 2 人)。训 2 人模型不能直接用于 3 人场景,要重训。

WSJ0-2mix 太干净:原文自己承认,这个 benchmark 已经能被小模型解决,说明它太容易、不够真实。虽然论文补了噪声混响实验,但主结果的数字是在干净人工混音上得到的,日常对话里的打断、笑声、情绪变化等未充分验证。

块大小 K 是超参数、需要调:K 太小块间负担重、K 太大块内 RNN 又跑不动。本文靠 K≈√(2L) 的经验公式选取,但换个任务/序列长度就得重新调,不是完全自适应的。

长时说话人跟踪可能掉链子:虽然块间 RNN 理论上能覆盖全局,但极长录音里说话人身份的一致性维持仍是难题(后续 SepFormer 等工作继续在这上面改进)。

所以这一节是想说:DPRNN 的强项是"小模型 + 高精度 + 能训超长序列",但代价是推理不能完全并行、只验证了离线场景、固定说话人数、依赖块大小调参——这些是后续工作的改进空间。


10. 它和别的几篇是什么关系

上游:TasNet → Conv-TasNet → DPRNN(同一作者 Yi Luo 系列):DPRNN 是这条时域分离主线在 2019-2020 的接力。TasNet 用 LSTM、Conv-TasNet 用 TCN、DPRNN 用 dual-path RNN——encoder-separator-decoder 三段架构不变,只换 separator。见本仓库 conv-tasnet.md,两篇对照读能看清 TCN → DPRNN 的动机。

下游对手/继承者:SepFormer(2020 后):用 Transformer 替换 RNN 做分离,但**"dual-path"思想被完整继承**——把块内/块间 RNN 换成块内/块间 Transformer(intra/inter Transformer)。可以说 SepFormer = DPRNN 的架构 + Transformer 的模块。

思想血缘:长序列处理的"局部 + 全局"划分:dual-path 的"切块再两路建模"在很多领域反复出现——线性注意力(Linformer/Performer)里的局部+全局划分、视觉里的 Swin Transformer(窗口内 + 跨窗口注意力)都是遥远的呼应。它本质是一种通用的"降维处理超长序列"范式。

下游影响:dual-path 成为语音分离的默认范式:DPRNN 之后,社区基本接受了 dual-path,后续 SepFormer、TF-GridNet 等都在这个框架上改进。它在这个领域的地位类似"架构范式的奠基"。

embodied AI 视角:机器人要在嘈杂环境里听清主人指令,语音分离是绕不开的前级模块。DPRNN 这条线是这类"机器人听觉"的基础设施。

所以这一节是想说:DPRNN 承接 TasNet/Conv-TasNet 的三段架构、定义了 dual-path 范式,并被 SepFormer 等后续工作继承发扬——它是 2020 年前后语音分离的架构拐点。


11. 和本导读的关系

本篇对应导读 Ch20: 听觉智能。Ch20 把语音分离系统的骨架定位为"encoder-separator-decoder 三段式",而 DPRNN 正是 separator(分离器)这一环节的关键演进——它和 Conv-TasNet 一起,构成了听觉分离的两代 backbone(就像 ResNet 之于视觉)。

Ch20 开篇讨论了机器人为什么需要"耳朵"——声音携带材质信息、状态变化、语音指令、方向与距离四类信息。语音分离正是让机器人"从多人说话/嘈杂环境里隔离出主人指令"的基础能力,DPRNN 是这条能力线上的高性能选项。

具体来说,Ch20 讲 Conv-TasNet 时会提到它的软肋——TCN 感受野固定、长时依赖抓不住。DPRNN 恰好是对这个软肋的直接回应:用 dual-path RNN 把感受野扩展到句子级。所以读完 conv-tasnet.md 再读本篇,能看到"从 TCN 的局部建模到 DPRNN 的局部+全局建模"这个清晰的技术演进。Ch20 里更靠后的 Proactive Hearing(主动聚焦目标说话人)、NeuralAids(神经助听器)等工作,也都建立在这类时域分离范式之上。

在更宏观的导读体系里,Ch20(听觉)和 Ch8(CLIP)、Ch9(LLaVA/BLIP-2)、Ch19(RF 感知)一起构成具身 AI 的多模态感知层——视觉、语言、射频、听觉各一条线,最终汇成机器人理解环境的完整"感官系统"。

所以这一节是想说:本篇是 Ch20 听觉智能里"分离器架构"的关键一代,承接 Conv-TasNet、用 dual-path 破解长序列建模,是后续主动听觉和神经助听器工作的地基。


12. 思考题

Q1:为什么把长序列切成块、交替做块内/块间处理,能让每个 RNN 的输入长度从 O(L) 降到 O(√L)?请用 50% 重叠时 S=2L/K+1 这个关系推一推。

提示

两个 RNN 的输入长度之和是 K + S = K + 2L/K + 1。这是一个关于 K 的函数,想想什么时候 K + 2L/K 取最小值(提示:均值不等式,当 K = 2L/K 即 K = √(2L) 时)。此时 S 也≈√(2L)≈K。所以每个 RNN 只处理 √L 量级的序列,而不是原来的 L。

Q2:块内 RNN 用双向(BLSTM),这在实时(在线)场景下能用吗?如果要做在线处理,架构要怎么改?

提示

双向 RNN 需要看到整个块的未来,块内双向在离线时没问题(一个块很短,可以等它收完)。原文提到块间 RNN 可以改成单向(uni-directional)来支持在线处理,此时最小延迟由块大小 K 决定。想想为什么块内可以双向、而块间在线时要单向?延迟主要卡在哪一步?

Q3:为什么窗口(滤波器长度)越短,DPRNN 的性能越好?为什么 LSTM 时代做不到用这么短的窗口?

提示

窗口越短,时间分辨率越高,encoder 能捕捉更精细的波形结构(窗口 2 采样点时输出超过 30000 帧)。但窗口越短序列越长,普通 LSTM 在这么长的序列上梯度消失、训练崩溃。DPRNN 靠 √L 降维让超长序列可训,所以能用超短窗口。想想"更细的时间分辨率"和"更长的序列"这对矛盾,DPRNN 是怎么同时拿到前者的好处、又避开后者的坏处的?

Q4:DPRNN 用比旧 SOTA 小 20 倍的模型(2.6M)刷新了 WSJ0-2mix 纪录。原文由此得出一个关于 benchmark 的重要判断,是什么?对整个领域有什么影响?

提示

原文说:既然小模型就能解决 WSJ0-2mix,说明这个 benchmark 太容易了,社区应该转向更难、更真实的数据集(带噪声、混响、更多说话人)。想想"一个数据集被小模型攻克"到底是好事还是坏事?它对后续研究方向的选择有什么指导意义?

Q5:块内 RNN 管局部、块间 RNN 管全局。如果只保留块内 RNN(去掉块间),模型会退化成什么?性能会怎样?

提示

去掉块间 RNN,每个块就只能看到自己内部的 K 个采样点,块与块之间完全不通信——这就退化成了"只有局部感受野"的模型,和 TCN 的局部建模问题类似(甚至更差,因为块之间完全隔离)。想想说话人在整段录音里的连贯性(比如同一个人的音色、语速)需要全局信息,去掉块间 RNN 后模型还能维持这种一致性吗?

Q6:uPIT(排列不变训练)为什么必要?如果不用它会发生什么?

提示

设想训练时标签是 [说话人A, 说话人B],但网络恰好把 A 输出到通道 2、B 输出到通道 1。直接算 loss 会很大,但网络其实分得很好、只是顺序反了。如果不用 uPIT,网络会被这种"正确分离但错误排列"惩罚,梯度方向混乱。uPIT 枚举所有排列(2 人 2 种)取 loss 最小的那个。想想说话人数增加时排列数怎么增长(3 人 6 种),这对计算有什么影响?

Q7:DPRNN 是一个通用的长序列建模模块,本文只用它做语音分离。你还能想到哪些超长序列任务可以套用 dual-path 思想?

提示

任何"序列长到普通 RNN/Transformer 吃不消"的任务都可能适用:生理信号(心电、脑电,采样率高、时长长)、长文档处理、高分辨率音频/音乐、基因序列等。想想 dual-path 的本质——把 O(L) 拆成两个 O(√L)。这和后来 Transformer 里的各种"局部+全局"稀疏注意力(Swin、Longformer)是不是一个思路?


13. 一些好奇心问答(FAQ)

Q1:dual-path 的思想真的这么简单吗?

真的。核心就一句话:把长序列切块,交替做块内和块间两路 RNN。没有花哨的数学,是那种"为什么以前没人这么做"的工作。原文标题里的 "simple yet effective"(简单但有效)是诚实的——这也是零基础学习者读它性价比最高的原因。

Q2:为什么放弃 STFT,用可学习的卷积前端?

STFT 是通用变换、不为分离优化,还强制拆成幅度 + 相位、丢掉相位信息,导致重建有天花板。可学习的卷积前端能和分离器一起端到端训练,学出专门适合分离的表示,相位隐式保留。这是整个 TasNet 系列(含 DPRNN)的共同选择。

Q3:DPRNN 比 Conv-TasNet 好在哪、差在哪?

好:SI-SNRi 更高(18.8 vs 15.3 dB)、模型更小(2.6M vs 5.1M)、能用超短窗口。差:RNN 不能像 TCN 那样完全并行,推理速度理论上更慢。所以是"用一点速度换很多精度和很小的模型"。

Q4:2.6M 参数到底多小?

约 10MB 模型文件。相比旧 SOTA FurcaNeXt 的 51.4M(约 200MB),小 20 倍。这个尺寸对塞进手机、助听器等边缘设备非常友好——虽然 RNN 的串行推理还需要工程优化,但模型大小这一关已经过了。

Q5:块大小 K 怎么定?

按经验公式 K ≈ √(2L),让块内和块间 RNN 的输入长度大致相等、总和最小。本文根据训练集里 encoder 输出的长度来定 K(比如窗口 2 时 K=250)。换任务/序列长度要重新算。

Q6:DPRNN 能做 3 个人以上的分离吗?

架构上支持(把输出通道数 C 设成说话人数),本文也在 WSJ0-3mix 上验证过(原文报告了三人结果,具体数字以原文为准)。但说话人越多越难,而且要预先知道人数、重训模型——固定说话人数是这一代方法的共同限制。

Q7:之后该看什么?

  • SepFormer(2020 后):把 dual-path 的 RNN 换成 Transformer,是 WSJ0-2mix 的后续 SOTA。
  • TF-GridNet(2022+):结合时频域和 dual-path,进一步提升。
  • Conv-TasNet:往前看,理解 DPRNN 要解决的 TCN 局限。

整个 dual-path 家族在 2020 年后都成了语音分离的默认起点。

所以这一节是想说:DPRNN 思想简单、模型小巧、精度高,实操门槛比看起来低很多,是入门时域语音分离和长序列建模的绝佳样本。


14. 如果你想再深入

按"前传 → 同系列 → 续作 → 思想血缘"排序:

  1. 前传:TasNet(ICASSP 2018) — 同一作者的时域分离鼻祖,用 LSTM 做分离。理解它才知道"为什么时域方法要处理超长序列"这个问题从哪来。

  2. 同系列:Conv-TasNet(IEEE/ACM TASLP 2019) — 用 TCN 替代 LSTM 的一代,2019 SOTA。本仓库 conv-tasnet.md 有精读。读它才懂 DPRNN 要解决的"TCN 感受野固定"是什么。

  3. 续作:SepFormer(ICASSP 2021) — 把 dual-path 的 RNN 换成 Transformer。DPRNN 的架构 + 注意力模块,是这条线的下一站。

  4. 续作:TF-GridNet(2022+) — 结合时频表示和 dual-path,当前语音分离的强基线之一。

  5. 思想血缘:Swin Transformer / Longformer — 视觉和 NLP 里的"局部窗口 + 跨窗口/全局"注意力,和 dual-path 的"块内 + 块间"是同一种降维超长序列的哲学。

  6. 代码实现:Asteroid 库 — 开源的语音分离工具库,里面有 DPRNN 的 PyTorch 实现。跑一遍 forward、打印每一步的 tensor shape,比读三遍论文更扎实。

所以这一节是想说:把 TasNet → Conv-TasNet → DPRNN → SepFormer 四篇连起来读,就能看到 2018-2021 年端到端语音分离的完整演化;想动手就用 Asteroid 库跑一遍。


15. 原文信息

本文(笔记所评论文)

@inproceedings{luo2020dprnn,
  title={Dual-Path RNN: Efficient Long Sequence Modeling for Time-Domain Single-Channel Speech Separation},
  author={Luo, Yi and Chen, Zhuo and Yoshioka, Takuya},
  booktitle={ICASSP 2020 - IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)},
  pages={46--50},
  year={2020},
  organization={IEEE}
}

关键前驱(Conv-TasNet)

@article{luo2019conv,
  title={Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation},
  author={Luo, Yi and Mesgarani, Nima},
  journal={IEEE/ACM Transactions on Audio, Speech, and Language Processing},
  volume={27},
  number={8},
  pages={1256--1266},
  year={2019},
  publisher={IEEE}
}

相关链接


笔记结束。如果你只记住一件事:处理超长序列时,"切块 + 交替做局部/全局两路建模"能把 O(L) 的难题降成两个 O(√L) 的易题——DPRNN 用这个极简招数破解了 RNN 训不动长序列的死结,并定义了 dual-path 这个至今仍在沿用的范式。

引用本笔记 / Cite this note
BibTeX
@online{eai_dprnn_2026,
  title       = {(readable note) Dual-path RNN},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2020 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dprnn/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?