Dual-path RNN
这是一份给"完全没接触过 AI、也没学过信号处理"的读者看的精读笔记。所有公式都翻成人话,类比都来自日常生活。数字全部来自原文,没有的地方会写明"原文未报告"。
混音波形(32000 个采样点,超长)
│ Encoder(可学习的 1D 卷积,替代 STFT)
▼
特征序列 N×L
│ Segmentation:切成 S 个块,每块长 K
▼
3D 张量 (N, K, S)
│ ┌─────────────── DPRNN block × 6 ───────────────┐
│ │ Intra-chunk RNN(块内,沿 K,双向 BLSTM) │
│ │ ↕ 交替 │
│ │ Inter-chunk RNN(块间,沿 S,双向 BLSTM) │
│ └────────────────────────────────────────────────┘
▼
预测每个说话人的 mask
│ Overlap-Add + Decoder(反卷积)
▼
分离出的每个人的干净波形
1. 一句话讲什么(TL;DR)
DPRNN 把超长录音切成小块,让 RNN 先在"块内"跑一遍、再在"块间"跑一遍,两路交替叠六层,就能把两个人同时说话的混音拆成各自干净的声音——而且模型只有 2.6M 参数,比当时的最强系统小 20 倍,性能却创了新纪录。
更具体一点:时域语音分离要处理几万个采样点的超长序列,普通 RNN 训不动、TCN(空洞卷积)感受野又受限。DPRNN 的招数是把长度 L 的序列切成 S 个长度 K 的块,组成一个 3D 张量 (N, K, S),然后交替做两件事——块内 RNN(沿 K 方向,处理局部细节)和块间 RNN(沿 S 方向,处理全局依赖)。当 K≈S 时,每个 RNN 只需处理 √L 量级的短序列,优化难度骤降。把它塞进 TasNet 框架替换掉原来的 TCN,在标准 benchmark WSJ0-2mix 上做到 18.8 dB SI-SNRi 的新 SOTA。
所以这一节是想说:这篇论文用"分块 + 块内/块间两路 RNN 交替"这个极简架构,破解了"RNN 处理超长序列训不动"的老大难,用一个小 20 倍的模型刷新了语音分离纪录。
2. 这是个什么场景
你跟朋友在吵闹的火锅店聊天,邻桌两个人也在大声讲话,还有背景音乐。手机放桌上录了 4 秒,回家想把"朋友的声音""邻桌甲的声音""邻桌乙的声音"分别洗成几条干净的轨道——这就是语音分离(speech separation)。人耳能轻松"挑一个声音听",机器却搞了几十年都不灵,这个难题学术上叫鸡尾酒会问题(cocktail party problem)。
吃力在哪?关键是序列太长。原文点破了时域方法的死穴:时域分离系统输入的是波形采样点,一段几秒的录音就有几万个时间步(8kHz 采样率下 4 秒 = 32000 点)。这就好比让你读一本 32000 个字的小说然后复述每个细节:
- 普通 RNN 像记性不好的人,从第一页读到最后就忘了开头——原文说得很直白:RNN 因为"优化困难(optimization difficulties)"没法有效建模这么长的序列(梯度消失/爆炸,训不动)。
- 1D 卷积(TCN/Conv-TasNet) 想用固定大小的"尺子"去量,但原文指出:当卷积的感受野小于序列长度时,它根本利用不上句子级别的全局依赖。
- 聪明的读法是先一段一段精读(块内),再翻回去串章节脉络(块间),两件事交替做。
DPRNN 干的就是把这种"分块读 + 反复串"的阅读策略,变成一个神经网络架构。
落到具体产品上,语音分离的最终归宿是:助听器(爷爷在饭店听不清孙女讲话)、电话会议(两人抢话变一坨)、语音助手前置(先去掉背景人声,Siri 才能听清指令)。这些场景对模型大小和延迟都很挑剔——所以"小 20 倍还更准"这件事不只是好看,是真能落地。
所以这一节是想说:语音分离的核心难点是"如何用循环结构处理几万步的超长序列还不训崩",而它的落地场景(助听器、会议、语音助手)对模型的小巧和性能都很苛刻。

3. 之前的人怎么做的,为什么不够好
原文把时域方法分成两类:自适应前端(adaptive front-end)和直接回归(direct regression),它们都绕不开"超长序列建模"这个共同难题。
传统频域方法(STFT + 掩码):先做短时傅立叶变换把波形变成频谱图,再在频谱上估一个 mask 乘回去。问题:STFT 强制把信号拆成幅度 + 相位,绝大多数方法只预测幅度、丢掉相位,导致即使理论最优 mask 也重建不出原声——天花板被钉死。而且窗口越小性能越好,但会让序列更长,反而更难建模。
TasNet(时域鼻祖,同一作者 Yi Luo):直接在波形上分离,用可学习的卷积前端替代 STFT,证明了端到端时域方法可行。但它用 LSTM 处理超长序列,效率低、训不动。
Conv-TasNet(2019 SOTA):把 TasNet 的 LSTM 换成堆叠的空洞卷积(TCN)。速度快、效果好,2019 年是 SOTA(15.3 dB SI-SNRi,5.1M 参数)。但感受野是固定的——原文明说 TCN 只能做"局部建模",超过感受野的依赖抓不住。
直接堆 LSTM:理论上能处理全局依赖(RNN 有动态感受野),但几万步的序列会让 LSTM 梯度消失,训练崩溃。
核心痛点:RNN 有全局建模能力但训不动长序列;TCN 训得动但只有局部视野。原文要的是"鱼和熊掌兼得"——用循环结构处理几万步序列、同时保留全局建模能力。这就是 DPRNN 切入的位置。
所以这一节是想说:前人要么用 TCN(能训但视野局部),要么用 LSTM(视野全局但训不动长序列);本文的空位是"既保留 RNN 的全局建模、又让它能处理几万步的超长序列"。
4. 这篇论文的新想法
类比:一个班 320 人没法一起开会。聪明的做法是先按 100 人一组开小组讨论(组内),再让每组代表坐到一起开圆桌(组间),来回开几轮,全班信息就都串起来了。RNN 不擅长开长会,但开短会很在行——那就别让它一个人扛 32000 步,把它拆成"两班倒"。
核心想法:把长序列切成块,用两个 RNN 交替处理"块内"和"块间",每个 RNN 只面对 √L 量级的短序列。
具体怎么做:
- 把长度 L 的特征序列切成 S 个块,每块长度 K(K 远小于 L)。
- 整理成一个 3D 张量
(特征维 N, 块内位置 K, 块编号 S)。 - 块内 RNN(intra-chunk):固定块编号,沿 K 维跑 RNN,处理块内局部依赖(一个音素的细节)。
- 块间 RNN(inter-chunk):固定块内位置,沿 S 维跑 RNN,处理跨块的全局依赖(说话人在整段中的连贯性)。
- 把 step 3 + step 4 当作一个 DPRNN block,叠 6 层(论文用 B=6),相当于"小组—圆桌"反复开 6 轮。
关键直觉与数学:原文推导得很漂亮。当块间重叠率设为 50%(hop size P = K/2)时,块数 S = 2L/K + 1。两个 RNN 的输入长度之和是 K + S = K + 2L/K + 1。要让这个和最小,K 应取 √(2L),此时 S 也≈√(2L)≈K。于是每个 RNN 的输入长度是 O(√L)(次线性),而不是原来的 O(L)(线性)。这就是它能训动超长序列的数学根源——把"读 32000 步"变成了"读两次约 180 步"。
等等,先慢一拍——为什么 RNN 能比 TCN 强? 因为块间 RNN 沿 S 维跑双向 LSTM,理论上能覆盖全部 S 个块,相当于无界感受野;而 TCN 的感受野受限于"层数 × 空洞率",超出去就抓不到。代价是 RNN 不能像 TCN 那样完全并行,但因为每次只跑 √L 长度的短序列(而非 L),并行度其实还不错。
所以这一节是想说:本文的核心创新是"分块 + 块内/块间两路 RNN 交替",把每个 RNN 的输入从 O(L) 降到 O(√L),既解决了 RNN 训不动长序列的问题,又通过块间 RNN 保住了全局建模能力。
5. 它分几步做的(方法)
DPRNN 本身是一个通用的长序列建模模块,本文把它装进 TasNet 框架做语音分离。整体是 encoder → separator → decoder 三段,DPRNN 是 separator 的核心。下面逐段拆开。
5.1 Encoder:把波形切碎、每片编码成向量(可学习的 STFT)
类比:把一卷胶卷剪成小片,每片举到光下有独特的光斑模式,给每片拍一个"光谱指纹"(一串数字)。
输入:一维混音波形(一长串 -1~1 之间的数)。
处理:一个线性的 1D 卷积层把波形切成重叠小段,每段映射成一个 N 维向量。本文滤波器数 N=64。这一步等价于"可学习的 STFT"——但它不像 STFT 那样强制拆成幅度和相位,相位信息隐式编码在向量里,重建时不会丢。
输出:一个 N×L 的特征序列(L 是帧数,仍然很长)。
为什么不用 STFT? STFT 是通用变换、不为分离优化,还丢相位。可学习的卷积前端能和后面的分离器一起端到端训练,学出专门适合分离的表示。
所以这一节是想说:Encoder 用一个可学习的卷积把波形编码成特征序列,绕开了 STFT 丢相位的天花板,是三段流水线的入口。
5.2 Segmentation:把长序列切成块,组成 3D 张量
类比:把一长条纸带按固定长度剪开,前后两段留一半重叠,然后把所有小段叠成一摞——从"一维长条"变成"三维方块"。
输入:N×L 的特征序列 W。
处理:用长度 K、跳步 P 的滑动窗口把 W 切成 S 个块,每块是 N×K。第一个和最后一个块补零(zero-pad),保证每个采样点恰好出现在 K/P 个块里。本文用 50% 重叠(P = K/2)。所有块沿新维度拼起来,形成一个 3D 张量 T ∈ R^(N×K×S)。K 按 K≈√(2L) 经验选取。
输出:3D 张量 (N, K, S)。
为什么要重叠? 因为最后要用 overlap-add 拼回去。相邻块留一半重叠,拼接处才平滑,不会出现"咔嗒"的断裂声。
所以这一节是想说:Segmentation 把一维长序列切成带重叠的块、堆成 3D 张量,是把 O(L) 问题降维成两个 O(√L) 子问题的关键第一步。
5.3 DPRNN Block:块内 + 块间两路 RNN 交替(本文灵魂)
类比:Excel 里先按行操作、再按列操作,看似每次只动一维,实则覆盖了整个二维表。
输入:3D 张量 T_b ∈ R^(N×K×S)(第一个 block 的输入是 T_1 = T)。
处理分两个子模块,串起来是一个 block,共叠 B=6 层:
块内 RNN(intra-chunk,公式 1-3):沿第二维(K,块内位置)跑。对每个块 i 独立地跑一个 RNN——本文用双向 LSTM(BLSTM),每方向 128 个隐藏单元。为什么可以双向?因为块内的未来是可以看的(离线处理)。RNN 输出后接一个全连接层把维度变回 N,再做层归一化(LayerNorm)(公式 3,原文强调这对泛化很重要),最后加一个残差连接(公式 7)T̂_b = T_b + LN(...)。块内 RNN 负责处理局部依赖,比如一个音素内部的波形细节。
块间 RNN(inter-chunk,公式 8):沿第三维(S,块编号)跑。对每个块内位置 i 独立地跑一个 BLSTM,把所有 S 个块的信息聚合起来。因为块内 RNN 是双向的,每个块内位置已经包含了整个块的信息,所以块间 RNN 能做真正的句子级(utterance-level)全局建模。同样接全连接 + LayerNorm + 残差。
两个子模块交替、叠 6 层,信息就在整个 32000 步里来回流动。
输出:和输入同形状的 3D 张量,喂给下一个 block(最后一层喂给输出投影)。
BLSTM(双向 LSTM):LSTM 从前往后跑一遍、再从后往前跑一遍,两个方向拼起来。好处是每个位置都能看到过去和未来的上下文。
残差连接 + LayerNorm:残差让梯度能跳过中间层直接回传(深网络好训),LayerNorm 让数值稳定。原文实测 LayerNorm 对模型泛化"很重要"。
为什么这步是灵魂:这就是 dual-path 的全部精髓。每层 RNN 只跑长度 K 或 S 的短序列(√L 量级),但通过反复切换块内/块间两个维度,信息能覆盖整个超长序列。块内管局部、块间管全局,交替叠加就同时拿到了两者。
所以这一节是想说:DPRNN block 用块内 RNN(管局部)和块间 RNN(管全局)交替处理 3D 张量的两个维度,每个 RNN 只面对短序列,是整篇论文最核心、也最优雅的设计。
5.4 Overlap-Add + Decoder:拼回长序列、还原波形
类比:把处理过的一摞小纸片按原来的重叠位置拼回一条长纸带,重叠区加权平均让接缝平滑;再把"加了 mask 的特征"反推回波形。
输入:最后一个 DPRNN block 的输出 3D 张量。
处理:先过 PReLU + 1D 卷积,为 C 个说话人(本文 C=2)各预测一份 mask。用 overlap-add 把 S 个块按重叠位置加权拼回长度 L 的序列。mask 逐元素乘到 encoder 输出上,得到每个说话人的特征。最后过一个 1D 反卷积(decoder)把特征还原成波形。
输出:C 个说话人各自的分离波形。
overlap-add(重叠相加):信号处理的标准拼接技巧。块之间留重叠、重叠区加权平均,避免块边界处的不连续(咔嗒声)。
所以这一节是想说:这一步把 DPRNN 处理后的块拼回长序列、用 mask 分离出每个人的特征、再反卷积还原成波形,是三段流水线的出口。
5.5 训练目标:SI-SNR + uPIT
类比:教学徒切土豆丝,怎么打分?先把两份丝缩放对齐(不管绝对粗细),再比形状有多像——这就是 SI-SNR。而"哪一路输出对应哪个人"顺序不定,就把两种顺序都算一遍取最优——这就是 uPIT。
输入:估计的分离波形 + 干净的目标波形。
处理:用 SI-SNR(尺度不变信噪比) 当损失——先把估计信号投影到真实信号方向、算"目标分量能量 / 残差能量"取 log。它对音量缩放免疫,训练更稳。配合 uPIT(句子级排列不变训练)——两个说话人有 2 种排列,枚举所有排列、取损失最小的那个当梯度方向,解决"输出 1 到底对应谁"的歧义。
训练配置:100 个 epoch,4 秒片段;初始学习率 1e-3,每两个 epoch 衰减 0.98;连续 10 个 epoch 验证集不涨就早停;Adam 优化器;梯度裁剪 L2 范数上限 5。分离用 WSJ0-2mix(8kHz)。
输出:训练好的模型权重。
所以这一节是想说:训练目标直接优化最终评测指标 SI-SNR(缩放不变、更稳),用 uPIT 解决说话人排列歧义——目标和评测完全对齐。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【Dual-path RNN · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
DPRNN ──► 2.6M ──► …
DPRNN-TasNet ──► 2.6M ──► …
DPRNN ──► 2.6M ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

6. 关键数字(What works)
6.1 不同分离器 / 配置对比(WSJ0-2mix,TasNet 框架)
| 分离器 | 模型大小 | 窗口(采样点) | 块大小(帧) | SI-SNRi (dB) | SDRi (dB) |
|---|---|---|---|---|---|
| TCN(Conv-TasNet) | 5.1M | 16 | — | 15.2 | 15.5 |
| DPRNN | — | 16 | 100 | 16.0 | 16.2 |
| DPRNN | — | 8 | 150 | 17.0 | 17.3 |
| DPRNN | — | 4 | 200 | 17.9 | 18.1 |
| DPRNN | 2.6M | 2 | 250 | 18.8 | 19.0 |
核心趋势:窗口(滤波器长度)越短,性能越高——窗口 2 采样点时 encoder 输出超过 30000 帧,这对普通 RNN/CNN 几乎不可能建模,但 DPRNN 做到了。仅把 TCN 换成 DPRNN(同窗口 16)就带来 4.6% 相对提升且模型小 49%。
6.2 与其他系统对比(WSJ0-2mix)
| 方法 | 模型大小 | SI-SNRi (dB) | SDRi (dB) |
|---|---|---|---|
| DPCL++ | 13.6M | 10.8 | — |
| uPIT-BLSTM-ST | 92.7M | — | 10.0 |
| ADANet | 9.1M | 10.4 | 10.8 |
| WA-MISI-5 | 32.9M | 12.6 | 13.1 |
| Conv-TasNet-gLN | 5.1M | 15.3 | 15.6 |
| Deep CASA | 12.8M | 17.7 | 18.0 |
| FurcaNeXt(旧 SOTA) | 51.4M | — | 18.4 |
| DPRNN-TasNet | 2.6M | 18.8 | 19.0 |
DPRNN-TasNet 用比旧 SOTA FurcaNeXt 小 20 倍的模型(2.6M vs 51.4M)刷新了 SI-SNRi 纪录。
6.3 噪声 + 混响条件下的分离与识别
| 分离器 | 模型大小 | SI-SNRi (dB) | WER (%) |
|---|---|---|---|
| TCN | 5.1M | 7.6 | 28.7 |
| DPRNN | 2.6M | 8.4 | 25.9 |
| 无噪声混响参考 | — | — | 9.1 |
窗口设为 32 采样点、块大小 100 帧。DPRNN 在更真实的噪声混响条件下也全面超过 TCN(SI-SNRi 更高、词错误率更低),证明它不只在干净数据上有效。
生活语言解读:18.8 dB 的 SI-SNRi 意味着分离后信号比"直接拿混音当输出"提升了近 19 dB——人耳对 1 dB 的差别就能听出来,19 dB 是天壤之别。而这个成绩是用2.6M 参数(约 10MB 模型文件)拿到的,比旧 SOTA 小 20 倍。这传递了一个重要信号:WSJ0-2mix 这个 benchmark 可以用小模型解决,说明社区需要更难、更真实的数据集(原文原话)。6.1 表最有意思:窗口从 16 一路缩到 2,性能一路涨——这是 LSTM 时代做梦都不敢想的,因为窗口越短序列越长、LSTM 越训不动,而 DPRNN 把这个限制打破了。
所以这一节是想说:数据证明"分块 + 双路 RNN + 极短窗口"三件套能用小 20 倍的模型刷新纪录,而且在噪声混响下也稳——超短窗口能训动正是 DPRNN 独有的能力。
7. 实验结果说明了什么
原文的实验回答了四个关键问题:
问题一:DPRNN 真的比 TCN 强吗? Table 1 做了直接对照——在同样的 TasNet 框架、同样窗口 16 下,仅把 TCN 换成 DPRNN,SI-SNRi 从 15.2 涨到 16.0(相对 +4.6%),而模型小了 49%。这证明"局部 + 全局交替建模"确实优于 TCN 的"只做局部"。
问题二:窗口能缩到多短? 这是本文最惊人的发现。Table 1 显示窗口从 16 → 8 → 4 → 2,性能单调上升到 18.8 dB。窗口 2 采样点时 encoder 输出超过 30000 帧——原文强调这"对普通 RNN 或 CNN 极难甚至不可能"。DPRNN 通过 √L 降维让超短窗口变得可训,而超短窗口带来更细的时间分辨率、更高的性能。这是一个"新架构解锁了旧架构做不到的配置"的典范。
问题三:能用多小的模型达到 SOTA? Table 2 对比历史系统。DPRNN-TasNet 用 2.6M 参数超过了 51.4M 的 FurcaNeXt(小 20 倍)。原文由此引出一个前瞻观点:WSJ0-2mix 已经能被小模型解决,说明这个 benchmark 太容易了,社区应该转向更难更真实的数据集——这个判断后来确实推动了带噪声、混响、更多说话人的新数据集出现。
问题四:在真实(噪声 + 混响)条件下还行吗? Table 3 用 200 小时人工混响噪声数据训练、在噪声混响测试集上评估。DPRNN 在 SI-SNRi 和词错误率(WER)上都优于 TCN(8.4 vs 7.6 dB,25.9% vs 28.7%)。这说明 DPRNN 不是只在干净的玩具数据上有效,作为一个通用的长序列建模模块,它在挑战性声学条件下同样能替代传统序列模块。
所以这一节是想说:四组实验分别验证了"DPRNN 胜过 TCN""超短窗口解锁更高性能""小 20 倍模型创 SOTA""噪声混响下也稳"——每条都有对照实验支撑,还顺带推动了社区反思 benchmark 难度。
8. 你应该懂的几个新词
语音分离(speech separation):从一段多人同时讲话的混音里,把每个人的声音拆成独立轨道。鸡尾酒会问题的工程版。类比:把一锅乱炖的声音重新分成几盘干净的菜。
时域 vs 频域方法:传统方法先 STFT 把波形变成频谱(频域)再处理;时域方法直接在波形上做。TasNet 系列都是时域方法,好处是能联合建模幅度和相位、直接优化。
STFT(短时傅立叶变换)与相位问题:把声音切窗、每窗算频率成分 + 相位。多数方法只预测幅度、丢掉相位,导致重建有天花板。DPRNN 用可学习前端绕开了这个问题。
TasNet / Conv-TasNet:时域语音分离的奠基工作(同一作者 Yi Luo)。TasNet 用 LSTM,Conv-TasNet 用空洞卷积(TCN)。DPRNN 是这条线的下一站,把 TCN 换成 dual-path RNN。
RNN / LSTM / BLSTM:循环神经网络按时间一格一格处理序列。LSTM 用门控机制缓解梯度消失、能记较长依赖。BLSTM 是双向版本,能同时看过去和未来。本文块内/块间都用 BLSTM。
TCN / 感受野:时序卷积网络,用堆叠(空洞)卷积处理序列,可并行但感受野固定。感受野 = 网络某个输出"看得到多长的输入"。TCN 感受野小于序列长度时抓不住全局。
dual-path(双路径):本文核心思想——把长序列切块,交替做块内(intra,局部)和块间(inter,全局)两路处理。让每个 RNN 只处理 √L 量级的短序列。
SI-SNR(尺度不变信噪比):分离质量指标,对整体音量缩放免疫,单位 dB,越高越好。本文的训练目标和评测指标。SI-SNRi 是"分离后相对分离前的提升"。
uPIT(句子级排列不变训练):训练时不知道输出 1/输出 2 对应哪个说话人,枚举所有排列取损失最小的那个,绕开顺序歧义。
overlap-add(重叠相加):把分块处理结果拼回长序列的标准技巧,块间留重叠、重叠区加权,避免边界不连续。
所以这一节是想说:读懂本文的关键是把"语音分离术语(STFT/相位/SI-SNR/uPIT)""序列建模术语(RNN/LSTM/TCN/感受野/dual-path)"两套词摸一遍。
9. 它有什么搞不定的
RNN 不能完全并行,推理速度不占优:这是 dual-path 的固有代价。虽然每个 RNN 只跑 √L 的短序列缓解了这个问题,但相比完全并行的 TCN,DPRNN 的推理速度理论上更慢(原文重点在精度,端到端速度对比未详细报告)。对助听器这种要求极低延迟的场景,这是需要权衡的点。
在线(因果)性能未评估:原文提到块间 RNN 可以改成单向来支持在线处理,最小延迟由块大小 K 决定,但明确说"在线与离线设置的性能差异超出本文范围"。也就是说,本文报告的都是能看整段录音的离线(非因果)结果,实时因果版本能做到多好,论文没回答。
固定说话人数:模型需要预先知道混音里有几个人(本文主要做 2 人)。训 2 人模型不能直接用于 3 人场景,要重训。
WSJ0-2mix 太干净:原文自己承认,这个 benchmark 已经能被小模型解决,说明它太容易、不够真实。虽然论文补了噪声混响实验,但主结果的数字是在干净人工混音上得到的,日常对话里的打断、笑声、情绪变化等未充分验证。
块大小 K 是超参数、需要调:K 太小块间负担重、K 太大块内 RNN 又跑不动。本文靠 K≈√(2L) 的经验公式选取,但换个任务/序列长度就得重新调,不是完全自适应的。
长时说话人跟踪可能掉链子:虽然块间 RNN 理论上能覆盖全局,但极长录音里说话人身份的一致性维持仍是难题(后续 SepFormer 等工作继续在这上面改进)。
所以这一节是想说:DPRNN 的强项是"小模型 + 高精度 + 能训超长序列",但代价是推理不能完全并行、只验证了离线场景、固定说话人数、依赖块大小调参——这些是后续工作的改进空间。
10. 它和别的几篇是什么关系
上游:TasNet → Conv-TasNet → DPRNN(同一作者 Yi Luo 系列):DPRNN 是这条时域分离主线在 2019-2020 的接力。TasNet 用 LSTM、Conv-TasNet 用 TCN、DPRNN 用 dual-path RNN——encoder-separator-decoder 三段架构不变,只换 separator。见本仓库 conv-tasnet.md,两篇对照读能看清 TCN → DPRNN 的动机。
下游对手/继承者:SepFormer(2020 后):用 Transformer 替换 RNN 做分离,但**"dual-path"思想被完整继承**——把块内/块间 RNN 换成块内/块间 Transformer(intra/inter Transformer)。可以说 SepFormer = DPRNN 的架构 + Transformer 的模块。
思想血缘:长序列处理的"局部 + 全局"划分:dual-path 的"切块再两路建模"在很多领域反复出现——线性注意力(Linformer/Performer)里的局部+全局划分、视觉里的 Swin Transformer(窗口内 + 跨窗口注意力)都是遥远的呼应。它本质是一种通用的"降维处理超长序列"范式。
下游影响:dual-path 成为语音分离的默认范式:DPRNN 之后,社区基本接受了 dual-path,后续 SepFormer、TF-GridNet 等都在这个框架上改进。它在这个领域的地位类似"架构范式的奠基"。
embodied AI 视角:机器人要在嘈杂环境里听清主人指令,语音分离是绕不开的前级模块。DPRNN 这条线是这类"机器人听觉"的基础设施。
所以这一节是想说:DPRNN 承接 TasNet/Conv-TasNet 的三段架构、定义了 dual-path 范式,并被 SepFormer 等后续工作继承发扬——它是 2020 年前后语音分离的架构拐点。
11. 和本导读的关系
本篇对应导读 Ch20: 听觉智能。Ch20 把语音分离系统的骨架定位为"encoder-separator-decoder 三段式",而 DPRNN 正是 separator(分离器)这一环节的关键演进——它和 Conv-TasNet 一起,构成了听觉分离的两代 backbone(就像 ResNet 之于视觉)。
Ch20 开篇讨论了机器人为什么需要"耳朵"——声音携带材质信息、状态变化、语音指令、方向与距离四类信息。语音分离正是让机器人"从多人说话/嘈杂环境里隔离出主人指令"的基础能力,DPRNN 是这条能力线上的高性能选项。
具体来说,Ch20 讲 Conv-TasNet 时会提到它的软肋——TCN 感受野固定、长时依赖抓不住。DPRNN 恰好是对这个软肋的直接回应:用 dual-path RNN 把感受野扩展到句子级。所以读完 conv-tasnet.md 再读本篇,能看到"从 TCN 的局部建模到 DPRNN 的局部+全局建模"这个清晰的技术演进。Ch20 里更靠后的 Proactive Hearing(主动聚焦目标说话人)、NeuralAids(神经助听器)等工作,也都建立在这类时域分离范式之上。
在更宏观的导读体系里,Ch20(听觉)和 Ch8(CLIP)、Ch9(LLaVA/BLIP-2)、Ch19(RF 感知)一起构成具身 AI 的多模态感知层——视觉、语言、射频、听觉各一条线,最终汇成机器人理解环境的完整"感官系统"。
所以这一节是想说:本篇是 Ch20 听觉智能里"分离器架构"的关键一代,承接 Conv-TasNet、用 dual-path 破解长序列建模,是后续主动听觉和神经助听器工作的地基。
12. 思考题
Q1:为什么把长序列切成块、交替做块内/块间处理,能让每个 RNN 的输入长度从 O(L) 降到 O(√L)?请用 50% 重叠时 S=2L/K+1 这个关系推一推。
提示
两个 RNN 的输入长度之和是 K + S = K + 2L/K + 1。这是一个关于 K 的函数,想想什么时候 K + 2L/K 取最小值(提示:均值不等式,当 K = 2L/K 即 K = √(2L) 时)。此时 S 也≈√(2L)≈K。所以每个 RNN 只处理 √L 量级的序列,而不是原来的 L。
Q2:块内 RNN 用双向(BLSTM),这在实时(在线)场景下能用吗?如果要做在线处理,架构要怎么改?
提示
双向 RNN 需要看到整个块的未来,块内双向在离线时没问题(一个块很短,可以等它收完)。原文提到块间 RNN 可以改成单向(uni-directional)来支持在线处理,此时最小延迟由块大小 K 决定。想想为什么块内可以双向、而块间在线时要单向?延迟主要卡在哪一步?
Q3:为什么窗口(滤波器长度)越短,DPRNN 的性能越好?为什么 LSTM 时代做不到用这么短的窗口?
提示
窗口越短,时间分辨率越高,encoder 能捕捉更精细的波形结构(窗口 2 采样点时输出超过 30000 帧)。但窗口越短序列越长,普通 LSTM 在这么长的序列上梯度消失、训练崩溃。DPRNN 靠 √L 降维让超长序列可训,所以能用超短窗口。想想"更细的时间分辨率"和"更长的序列"这对矛盾,DPRNN 是怎么同时拿到前者的好处、又避开后者的坏处的?
Q4:DPRNN 用比旧 SOTA 小 20 倍的模型(2.6M)刷新了 WSJ0-2mix 纪录。原文由此得出一个关于 benchmark 的重要判断,是什么?对整个领域有什么影响?
提示
原文说:既然小模型就能解决 WSJ0-2mix,说明这个 benchmark 太容易了,社区应该转向更难、更真实的数据集(带噪声、混响、更多说话人)。想想"一个数据集被小模型攻克"到底是好事还是坏事?它对后续研究方向的选择有什么指导意义?
Q5:块内 RNN 管局部、块间 RNN 管全局。如果只保留块内 RNN(去掉块间),模型会退化成什么?性能会怎样?
提示
去掉块间 RNN,每个块就只能看到自己内部的 K 个采样点,块与块之间完全不通信——这就退化成了"只有局部感受野"的模型,和 TCN 的局部建模问题类似(甚至更差,因为块之间完全隔离)。想想说话人在整段录音里的连贯性(比如同一个人的音色、语速)需要全局信息,去掉块间 RNN 后模型还能维持这种一致性吗?
Q6:uPIT(排列不变训练)为什么必要?如果不用它会发生什么?
提示
设想训练时标签是 [说话人A, 说话人B],但网络恰好把 A 输出到通道 2、B 输出到通道 1。直接算 loss 会很大,但网络其实分得很好、只是顺序反了。如果不用 uPIT,网络会被这种"正确分离但错误排列"惩罚,梯度方向混乱。uPIT 枚举所有排列(2 人 2 种)取 loss 最小的那个。想想说话人数增加时排列数怎么增长(3 人 6 种),这对计算有什么影响?
Q7:DPRNN 是一个通用的长序列建模模块,本文只用它做语音分离。你还能想到哪些超长序列任务可以套用 dual-path 思想?
提示
任何"序列长到普通 RNN/Transformer 吃不消"的任务都可能适用:生理信号(心电、脑电,采样率高、时长长)、长文档处理、高分辨率音频/音乐、基因序列等。想想 dual-path 的本质——把 O(L) 拆成两个 O(√L)。这和后来 Transformer 里的各种"局部+全局"稀疏注意力(Swin、Longformer)是不是一个思路?
13. 一些好奇心问答(FAQ)
Q1:dual-path 的思想真的这么简单吗?
真的。核心就一句话:把长序列切块,交替做块内和块间两路 RNN。没有花哨的数学,是那种"为什么以前没人这么做"的工作。原文标题里的 "simple yet effective"(简单但有效)是诚实的——这也是零基础学习者读它性价比最高的原因。
Q2:为什么放弃 STFT,用可学习的卷积前端?
STFT 是通用变换、不为分离优化,还强制拆成幅度 + 相位、丢掉相位信息,导致重建有天花板。可学习的卷积前端能和分离器一起端到端训练,学出专门适合分离的表示,相位隐式保留。这是整个 TasNet 系列(含 DPRNN)的共同选择。
Q3:DPRNN 比 Conv-TasNet 好在哪、差在哪?
好:SI-SNRi 更高(18.8 vs 15.3 dB)、模型更小(2.6M vs 5.1M)、能用超短窗口。差:RNN 不能像 TCN 那样完全并行,推理速度理论上更慢。所以是"用一点速度换很多精度和很小的模型"。
Q4:2.6M 参数到底多小?
约 10MB 模型文件。相比旧 SOTA FurcaNeXt 的 51.4M(约 200MB),小 20 倍。这个尺寸对塞进手机、助听器等边缘设备非常友好——虽然 RNN 的串行推理还需要工程优化,但模型大小这一关已经过了。
Q5:块大小 K 怎么定?
按经验公式 K ≈ √(2L),让块内和块间 RNN 的输入长度大致相等、总和最小。本文根据训练集里 encoder 输出的长度来定 K(比如窗口 2 时 K=250)。换任务/序列长度要重新算。
Q6:DPRNN 能做 3 个人以上的分离吗?
架构上支持(把输出通道数 C 设成说话人数),本文也在 WSJ0-3mix 上验证过(原文报告了三人结果,具体数字以原文为准)。但说话人越多越难,而且要预先知道人数、重训模型——固定说话人数是这一代方法的共同限制。
Q7:之后该看什么?
- SepFormer(2020 后):把 dual-path 的 RNN 换成 Transformer,是 WSJ0-2mix 的后续 SOTA。
- TF-GridNet(2022+):结合时频域和 dual-path,进一步提升。
- Conv-TasNet:往前看,理解 DPRNN 要解决的 TCN 局限。
整个 dual-path 家族在 2020 年后都成了语音分离的默认起点。
所以这一节是想说:DPRNN 思想简单、模型小巧、精度高,实操门槛比看起来低很多,是入门时域语音分离和长序列建模的绝佳样本。
14. 如果你想再深入
按"前传 → 同系列 → 续作 → 思想血缘"排序:
前传:TasNet(ICASSP 2018) — 同一作者的时域分离鼻祖,用 LSTM 做分离。理解它才知道"为什么时域方法要处理超长序列"这个问题从哪来。
同系列:Conv-TasNet(IEEE/ACM TASLP 2019) — 用 TCN 替代 LSTM 的一代,2019 SOTA。本仓库 conv-tasnet.md 有精读。读它才懂 DPRNN 要解决的"TCN 感受野固定"是什么。
续作:SepFormer(ICASSP 2021) — 把 dual-path 的 RNN 换成 Transformer。DPRNN 的架构 + 注意力模块,是这条线的下一站。
续作:TF-GridNet(2022+) — 结合时频表示和 dual-path,当前语音分离的强基线之一。
思想血缘:Swin Transformer / Longformer — 视觉和 NLP 里的"局部窗口 + 跨窗口/全局"注意力,和 dual-path 的"块内 + 块间"是同一种降维超长序列的哲学。
代码实现:Asteroid 库 — 开源的语音分离工具库,里面有 DPRNN 的 PyTorch 实现。跑一遍 forward、打印每一步的 tensor shape,比读三遍论文更扎实。
所以这一节是想说:把 TasNet → Conv-TasNet → DPRNN → SepFormer 四篇连起来读,就能看到 2018-2021 年端到端语音分离的完整演化;想动手就用 Asteroid 库跑一遍。
15. 原文信息
本文(笔记所评论文)
@inproceedings{luo2020dprnn,
title={Dual-Path RNN: Efficient Long Sequence Modeling for Time-Domain Single-Channel Speech Separation},
author={Luo, Yi and Chen, Zhuo and Yoshioka, Takuya},
booktitle={ICASSP 2020 - IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)},
pages={46--50},
year={2020},
organization={IEEE}
}
关键前驱(Conv-TasNet)
@article{luo2019conv,
title={Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation},
author={Luo, Yi and Mesgarani, Nima},
journal={IEEE/ACM Transactions on Audio, Speech, and Language Processing},
volume={27},
number={8},
pages={1256--1266},
year={2019},
publisher={IEEE}
}
相关链接
- 论文:arXiv:1910.06379
- 代码(Asteroid 库):https://github.com/asteroid-team/asteroid
- 前驱精读:conv-tasnet.md
- 导读章节:Ch20: 听觉智能
笔记结束。如果你只记住一件事:处理超长序列时,"切块 + 交替做局部/全局两路建模"能把 O(L) 的难题降成两个 O(√L) 的易题——DPRNN 用这个极简招数破解了 RNN 训不动长序列的死结,并定义了 dual-path 这个至今仍在沿用的范式。
◼
引用本笔记 / Cite this note
@online{eai_dprnn_2026,
title = {(readable note) Dual-path RNN},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2020 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dprnn/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?