Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 14

Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation

32 min read · 11300 字 · ⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

两人同时讲话的混音,喂给一个网络,它能把每个人的声音分别还原。比老方法(看频谱图)更准、更快、更小。

所以这一节是想说:这篇论文做出了一个"端到端听筒",能从一段嘈杂录音里直接拆出每个人各自的声音。


这是个什么场景

火锅店里你和朋友吃饭,邻桌大叔正高声讲电话,对面的女生在跟服务员点单——三个人的声音全糊在一起冲进你耳朵。神奇的是,你只要把注意力转到朋友身上,就能听清他在说"再来一盘毛肚",其他声音自动变成背景。人耳天生会"挑声音听"

但你掏出手机想录段对话留念,回放时就傻眼了:录音里所有人混成一锅粥,谁都听不清。机器不会挑

这个问题在学术上叫 鸡尾酒会问题(cocktail party problem)——人耳轻松搞定的事,机器搞了几十年都不灵。

落到具体产品上:

  • 助听器:爷爷在饭店听不清孙女讲话,因为周围人声太杂。能不能实时把"孙女那个声音"单独放大?
  • 电话会议:两个人同时抢话时,对方听到的就是一坨。
  • Siri / 小爱前置:先把背景人声去掉,语音识别才能听清你的指令。

这些场景共通的硬约束是:实时 + 低延迟 + 能塞进小芯片。模型要等好几秒才出结果,或者大到只能跑在 GPU 服务器上,助听器就永远做不出来。

所以这一节是想说:语音分离的最终目标是落在"耳机里、助听器里、手机里",对延迟、模型大小、准确率都很挑剔。


Conv-TasNet — 场景示意:这论文要解决的现实问题
Plate Nº IConv-TasNet — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

主流做法都是先把声音变成一张"频谱图",再在频谱图上做分离。

  • 第一步:短时傅立叶变换(STFT)——把声音切成一段段(比如每 32 毫秒一段),每段用数学方法拆成"不同频率成分的强度 + 相位"。结果是一张图:横轴时间、纵轴频率。这就是"频谱图"。

  • 第二步:在频谱图上画 mask(蒙版)——训练一个神经网络,告诉它"这一格频谱属于说话人 A,那一格属于说话人 B",然后把 mask 乘上去就把两个人分开了。

听上去合理,但这条路有三个绕不过的坑:

  • 相位丢了一半:STFT 输出的频谱包含"幅度(声音多响)"和"相位(波形怎么对齐)"两部分。绝大多数方法只预测幅度,把相位扔掉用混音的相位凑数。结果即使理论上的"完美 mask"也还原不出原始声音——天花板被钉死了。
  • STFT 不一定是最适合分离的表示:它是一个通用变换,没人说它对"分人声"最优。
  • 延迟太高:要算清频谱,窗口至少 32 毫秒。再加上后续处理,总延迟 50ms 起步——助听器场景里,超过 10ms 用户就会觉得"嘴型对不上"。

STFT(短时傅立叶变换):把一段声音切成短窗口,每个窗口算出"哪个频率有多强 + 这个频率的相位是多少"。结果是一张时间-频率二维图。

相位(phase):声波的"对齐时刻"。两个频率相同但相位不同的波叠加起来,可能完全相消(变成静音)也可能加倍。所以相位错了,波形就重建不回来。

mask(蒙版):一张 0~1 的权重图,乘到频谱上能"留下我想要的那部分,抹掉别的"。

所以这一节是想说:传统做法因为绕了"频谱图"这一道弯,被相位丢失和延迟两件事卡住了上限。


这篇论文的新想法

类比一下:以前做菜,所有人都要先把食材榨成果汁(STFT 频谱图)才开始炒,问题是榨汁过程会丢一半信息(相位)。这篇论文说:"别榨了,直接下锅,让网络自己决定怎么切配。"

换成正经描述:别再绕频谱图了——直接让网络自己学一种"适合分离"的表示,从原始波形进、原始波形出。

具体说:用一个简单的卷积层当"编码器"(替代 STFT),用全卷积网络当"分离器"(替代 LSTM),用一个反卷积层当"解码器"(替代 iSTFT)。整套都在时域做,没有相位这回事。

等等,先慢一拍——什么叫"时域"? 时域就是"声音原本的样子":一秒采 8000 个数,每个数表示那一瞬间空气压强是多少。频域是把这串数转成"哪个音高有多响"。时域是录音笔录下来的原始数据,频域是把它画成钢琴卷帘那种五线谱式的图。

所以这一节是想说:核心创新是把 STFT 这个"固定的数学变换"换成"网络自己学出来的变换",让模型从波形直通波形。


它分几步做的(方法)

Figure:Conv-TasNet 编码器—分离网络—解码器整体结构
Plate Nº IIFigure:Conv-TasNet 编码器—分离网络—解码器整体结构

上图说明:Figure:Conv-TasNet 编码器—分离网络—解码器整体结构(论文原图)。

Figure:Conv-TasNet 与 IRM 基线的主观评分对比
Plate Nº IIIFigure:Conv-TasNet 与 IRM 基线的主观评分对比

上图说明:Figure:Conv-TasNet 与 IRM 基线的主观评分对比(论文原图)。

整个 Conv-TasNet 像一条三段流水线:编码器 -> 分离器 -> 解码器。下面把每一段掰开讲清楚。

1. 编码器:把波形切碎,每片打个数字标签

类比

想象你有一卷胶卷,剪成 2 毫秒一片。每片胶卷举到光下都有它独特的光斑模式。你给每片胶卷拍一个"光谱指纹"——一串 512 维的数字。

Conv-TasNet 的编码器就是这件事:把混音波形切成长度 L=16 个采样点(在 8kHz 采样率下就是 2 毫秒)的小段,每段过一个 1D 卷积,输出一串 N=512 维的数字。

输入 -> 处理 -> 输出

  • 输入:一段一维波形 x(一长串 -1~1 之间的数)。
  • 处理:把波形切成重叠的小段 x_k,每段 16 个采样点。每段乘以一个 N*L 的矩阵 U(N=512 行,每行是一个长度 L=16 的"基函数"),再可选地过一个非线性函数 H。用公式写就是 w = H(xU),其中 U 的每一行可以想象成一条特殊的"频率波纹"——输入波形和它越像,输出数字越大。
  • 输出:整段录音变成一个 N*T 的"特征图"——T 是时间帧数。可以理解成一种"自己学出来的频谱图",只不过它的"频率轴"不是物理频率,而是网络觉得对分离最有用的 512 种特征。

卷积(convolution):一种"滑动取窗口、每窗加权求和"的运算。一维卷积在波形上就是:从左到右滑一个小窗口,每次把窗口里的数和一组权重相乘相加。

基函数(basis function):编码器学到的那 N=512 个权重模板。每个模板像一个"频率+相位"的小波纹,输入波形跟它越像,对应的输出数字越大。论文里画图发现这些基函数自动聚集到了低频区,神似人耳的 mel 频率分布。

重叠(overlap):相邻段共享一半采样点(50% stride),避免边界处理出"咔嗒"声。

论文关于编码器非负性的深入讨论

原版 TasNet 对编码器输出强制加了 ReLU,要求输出必须是非负数。逻辑是:如果 mask 值在 0~1 之间,编码器输出也是非负的,那么 mask 乘完之后的物理含义才说得通("保留多少")。但 Conv-TasNet 做了五组对比实验(Table III),发现:

编码器 mask 函数 SI-SNRi (dB)
Pinv(伪逆自编码器) Softmax 12.1
线性(无 ReLU) Softmax 12.9
线性(无 ReLU) Sigmoid 13.1
ReLU(强制非负) Softmax 13.0
ReLU(强制非负) Sigmoid 12.9

结论出乎意料:去掉 ReLU 约束、让编码器输出允许正负都有,配上 Sigmoid mask 反而最好。作者的解释是:当编码器的表示维度远大于输入维度(N=512 >> L=16),即"过完备(overcomplete)"时,哪怕表示空间里有负数,网络也总能找到一组非负的 mask 来干净地分离信号。这条发现颠覆了从 ICA(独立成分分析)时代传下来的"非负性是必须的"这个设计教条。

过完备(overcomplete):表示空间的维度比输入维度大。就像给一个三维物体建立了 100 维的描述——信息冗余,但让后续操作有更大的灵活性。

为什么编码器这一步有用

  • 不再依赖"先 STFT 再分离"的两段流水线,编码器可以和后面的分离器一起训练,学出来的表示天然适合分离任务。
  • L=16 (2ms) 比 STFT 的 32ms 窗口短得多,最低延迟降到 1/16
  • 不显式区分"幅度"和"相位",相位信息隐式存在 N 维向量里,重建时不会丢。
  • 论文 Section IV.G 分析发现:编码器自动学出来的基函数中超过 60% 集中在 1kHz 以下,恰好对应人声基频范围。这个分布神似人耳的 mel 频率刻度——网络在没有任何人为设定的情况下重新发现了人类听觉系统的频率偏好。并且同频率的基函数展现了不同的相位偏移(在时域上表现为波形的平移),说明编码器显式地编码了相位信息——这恰好弥补了 STFT 方法丢相位的致命缺陷。

编码器超参数选择的工程直觉

论文 Table II 扫了三档滤波器数量:N=128/256/512。N 越大,表示空间越"过完备",分数越高(13.0 -> 13.1 -> 13.3 dB)。但 N 太大会增加后续分离器的计算量——因为分离器要在 N 维空间上做卷积。最终选 N=512 是精度和效率的平衡点。

滤波器长度 L 的选择则更有趣。L=40 对应 5ms 窗口,L=32 对应 4ms,L=16 对应 2ms。直觉上窗口越长看到的信息越多应该越好,但实验结果正好相反:L=16(2ms)最好。原因在于:(1) 短窗口提供更高的时间分辨率,让编码器能捕捉到更精细的波形结构;(2) 编码器有 N=512 个基函数——远远多于输入的 L=16 维——过完备度 N/L = 32 倍,足以弥补单窗口信息量的减少;(3) 短窗口还带来了延迟优势——最小算法延迟等于一个窗口长度 L/fs = 2ms,比 STFT 的 32ms 窗口短了 16 倍。

50% overlap(重叠)的原理

编码器使用 50% 的步长(stride = L/2 = 8 个采样点)。这意味着相邻两帧共享一半的输入采样点。为什么要重叠?因为在解码器端需要做"重叠相加"——如果没有重叠,相邻帧的拼接处会出现不连续(听起来就是"咔嗒"声)。50% 重叠保证了每个采样点恰好被两帧覆盖,重叠相加后边界平滑。这和 STFT 中的 COLA(Constant Overlap-Add)条件是一个道理,但在这里约束更松——因为编码器和解码器是一起学的,网络会自动学到满足平滑拼接条件的基函数。

所以这一节是想说:用一个学得出来的卷积层把波形切片编码,绕开了 STFT 的天花板,还顺便砍了延迟。编码器不需要强制非负——过完备的表示空间给了 mask 足够的灵活性。短窗口 + 高过完备度 + 50% 重叠是编码器设计的三个关键工程选择。


2. 分离器:用全卷积(TCN)画两张 mask

这是论文最核心的改动。原版 TasNet 用 LSTM 做分离,Conv-TasNet 把 LSTM 全部换成卷积。

类比

想象你要在一卷长长的乐谱上标注"这部分属于钢琴、这部分属于小提琴"。

  • 旧方法(LSTM):从乐谱开头一格一格往后看,每看一格都要记住前面所有内容。慢、容易乱、记不远。
  • 新方法(TCN + 空洞卷积):你有十几把不同长度的尺子,最短的看 3 格,第二把看 6 格,第三把看 12 格,每次翻一倍。所有尺子可以同时量,不用等前一把出结果。

TCN(temporal convolutional network,时序卷积网络):一个用堆叠卷积层处理时间序列的网络。和 RNN 比,它能并行算,速度快几个数量级。

空洞卷积(dilated convolution):卷积窗口里"跳格子"取样。第 k 层的窗口跳 2^k 格——这样网络深度每增加一层,能看到的上下文范围就翻一倍,几层之后就能覆盖整段录音。

感受野(receptive field):网络某个输出位置"看得到多长一段输入"。Conv-TasNet 最强配置感受野约 1.5 秒,刚好覆盖一句话的尺度。

LSTM(long short-term memory):一种循环神经网络,按时间一格一格地处理序列,每格依赖前一格。准确但慢。

输入 -> 处理 -> 输出

  • 输入:编码器输出的 NT 特征图。先过一层归一化(gLN 或 cLN),再过一个 11 卷积"瓶颈层"把通道数从 N(=512)压到 B(=128)。
  • 处理:进入 TCN 主体。整个分离器是 R 个重复块,每块包含 X 个卷积小模块,dilation 因子 1, 2, 4, ..., 2^(X-1)。最强配置 X=8, R=3,共 24 个卷积块。

每个卷积块的内部结构(论文 Figure 1C):

  1. 1x1 卷积:把通道数从 B(=128)扩到 H(=512)——叫"升维"。
  2. PReLU 激活 + 归一化:让数值稳定。
  3. D-conv(depthwise 卷积):每个通道独立做卷积,不混不同通道。这一步就是空洞卷积发生的地方——dilation 因子随层数指数增长。卷积核大小 P=3,但跳格后实际覆盖范围远大于 3。
  4. PReLU + 归一化:再来一次。
  5. 两个出口
    • 残差路(residual):1x1 卷积降回 B 维,加回输入,传给下一个块。
    • 跳连路(skip):1x1 卷积输出 Sc 维,所有块的跳连相加,最后变成总输出。

最后一个 1x1 卷积把总输出变成 C*N 个 mask(C=2 个说话人,每人一份 N 维 mask),通过 Sigmoid 函数映射到 0~1 范围。

  • 输出:C 张 mask,每张和编码器输出同形状(N*T)。

关键公式翻译成人话

原文:d_i = w (element-wise multiply) m_i

人话:"第 i 个人的特征 = 编码器输出 * 第 i 个人的 mask"。逐元素相乘——一个长度为 N 的向量乘上另一个同长度的向量,得到第三个 N 维向量。mask 里接近 1 的位置保留,接近 0 的位置压掉。

深度可分离卷积——为什么模型这么小

depthwise separable 卷积(深度可分离卷积):把"标准卷积"拆成"D-conv(每通道独立卷)+ 1x1 卷积(混通道)"两步。标准卷积需要 GHP 个参数,分离后只要 GP + GH 个——当 H 远大于 P 时(这里 H=512, P=3),参数量大约缩减到原来的 P/(H+P) ≈ 1/170。Conv-TasNet 用这一招把整个模型压到 5.1M 参数。MobileNet 就靠同样这一招让卷积神经网络能跑在手机上。

归一化方法:gLN vs cLN

分离器里的归一化层有两种选择:

  • gLN(global layer normalization):对整段录音的所有通道、所有时间帧一起算均值和方差做归一化。需要看到完整输入,属于非因果操作——离线场景用。
  • cLN(cumulative layer normalization):只用到当前帧及之前帧的统计量。属于因果操作——实时场景用。

两者的性能差异很大:gLN 配置达到 15.3 dB SI-SNRi,cLN 只有 10.6 dB,差了 4.7 dB。这 4.7 dB 就是"实时 vs 离线"的代价。

因果(causal):只看过去和当前,不偷看未来。实时系统必须因果——你还没收到未来的音频帧,怎么用它?

非因果(non-causal):可以看整段录音。离线处理(比如录音转写后处理)可以非因果。

超参数对分数的影响(消融实验,Table II)

论文系统地扫描了各种超参数组合,核心发现:

超参数 发现
编码器滤波器数 N 128 -> 256 -> 512,越多越好(过完备度提高)
滤波器长度 L 40 -> 32 -> 16,越短越好(LSTM 时代做不到——序列太长训练崩了)
瓶颈维度 B vs 卷积通道 H 小 B(128) + 大 H(512) 效果好,H/B 比率约 4~5 为最佳
每次重复的块数 X 和重复次数 R X=8, R=3(感受野 1.5s)最强,同参数量下深网络优于浅网络
因果 vs 非因果 非因果(gLN)15.3 dB >> 因果(cLN)10.6 dB

为什么分离器这一步有用

  • 并行:所有时间步可以同时算,速度比 LSTM 快好几倍。
  • 稳定:LSTM 对"录音从哪一秒开始"很敏感(论文 Figure 4 显示 LSTM-TasNet 移动几个采样点分数能掉好几分),TCN 因为每个位置只看周围有限上下文,偏移几个采样点几乎没影响。这点用论文原话说:"Conv-TasNet 的帧间处理是解耦的,前一帧的错误不会传播到后续帧"。
  • :用 depthwise separable 卷积后,整个 Conv-TasNet 只有 5.1M 参数,比同期模型小 6~18 倍。

残差路和跳连路为什么都要

分离器的每个卷积块有两条出路:残差路(residual)和跳连路(skip-connection)。残差路的作用是"信息高速公路"——把输入直接加到输出上,让梯度能跳过中间的非线性层直接回传,解决深层网络训练困难的问题。这和 ResNet 的残差连接是同一个思想。跳连路则不同——它把每一层的中间产物汇聚到最终输出,让浅层特征也能直接影响 mask 生成。可以这样理解:残差路负责"让信号顺畅地往深处传",跳连路负责"让每一层都有发言权"。论文选择了所有跳连路相加再做最后的 1x1 卷积,而不是只用最后一层的输出。这种设计来自 WaveNet 论文 [38]。

mask 生成的最后一步

所有跳连路相加之后,通过一个 PReLU + 1x1 卷积,输出维度变成 C*N(C 个说话人,每人 N 维)。然后通过 Sigmoid 函数把每个值压到 [0, 1] 范围,得到 C 张 mask。原版 TasNet 用的是 Softmax(要求 C 个 mask 在每个位置加起来等于 1),但 Conv-TasNet 发现 Sigmoid 更好——因为 Sigmoid 不强制 mask 求和为 1,给了模型更多灵活性。想象两个人在某个时刻都不说话的情况:Softmax 必须把 mask 分给某个人(总和=1),而 Sigmoid 可以两个都接近 0("两个都不要")。

所以这一节是想说:用堆叠空洞卷积代替 LSTM,让分离器又快又稳又小,还能看到 1.5 秒长的上下文。深度可分离卷积是"小"的秘密武器,gLN/cLN 的选择决定了能不能实时。残差路和跳连路的双通道设计让深层网络既好训练又不丢信息。


3. 解码器:把"加 mask 后的特征"反推回波形

类比

回到上面那卷胶卷的比喻:你已经得到"属于说话人 A 的胶卷光斑模式",现在要把这些光斑还原成胶卷上的画面。

输入 -> 处理 -> 输出

  • 输入:第 i 个人的特征 d_i = w * m_i(编码器输出乘以 mask),形状 N*T。
  • 处理:一个 1D 反卷积层(数学上等于另一个矩阵乘法):s_hat_i = d_i * V,其中 V 是一个 N*L 的矩阵,每一行是一个"解码基函数"。把 N 维特征向量乘上 V,得到 L=16 个采样点的小段波形。
  • 输出:相邻段重叠相加(overlap-and-add),拼回完整的分离后波形。

反卷积(transposed convolution):可以理解成"卷积反着做"。普通卷积把波形压成特征向量,反卷积把特征向量还原成波形。

重叠相加(overlap-and-add):相邻段共享一半采样点,相加后边界平滑过渡,避免"咔嗒"声。

为什么解码器这一步有用

  • 解码器是纯线性的,不带 ReLU 之类的非线性。这意味着它就是一组学出来的"反向滤波器",做的事情和"反向 STFT"对应,但模板是网络自己学的。
  • 论文意外发现:编码器输出不必非负、解码器也不必是编码器的逆,让网络自己决定怎么编码/解码反而更好。传统自编码器理论认为 decoder 应该是 encoder 的伪逆矩阵(即 V = pinv(U)),但实验表明这种强制约束反而降低了分数(12.1 dB vs 13.1 dB)。

所以这一节是想说:解码器只是把分离后的特征反推回波形,结构极简,所有秘密都在编码器和分离器里。


4. 训练目标:用 SI-SNR 当指南针

类比

教学徒切土豆丝。怎么打分?传统办法是"和老师切的对比"——但老师手抖一下就全错。SI-SNR 是另一种打分:先把两份土豆丝缩放对齐(不管谁切得粗细绝对值),再比形状有多像。

输入 -> 处理 -> 输出

  • 输入:估计的分离波形 s_hat 和原始干净波形 s。
  • 处理:
    1. 先做零均值归一化(消除直流偏移)。
    2. 计算"目标投影":s_target = (<s_hat, s> / ||s||^2) * s。直觉是把估计信号投影到真实信号方向上,只保留"对的那部分"。
    3. 计算"噪声":e_noise = s_hat - s_target。就是估计信号里"不对的那部分"。
    4. SI-SNR = 10 * log10(||s_target||^2 / ||e_noise||^2)。目标分量的能量和噪声分量的能量做比值取 log。
  • 输出:SI-SNR 值(dB),越高越好。训练时 loss = -SI-SNR,最大化即可。

SI-SNR(scale-invariant signal-to-noise ratio):一种"对音量缩放免疫"的信噪比。先投影对齐,再算"目标 vs 残差"的能量比,取 log 乘 10。单位是 dB。值越大越好。"scale-invariant"的意思是:即使把估计信号放大或缩小任意倍数,SI-SNR 不变——因为投影操作已经自动对齐了缩放。

uPIT(utterance-level permutation invariant training):训练时不知道"哪个输出对应哪个说话人"——可能输出 1 是 A、可能是 B。uPIT 就是"两种可能性都算一遍 loss,取小的那个",避免被排列顺序坑死。比如两个说话人有 2!=2 种排列,三个说话人有 3!=6 种排列——uPIT 枚举所有排列,选 loss 最小的那个作为这一步的梯度方向。

SDR / SDRi:另一种相关指标。SI-SNRi 和 SDRi 都是"分离后比分离前提升了几 dB",越大越好。人耳对 1dB 的提升就能听出来。

训练细节

  • 训练 100 epoch,每段 4 秒长。
  • Adam 优化器,初始学习率 1e-3;验证集连续 3 个 epoch 不涨就把学习率减半。
  • 梯度裁剪:L2 范数上限为 5。
  • 数据集:WSJ0-2mix(30 小时训练 + 10 小时验证 + 5 小时测试,所有波形重采样到 8kHz)。

为什么这步有用

  • 直接对最终评测指标(SDR/SI-SNR)优化,不用借道"先逼近频谱"。
  • SI-SNR 的"缩放不变"性质让训练对录音音量大小免疫,更稳。
  • uPIT 解决了"谁是输出 1、谁是输出 2"的歧义,让网络不会在排列问题上浪费训练信号。

所以这一节是想说:训练就是反复让网络把 SI-SNR 拉高,目标和评测指标完全一致。uPIT 搞定了说话人排列歧义,SI-SNR 的缩放不变性让优化更稳定。


Conv-TasNet — 方法示意:核心 pipeline
Plate Nº IVConv-TasNet — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们告诉你"这条路通"。

主结果对比(WSJ0-2mix,两人混音)

方法 参数量 因果 SI-SNRi (dB) SDRi (dB)
DPCL++ 13.6M 10.8 --
uPIT-BLSTM-ST 92.7M -- 10.0
DANet 9.1M 10.5 --
Chimera++ 32.9M 11.5 12.0
WA-MISI-5 32.9M 12.6 13.1
BLSTM-TasNet 23.6M 13.2 13.6
Conv-TasNet-gLN 5.1M 15.3 15.6
uPIT-LSTM 46.3M -- 7.0
LSTM-TasNet 32.0M 10.8 11.2
Conv-TasNet-cLN 5.1M 10.6 11.0
IRM(理想比例 mask) -- -- 12.2 12.6
IBM(理想二值 mask) -- -- 13.0 13.5
WFM(维纳 mask) -- -- 13.4 13.8

三人混音结果(WSJ0-3mix)

方法 参数量 SI-SNRi (dB) SDRi (dB)
DPCL++ 13.6M 7.1 --
ADANet 9.1M 9.1 9.4
Conv-TasNet-gLN 5.1M 12.7 13.1
Conv-TasNet-cLN 5.1M 7.8 8.2

速度对比

方法 CPU TPF (ms) GPU TPF (ms) 帧长 (ms)
LSTM-TasNet 4.3 0.2 5.0
Conv-TasNet-cLN 0.4 0.02 2.0

主观质量(MOS,40 人打分,满分 5)

方法 MOS PESQ
Conv-TasNet-gLN 4.03 3.22
IRM 3.51 3.74
Clean(原始干净语音) 4.23 4.5

生活语言解读

  • Conv-TasNet 的 15.3 dB SI-SNRi 是第一个把"理想 T-F 幅度 mask"全打败的方法——过去十几年大家以为是天花板的东西被捅破了。
  • 5.1M 参数(约 20MB 模型文件)比 uPIT-BLSTM-ST 的 92.7M 小 18 倍——可以塞进手机和助听器。
  • CPU 上处理一帧 0.4ms,帧长 2ms——比帧长快 5 倍,意味着真能实时跑。LSTM 版本 4.3ms 几乎贴着 5ms 帧长,稍微赶不上就掉帧。
  • MOS 4.03 比 IRM 高(3.51),逼近原始干净录音的 4.23——人耳投票认为 Conv-TasNet 的分离质量更好。但 PESQ 反而给 IRM 打分更高(3.74 vs 3.22),说明 PESQ 这种基于频谱的自动指标在评估时域方法时有系统性偏差。

所以这一节是想说:数据告诉我们——并行卷积 + 短窗口 + 学得出来的表示,三件套合起来彻底翻了一个时代的天花板。


实验结果说明了什么

论文的实验不只是报个分数,它还回答了几个"为什么"和"什么情况下"的问题:

1. 编码器该不该加 ReLU?——不该。 Table III 做了五种编码器-解码器配置对比。伪逆自编码器(强制完美重建)最差(12.1 dB),线性编码器 + Sigmoid mask 最好(13.1 dB)。这说明让编码器和解码器各自自由学习,比强制它们互为逆运算更好。

2. 什么超参数最关键?——短窗口 L=16 和深网络 X=8, R=3。 Table II 做了系统消融。滤波器长度从 L=40 缩到 L=16,分数从 14.5 涨到 15.3——LSTM 时代不可能把窗口做这么短,因为序列长度翻倍后 LSTM 训练就崩了,TCN 没这个问题。同参数量下 X=8,R=3(深+窄)优于 X=6,R=4(浅+宽)和 X=4,R=6,说明网络深度比宽度重要

3. LSTM-TasNet 有多脆弱?——起始点偏移就崩。 Figure 4 是论文最有说服力的可视化之一。把输入波形平移几个采样点,LSTM-TasNet 的 SDRi 剧烈波动(标准差很大),而 Conv-TasNet 几乎不受影响。原因是 LSTM 的 cell state 会一帧一帧累积错误——第一帧错了,后面帧帧都歪。Conv-TasNet 每个时间位置只看局部上下文,错了就错了,不会"感染"邻居。

4. 人耳和自动指标谁说了算?——人耳。 PESQ(基于频谱设计的自动指标)给 IRM 打分更高,但 40 个人实际听下来一致认为 Conv-TasNet 更好(MOS 4.03 vs 3.51,p < 1e-16)。论文推测 PESQ 的偏差来源于它依赖幅度频谱来评估质量——对时域方法先天不友好。这个发现对后续评测标准的选择产生了影响。

5. 三人混音呢?——从 15.3 掉到 12.7,但仍大幅领先。 WSJ0-3mix 上 Conv-TasNet 的 SI-SNRi 比 ADANet 高出 3.6 dB。不过三人场景仍然比两人场景难得多,分数下降了 2.6 dB。

所以这一节是想说:实验不仅证明了 Conv-TasNet 分数高,更揭示了"短窗口 + 深网络 + 解耦帧处理"是性能的核心来源,而"非负约束是必须的"和"PESQ 是可靠的"这两个旧共识都被推翻了。


你应该懂的几个新词

语音分离(speech separation):从一段多个人同时讲话的混音里把每个人的声音分开。鸡尾酒会问题的工程版。

STFT(短时傅立叶变换):把声音切成小窗口,每窗口算"频率成分 + 相位"。是传统语音处理的基础。

频谱图(spectrogram):STFT 的可视化结果,一张时间-频率二维热图。

mask(蒙版):一张权重图,乘到频谱或特征上做"过滤"。把"想保留的乘 1、想抹掉的乘 0"。

理想 mask(IBM/IRM/WFM):用真实分离前的纯净声音算出来的"作弊版" mask,在频谱域曾被视作上限。IBM 是 0/1 二值(哪个说话人在这个时频格子里能量大就给谁),IRM 是能量比例(连续值),WFM 是能量平方比例。Conv-TasNet 在波形域的分数把它们都超过了。

TCN(temporal convolutional network):用堆叠卷积层处理时间序列的网络,可并行、可看长上下文,常用来替代 RNN。

空洞卷积(dilated convolution):卷积窗口跳格采样,每深一层视野翻倍。让 TCN 能看到长上下文。

深度可分离卷积(depthwise separable conv):把卷积拆成"逐通道 + 逐位置"两步,参数量大幅缩减。MobileNet 同款。

PReLU:一种激活函数。普通 ReLU 把负数直接抹零,PReLU 给负数留一个可学习的小斜率,避免"神经元死掉"。

gLN / cLN(global / cumulative layer normalization):两种归一化方法。gLN 看整段录音的均值方差(非因果,离线用);cLN 只看到当前及之前的帧(因果,实时用)。

SI-SNR(scale-invariant SNR):对音量缩放免疫的信噪比,单位 dB,越高越好。本论文的训练目标和评测指标。

uPIT(utterance-level permutation invariant training):训练时对说话人顺序做"所有排列都试一下取最优",绕开 label 顺序问题。

WSJ0-2mix / 3mix:标准两人 / 三人混音测试集,从《华尔街日报》朗读语料 WSJ0 拼出来。社区公认的 benchmark。

过完备(overcomplete):表示空间的维度大于输入维度。让编码有冗余,后续操作更灵活——类似给一个三维物体建 100 维描述。

所以这一节是想说:上面这些词在 2019 年之后所有语音分离论文里反复出现,先把它们和生活类比挂钩。


它有什么搞不定的

论文最后一节和实验结果暗示了多条短板:

  • 长时跟踪人会掉链子:网络感受野固定 1.5 秒。如果一个人停顿超过这个时长再开口,模型可能把他归到另一个输出通道上,造成"同一个人被切成两段不同身份"。这个问题后来被 DPRNN 的双路径设计部分缓解。

  • 混响和噪声没测:训练数据是干净拼接的,没加混响。真实房间里墙壁反射会让一个声音"拖尾",时域方法对这种拖尾比频域方法更敏感,泛化效果未知。论文原文也承认"time-domain approaches are more prone to temporal distortions which are particularly severe in reverberant acoustic environments"。

  • 三人以上还是难:WSJ0-3mix 上分数从 15.3 掉到 12.7,说话人越多越吃力。再加一两人就需要多麦克风(多通道)方案。

  • 因果版性能大幅下降:非因果 15.3 dB vs 因果 10.6 dB,差了 4.7 dB。对于助听器等实时场景,这意味着离实际好用还有差距。

  • 只在朗读语音上测过:WSJ0 是新闻朗读语料,语速均匀、口音少、无情绪变化。日常对话中的打断、笑声、叹气等非语音信号是否影响分离质量,论文没有验证。

  • 固定说话人数:模型需要预先知道混音中有几个人。训练 2 人模型不能直接用于 3 人场景——你需要重新训练一个 3 人版本。

所以这一节是想说:Conv-TasNet 在干净两人场景里封顶,但混响、超过三人、长跟踪、因果性能损失、固定说话人数这五件事还要后续工作来补。


它和别的论文是什么关系

  • 同一系列:LSTM-TasNet -> Conv-TasNet -> DPRNN / SepFormer。Conv-TasNet 把 LSTM-TasNet 里的 LSTM 换成 TCN,是 TasNet 系列的二代。后续 DPRNN、SepFormer 在分离器架构上继续迭代(双路径 RNN、Transformer),但编码器-分离器-解码器三段流水线不变——这套范式由本篇定型。
  • 和 LLaVA 的对照:本笔记 11 篇里的 LLaVA(多模态 VLM)也是"先用一个简单接口接两个模块,把劲使在数据/任务上"——LLaVA 的接口是一层投影矩阵,Conv-TasNet 的接口是一层卷积编码器。**两篇都示范了"接口故意做简单,性能提升来自端到端训练"**这条设计哲学。
  • 和 WaveNet 的关系:WaveNet(论文引用 [38])是把空洞卷积用在波形生成上的开山之作,Conv-TasNet 把同样的工具搬到了"波形分离"。两者证明了**"在原始波形上做端到端深度学习"是可行的**,不必绕道频谱图。
  • 和 SoundStream / EnCodec 的关系:Conv-TasNet 证明了"学出来的编码器优于 STFT",这个结论后来被 SoundStream(2021)和 EnCodec(2022)借鉴——它们也用学出来的卷积编码器做音频压缩/编码,而不是走传统的 MDCT(改进离散余弦变换)。
  • 被引扩散到何处:后续语音增强(speech enhancement)、音乐分离(source separation for music)、目标说话人提取(target speaker extraction)等几乎都从 Conv-TasNet 改的。在具身 AI 里,机器人感知模块要从环境噪声中分出"主人指令"也常用 TasNet 系列。

所以这一节是想说:Conv-TasNet 是 2019 年语音分离的范式转折点,把整个领域从"频谱域"拉到了"时域端到端"。它定义的编码器-分离器-解码器三段架构至今仍是后续工作的默认骨架。


和本导读的关系

Conv-TasNet 属于 Ch20: 听觉智能 的核心论文。Ch20 将它定位为听觉分离系统的 backbone——就像 ResNet 之于视觉,Conv-TasNet/DPRNN 之于听觉分离。

具体来说:

  • Ch20 的 20.6.4 节专门讲解了 Conv-TasNet 的"编码器-分离器-解码器"三段架构和关键数字。
  • 后续 20.7 节的 Proactive Hearing(主动聚焦目标说话人)直接在 Conv-TasNet/DPRNN 的基础上增加了方向注意力机制。
  • 20.8 节的 NeuralAids(神经助听器)则是在类似架构上加入了超低功耗约束。
  • Ch20 开篇(20.1)讨论了机器人为什么需要"耳朵"——声音携带材质信息、状态变化、语音指令、方向与距离四类信息,这恰好是 Conv-TasNet 在具身 AI 中的应用场景:从环境噪声中分出主人指令、从多人说话场景中隔离目标声源。

在更宏观的导读体系中,Conv-TasNet 和 Ch8(CLIP)、Ch9(LLaVA/BLIP-2)、Ch19(RF 感知)一起构成了具身 AI 的多模态感知层——视觉、语言、射频、听觉各一条线,最终汇聚成机器人理解环境的完整"感官系统"。

所以这一节是想说:Conv-TasNet 是 Ch20 听觉智能的地基,后续的主动听觉和神经助听器都建筑在它定义的时域分离范式上。


思考题

Q1:Conv-TasNet 的编码器和 STFT 有什么本质区别?如果编码器学出来的东西和 STFT 很像,那为什么还要"学"?

提示

从三个角度想:(1) STFT 的基函数是固定的正弦/余弦波,编码器的基函数是可训练的——它能学出任意形状的波形模板;(2) STFT 强制把信号拆成幅度+相位,编码器的 N 维输出隐式地把相位信息编码在向量里,不存在"丢相位"的问题;(3) 虽然论文发现学出来的基函数频率分布像 mel 刻度,但它们额外编码了相位信息(同频率基函数有不同相位偏移),这是 STFT 做不到的。所以"像"是因为人声信号的物理特性决定了低频重要,但"学"的好处是编码器能针对分离任务做到 STFT 做不到的事。

Q2:TCN 的空洞卷积感受野是怎么指数增长的?假设每块的 dilation factor 是 1, 2, 4, ..., 128(X=8),kernel size P=3,重复 R=3 次,感受野大概有多长?

提示

每个空洞卷积块的感受野增量 = dilation * (P-1) = dilation * 2。一个重复块的总感受野增量 = 2 * (1+2+4+...+128) = 2 * 255 = 510 帧。重复 3 次 = 510 * 3 = 1530 帧。再加上初始的 1 帧,总感受野约 1531 帧。每帧步长 = L/2 = 8 个采样点,在 8kHz 下 = 1ms/帧。所以感受野约 1531ms ≈ 1.5 秒——论文说的就是这个数字。1.5 秒大约是一句话的长度,足以覆盖语音分离所需的上下文。

Q3:uPIT(排列不变训练)为什么是必要的?如果不用 uPIT 会发生什么?

提示

设想训练时标签是 [说话人A, 说话人B],但网络恰好把 A 输出到通道 2、B 输出到通道 1。如果直接计算 loss(通道 1 vs A, 通道 2 vs B),loss 会很大——但网络其实分得很好,只是顺序反了。如果不用 uPIT,网络会被这种"正确的分离但错误的排列"惩罚,梯度方向混乱,训练不收敛。uPIT 穷举所有排列(2 人只有 2 种),选 loss 最小的那个来反传,绕开了这个问题。

Q4:SI-SNR 为什么叫"scale-invariant"?这个性质对训练有什么好处?

提示

如果把估计信号 s_hat 放大 10 倍,SI-SNR 的值不变——因为计算时先做投影对齐(s_target = (<s_hat, s>/||s||^2) * s),投影操作本身会吸收掉缩放因子。好处是:训练中网络不需要同时学"怎么分离"和"输出音量该多大"这两件事——音量维度被 SI-SNR 自动消掉了,网络可以集中精力优化波形形状的相似度。这让训练更稳定,不容易因为音量忽大忽小而导致梯度抖动。

Q5:论文发现 PESQ 给 IRM 打高分但人耳给 Conv-TasNet 打高分。这种"自动指标和人耳不一致"的现象说明了什么?

提示

PESQ 是基于幅度频谱设计的——它比较的是分离语音和原始语音在频谱图上的差异。IRM 本身就在频谱域上操作,产出的结果天然"频谱友好";而 Conv-TasNet 在时域操作,可能产出频谱不那么"干净"但听起来更自然的波形。这说明:(1) 评测指标的设计假设会偏向某类方法;(2) 当研究范式发生转变(从频域到时域)时,老的评测指标可能不再可靠;(3) 人耳评测虽然贵但在关键对比中不可替代。后续很多语音分离论文开始报告 MOS 就是受了这篇的影响。

Q6:Conv-TasNet 的因果版(cLN)比非因果版(gLN)差 4.7 dB。如果你要为助听器设计一个实时系统,你会怎么缩小这个差距?

提示

几个方向可以想:(1) 用"有限未来上下文"——不看整段录音但允许看未来 10-20ms,这在助听器里可以接受(多等 20ms 用户感知不到),能比纯因果好很多;(2) 用 DPRNN 的双路径结构代替 TCN——intra-chunk 做因果、inter-chunk 看少量未来 chunk;(3) 用知识蒸馏——先训一个大的非因果"老师"模型,再训一个小的因果"学生"模型模仿老师的输出。实际上后续的 Proactive Hearing(Ch20.7)就是在类似架构上做了低延迟优化。

Q7:为什么 Conv-TasNet 用 L=16(2ms 窗口)分数最好,而传统 STFT 方法不可能用这么短的窗口?

提示

STFT 有一个物理限制叫"时频不确定性原理"——窗口越短,频率分辨率越低。2ms 的窗口只能分辨 500Hz 的频率精度,对语音分离来说远远不够(人声基频在 80-300Hz 范围,需要几十 Hz 的分辨率才能区分两个说话人的 pitch)。但 Conv-TasNet 的编码器不受这个限制——它的 512 个基函数不是正弦波,可以是任意形状,所以短窗口不意味着低"分辨率"。另一方面,LSTM-TasNet 也做不到 L=16:窗口从 40 缩到 16 意味着序列长度变成 2.5 倍,LSTM 的训练在这么长的序列上会崩溃(梯度消失/爆炸),而 TCN 没有这个问题。


一些好奇心问答(FAQ)

Q1:为什么放弃 STFT 这么好用的工具?

STFT 是一种"通用"变换,不是为分离设计的。它把信号拆成幅度+相位,但分离任务里相位极难预测,丢了相位就丢了上限。让网络自己学一种只服务于分离的变换,反而能突破上限。

Q2:编码器学出来的东西像不像 STFT?

很像但更聚焦。论文 Section IV.G 画了所有基函数的频率响应,发现:超过 60% 的滤波器集中在 1kHz 以下,恰好对应人声基频范围。这个分布像 mel 频率(人耳的非线性频率感知),但是网络自动学到的,没有任何人为设定。而且同频率的基函数展现出不同的相位值——通过时域波形的循环平移来显式编码相位信息,这是 STFT 做不到的。

Q3:TCN 比 LSTM 强在哪?

三件事:(1) 并行——所有时间步同时算;(2) 稳定——感受野固定,对录音起始点偏移不敏感;(3) 小——参数量比 deep LSTM 少很多。代价是理论上 TCN 看不到无限远的过去,但实际语音任务用 1.5 秒上下文足够。

Q4:因果版和非因果版差多少?

因果版(cLN,只看过去)SI-SNRi 10.6 dB,非因果版(gLN,看整段)15.3 dB——差 4.7 dB。这是实时 vs 离线的代价。助听器场景必须用因果版,电话会议后期可以用非因果版。

Q5:5.1M 参数到底有多小?

折算下来大约 20MB 模型文件。骁龙 855 这种几年前的手机芯片就能跑实时(CPU TPF 0.4ms < 帧长 2ms)。理论上助听器的微控制器加点优化后也能跑,这是这篇论文真正"接地气"的地方。

Q6:为什么 PESQ 给 IRM 打分高,MOS 给 Conv-TasNet 打分高?

PESQ 是基于幅度频谱设计的自动指标——它"喜欢"频谱看起来干净的方法。Conv-TasNet 在时域工作,频谱可能不那么"漂亮"但听起来更自然。人耳投票才是金标准,论文专门做了 40 人主观实验来证明这一点。

Q7:LSTM-TasNet 对起始点为什么那么敏感?

LSTM 状态会一帧一帧累积。如果第一帧错了,错误会顺着 cell state 传播下去,越攒越多。Conv-TasNet 每个时间位置只依赖局部上下文,错了就错了,不会污染后续帧。这是论文 Figure 4 想说的最重要的事。

Q8:之后该看什么?

  • DPRNN(2020):把 TCN 换成"双路径 RNN",分数继续涨(18.8 dB SI-SNRi)。
  • SepFormer(2021):把 TCN 换成 Transformer,是 WSJ0-2mix 的后续 SOTA。
  • Demucs / Hybrid-Demucs(2021-2022):把 Conv-TasNet 思路搬到音乐分离,能把人声/鼓/贝斯/其它四轨拆开。

整个 TasNet 家族在 2020 年后都用 Conv-TasNet 当 baseline 比较——它是这个领域的"GPT-2 时刻"。

所以这一节是想说:实操问题(多大、多快、能不能实时、怎么对照)作者都给了答案,门槛比看起来低很多。


如果你想再深入

按"前传 -> 同期对手 -> 续作 -> 衍生方向"四类排序:

  1. 前传:LSTM-TasNet(2018) — 同一组人。Conv-TasNet 之前的 v1,把分离从频域搬到时域,但用 LSTM 做分离器。读完它能清楚看到"为什么必须换 TCN"。
  2. 同期对手:Wave-U-Net(2018) — 把 U-Net 架构搬到时域音频分离,多用于音乐。和 Conv-TasNet 比能看出"U-Net 风格 vs 编码器-分离器-解码器风格"两条流派。
  3. 续作:DPRNN(2020) — 双路径 RNN,把长序列拆成"段内 + 段间"两次循环,进一步提升长上下文建模能力。SI-SNRi 比 Conv-TasNet 再涨 3 dB 左右。
  4. 续作:SepFormer(2021) — 用 Transformer 替换 TCN/RNN,是当前 WSJ0-2mix SOTA。如果你看完 Conv-TasNet 直接跳过 DPRNN 也能读,但 SepFormer 比 Conv-TasNet 大 10 倍以上,回到了"靠模型大取胜"的路上。
  5. 衍生:Demucs / Hybrid-Demucs(2021-2022) — Facebook 把 Conv-TasNet 思路套到音乐源分离上,最终和频域方法做了混合(两路并联)。这条线说明:纯时域不是终点,时域+频域混合可能是更好的方向

所以这一节是想说:把 Conv-TasNet -> DPRNN -> SepFormer 三篇连起来读,就能看到 2018-2021 年端到端语音分离的演化全貌。


原文信息

BibTeX

@article{luo2019conv,
  title={Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation},
  author={Luo, Yi and Mesgarani, Nima},
  journal={IEEE/ACM Transactions on Audio, Speech, and Language Processing},
  volume={27},
  number={8},
  pages={1256--1266},
  year={2019},
  publisher={IEEE}
}

链接

作者

Yi Luo, Nima Mesgarani(哥伦比亚大学电气工程系 Neural Acoustic Processing Lab)

所以最后一节是想说:Conv-TasNet 不只是分数好看,而是把整个语音分离领域从"频谱域思维"拉进了"端到端时域思维"——这是 2019 年语音 AI 的一个标志性瞬间。

引用本笔记 / Cite this note
BibTeX
@online{eai_conv_tasnet_2026,
  title       = {(readable note) Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2019 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/conv-tasnet/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?