Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 11

Proactive Hearing Assistants that Isolate Egocentric Conversations

33 min read · 11682 字 · ⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI / 音频信号处理"的读者写的精读笔记。所有专业词第一次出现都会解释清楚。只看这份笔记就能理解全文机制。


一句话讲什么(TL;DR)

戴上这副耳机,它自动听出"现在你在跟谁聊天",把同伴的声音放大、把陌生人和噪音压下去——你一个按钮都不用按,甚至不用提前录入任何人的声音。它靠的不是"认声音",而是"认对话节奏"。

所以这一节是想说:耳机要从"被动放大全场"升级成"主动挑人听",核心武器是对话的节奏规律。


这是个什么场景

周五晚上你和两个朋友约火锅。锅在咕嘟、隔壁桌在喊"我跟你讲那个梅西啊"、服务员在背后喊"38 号上菜",对面朋友刚说完一句你最想听的——你只听到半句。

你下意识把头凑过去,喊一声"你说啥?"

戴助听器的人每天都在过这种日子,而且更糟。普通助听器只会把所有声音一起放大——锅声、隔壁桌的争论、服务员的吆喝,全都更响了。结果是:越听越累,朋友说什么还是听不清。

这就像你打开手机相机想拍朋友的脸,但相机不会对焦——它把整个画面同等清晰地拍下来,你的朋友只是其中模糊的一小块。

这种"一群人同时说话,你只想听其中几个"的难题,研究界叫鸡尾酒会问题(cocktail party problem)——想象一个嘈杂的鸡尾酒派对,所有人都在聊天,你想听清面前这个人的话,大脑必须做的那种"声音过滤"。

鸡尾酒会问题(cocktail party problem):多人同时说话时怎么只听清一个目标的难题。名字来源于酒会场景——几十个人同时聊天,你的大脑能自动聚焦到跟你说话的人,但机器做不到。

再说一个关键词:第一视角音频(egocentric audio)。这个词的意思是"从佩戴者自己耳朵位置录到的声音"——类似第一人称视频 vlog,只不过换成声音版。你左右耳听到的声音有细微差别(左边的人声音先到左耳、后到右耳),这些差别本身就携带了方向信息。本文的系统正是利用这种双耳录音来工作的。

读到这里你应该懂了:这篇论文要做的事,就是让耳机会"对焦"——自动判断谁是你的对话伙伴,把他们的声音调清楚,把别的调暗。而且全程不需要你动手指。

所以这一节是想说:现实生活里的听觉混乱很普遍,本文要给它一个完全自动化的机器解决方案。


Proactive Hearing Assistants that Isolate Egocentric Conversations — 场景示意:这论文要解决的现实问题
Plate Nº IProactive Hearing Assistants that Isolate Egocentric Conversations — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

研究界和耳机厂之前已经试过几条路,但都有明显短板:

方法 核心思路 致命问题
用户手动选方向 像相机手动对焦,在手机上点选"我要听左边" 等你操作完,对面那句话早过去了
苹果 AirPods"对话感知" 检测到你开口就把背景音降一档 不知道你在跟谁说,不分离特定人
提前录声纹 先录一段朋友声音当"身份证",后续匹配 新来一个人没录过就失效
离线算法(TCE) 用轮流说话节奏找到对话伙伴 需要看到未来几秒录音才能算,做不了实时
单耳麦克风 一个麦克风收音 丢掉了左右耳差别这个方向线索
脑电波解码(NeuroHEED) 贴电极在头上,读你大脑的注意力 需要侵入性硬件,现实中几乎不可用

这就像你想拍一群在跑动的小朋友,但相机:必须手动追焦(慢)、必须提前录入每个人的脸(麻烦)、拍下来要等几秒才出图(不实时)。显然没法日常使用。

其中最值得关注的前作是 Target Conversation Extraction (TCE),它跟本文来自同一个实验室(华盛顿大学 Gollakota 组),也用了轮流说话的节奏。但 TCE 有三个关键限制:(1) 离线处理,需要未来上下文;(2) 依赖预先提取的说话人嵌入向量;(3) 只用单声道录音。本文就是在 TCE 基础上做的"实时化 + 双耳化 + 免注册化"升级。

所以这一节是想说:旧方法要么慢、要么需要预先准备、要么不知道"对话关系"是什么,这篇论文要同时解决所有这些问题。


这篇论文的新想法

核心洞察一句话概括:

不去问"这个声音是谁的",而是问"谁正在跟我配合说话"。

传统方法试图识别"身份"——录一段 Alice 的声音,然后去混合声音里找 Alice。本文换了一个全新的切入角度:识别"关系"——你跟朋友说话时天然会一来一回(你说完一段,对方接一段,几乎不会同时开口,停顿很短),而隔壁桌的人跟你的说话节奏完全不同步。

这个节奏差异就是身份的替代品。

具体来说,本文有三个核心贡献:

贡献 1:自语锚点(self-speech anchor)。系统先用波束成形器从双耳录音中提取"你自己在说什么",把你自己的声音当作"我在参与对话"的信号。不需要任何预录音。

贡献 2:双模型架构(dual-model architecture)。一个慢模型每 1 秒看一次全局,总结出"这场对话长什么样";一个快模型每 12.5 毫秒出一次实时结果。两者配合,既看得远又跑得快。

贡献 3:合成数据训练 + 真实世界验证。用真人对话的时间戳 + 合成语音 + 模拟房间来训练,然后在 11 个人的 6.8 小时真人录音上验证。

类比:想象你在一个化装舞会上找同伴。传统方法是"看长相找人"(声纹识别),本文的方法是"看谁在跟你配合跳舞"(节奏匹配)——即使所有人都戴着面具,你也能从舞步的配合中找到你的舞伴。

所以这一节是想说:不靠声纹靠节奏,从"识别人"转向"识别配合关系",是这篇论文最聪明的一点。它让系统不需要提前"认识"任何人。


它分几步做的(方法)

把这套方法想象成一家餐厅的厨房分工:先有人确认"老板的口味"(第 1 步——认出佩戴者自己),然后大堂经理观察"哪几桌客人是同一拨"(第 2 步——学节奏),再分成"前台快手"和"后厨慢工"两班搭配(第 3、4 步——双模型),最后厨房没真客人时拿模拟客人来练手(第 5 步——合成数据),练好了再真枪实弹上阵(第 6 步——部署与推理)。

下面是整体架构图,你可以先扫一眼有个印象:

架构图
Plate Nº II架构图

图里两条路径:上半部分"Slow"(慢模型)每 1 秒看一眼整体;下半部分"Fast"(快模型)每 12.5 毫秒输出一段实时声音。左边的"Beamformer"负责提取佩戴者自己的声音。

步骤 1:用"我自己说话的样子"当锚点

日常类比:想象你在化装舞会找朋友,你身上戴着一个会发光的徽章。徽章一亮,你就知道"哪些人正在跟我互动"——因为他们在看着你的光。本文的"发光徽章"就是佩戴者自己的嘴

输入:从双耳麦克风录到的混合音频(左声道 + 右声道),里面混着你的声音、同伴的声音、隔壁桌的声音、环境噪音。

处理:一个叫做**波束成形器(beamformer)**的神经网络,利用双耳之间的时间差和音量差,把"从你嘴巴方向来的声音"单独抽出来。

波束成形器(beamformer):一种利用多个麦克风之间到达时间差来聚焦特定方向声音的装置。想象一个声学版的探照灯——它只照亮一个方向,其他方向全黑。在这里,它被训练成专门对准佩戴者自己的嘴,因为你的嘴离你自己的耳朵最近、声音最响。

输出:一段干净的"你自己说了什么"的单声道音频。

技术细节

  • 波束成形器是一个轻量级神经网络,只有 17.4 万个参数(比一张 100x100 的彩色图片的像素数还少)
  • 它在时频域(time-frequency domain)工作:先把声波用 STFT(短时傅里叶变换)转成频谱图,处理后再转回声波
  • 使用 6ms 的分析窗口,总延迟极小
  • 先在合成数据上预训练(2 万个 5 秒混合音频),再在 3 小时真实录音上微调
  • 真实世界测试中,它能把自语的信噪比从 -0.13 dB 提升到 8.36 dB

信噪比(SNR):目标声音的响度与噪音响度的比值,单位是分贝(dB)。SNR 越高,说明目标声音越"突出"。从 -0.13 dB(目标跟噪音差不多响)到 8.36 dB(目标比噪音响 6 倍以上),是非常显著的提升。

为什么这步关键:以前要让用户先注册一个声纹身份证,麻烦又不够准。现在改用"你自己开口说的话"当参照——你只要说话,系统就知道你在参与对话。不需要换朋友时重新注册,不需要换语言时重新训练。系统在你连续说话 5 秒后自动激活。

为什么不直接用声纹(d-vector)? 论文做了消融实验:用传统的 256 维声纹向量替代自语锚点,SISDRi 下降了 2.65 dB。原因是声纹是一个"平均化"的表示,丢失了时间维度的细节,而自语保留了"你在什么时刻说了什么"的完整时序信息。

所以这一节是想说:第一步是把"佩戴者正在说话"变成系统的起点信号,这样就绕过了传统方法"必须提前认识你朋友"的限制。

步骤 2:学"轮流说话"的节奏规律

日常类比:两个人下围棋,你不用看脸都能从落子节奏猜出他们是不是真在对弈——一个落子另一个会想几秒再落,几乎不会同时落子。对话也一样。

人类对话有一个全世界通用的规律(2009 年 Stivers 等人在 10 种语言中验证过):

  • 你说一段,对方接一段(交替性)
  • 几乎没人同时开口(重叠率极低,本文的真实数据中只有 1.3%)
  • 转换停顿很短(平均只有 0.18 秒就接上,叫 Floor-Transfer Offset)
  • 每轮发言平均 8.2 秒

这种规律就叫轮流说话(turn-taking)

轮流说话(turn-taking):对话学里的术语,指人对话天然会交替发言、几乎不重叠、停顿很短的规律。就像打乒乓球——你打过去、对方打回来,几乎不会两人同时打。

Floor-Transfer Offset (FTO):两人对话时,一方话音落下到另一方开口之间的时间间隔。正值表示有停顿,负值表示有重叠。

输入:混合音频 + 前一步提取出的自语。

处理:慢模型分析过去几十秒的音频,识别出以下模式——

  • 哪些时间段有人在说话
  • 说话和沉默交替的节奏像不像在跟"我"对话
  • 有没有跟"我"的说话节奏配合上的人

输出:一个"对话嵌入向量(conversation embedding)"——一串浓缩了"这场对话长什么样"的数字。

嵌入向量(embedding):把一段复杂内容压缩成的一串固定长度的数字。就像把一本书的内容压缩成一个 32 位的二维码——虽然丢失了细节,但保留了核心特征。两个嵌入向量越相似,代表原始内容越像。

为什么这步有用

  1. 跨语言能用。中文、英文、日文虽然语速不一样,但"一来一回"的形态都差不多。论文用英文数据训练,直接零样本测试中文得到 6.50 dB、日文 7.92 dB 的提升。
  2. 不用提前注册任何人。新朋友走过来开始跟你聊,节奏对得上就被自动识别。
  3. 抗打扰。隔壁桌再吵,他们的说话节奏跟你这桌就是对不上。

消融验证:论文通过人为扰动轮流说话的节奏来验证这个机制。他们给沉默间隔加上随机偏移(标准差从 0.5 秒增加到 3 秒),结果 SISDRi 从 6.75 dB 逐渐下降到 4.16 dB。这证明模型确实在依赖轮流说话的时间结构来工作。

所以这一节是想说:节奏比身份更通用——它是跨语言、跨人群、无需注册的万能钥匙。模型学的是"配合关系"的模式,不是某个人的声音特征。

步骤 3:一快一慢两个模型搭配(双模型架构)

日常类比:人开车的时候——眼睛和反射神经负责"前面突然有东西马上踩刹车"(反应在毫秒级),大脑同时在后台想"过 500 米要不要变道"(反应在秒级)。两个反应速度不一样,各管各的,互不拖后腿。

本文的系统就是这样的两层设计:

慢模型(Conversation Embedding Model)

  • 运行频率:每 1 秒跑一次
  • 输入:过去 1 秒的混合音频 + 自语信号
  • 网络结构:基于 TF-GridNet,6 个提取块(extraction block),每块包含"局部模块"(bidirectional LSTM 处理频率和时间信息)和"全局模块"(带因果掩码的自注意力,跨越多个 1 秒块)
  • 输出:一个对话嵌入向量 E,维度为 D x F x L(D=32 通道,F=频率轴,L=时间步数)
  • 参数量:98.6 万
  • 运行设备:手机(Apple M2 芯片),每 1 秒块处理耗时 41.3 ms
  • 峰值内存:591 MB

LSTM(长短期记忆网络):一种能"记住"过去信息的神经网络。想象一个人在记笔记——普通笔记本写满就忘,LSTM 像一个有索引的笔记本,重要的事会一直记着,不重要的会被覆盖。

自注意力(self-attention):让序列中每个位置都能"看到"其他所有位置的机制。想象一个班级讨论,每个人发言时都能参考之前所有人说过的话。问题是:人越多(序列越长),讨论越耗时——计算量随序列长度的平方增长。

TF-GridNet:一种在时间-频率二维网格上工作的神经网络架构,最初为语音分离设计。它分别在时间轴和频率轴上建模,然后交叉信息。

快模型(Streaming Model)

  • 运行频率:每 12.5 毫秒跑一次(比一次眨眼短得多)
  • 输入:当前 12.5 ms 的单声道混合音频 + 慢模型上一秒给出的对话嵌入
  • 网络结构:也基于 TF-GridNet,但去掉了全局模块,把双向时间 LSTM 换成单向 LSTM(确保因果性——只看过去不看未来)
  • 条件注入方式:对话嵌入在第 1 和第 2 个提取块之间,与特征图做逐元素乘法(element-wise multiplication)
  • 输出:清洗后的目标对话音频(只保留对话伙伴的声音)
  • 参数量:49.1 万
  • 运行设备:嵌入式开发板(Orange Pi 5B,约 600 元),每 12.5 ms 块处理耗时 8.9 ms
  • 峰值内存:86 MB

因果性(causality):模型在处理当前时刻时,只能看到过去的信息,不能"偷看"未来。这是实时系统的硬性要求——未来的声音还没录到,你不可能用它。

两者的配合方式

时间轴  →  →  →  →  →  →  →  →  →  →  →

慢模型:  [====== 1秒 ======]  [====== 1秒 ======]  ...
          输出 E₁                输出 E₂

快模型:  [12.5ms][12.5ms]...[12.5ms] | [12.5ms][12.5ms]...
          用 E₀(初始)                  | 用 E₁

注意:快模型在第 N 秒使用的是第 (N-1) 秒的嵌入。这个 1 秒的"落后"是故意设计的——它让慢模型完全不需要赶时间。

为什么需要这种设计? 核心矛盾是:要判断对话节奏,必须看很长的历史(论文验证了:只看 1 秒上下文比看全部上下文差 5.74 dB);但实时输出要求每 12.5 ms 出结果。如果一个模型又要看长历史又要快输出,自注意力的计算量会爆炸(O(n^2) 复杂度)。分成两个模型后:

  • 慢模型虽然需要看长序列,但它每秒只跑一次,而且先做了"平均池化"降低时间分辨率再做自注意力,所以 token 数很少
  • 快模型不需要看历史,只用当前 12.5 ms 的输入 + 一个固定大小的嵌入向量,内存开销恒定

消融验证:去掉慢模型,只用快模型,SISDRi 从 12.48 dB 暴跌到 1.45 dB。这说明没有长上下文的"指路信号",快模型根本分不清谁是对话伙伴。

所以这一节是想说:双模型架构把"看大局"和"出实时结果"这对矛盾拆开来同时满足。慢模型负责理解力,快模型负责反应速度,两者通过一串"数字密码"协作。

步骤 4:信号流的完整数据管道

日常类比:工厂流水线——原材料进来,经过切割、加工、组装、质检四个车间,最后成品出去。每个车间只管自己的活,但上一个车间的产出就是下一个车间的输入。

让我把完整的信号流从头到尾走一遍:

阶段 A:波束成形

  • 输入:双耳录音 (2 通道,16kHz)
  • 处理:6 个 GridNet 块 + 双窗 STFT(分析窗 96 样本 = 6ms)
  • 输出:单声道自语信号

阶段 B.1:慢模型

  • 输入:单声道混合音频 + 自语信号(沿通道维度拼接,变成 2 通道)
  • 时频变换:STFT,得到 C x F x L 的复数矩阵,取实部和虚部拼接成 2C x F x L 的实数张量
  • 编码:3x3 因果卷积层,映射到 D=32 维潜空间,得到 Z_e ∈ R^(32 x F x L)
  • 6 个提取块:
    • 局部模块:双向 LSTM 分别在频率轴和时间轴上建模(带 unfolding,kernel=2, stride=2 降采样减少计算)
    • 全局模块:先平均池化到每秒一个表示,再用 4 头因果自注意力 + 绝对位置编码,然后复制回原始时间步
  • 时移:输出整体向后移 T=1 秒(前面补零),模拟慢模型的"延迟"
  • 输出:对话嵌入 E ∈ R^(32 x F x L)

阶段 B.2:快模型

  • 输入:单声道混合音频(注意:不接收自语信号,避免额外延迟)
  • 时频变换:STFT,chunk size = 200 样本 = 12.5ms,lookback=32 样本=2ms,lookahead=32 样本=2ms
  • 编码:3x3 因果卷积层,映射到 Z_s ∈ R^(32 x F x L)
  • 条件注入:Z_s 与 E 逐元素相乘(在第 1 和第 2 提取块之间)
  • 6 个提取块:
    • 频率方向双向 LSTM(同一时间帧内)
    • 时间方向单向 LSTM(确保因果性,不等待未来)
    • 无全局模块(节省计算)
  • 解码:反卷积层 → 逆 STFT + overlap-add → 时域音频
  • 输出:干净的目标对话音频 x ∈ R^(1 x T)

蓝牙传输优化:慢模型可以放在手机上,快模型放在耳机(或贴身开发板)上。两者之间只需要通过蓝牙传输那个 32 维的嵌入向量——数据量极小,远比传原始音频省电省带宽。

关键设计选择总结

设计决策 原因
自语不送入快模型 避免波束成形的额外延迟影响实时性
慢模型落后快模型 1 秒 让慢模型可以从容计算,不阻塞快模型
两个模型都用单声道输入 减少计算量,让模型专注学节奏而非空间方位
快模型用单向时间 LSTM 确保因果性,输出不依赖未来
慢模型用因果掩码自注意力 可以看到所有过去,但不看未来

所以这一节是想说:信号从麦克风到耳朵的完整路径,每一步都有明确的"输入 → 处理 → 输出",设计选择环环相扣,都是为了同时满足"低延迟"和"长记忆"。

步骤 5:用合成数据训练

日常类比:你想学画"一群人在公园下棋",但找不到这种照片。怎么办?把"单人下棋"的照片和"公园背景"用 PS 拼起来,自己造训练素材。本文也是这么干的——用真人对话的节奏模板 + 合成的语音 + 模拟的房间。

为什么不能直接用真实录音? 因为要训练模型,需要有"正确答案"——即混合音频中每个人单独的干净语音。但真实场景中你录到的是混合的,根本没法拆开。所以必须"先拼后混":先有每个人的干净录音,把它们合成混合音频,这样训练时就知道"正确答案是什么"。

合成数据的五个子集

数据集 目标对话人数 干扰对话人数 用途
Libri (2spk) 2 2 训练 + 测试
Libri (3spk) 3 2 训练 + 测试
Libri (leaving) 3→2(有人中途离开) 2→3 训练 + 测试
Libri (4spk) 4 2 仅测试
Libri (5spk) 5 2 仅测试

合成过程四步

  1. 从 RAMC(180 小时中文真人对话)中取时间戳——"A 说 03.2 秒,B 说 3.47.1 秒"这种节奏表
  2. 把每个时间槽的内容换成 LibriTTS(英文语音库)中随机一个人的录音。这样节奏是真人的,声音内容是英文的
  3. 用 PyRoomAcoustics 模拟一个虚拟房间:
    • 房间长宽 510 米,高 34 米
    • 佩戴者在房间中心附近(0~1 米偏移)
    • 其他说话人距佩戴者 0.5~1.5 米
    • 双耳麦克风在佩戴者头部两侧(间距约 15cm)
    • 混响时间 RT60 从 0.15~1 秒随机采样
  4. 用房间脉冲响应(RIR)对每个人的语音做卷积,模拟出"在佩戴者耳朵位置听到的双声道录音"

混响(reverb / RT60):声音在房间里被墙壁反弹后形成的回响。RT60 定义为声音能量衰减到原来的百万分之一(60dB)所需时间。空浴室 RT60 约 1.5 秒(回声很大),铺地毯的卧室约 0.3 秒(回声小)。

房间脉冲响应(RIR):如果在房间某个位置放一个理想的"啪"声,在另一个位置录到的声音波形就是 RIR。它编码了从声源到接收点之间所有反射路径的信息。把任何声音跟 RIR 做卷积(一种数学运算),就能模拟出"在那个房间里听那个声音"的效果。

另外还有 Candor 数据集:850 小时英文双人对话(Zoom 录制的真人首次对话),提供真实的说话模式。生成 7000 个训练样本 + 500 个测试样本。

训练三阶段策略

阶段 做什么 目的
Stage 1 在非空间化的合成数据 + Candor 上联合训练快慢模型,120 epochs 学会基本的对话节奏识别
Stage 2 在空间化数据上继续训练,用波束成形器输出替代真值自语,50 epochs 适应真实的双耳空间化条件
Stage 3 对训练数据的沉默间隔做随机扰动(N(0, 0.5s)),42 epochs 弥合 Zoom 对话(陌生人、节奏规整)与现实对话(熟人、节奏随意)的分布差异

训练使用负 SNR 损失函数(让模型最大化输出与目标的信噪比),AdamW 优化器,梯度裁剪 max_norm=1,8 张 L40s GPU,batch size=16。

所以这一节是想说:用真节奏 + 假声音 + 假房间,巧妙地绕过了"真实戴耳机对话录音几乎不存在"的数据稀缺难题。三阶段训练逐步逼近真实世界条件。

步骤 6:在便宜硬件上实时推理

日常类比:一道菜再好吃,如果要在五星级厨房里用进口设备才能做,普通人就吃不到。这一步是证明"家常厨房也做得出来"。

部署方案

  • 快模型 → Orange Pi 5B(一块约 600 元的嵌入式开发板)
  • 慢模型 → Apple M2 芯片(手机或笔记本)
  • 两者之间通过蓝牙传输嵌入向量

实时性验证

  • 快模型每 12.5ms 块的处理时间:平均 8.9ms(< 12.5ms,跟得上不堆积)
  • 慢模型每 1s 块的处理时间:41.3ms(远 < 1s)
  • 端到端总延迟:约 30ms,低于人耳可感知阈值(约 50ms)

内存占用

  • 快模型峰值:86 MB
  • 慢模型峰值:591 MB

这意味着不需要云服务器,不需要高端显卡,一个开发板 + 一部手机就能跑全部流程。

所以这一节是想说:再好的算法,跑不上真实设备就是论文里的玩具。本文证明了它能在千元级硬件上以 30ms 延迟实时运行。


Proactive Hearing Assistants that Isolate Egocentric Conversations — 方法示意:核心 pipeline
Plate Nº IIIProactive Hearing Assistants that Isolate Egocentric Conversations — 方法示意:核心 pipeline

关键数字(What works)

看数字之前先记住:**SISDRi(Scale-Invariant Signal-to-Distortion Ratio improvement)**可以理解成"目标声音相对原始混音被加强了多少分贝"。每多 3 dB,听感大约响一倍。正值表示提升,负值表示恶化。

测试条件 SISDRi (dB) ↑ 准确率 ↑ 混淆率 ↓ ΔPESQ ↑
Libri 2人 (空间化) 15.68 99.2% 0.2% 0.65
Libri 3人 (空间化) 14.29 96.1% 0.6% 0.63
Libri 离场 (空间化) 13.89 95.7% 1.5% 0.60
Candor (空间化) 9.82 93.9% 1.1% 0.56
SpokenWOZ OOD (空间化) 11.95 92.1% 1.5% 0.52
RAMC 中文 (非空间化) 6.50 85.5% 5.6% 0.63
日文 (非空间化) 7.92
真人录音 2人 7.84 85.0% 1.1%
真人录音 3人 6.00 73.4% 3.7%
基线 DeepFilterNet2 (空间化) -3.45 16.8% 9.2% -0.16

混淆率(Confusion Rate, CR):模型把陌生人错当成你同伴的频率。1.5% 意味着 100 次判断中只有 1.5 次把陌生人的声音当成你朋友放大出来——这是一个安全指标。

PESQ:一个国际标准的"机器打分听感"工具,约 1~4.5 分。ΔPESQ 是模型输出相对输入的改善量。

人类主观评价(11 人,5 分制):

维度 模型输出 原始混音
噪音抑制 4.29 1.67
理解容易度 4.35 1.97
聆听费力度 4.45 1.97
总体 MOS 4.30 1.88

泛化到未见人数

对话人数 SISDRi (dB)
2 人(训练过) 12.48
3 人(训练过) 12.03
4 人(未训练) 11.94
5 人(未训练) 11.85

几乎不掉分,说明模型学到的是通用的"配合节奏",不是死记"N 个人的模式"。

SISDRi 在真实录音上的分布
Plate Nº IVSISDRi 在真实录音上的分布

上面这张直方图显示大部分真实录音样本的 SISDRi 集中在 5~15 dB 之间,约 80% 样本获得了正向提升。

有人离开同伴关系后,模型自动调整
Plate Nº V有人离开同伴关系后,模型自动调整

这张散点图特别有意思:横轴是一个人在属于你这桌时的 SISDRi(正值 = 被增强),纵轴是同一个人离开你这桌加入别桌后的 SISDRi(负值 = 被压制)。绝大多数点落在"右下角"(先增强后压制),证明模型会动态适应对话关系的变化。

所以这一节是想说:数字证明这不是实验室玩具——在多种条件(跨语言、跨人数、真人录音)下都有意义的提升,而且真人也觉得"好太多了"。


实验结果说明了什么

把上面的数字串起来看,有几个重要结论:

结论 1:节奏确实比声纹好用。 模型从没"听过"中文和日文,但因为它学的是节奏而非发音,直接零样本迁移就有 6~8 dB 的提升。这在"每种语言都要重新训练"的传统路线里是不可想象的。

结论 2:合成数据训练 → 真人录音验证,链路跑通了。 从纯合成数据训出来的模型,拿到 11 个真人 6.8 小时的录音上测试,依然有 7~8 dB 的提升。这一步通常是最容易掉链子的地方(sim-to-real gap),本文证明"只要节奏是真人的,声音和房间可以是假的"。

结论 3:双模型不是可选的,是必须的。 去掉慢模型后 SISDRi 从 12.48 暴跌到 1.45(下降 88%)。快模型独自根本不知道"谁是对话伙伴"——它只有毫秒级的视野,看不到秒级的轮流说话模式。

结论 4:上下文长度很重要。 把慢模型能看到的历史从"全部"限制到 10 秒、5 秒、1 秒,SISDRi 分别下降 2.12、4.06、5.74 dB。对话关系的判断需要几十秒的积累,不是几秒就够的。

结论 5:真人评分远比仪器数字更有说服力。 总体 MOS 从 1.88 升到 4.30——这是从"几乎没法听"到"体验良好"的质变。

所以这一节是想说:实验不只证明"数字好看",更证明了设计选择(节奏>声纹、双模型>单模型、长上下文>短上下文)的每一个都是必要的。


你应该懂的几个新词

Egocentric audio(第一视角音频):从佩戴者自己耳朵位置录到的双声道音频。类比第一人称 vlog,只不过是声音版。左右耳的细微差异携带着方向信息。

Beamformer(波束成形器):用多个麦克风之间的相位差当"声学探照灯",把某个方向的声音聚焦出来。本文用它对准佩戴者自己的嘴,提取自语信号。

Turn-taking(轮流发言):对话里的"一来一回"规律——人说话会交替、几乎不重叠、停顿很短。全球 10 种语言都遵循这个规律。本文模型抓的就是这个节奏。

SISDRi(信噪比提升,单位 dB):衡量"目标声音相对原始混音被加强了多少"。越大越好,每多 3 dB 听感大约响一倍。

Conversation Embedding(对话嵌入向量):慢模型输出的一串数字,浓缩了"这场对话的节奏长什么样"的信息。快模型拿到它就知道"该保留谁、压制谁"。

Streaming Model(流式模型):边收边处理、不等录音结束就出结果的模型。类比直播 vs 录播——直播是流式的,录播是离线的。

Confusion Rate(混淆率, CR):模型把陌生人错当成同伴的频率,越低越好。是本文新定义的安全指标。

RT60(混响时间):声音在房间中从发出到衰减 60dB 所需的秒数。越大说明回声越重。

OOD(Out-of-Distribution,分布外):测试数据来源跟训练数据不一样。类比"高考考了课外题"——模型面对从未见过的数据分布,依然要给出好结果。

Negative SNR Loss(负信噪比损失):训练时的目标函数,让模型最大化输出信号与目标信号之间的信噪比。最小化这个损失 = 让输出越来越干净。

PESQ(感知语音质量评估):一个 ITU 国际标准的语音质量自动评分工具,模拟人耳的主观感受,范围约 1~4.5 分。

所以这一节是想说:这套术语是看懂全文的最小词汇表,每个都能用一句类比抓住核心含义。


它有什么搞不定的

长时间沉默会破坏锚点
Plate Nº VI长时间沉默会破坏锚点

上面这张图(论文 Fig. 5)展示了一个失败场景:紫色线是对话伙伴的 SISDRi 随时间的变化,灰色区域标记佩戴者在说话的时段。当佩戴者超过 2 分钟不说话时,SISDRi 直接掉到 0 以下(完全失效),直到佩戴者重新开口才恢复。

具体的局限列表:

1. 你长时间不说话就失灵(最大软肋)。比如听讲座、看电影、安静听别人聊天——这些"我只听不说"的场景,系统的锚点就消失了,完全不知道该保留谁。

2. 新人刚开口的前 2 秒有延迟。每个新加入对话的人前 2 秒 SISDRi 只有 4.77 dB,要等 2 秒后才稳定到 8+ dB。对于快速轮换的多人讨论,这 2 秒的"预热期"可能漏掉关键句子。

3. 三人对话比两人差一档。两人 7.84 dB vs 三人 6.00 dB。而家庭聚会、多人圆桌恰恰是助听器最常见的使用场景。

4. 两边同时换人说话时容易混淆。当你这桌和隔壁桌在 1 秒内同时发生说话人转换时,SISDRi 降到 4.98 dB(正常是 8+ dB)。因为两边的节奏瞬间"对齐"了,模型分不清。

5. 模型不会告诉你"我不确定"。万一它把陌生人当成你的同伴,你完全听不到被滤掉的声音,也不知道自己漏听了什么。没有任何"置信度提示"或退化机制。

6. 没测试过真正的听力障碍用户。测试参与者都是听力正常的成年人(21~39 岁)。但目标人群是助听器使用者——他们的对话模式(更慢、更多重复确认)可能跟训练数据不同。

7. 文化差异未充分验证。虽然跨语言泛化不错,但不同文化的对话节奏确实有差异(比如日本人的沉默间隔比美国人长),更多语言/文化需要验证。

所以这一节是想说:每个设计选择都有代价。"不靠声纹靠节奏"换来了免注册的便利,但也意味着"不开口就失灵"。"只看节奏不看内容"让它跨语言,但也让它在节奏冲突时无能为力。


它和别的几篇是什么关系

纵向:同一实验室的"可编程耳朵"路线图

华盛顿大学 Gollakota 实验室连续几年在做一条清晰的产品路线——每篇论文都在减少用户需要执行的操作数:

Semantic Hearing (UIST 2023)
  → 用户手动选"我要听什么类型的声音"(狗叫/警笛/人声)
  → 需要操作:选类别

Look Once to Hear (CHI 2024)
  → 看一眼目标人的脸就完成注册
  → 需要操作:看一眼

Target Conversation Extraction (arXiv 2024)
  → 用轮流说话节奏离线提取对话
  → 需要操作:无,但不是实时

★ 本文:Proactive Hearing (UIST 2024)
  → 实时、免注册、自动判断对话伙伴
  → 需要操作:无

LlamaPIE (ACL Findings 2025)
  → 接入语言模型,从"听清"到"听懂 + 主动建议"
  → 需要操作:无,且能主动提供信息

每一步都在减少"人需要做的事",同时增加"机器能理解的深度"。本文是"用户什么都不用做"的关键一棒。

横向:与竞争路线的对比

路线 代表工作 需要什么硬件 实时性 注册需求
声纹匹配 传统说话人验证 普通麦克风 实时 需要预录
脑电波解码 NeuroHEED 头皮电极 接近实时 不需要
视觉辅助 Look Once to Hear 摄像头 + 麦克风 实时 看一眼
对话节奏 本文 双耳麦克风 实时 不需要

听觉三连:本文在三篇听觉论文中的定位

在本导读的听觉论文族中,三篇论文各管一个层面:

  • Proactive Hearing(本文)= 主动听觉决策:解决的是"agent 决定听谁"——这是最高层的问题,类似大脑的选择性注意力。它输出的是"保留 / 压制"的决策。
  • NeuralAIDS = 边缘设备上的神经音频处理:解决的是"在极低功耗芯片上跑音频处理算法"——类似耳蜗的信号放大。关注的是硬件约束下的算法实现。
  • Acoustic Swarms = 分布式麦克风阵列:解决的是"多个机器人协作形成大型虚拟麦克风阵列"——类似一群人各站不同位置帮你"听"不同方向的声音。

三者是互补的:Proactive Hearing 的"决策层"可以跑在 NeuralAIDS 的"硬件层"上,而 Acoustic Swarms 的"阵列层"可以为 Proactive Hearing 提供更高质量的多角度输入。想象一个完整系统:多个分布式麦克风(Acoustic Swarms)采集环境音 → 低功耗芯片预处理(NeuralAIDS)→ 智能决策保留谁的声音(Proactive Hearing)。

所以这一节是想说:本文是"主动听觉"这条路线的核心——它不只是在做信号处理,它在做认知层面的"选择性注意力"。


和本导读的关系

本文对应导读 Ch20: 听觉智能 中的"声源分离与主动听觉"部分(Part 2)。

在 Ch20 的知识体系中,各篇论文的位置如下:

  • Ch20.2-20.3 建立了音频信号基础(采样、频谱图、梅尔刻度、神经音频编解码器)——本文的波束成形器和 TF-GridNet 都在时频域工作,理解 STFT 是前提
  • Ch20.4 Whisper 解决"听懂说了什么"(ASR)——本文不做 ASR,但它的后续工作 LlamaPIE 会接入 LLM,那时就需要 ASR
  • Ch20.5 AudioLM 解决"AI 自己会说"(生成)——与本文方向不同
  • 本文 = Ch20 Part 2 的核心:从"被动处理音频"升级到"主动决策该听谁"

本文还连接了 Ch18(多模态)中 ImageBind 的思想——把音频表示压缩成嵌入向量,跨模态传递信息。对话嵌入向量 E 本质上就是一种"听觉理解的压缩表示"。

所以这一节是想说:本文是导读听觉章节的"决策核心",它把前面学的信号基础变成了可行动的系统。


思考题

Q1:为什么本文选择"对话节奏"而不是"声纹"作为识别对话伙伴的主要线索?如果两个人的声音很像(比如双胞胎),本文的方法会受影响吗?

提示

思考两个维度:(1) 声纹需要预注册,节奏不需要——这是产品层面的优势;(2) 声纹是"是谁在说",节奏是"在跟谁配合说"——后者才是"对话伙伴"的本质定义。对于双胞胎的问题:声纹路线确实会被迷惑(两人声音几乎一样),但节奏路线不受影响——重点是谁在跟你配合,不是谁的声音像谁。

Q2:慢模型故意落后快模型 1 秒。如果把这个延迟从 1 秒增大到 4 秒,会发生什么?如果减小到 0.1 秒呢?

提示

论文做了消融:从 1 秒增到 4 秒,SISDRi 下降 1.22 dB。更大延迟意味着嵌入向量更新更慢,对话动态的响应更迟钝(比如有人突然加入对话,4 秒后才被识别)。减小到 0.1 秒则会让慢模型时间预算太紧——它需要在 0.1 秒内完成 41.3ms 的计算(本身不是问题),但更关键的是每个"块"只有 0.1 秒的音频信息,自注意力需要处理更多的 token(同样一分钟对话,被切成 600 个 0.1 秒块 vs 60 个 1 秒块),计算量暴增。

Q3:论文用中文 RAMC 的时间戳 + 英文 LibriTTS 的语音来合成训练数据。为什么不直接用英文对话数据集的时间戳?

提示

RAMC 是面对面的中文对话(180 小时),其轮流说话节奏更接近真实生活场景。而英文数据集 Candor 虽然有 850 小时,但它是通过 Zoom 远程录制的首次对话——对话风格偏正式、停顿偏长。混合使用两者的节奏可以增加训练分布的多样性。更关键的是,用中文节奏 + 英文语音的组合,让模型被迫只学节奏而非语言内容,天然获得了跨语言泛化能力。

Q4:如果佩戴者完全不说话(纯被动听),系统就失效了。你能想出什么改进方案来解决这个问题?

提示

几个可能的方向:(1) 用视觉辅助——摄像头检测你的头部朝向和眼神接触(Look Once to Hear 的路线);(2) 检测非语言信号——点头、"嗯嗯"这类回应声也是对话参与的证据;(3) 用内容理解——接入 ASR + LLM,根据对话内容的连贯性判断谁在跟谁说话(LlamaPIE 的方向);(4) 用历史记忆——记住"5 分钟前你在跟 A 说话",在短暂沉默后维持这个判断;(5) 用户主动模式——提供一个"被动听讲"模式的按钮。

Q5:论文说模型从 23 人训练数据直接泛化到 45 人几乎不掉分。这在直觉上为什么说得通?

提示

因为模型学的核心特征是"配合 vs 不配合"的二元关系。不管对话有几个人,关键模式始终是:(a) 对话伙伴跟你交替说话、停顿短、不重叠;(b) 非对话者跟你没有这种时间相关性。多了几个对话伙伴,只是增加了几个"跟你配合"的人,基本模式不变。这就像你能从 2 人乒乓球的经验推广到 4 人打乒乓球——轮流击球的规则是一样的。

Q6:本文只用了单声道作为快/慢模型的输入(不是双声道)。这是为什么?双声道不是能提供更多方向信息吗?

提示

论文明确说了三个原因:(1) 减少快模型的计算量(通道数减半);(2) 让模型专注于学习对话节奏(turn-taking dynamics)而非空间方位——这样模型在空间配置变化时(人移动、换位置)更鲁棒;(3) 双声道信息已经被波束成形器利用过了(用于提取自语),再给模型双声道是冗余的。空间信息在波束成形阶段已经完成了它的使命。

Q7:假设你是产品经理,要把这个系统做成一个消费级产品。你认为最大的非技术障碍是什么?

提示

几个维度的障碍:(1) 隐私:系统需要持续录音并分析所有人的对话节奏,即使它不"理解"内容,用户和周围人可能仍有隐私顾虑;(2) 信任:1.5% 的混淆率听起来低,但意味着每小时可能有好几次误判,用户在关键时刻(比如商务会议)可能不敢完全依赖它;(3) 法规:录音设备在不同国家有不同法律要求;(4) 用户教育:用户需要理解"我必须参与说话才有效"这个限制;(5) 硬件集成:需要双耳麦克风 + 处理芯片 + 蓝牙连接手机,硬件集成度要求高。

Q8:论文的 Stage 3 训练对沉默间隔做了随机扰动(N(0, 0.5s))来弥合分布差异。为什么 Zoom 对话和面对面对话的节奏会有差异?这种数据增强的局限是什么?

提示

Zoom 对话的特殊性:(1) 陌生人首次对话,比较客气,停顿更长、打断更少;(2) 网络延迟导致实际的 FTO(转换间隔)比面对面更长;(3) 没有非语言线索(眼神、手势)辅助轮换,导致更多"尴尬沉默"和"同时开口"。面对面的朋友对话则更随意——停顿更短、重叠更多、甚至有很多"嗯"/"哈哈"的短回应。局限在于:随机扰动只改变了沉默的长度分布,没有改变其他特征(如回应词频率、重叠模式、情绪起伏的节奏),所以仍然存在 gap(真实录音上的 SISDRi 比合成数据低约 5 dB)。


一些好奇心问答(FAQ)

Q1:模型有多大?

三个子网络加起来:波束成形器 17.4 万 + 慢模型 98.6 万 + 快模型 49.1 万 = 约 165 万参数。作为对比,GPT-2 Small 有 1.24 亿参数,本文的模型只有它的 1.3%。这么小的模型能做到这些,归功于任务本身的特定性——它不需要"理解世界",只需要学会一种节奏模式。

Q2:训练花了多少钱?

8 张 L40s GPU(约 $2/卡/时)训了 Stage 1 约 120 epochs + Stage 2 约 50 epochs + Stage 3 约 42 epochs。粗估总共 15002000 GPU 小时,云上约 $30004000(约 2~3 万人民币)。一个研究生项目完全能负担。

Q3:我能装进 AirPods 吗?

不能——AirPods 不开放第三方代码。但作者演示了用 Orange Pi 5B(约 600 元)+ Sonic Presence SP15C 双耳麦克风 + 手机的组合。总硬件成本不到 2000 元。

Q4:端到端延迟到底多少?

快模型处理一个 12.5ms chunk 需要 8.9ms,加上 STFT 的 lookback/lookahead 各 2ms,总算法延迟约 12.9ms。加上硬件 I/O 约 15-20ms,端到端约 30ms——低于人耳"能感知到回声"的阈值(约 50ms)。

Q5:为什么用负 SNR 而不是更常见的 MSE 作为损失函数?

SNR 损失是尺度不变的(Scale-Invariant)——不管目标信号本身多响或多轻,损失值只关心"信号和噪音的比例"。这对音频处理特别重要,因为不同说话人的音量差异很大。MSE 会偏好响的信号,SNR 不会。

Q6:这个跟降噪耳机(如 AirPods Pro 的 ANC)有什么区别?

完全不同的问题。ANC(Active Noise Cancellation)是物理消除环境中的持续噪音(风声、引擎声),靠的是发出反相声波抵消。本文做的是智能语音分离——从人类说话声中区分出"谁是你的对话伙伴"。ANC 处理的是确定性的物理噪音,本文处理的是不确定性的社交信号。

Q7:如果两个不同桌的人恰好在同一时刻开始跟你说话,模型会怎样?

这正是"turn-change collision"问题。论文发现当你这桌和隔壁桌在 1 秒内都发生说话人转换时,性能下降到 4.98 dB。模型的判断依据是"谁的节奏跟你配合",如果两边同时"配合上"了,就会短暂混淆。但这种情况只占 11.3% 的时间。

Q8:后续工作 LlamaPIE 做了什么?

LlamaPIE(2025)把本文的"听清"能力接入了 LLM(大语言模型),实现了"听懂 + 主动建议"。比如你在跟人讨论明天去哪吃饭,LlamaPIE 不只帮你听清对方说了什么,还能在你犹豫时主动提供附近餐厅推荐。它代表了从"增强听觉"到"增强认知"的进化。

所以这一节是想说:把论文当真实产品来追问,每个实际问题都有对应的设计考量或工程权衡。


如果你想再深入

延伸阅读(按优先级排序)

  1. Target Conversation Extraction (Chen 2024b) — 本文的直接前作。离线版,用声纹 + 单耳。读完能看清从离线到实时的工程飞跃。
  2. LlamaPIE (Chen 2025) — 本文的直接后续。接入 LLM,从"听清"到"听懂"。看下一步的演化方向。
  3. Semantic Hearing (Veluri 2023) — 同组兄弟篇。换一个角度:"按声音类型过滤"。三篇放一起读能完整看清 Gollakota 组的路线。
  4. Look Once to Hear (Veluri 2024a) — "看一眼目标人完成注册"的路线。对比"视觉辅助 vs 纯音频"两条路。
  5. Stivers 2009 (PNAS): 全球 10 种语言的轮流说话研究 — 跨语言泛化能成立的理论根基。语言学方向的经典。
  6. NeuroHEED (Pan 2024) — 竞争路线代表。用脑电波解码注意力。看看"另一条路"的进展。
  7. TF-GridNet (Wang 2023) — 本文网络架构的基础。如果想深入理解模型结构,需要读这篇。
  8. DeepFilterNet2 (Schroter 2022) — 本文的基线模型。了解工业级语音增强的当前水平。

所以这一节是想说:找到一篇论文的家族树和后续走向,是真正读懂它的最后一步。


原文信息

论文标题:Proactive Hearing Assistants that Isolate Egocentric Conversations

作者:Guilin Hu, Malek Itani, Tuochao Chen, Shyamnath Gollakota

机构:University of Washington, Paul G. Allen School of Computer Science & Engineering(Gollakota Lab——同组还有 Semantic Hearing、Look Once to Hear、Sound Bubbles 等一系列"可编程耳朵"工作)

发表:UIST 2024

链接

BibTeX

@inproceedings{hu2024proactive,
  title={Proactive Hearing Assistants that Isolate Egocentric Conversations},
  author={Hu, Guilin and Itani, Malek and Chen, Tuochao and Gollakota, Shyamnath},
  booktitle={Proceedings of the 37th Annual ACM Symposium on User Interface Software and Technology (UIST)},
  year={2024},
  organization={ACM}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_proactive_hearing_2026,
  title       = {(readable note) Proactive Hearing Assistants that Isolate Egocentric Conversations},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/proactive-hearing/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?