Proactive Hearing Assistants that Isolate Egocentric Conversations
给"完全没接触过 AI / 音频信号处理"的读者写的精读笔记。所有专业词第一次出现都会解释清楚。只看这份笔记就能理解全文机制。
一句话讲什么(TL;DR)
戴上这副耳机,它自动听出"现在你在跟谁聊天",把同伴的声音放大、把陌生人和噪音压下去——你一个按钮都不用按,甚至不用提前录入任何人的声音。它靠的不是"认声音",而是"认对话节奏"。
所以这一节是想说:耳机要从"被动放大全场"升级成"主动挑人听",核心武器是对话的节奏规律。
这是个什么场景
周五晚上你和两个朋友约火锅。锅在咕嘟、隔壁桌在喊"我跟你讲那个梅西啊"、服务员在背后喊"38 号上菜",对面朋友刚说完一句你最想听的——你只听到半句。
你下意识把头凑过去,喊一声"你说啥?"
戴助听器的人每天都在过这种日子,而且更糟。普通助听器只会把所有声音一起放大——锅声、隔壁桌的争论、服务员的吆喝,全都更响了。结果是:越听越累,朋友说什么还是听不清。
这就像你打开手机相机想拍朋友的脸,但相机不会对焦——它把整个画面同等清晰地拍下来,你的朋友只是其中模糊的一小块。
这种"一群人同时说话,你只想听其中几个"的难题,研究界叫鸡尾酒会问题(cocktail party problem)——想象一个嘈杂的鸡尾酒派对,所有人都在聊天,你想听清面前这个人的话,大脑必须做的那种"声音过滤"。
鸡尾酒会问题(cocktail party problem):多人同时说话时怎么只听清一个目标的难题。名字来源于酒会场景——几十个人同时聊天,你的大脑能自动聚焦到跟你说话的人,但机器做不到。
再说一个关键词:第一视角音频(egocentric audio)。这个词的意思是"从佩戴者自己耳朵位置录到的声音"——类似第一人称视频 vlog,只不过换成声音版。你左右耳听到的声音有细微差别(左边的人声音先到左耳、后到右耳),这些差别本身就携带了方向信息。本文的系统正是利用这种双耳录音来工作的。
读到这里你应该懂了:这篇论文要做的事,就是让耳机会"对焦"——自动判断谁是你的对话伙伴,把他们的声音调清楚,把别的调暗。而且全程不需要你动手指。
所以这一节是想说:现实生活里的听觉混乱很普遍,本文要给它一个完全自动化的机器解决方案。

之前的人怎么做的,为什么不够好
研究界和耳机厂之前已经试过几条路,但都有明显短板:
| 方法 | 核心思路 | 致命问题 |
|---|---|---|
| 用户手动选方向 | 像相机手动对焦,在手机上点选"我要听左边" | 等你操作完,对面那句话早过去了 |
| 苹果 AirPods"对话感知" | 检测到你开口就把背景音降一档 | 不知道你在跟谁说,不分离特定人 |
| 提前录声纹 | 先录一段朋友声音当"身份证",后续匹配 | 新来一个人没录过就失效 |
| 离线算法(TCE) | 用轮流说话节奏找到对话伙伴 | 需要看到未来几秒录音才能算,做不了实时 |
| 单耳麦克风 | 一个麦克风收音 | 丢掉了左右耳差别这个方向线索 |
| 脑电波解码(NeuroHEED) | 贴电极在头上,读你大脑的注意力 | 需要侵入性硬件,现实中几乎不可用 |
这就像你想拍一群在跑动的小朋友,但相机:必须手动追焦(慢)、必须提前录入每个人的脸(麻烦)、拍下来要等几秒才出图(不实时)。显然没法日常使用。
其中最值得关注的前作是 Target Conversation Extraction (TCE),它跟本文来自同一个实验室(华盛顿大学 Gollakota 组),也用了轮流说话的节奏。但 TCE 有三个关键限制:(1) 离线处理,需要未来上下文;(2) 依赖预先提取的说话人嵌入向量;(3) 只用单声道录音。本文就是在 TCE 基础上做的"实时化 + 双耳化 + 免注册化"升级。
所以这一节是想说:旧方法要么慢、要么需要预先准备、要么不知道"对话关系"是什么,这篇论文要同时解决所有这些问题。
这篇论文的新想法
核心洞察一句话概括:
不去问"这个声音是谁的",而是问"谁正在跟我配合说话"。
传统方法试图识别"身份"——录一段 Alice 的声音,然后去混合声音里找 Alice。本文换了一个全新的切入角度:识别"关系"——你跟朋友说话时天然会一来一回(你说完一段,对方接一段,几乎不会同时开口,停顿很短),而隔壁桌的人跟你的说话节奏完全不同步。
这个节奏差异就是身份的替代品。
具体来说,本文有三个核心贡献:
贡献 1:自语锚点(self-speech anchor)。系统先用波束成形器从双耳录音中提取"你自己在说什么",把你自己的声音当作"我在参与对话"的信号。不需要任何预录音。
贡献 2:双模型架构(dual-model architecture)。一个慢模型每 1 秒看一次全局,总结出"这场对话长什么样";一个快模型每 12.5 毫秒出一次实时结果。两者配合,既看得远又跑得快。
贡献 3:合成数据训练 + 真实世界验证。用真人对话的时间戳 + 合成语音 + 模拟房间来训练,然后在 11 个人的 6.8 小时真人录音上验证。
类比:想象你在一个化装舞会上找同伴。传统方法是"看长相找人"(声纹识别),本文的方法是"看谁在跟你配合跳舞"(节奏匹配)——即使所有人都戴着面具,你也能从舞步的配合中找到你的舞伴。
所以这一节是想说:不靠声纹靠节奏,从"识别人"转向"识别配合关系",是这篇论文最聪明的一点。它让系统不需要提前"认识"任何人。
它分几步做的(方法)
把这套方法想象成一家餐厅的厨房分工:先有人确认"老板的口味"(第 1 步——认出佩戴者自己),然后大堂经理观察"哪几桌客人是同一拨"(第 2 步——学节奏),再分成"前台快手"和"后厨慢工"两班搭配(第 3、4 步——双模型),最后厨房没真客人时拿模拟客人来练手(第 5 步——合成数据),练好了再真枪实弹上阵(第 6 步——部署与推理)。
下面是整体架构图,你可以先扫一眼有个印象:

图里两条路径:上半部分"Slow"(慢模型)每 1 秒看一眼整体;下半部分"Fast"(快模型)每 12.5 毫秒输出一段实时声音。左边的"Beamformer"负责提取佩戴者自己的声音。
步骤 1:用"我自己说话的样子"当锚点
日常类比:想象你在化装舞会找朋友,你身上戴着一个会发光的徽章。徽章一亮,你就知道"哪些人正在跟我互动"——因为他们在看着你的光。本文的"发光徽章"就是佩戴者自己的嘴。
输入:从双耳麦克风录到的混合音频(左声道 + 右声道),里面混着你的声音、同伴的声音、隔壁桌的声音、环境噪音。
处理:一个叫做**波束成形器(beamformer)**的神经网络,利用双耳之间的时间差和音量差,把"从你嘴巴方向来的声音"单独抽出来。
波束成形器(beamformer):一种利用多个麦克风之间到达时间差来聚焦特定方向声音的装置。想象一个声学版的探照灯——它只照亮一个方向,其他方向全黑。在这里,它被训练成专门对准佩戴者自己的嘴,因为你的嘴离你自己的耳朵最近、声音最响。
输出:一段干净的"你自己说了什么"的单声道音频。
技术细节:
- 波束成形器是一个轻量级神经网络,只有 17.4 万个参数(比一张 100x100 的彩色图片的像素数还少)
- 它在时频域(time-frequency domain)工作:先把声波用 STFT(短时傅里叶变换)转成频谱图,处理后再转回声波
- 使用 6ms 的分析窗口,总延迟极小
- 先在合成数据上预训练(2 万个 5 秒混合音频),再在 3 小时真实录音上微调
- 真实世界测试中,它能把自语的信噪比从 -0.13 dB 提升到 8.36 dB
信噪比(SNR):目标声音的响度与噪音响度的比值,单位是分贝(dB)。SNR 越高,说明目标声音越"突出"。从 -0.13 dB(目标跟噪音差不多响)到 8.36 dB(目标比噪音响 6 倍以上),是非常显著的提升。
为什么这步关键:以前要让用户先注册一个声纹身份证,麻烦又不够准。现在改用"你自己开口说的话"当参照——你只要说话,系统就知道你在参与对话。不需要换朋友时重新注册,不需要换语言时重新训练。系统在你连续说话 5 秒后自动激活。
为什么不直接用声纹(d-vector)? 论文做了消融实验:用传统的 256 维声纹向量替代自语锚点,SISDRi 下降了 2.65 dB。原因是声纹是一个"平均化"的表示,丢失了时间维度的细节,而自语保留了"你在什么时刻说了什么"的完整时序信息。
所以这一节是想说:第一步是把"佩戴者正在说话"变成系统的起点信号,这样就绕过了传统方法"必须提前认识你朋友"的限制。
步骤 2:学"轮流说话"的节奏规律
日常类比:两个人下围棋,你不用看脸都能从落子节奏猜出他们是不是真在对弈——一个落子另一个会想几秒再落,几乎不会同时落子。对话也一样。
人类对话有一个全世界通用的规律(2009 年 Stivers 等人在 10 种语言中验证过):
- 你说一段,对方接一段(交替性)
- 几乎没人同时开口(重叠率极低,本文的真实数据中只有 1.3%)
- 转换停顿很短(平均只有 0.18 秒就接上,叫 Floor-Transfer Offset)
- 每轮发言平均 8.2 秒
这种规律就叫轮流说话(turn-taking)。
轮流说话(turn-taking):对话学里的术语,指人对话天然会交替发言、几乎不重叠、停顿很短的规律。就像打乒乓球——你打过去、对方打回来,几乎不会两人同时打。
Floor-Transfer Offset (FTO):两人对话时,一方话音落下到另一方开口之间的时间间隔。正值表示有停顿,负值表示有重叠。
输入:混合音频 + 前一步提取出的自语。
处理:慢模型分析过去几十秒的音频,识别出以下模式——
- 哪些时间段有人在说话
- 说话和沉默交替的节奏像不像在跟"我"对话
- 有没有跟"我"的说话节奏配合上的人
输出:一个"对话嵌入向量(conversation embedding)"——一串浓缩了"这场对话长什么样"的数字。
嵌入向量(embedding):把一段复杂内容压缩成的一串固定长度的数字。就像把一本书的内容压缩成一个 32 位的二维码——虽然丢失了细节,但保留了核心特征。两个嵌入向量越相似,代表原始内容越像。
为什么这步有用:
- 跨语言能用。中文、英文、日文虽然语速不一样,但"一来一回"的形态都差不多。论文用英文数据训练,直接零样本测试中文得到 6.50 dB、日文 7.92 dB 的提升。
- 不用提前注册任何人。新朋友走过来开始跟你聊,节奏对得上就被自动识别。
- 抗打扰。隔壁桌再吵,他们的说话节奏跟你这桌就是对不上。
消融验证:论文通过人为扰动轮流说话的节奏来验证这个机制。他们给沉默间隔加上随机偏移(标准差从 0.5 秒增加到 3 秒),结果 SISDRi 从 6.75 dB 逐渐下降到 4.16 dB。这证明模型确实在依赖轮流说话的时间结构来工作。
所以这一节是想说:节奏比身份更通用——它是跨语言、跨人群、无需注册的万能钥匙。模型学的是"配合关系"的模式,不是某个人的声音特征。
步骤 3:一快一慢两个模型搭配(双模型架构)
日常类比:人开车的时候——眼睛和反射神经负责"前面突然有东西马上踩刹车"(反应在毫秒级),大脑同时在后台想"过 500 米要不要变道"(反应在秒级)。两个反应速度不一样,各管各的,互不拖后腿。
本文的系统就是这样的两层设计:
慢模型(Conversation Embedding Model):
- 运行频率:每 1 秒跑一次
- 输入:过去 1 秒的混合音频 + 自语信号
- 网络结构:基于 TF-GridNet,6 个提取块(extraction block),每块包含"局部模块"(bidirectional LSTM 处理频率和时间信息)和"全局模块"(带因果掩码的自注意力,跨越多个 1 秒块)
- 输出:一个对话嵌入向量 E,维度为 D x F x L(D=32 通道,F=频率轴,L=时间步数)
- 参数量:98.6 万
- 运行设备:手机(Apple M2 芯片),每 1 秒块处理耗时 41.3 ms
- 峰值内存:591 MB
LSTM(长短期记忆网络):一种能"记住"过去信息的神经网络。想象一个人在记笔记——普通笔记本写满就忘,LSTM 像一个有索引的笔记本,重要的事会一直记着,不重要的会被覆盖。
自注意力(self-attention):让序列中每个位置都能"看到"其他所有位置的机制。想象一个班级讨论,每个人发言时都能参考之前所有人说过的话。问题是:人越多(序列越长),讨论越耗时——计算量随序列长度的平方增长。
TF-GridNet:一种在时间-频率二维网格上工作的神经网络架构,最初为语音分离设计。它分别在时间轴和频率轴上建模,然后交叉信息。
快模型(Streaming Model):
- 运行频率:每 12.5 毫秒跑一次(比一次眨眼短得多)
- 输入:当前 12.5 ms 的单声道混合音频 + 慢模型上一秒给出的对话嵌入
- 网络结构:也基于 TF-GridNet,但去掉了全局模块,把双向时间 LSTM 换成单向 LSTM(确保因果性——只看过去不看未来)
- 条件注入方式:对话嵌入在第 1 和第 2 个提取块之间,与特征图做逐元素乘法(element-wise multiplication)
- 输出:清洗后的目标对话音频(只保留对话伙伴的声音)
- 参数量:49.1 万
- 运行设备:嵌入式开发板(Orange Pi 5B,约 600 元),每 12.5 ms 块处理耗时 8.9 ms
- 峰值内存:86 MB
因果性(causality):模型在处理当前时刻时,只能看到过去的信息,不能"偷看"未来。这是实时系统的硬性要求——未来的声音还没录到,你不可能用它。
两者的配合方式:
时间轴 → → → → → → → → → → →
慢模型: [====== 1秒 ======] [====== 1秒 ======] ...
输出 E₁ 输出 E₂
快模型: [12.5ms][12.5ms]...[12.5ms] | [12.5ms][12.5ms]...
用 E₀(初始) | 用 E₁
注意:快模型在第 N 秒使用的是第 (N-1) 秒的嵌入。这个 1 秒的"落后"是故意设计的——它让慢模型完全不需要赶时间。
为什么需要这种设计? 核心矛盾是:要判断对话节奏,必须看很长的历史(论文验证了:只看 1 秒上下文比看全部上下文差 5.74 dB);但实时输出要求每 12.5 ms 出结果。如果一个模型又要看长历史又要快输出,自注意力的计算量会爆炸(O(n^2) 复杂度)。分成两个模型后:
- 慢模型虽然需要看长序列,但它每秒只跑一次,而且先做了"平均池化"降低时间分辨率再做自注意力,所以 token 数很少
- 快模型不需要看历史,只用当前 12.5 ms 的输入 + 一个固定大小的嵌入向量,内存开销恒定
消融验证:去掉慢模型,只用快模型,SISDRi 从 12.48 dB 暴跌到 1.45 dB。这说明没有长上下文的"指路信号",快模型根本分不清谁是对话伙伴。
所以这一节是想说:双模型架构把"看大局"和"出实时结果"这对矛盾拆开来同时满足。慢模型负责理解力,快模型负责反应速度,两者通过一串"数字密码"协作。
步骤 4:信号流的完整数据管道
日常类比:工厂流水线——原材料进来,经过切割、加工、组装、质检四个车间,最后成品出去。每个车间只管自己的活,但上一个车间的产出就是下一个车间的输入。
让我把完整的信号流从头到尾走一遍:
阶段 A:波束成形
- 输入:双耳录音 (2 通道,16kHz)
- 处理:6 个 GridNet 块 + 双窗 STFT(分析窗 96 样本 = 6ms)
- 输出:单声道自语信号
阶段 B.1:慢模型
- 输入:单声道混合音频 + 自语信号(沿通道维度拼接,变成 2 通道)
- 时频变换:STFT,得到 C x F x L 的复数矩阵,取实部和虚部拼接成 2C x F x L 的实数张量
- 编码:3x3 因果卷积层,映射到 D=32 维潜空间,得到 Z_e ∈ R^(32 x F x L)
- 6 个提取块:
- 局部模块:双向 LSTM 分别在频率轴和时间轴上建模(带 unfolding,kernel=2, stride=2 降采样减少计算)
- 全局模块:先平均池化到每秒一个表示,再用 4 头因果自注意力 + 绝对位置编码,然后复制回原始时间步
- 时移:输出整体向后移 T=1 秒(前面补零),模拟慢模型的"延迟"
- 输出:对话嵌入 E ∈ R^(32 x F x L)
阶段 B.2:快模型
- 输入:单声道混合音频(注意:不接收自语信号,避免额外延迟)
- 时频变换:STFT,chunk size = 200 样本 = 12.5ms,lookback=32 样本=2ms,lookahead=32 样本=2ms
- 编码:3x3 因果卷积层,映射到 Z_s ∈ R^(32 x F x L)
- 条件注入:Z_s 与 E 逐元素相乘(在第 1 和第 2 提取块之间)
- 6 个提取块:
- 频率方向双向 LSTM(同一时间帧内)
- 时间方向单向 LSTM(确保因果性,不等待未来)
- 无全局模块(节省计算)
- 解码:反卷积层 → 逆 STFT + overlap-add → 时域音频
- 输出:干净的目标对话音频 x ∈ R^(1 x T)
蓝牙传输优化:慢模型可以放在手机上,快模型放在耳机(或贴身开发板)上。两者之间只需要通过蓝牙传输那个 32 维的嵌入向量——数据量极小,远比传原始音频省电省带宽。
关键设计选择总结:
| 设计决策 | 原因 |
|---|---|
| 自语不送入快模型 | 避免波束成形的额外延迟影响实时性 |
| 慢模型落后快模型 1 秒 | 让慢模型可以从容计算,不阻塞快模型 |
| 两个模型都用单声道输入 | 减少计算量,让模型专注学节奏而非空间方位 |
| 快模型用单向时间 LSTM | 确保因果性,输出不依赖未来 |
| 慢模型用因果掩码自注意力 | 可以看到所有过去,但不看未来 |
所以这一节是想说:信号从麦克风到耳朵的完整路径,每一步都有明确的"输入 → 处理 → 输出",设计选择环环相扣,都是为了同时满足"低延迟"和"长记忆"。
步骤 5:用合成数据训练
日常类比:你想学画"一群人在公园下棋",但找不到这种照片。怎么办?把"单人下棋"的照片和"公园背景"用 PS 拼起来,自己造训练素材。本文也是这么干的——用真人对话的节奏模板 + 合成的语音 + 模拟的房间。
为什么不能直接用真实录音? 因为要训练模型,需要有"正确答案"——即混合音频中每个人单独的干净语音。但真实场景中你录到的是混合的,根本没法拆开。所以必须"先拼后混":先有每个人的干净录音,把它们合成混合音频,这样训练时就知道"正确答案是什么"。
合成数据的五个子集:
| 数据集 | 目标对话人数 | 干扰对话人数 | 用途 |
|---|---|---|---|
| Libri (2spk) | 2 | 2 | 训练 + 测试 |
| Libri (3spk) | 3 | 2 | 训练 + 测试 |
| Libri (leaving) | 3→2(有人中途离开) | 2→3 | 训练 + 测试 |
| Libri (4spk) | 4 | 2 | 仅测试 |
| Libri (5spk) | 5 | 2 | 仅测试 |
合成过程四步:
- 从 RAMC(180 小时中文真人对话)中取时间戳——"A 说 0
3.2 秒,B 说 3.47.1 秒"这种节奏表 - 把每个时间槽的内容换成 LibriTTS(英文语音库)中随机一个人的录音。这样节奏是真人的,声音内容是英文的
- 用 PyRoomAcoustics 模拟一个虚拟房间:
- 房间长宽 5
10 米,高 34 米 - 佩戴者在房间中心附近(0~1 米偏移)
- 其他说话人距佩戴者 0.5~1.5 米
- 双耳麦克风在佩戴者头部两侧(间距约 15cm)
- 混响时间 RT60 从 0.15~1 秒随机采样
- 房间长宽 5
- 用房间脉冲响应(RIR)对每个人的语音做卷积,模拟出"在佩戴者耳朵位置听到的双声道录音"
混响(reverb / RT60):声音在房间里被墙壁反弹后形成的回响。RT60 定义为声音能量衰减到原来的百万分之一(60dB)所需时间。空浴室 RT60 约 1.5 秒(回声很大),铺地毯的卧室约 0.3 秒(回声小)。
房间脉冲响应(RIR):如果在房间某个位置放一个理想的"啪"声,在另一个位置录到的声音波形就是 RIR。它编码了从声源到接收点之间所有反射路径的信息。把任何声音跟 RIR 做卷积(一种数学运算),就能模拟出"在那个房间里听那个声音"的效果。
另外还有 Candor 数据集:850 小时英文双人对话(Zoom 录制的真人首次对话),提供真实的说话模式。生成 7000 个训练样本 + 500 个测试样本。
训练三阶段策略:
| 阶段 | 做什么 | 目的 |
|---|---|---|
| Stage 1 | 在非空间化的合成数据 + Candor 上联合训练快慢模型,120 epochs | 学会基本的对话节奏识别 |
| Stage 2 | 在空间化数据上继续训练,用波束成形器输出替代真值自语,50 epochs | 适应真实的双耳空间化条件 |
| Stage 3 | 对训练数据的沉默间隔做随机扰动(N(0, 0.5s)),42 epochs | 弥合 Zoom 对话(陌生人、节奏规整)与现实对话(熟人、节奏随意)的分布差异 |
训练使用负 SNR 损失函数(让模型最大化输出与目标的信噪比),AdamW 优化器,梯度裁剪 max_norm=1,8 张 L40s GPU,batch size=16。
所以这一节是想说:用真节奏 + 假声音 + 假房间,巧妙地绕过了"真实戴耳机对话录音几乎不存在"的数据稀缺难题。三阶段训练逐步逼近真实世界条件。
步骤 6:在便宜硬件上实时推理
日常类比:一道菜再好吃,如果要在五星级厨房里用进口设备才能做,普通人就吃不到。这一步是证明"家常厨房也做得出来"。
部署方案:
- 快模型 → Orange Pi 5B(一块约 600 元的嵌入式开发板)
- 慢模型 → Apple M2 芯片(手机或笔记本)
- 两者之间通过蓝牙传输嵌入向量
实时性验证:
- 快模型每 12.5ms 块的处理时间:平均 8.9ms(< 12.5ms,跟得上不堆积)
- 慢模型每 1s 块的处理时间:41.3ms(远 < 1s)
- 端到端总延迟:约 30ms,低于人耳可感知阈值(约 50ms)
内存占用:
- 快模型峰值:86 MB
- 慢模型峰值:591 MB
这意味着不需要云服务器,不需要高端显卡,一个开发板 + 一部手机就能跑全部流程。
所以这一节是想说:再好的算法,跑不上真实设备就是论文里的玩具。本文证明了它能在千元级硬件上以 30ms 延迟实时运行。

关键数字(What works)
看数字之前先记住:**SISDRi(Scale-Invariant Signal-to-Distortion Ratio improvement)**可以理解成"目标声音相对原始混音被加强了多少分贝"。每多 3 dB,听感大约响一倍。正值表示提升,负值表示恶化。
| 测试条件 | SISDRi (dB) ↑ | 准确率 ↑ | 混淆率 ↓ | ΔPESQ ↑ |
|---|---|---|---|---|
| Libri 2人 (空间化) | 15.68 | 99.2% | 0.2% | 0.65 |
| Libri 3人 (空间化) | 14.29 | 96.1% | 0.6% | 0.63 |
| Libri 离场 (空间化) | 13.89 | 95.7% | 1.5% | 0.60 |
| Candor (空间化) | 9.82 | 93.9% | 1.1% | 0.56 |
| SpokenWOZ OOD (空间化) | 11.95 | 92.1% | 1.5% | 0.52 |
| RAMC 中文 (非空间化) | 6.50 | 85.5% | 5.6% | 0.63 |
| 日文 (非空间化) | 7.92 | — | — | — |
| 真人录音 2人 | 7.84 | 85.0% | 1.1% | — |
| 真人录音 3人 | 6.00 | 73.4% | 3.7% | — |
| 基线 DeepFilterNet2 (空间化) | -3.45 | 16.8% | 9.2% | -0.16 |
混淆率(Confusion Rate, CR):模型把陌生人错当成你同伴的频率。1.5% 意味着 100 次判断中只有 1.5 次把陌生人的声音当成你朋友放大出来——这是一个安全指标。
PESQ:一个国际标准的"机器打分听感"工具,约 1~4.5 分。ΔPESQ 是模型输出相对输入的改善量。
人类主观评价(11 人,5 分制):
| 维度 | 模型输出 | 原始混音 |
|---|---|---|
| 噪音抑制 | 4.29 | 1.67 |
| 理解容易度 | 4.35 | 1.97 |
| 聆听费力度 | 4.45 | 1.97 |
| 总体 MOS | 4.30 | 1.88 |
泛化到未见人数:
| 对话人数 | SISDRi (dB) |
|---|---|
| 2 人(训练过) | 12.48 |
| 3 人(训练过) | 12.03 |
| 4 人(未训练) | 11.94 |
| 5 人(未训练) | 11.85 |
几乎不掉分,说明模型学到的是通用的"配合节奏",不是死记"N 个人的模式"。

上面这张直方图显示大部分真实录音样本的 SISDRi 集中在 5~15 dB 之间,约 80% 样本获得了正向提升。

这张散点图特别有意思:横轴是一个人在属于你这桌时的 SISDRi(正值 = 被增强),纵轴是同一个人离开你这桌加入别桌后的 SISDRi(负值 = 被压制)。绝大多数点落在"右下角"(先增强后压制),证明模型会动态适应对话关系的变化。
所以这一节是想说:数字证明这不是实验室玩具——在多种条件(跨语言、跨人数、真人录音)下都有意义的提升,而且真人也觉得"好太多了"。
实验结果说明了什么
把上面的数字串起来看,有几个重要结论:
结论 1:节奏确实比声纹好用。 模型从没"听过"中文和日文,但因为它学的是节奏而非发音,直接零样本迁移就有 6~8 dB 的提升。这在"每种语言都要重新训练"的传统路线里是不可想象的。
结论 2:合成数据训练 → 真人录音验证,链路跑通了。 从纯合成数据训出来的模型,拿到 11 个真人 6.8 小时的录音上测试,依然有 7~8 dB 的提升。这一步通常是最容易掉链子的地方(sim-to-real gap),本文证明"只要节奏是真人的,声音和房间可以是假的"。
结论 3:双模型不是可选的,是必须的。 去掉慢模型后 SISDRi 从 12.48 暴跌到 1.45(下降 88%)。快模型独自根本不知道"谁是对话伙伴"——它只有毫秒级的视野,看不到秒级的轮流说话模式。
结论 4:上下文长度很重要。 把慢模型能看到的历史从"全部"限制到 10 秒、5 秒、1 秒,SISDRi 分别下降 2.12、4.06、5.74 dB。对话关系的判断需要几十秒的积累,不是几秒就够的。
结论 5:真人评分远比仪器数字更有说服力。 总体 MOS 从 1.88 升到 4.30——这是从"几乎没法听"到"体验良好"的质变。
所以这一节是想说:实验不只证明"数字好看",更证明了设计选择(节奏>声纹、双模型>单模型、长上下文>短上下文)的每一个都是必要的。
你应该懂的几个新词
Egocentric audio(第一视角音频):从佩戴者自己耳朵位置录到的双声道音频。类比第一人称 vlog,只不过是声音版。左右耳的细微差异携带着方向信息。
Beamformer(波束成形器):用多个麦克风之间的相位差当"声学探照灯",把某个方向的声音聚焦出来。本文用它对准佩戴者自己的嘴,提取自语信号。
Turn-taking(轮流发言):对话里的"一来一回"规律——人说话会交替、几乎不重叠、停顿很短。全球 10 种语言都遵循这个规律。本文模型抓的就是这个节奏。
SISDRi(信噪比提升,单位 dB):衡量"目标声音相对原始混音被加强了多少"。越大越好,每多 3 dB 听感大约响一倍。
Conversation Embedding(对话嵌入向量):慢模型输出的一串数字,浓缩了"这场对话的节奏长什么样"的信息。快模型拿到它就知道"该保留谁、压制谁"。
Streaming Model(流式模型):边收边处理、不等录音结束就出结果的模型。类比直播 vs 录播——直播是流式的,录播是离线的。
Confusion Rate(混淆率, CR):模型把陌生人错当成同伴的频率,越低越好。是本文新定义的安全指标。
RT60(混响时间):声音在房间中从发出到衰减 60dB 所需的秒数。越大说明回声越重。
OOD(Out-of-Distribution,分布外):测试数据来源跟训练数据不一样。类比"高考考了课外题"——模型面对从未见过的数据分布,依然要给出好结果。
Negative SNR Loss(负信噪比损失):训练时的目标函数,让模型最大化输出信号与目标信号之间的信噪比。最小化这个损失 = 让输出越来越干净。
PESQ(感知语音质量评估):一个 ITU 国际标准的语音质量自动评分工具,模拟人耳的主观感受,范围约 1~4.5 分。
所以这一节是想说:这套术语是看懂全文的最小词汇表,每个都能用一句类比抓住核心含义。
它有什么搞不定的

上面这张图(论文 Fig. 5)展示了一个失败场景:紫色线是对话伙伴的 SISDRi 随时间的变化,灰色区域标记佩戴者在说话的时段。当佩戴者超过 2 分钟不说话时,SISDRi 直接掉到 0 以下(完全失效),直到佩戴者重新开口才恢复。
具体的局限列表:
1. 你长时间不说话就失灵(最大软肋)。比如听讲座、看电影、安静听别人聊天——这些"我只听不说"的场景,系统的锚点就消失了,完全不知道该保留谁。
2. 新人刚开口的前 2 秒有延迟。每个新加入对话的人前 2 秒 SISDRi 只有 4.77 dB,要等 2 秒后才稳定到 8+ dB。对于快速轮换的多人讨论,这 2 秒的"预热期"可能漏掉关键句子。
3. 三人对话比两人差一档。两人 7.84 dB vs 三人 6.00 dB。而家庭聚会、多人圆桌恰恰是助听器最常见的使用场景。
4. 两边同时换人说话时容易混淆。当你这桌和隔壁桌在 1 秒内同时发生说话人转换时,SISDRi 降到 4.98 dB(正常是 8+ dB)。因为两边的节奏瞬间"对齐"了,模型分不清。
5. 模型不会告诉你"我不确定"。万一它把陌生人当成你的同伴,你完全听不到被滤掉的声音,也不知道自己漏听了什么。没有任何"置信度提示"或退化机制。
6. 没测试过真正的听力障碍用户。测试参与者都是听力正常的成年人(21~39 岁)。但目标人群是助听器使用者——他们的对话模式(更慢、更多重复确认)可能跟训练数据不同。
7. 文化差异未充分验证。虽然跨语言泛化不错,但不同文化的对话节奏确实有差异(比如日本人的沉默间隔比美国人长),更多语言/文化需要验证。
所以这一节是想说:每个设计选择都有代价。"不靠声纹靠节奏"换来了免注册的便利,但也意味着"不开口就失灵"。"只看节奏不看内容"让它跨语言,但也让它在节奏冲突时无能为力。
它和别的几篇是什么关系
纵向:同一实验室的"可编程耳朵"路线图
华盛顿大学 Gollakota 实验室连续几年在做一条清晰的产品路线——每篇论文都在减少用户需要执行的操作数:
Semantic Hearing (UIST 2023)
→ 用户手动选"我要听什么类型的声音"(狗叫/警笛/人声)
→ 需要操作:选类别
Look Once to Hear (CHI 2024)
→ 看一眼目标人的脸就完成注册
→ 需要操作:看一眼
Target Conversation Extraction (arXiv 2024)
→ 用轮流说话节奏离线提取对话
→ 需要操作:无,但不是实时
★ 本文:Proactive Hearing (UIST 2024)
→ 实时、免注册、自动判断对话伙伴
→ 需要操作:无
LlamaPIE (ACL Findings 2025)
→ 接入语言模型,从"听清"到"听懂 + 主动建议"
→ 需要操作:无,且能主动提供信息
每一步都在减少"人需要做的事",同时增加"机器能理解的深度"。本文是"用户什么都不用做"的关键一棒。
横向:与竞争路线的对比
| 路线 | 代表工作 | 需要什么硬件 | 实时性 | 注册需求 |
|---|---|---|---|---|
| 声纹匹配 | 传统说话人验证 | 普通麦克风 | 实时 | 需要预录 |
| 脑电波解码 | NeuroHEED | 头皮电极 | 接近实时 | 不需要 |
| 视觉辅助 | Look Once to Hear | 摄像头 + 麦克风 | 实时 | 看一眼 |
| 对话节奏 | 本文 | 双耳麦克风 | 实时 | 不需要 |
听觉三连:本文在三篇听觉论文中的定位
在本导读的听觉论文族中,三篇论文各管一个层面:
- Proactive Hearing(本文)= 主动听觉决策:解决的是"agent 决定听谁"——这是最高层的问题,类似大脑的选择性注意力。它输出的是"保留 / 压制"的决策。
- NeuralAIDS = 边缘设备上的神经音频处理:解决的是"在极低功耗芯片上跑音频处理算法"——类似耳蜗的信号放大。关注的是硬件约束下的算法实现。
- Acoustic Swarms = 分布式麦克风阵列:解决的是"多个机器人协作形成大型虚拟麦克风阵列"——类似一群人各站不同位置帮你"听"不同方向的声音。
三者是互补的:Proactive Hearing 的"决策层"可以跑在 NeuralAIDS 的"硬件层"上,而 Acoustic Swarms 的"阵列层"可以为 Proactive Hearing 提供更高质量的多角度输入。想象一个完整系统:多个分布式麦克风(Acoustic Swarms)采集环境音 → 低功耗芯片预处理(NeuralAIDS)→ 智能决策保留谁的声音(Proactive Hearing)。
所以这一节是想说:本文是"主动听觉"这条路线的核心——它不只是在做信号处理,它在做认知层面的"选择性注意力"。
和本导读的关系
本文对应导读 Ch20: 听觉智能 中的"声源分离与主动听觉"部分(Part 2)。
在 Ch20 的知识体系中,各篇论文的位置如下:
- Ch20.2-20.3 建立了音频信号基础(采样、频谱图、梅尔刻度、神经音频编解码器)——本文的波束成形器和 TF-GridNet 都在时频域工作,理解 STFT 是前提
- Ch20.4 Whisper 解决"听懂说了什么"(ASR)——本文不做 ASR,但它的后续工作 LlamaPIE 会接入 LLM,那时就需要 ASR
- Ch20.5 AudioLM 解决"AI 自己会说"(生成)——与本文方向不同
- 本文 = Ch20 Part 2 的核心:从"被动处理音频"升级到"主动决策该听谁"
本文还连接了 Ch18(多模态)中 ImageBind 的思想——把音频表示压缩成嵌入向量,跨模态传递信息。对话嵌入向量 E 本质上就是一种"听觉理解的压缩表示"。
所以这一节是想说:本文是导读听觉章节的"决策核心",它把前面学的信号基础变成了可行动的系统。
思考题
Q1:为什么本文选择"对话节奏"而不是"声纹"作为识别对话伙伴的主要线索?如果两个人的声音很像(比如双胞胎),本文的方法会受影响吗?
提示
思考两个维度:(1) 声纹需要预注册,节奏不需要——这是产品层面的优势;(2) 声纹是"是谁在说",节奏是"在跟谁配合说"——后者才是"对话伙伴"的本质定义。对于双胞胎的问题:声纹路线确实会被迷惑(两人声音几乎一样),但节奏路线不受影响——重点是谁在跟你配合,不是谁的声音像谁。
Q2:慢模型故意落后快模型 1 秒。如果把这个延迟从 1 秒增大到 4 秒,会发生什么?如果减小到 0.1 秒呢?
提示
论文做了消融:从 1 秒增到 4 秒,SISDRi 下降 1.22 dB。更大延迟意味着嵌入向量更新更慢,对话动态的响应更迟钝(比如有人突然加入对话,4 秒后才被识别)。减小到 0.1 秒则会让慢模型时间预算太紧——它需要在 0.1 秒内完成 41.3ms 的计算(本身不是问题),但更关键的是每个"块"只有 0.1 秒的音频信息,自注意力需要处理更多的 token(同样一分钟对话,被切成 600 个 0.1 秒块 vs 60 个 1 秒块),计算量暴增。
Q3:论文用中文 RAMC 的时间戳 + 英文 LibriTTS 的语音来合成训练数据。为什么不直接用英文对话数据集的时间戳?
提示
RAMC 是面对面的中文对话(180 小时),其轮流说话节奏更接近真实生活场景。而英文数据集 Candor 虽然有 850 小时,但它是通过 Zoom 远程录制的首次对话——对话风格偏正式、停顿偏长。混合使用两者的节奏可以增加训练分布的多样性。更关键的是,用中文节奏 + 英文语音的组合,让模型被迫只学节奏而非语言内容,天然获得了跨语言泛化能力。
Q4:如果佩戴者完全不说话(纯被动听),系统就失效了。你能想出什么改进方案来解决这个问题?
提示
几个可能的方向:(1) 用视觉辅助——摄像头检测你的头部朝向和眼神接触(Look Once to Hear 的路线);(2) 检测非语言信号——点头、"嗯嗯"这类回应声也是对话参与的证据;(3) 用内容理解——接入 ASR + LLM,根据对话内容的连贯性判断谁在跟谁说话(LlamaPIE 的方向);(4) 用历史记忆——记住"5 分钟前你在跟 A 说话",在短暂沉默后维持这个判断;(5) 用户主动模式——提供一个"被动听讲"模式的按钮。
Q5:论文说模型从 23 人训练数据直接泛化到 45 人几乎不掉分。这在直觉上为什么说得通?
提示
因为模型学的核心特征是"配合 vs 不配合"的二元关系。不管对话有几个人,关键模式始终是:(a) 对话伙伴跟你交替说话、停顿短、不重叠;(b) 非对话者跟你没有这种时间相关性。多了几个对话伙伴,只是增加了几个"跟你配合"的人,基本模式不变。这就像你能从 2 人乒乓球的经验推广到 4 人打乒乓球——轮流击球的规则是一样的。
Q6:本文只用了单声道作为快/慢模型的输入(不是双声道)。这是为什么?双声道不是能提供更多方向信息吗?
提示
论文明确说了三个原因:(1) 减少快模型的计算量(通道数减半);(2) 让模型专注于学习对话节奏(turn-taking dynamics)而非空间方位——这样模型在空间配置变化时(人移动、换位置)更鲁棒;(3) 双声道信息已经被波束成形器利用过了(用于提取自语),再给模型双声道是冗余的。空间信息在波束成形阶段已经完成了它的使命。
Q7:假设你是产品经理,要把这个系统做成一个消费级产品。你认为最大的非技术障碍是什么?
提示
几个维度的障碍:(1) 隐私:系统需要持续录音并分析所有人的对话节奏,即使它不"理解"内容,用户和周围人可能仍有隐私顾虑;(2) 信任:1.5% 的混淆率听起来低,但意味着每小时可能有好几次误判,用户在关键时刻(比如商务会议)可能不敢完全依赖它;(3) 法规:录音设备在不同国家有不同法律要求;(4) 用户教育:用户需要理解"我必须参与说话才有效"这个限制;(5) 硬件集成:需要双耳麦克风 + 处理芯片 + 蓝牙连接手机,硬件集成度要求高。
Q8:论文的 Stage 3 训练对沉默间隔做了随机扰动(N(0, 0.5s))来弥合分布差异。为什么 Zoom 对话和面对面对话的节奏会有差异?这种数据增强的局限是什么?
提示
Zoom 对话的特殊性:(1) 陌生人首次对话,比较客气,停顿更长、打断更少;(2) 网络延迟导致实际的 FTO(转换间隔)比面对面更长;(3) 没有非语言线索(眼神、手势)辅助轮换,导致更多"尴尬沉默"和"同时开口"。面对面的朋友对话则更随意——停顿更短、重叠更多、甚至有很多"嗯"/"哈哈"的短回应。局限在于:随机扰动只改变了沉默的长度分布,没有改变其他特征(如回应词频率、重叠模式、情绪起伏的节奏),所以仍然存在 gap(真实录音上的 SISDRi 比合成数据低约 5 dB)。
一些好奇心问答(FAQ)
Q1:模型有多大?
三个子网络加起来:波束成形器 17.4 万 + 慢模型 98.6 万 + 快模型 49.1 万 = 约 165 万参数。作为对比,GPT-2 Small 有 1.24 亿参数,本文的模型只有它的 1.3%。这么小的模型能做到这些,归功于任务本身的特定性——它不需要"理解世界",只需要学会一种节奏模式。
Q2:训练花了多少钱?
8 张 L40s GPU(约 $2/卡/时)训了 Stage 1 约 120 epochs + Stage 2 约 50 epochs + Stage 3 约 42 epochs。粗估总共 15002000 GPU 小时,云上约 $30004000(约 2~3 万人民币)。一个研究生项目完全能负担。
Q3:我能装进 AirPods 吗?
不能——AirPods 不开放第三方代码。但作者演示了用 Orange Pi 5B(约 600 元)+ Sonic Presence SP15C 双耳麦克风 + 手机的组合。总硬件成本不到 2000 元。
Q4:端到端延迟到底多少?
快模型处理一个 12.5ms chunk 需要 8.9ms,加上 STFT 的 lookback/lookahead 各 2ms,总算法延迟约 12.9ms。加上硬件 I/O 约 15-20ms,端到端约 30ms——低于人耳"能感知到回声"的阈值(约 50ms)。
Q5:为什么用负 SNR 而不是更常见的 MSE 作为损失函数?
SNR 损失是尺度不变的(Scale-Invariant)——不管目标信号本身多响或多轻,损失值只关心"信号和噪音的比例"。这对音频处理特别重要,因为不同说话人的音量差异很大。MSE 会偏好响的信号,SNR 不会。
Q6:这个跟降噪耳机(如 AirPods Pro 的 ANC)有什么区别?
完全不同的问题。ANC(Active Noise Cancellation)是物理消除环境中的持续噪音(风声、引擎声),靠的是发出反相声波抵消。本文做的是智能语音分离——从人类说话声中区分出"谁是你的对话伙伴"。ANC 处理的是确定性的物理噪音,本文处理的是不确定性的社交信号。
Q7:如果两个不同桌的人恰好在同一时刻开始跟你说话,模型会怎样?
这正是"turn-change collision"问题。论文发现当你这桌和隔壁桌在 1 秒内都发生说话人转换时,性能下降到 4.98 dB。模型的判断依据是"谁的节奏跟你配合",如果两边同时"配合上"了,就会短暂混淆。但这种情况只占 11.3% 的时间。
Q8:后续工作 LlamaPIE 做了什么?
LlamaPIE(2025)把本文的"听清"能力接入了 LLM(大语言模型),实现了"听懂 + 主动建议"。比如你在跟人讨论明天去哪吃饭,LlamaPIE 不只帮你听清对方说了什么,还能在你犹豫时主动提供附近餐厅推荐。它代表了从"增强听觉"到"增强认知"的进化。
所以这一节是想说:把论文当真实产品来追问,每个实际问题都有对应的设计考量或工程权衡。
如果你想再深入
延伸阅读(按优先级排序)
- Target Conversation Extraction (Chen 2024b) — 本文的直接前作。离线版,用声纹 + 单耳。读完能看清从离线到实时的工程飞跃。
- LlamaPIE (Chen 2025) — 本文的直接后续。接入 LLM,从"听清"到"听懂"。看下一步的演化方向。
- Semantic Hearing (Veluri 2023) — 同组兄弟篇。换一个角度:"按声音类型过滤"。三篇放一起读能完整看清 Gollakota 组的路线。
- Look Once to Hear (Veluri 2024a) — "看一眼目标人完成注册"的路线。对比"视觉辅助 vs 纯音频"两条路。
- Stivers 2009 (PNAS): 全球 10 种语言的轮流说话研究 — 跨语言泛化能成立的理论根基。语言学方向的经典。
- NeuroHEED (Pan 2024) — 竞争路线代表。用脑电波解码注意力。看看"另一条路"的进展。
- TF-GridNet (Wang 2023) — 本文网络架构的基础。如果想深入理解模型结构,需要读这篇。
- DeepFilterNet2 (Schroter 2022) — 本文的基线模型。了解工业级语音增强的当前水平。
所以这一节是想说:找到一篇论文的家族树和后续走向,是真正读懂它的最后一步。
原文信息
论文标题:Proactive Hearing Assistants that Isolate Egocentric Conversations
作者:Guilin Hu, Malek Itani, Tuochao Chen, Shyamnath Gollakota
机构:University of Washington, Paul G. Allen School of Computer Science & Engineering(Gollakota Lab——同组还有 Semantic Hearing、Look Once to Hear、Sound Bubbles 等一系列"可编程耳朵"工作)
发表:UIST 2024
链接:
- 项目主页:https://proactivehearing.cs.washington.edu/
- 本地全文解析:
papers/proactive-hearing/paper.md
BibTeX:
@inproceedings{hu2024proactive,
title={Proactive Hearing Assistants that Isolate Egocentric Conversations},
author={Hu, Guilin and Itani, Malek and Chen, Tuochao and Gollakota, Shyamnath},
booktitle={Proceedings of the 37th Annual ACM Symposium on User Interface Software and Technology (UIST)},
year={2024},
organization={ACM}
}
◼
引用本笔记 / Cite this note
@online{eai_proactive_hearing_2026,
title = {(readable note) Proactive Hearing Assistants that Isolate Egocentric Conversations},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/proactive-hearing/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?