NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
给"完全没接触过 AI / 嵌入式硬件"的读者写的精读笔记。所有专业词第一次出现都会解释清楚。只看这份笔记就能理解全文机制。
一句话讲什么(TL;DR)
在咖啡馆听不清对面说话?让助听器自己降噪,不连手机、不连云——把一个原本跑在显卡上的"降噪大脑"拆骨瘦身 100 倍,再教它用"粗糙的算盘"(8 位整数芯片)照样算出接近原来的答案,最终全部塞进一只挂在耳朵后面的小壳子里,处理一帧音频只要 5.54 毫秒,功耗只有 71 毫瓦,28 个真人听测显著好于前作。
所以这一节是想说:这是一篇"把聪明的耳机做小做省电"的论文,核心贡献是*三层联合设计——硬件、神经网络、数字压缩一起改。*
这是个什么场景
周末下午的星巴克,你和朋友约在窗边那张桌子。隔壁桌大声讨论项目、咖啡机"咔咔"打奶泡、背景音乐里有人在唱英文,全都叠在一起糊成一锅声音粥。你戴着 AirPods Pro 想听清朋友说"你昨天那个 PR 改完了吗"——结果只听到"你昨天那个……改完了吗",中间那段被噪声盖住了。
把场景换到 70 岁的爷爷戴助听器,问题被放大十倍——他听对面孙子说话基本靠猜。

现在市面上"AI 助听器"主要有两种做法:一是把麦克风录到的声音偷偷传到手机上,让手机算完再传回来,问题是网络一抖回声就乱了;二是在助听器自己里面跑一个超精简的小程序,问题是噪音确实小了但孙子的声音也跟着变得像在水底下说话。
这篇论文要解决的就是这个尴尬:能不能让助听器自己就把这件事做好,不依赖任何外部设备?
但工程上这是个"听起来不可能"的任务,因为同时要满足三件事:
- 小:助听器电池只有 300 mAh(毫安时,电量单位),相当于四节纽扣电池串在一起。
- 快:声音从耳朵进、被处理完、再播给你听,整个过程必须在 10 毫秒(千分之一秒)以内。慢一点就会出现"自己说话像在山洞里回响"的诡异感——学名叫"梳状滤波效应"。
- 像云端那么聪明:得跟手机/电脑里的大模型一样能干净地降噪,不能降噪的同时把人声也"咬碎"。
助听器(hearing aid):戴在耳朵上、把声音放大让听障人士听得清的小设备。 mAh(毫安时):电量单位,数字越大电池能撑越久。手机电池大约 4000 mAh,助听器电池只有它的 1/13。
听觉三连中的位置
本导读有三篇和"听"相关的论文,合称"听觉三连"。它们分别解决的问题是:
| 论文 | 核心问题 | 类比 |
|---|---|---|
| Proactive Hearing | 从多人中"挑"出你在跟谁聊天 | 大脑的"注意力"——选谁听 |
| NeuralAids(本文) | 把降噪 AI 装进耳朵里的芯片上 | 大脑的"神经处理"——怎么算 |
| Acoustic Swarms | 多个小机器人自动铺成麦克风阵列 | 耳朵的"硬件排布"——怎么收 |
你可以把它们想成一条工厂流水线:Acoustic Swarms 负责"多只耳朵怎么摆",NeuralAids 负责"耳朵里的芯片怎么算",Proactive Hearing 负责"算完之后挑谁听"。三篇分别对应硬件层、计算层、决策层。
所以这一节是想说:这论文想做一个"耳朵戴的小电脑",自己就能听清吵闹里的人话。它在听觉三连里负责"算力"那一环。

之前的人怎么做的,为什么不够好
在 NeuralAids 之前,"助听器降噪"这条路上有四种方案,每种都卡在不同的地方:
方案 A:把声音传到手机算。 就像点外卖叫云端帮你做菜。ClearBuds(CHI 2022,同实验室前作)就是这条路——耳机录音,手机处理,再传回耳机。结果是网络一卡饭就凉:对话延迟超过 10 毫秒就会让你感觉"不对劲",而蓝牙来回传一次最少也要几十毫秒。
方案 B:在耳机里跑一个超精简模型。 TinyDenoiser(2020)是这条路的代表——用一个只有几十 KB 的小 LSTM 网络,全部在 GAP9 芯片上跑。问题出在两个地方:一是它的算法延迟高达 25 毫秒,远超 10 毫秒门槛(后面会解释"算法延迟"和"硬件延迟"的区别);二是它的网络太简单,降噪的同时把人声也弄糊了——主观打分甚至比不开 AI 还低。
方案 C:商业产品(AirPods Pro 等)。 其实它们也没完全在耳机里算,至少把一部分计算扔回手机。而且技术细节都是商业秘密,论文无法复现和比较。
方案 D:Phonak 2024 年底的 AI 助听器。 号称做到了全设备端推理,但同样是商业秘密,不公开怎么做的。
LSTM(Long Short-Term Memory,长短期记忆网络):一种"会记住过去"的神经网络模块。你可以想成一个有"小本子"的考生——答题时会翻看前面几道题的笔记。 算法延迟(algorithmic latency):模型本身设计上"必须等多久才能输出"。比如你需要看完整句话才能翻译,那"等你说完"就是算法延迟。 硬件延迟(hardware latency):芯片实际算这一帧花了多久。两者加起来才是真正的端到端延迟。
这四种方案的对比可以用一张表看清:
| 方案 | 在哪算 | 延迟 | 降噪效果 | 能复现吗 |
|---|---|---|---|---|
| A (ClearBuds) | 手机 | 高(蓝牙往返) | 好 | 是 |
| B (TinyDenoiser) | 耳机 | 25 ms(太慢) | 差(人声也糊了) | 是 |
| C (AirPods Pro) | 耳机+手机 | 未知 | 未知 | 否(商业秘密) |
| D (Phonak) | 耳机 | 未知 | 未知 | 否(商业秘密) |
| NeuralAids | 耳机 | 10 ms | 好 | 是 |
这篇论文说:我们用一套完全公开的、能复制的方法,把"全程在耳朵里算、低于 10 毫秒延迟、降噪效果接近云端"这三件事同时做出来。
所以这一节是想说:要么慢、要么糊、要么商业秘密。这篇要做一份开源的"全程在耳朵里算"的完整样本。
这篇论文的新想法
一句话概括:硬件 + 神经网络 + 数字压缩,三层一起设计。
具体地说,这篇论文不是只改了模型、也不是只改了芯片,而是把三件事拧在一起做了一个"联合设计":
- 硬件层:设计了一个五块 PCB 叠成的无线可穿戴助听器,核心是一颗叫 GAP9 的低功耗 AI 芯片。
- 神经网络层:从一个"聪明但太重"的 SOTA 模型(TF-GridNet)出发,做了三刀魔改让它跑进芯片。
- 数字压缩层:用混合精度量化 + 量化感知训练(QAT),把 32 位小数压成 8 位整数而几乎不掉点。
为什么必须三层一起改?因为单独优化任何一层都会撞墙。光改网络不够——你改出来的网络在浮点模式下跑不进 6 毫秒实时要求。光做量化不够——直接把好模型压成整数会从 8.65 dB 掉到 -1.70 dB(比不降噪还差)。光改硬件不够——没有匹配的软件,芯片再好也白搭。这种"三层联合设计"在学术界叫做 hardware-software co-design(硬件-软件协同设计)。
SOTA(State-Of-The-Art):目前最强水平。 PCB(Printed Circuit Board,印刷电路板):电路用铜线印在塑料板上做成的硬件载体。你能看到的所有电子产品里都有它。 co-design(协同设计):不是先做硬件再适配软件(或反过来),而是两边同时设计、互相迁就。
所以这一节是想说:单独优化哪一层都不够,要三层联手。这就是为什么论文的三大贡献恰好对应硬件、网络、量化三条线。
它分几步做的(方法)
整篇论文做的事可以拆成三大块:搭硬件、改神经网络、做数字压缩。下面逐一展开。
第一步:搭一个"五层蛋糕"硬件
类比:像麦当劳的巨无霸——五层叠在一起,每一层各司其职:上面那片管面包、中间那片管菜、最下面那片管肉。每层换一种功能,但合在一起才是一个完整汉堡。

输入:空气中的声波(含说话人声 + 噪声)。
处理:作者把五块小电路板叠在一起塞进耳后助听器壳里。每一块板各管一件事:
| 板子名 | 层数 | 职责 |
|---|---|---|
| PWR | 2 层柔性板 | 电源管理、充电、编程接口 |
| BT | 2 层刚性板 | 蓝牙低功耗(BLE)通信 |
| AI | 6 层刚性板 | 核心 AI 计算(装了 GAP9 芯片) |
| PERIPH | 4 层刚性板 | 外围设备:RAM、闪存、IMU、DAC |
| MIC | 2 层柔性板 | 3 个麦克风 + 2 个按钮 |
最关键的那块叫 AI 板,里面装了一颗叫 GAP9 的特制芯片。
GAP9(GreenWaves Application Processor 9):一颗专门为低功耗 AI 设计的小芯片。可以把它想成"耳机里的小型显卡,但只擅长做整数加减乘"。它有 9 个 RISC-V 处理器核心和一个专用的神经网络加速器(NE16),跑在 370 MHz 时钟频率下。它的片上内存只有 1.5 MB L2 + 128 KB L1——连一张手机照片都装不下。 BLE(Bluetooth Low Energy,蓝牙低功耗):蓝牙的一种省电版本,专门为可穿戴设备设计。 DAC(Digital-to-Analog Converter,数模转换器):把数字信号变回模拟声波的芯片,这样你的耳朵才能听到处理后的声音。
输出:五块板叠起来塞进耳后壳,形成一个完整的可穿戴助听器。
三个子系统怎么协作
硬件分成三个子系统,像三个部门各有分工:
蓝牙子系统:开机后第一个启动,负责唤醒 AI 芯片、管理无线连接。双核处理器,一个核心跑蓝牙协议栈(时间敏感),另一个核心处理杂活(GPIO 控制等)。
音频子系统:管理从麦克风采集到扬声器播放的全链路。三个 PDM 麦克风以 48 kHz 采样,经过 GAP9 内部的 SFU(Smart Filter Unit)做 64 倍抽取后降到 16 kHz 送给神经网络处理。处理完再升采样回 48 kHz 通过 I2S 接口送给 DAC 播放。
PDM(Pulse Density Modulation,脉冲密度调制):一种数字麦克风的输出格式,用高速的 0/1 脉冲来表示声音振幅。 采样率(sample rate):每秒"拍多少张快照"来记录声波。16 kHz 意味着每秒记录 16000 个数据点,足以覆盖人声的核心频率范围。
AI 子系统:核心——每 6 毫秒(96 个采样点 @ 16 kHz)收到一小段音频,做以下事情:
32-bit PCM 音频
→ 转成 16-bit 浮点
→ 预加重滤波(去除直流分量)
→ 放入环形缓冲区
→ FFT 变换到频域
→ 神经网络推理(降噪)
→ IFFT 变回时域
→ 转回 32-bit 整数
→ 送给扬声器播放
功耗预算
| 组件 | 功耗 (mW) |
|---|---|
| BLE 芯片 | 6.75 |
| 麦克风阵列 | 2.02 |
| 扬声器 | 1.49 |
| AI 芯片(本文模型) | 71.64 |
| 总计 | 约 82 |
电池容量 300 mAh x 3.85V = 1.155 Wh。按 82 mW 计算,理论续航约 14 小时——一天通勤足够。
为什么这步有用:把原来需要手机帮忙的算力,挪到耳机本身。这样不再依赖外部设备,也消除了蓝牙往返带来的延迟。
所以这一节是想说:先把"小电脑"装进耳后这块塑料壳里。五层蛋糕各司其职,关键是 AI 那层的 GAP9 芯片。
第二步:改造一个能听人声的神经网络
这是论文最核心、篇幅最大的部分。作者要做的事是:从一个"聪明但太重"的网络出发,做三刀魔改让它能在 GAP9 上实时跑起来。
2.1 起点:TF-GridNet——双路径网络
类比:像你在嘈杂酒吧听音乐时,耳朵其实同时在做两件事——一件是跟着鼓点走(时间维度:何时出现),一件是分辨这是吉他还是钢琴(频率维度:声音的高低)。
TF-GridNet(2023)就是这样一个"双路径"网络:一条通道专门看频率关系,另一条专门看时间关系。它在语音降噪任务上达到了当时最强水平。但问题是——它太大太慢了,直接放到 GAP9 上根本跑不起来。
STFT(Short-Time Fourier Transform,短时傅里叶变换):把一段声音按小窗口切开,每个窗口变成一张"频率分布图"。就像把一首歌切成很多 6 毫秒的小片段,每个片段画一张"哪个音符在响"的柱状图。 双路径(dual-path)网络:两条独立的神经网络通道,一条管时间、一条管频率。两条通道的结果合并后还原出干净人声。 TF-GridNet:2023 年发表的双路径语音降噪网络,本文的起点模型。
2.2 整体架构:输入到输出的完整数据流

让我们跟着一小段 6 毫秒的噪声音频走完整个处理流程:
输入:一个 6 ms 的音频块 x_i(96 个采样点 @ 16 kHz),加上 6 ms 的回看(lookback)和 4 ms 的前瞻(lookahead),总共 16 ms 的窗口。
Step 1 - STFT 变换:用短时傅里叶变换把时域波形转成时频二维表示 X_i。想象把一段声音变成一张图:横轴是时间(几帧),纵轴是频率(257 个频率 bin)。
频率 bin:STFT 把频率轴切成等宽的"格子",每个格子叫一个 bin。512 点 FFT 在 16 kHz 采样率下产生 257 个 bin。
Step 2 - 2D 因果卷积:对 X_i 做一层二维卷积,提取低层特征。这里用"因果"卷积——只看过去和当前的帧,不偷看未来的。
卷积(convolution):一种"小窗口在数据上滑过、每滑一步算一次乘加"的操作。把它当成"用一把小刷子在画上反复涂、每涂一下记下涂的结果"。 因果(causal):只依赖过去和当前的数据,不依赖未来。这对实时系统是必须的——你不能等未来的声音到了才处理现在的。
Step 3 - 多个双路径模块(核心计算):这是整个网络最耗算力的部分。每个双路径模块做两件事:
- 频率阶段(spectral stage):沿频率轴看——低音、中音、高音之间的关系是什么?先用步长卷积把 257 个频率 bin 压成 64 个(4 倍压缩),然后用双向 GRU 处理。
- 时间阶段(temporal stage):沿时间轴看——前后几帧之间的连贯性怎样?用单向 GRU 处理(只看过去,不看未来)。
本文用了 B=6 个这样的双路径模块堆叠,每个模块的隐藏维度 D=32、H=32。
GRU(Gated Recurrent Unit,门控循环单元):一种比 LSTM 简单的"会记住过去"的网络模块。它内部有两个"门"——重置门(决定"忘掉多少旧记忆")和更新门(决定"接受多少新信息")。比 LSTM 少一个门,计算量约少 1/3,但效果差不多。
Step 4 - 2D 因果反卷积:把处理后的特征图还原回时频表示 Y_i。
Step 5 - ISTFT + 重叠相加:用逆短时傅里叶变换把频域信号变回时域波形 y_i(干净人声)。
输出:一段 6 ms 的干净人声音频,准备送给扬声器播放。
2.3 魔改 a:把频率"压扁"——步长卷积降维
类比:原来要逐个数完一本书所有的字才告诉你这本书写啥。现在改成先把书横着压扁四倍,用目录快速扫一遍。
问题:原始 TF-GridNet 的频率阶段要按 257 个频率 bin 一个一个顺序处理。双向 LSTM 的计算量和序列长度成正比——257 步走下来,光这一个模块的推理时间就超过了 6 毫秒的实时限制。
解法:在送入频率阶段的 GRU 之前,先加一层步长卷积(strided convolution),把 257 个频率 bin 压成 64 个(4 倍压缩)。处理完再用转置卷积恢复原来的维度。
步长卷积(strided convolution):让卷积核每次跳几步而不是一步,这样输出比输入短,等于做了"压缩"。步长为 4 就意味着每 4 个输入点产生 1 个输出点。
同时,作者把原来的 LSTM 模块全部换成 GRU 模块。GRU 比 LSTM 少一个门(没有"输出门"),参数量少约 25%,速度快约 1.3 倍,在语音任务上效果几乎不掉。
为什么这步有用:频率序列从 257 缩到 64,GRU 又比 LSTM 轻——两刀下去,频率阶段的计算量下降约 75%。
2.4 魔改 b:双窗口拼接——省掉一段等待
这一步比较精妙,需要理解"重叠相加"(overlap-add)是怎么工作的。
问题背景:在流式音频处理中,每次处理的不只是当前 6 ms 的音频块——为了提高频率分辨率,还需要额外的"前瞻"(lookahead,4 ms)和"回看"(lookback,6 ms)。前瞻的延迟很好理解——你必须等那 4 ms 的未来音频到来。但回看也会引入延迟,原因在于 ISTFT 的重叠相加步骤。

常规做法的问题:如图 3B 所示,重叠相加需要把当前块 y_i 的回看部分和下一块 y_{i+1} 的回看部分拼起来。这意味着——你必须等到下一块处理完(额外等 L_B + L_C = 12 ms)才能输出当前块。这就让算法延迟从 10 ms 暴涨到 22 ms。
类比:原来切香肠要左切右切再粘起来,当前这片的边缘必须等下一片切完才能对齐粘合。
解法:采用"双窗口"方法——分析时用大窗口(包含 lookback + chunk + lookahead),合成时用小窗口(只包含 chunk + lookahead 的部分)。具体来说:
- 分析窗口:矩形窗(全为 1),长度为 L_B + L_C + L_F = 16 ms
- 合成窗口:一个特殊设计的短窗函数,在 lookback 对应的位置赋予特定权重,使得重叠相加时不需要下一块的数据
窗函数(window function):在切音频时给每段加一个"两边轻、中间重"的权重曲线。物理上类似"渐入渐出"——防止切口处出现跳变产生杂音。
数学上,合成窗函数 s[i] 被设计为:在 chunk 区间 [L_F, L_C] 内值为 1,在其他位置值为 1/(floor((L_C + L_B)/(L_C)) + 1)。这个精巧的设计保证了完美信号重建(perfect reconstruction)——拼回去的信号和原始信号完全一致。
效果:回看不再引入额外延迟。算法延迟 = L_C + L_F = 6 + 4 = 10 ms。比 TinyDenoiser 的 25 ms 低了 15 ms,终于降到人耳不敏感的门槛以下。
为什么这步有用:这是落地的关键门槛。25 ms 延迟的助听器戴上会有"山洞回声感",10 ms 就没有了。
2.5 魔改 c:留底汤——缓存复用中间结果
类比:做一锅汤,每天倒掉太浪费。把昨天的底汤留着,今天接着用。
问题:神经网络每来一个新的 6 ms 音频块,很多中间计算其实和上一块高度重叠。如果每次都从头算,会做大量重复运算。
解法:维护一个缓存状态 h_i,由四个部分组成:
| 缓存编号 | 存什么 | 为什么有用 |
|---|---|---|
| 缓存 1 | 前几块的 STFT 帧 | 第一层 2D 卷积的 kernel 需要用到前面的帧,缓存避免重算 STFT |
| 缓存 2 | 双路径模块的输出 | 2D 反卷积需要前面的特征图,缓存避免重跑双路径模块 |
| 缓存 3 | 反卷积层的中间输出 | ISTFT 需要前面块的数据来做重叠相加 |
| 缓存 4 | GRU 的隐藏状态 | GRU 的"记忆"——让它记住之前听到的所有内容 |
四个缓存总共约 30 KB——只占 GAP9 的 128 KB L1 内存的不到四分之一。
为什么这步有用:避免重复计算,在不增加模型大小的情况下进一步压缩推理时间。同时,GRU 隐藏状态的缓存让模型拥有了"长期记忆"——虽然每次只看 16 ms 的窗口,但通过 GRU 状态的累积,模型实际上能利用开机以来所有音频的上下文信息。
所以这一节是想说:作者把一个聪明但太重的网络瘦身了三道——压频率、双窗口、缓存复用——让它能在小芯片上实时跑起来。三刀各砍不同维度的开销,合起来才刚好满足约束。
第三步:训练策略——让模型在真实世界也能用
网络结构设计好了,接下来要训练它。训练策略有两个阶段。
3.1 第一阶段:合成数据 + 双耳房间冲激响应
输入:三种原料混在一起:
- 干净人声:LibriSpeech 数据集(公开免费的有声书,360 小时)
- 房间回声:4 个公开的"双耳房间冲激响应"(BRIR)数据集——CIPIC、RRBRIR、ASH-Listening-Set、CATTRIR
- 背景噪声:WHAM! 数据集(58 小时的咖啡馆/餐厅/公园等真实噪声)
房间冲激响应(Room Impulse Response, RIR):在某个房间里"啪"地拍一下手,麦克风录到的衰减+反射波形。把它和干净人声做卷积,就能模拟"在那个房间里说话"的效果。 BRIR(Binaural RIR):双耳版的房间冲激响应——分别录左耳和右耳听到的,包含了头部遮挡和耳朵形状带来的声学差异。
混合公式:x(t) = h_{θ,φ}(t) * a(t) + n(t)。翻译成人话就是:先把干净人声 a(t) 和某个角度的 BRIR 做卷积(模拟"从那个方向传来的声音在这个房间里的效果"),再加上背景噪声 n(t)。训练目标是从混合信号中恢复出 s(t) = h_{θ,φ}(t) * a(t)(带房间效果的干净人声)。
损失函数:使用 SNR Loss = ||s||^2 / ||s - ŝ||^2。翻译:用干净信号的能量除以"干净信号减去模型输出"的能量。这个比值越大说明模型输出越接近干净信号。
训练配置:200 个 epoch,每个 epoch 20000 个样本,AdamW 优化器,梯度裁剪 0.1。学习率经历三段式调度:前 10 轮线性升温(1e-4 → 1e-3),中间 140 轮保持 1e-3,最后 50 轮每 15 轮减半。
因为两只耳朵各自独立处理,所以训练了两个独立的网络——一个管左耳,一个管右耳。
3.2 第二阶段:运动微调 + 数据增强
问题:第一阶段假设说话人和佩戴者都不动。但真实世界里,你和聊天对象都会转头、走动。
解法:微调阶段加入时变的声源位置——每 25 ms 有 2.5% 的概率触发随机运动事件,角速度在 [π/6, π/2] rad/s 之间采样,持续 0.1-1 秒。用 Steam Audio SDK 模拟运动轨迹,在离散 BRIR 位置之间用最近邻插值。
同时加入三种噪声增强(30% 概率触发):白噪声、粉红噪声、棕色噪声。还随机变速语音(80%-120%)。
损失函数从 SNR Loss 换成多分辨率频谱损失——在多个 STFT 窗口长度上同时计算,兼顾时间和频率分辨率。微调 100 个 epoch,ReduceLROnPlateau 学习率调度器(patience=5, factor=0.5)。
所以这一节是想说:训练数据全是合成的(不需要真实硬件采集),但通过 BRIR、运动模拟、噪声增强,让模型学会应对真实世界的复杂声学环境。
第四步:把"小数"压成"整数"——量化与 QAT
这是论文真正的方法贡献。前面两步让模型"跑得动",这一步让模型"跑得好"。
4.1 为什么要量化
神经网络里的每个数字默认用 32 位浮点数(float32)存——精度高但占空间大、计算慢。GAP9 芯片的 NE16 加速器只支持 8 位整数(int8)运算,浮点运算要退回到通用 RISC-V 核心上跑,速度慢好几倍。所以必须把模型从 float32 压缩到 int8。
量化(quantization):把高精度的小数压成低精度整数的过程。类比:原来用精确到毫米的尺子量东西,现在换成只精确到厘米的尺子——快了但会丢一点精度。 float32:32 位浮点数,能表示非常精确的小数。 int8:8 位整数,只能表示 -128 到 127 之间的整数。空间少 4 倍,整数运算比浮点快 5-10 倍。
量化的数学公式很简单:Q(r) = round(r / S) + Z。翻译:把原始值 r 除以缩放因子 S,四舍五入到最近的整数,再加上零点偏移 Z。反量化时反过来:r̂ = S × (Q(r) - Z)。由于四舍五入,恢复出来的 r̂ 不会精确等于 r——这个差距就是量化误差。
4.2 直接压会怎样——灾难性崩塌
论文做了一个直观的实验:把训练好的浮点模型直接用 PTQ(Post-Training Quantization,训练后量化)压成全 int8。
结果:SISDRi 从 8.65 dB 暴跌到 -1.70 dB。
负数意味着"处理后的音频比处理前还差"——模型彻底崩了。原因是:这个模型有 6 个双路径模块堆叠,量化误差会逐层放大(误差在深层网络中像"击鼓传花"一样越传越大)。
PTQ(Post-Training Quantization,训练后量化):先正常训练好模型,然后一次性把所有权重和激活值压成低精度。简单但粗暴。 SISDRi(Scale-Invariant Signal-to-Distortion Ratio improvement):一个客观打分,衡量"降噪后人声比原来干净了多少"。数字越大越好,负数意味着越处理越差。
4.3 第一把钥匙:混合精度量化
类比:像考试时你把粗略思路写在普通纸上,但关键步骤写在格子纸上保证清晰。
思路:不同层对量化误差的敏感度不同。第一层(直接处理原始输入)和最后一层(生成最终输出)最敏感——就像做饭时第一步洗菜和最后一步摆盘最关键,中间翻炒可以粗糙一点。
做法:
- 第一层 2D 卷积 → 用 bfloat16(16 位浮点,精度介于 float32 和 int8 之间)
- 最后一层 2D 反卷积 → 用 bfloat16
- 中间所有双路径模块 → 压成 int8
bfloat16(Brain Float 16):16 位的浮点格式。比 float32 精度低,但比 int8 精度高得多。Google Brain 团队发明的,"brain"就是从这来的。
混合精度后:SISDRi 从 -1.70 dB 回升到 0.90 dB。虽然还是比浮点的 8.65 dB 差很远,但至少不是负数了——模型活过来了。
4.4 第二把钥匙:量化感知训练(QAT)
类比:考试前先用真考试的粗糙卷纸练,而不是用印得清楚的练习卷。这样考试时你就不会因为"印刷太糊看不清"而慌。
核心思想:既然量化会引入误差,那就在训练阶段就把量化这一步模拟出来——让模型一边学一边适应"被压缩后会损失精度"这件事。模型会学会补偿量化带来的损失,找到一个"即使被粗糙化也依然表现良好"的参数配置。
QAT(Quantization-Aware Training,量化感知训练):在训练阶段就把量化操作插入前向传播中。每一步训练时,权重和激活值先被假装量化(round到整数再恢复回浮点),然后用这个"受损"的结果计算损失、更新梯度。 Straight-Through Estimator (STE):量化操作(四舍五入)是不可微分的,无法直接算梯度。STE 的做法是"假装 round 操作的梯度等于 1"——虽然数学上不严格,但实践中效果很好。
QAT 实现细节:
- 初始化:从训练好的浮点模型开始,先应用混合精度配置
- LSQ(Learned Step-Size Quantization):让缩放因子 S 也变成可学习参数——模型自己决定"量尺的精度"
- 微调:使用 FQSE 框架微调 30 个 epoch,每个 epoch 4000 个混合样本(QAT 计算开销大,所以用更少的数据)
- 学习率:初始 1e-3,ReduceLROnPlateau 调度
效果:SISDRi 从 0.90 dB 跃升到 8.19 dB——只比原始浮点版(8.65 dB)低 0.57 dB。差距被压缩了 14 倍。
用一张表总结量化的完整旅程:
| 量化阶段 | SISDRi (dB) | 和浮点的差距 |
|---|---|---|
| 浮点原版 (float32) | 8.65 | 基准 |
| 全 int8 PTQ | -1.70 | -10.35 dB(崩了) |
| 混合精度 PTQ | 0.90 | -7.75 dB(活了但很差) |
| 混合精度 + QAT | 8.19 | -0.46 dB(几乎追平) |
所以这一节是想说:模型不能直接压,得分两步走——先用混合精度把"最敏感的两层"保护起来,再用 QAT 让模型学会适应粗糙精度。两把钥匙缺一不可。
第五步:训练的工程细节补充
量化的两种粒度:论文对激活值用 per-tensor 不对称量化(整个张量共享一组 S 和 Z),对权重用 per-channel 对称量化(每个通道独立的 S,Z=0)。这是因为 GAP9 硬件的 NE16 加速器只支持这种配置——又一个 co-design 的例子。
GAP9 的内存层次:L1(128 KB,快) → L2(1.5 MB,中) → 外部 L3 RAM(慢且耗电)。最终模型只有 299 KB,全部放进 L2,不需要碰 L3——这是功耗能控制在 71 mW 的关键原因。
所以这一节是想说:从网络设计到量化策略到硬件部署,每一步都在互相迁就。这就是 co-design 的精髓。

关键数字(What works)

| 指标 | 数值 | 对比基准 | 生活语言 |
|---|---|---|---|
| 处理一帧时间 | 5.54 ms | TinyDenoiser 0.58 ms(但算法延迟 25 ms) | 6 ms 的题 5.54 ms 交卷,留 0.46 ms 缓冲 |
| 算法延迟 | 10 ms | TinyDenoiser 25 ms | 人耳对 10 ms 以下延迟基本不敏感 |
| 功耗 (AI 芯片) | 71.64 mW | 手机端同类模型上百 mW | 300 mAh 电池撑约 14 小时 |
| 模型大小 | 299 KB | GPT-3 约 700 GB | 比一张手机照片还小 |
| SISDRi | 8.19 dB | TinyDenoiser 5.97 dB;浮点上限 8.65 dB | 从"中等清晰"到"高清晰" |
| 主观打分 (Overall MOS) | 3.38/5 | 不开 AI 2.96;TinyDenoiser 1.96 | TinyDenoiser 反而不如不开 |
| 降噪打分 (Noise MOS) | 3.57/5 | 不开 AI 2.15;TinyDenoiser 2.38 | 明显感知到噪声减少 |
| 量化差距 | 0.57 dB | PTQ 差距 7.86 dB | QAT 把差距压缩了 14 倍 |
PESQ(Perceptual Evaluation of Speech Quality):一个模拟人耳感知的客观打分,范围 1-4.5,越高越好。本文浮点版 1.76,QAT 版原文未单独报 PESQ 但从表格推断在 1.7 左右。 DNSMOS(Deep Noise Suppression MOS):用神经网络预测的主观打分,范围 1-5。本文浮点版 2.50。 MOS(Mean Opinion Score):让真人听完打 1-5 分取平均值。类比"豆瓣评分"。
所以这一节是想说:又快又小又省电又好听,四件事一起做到了。每个数字背后都是三层联合设计的结果。
实验结果说明了什么
论文的实验结果传递了三条核心信息:
第一条:QAT 是深度量化的必经之路,不是可选项。 从 Table 3 可以清楚看到,不管是简单模型(TinyDenoiser)还是复杂模型(本文),直接 PTQ 都会严重掉点。而且模型越复杂、层数越多,掉点越惨(TinyDenoiser 掉 2.76 dB,本文掉 10.35 dB)。QAT 的价值在于:它让复杂模型在量化后依然能保持大部分性能,而简单模型即使用了 QAT 也追不上复杂模型的 QAT 版本(5.97 vs 8.19)。
第二条:"降噪"和"保真"是两件不同的事,只做好一件不够。 TinyDenoiser 在主观实验中的降噪打分(2.38)确实比不开 AI(2.15)好一点,但整体体验打分(1.96)反而比不开 AI(2.96)低了整整一分。原因是它在降噪的同时把人声也"咬碎"了——听到的人声断断续续、有机器人般的失真。这说明:用户要的不是"噪声小了",而是"听起来舒服"。
第三条:纯合成训练数据可以泛化到真实环境。 论文的训练数据全部来自公开数据集的合成混合,没有用任何真实硬件采集的数据。但在 6 个从未见过的室内外环境中,以及佩戴者转头运动的场景下,模型依然表现良好。Table 4 显示,即使声源以 90 度/秒的速度移动(很快的头转动速度),微调后的模型 SISDRi 仍然保持在 10+ dB。这对部署意义重大——不需要为每个新环境采集训练数据。
所以这一节是想说:实验不只是"验证模型好不好",更揭示了三个重要的设计原则——QAT 是必须的、降噪和保真都要做好、合成数据能泛化。
你应该懂的几个新词
GAP9 / GreenWaves Application Processor 9:一颗专门为低功耗 AI 设计的小芯片。9 个 RISC-V 核心 + NE16 神经网络加速器。功耗级别在几十毫瓦。像"耳机里的小型显卡"。
STFT / Short-Time Fourier Transform / 短时傅里叶变换:把一段声音切成小窗口,每个窗口画成"频率分布图"。横轴时间、纵轴频率。
dual-path / 双路径网络:神经网络的一种结构,一条通道处理时间维度、一条处理频率维度。处理完合并。
TF-GridNet:2023 年发表的双路径语音降噪网络,本文的起点。SOTA 但太大太慢。
SISDRi / Scale-Invariant Signal-to-Distortion Ratio improvement:客观降噪打分,单位 dB。数字越大越好,负数意味着越处理越差。
MOS / Mean Opinion Score:真人主观打分 1-5 分的平均值,类似"豆瓣评分"。
PTQ / Post-Training Quantization / 训练后量化:训练完再一次性压成整数。简单但效果差。
QAT / Quantization-Aware Training / 量化感知训练:训练阶段就模拟"被压成整数"的损失,让模型学会补偿。
GRU / Gated Recurrent Unit / 门控循环单元:一种比 LSTM 简单的"会记住过去"的网络模块。少一个门,速度快约 1/3。
量化 / quantization:把高精度小数压成低精度整数。空间少 4 倍、运算快 5-10 倍。
bfloat16:16 位浮点格式,精度介于 float32 和 int8 之间。
co-design / 协同设计:硬件和软件同时设计、互相迁就,而不是先做一边再适配另一边。
LSQ / Learned Step-Size Quantization:让量化的缩放因子也变成可学习参数。
算法延迟 vs 硬件延迟:前者是"模型设计上必须等多久",后者是"芯片实际算多久"。两者都得低于 10 ms。
所以这一节是想说:这些词以后在边缘 AI 领域还会反复出现,先建一个小词典。
它有什么搞不定的
没人说话时还在烧电。 安静的图书馆里戴 6 小时,AI 芯片一直以 71 mW 运转完全没必要。论文自己也提到可以加一个"噪声检测 + 占空比"机制——安静时让 AI 睡觉,吵闹时才唤醒。但这个功能没做。
只在 GAP9 一颗芯片上验证过。 换一家厂商的芯片(比如 Analog Devices MAX78000、Arm Ethos U-55)能不能直接用?量化策略需不需要重新调?未知。论文列出了几颗候选芯片但没有实验。
训练数据全是合成的。 地铁隧道里的尖锐刹车声、强风海边的轰鸣、教堂大堂的极长混响——这些极端声学环境没测,可能掉链子。
只用了 1 个麦克风。 硬件有 3 个麦克风,但模型只用了 1 个。意味着"声源在左在右"的空间信息完全没用上。多麦克风波束成形(beamforming)能进一步提升降噪效果,但留给了未来工作。
没针对听损人群个性化。 28 个志愿者里没有区分听力正常 vs 听损者,也没有接入临床上常用的听力损失处方算法。所以这更像"健康人降噪耳塞",不是真正意义的"医疗助听器"。
没有 ANC(主动降噪)。 AirPods Pro 那种"产生反向声波抵消噪声"的功能,本作完全没做。GAP9 硬件支持 ANC 算法,但论文没集成。
形状还是 BTE(耳后挂)助听器。 5 块 PCB 叠起来挂在耳后,比耳塞大 3-4 倍。论文说下一步要做成耳塞形状。
所以这一节是想说:能跑起来,但还有七条明显的留白——每条都是"未来工作"的候选方向。
它和别的几篇是什么关系
听觉智能时间线(同一实验室 UW CSE / Gollakota 组)
ClearBuds (MobiSys 2022) ← 耳机收音,手机算(需要外部设备)
↓
Semantic Hearing (UIST 2023) ← 选择性听类别("只听人声 / 只听鸟叫")
↓
Look Once to Hear (CHI 2024) ← 看一眼就锁定那个人的声音
↓
Sound Bubbles (Nature Electronics 2024) ← 按距离过滤(3 米内的人才听得到)
↓
NeuralAids (MobiCom 2025, 本文) ← 第一篇全程耳机内、不依赖手机
↓
TF-MLPNet (Clarity Challenge 2025) ← 同作者后续,更小更快的候选模型
在 13 篇阅读清单中的位置
NeuralAids 是 13 篇中唯一一篇研究"边缘 AI 部署"的工程论文。其他论文关心的是"模型能做多复杂"(比如 OpenVLA 的 7B 参数 VLA 模型),而这篇关心的是"模型怎么压到极致才能跑在纽扣电池上"。
这构成了一个重要的互补视角:当算力不是问题时(云端 / GPU 集群),瓶颈在模型能力;当算力极度受限时(可穿戴 / 嵌入式),瓶颈在部署效率。方法论上,"模型压缩 + 硬件协同"的思路和把大型 VLA 模型部署到机器人本体上是相通的——只是约束更极端。
和"听觉三连"的分工
| 维度 | Proactive Hearing | NeuralAids | Acoustic Swarms |
|---|---|---|---|
| 核心问题 | 谁在跟我说话 | 怎么在芯片上降噪 | 怎么摆麦克风阵列 |
| 层次 | 决策层 | 计算层 | 硬件层 |
| 关键技术 | 对话节奏检测 | 量化感知训练 | 自主分布机器人 |
| 硬件形态 | 有线耳机+手机 | 无线助听器(全设备端) | 桌面小机器人群 |
| 麦克风数量 | 6 个(耳机上) | 1 个(3 个可用但只用 1 个) | 7 个机器人各 7 个 |
神经处理 vs 传统 DSP
NeuralAids 最根本的贡献是证明了"神经网络降噪可以替代传统 DSP 降噪跑在可穿戴设备上"。传统数字信号处理(频率均衡、谱减法)只能处理"稳定的背景噪声"(如风扇嗡嗡声),对"非平稳噪声"(人说话、瓷器碰撞、突然的笑声)无能为力。神经网络的优势是它能学到"什么是人声的统计特征"——这是死规则写不出来的。但代价是计算量大 100 倍以上,所以需要本文这样的三层联合设计才能塞进芯片。
所以这一节是想说:在听觉智能这条线上,NeuralAids 是"硬件落地"那一段;在更宏观的具身 AI 里,它代表了"如何把模型塞进真实物理设备"。
和本导读的关系
本文对应导读 Ch20: 听觉智能 的以下内容:
- 20.2 音频信号基础:STFT、窗函数、频率 bin 这些概念在 Ch20.2 有完整讲解。NeuralAids 的双窗口方法是 STFT 参数选择的实际工程案例。
- 20.2.5 时域 vs 频域:NeuralAids 选择频域路线(STFT → 网络 → ISTFT),和 Conv-TasNet 的时域路线形成对比。为什么?因为频域表示对量化更友好——频谱幅度值的分布比原始波形更平稳,量化误差更小。
- 20.2.6 STFT 基础补充:Ch20 提到的 N_FFT=512 产生 257 个频率 bin——这正是 NeuralAids 网络输入的频率维度。步长卷积把它压到 64 个 bin 的设计直接对应了 Ch20 讨论的时频分辨率 trade-off。
- 20.3 音频离散化:SoundStream/EnCodec 的量化思想和本文的 int8 量化属于同一个技术家族——都是"用更少的比特表示音频信息"。区别在于 SoundStream 量化的是 latent 向量(用于压缩传输),NeuralAids 量化的是网络权重和激活值(用于加速推理)。
本文是 Ch20 "Part 2: 边缘设备上的听觉" 的核心论文。它回答了一个关键问题:Ch20.4 的 Whisper 跑在云端需要几 GB 内存,而 NeuralAids 证明语音处理任务(虽然比 ASR 简单)可以压缩到 299 KB 跑在纽扣电池芯片上。这条从"云端大模型"到"设备端微模型"的压缩之路,是具身 AI 感知系统从实验室走向产品的必经之路。
所以这一节是想说:NeuralAids 是 Ch20 "听觉基础"到"听觉落地"的桥梁——把前面学的 STFT、量化、频域处理等概念全部用在了一个真实的工程系统上。
思考题
Q1:为什么 NeuralAids 选择频域(STFT)路线而不是时域(Conv-TasNet 风格)路线?如果换成时域路线,量化会更容易还是更难?
提示
想想时域波形的数值分布:原始 PCM 采样值在 [-1, 1] 之间快速振荡,相邻采样点可能正负交替。这种分布对量化不友好——int8 的 256 个值要覆盖正负两侧,有效分辨率减半。而 STFT 幅度谱是非负的,且频率分布相对平滑,量化误差更小。另外,频域处理天然把问题分解成了"哪些频率该留、哪些该去",和降噪任务的目标直接对齐。
Q2:论文说"直接全 int8 量化后 SISDRi 从 8.65 掉到 -1.70"。为什么我们的模型比 TinyDenoiser 掉得更惨(10.35 dB vs 2.76 dB),明明我们的浮点性能更好?
提示
想想两个模型的深度差异。TinyDenoiser 只有很少的层,量化误差没有太多机会"逐层放大"。而我们的模型有 6 个双路径模块堆叠,每个模块内部又有卷积 + GRU + 反卷积。量化误差在每一层都会引入新的噪声,经过 6 层传播后,误差像滚雪球一样越来越大。模型越深越复杂,对量化的鲁棒性反而越差——这是深度网络量化的一个普遍规律。
Q3:假设你要把 NeuralAids 的降噪能力和 Proactive Hearing 的"挑人听"能力合并到同一只耳机里,你会怎么设计系统?两个模型能顺序跑还是需要并行跑?瓶颈在哪里?
提示
先想清楚两个任务的计算顺序:降噪是"去掉噪声、保留所有人声",挑人是"在所有人声中只保留同伴的声音"。逻辑上应该先降噪再挑人(先去噪再分人更容易),所以可以串行跑。但瓶颈在于延迟预算:NeuralAids 已经用了 5.54 ms 中的 6 ms 窗口,加上 Proactive Hearing 的模型推理,总延迟可能超过 10 ms。可能的解法包括:用更激进的量化、用更小的网络、或者把两个任务融合成一个端到端模型。
Q4:论文用了 4 倍频率压缩(257 → 64),而 TFGridNet-6F 用了 6 倍(257 → 43)。为什么不直接用 6 倍?压缩比和降噪效果之间的 trade-off 是什么?
提示
看 Table 2:TFGridNet-6F(6 倍压缩)的 SISDRi 是 8.43,我们的模型(4 倍压缩)是 8.65。差了 0.22 dB。频率压缩越多,频率分辨率越低——模型越难区分"频率相近但一个是人声一个是噪声"的情况。4 倍压缩是作者在"实时性"和"频率分辨率"之间找到的甜蜜点——足够快能在 6 ms 内完成,又不至于丢太多频率信息。
Q5:如果 GAP9 的 NE16 加速器升级到支持 int4(4 位整数),你觉得直接把模型从 int8 压到 int4 会发生什么?需要做哪些额外工作?
提示
int4 只有 16 个可能的值(-8 到 7),分辨率极低。直接从 int8 压到 int4 几乎肯定会再次崩溃(参考 int8 PTQ 的灾难)。需要的额外工作至少包括:重新做混合精度搜索(可能需要更多层保留高精度)、重新做 QAT(而且 QAT 的训练难度更大,因为梯度估计误差更大)、可能需要引入新技术如分组量化(group quantization)或异常值处理。同时 int4 的精度可能已经低于语音任务的下限——毕竟人声的微妙频率差异需要一定的数值分辨率才能捕捉。
Q6:论文只用了 3 个麦克风中的 1 个。如果用上全部 3 个做波束成形(beamforming),网络输入从 1 通道变成 3 通道,计算量和模型大小会如何变化?对实时性有什么影响?
提示
最直接的影响:STFT 输入从 1x257xT 变成 3x257xT,第一层卷积的输入通道数变成 3 倍。但这只是第一层,后续层可以保持不变。所以模型大小增加有限(主要增加第一层权重),计算量增加也有限。更大的挑战在于:波束成形需要利用麦克风间的时间差(ITD)来判断声源方向,这需要额外的对齐模块。另外,3 路 16kHz 的音频同时流入意味着 I/O 带宽增加 3 倍,可能需要更高效的 DMA 设计。
Q7:为什么论文选择 6 ms 的 chunk size?改成 3 ms(更低延迟)或 12 ms(更多上下文)会怎样?
提示
chunk size 涉及三个 trade-off:(1) 延迟——chunk 越小延迟越低,但算法延迟 = L_C + L_F,3 ms chunk 能把延迟降到 7 ms;(2) 频率分辨率——chunk 越小 STFT 窗口越短,频率分辨率越低(时频不确定性原理),降噪效果可能变差;(3) 计算效率——每个 chunk 都有固定的 overhead(数据拷贝、类型转换),chunk 越小 overhead 占比越高。6 ms = 96 个采样点,是在这三者之间的平衡点。
一些好奇心问答(FAQ)
Q1: 这个模型有多大?我家的 RTX 4070 跑得动吗?
压缩后模型只有 299 KB,比一张照片还小。你的 4070 当然跑得动,但官方推理代码是给 GAP9 芯片写的(用 GreenWaves 的 SDK),没有适配 GPU 的版本。训练阶段需要一张普通显卡(RTX 3090 / 4070 都够)。
Q2: 训练数据从哪来?
全是合成出来的。具体配方:干净人声来自 LibriSpeech(360 小时有声书),房间回声来自 4 个公开 BRIR 数据集,背景噪声来自 WHAM!(58 小时真实环境噪声)。把它们按公式 x(t) = h * a(t) + n(t) 叠在一起当训练样本。全部免费公开,不需要花钱买数据。
Q3: 我能跑代码吗?官方开源了吗?
截至 2026 年 6 月,论文发表时还没有公开完整代码。同组前几篇的代码在 github.com/uw-x,可以参考网络结构设计。GAP9 的推理框架在 github.com/GreenWaves-Technologies。硬件 PCB 设计也没开源——要完全复现需要自己设计五块板子。
Q4: 训练一次要烧多少卡时?
第一阶段 200 epoch x 20000 样本 x 5 秒 = 约 5500 小时音频处理量,单张 RTX 3090 估计要 3-7 天。第二阶段(运动微调)100 epoch,约 2-3 天。QAT 阶段 30 epoch x 4000 样本,约 12-24 小时。总共单卡 7-12 天,多卡可以线性加速。
Q5: 为什么不用 Transformer?Transformer 不是比 GRU 更强吗?
Transformer 在大多数 NLP/CV 任务上确实更强,但它有两个致命问题:第一,自注意力的计算量和序列长度的平方成正比,257 个频率 bin 的自注意力太贵了;第二,Transformer 的参数量通常远大于 GRU,放不进 1.5 MB 的 L2 内存。论文实际上提到它们尝试过 Transformer 和 State-Space Model,都超出了硬件的内存和时间限制。
Q6: 戴它能去跑步吗?
不行。现在的形状是"耳后挂"助听器,5 块 PCB 叠起来比耳塞大 3-4 倍。论文说下一步会做成耳塞形状——GAP9 芯片本身很小,主要是其他外围器件(RAM、闪存、电池)占空间。
Q7: 它能识别说话内容吗?比如做语音转文字?
不能。它只做降噪(speech enhancement),不做识别(ASR)。降噪是"让声音更干净",识别是"把声音变成文字"——两个完全不同的任务。识别需要再叠一个语音识别模型(如 Whisper),那个模型比降噪模型大得多,目前还塞不进 GAP9。
Q8: 真的比 AirPods Pro 好吗?
论文没有直接和 AirPods Pro 对比(因为 Apple 不公开技术细节)。严格来说,AirPods Pro 有主动降噪(ANC)+ 通透模式 + Apple 自研芯片 + 更大的电池,综合体验大概率更好。NeuralAids 的价值不在于"产品更好",而在于"方法全公开"——它第一次证明了一套开源的、可复现的方法能在如此受限的硬件上做到有效的神经网络降噪。
所以这一节是想说:实操问题先一次性回答清楚,不留困惑。
如果你想再深入
前传 / 必读基础:
- TinyDenoiser (Fedorov et al., 2020) — 本文最强对比基线。理解它就理解了"小耳机降噪"最基础的做法以及它的局限。
- TF-GridNet (2023) — 本文神经网络的起点,双路径范式的代表。看懂它就知道"瘦身前的胖子长什么样"。
- Wang et al., STFT-domain neural speech enhancement with very low algorithmic latency — 双窗口设计的思想出处。
同组续作 / 兄弟工作:
- Look Once to Hear (CHI 2024) — 同组前作,做"只听某个特定人的声音"。和 NeuralAids 用了类似的双路径架构。
- Sound Bubbles (Nature Electronics 2024) — 同组前作,做"按距离过滤声音"。
- TF-MLPNet (Clarity Challenge 2025) — 同作者的更小更快后续模型,可能是 NeuralAids 下一代候选。
量化技术深入:
- Esser et al., Learned Step-Size Quantization (LSQ) — 让量化缩放因子也变成可学习参数的论文。NeuralAids 的 QAT 直接用了这个技术。
- Cohen et al., Fully Quantized NN for Audio Source Separation — 全量化语音分离的近邻工作,也是在 GAP9 上做的。
听觉三连的另外两篇:
- Proactive Hearing 精读笔记 — 决策层:怎么挑人听。
- Acoustic Swarms 笔记 — 硬件层:怎么摆麦克风。
原文信息
标题:Wireless Hearables With Programmable Speech AI Accelerators
作者:Malek Itani, Tuochao Chen, Arun Raghavan, Gavriel Kohlberg, Shyamnath Gollakota
机构:University of Washington (Paul G. Allen School of CSE + Department of Otolaryngology)
会议:ACM MobiCom 2025 (The 31st Annual International Conference on Mobile Computing and Networking), Hong Kong
链接:https://doi.org/10.1145/3680207.3765251
BibTeX:
@inproceedings{itani2025neuralaids,
title = {Wireless Hearables With Programmable Speech {AI} Accelerators},
author = {Itani, Malek and Chen, Tuochao and Raghavan, Arun and Kohlberg, Gavriel and Gollakota, Shyamnath},
booktitle = {Proceedings of the 31st Annual International Conference on Mobile Computing and Networking (ACM MobiCom '25)},
year = {2025},
address = {Hong Kong, China},
publisher = {ACM},
doi = {10.1145/3680207.3765251}
}
开源状态:截至 2026 年 6 月,代码和硬件设计未公开。同组相关代码见 github.com/uw-x,GAP9 SDK 见 github.com/GreenWaves-Technologies。
所以这一节是想说:想沿着任何一条线深挖都有现成的入口。
◼
引用本笔记 / Cite this note
@online{eai_neuralaids_2026,
title = {(readable note) NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/neuralaids/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?