Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 12

NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators

36 min read · 12518 字 · ⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI / 嵌入式硬件"的读者写的精读笔记。所有专业词第一次出现都会解释清楚。只看这份笔记就能理解全文机制。


一句话讲什么(TL;DR)

在咖啡馆听不清对面说话?让助听器自己降噪,不连手机、不连云——把一个原本跑在显卡上的"降噪大脑"拆骨瘦身 100 倍,再教它用"粗糙的算盘"(8 位整数芯片)照样算出接近原来的答案,最终全部塞进一只挂在耳朵后面的小壳子里,处理一帧音频只要 5.54 毫秒,功耗只有 71 毫瓦,28 个真人听测显著好于前作。

所以这一节是想说:这是一篇"把聪明的耳机做小做省电"的论文,核心贡献是*三层联合设计——硬件、神经网络、数字压缩一起改。*


这是个什么场景

周末下午的星巴克,你和朋友约在窗边那张桌子。隔壁桌大声讨论项目、咖啡机"咔咔"打奶泡、背景音乐里有人在唱英文,全都叠在一起糊成一锅声音粥。你戴着 AirPods Pro 想听清朋友说"你昨天那个 PR 改完了吗"——结果只听到"你昨天那个……改完了吗",中间那段被噪声盖住了。

把场景换到 70 岁的爷爷戴助听器,问题被放大十倍——他听对面孙子说话基本靠猜。

戴在耳后的样子
Plate Nº I戴在耳后的样子

现在市面上"AI 助听器"主要有两种做法:一是把麦克风录到的声音偷偷传到手机上,让手机算完再传回来,问题是网络一抖回声就乱了;二是在助听器自己里面跑一个超精简的小程序,问题是噪音确实小了但孙子的声音也跟着变得像在水底下说话。

这篇论文要解决的就是这个尴尬:能不能让助听器自己就把这件事做好,不依赖任何外部设备?

但工程上这是个"听起来不可能"的任务,因为同时要满足三件事:

  • :助听器电池只有 300 mAh(毫安时,电量单位),相当于四节纽扣电池串在一起。
  • :声音从耳朵进、被处理完、再播给你听,整个过程必须在 10 毫秒(千分之一秒)以内。慢一点就会出现"自己说话像在山洞里回响"的诡异感——学名叫"梳状滤波效应"。
  • 像云端那么聪明:得跟手机/电脑里的大模型一样能干净地降噪,不能降噪的同时把人声也"咬碎"。

助听器(hearing aid):戴在耳朵上、把声音放大让听障人士听得清的小设备。 mAh(毫安时):电量单位,数字越大电池能撑越久。手机电池大约 4000 mAh,助听器电池只有它的 1/13。

听觉三连中的位置

本导读有三篇和"听"相关的论文,合称"听觉三连"。它们分别解决的问题是:

论文 核心问题 类比
Proactive Hearing 从多人中"挑"出你在跟谁聊天 大脑的"注意力"——选谁听
NeuralAids(本文) 把降噪 AI 装进耳朵里的芯片上 大脑的"神经处理"——怎么算
Acoustic Swarms 多个小机器人自动铺成麦克风阵列 耳朵的"硬件排布"——怎么收

你可以把它们想成一条工厂流水线:Acoustic Swarms 负责"多只耳朵怎么摆",NeuralAids 负责"耳朵里的芯片怎么算",Proactive Hearing 负责"算完之后挑谁听"。三篇分别对应硬件层、计算层、决策层。

所以这一节是想说:这论文想做一个"耳朵戴的小电脑",自己就能听清吵闹里的人话。它在听觉三连里负责"算力"那一环。


NeuralAids — 场景示意:这论文要解决的现实问题
Plate Nº IINeuralAids — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

在 NeuralAids 之前,"助听器降噪"这条路上有四种方案,每种都卡在不同的地方:

方案 A:把声音传到手机算。 就像点外卖叫云端帮你做菜。ClearBuds(CHI 2022,同实验室前作)就是这条路——耳机录音,手机处理,再传回耳机。结果是网络一卡饭就凉:对话延迟超过 10 毫秒就会让你感觉"不对劲",而蓝牙来回传一次最少也要几十毫秒。

方案 B:在耳机里跑一个超精简模型。 TinyDenoiser(2020)是这条路的代表——用一个只有几十 KB 的小 LSTM 网络,全部在 GAP9 芯片上跑。问题出在两个地方:一是它的算法延迟高达 25 毫秒,远超 10 毫秒门槛(后面会解释"算法延迟"和"硬件延迟"的区别);二是它的网络太简单,降噪的同时把人声也弄糊了——主观打分甚至比不开 AI 还低。

方案 C:商业产品(AirPods Pro 等)。 其实它们也没完全在耳机里算,至少把一部分计算扔回手机。而且技术细节都是商业秘密,论文无法复现和比较。

方案 D:Phonak 2024 年底的 AI 助听器。 号称做到了全设备端推理,但同样是商业秘密,不公开怎么做的。

LSTM(Long Short-Term Memory,长短期记忆网络):一种"会记住过去"的神经网络模块。你可以想成一个有"小本子"的考生——答题时会翻看前面几道题的笔记。 算法延迟(algorithmic latency):模型本身设计上"必须等多久才能输出"。比如你需要看完整句话才能翻译,那"等你说完"就是算法延迟。 硬件延迟(hardware latency):芯片实际算这一帧花了多久。两者加起来才是真正的端到端延迟。

这四种方案的对比可以用一张表看清:

方案 在哪算 延迟 降噪效果 能复现吗
A (ClearBuds) 手机 高(蓝牙往返)
B (TinyDenoiser) 耳机 25 ms(太慢) 差(人声也糊了)
C (AirPods Pro) 耳机+手机 未知 未知 否(商业秘密)
D (Phonak) 耳机 未知 未知 否(商业秘密)
NeuralAids 耳机 10 ms

这篇论文说:我们用一套完全公开的、能复制的方法,把"全程在耳朵里算、低于 10 毫秒延迟、降噪效果接近云端"这三件事同时做出来。

所以这一节是想说:要么慢、要么糊、要么商业秘密。这篇要做一份开源的"全程在耳朵里算"的完整样本。


这篇论文的新想法

一句话概括:硬件 + 神经网络 + 数字压缩,三层一起设计

具体地说,这篇论文不是只改了模型、也不是只改了芯片,而是把三件事拧在一起做了一个"联合设计":

  1. 硬件层:设计了一个五块 PCB 叠成的无线可穿戴助听器,核心是一颗叫 GAP9 的低功耗 AI 芯片。
  2. 神经网络层:从一个"聪明但太重"的 SOTA 模型(TF-GridNet)出发,做了三刀魔改让它跑进芯片。
  3. 数字压缩层:用混合精度量化 + 量化感知训练(QAT),把 32 位小数压成 8 位整数而几乎不掉点。

为什么必须三层一起改?因为单独优化任何一层都会撞墙。光改网络不够——你改出来的网络在浮点模式下跑不进 6 毫秒实时要求。光做量化不够——直接把好模型压成整数会从 8.65 dB 掉到 -1.70 dB(比不降噪还差)。光改硬件不够——没有匹配的软件,芯片再好也白搭。这种"三层联合设计"在学术界叫做 hardware-software co-design(硬件-软件协同设计)

SOTA(State-Of-The-Art):目前最强水平。 PCB(Printed Circuit Board,印刷电路板):电路用铜线印在塑料板上做成的硬件载体。你能看到的所有电子产品里都有它。 co-design(协同设计):不是先做硬件再适配软件(或反过来),而是两边同时设计、互相迁就。

所以这一节是想说:单独优化哪一层都不够,要三层联手。这就是为什么论文的三大贡献恰好对应硬件、网络、量化三条线。


它分几步做的(方法)

整篇论文做的事可以拆成三大块:搭硬件、改神经网络、做数字压缩。下面逐一展开。


第一步:搭一个"五层蛋糕"硬件

类比:像麦当劳的巨无霸——五层叠在一起,每一层各司其职:上面那片管面包、中间那片管菜、最下面那片管肉。每层换一种功能,但合在一起才是一个完整汉堡。

NeuralAid 硬件平台
Plate Nº IIINeuralAid 硬件平台

输入:空气中的声波(含说话人声 + 噪声)。

处理:作者把五块小电路板叠在一起塞进耳后助听器壳里。每一块板各管一件事:

板子名 层数 职责
PWR 2 层柔性板 电源管理、充电、编程接口
BT 2 层刚性板 蓝牙低功耗(BLE)通信
AI 6 层刚性板 核心 AI 计算(装了 GAP9 芯片)
PERIPH 4 层刚性板 外围设备:RAM、闪存、IMU、DAC
MIC 2 层柔性板 3 个麦克风 + 2 个按钮

最关键的那块叫 AI 板,里面装了一颗叫 GAP9 的特制芯片。

GAP9(GreenWaves Application Processor 9):一颗专门为低功耗 AI 设计的小芯片。可以把它想成"耳机里的小型显卡,但只擅长做整数加减乘"。它有 9 个 RISC-V 处理器核心和一个专用的神经网络加速器(NE16),跑在 370 MHz 时钟频率下。它的片上内存只有 1.5 MB L2 + 128 KB L1——连一张手机照片都装不下。 BLE(Bluetooth Low Energy,蓝牙低功耗):蓝牙的一种省电版本,专门为可穿戴设备设计。 DAC(Digital-to-Analog Converter,数模转换器):把数字信号变回模拟声波的芯片,这样你的耳朵才能听到处理后的声音。

输出:五块板叠起来塞进耳后壳,形成一个完整的可穿戴助听器。

三个子系统怎么协作

硬件分成三个子系统,像三个部门各有分工:

蓝牙子系统:开机后第一个启动,负责唤醒 AI 芯片、管理无线连接。双核处理器,一个核心跑蓝牙协议栈(时间敏感),另一个核心处理杂活(GPIO 控制等)。

音频子系统:管理从麦克风采集到扬声器播放的全链路。三个 PDM 麦克风以 48 kHz 采样,经过 GAP9 内部的 SFU(Smart Filter Unit)做 64 倍抽取后降到 16 kHz 送给神经网络处理。处理完再升采样回 48 kHz 通过 I2S 接口送给 DAC 播放。

PDM(Pulse Density Modulation,脉冲密度调制):一种数字麦克风的输出格式,用高速的 0/1 脉冲来表示声音振幅。 采样率(sample rate):每秒"拍多少张快照"来记录声波。16 kHz 意味着每秒记录 16000 个数据点,足以覆盖人声的核心频率范围。

AI 子系统:核心——每 6 毫秒(96 个采样点 @ 16 kHz)收到一小段音频,做以下事情:

32-bit PCM 音频
  → 转成 16-bit 浮点
  → 预加重滤波(去除直流分量)
  → 放入环形缓冲区
  → FFT 变换到频域
  → 神经网络推理(降噪)
  → IFFT 变回时域
  → 转回 32-bit 整数
  → 送给扬声器播放

功耗预算

组件 功耗 (mW)
BLE 芯片 6.75
麦克风阵列 2.02
扬声器 1.49
AI 芯片(本文模型) 71.64
总计 约 82

电池容量 300 mAh x 3.85V = 1.155 Wh。按 82 mW 计算,理论续航约 14 小时——一天通勤足够。

为什么这步有用:把原来需要手机帮忙的算力,挪到耳机本身。这样不再依赖外部设备,也消除了蓝牙往返带来的延迟。

所以这一节是想说:先把"小电脑"装进耳后这块塑料壳里。五层蛋糕各司其职,关键是 AI 那层的 GAP9 芯片。


第二步:改造一个能听人声的神经网络

这是论文最核心、篇幅最大的部分。作者要做的事是:从一个"聪明但太重"的网络出发,做三刀魔改让它能在 GAP9 上实时跑起来。

2.1 起点:TF-GridNet——双路径网络

类比:像你在嘈杂酒吧听音乐时,耳朵其实同时在做两件事——一件是跟着鼓点走(时间维度:何时出现),一件是分辨这是吉他还是钢琴(频率维度:声音的高低)。

TF-GridNet(2023)就是这样一个"双路径"网络:一条通道专门看频率关系,另一条专门看时间关系。它在语音降噪任务上达到了当时最强水平。但问题是——它太大太慢了,直接放到 GAP9 上根本跑不起来。

STFT(Short-Time Fourier Transform,短时傅里叶变换):把一段声音按小窗口切开,每个窗口变成一张"频率分布图"。就像把一首歌切成很多 6 毫秒的小片段,每个片段画一张"哪个音符在响"的柱状图。 双路径(dual-path)网络:两条独立的神经网络通道,一条管时间、一条管频率。两条通道的结果合并后还原出干净人声。 TF-GridNet:2023 年发表的双路径语音降噪网络,本文的起点模型。

2.2 整体架构:输入到输出的完整数据流

网络整体架构
Plate Nº IV网络整体架构

让我们跟着一小段 6 毫秒的噪声音频走完整个处理流程:

输入:一个 6 ms 的音频块 x_i(96 个采样点 @ 16 kHz),加上 6 ms 的回看(lookback)和 4 ms 的前瞻(lookahead),总共 16 ms 的窗口。

Step 1 - STFT 变换:用短时傅里叶变换把时域波形转成时频二维表示 X_i。想象把一段声音变成一张图:横轴是时间(几帧),纵轴是频率(257 个频率 bin)。

频率 bin:STFT 把频率轴切成等宽的"格子",每个格子叫一个 bin。512 点 FFT 在 16 kHz 采样率下产生 257 个 bin。

Step 2 - 2D 因果卷积:对 X_i 做一层二维卷积,提取低层特征。这里用"因果"卷积——只看过去和当前的帧,不偷看未来的。

卷积(convolution):一种"小窗口在数据上滑过、每滑一步算一次乘加"的操作。把它当成"用一把小刷子在画上反复涂、每涂一下记下涂的结果"。 因果(causal):只依赖过去和当前的数据,不依赖未来。这对实时系统是必须的——你不能等未来的声音到了才处理现在的。

Step 3 - 多个双路径模块(核心计算):这是整个网络最耗算力的部分。每个双路径模块做两件事:

  • 频率阶段(spectral stage):沿频率轴看——低音、中音、高音之间的关系是什么?先用步长卷积把 257 个频率 bin 压成 64 个(4 倍压缩),然后用双向 GRU 处理。
  • 时间阶段(temporal stage):沿时间轴看——前后几帧之间的连贯性怎样?用单向 GRU 处理(只看过去,不看未来)。

本文用了 B=6 个这样的双路径模块堆叠,每个模块的隐藏维度 D=32、H=32。

GRU(Gated Recurrent Unit,门控循环单元):一种比 LSTM 简单的"会记住过去"的网络模块。它内部有两个"门"——重置门(决定"忘掉多少旧记忆")和更新门(决定"接受多少新信息")。比 LSTM 少一个门,计算量约少 1/3,但效果差不多。

Step 4 - 2D 因果反卷积:把处理后的特征图还原回时频表示 Y_i。

Step 5 - ISTFT + 重叠相加:用逆短时傅里叶变换把频域信号变回时域波形 y_i(干净人声)。

输出:一段 6 ms 的干净人声音频,准备送给扬声器播放。

2.3 魔改 a:把频率"压扁"——步长卷积降维

类比:原来要逐个数完一本书所有的字才告诉你这本书写啥。现在改成先把书横着压扁四倍,用目录快速扫一遍。

问题:原始 TF-GridNet 的频率阶段要按 257 个频率 bin 一个一个顺序处理。双向 LSTM 的计算量和序列长度成正比——257 步走下来,光这一个模块的推理时间就超过了 6 毫秒的实时限制。

解法:在送入频率阶段的 GRU 之前,先加一层步长卷积(strided convolution),把 257 个频率 bin 压成 64 个(4 倍压缩)。处理完再用转置卷积恢复原来的维度。

步长卷积(strided convolution):让卷积核每次跳几步而不是一步,这样输出比输入短,等于做了"压缩"。步长为 4 就意味着每 4 个输入点产生 1 个输出点。

同时,作者把原来的 LSTM 模块全部换成 GRU 模块。GRU 比 LSTM 少一个门(没有"输出门"),参数量少约 25%,速度快约 1.3 倍,在语音任务上效果几乎不掉。

为什么这步有用:频率序列从 257 缩到 64,GRU 又比 LSTM 轻——两刀下去,频率阶段的计算量下降约 75%。

2.4 魔改 b:双窗口拼接——省掉一段等待

这一步比较精妙,需要理解"重叠相加"(overlap-add)是怎么工作的。

问题背景:在流式音频处理中,每次处理的不只是当前 6 ms 的音频块——为了提高频率分辨率,还需要额外的"前瞻"(lookahead,4 ms)和"回看"(lookback,6 ms)。前瞻的延迟很好理解——你必须等那 4 ms 的未来音频到来。但回看也会引入延迟,原因在于 ISTFT 的重叠相加步骤。

延迟图:算法延迟 vs 硬件延迟
Plate Nº V延迟图:算法延迟 vs 硬件延迟

常规做法的问题:如图 3B 所示,重叠相加需要把当前块 y_i 的回看部分和下一块 y_{i+1} 的回看部分拼起来。这意味着——你必须等到下一块处理完(额外等 L_B + L_C = 12 ms)才能输出当前块。这就让算法延迟从 10 ms 暴涨到 22 ms。

类比:原来切香肠要左切右切再粘起来,当前这片的边缘必须等下一片切完才能对齐粘合。

解法:采用"双窗口"方法——分析时用大窗口(包含 lookback + chunk + lookahead),合成时用小窗口(只包含 chunk + lookahead 的部分)。具体来说:

  • 分析窗口:矩形窗(全为 1),长度为 L_B + L_C + L_F = 16 ms
  • 合成窗口:一个特殊设计的短窗函数,在 lookback 对应的位置赋予特定权重,使得重叠相加时不需要下一块的数据

窗函数(window function):在切音频时给每段加一个"两边轻、中间重"的权重曲线。物理上类似"渐入渐出"——防止切口处出现跳变产生杂音。

数学上,合成窗函数 s[i] 被设计为:在 chunk 区间 [L_F, L_C] 内值为 1,在其他位置值为 1/(floor((L_C + L_B)/(L_C)) + 1)。这个精巧的设计保证了完美信号重建(perfect reconstruction)——拼回去的信号和原始信号完全一致。

效果:回看不再引入额外延迟。算法延迟 = L_C + L_F = 6 + 4 = 10 ms。比 TinyDenoiser 的 25 ms 低了 15 ms,终于降到人耳不敏感的门槛以下。

为什么这步有用:这是落地的关键门槛。25 ms 延迟的助听器戴上会有"山洞回声感",10 ms 就没有了。

2.5 魔改 c:留底汤——缓存复用中间结果

类比:做一锅汤,每天倒掉太浪费。把昨天的底汤留着,今天接着用。

问题:神经网络每来一个新的 6 ms 音频块,很多中间计算其实和上一块高度重叠。如果每次都从头算,会做大量重复运算。

解法:维护一个缓存状态 h_i,由四个部分组成:

缓存编号 存什么 为什么有用
缓存 1 前几块的 STFT 帧 第一层 2D 卷积的 kernel 需要用到前面的帧,缓存避免重算 STFT
缓存 2 双路径模块的输出 2D 反卷积需要前面的特征图,缓存避免重跑双路径模块
缓存 3 反卷积层的中间输出 ISTFT 需要前面块的数据来做重叠相加
缓存 4 GRU 的隐藏状态 GRU 的"记忆"——让它记住之前听到的所有内容

四个缓存总共约 30 KB——只占 GAP9 的 128 KB L1 内存的不到四分之一。

为什么这步有用:避免重复计算,在不增加模型大小的情况下进一步压缩推理时间。同时,GRU 隐藏状态的缓存让模型拥有了"长期记忆"——虽然每次只看 16 ms 的窗口,但通过 GRU 状态的累积,模型实际上能利用开机以来所有音频的上下文信息。

所以这一节是想说:作者把一个聪明但太重的网络瘦身了三道——压频率、双窗口、缓存复用——让它能在小芯片上实时跑起来。三刀各砍不同维度的开销,合起来才刚好满足约束。


第三步:训练策略——让模型在真实世界也能用

网络结构设计好了,接下来要训练它。训练策略有两个阶段。

3.1 第一阶段:合成数据 + 双耳房间冲激响应

输入:三种原料混在一起:

  • 干净人声:LibriSpeech 数据集(公开免费的有声书,360 小时)
  • 房间回声:4 个公开的"双耳房间冲激响应"(BRIR)数据集——CIPIC、RRBRIR、ASH-Listening-Set、CATTRIR
  • 背景噪声:WHAM! 数据集(58 小时的咖啡馆/餐厅/公园等真实噪声)

房间冲激响应(Room Impulse Response, RIR):在某个房间里"啪"地拍一下手,麦克风录到的衰减+反射波形。把它和干净人声做卷积,就能模拟"在那个房间里说话"的效果。 BRIR(Binaural RIR):双耳版的房间冲激响应——分别录左耳和右耳听到的,包含了头部遮挡和耳朵形状带来的声学差异。

混合公式:x(t) = h_{θ,φ}(t) * a(t) + n(t)。翻译成人话就是:先把干净人声 a(t) 和某个角度的 BRIR 做卷积(模拟"从那个方向传来的声音在这个房间里的效果"),再加上背景噪声 n(t)。训练目标是从混合信号中恢复出 s(t) = h_{θ,φ}(t) * a(t)(带房间效果的干净人声)。

损失函数:使用 SNR Loss = ||s||^2 / ||s - ŝ||^2。翻译:用干净信号的能量除以"干净信号减去模型输出"的能量。这个比值越大说明模型输出越接近干净信号。

训练配置:200 个 epoch,每个 epoch 20000 个样本,AdamW 优化器,梯度裁剪 0.1。学习率经历三段式调度:前 10 轮线性升温(1e-4 → 1e-3),中间 140 轮保持 1e-3,最后 50 轮每 15 轮减半。

因为两只耳朵各自独立处理,所以训练了两个独立的网络——一个管左耳,一个管右耳。

3.2 第二阶段:运动微调 + 数据增强

问题:第一阶段假设说话人和佩戴者都不动。但真实世界里,你和聊天对象都会转头、走动。

解法:微调阶段加入时变的声源位置——每 25 ms 有 2.5% 的概率触发随机运动事件,角速度在 [π/6, π/2] rad/s 之间采样,持续 0.1-1 秒。用 Steam Audio SDK 模拟运动轨迹,在离散 BRIR 位置之间用最近邻插值。

同时加入三种噪声增强(30% 概率触发):白噪声、粉红噪声、棕色噪声。还随机变速语音(80%-120%)。

损失函数从 SNR Loss 换成多分辨率频谱损失——在多个 STFT 窗口长度上同时计算,兼顾时间和频率分辨率。微调 100 个 epoch,ReduceLROnPlateau 学习率调度器(patience=5, factor=0.5)。

所以这一节是想说:训练数据全是合成的(不需要真实硬件采集),但通过 BRIR、运动模拟、噪声增强,让模型学会应对真实世界的复杂声学环境。


第四步:把"小数"压成"整数"——量化与 QAT

这是论文真正的方法贡献。前面两步让模型"跑得动",这一步让模型"跑得好"。

4.1 为什么要量化

神经网络里的每个数字默认用 32 位浮点数(float32)存——精度高但占空间大、计算慢。GAP9 芯片的 NE16 加速器只支持 8 位整数(int8)运算,浮点运算要退回到通用 RISC-V 核心上跑,速度慢好几倍。所以必须把模型从 float32 压缩到 int8。

量化(quantization):把高精度的小数压成低精度整数的过程。类比:原来用精确到毫米的尺子量东西,现在换成只精确到厘米的尺子——快了但会丢一点精度。 float32:32 位浮点数,能表示非常精确的小数。 int8:8 位整数,只能表示 -128 到 127 之间的整数。空间少 4 倍,整数运算比浮点快 5-10 倍。

量化的数学公式很简单:Q(r) = round(r / S) + Z。翻译:把原始值 r 除以缩放因子 S,四舍五入到最近的整数,再加上零点偏移 Z。反量化时反过来:r̂ = S × (Q(r) - Z)。由于四舍五入,恢复出来的 r̂ 不会精确等于 r——这个差距就是量化误差

4.2 直接压会怎样——灾难性崩塌

论文做了一个直观的实验:把训练好的浮点模型直接用 PTQ(Post-Training Quantization,训练后量化)压成全 int8。

结果:SISDRi 从 8.65 dB 暴跌到 -1.70 dB

负数意味着"处理后的音频比处理前还差"——模型彻底崩了。原因是:这个模型有 6 个双路径模块堆叠,量化误差会逐层放大(误差在深层网络中像"击鼓传花"一样越传越大)。

PTQ(Post-Training Quantization,训练后量化):先正常训练好模型,然后一次性把所有权重和激活值压成低精度。简单但粗暴。 SISDRi(Scale-Invariant Signal-to-Distortion Ratio improvement):一个客观打分,衡量"降噪后人声比原来干净了多少"。数字越大越好,负数意味着越处理越差。

4.3 第一把钥匙:混合精度量化

类比:像考试时你把粗略思路写在普通纸上,但关键步骤写在格子纸上保证清晰。

思路:不同层对量化误差的敏感度不同。第一层(直接处理原始输入)和最后一层(生成最终输出)最敏感——就像做饭时第一步洗菜和最后一步摆盘最关键,中间翻炒可以粗糙一点。

做法

  • 第一层 2D 卷积 → 用 bfloat16(16 位浮点,精度介于 float32 和 int8 之间)
  • 最后一层 2D 反卷积 → 用 bfloat16
  • 中间所有双路径模块 → 压成 int8

bfloat16(Brain Float 16):16 位的浮点格式。比 float32 精度低,但比 int8 精度高得多。Google Brain 团队发明的,"brain"就是从这来的。

混合精度后:SISDRi 从 -1.70 dB 回升到 0.90 dB。虽然还是比浮点的 8.65 dB 差很远,但至少不是负数了——模型活过来了。

4.4 第二把钥匙:量化感知训练(QAT)

类比:考试前先用真考试的粗糙卷纸练,而不是用印得清楚的练习卷。这样考试时你就不会因为"印刷太糊看不清"而慌。

核心思想:既然量化会引入误差,那就在训练阶段就把量化这一步模拟出来——让模型一边学一边适应"被压缩后会损失精度"这件事。模型会学会补偿量化带来的损失,找到一个"即使被粗糙化也依然表现良好"的参数配置。

QAT(Quantization-Aware Training,量化感知训练):在训练阶段就把量化操作插入前向传播中。每一步训练时,权重和激活值先被假装量化(round到整数再恢复回浮点),然后用这个"受损"的结果计算损失、更新梯度。 Straight-Through Estimator (STE):量化操作(四舍五入)是不可微分的,无法直接算梯度。STE 的做法是"假装 round 操作的梯度等于 1"——虽然数学上不严格,但实践中效果很好。

QAT 实现细节

  1. 初始化:从训练好的浮点模型开始,先应用混合精度配置
  2. LSQ(Learned Step-Size Quantization):让缩放因子 S 也变成可学习参数——模型自己决定"量尺的精度"
  3. 微调:使用 FQSE 框架微调 30 个 epoch,每个 epoch 4000 个混合样本(QAT 计算开销大,所以用更少的数据)
  4. 学习率:初始 1e-3,ReduceLROnPlateau 调度

效果:SISDRi 从 0.90 dB 跃升到 8.19 dB——只比原始浮点版(8.65 dB)低 0.57 dB。差距被压缩了 14 倍。

用一张表总结量化的完整旅程:

量化阶段 SISDRi (dB) 和浮点的差距
浮点原版 (float32) 8.65 基准
全 int8 PTQ -1.70 -10.35 dB(崩了)
混合精度 PTQ 0.90 -7.75 dB(活了但很差)
混合精度 + QAT 8.19 -0.46 dB(几乎追平)

所以这一节是想说:模型不能直接压,得分两步走——先用混合精度把"最敏感的两层"保护起来,再用 QAT 让模型学会适应粗糙精度。两把钥匙缺一不可。


第五步:训练的工程细节补充

量化的两种粒度:论文对激活值用 per-tensor 不对称量化(整个张量共享一组 S 和 Z),对权重用 per-channel 对称量化(每个通道独立的 S,Z=0)。这是因为 GAP9 硬件的 NE16 加速器只支持这种配置——又一个 co-design 的例子。

GAP9 的内存层次:L1(128 KB,快) → L2(1.5 MB,中) → 外部 L3 RAM(慢且耗电)。最终模型只有 299 KB,全部放进 L2,不需要碰 L3——这是功耗能控制在 71 mW 的关键原因。

所以这一节是想说:从网络设计到量化策略到硬件部署,每一步都在互相迁就。这就是 co-design 的精髓。


NeuralAids — 方法示意:核心 pipeline
Plate Nº VINeuralAids — 方法示意:核心 pipeline

关键数字(What works)

QAT 后量化模型几乎追平浮点
Plate Nº VIIQAT 后量化模型几乎追平浮点
指标 数值 对比基准 生活语言
处理一帧时间 5.54 ms TinyDenoiser 0.58 ms(但算法延迟 25 ms) 6 ms 的题 5.54 ms 交卷,留 0.46 ms 缓冲
算法延迟 10 ms TinyDenoiser 25 ms 人耳对 10 ms 以下延迟基本不敏感
功耗 (AI 芯片) 71.64 mW 手机端同类模型上百 mW 300 mAh 电池撑约 14 小时
模型大小 299 KB GPT-3 约 700 GB 比一张手机照片还小
SISDRi 8.19 dB TinyDenoiser 5.97 dB;浮点上限 8.65 dB 从"中等清晰"到"高清晰"
主观打分 (Overall MOS) 3.38/5 不开 AI 2.96;TinyDenoiser 1.96 TinyDenoiser 反而不如不开
降噪打分 (Noise MOS) 3.57/5 不开 AI 2.15;TinyDenoiser 2.38 明显感知到噪声减少
量化差距 0.57 dB PTQ 差距 7.86 dB QAT 把差距压缩了 14 倍

PESQ(Perceptual Evaluation of Speech Quality):一个模拟人耳感知的客观打分,范围 1-4.5,越高越好。本文浮点版 1.76,QAT 版原文未单独报 PESQ 但从表格推断在 1.7 左右。 DNSMOS(Deep Noise Suppression MOS):用神经网络预测的主观打分,范围 1-5。本文浮点版 2.50。 MOS(Mean Opinion Score):让真人听完打 1-5 分取平均值。类比"豆瓣评分"。

所以这一节是想说:又快又小又省电又好听,四件事一起做到了。每个数字背后都是三层联合设计的结果。


实验结果说明了什么

论文的实验结果传递了三条核心信息:

第一条:QAT 是深度量化的必经之路,不是可选项。 从 Table 3 可以清楚看到,不管是简单模型(TinyDenoiser)还是复杂模型(本文),直接 PTQ 都会严重掉点。而且模型越复杂、层数越多,掉点越惨(TinyDenoiser 掉 2.76 dB,本文掉 10.35 dB)。QAT 的价值在于:它让复杂模型在量化后依然能保持大部分性能,而简单模型即使用了 QAT 也追不上复杂模型的 QAT 版本(5.97 vs 8.19)。

第二条:"降噪"和"保真"是两件不同的事,只做好一件不够。 TinyDenoiser 在主观实验中的降噪打分(2.38)确实比不开 AI(2.15)好一点,但整体体验打分(1.96)反而比不开 AI(2.96)低了整整一分。原因是它在降噪的同时把人声也"咬碎"了——听到的人声断断续续、有机器人般的失真。这说明:用户要的不是"噪声小了",而是"听起来舒服"。

第三条:纯合成训练数据可以泛化到真实环境。 论文的训练数据全部来自公开数据集的合成混合,没有用任何真实硬件采集的数据。但在 6 个从未见过的室内外环境中,以及佩戴者转头运动的场景下,模型依然表现良好。Table 4 显示,即使声源以 90 度/秒的速度移动(很快的头转动速度),微调后的模型 SISDRi 仍然保持在 10+ dB。这对部署意义重大——不需要为每个新环境采集训练数据。

所以这一节是想说:实验不只是"验证模型好不好",更揭示了三个重要的设计原则——QAT 是必须的、降噪和保真都要做好、合成数据能泛化。


你应该懂的几个新词

GAP9 / GreenWaves Application Processor 9:一颗专门为低功耗 AI 设计的小芯片。9 个 RISC-V 核心 + NE16 神经网络加速器。功耗级别在几十毫瓦。像"耳机里的小型显卡"。

STFT / Short-Time Fourier Transform / 短时傅里叶变换:把一段声音切成小窗口,每个窗口画成"频率分布图"。横轴时间、纵轴频率。

dual-path / 双路径网络:神经网络的一种结构,一条通道处理时间维度、一条处理频率维度。处理完合并。

TF-GridNet:2023 年发表的双路径语音降噪网络,本文的起点。SOTA 但太大太慢。

SISDRi / Scale-Invariant Signal-to-Distortion Ratio improvement:客观降噪打分,单位 dB。数字越大越好,负数意味着越处理越差。

MOS / Mean Opinion Score:真人主观打分 1-5 分的平均值,类似"豆瓣评分"。

PTQ / Post-Training Quantization / 训练后量化:训练完再一次性压成整数。简单但效果差。

QAT / Quantization-Aware Training / 量化感知训练:训练阶段就模拟"被压成整数"的损失,让模型学会补偿。

GRU / Gated Recurrent Unit / 门控循环单元:一种比 LSTM 简单的"会记住过去"的网络模块。少一个门,速度快约 1/3。

量化 / quantization:把高精度小数压成低精度整数。空间少 4 倍、运算快 5-10 倍。

bfloat16:16 位浮点格式,精度介于 float32 和 int8 之间。

co-design / 协同设计:硬件和软件同时设计、互相迁就,而不是先做一边再适配另一边。

LSQ / Learned Step-Size Quantization:让量化的缩放因子也变成可学习参数。

算法延迟 vs 硬件延迟:前者是"模型设计上必须等多久",后者是"芯片实际算多久"。两者都得低于 10 ms。

所以这一节是想说:这些词以后在边缘 AI 领域还会反复出现,先建一个小词典。


它有什么搞不定的

  1. 没人说话时还在烧电。 安静的图书馆里戴 6 小时,AI 芯片一直以 71 mW 运转完全没必要。论文自己也提到可以加一个"噪声检测 + 占空比"机制——安静时让 AI 睡觉,吵闹时才唤醒。但这个功能没做。

  2. 只在 GAP9 一颗芯片上验证过。 换一家厂商的芯片(比如 Analog Devices MAX78000、Arm Ethos U-55)能不能直接用?量化策略需不需要重新调?未知。论文列出了几颗候选芯片但没有实验。

  3. 训练数据全是合成的。 地铁隧道里的尖锐刹车声、强风海边的轰鸣、教堂大堂的极长混响——这些极端声学环境没测,可能掉链子。

  4. 只用了 1 个麦克风。 硬件有 3 个麦克风,但模型只用了 1 个。意味着"声源在左在右"的空间信息完全没用上。多麦克风波束成形(beamforming)能进一步提升降噪效果,但留给了未来工作。

  5. 没针对听损人群个性化。 28 个志愿者里没有区分听力正常 vs 听损者,也没有接入临床上常用的听力损失处方算法。所以这更像"健康人降噪耳塞",不是真正意义的"医疗助听器"。

  6. 没有 ANC(主动降噪)。 AirPods Pro 那种"产生反向声波抵消噪声"的功能,本作完全没做。GAP9 硬件支持 ANC 算法,但论文没集成。

  7. 形状还是 BTE(耳后挂)助听器。 5 块 PCB 叠起来挂在耳后,比耳塞大 3-4 倍。论文说下一步要做成耳塞形状。

所以这一节是想说:能跑起来,但还有七条明显的留白——每条都是"未来工作"的候选方向。


它和别的几篇是什么关系

听觉智能时间线(同一实验室 UW CSE / Gollakota 组)

ClearBuds (MobiSys 2022)        ← 耳机收音,手机算(需要外部设备)
  ↓
Semantic Hearing (UIST 2023)    ← 选择性听类别("只听人声 / 只听鸟叫")
  ↓
Look Once to Hear (CHI 2024)    ← 看一眼就锁定那个人的声音
  ↓
Sound Bubbles (Nature Electronics 2024) ← 按距离过滤(3 米内的人才听得到)
  ↓
NeuralAids (MobiCom 2025, 本文)  ← 第一篇全程耳机内、不依赖手机
  ↓
TF-MLPNet (Clarity Challenge 2025) ← 同作者后续,更小更快的候选模型

在 13 篇阅读清单中的位置

NeuralAids 是 13 篇中唯一一篇研究"边缘 AI 部署"的工程论文。其他论文关心的是"模型能做多复杂"(比如 OpenVLA 的 7B 参数 VLA 模型),而这篇关心的是"模型怎么压到极致才能跑在纽扣电池上"。

这构成了一个重要的互补视角:当算力不是问题时(云端 / GPU 集群),瓶颈在模型能力;当算力极度受限时(可穿戴 / 嵌入式),瓶颈在部署效率。方法论上,"模型压缩 + 硬件协同"的思路和把大型 VLA 模型部署到机器人本体上是相通的——只是约束更极端。

和"听觉三连"的分工

维度 Proactive Hearing NeuralAids Acoustic Swarms
核心问题 谁在跟我说话 怎么在芯片上降噪 怎么摆麦克风阵列
层次 决策层 计算层 硬件层
关键技术 对话节奏检测 量化感知训练 自主分布机器人
硬件形态 有线耳机+手机 无线助听器(全设备端) 桌面小机器人群
麦克风数量 6 个(耳机上) 1 个(3 个可用但只用 1 个) 7 个机器人各 7 个

神经处理 vs 传统 DSP

NeuralAids 最根本的贡献是证明了"神经网络降噪可以替代传统 DSP 降噪跑在可穿戴设备上"。传统数字信号处理(频率均衡、谱减法)只能处理"稳定的背景噪声"(如风扇嗡嗡声),对"非平稳噪声"(人说话、瓷器碰撞、突然的笑声)无能为力。神经网络的优势是它能学到"什么是人声的统计特征"——这是死规则写不出来的。但代价是计算量大 100 倍以上,所以需要本文这样的三层联合设计才能塞进芯片。

所以这一节是想说:在听觉智能这条线上,NeuralAids 是"硬件落地"那一段;在更宏观的具身 AI 里,它代表了"如何把模型塞进真实物理设备"。


和本导读的关系

本文对应导读 Ch20: 听觉智能 的以下内容:

  • 20.2 音频信号基础:STFT、窗函数、频率 bin 这些概念在 Ch20.2 有完整讲解。NeuralAids 的双窗口方法是 STFT 参数选择的实际工程案例。
  • 20.2.5 时域 vs 频域:NeuralAids 选择频域路线(STFT → 网络 → ISTFT),和 Conv-TasNet 的时域路线形成对比。为什么?因为频域表示对量化更友好——频谱幅度值的分布比原始波形更平稳,量化误差更小。
  • 20.2.6 STFT 基础补充:Ch20 提到的 N_FFT=512 产生 257 个频率 bin——这正是 NeuralAids 网络输入的频率维度。步长卷积把它压到 64 个 bin 的设计直接对应了 Ch20 讨论的时频分辨率 trade-off。
  • 20.3 音频离散化:SoundStream/EnCodec 的量化思想和本文的 int8 量化属于同一个技术家族——都是"用更少的比特表示音频信息"。区别在于 SoundStream 量化的是 latent 向量(用于压缩传输),NeuralAids 量化的是网络权重和激活值(用于加速推理)。

本文是 Ch20 "Part 2: 边缘设备上的听觉" 的核心论文。它回答了一个关键问题:Ch20.4 的 Whisper 跑在云端需要几 GB 内存,而 NeuralAids 证明语音处理任务(虽然比 ASR 简单)可以压缩到 299 KB 跑在纽扣电池芯片上。这条从"云端大模型"到"设备端微模型"的压缩之路,是具身 AI 感知系统从实验室走向产品的必经之路。

所以这一节是想说:NeuralAids 是 Ch20 "听觉基础"到"听觉落地"的桥梁——把前面学的 STFT、量化、频域处理等概念全部用在了一个真实的工程系统上。


思考题

Q1:为什么 NeuralAids 选择频域(STFT)路线而不是时域(Conv-TasNet 风格)路线?如果换成时域路线,量化会更容易还是更难?

提示

想想时域波形的数值分布:原始 PCM 采样值在 [-1, 1] 之间快速振荡,相邻采样点可能正负交替。这种分布对量化不友好——int8 的 256 个值要覆盖正负两侧,有效分辨率减半。而 STFT 幅度谱是非负的,且频率分布相对平滑,量化误差更小。另外,频域处理天然把问题分解成了"哪些频率该留、哪些该去",和降噪任务的目标直接对齐。

Q2:论文说"直接全 int8 量化后 SISDRi 从 8.65 掉到 -1.70"。为什么我们的模型比 TinyDenoiser 掉得更惨(10.35 dB vs 2.76 dB),明明我们的浮点性能更好?

提示

想想两个模型的深度差异。TinyDenoiser 只有很少的层,量化误差没有太多机会"逐层放大"。而我们的模型有 6 个双路径模块堆叠,每个模块内部又有卷积 + GRU + 反卷积。量化误差在每一层都会引入新的噪声,经过 6 层传播后,误差像滚雪球一样越来越大。模型越深越复杂,对量化的鲁棒性反而越差——这是深度网络量化的一个普遍规律。

Q3:假设你要把 NeuralAids 的降噪能力和 Proactive Hearing 的"挑人听"能力合并到同一只耳机里,你会怎么设计系统?两个模型能顺序跑还是需要并行跑?瓶颈在哪里?

提示

先想清楚两个任务的计算顺序:降噪是"去掉噪声、保留所有人声",挑人是"在所有人声中只保留同伴的声音"。逻辑上应该先降噪再挑人(先去噪再分人更容易),所以可以串行跑。但瓶颈在于延迟预算:NeuralAids 已经用了 5.54 ms 中的 6 ms 窗口,加上 Proactive Hearing 的模型推理,总延迟可能超过 10 ms。可能的解法包括:用更激进的量化、用更小的网络、或者把两个任务融合成一个端到端模型。

Q4:论文用了 4 倍频率压缩(257 → 64),而 TFGridNet-6F 用了 6 倍(257 → 43)。为什么不直接用 6 倍?压缩比和降噪效果之间的 trade-off 是什么?

提示

看 Table 2:TFGridNet-6F(6 倍压缩)的 SISDRi 是 8.43,我们的模型(4 倍压缩)是 8.65。差了 0.22 dB。频率压缩越多,频率分辨率越低——模型越难区分"频率相近但一个是人声一个是噪声"的情况。4 倍压缩是作者在"实时性"和"频率分辨率"之间找到的甜蜜点——足够快能在 6 ms 内完成,又不至于丢太多频率信息。

Q5:如果 GAP9 的 NE16 加速器升级到支持 int4(4 位整数),你觉得直接把模型从 int8 压到 int4 会发生什么?需要做哪些额外工作?

提示

int4 只有 16 个可能的值(-8 到 7),分辨率极低。直接从 int8 压到 int4 几乎肯定会再次崩溃(参考 int8 PTQ 的灾难)。需要的额外工作至少包括:重新做混合精度搜索(可能需要更多层保留高精度)、重新做 QAT(而且 QAT 的训练难度更大,因为梯度估计误差更大)、可能需要引入新技术如分组量化(group quantization)或异常值处理。同时 int4 的精度可能已经低于语音任务的下限——毕竟人声的微妙频率差异需要一定的数值分辨率才能捕捉。

Q6:论文只用了 3 个麦克风中的 1 个。如果用上全部 3 个做波束成形(beamforming),网络输入从 1 通道变成 3 通道,计算量和模型大小会如何变化?对实时性有什么影响?

提示

最直接的影响:STFT 输入从 1x257xT 变成 3x257xT,第一层卷积的输入通道数变成 3 倍。但这只是第一层,后续层可以保持不变。所以模型大小增加有限(主要增加第一层权重),计算量增加也有限。更大的挑战在于:波束成形需要利用麦克风间的时间差(ITD)来判断声源方向,这需要额外的对齐模块。另外,3 路 16kHz 的音频同时流入意味着 I/O 带宽增加 3 倍,可能需要更高效的 DMA 设计。

Q7:为什么论文选择 6 ms 的 chunk size?改成 3 ms(更低延迟)或 12 ms(更多上下文)会怎样?

提示

chunk size 涉及三个 trade-off:(1) 延迟——chunk 越小延迟越低,但算法延迟 = L_C + L_F,3 ms chunk 能把延迟降到 7 ms;(2) 频率分辨率——chunk 越小 STFT 窗口越短,频率分辨率越低(时频不确定性原理),降噪效果可能变差;(3) 计算效率——每个 chunk 都有固定的 overhead(数据拷贝、类型转换),chunk 越小 overhead 占比越高。6 ms = 96 个采样点,是在这三者之间的平衡点。


一些好奇心问答(FAQ)

Q1: 这个模型有多大?我家的 RTX 4070 跑得动吗?

压缩后模型只有 299 KB,比一张照片还小。你的 4070 当然跑得动,但官方推理代码是给 GAP9 芯片写的(用 GreenWaves 的 SDK),没有适配 GPU 的版本。训练阶段需要一张普通显卡(RTX 3090 / 4070 都够)。

Q2: 训练数据从哪来?

全是合成出来的。具体配方:干净人声来自 LibriSpeech(360 小时有声书),房间回声来自 4 个公开 BRIR 数据集,背景噪声来自 WHAM!(58 小时真实环境噪声)。把它们按公式 x(t) = h * a(t) + n(t) 叠在一起当训练样本。全部免费公开,不需要花钱买数据。

Q3: 我能跑代码吗?官方开源了吗?

截至 2026 年 6 月,论文发表时还没有公开完整代码。同组前几篇的代码在 github.com/uw-x,可以参考网络结构设计。GAP9 的推理框架在 github.com/GreenWaves-Technologies。硬件 PCB 设计也没开源——要完全复现需要自己设计五块板子。

Q4: 训练一次要烧多少卡时?

第一阶段 200 epoch x 20000 样本 x 5 秒 = 约 5500 小时音频处理量,单张 RTX 3090 估计要 3-7 天。第二阶段(运动微调)100 epoch,约 2-3 天。QAT 阶段 30 epoch x 4000 样本,约 12-24 小时。总共单卡 7-12 天,多卡可以线性加速。

Q5: 为什么不用 Transformer?Transformer 不是比 GRU 更强吗?

Transformer 在大多数 NLP/CV 任务上确实更强,但它有两个致命问题:第一,自注意力的计算量和序列长度的平方成正比,257 个频率 bin 的自注意力太贵了;第二,Transformer 的参数量通常远大于 GRU,放不进 1.5 MB 的 L2 内存。论文实际上提到它们尝试过 Transformer 和 State-Space Model,都超出了硬件的内存和时间限制。

Q6: 戴它能去跑步吗?

不行。现在的形状是"耳后挂"助听器,5 块 PCB 叠起来比耳塞大 3-4 倍。论文说下一步会做成耳塞形状——GAP9 芯片本身很小,主要是其他外围器件(RAM、闪存、电池)占空间。

Q7: 它能识别说话内容吗?比如做语音转文字?

不能。它只做降噪(speech enhancement),不做识别(ASR)。降噪是"让声音更干净",识别是"把声音变成文字"——两个完全不同的任务。识别需要再叠一个语音识别模型(如 Whisper),那个模型比降噪模型大得多,目前还塞不进 GAP9。

Q8: 真的比 AirPods Pro 好吗?

论文没有直接和 AirPods Pro 对比(因为 Apple 不公开技术细节)。严格来说,AirPods Pro 有主动降噪(ANC)+ 通透模式 + Apple 自研芯片 + 更大的电池,综合体验大概率更好。NeuralAids 的价值不在于"产品更好",而在于"方法全公开"——它第一次证明了一套开源的、可复现的方法能在如此受限的硬件上做到有效的神经网络降噪。

所以这一节是想说:实操问题先一次性回答清楚,不留困惑。


如果你想再深入

前传 / 必读基础

  1. TinyDenoiser (Fedorov et al., 2020) — 本文最强对比基线。理解它就理解了"小耳机降噪"最基础的做法以及它的局限。
  2. TF-GridNet (2023) — 本文神经网络的起点,双路径范式的代表。看懂它就知道"瘦身前的胖子长什么样"。
  3. Wang et al., STFT-domain neural speech enhancement with very low algorithmic latency — 双窗口设计的思想出处。

同组续作 / 兄弟工作

  1. Look Once to Hear (CHI 2024) — 同组前作,做"只听某个特定人的声音"。和 NeuralAids 用了类似的双路径架构。
  2. Sound Bubbles (Nature Electronics 2024) — 同组前作,做"按距离过滤声音"。
  3. TF-MLPNet (Clarity Challenge 2025) — 同作者的更小更快后续模型,可能是 NeuralAids 下一代候选。

量化技术深入

  1. Esser et al., Learned Step-Size Quantization (LSQ) — 让量化缩放因子也变成可学习参数的论文。NeuralAids 的 QAT 直接用了这个技术。
  2. Cohen et al., Fully Quantized NN for Audio Source Separation — 全量化语音分离的近邻工作,也是在 GAP9 上做的。

听觉三连的另外两篇

  1. Proactive Hearing 精读笔记 — 决策层:怎么挑人听。
  2. Acoustic Swarms 笔记 — 硬件层:怎么摆麦克风。

原文信息

标题:Wireless Hearables With Programmable Speech AI Accelerators

作者:Malek Itani, Tuochao Chen, Arun Raghavan, Gavriel Kohlberg, Shyamnath Gollakota

机构:University of Washington (Paul G. Allen School of CSE + Department of Otolaryngology)

会议:ACM MobiCom 2025 (The 31st Annual International Conference on Mobile Computing and Networking), Hong Kong

链接https://doi.org/10.1145/3680207.3765251

BibTeX

@inproceedings{itani2025neuralaids,
  title     = {Wireless Hearables With Programmable Speech {AI} Accelerators},
  author    = {Itani, Malek and Chen, Tuochao and Raghavan, Arun and Kohlberg, Gavriel and Gollakota, Shyamnath},
  booktitle = {Proceedings of the 31st Annual International Conference on Mobile Computing and Networking (ACM MobiCom '25)},
  year      = {2025},
  address   = {Hong Kong, China},
  publisher = {ACM},
  doi       = {10.1145/3680207.3765251}
}

开源状态:截至 2026 年 6 月,代码和硬件设计未公开。同组相关代码见 github.com/uw-x,GAP9 SDK 见 github.com/GreenWaves-Technologies

所以这一节是想说:想沿着任何一条线深挖都有现成的入口。

引用本笔记 / Cite this note
BibTeX
@online{eai_neuralaids_2026,
  title       = {(readable note) NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/neuralaids/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?