Auditory & Acoustic
让机器人听懂世界——从语音识别到环境声音分离到声学定位。这是具身感知里最被低估的一块,但所有家务机器人都需要它。
先读这三篇。
Whisper 用 68 万小时弱标注做 ASR → AudioLM 把音频建模成 token 序列 → Acoustic Swarms 用一群麦克风分离声源。
-
1
Robust Speech Recognition via Large-Scale Weak Supervision
Whisper 用互联网上 68 万小时的弱标注(音频 + 自动/人工字幕)数据,喂进标准 Encoder-Decoder Transformer,训出一个多语种多任务语音模型。不微调直接用(zero-shot),在 12 个分布外数据集上平均 WER 比 Wav2Vec 2.0
-
2
AudioLM
Google AudioLM 把波形变成 两套离散 token——w2v-BERT 语义 token(25 Hz) 管长程内容,SoundStream 声学 token(50 Hz×12 层 RVQ) 管高保真音色——再用 三个 0.3B Transformer 分阶段自回归续写
-
3
Creating speech zones with self-distributing acoustic swarms
七个骰子大小的小机器人,从充电底座自己爬上桌子、散成一圈,靠互相"喊一嗓子"算出各自的精确坐标,然后联手把桌旁几个同时说话的人一一分清——谁在哪、说了啥,全部搞定。整个过程不需要头顶装摄像头、不需要人手摆放、不需要扯一根线。
2019 到 2024,15 篇怎么排开。
祖师爷
经典
前沿
Auditory & Acoustic 全部 15 篇。
| era | year | title | venue |
|---|---|---|---|
| 前沿 | 2024 | Proactive Hearing Assistants that Isolate Egocentric Conversations | UIST |
| 经典 | 2024 | NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators | MobiCom |
| 祖师爷 | 2023 | Creating speech zones with self-distributing acoustic swarms | Nature |
| 祖师爷 | 2019 | Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation | IEEE/ACM TASLP |
| 祖师爷 | 2022 | SoundStream: An End-to-End Neural Audio Codec | IEEE/ACM TASLP |
| 经典 | 2020 | Conformer | Interspeech |
| 经典 | 2020 | Dual-path RNN | ICASSP |
| 经典 | 2021 | Meta-StyleSpeech | ICML |
| 经典 | 2023 | AudioLM | TASLP |
| 经典 | 2023 | EnCodec | TMLR |
| 经典 | 2023 | MusicLM | arXiv |
| 经典 | 2023 | Robust Speech Recognition via Large-Scale Weak Supervision | ICML |
| 前沿 | 2023 | SeamlessM4T | arXiv |
| 前沿 | 2024 | Stable Audio | ICML |
| 前沿 | 2024 | Universal Source Separation with Weakly Labelled Data | TASLP |