Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Topic IX · 听觉智能与声学空间交互

Auditory & Acoustic

Auditory & Acoustic — 听觉智能与声学空间交互
15papers
3founder
8classic
4frontier

让机器人听懂世界——从语音识别到环境声音分离到声学定位。这是具身感知里最被低估的一块,但所有家务机器人都需要它。


Primer · 入门 3 篇

先读这三篇

Whisper 用 68 万小时弱标注做 ASR → AudioLM 把音频建模成 token 序列 → Acoustic Swarms 用一群麦克风分离声源。

  1. 1
    Robust Speech Recognition via Large-Scale Weak Supervision 2023 · ICML · ⭐⭐⭐

    Whisper 用互联网上 68 万小时的弱标注(音频 + 自动/人工字幕)数据,喂进标准 Encoder-Decoder Transformer,训出一个多语种多任务语音模型。不微调直接用(zero-shot),在 12 个分布外数据集上平均 WER 比 Wav2Vec 2.0

  2. 2
    AudioLM 2023 · TASLP · ⭐⭐⭐⭐

    Google AudioLM 把波形变成 两套离散 token——w2v-BERT 语义 token(25 Hz) 管长程内容,SoundStream 声学 token(50 Hz×12 层 RVQ) 管高保真音色——再用 三个 0.3B Transformer 分阶段自回归续写

  3. 3
    Creating speech zones with self-distributing acoustic swarms 2023 · Nature · ⭐⭐⭐

    七个骰子大小的小机器人,从充电底座自己爬上桌子、散成一圈,靠互相"喊一嗓子"算出各自的精确坐标,然后联手把桌旁几个同时说话的人一一分清——谁在哪、说了啥,全部搞定。整个过程不需要头顶装摄像头、不需要人手摆放、不需要扯一根线。


Distribution · 年份分布

2019 到 2024,15 篇怎么排开。

祖师爷 经典 前沿
All papers · 按 era 排

Auditory & Acoustic 全部 15 篇。

erayeartitlevenue
前沿 2024 Proactive Hearing Assistants that Isolate Egocentric Conversations UIST
经典 2024 NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators MobiCom
祖师爷 2023 Creating speech zones with self-distributing acoustic swarms Nature
祖师爷 2019 Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation IEEE/ACM TASLP
祖师爷 2022 SoundStream: An End-to-End Neural Audio Codec IEEE/ACM TASLP
经典 2020 Conformer Interspeech
经典 2020 Dual-path RNN ICASSP
经典 2021 Meta-StyleSpeech ICML
经典 2023 AudioLM TASLP
经典 2023 EnCodec TMLR
经典 2023 MusicLM arXiv
经典 2023 Robust Speech Recognition via Large-Scale Weak Supervision ICML
前沿 2023 SeamlessM4T arXiv
前沿 2024 Stable Audio ICML
前沿 2024 Universal Source Separation with Weakly Labelled Data TASLP