Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 67

AudioPaLM

24 min read · 8421 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过语音识别、语音翻译、token 化"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 conformer 笔记理解语音识别基础。

一句话讲什么(TL;DR)

现在最强的文本大模型(如 PaLM-2)会读会写,但"听不见、不会说"。AudioPaLM 的想法很直接:把语音也切成一个个"词元(token)",塞进文本大模型的词表里,让同一个模型既能吃文字又能吃声音、既能吐文字又能吐声音。这样一个模型就能同时做语音识别、语音翻译、语音到语音翻译、文字转语音。因为底座是文本大模型,它还能把从海量文本里学到的翻译/常识知识"迁移"到语音任务上。结果:语音翻译刷新 SOTA(CoVoST2 BLEU 37.8 vs Whisper 29.1),还能零样本翻译训练时没见过的语言对,甚至能在翻译时保留你原来的嗓音

所以这一节是想说:AudioPaLM 的核心就一句话——把语音 token 化后并入文本 LLM 的词表,用一个模型统一"说、听、翻译",还能白蹭文本模型的语言知识。


这是个什么场景

想象一个真正好用的实时翻译器:你说中文,它直接用你自己的声音说出英文。这需要一连串能力——听懂你说什么(语音识别 ASR)、翻译成英文(机器翻译 MT)、再用语音说出来(文字转语音 TTS),最好还保留你的音色、语气。

传统做法是把这三步用三个独立模型串起来(级联):ASR → MT → TTS。问题一堆:

  • 只关注文字,丢了副语言信息:语气、音色、情感在第一步转成文字时就没了,输出是机器音。
  • 误差累积:ASR 错一个词,MT 和 TTS 跟着错,越串越歪。
  • 三个模型难协同:各训各的,接口处信息丢失,还慢。

而另一边,文本大模型(LLM)已经强到能做开放域问答、少样本翻译——但它们只活在文字世界,听不见也不会说

AudioPaLM 要解的题:能不能让一个模型同时会"说、听、翻译",把语音和文字统一处理,还能把文本大模型积累的语言知识用到语音上?

所以这一节是想说:实时语音翻译等任务需要"说听译"一体,但传统级联丢信息、累积误差,而强大的文本 LLM 又听不见——AudioPaLM 要把两者打通。


AudioPaLM — 场景示意:这论文要解决的现实问题
Plate Nº IAudioPaLM — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:级联系统(ASR → MT → TTS) 三个独立模型串起来。类比:三个不通气的部门接力办事。问题:转文字时丢副语言信息(音色、语气)、误差层层累积、计算重、专名/非语言内容处理差。

  • 方案 B:直接语音到语音翻译(Translatotron 等) 端到端在音频频谱域上翻译,不经文字。类比:一个人直接听着翻着说。问题:能保留声学信息,但难以借力海量文本数据,翻译质量和覆盖语言有限。

  • 方案 C:编码器-解码器多模态(Whisper、Flamingo、PaLI) 拿一个音频/视觉编码器 + 一个文本解码器拼起来(用适配层或单独编码器)。类比:给会写字的人配一副助听器。问题:解码器只能输出文字——因为解码器是纯文本的,模型没法原生生成语音。

  • 方案 D:语音语言模型(AudioLM、SPEAR-TTS、SpeechLM) AudioLM 用分层 token(语义 token + 声学 token)建模语音,能生成逼真语音;SPEAR-TTS 加文本编码器做 TTS;SpeechLM 用文本 LLM 权重初始化语音生成器。问题:它们的文本词表和语音词表大多分开建模、互不相通(SPEAR-TTS 的文本和语义 token 是两套),或者干脆用语音 token 替换掉文本词表(SpeechLM 就不再是多模态了)。没有真正把文字和语音统一进一套可互换的词表。

  • 核心难题:怎么把文字和语音统一成一套词表、一个 decoder-only 模型,既能自由地在语音↔文字间映射(做 ASR/TTS/AST/S2ST),又能用文本预训练来初始化、白蹭文本知识?

所以这一节是想说:级联丢信息、直接 S2ST 借不到文本、编解码器只能出文字、语音 LM 又不统一词表——缺一个"文字语音同词表、一个模型全包"的方案。


这篇论文的新想法

类比:文本 LLM 是个只认字的人。与其给它外接一个"翻译耳机+扬声器"(编解码器方案),AudioPaLM 干脆教它把声音也当成一种"字"来认——在它原有的字典后面,续上一批"声音字"。

AudioPaLM 的核心判断:对模型来说,文字和音频都只是"一串整数(token)"。既然如此,把音频 token 和文本 token 合成一套联合词表,就能用同一个 decoder-only 模型统一处理。

三个关键设计:

  1. 联合词表:把语音离散化成有限的音频 token,和文本的 SentencePiece token 合并成一套多模态词表。文字和语音在模型眼里没有本质区别,都是整数序列。

  2. 从文本 LLM 初始化:架构就是一个大 Transformer decoder,所以可以直接用 PaLM / PaLM-2 的预训练权重初始化——只需在 embedding 矩阵后面加几行给音频 token。这样模型能白蹭文本预训练里的语言知识和翻译能力(实验证明 PaLM-2 更强的翻译能力直接迁移到了语音翻译)。

  3. 用文本标签表达任务:不引入特殊 token,而是用普通文字标签前缀告诉模型做什么,如 [ASR French](识别法语)、[TTS English](英语合成)、[S2ST English French](英译法语音到语音)。甚至能用"组合任务"(如 [ASR AST S2ST English French])让模型先输出中间步骤——类似思维链。

【级联 / 编解码器 vs AudioPaLM 统一词表】

旧级联:  ASR ─▶ MT ─▶ TTS  (三部门接力,丢音色、误差累积)
旧编解码器:音频编码器 + 纯文本解码器  (只能"出文字")

AudioPaLM:文本token ∪ 音频token = 一套联合词表
   ┌ 用 PaLM-2 权重初始化(白蹭文本知识 / 翻译能力)
   │ 一个 decoder-only Transformer
   └ 用文字标签表达任务:[ASR French] / [TTS English] / [S2ST English French]
   ─▶ 同一模型统一 说/听/译 (ASR·TTS·AST·S2ST·MT)

所以这一节是想说:AudioPaLM 把语音 token 并入文本词表、用文本 LLM 权重初始化、用文字标签表达任务——三招让一个 decoder-only 模型统一了说、听、译。


它分几步做的(方法)

AudioPaLM 就是一个 decoder-only Transformer,吃"文字+音频"混合 token 序列,吐文字或音频 token。整体流程:

原始语音 ─▶ [音频tokenizer: w2v-BERT/USM] ─▶ 音频token(25Hz, 词表1024)
文本 ─▶ [SentencePiece] ─▶ 文本token
                    │
   联合词表 = 文本token ∪ 音频token
                    │
   [任务标签] + 混合token序列
                    ▼
   Decoder-only Transformer(用PaLM-2权重初始化, embedding矩阵扩了音频行)
                    │
       ┌────────────┴────────────┐
       ▼(文本token)              ▼(音频token)
   文本detokenizer          AudioLM stage2+3 或 SoundStorm
       │                        │
    输出文字                 SoundStream解码 → 原始语音波形

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 音频 token 化:把声音切成"声音字"

类比:把连续的声波像切香肠一样切成一段段,再给每段贴一个编号。

输入:原始语音波形。

处理:先用一个语音表示模型提特征,再离散化成有限的音频 token。论文试了三种 tokenizer——

  • w2v-BERT:沿用 AudioLM 的做法但两处改动(用多语言版 w2v-BERT;不做 embedding 归一化,因为多语言下归一化反而掉性能)。产 token 速率 25Hz,词表 1024。
  • USM-v1:换成更强的 Universal Speech Model(2B 参数多语言语音编码器),取中间层特征。同样 25Hz、词表 1024。
  • USM-v2:在 USM 基础上用一个辅助 ASR 损失训练量化器,进一步微调提升多语言性能。这是最终最优选择。

输出:一串音频 token(长度正比于音频时长)。估算约 6-8 个音频 token 对应 1 个文本 token。

小结:用 w2v-BERT/USM 把语音离散成 25Hz、词表 1024 的音频 token,其中带 ASR 辅助损失的 USM-v2 最好——token 质量直接决定上限。

5.2 改造文本解码器:让它也认音频 token

类比:给一本只收录汉字的字典,在最后续上一批"声音字",其他啥都不改。

输入:预训练的纯文本 decoder(PaLM / PaLM-2)。

处理:Transformer decoder 里,输入端的 token embedding 矩阵 E 是 t×m(t 个 token、每个 m 维),输出端 softmax 层用 E′ 算 logits。PaLM 里这两个矩阵共享(E′ = Eᵀ)。decoder 其余部分完全不管词表大小。所以只需一处改动:把 E 从 t×m 扩成 (t+a)×m(a 是音频 token 数)。前 t 行是原文本 token(可复用预训练权重),后 a 行是新音频 token(随机初始化,从头训)。实验发现必须训练全部参数,不能冻结原权重(这点和 Flamingo 冻结大部分权重不同)。

输出:一个能同时建模文字和音频 token 的 decoder-only 模型。

小结:只把 embedding 矩阵加几行给音频 token、其余架构不动,就把文本 LLM 变成多模态模型——简单到令人意外,但要全参数微调。

5.3 把音频 token 解码回声音

类比:模型吐出的是"声音字编号",还得请一个"发声器"把编号还原成真实声波。

输入:模型输出的音频 token + 一段声音条件(voice conditioning)。

处理:两种方式——

  • AudioLM stage 2+3(自回归):stage 2 是个 decoder-only Transformer,吃音频 token + 声音条件,生成低比特率的 SoundStream token;stage 3 重建 SoundStream 残差矢量量化的更高层,提比特率、提音质。
  • SoundStorm(非自回归):并行地对所有 token 迭代生成,音质与 AudioLM 相当,但声音/声学条件一致性更好、快两个数量级。 两种最后都把音频 token 转成 SoundStream token,再用卷积解码器还原波形。声音条件是一段 3 秒语音样本(不足 3 秒就重复)——把原语音的一部分当条件,模型翻译到别的语言时就能保留原说话人的嗓音

输出:目标语言的语音波形(保留原音色)。

小结:用 AudioLM 或更快的 SoundStorm 把音频 token 还原成波形,配 3 秒声音条件实现跨语言音色保留。

5.4 训练任务与组合任务

类比:用同一个学生同时练"听写、翻译、朗读",还教他"复杂题先写中间步骤"。

输入:语音-文本数据集(含音频、转录、翻译音频、翻译转录等字段)。

处理:任务包括 ASR(音频→转录)、AST(音频→翻译文字)、S2ST(音频→翻译音频)、TTS(文字→音频)、MT(文字→翻译文字)。用文字标签指定任务([ASR French] 等),语言名写进标签对低资源语言有益。关键技巧:

  • 多任务混训:同一份数据同时用作 ASR 和 AST 能互相提升。
  • 组合任务:让模型对复杂任务先输出中间步骤(如先 ASR 出英文、再 AST 出法文、再 S2ST 出法语音),用一次自回归解码完成(不是分开调用),所以每步都能看到输入音频和之前所有输出——比级联管道信息更全。类似思维链。

输出:一个能做所有语音-文本任务的统一模型。用 Adafactor、学习率 5e-5、dropout 0.1、输入端 loss masking 微调。

小结:用文字标签统一表达所有任务,多任务混训 + 组合任务(思维链式)让一个模型全包,且信息不像级联那样在接口处丢失。

5.5 为什么"统一词表 + 文本初始化"是关键

  • 统一词表 = 一个模型全包:文字和语音同为整数序列,一套词表就能自由映射语音↔文字,训练一次搞定所有任务,不用异构模型拼接。
  • 文本初始化 = 白蹭语言知识:从 PaLM-2 初始化,把海量文本里学的翻译、常识直接迁移到语音——实验证明 PaLM-2 更强的文本翻译能力立刻转化成更强的语音翻译,甚至零样本翻译没见过的语言对。
  • 端到端能看全上下文:组合任务里,解码翻译文字时能回看输入音频(含语气等副语言信息),这是级联管道做不到的。
  • 音频 token 化 = 原生能说:因为语音也是 token,模型能原生输出音频(不像编解码器方案只能出文字),从而做 S2ST 并保留音色。

小结:统一词表管"一个模型全包"、文本初始化管"白蹭语言知识"、端到端管"看全上下文"、token 化管"原生能说"——四者叠起来才是 AudioPaLM。

5.6 零样本翻译:训练没见过的语言对也能译

类比:一个人在课上只练过"英译法、英译德",但因为他本来就懂西班牙语和法语,考试遇到"西译法"竟也能直接上手——因为底层的语言知识是相通的。

输入:一个训练时没有出现过的语音翻译方向(源语言→目标语言的组合在训练数据里从未配对过)。

处理:因为模型从 PaLM-2 初始化、又用统一词表把语音和文本知识打通,它把"翻译"这件事学成了一种可迁移的通用能力,而不是死记每一个语言对。于是即便某个语言方向在语音训练数据里从没成对出现过,模型也能借助文本预训练里学到的该语言知识,把语音**零样本(zero-shot)**翻译过去。这大大缓解了语音翻译数据稀缺、语言对覆盖不全的老大难问题——不必为每个语言组合都单独采配对数据。

输出:对未见语言对也能给出可用的语音/文本翻译。

小结:靠文本预训练 + 统一词表,AudioPaLM 把翻译学成可迁移的通用能力,能对训练没见过的语言对做零样本语音翻译,绕开配对数据稀缺的瓶颈。


AudioPaLM — 方法示意:核心 pipeline
Plate Nº IIAudioPaLM — 方法示意:核心 pipeline

关键数字(What works)

数字来自原文,重点看"统一模型 + 文本初始化"到底值多少。

数字 1:顶级结果(AST/S2ST/ASR)

模型 CoVoST2 AST BLEU↑ CVSS S2ST BLEU↑ VoxPopuli ASR WER↓
Whisper Large-v2 1.5B 29.1 13.6
mSLAM-CTC 2B 25.2 9.1
MAESTRO 600M 25.2 8.1
USM-M 30.7
AudioPaLM 8B AST 35.4 11.1
AudioPaLM 8B S2ST 36.2 32.5 16.0
AudioPaLM-2 8B AST 37.8 9.8
AudioPaLM-2 级联 ASR+翻译 39.0

关键含义:语音翻译(AST)刷新 SOTA(37.8 vs Whisper 29.1),S2ST 也大幅领先;ASR 有竞争力(不是最好,因为要兼顾生成语音的能力)。

数字 2:零样本 AST(FLEURS,训练时没见过 FLEURS)

模型 AST-已见语言 BLEU 仅ASR-已见语言 BLEU(零样本翻译)
Whisper Large-v2 1.5B 23.3 19.6(注:非零样本,见过 AST 数据)
AudioPaLM 8B AST 22.4 10.0
AudioPaLM-2 8B AST 28.6 20.7

关键含义:AudioPaLM-2 能零样本翻译只见过 ASR 数据、没见过任何翻译数据的语言对。从 AudioPaLM 升到 AudioPaLM-2,AST-已见语言涨 28%、仅ASR-已见涨 107%——证明文本模型的翻译能力直接迁移到了语音。

数字 3:生成语音质量与音色保留(CVSS-T,MOS 1-5,越高越好)

系统 音质(主观MOS) 音色相似(主观) 声学一致(客观)
CVSS-T 真值合成 3.88 3.70 0.54
Translatotron 2 3.96 3.51 0.44
AudioPaLM 4.44 4.00 0.81

关键含义:AudioPaLM 生成的语音,音质和音色相似度都超过基线,甚至超过数据集里的真值合成音——跨语言翻译时能高质量保留原说话人嗓音。

数字 4:关键消融(CoVoST2)

消融 设置 结果
多任务 仅 AST → AST+ASR BLEU 16.0 → 18.5
初始化 8B 从头训 → 8B 微调 PaLM AST BLEU 6.9 → 18.4
tokenizer w2v-BERT / USM-v1 / USM-v2 AST BLEU 15.2 / 18.5 / 26.9
组合任务 直接 → 组合(USM-v2) AST BLEU 26.9 → 30.5
解码器 AudioLM → SoundStorm S2ST BLEU 31.2 → 32.5
模型规模 128M / 1B / 8B AST BLEU 18.3 / 31.6 / 37.8

关键含义:每一招都实打实有效——微调预训练模型(6.9→18.4)和好的 tokenizer(15.2→26.9)影响最大;1B 模型就已超过 Whisper 1.5B 超 5 个 BLEU。

所以这一节是想说:数字全面证明——语音翻译刷新 SOTA、能零样本翻译、能保留音色,且文本初始化、好 tokenizer、组合任务、规模化每一项都关键。


实验结果说明了什么

问题一:从文本 LLM 初始化到底有多重要? 决定性重要。消融显示:8B 模型从头训 AST 只有 6.9 BLEU,微调 PaLM 权重直接到 18.4——差近三倍。这说明模型能把文本预训练里的语言知识"迁移"到全新的音频输入上,即便音频 token 是模型从没见过的全新 embedding。更进一步,用更强的 PaLM-2(比 PaLM 多了并行翻译数据)替换 PaLM,语音翻译立刻更好,零样本翻译能力尤其突出——文本能力直接变成语音能力。

问题二:能零样本翻译没训过的语言对吗? 能。FLEURS 上,对于只见过 ASR 数据(没见过任何翻译数据)的语言对,AudioPaLM-2 仍能翻译,且超过见过这些语言 AST 数据的 Whisper。这是因为翻译能力来自文本底座 PaLM-2——它在文本上学会了翻译,这个能力自动泛化到语音输入。这是级联和纯语音模型都难做到的。

问题三:token 化方案有多关键? 非常关键。消融显示 w2v-BERT→USM-v1→USM-v2,AST BLEU 从 15.2 一路涨到 26.9。因为模型只能接触到 tokenizer 捕获的信息——tokenizer 丢了什么、以什么形式呈现,直接决定模型能学到什么。带 ASR 辅助损失的 USM-v2 最好。论文也坦言音频 token 化仍是不成熟的研究领域。

问题四:"组合任务"(先出中间步骤)为什么有用? 类似思维链——让模型把复杂任务拆成简单步骤先输出,AST BLEU 从 26.9 涨到 30.5。注意这不是退化成级联管道:模型是一次自回归解码,每步都能回看输入音频和之前所有输出。所以解码翻译文字时能利用输入音频里的韵律信息,这对 S2ST 保留语气尤其重要。代价是 ASR 略降(可能与"按 AST 指标选 checkpoint"有关)。

所以这一节是想说:实验回答了四个问题——文本初始化是命脉、能零样本翻译、token 化决定上限、组合任务像思维链般提升复杂任务。


你应该懂的几个新词

ASR(自动语音识别):把语音转成文字(听写)。AudioPaLM 的基础任务之一。

AST(自动语音翻译):把语音直接翻译成另一种语言的文字。AudioPaLM 刷新 SOTA 的任务。

S2ST(语音到语音翻译):把一种语言的语音翻译成另一种语言的语音。AudioPaLM 的旗舰能力(还能保音色)。

TTS(文字转语音)/ MT(机器翻译):文字→语音、文字→翻译文字。也被统一进来。

token(词元):模型眼里的基本单位。AudioPaLM 把文字和语音都变成 token。

联合词表(joint vocabulary):文本 token + 音频 token 合成的一套词表。AudioPaLM 的核心。

decoder-only Transformer:只有解码器的自回归模型(GPT、PaLM 都是)。AudioPaLM 的架构。

音频 token 化(audio tokenization):把连续语音离散成有限的音频 token。用 w2v-BERT / USM 实现。

语义 token vs 声学 token:AudioLM 的分层——语义 token 管语言内容(自监督特征),声学 token 管音质细节(神经编解码)。

SoundStream / SoundStorm / AudioLM:神经音频编解码器 / 快速并行音频生成 / 分层音频语言模型——把音频 token 还原成波形的组件。

voice conditioning(声音条件):一段 3 秒语音样本,让模型翻译时保留原说话人音色。

BLEU / WER / MOS:翻译质量指标 / 词错误率(越低越好)/ 主观音质打分(1-5)。

零样本(zero-shot):训练时没见过该任务/语言对,却能直接做。AudioPaLM 的翻译能力就有此特性。

所以这一节是想说:这些词是读任何"语音 + 大模型 + 翻译"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 强依赖音频 tokenizer 质量:论文明确的局限——因为语音靠 token 化,tokenizer 好坏直接决定上限(消融里 w2v-BERT 15.2 vs USM-v2 26.9 差距巨大)。而音频 token 化本身还是不成熟的研究领域。
  • 必须全参数微调,无法冻结保原能力:不像 Flamingo 冻结大部分权重、保证原组件能力不变,AudioPaLM 需要训练全部参数——意味着可能损失一些原文本模型的纯文本能力,且训练成本高。
  • 加入 S2ST 会拖累纯文字任务:让模型学会输出音频 token(S2ST)后,AST/ASR 会有小幅退化——模型容量要分给音频建模。是能力与专精的权衡。
  • ASR 不是最强:为兼顾生成能力,ASR 上只是"有竞争力",不及 MAESTRO 等专精模型。
  • 生成音频评测基准不成熟:论文坦言相比文本,生成式音频任务的基准和指标还很欠缺,评估困难。
  • 计算/数据成本高:基于 8B PaLM-2 + 海量多语言语音数据,复现门槛高。

所以这一节是想说:AudioPaLM 统一了说听译,但受限于 tokenizer 质量、必须全参微调、S2ST 拖累文字任务、ASR 非最强、生成评测不成熟这些问题。


它和别的论文是什么关系

  • 上游(被它融合/借用)
    • PaLM / PaLM-2(Chowdhery / Anil et al.):文本底座,AudioPaLM 从它初始化,白蹭语言和翻译知识。
    • AudioLM(Borsos et al. 2022):语音语言模型,提供分层音频 token 思路和音频解码(stage 2+3)。
    • SoundStorm(Borsos et al. 2023):更快的并行音频解码器。
    • w2v-BERT / USM(Zhang et al. 2023):音频 tokenizer 的来源。
    • SoundStream(Zeghidour et al. 2021):神经音频编解码器,最终还原波形。
    • T5(Raffel et al.):用文字标签表达任务的思路来源。
  • 对比关系
    • Whisper:Whisper 是编解码器、只能输出文字;AudioPaLM 统一词表、能原生出语音,且翻译更强。
    • Translatotron 2:直接 S2ST,AudioPaLM 音质和音色保留都更好。
    • SPEAR-TTS / SpeechLM:那些词表分离或替换;AudioPaLM 真正统一文字+语音词表。
  • 下游 / 同族:AudioPaLM 属于"用 LLM 统一多模态"这条大线,和视觉侧的 PaLI/Flamingo、以及本仓库的多模态章节同族。它把"token 化 + 并入 LLM 词表"这个范式从图像扩展到了语音。

所以这一节是想说:AudioPaLM 站在 PaLM-2 + AudioLM + USM + SoundStorm 的肩膀上,用"统一词表"范式把语音正式并入大语言模型,是多模态 LLM 在音频方向的关键一步。


和本导读的关系

本笔记对应导读 Ch20:听觉,也与 Ch18:多模态 强相关。

导读 Ch20 讲了机器如何"听"——从语音识别(如 Conformer)到语音生成、语音翻译。AudioPaLM 是这条线上"用大语言模型统一说听译"的集大成者。读完本笔记,建议:先回看 conformer 深读笔记(理解语音识别的声学建模基础,Conformer 是编码器侧的代表),再看 Ch18 多模态章节理解"token 化 + 并入 LLM 词表"这个通用范式(图像用它、语音也用它)。三者连起来,就能看清"从专精语音模型 → 统一多模态 LLM"的演进:Conformer 解决"怎么听清",AudioPaLM 解决"怎么把听、说、译统一进一个会思考的大脑"。

所以这一节是想说:本笔记是导读 Ch20 听觉在"统一多模态 LLM"方向的深度展开,读前先懂 Conformer 的声学建模,读后接多模态章节的 token 化范式。


思考题

以下问题检验你是否真正理解了 AudioPaLM 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:AudioPaLM 的核心洞察是"文字和音频对模型来说都只是一串整数"。这个看似简单的观察,为什么能带来这么大的统一?

提示

因为它把"多模态"这个难题化简成了"扩大词表"这个易题。Transformer decoder 的主体(注意力、前馈层)根本不关心 token 代表什么、词表多大——它只处理整数序列。所以一旦把语音也变成 token,语音就和文字一样能被同一个模型处理,唯一要改的只是 embedding 矩阵加几行。这带来的统一是:(1) 一个模型全包所有语音-文本任务;(2) 能直接复用文本预训练权重;(3) 输入输出可以任意交错文字和音频。这个"万物皆 token"的思路正是多模态 LLM 的核心范式——图像、音频、动作都可以这么并入。深刻之处在于用一个统一抽象消解了模态的边界。

Q2:为什么从文本 LLM 初始化(微调)比从头训练好这么多(AST BLEU 18.4 vs 6.9)?模型明明从没见过音频 token。

提示

因为语音任务的大部分难度在"语言理解和翻译",而这些能力文本 LLM 早已从海量文本里学会了。音频 token 只是给模型一个新的"输入通道",模型要学的只是"把这个新通道对接到已有的语言理解上"——这比"从零学会语言+学会听"容易得多。打个比方:一个精通中英互译的人,学会看手语(新输入方式)比一个婴儿同时学语言和手语快得多。从头训的模型要同时学语言知识和音频建模,数据又远不如文本预训练充分,自然差。这也印证了"迁移学习"的威力:把在数据丰富的领域(文本)学到的能力迁移到数据稀缺的领域(语音)。

Q3:AudioPaLM 用文字标签(如 [ASR French])而不是特殊 token 来表达任务。这个选择有什么好处?

提示

好处是复用文本模型对语言的既有理解。用普通文本 tokenizer 编码 [ASR French],"French" 这个词本身在预训练中就有丰富的语义——模型知道法语是什么、和其他语言的关系。论文发现:把语言名写进标签(vs 用通用的 [ASR])对低资源语言特别有益,因为模型能借用它对该语言的先验知识。而且用人类可读的标签(如"transcribe the following French audio")性能不变——说明模型是在真正理解标签语义,而非记住一个符号。如果用全新的特殊 token,就得从头学这些 token 的含义,白白浪费了文本预训练的知识。这是"让接口也复用预训练知识"的巧妙设计。

Q4:论文说"组合任务不是退化成级联管道"。为什么先输出中间步骤(ASR→AST→S2ST)却不等于级联?

提示

关键在于"一次自回归解码 + 全局注意力"。级联管道是三个独立模型分开调用:ASR 出文字后,MT 模型只看到那段文字,看不到原始音频——原音频里的语气、韵律、专名发音等信息在第一步就永久丢失了。而 AudioPaLM 的组合任务是同一个模型一次解码:当它解码翻译文字或输出音频时,注意力机制能回看输入音频和之前所有输出。所以解码法语音频时,它能参考原英语音频里的韵律来决定语气。这就是"统一模型"相对"级联"的本质优势——信息在整个过程中不丢失,上下文始终可及。组合任务只是显式地让模型写出中间推理(像思维链),但底层仍是一个能看全局的统一模型。

Q5:加入 S2ST 任务后,AST 和 ASR 性能会小幅下降。为什么?这揭示了什么权衡?

提示

因为模型容量是有限的、要重新分配。ASR/AST 只需模型输入音频、输出文字——由于输入端做了 loss masking,模型不需要学会"生成"音频 token 的分布。但 S2ST 要求模型输出音频 token,这是一个全新的、困难的建模任务(要学会音频 token 的序列分布)。当模型必须把一部分容量投入到"学会说话"上,留给"听和译"的容量就相对少了,于是文字任务小幅退化。这揭示了"通用 vs 专精"的经典权衡:一个模型能力越广,每项单独能力可能越难做到极致。实际应用中要根据需求选择——只需翻译文字就用 AST 版,需要输出语音就用 S2ST 版并接受文字任务的小损失。

Q6:消融显示 tokenizer 从 w2v-BERT 换到 USM-v2,AST BLEU 从 15.2 涨到 26.9。为什么 tokenizer 的影响这么大?

提示

因为 tokenizer 是模型接触音频的唯一窗口——模型只能"看到" tokenizer 捕获并编码进 token 的信息,tokenizer 丢掉的东西模型永远拿不回来。如果 tokenizer 把语音编码得语言信息清晰、冗余少、对模型友好,模型就好学;反之则难。USM-v2 用了更强的编码器(2B 参数多语言 USM)且加了辅助 ASR 损失来训量化器,让 token 更好地保留了对识别/翻译有用的语言信息,所以性能大涨。这类似于"数据质量决定模型上限"——这里是"表示质量决定模型上限"。论文也坦言音频 token 化是不成熟的研究领域,是未来重点。这提醒我们:在 token 化的多模态框架里,token 化环节和模型本身同等重要。

Q7:如果让你把 AudioPaLM 的"统一词表"思路扩展到机器人控制(动作),你会怎么做?会遇到什么和语音类似/不同的挑战?

提示

思路:把机器人动作也离散化成"动作 token",并入 LLM 词表,用文字标签表达任务(如 [CONTROL pick up the cup]),从文本/视觉-语言模型初始化,训练模型输出动作 token。这正是 RT-2、OpenVLA 等 VLA 模型做的事(本仓库有笔记)。类似的挑战:(1) 动作 token 化的质量决定上限(和音频 tokenizer 一样关键——怎么把连续动作切成 token 而不丢精度);(2) 从预训练模型初始化能白蹭知识(和文本初始化一样有效)。不同的挑战:(1) 动作是连续、高精度控制信号,量化损失比语音更敏感(差几毫米就抓不住)——这也是为什么有些工作改用扩散/flow 生成连续动作而非离散 token;(2) 动作有实时性和安全约束,语音没有;(3) 动作数据远比语音稀缺,且有具身差异(不同机器人动作空间不同)。核心相通点是"万物皆 token + 复用预训练",核心差异是"控制对精度、实时、安全的要求远高于语音"。

所以这一节是想说:能回答这 7 题,你就真正理解了 AudioPaLM 为什么用统一词表、为什么从文本初始化、为什么用文字标签、组合任务和 tokenizer 为何关键。


一些好奇心问答(FAQ)

Q1:AudioPaLM 和 Whisper 到底差在哪? Whisper 是"音频编码器 + 文本解码器",只能输出文字。AudioPaLM 是统一词表的 decoder-only,能原生输出语音(做 S2ST 并保音色),翻译也更强(BLEU 37.8 vs 29.1)。

Q2:它真能用我的声音说外语吗? 能。给它一段 3 秒你的语音当"声音条件",它翻译到别的语言时会保留你的音色。主观音色相似度 4.00,甚至超过基线和真值合成音。

Q3:为什么语音要切成 25Hz 的 token? 这是 tokenizer(w2v-BERT/USM)的输出速率。约 6-8 个音频 token 对应 1 个文本 token。速率太高序列太长、太低丢信息,25Hz 是个平衡。

Q4:一个模型做这么多任务,会不会样样稀松? 翻译(AST/S2ST)是它最强的、刷新 SOTA。ASR 只是"有竞争力"(为兼顾生成能力有所让步)。所以是"翻译强、识别够用",不是样样稀松,但确实存在通用 vs 专精的权衡。

Q5:AudioLM 和 SoundStorm 选哪个解码? SoundStorm 更好——音质相当但声音一致性更高、快两个数量级,S2ST BLEU 也高 1.3 点(31.2→32.5)。最终结果用的是 SoundStorm。

Q6:为什么要从 PaLM-2 而不是 PaLM 初始化? PaLM-2 用了更好的数据和技巧、还专门训了并行翻译数据。它更强的文本翻译能力直接迁移成更强的语音翻译,零样本翻译尤其明显(仅ASR-已见语言 BLEU 涨 107%)。

所以这一节是想说:AudioPaLM 的实操问题(与 Whisper 区别、音色保留、token 速率、通用性、解码器选择、初始化选择)都有明确答案。


如果你想再深入

按"文本底座 → 语音基础 → tokenizer → 同族"排序:

  1. 文本底座:PaLM-2(Anil et al. 2023) — 理解 AudioPaLM 白蹭的语言/翻译能力从何而来。
  2. 语音语言模型:AudioLM(Borsos et al. 2022) — 分层音频 token 的思想源头和音频解码。
  3. 语音识别基础:Conformer — 声学建模的经典,本仓库有深读笔记,理解"怎么听清"。
  4. tokenizer:USM / SoundStream — 理解音频怎么变成 token、又怎么变回波形。
  5. 快速解码:SoundStorm(Borsos et al. 2023) — 并行音频生成,理解为什么它比 AudioLM 快两个数量级。
  6. 同族范式:RT-2 / OpenVLA — 把"统一词表"思路用到机器人动作,本仓库有相关笔记。

所以这一节是想说:把 PaLM-2 + AudioLM + Conformer + USM 连起来读,就能看清"从专精语音模型到统一多模态 LLM"的完整技术脉络。


原文信息

BibTeX

@article{rubenstein2023audiopalm,
  title   = {AudioPaLM: A Large Language Model That Can Speak and Listen},
  author  = {Rubenstein, Paul K. and Asawaroengchai, Chulayuth and Nguyen, Duc Dung and Bapna, Ankur and Borsos, Zal{\'a}n and de Chaumont Quitry, F{\'e}lix and Chen, Peter and El Badawy, Dalia and Han, Wei and Kharitonov, Eugene and others},
  journal = {arXiv preprint arXiv:2306.12925},
  year    = {2023}
}

链接

所以这一节是想说:这是 Google 2023 年的工作,用"把语音 token 并入文本 LLM 词表"的统一范式,让一个模型学会说、听、译,并刷新了语音翻译 SOTA、实现零样本翻译和音色保留。

引用本笔记 / Cite this note
BibTeX
@online{eai_audiopalm_2026,
  title       = {(readable note) AudioPaLM},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/audiopalm/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?