Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Auditory & Acoustic · Plate Nº 17

Conformer

21 min read · 7405 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过语音识别和 Transformer"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

Transformer 擅长看"全局大局",卷积擅长抠"局部细节",Conformer 把两者塞进同一个模块里——让语音识别既看得远又看得清,用更少的参数刷出了 LibriSpeech 的最好成绩(测试集 word 错误率低到 1.9%/3.9%)。

所以这一节是想说:这篇论文的核心就一句话——把"卷积"和"自注意力"合体,语音识别的全局和局部一起抓。


这是个什么场景

你在嘈杂的咖啡馆听朋友说话。要听懂一句话,你的大脑同时在做两件事:

  1. 抠局部细节:每个音素(p、a、t 这种最小发音单位)的具体发音,靠的是相邻几十毫秒的声音波形——这是"局部"信息。
  2. 联系全局上下文:这个词到底是 "recognize" 还是 "wreck a nice",得联系整句话的语境判断——这是"全局"信息。

自动语音识别(ASR,Automatic Speech Recognition) 就是让机器把一段声音波形转成文字。它面对同样的两难:既要抠清楚每一小段声音是什么音,又要联系长距离上下文判断整句话。

在 Conformer 之前,机器有两派工具,各有偏科:

  • Transformer(自注意力):擅长捕捉"内容相关的全局交互"——任意两个时刻都能直接互相看,看得远。但它抓不好细粒度的局部模式,且要看清局部得堆很多层。
  • CNN(卷积神经网络):擅长用局部感受野逐层抓局部特征(像边缘、形状)。但局部连接的代价是——想抓全局信息就得堆很多层或很多参数。

Conformer 想做的就是:把这两个偏科生的长处合到一个模块里,用更少的参数同时抓好全局和局部。

所以这一节是想说:语音识别要同时抓"每个音的细节"和"整句的语境",而 Transformer 和 CNN 各偏科一头,Conformer 来做合体。


Conformer — 场景示意:这论文要解决的现实问题
Plate Nº IConformer — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:RNN(循环神经网络) ASR 长期的默认选择,能建模时序依赖。类比:一个字一个字顺着听。问题:难并行、训练慢,长距离依赖会衰减。

  • 方案 B:纯 Transformer / Transformer Transducer 用自注意力建模全局。类比:一眼扫全句,任意两词直接连线。问题:抠不好局部细粒度特征(相邻几帧的精细声学模式),要达到高精度往往需要很大模型(论文对比的 Transformer Transducer 用了 139M 参数)。

  • 方案 C:纯 CNN(QuartzNet、Jasper、ContextNet) 用卷积逐层抓局部。类比:拿放大镜一小段一小段看。问题:抓全局要堆很多层。ContextNet 想补救,往每个残差块里塞 squeeze-and-excitation 模块抓长上下文,但那只是对整段做个全局平均,抓不到"动态的全局上下文"。

  • 方案 D:把卷积和注意力拼一起(早期尝试) 已有工作(如 Lite Transformer)把输入分成两个并行分支(自注意力 + 卷积),输出拼接。类比:两个专家各看一遍再合并意见。问题:这些主要针对机器翻译/移动端,且并行拼接的方式在语音上不是最优。

  • 核心难题:怎么把卷积和自注意力有机地组织在一起(而不是简单并行),让全局和局部信息在参数高效的前提下深度融合?

所以这一节是想说:前人要么偏全局(Transformer)、要么偏局部(CNN)、要么拼得不够巧(并行分支),缺一个把两者深度合体的架构。


这篇论文的新想法

类比:想象一个"三明治"结构。中间夹着"望远镜"(自注意力,看全局)和"放大镜"(卷积,看局部),上下各垫一片"面包"(前馈网络,做特征变换)。这就是 Conformer 块(Conformer block)。

Conformer 的核心创新是一个新的编码器基本块,把四个模块按特定顺序堆起来:

前馈模块 → 自注意力模块 → 卷积模块 → 前馈模块

关键的三个设计判断:

  1. 卷积放在自注意力之后(不是之前,也不是并行)——论文实验证明这个顺序对语音最好。直觉:先用注意力抓全局语境,再用卷积在这个语境上精修局部。
  2. 两片前馈"面包"用半步残差夹住中间(借鉴 Macaron-Net)——不是 Transformer 那样只在注意力后放一个前馈,而是前后各放一个"半量"前馈。
  3. 自注意力用相对位置编码(借鉴 Transformer-XL)——让模型对不同长度的语音更鲁棒。

合起来,Conformer 让"看得远"和"看得清"在同一个块里深度交织,而不是浅浅地并排。

【偏科 vs 合体】

纯 Transformer:全局强 / 局部弱(要高精度需大模型, 对比用 139M)
纯 CNN:       局部强 / 全局弱(抓全局要堆很多层)
早期拼接:     自注意力 ‖ 卷积 (并行两分支再拼接, 语音上不最优)

Conformer 块(三明治, 深度交织):
  ½前馈(面包)
     → 自注意力(望远镜/全局, 用相对位置编码)
     → 卷积(放大镜/局部, 放在注意力"之后")
     → ½前馈(面包)
     → LayerNorm
  参数更省, 全局 + 局部在同一块内融合

所以这一节是想说:把自注意力(全局)和卷积(局部)夹在两片 Macaron 前馈之间,卷积放在注意力之后——这个"三明治"块就是 Conformer 的全部创新。


它分几步做的(方法)

Conformer 编码器的整体结构:

声音波形 → 80维滤波器组特征
   │
   ▼ 卷积下采样层 (subsampling)
   │
   ▼ ┌───────── Conformer Block × N ─────────┐
     │  ½ FFN → MHSA → Conv → ½ FFN → LayerNorm │  (Macaron三明治)
     └────────────────────────────────────────┘
   │
   ▼ 单层 LSTM 解码器 (Transducer)
   │
   ▼ 文字

下面逐个模块拆开,每个按"输入 → 处理 → 输出"讲清楚。

5.1 输入前端:滤波器组特征 + 卷积下采样

输入:原始语音波形。

处理:提取 80 通道的滤波器组(filterbank)特征——用 25ms 的窗口、10ms 的步长(stride)计算。这相当于把声音切成一帧帧的"频谱切片",每帧 80 个数字描述各频段的能量。再加数据增强 SpecAugment(掩码参数 F=27,10 个时间掩码,最大时间掩码比例 pS=0.05)——随机遮住一些频段/时段,逼模型别死记硬背。然后过一个卷积下采样层,减少序列长度。

输出:一串下采样后的特征向量,喂给 Conformer 块。

小结:把波形变成频谱帧、做数据增强、下采样,为主干做好准备。

5.2 前馈模块(FFN):Macaron 式半步残差

类比:面包片——对每个位置的特征做一次"深加工"。

输入 → 处理 → 输出:标准 Transformer 前馈是"线性层 → 激活 → 线性层"。Conformer 的前馈用pre-norm 残差 + Swish 激活 + dropout,第一层线性用 4 倍扩展因子(先放大再压回)。关键区别:Conformer 有两个前馈模块,分别在注意力前后,且各用半步残差(residual 权重 ×½)——这是 Macaron-Net 的思路,把 Transformer 里那一个前馈拆成两个半量的夹在两头。

为什么:消融实验证明,两个半步 Macaron 前馈比单个前馈(同参数量)效果更好。

小结:前后两片半量前馈"面包"夹住中间,比单片前馈更强。

5.3 多头自注意力模块(MHSA):相对位置编码

类比:望远镜——让每个时刻直接看到序列里任意其他时刻。

输入 → 处理 → 输出:多头自注意力让每个时间帧根据"内容相关性"去关注序列里所有其他帧,捕捉全局依赖。关键改进:借用 Transformer-XL 的相对正弦位置编码——不编码"绝对第几帧",而是编码"两帧相隔多远"。这让编码器对不同长度的语音(utterance)更鲁棒。用 pre-norm 残差 + dropout 稳定深层训练。

为什么相对位置:语音长度千变万化,绝对位置编码在长度变化时泛化差;相对位置只关心"隔多远",更稳。

小结:自注意力抓全局,配相对位置编码让它对语音长度变化更鲁棒。

5.4 卷积模块(Conv):门控 + 深度卷积

类比:放大镜——在全局语境上精修局部细节。

输入 → 处理 → 输出:卷积模块的内部顺序是——

  1. LayerNorm;
  2. 逐点卷积(pointwise conv)扩展 2 倍通道 + GLU(门控线性单元)激活——门控机制让模型自己决定哪些信息通过;
  3. 一层 1D 深度卷积(depthwise conv)——每个通道独立做卷积,参数少;
  4. BatchNorm(帮助训练深层模型);
  5. Swish 激活
  6. 逐点卷积 + dropout。

深度卷积的核大小经过扫描({3,7,17,32,65}),32 最优(太大反而变差)。

为什么:这个模块专门抓相邻帧的局部声学模式,是 Conformer 相对纯 Transformer 的最大增益来源(见消融)。

小结:门控 + 1D 深度卷积(核 32)+ BatchNorm,专抓局部声学细节。

5.5 Conformer 块的合体公式

类比:把三明治压紧。对输入 x_i,一个 Conformer 块的输出 y_i 是:

  • x̃ = x + ½·FFN(x)(第一片半量面包)
  • x' = x̃ + MHSA(x̃)(望远镜)
  • x'' = x' + Conv(x')(放大镜)
  • y = LayerNorm(x'' + ½·FFN(x''))(第二片半量面包 + 收尾归一化)

人话:"先做半量前馈加工,再全局注意力,再局部卷积,最后再来半量前馈,收尾归一化"。四个模块全用残差连接,梯度好传。

解码器:所有模型都用单层 LSTM 解码器(Transducer 架构,RNN-T loss)。

训练配置:Adam(β1=0.9, β2=0.98, ε=1e-9),Transformer 学习率调度(10k 预热步,峰值 0.05/√d),dropout 0.1,L2 正则 1e-6。可选外接语言模型:3 层 LSTM、宽度 4096、词级困惑度 63.9。

小结:四模块残差堆叠成块、Macaron 半步残差夹心、单层 LSTM 解码——这就是完整的 Conformer。

5.6 三种尺寸:同一块怎么堆成大中小三档

类比:同一份三明治配方,可以做成小份、中份、大份——面包和配料一样,只是层数和厚度不同。

输入 → 处理 → 输出:Conformer 用完全相同的块结构,靠调三个旋钮堆出三个规模(论文的 S/M/L):

  • Conformer(S):约 10.3M 参数——16 个编码器块、编码器维度 144、注意力头 4、卷积核 32、解码器单层 LSTM 维度 320。
  • Conformer(M):约 30.7M 参数——16 个块、维度 256、4 个头、卷积核 32、解码器维度 640。
  • Conformer(L):约 118.8M 参数——17 个块、维度 512、8 个头、卷积核 32、解码器维度 640。

三档的关键差异只有"块的宽度(维度)、注意力头数、块数",卷积核统一取扫描出的最优值 32。注意即使最大的 L 模型,也只有 118.8M 参数,却能打过 139M 的 Transformer Transducer——这就是"深度融合全局与局部"带来的参数效率

正则化怎么配:因为语音数据相对有限、模型又深,Conformer 叠了多重正则化防过拟合——每个残差单元里的 dropout(0.1)权重衰减(L2,1e-6)、以及训练中给权重加的 variational noise(变分噪声),再配上前端的 SpecAugment 数据增强。这套组合让大模型也能稳定训练不塌。

输出:一个可按算力预算选档(S/M/L)的编码器家族,块结构不变、只缩放规模。

小结:Conformer 用同一块结构、只调"宽度/头数/层数"就堆出 S/M/L 三档,配多重正则化,实现了从 10M 到 119M 的参数高效家族。

5.7 解码器与语言模型融合:把声学和语言拼起来

类比:Conformer 编码器是"耳朵",负责把声音听成一串富含信息的特征;但要真正吐出通顺的文字,还得配一张"嘴"(解码器),必要时再请一位"语文老师"(语言模型)帮忙润色。

输入:编码器输出的一串声学特征。

处理:Conformer 用 Transducer(RNN-T) 框架把编码器和解码器接起来——解码器只用一层 LSTM(论文特意验证:即便解码器这么小,性能也几乎不掉,说明强大的编码器才是关键,把复杂度都压在了编码器侧)。训练用 RNN-T 损失,它天然支持流式(streaming)识别,不必等整句说完才出字。为进一步降低词错误率,还可以做语言模型浅融合(shallow fusion):外接一个在 LibriSpeech 语言模型语料上训练的 3 层 LSTM 语言模型(宽度 4096),在解码打分时把声学得分和语言模型得分加权相加,让输出更符合语言习惯。实验里,加了 LM 的版本在各档模型上都进一步压低了 WER。

输出:最终的识别文字(可选地经语言模型润色)。

为什么解码器可以这么小:因为 Conformer 编码器已经把全局语境和局部细节都编码得很充分,"理解"这一步基本在编码器完成,解码器只需做轻量的序列输出,所以单层 LSTM 就够——这也是 Conformer 参数效率高的另一面。

小结:Conformer 用 RNN-T 框架 + 单层 LSTM 解码器(支持流式),必要时再浅融合一个 3 层 LSTM 语言模型进一步降 WER;解码器能做得极小,正因为强大的编码器已把理解这步做足。


Conformer — 方法示意:核心 pipeline
Plate Nº IIConformer — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们告诉你"合体到底值多少、哪个部件最关键"。

数字 1:三个尺寸模型 vs 前人(LibriSpeech WER%)

模型 参数量 无 LM (clean/other) 有 LM (clean/other)
Conformer(S) 10.3M 2.7 / 6.3 2.1 / 5.0
Conformer(M) 30.7M 2.3 / 5.0 2.0 / 4.3
Conformer(L) 118.8M 2.1 / 4.3 1.9 / 3.9
Transducer Transformer 139M 2.4 / 5.6 2.0 / 4.6
ContextNet(L) 112.7M 2.1 / 4.6 1.9 / 4.1

关键含义:参数效率极高——30.7M 的 Conformer(M) 就超过了 139M 的 Transformer Transducer;118.8M 的大模型达到 1.9%/3.9%,刷新 SOTA。WER(word error rate,词错误率)越低越好。

数字 2:拆解 Conformer——哪个部件最关键(test-other WER%,无 LM)

架构变体 test-other
完整 Conformer 4.3
Swish 换 ReLU 4.5
去掉卷积块 4.9
去掉卷积块 + Macaron 5.0
再去掉相对位置编码 5.6

关键含义:卷积模块是最重要的部件(去掉后 4.3→4.9);Macaron 前馈和相对位置编码也都各有贡献。这直接证明了"给 Transformer 加卷积"是核心增益。

数字 3:卷积和注意力怎么组合(dev-clean/dev-other WER%)

组合方式 dev-clean / dev-other
Conformer(卷积在注意力后) 1.9 / 4.4
深度卷积换轻量卷积 2.0 / 4.8
卷积放在注意力前 1.9 / 4.5
注意力与卷积并行拼接 2.0 / 4.9

关键含义:卷积放在自注意力之后最好,且深度卷积优于轻量卷积,串行优于并行。

数字 4:超参扫描

超参 结论
注意力头数 从 4 增到 16 提升(尤其 dev-other)
卷积核大小 {3,7,17,32,65} 中 32 最优,65 变差
数据集 LibriSpeech,970 小时标注语音 + 800M 词文本
特征 80 通道滤波器组,25ms 窗,10ms 步长

所以这一节是想说:数字证明三件事——参数效率极高、卷积模块是灵魂、组合方式(卷积在后、深度卷积、核 32)都有实验支撑。


实验结果说明了什么

问题一:把卷积加进 Transformer,到底带来多少提升? 消融给出了明确答案:从完整 Conformer 到去掉卷积块,test-other 从 4.3% 涨到 4.9%——卷积是所有改动里贡献最大的。这验证了核心假设:Transformer 的全局建模缺了局部细粒度特征,卷积正好补上。

问题二:为什么参数效率这么高? 因为全局和局部信息在同一个块里深度融合,而不是靠堆层数硬凑。纯 CNN 要抓全局得堆很多层,纯 Transformer 要抓局部也得堆;Conformer 一个块同时干两件事,所以 30.7M 就能打赢 139M。这是"架构设计"胜过"暴力堆参数"的经典案例。

问题三:组件的排列顺序真的重要吗? 重要。卷积放在注意力之后(4.4)比放在之前(4.5)好,比并行拼接(4.9)好很多。直觉:先让注意力建立全局语境,卷积再在这个"已经理解了大局"的表示上精修局部,比反过来或各干各的更合理。

问题四:小模型也能受益吗? 能。10.3M 的 Conformer(S) 在 test-other 上比同尺寸的 ContextNet(S) 好 0.7%。说明这套设计不是靠大模型才成立,小模型上同样有效——这对移动端/边缘部署很重要。

所以这一节是想说:实验系统回答了四个问题——卷积是灵魂、参数效率来自深度融合、排列顺序重要、大小模型都受益。


你应该懂的几个新词

ASR(自动语音识别):把语音波形转成文字的任务。Conformer 是它的一个编码器架构。

WER(词错误率,Word Error Rate):ASR 的核心评测指标——识别文本相对正确文本的错误比例(插入+删除+替换)。越低越好。

Transformer / 自注意力(self-attention):让序列里任意两个位置直接互相关注的机制,擅长全局长距离依赖。

CNN / 卷积:用局部滑窗抓局部特征的操作,擅长局部模式(边缘、相邻帧的声学模式)。

深度卷积(depthwise convolution):每个通道独立做卷积,参数量远小于普通卷积。Conformer 卷积模块的核心。

GLU(门控线性单元):一种带"门"的激活,让网络自己学习哪些信息通过、哪些屏蔽。

Macaron-Net 结构:把一个前馈层拆成前后两个半量前馈夹住中间模块,像马卡龙的两片饼干夹馅。

相对位置编码(relative positional encoding):编码"两个位置相隔多远"而非"绝对第几个",对变长序列更鲁棒。来自 Transformer-XL。

Transducer / RNN-T:一种流式 ASR 框架,编码器 + 预测网络 + 联合网络,用 RNN-T loss 训练。Conformer 用它当解码框架。

SpecAugment:语音的数据增强——随机遮住频谱的一些时间段/频段,防止过拟合。

LibriSpeech:语音识别最常用的公开数据集,来自公版有声书,970 小时标注语音。

所以这一节是想说:这十个词是读任何现代语音识别论文都会反复出现的基础词汇。


它有什么搞不定的

  • 仍是纯声学编码器:Conformer 只是把声音编码得更好,不理解语义。想纠正"同音不同义"的错误还得靠外接语言模型(有 LM 时 test-other 从 4.3% 降到 3.9%)。
  • 依赖大量标注语音:训练用了 970 小时标注语音——获取成本高。对低资源语言(标注数据少)不友好,本文没探讨。
  • BatchNorm 的部署隐患:卷积模块用 BatchNorm,它依赖 batch 统计量。在流式/小 batch 推理时 BatchNorm 表现可能不稳(后续工作常换成其他归一化)。
  • 推理延迟未深究:论文聚焦精度和参数效率,对真正流式低延迟场景(边说边出字)的延迟-精度权衡讨论有限。
  • 核大小是全局固定的:所有层用同一个卷积核大小(32)。不同层可能适合不同感受野,但论文没做逐层自适应。
  • 超参需要 sweep:三个尺寸模型都是"扫描不同深度/维度/头数组合再挑最好"得到的——迁移到新数据集/新任务时可能需要重新调。

所以这一节是想说:Conformer 把声学编码做到极致,但它不懂语义、吃标注数据、BatchNorm 有流式隐患——这些都是后续工作发力的方向。


它和别的论文是什么关系

  • 上游(被它借用)
    • Transformer(Attention is All You Need):自注意力模块的来源。
    • Transformer-XL:相对位置编码来源。
    • Macaron-Net:两片半步前馈夹心结构来源。
    • ContextNet / QuartzNet / Jasper:纯 CNN 语音识别路线,Conformer 的直接对比对象。
    • Lite Transformer:早期"卷积 + 注意力"并行分支尝试,Conformer 证明串行更好。
  • 对比关系
    • 纯 Transformer Transducer:Conformer 用更少参数(30.7M vs 139M)超过它——加了卷积模块是关键。
    • 纯 CNN(ContextNet):Conformer 用自注意力抓动态全局上下文,比 ContextNet 的全局平均更强。
  • 下游 / 影响:Conformer 成为语音识别的默认骨干之一,被大量后续工作(Wav2Vec2 的变体、Whisper 的部分设计思路、各类流式 ASR)沿用。"卷积 + 注意力合体"的思想也影响了视觉领域(CoAtNet 等)。

所以这一节是想说:Conformer 站在 Transformer + Transformer-XL + Macaron-Net + CNN 语音路线的肩膀上,把"全局 + 局部合体"这个思想在语音识别里做到了标杆,并外溢到其他领域。


和本导读的关系

本笔记对应导读 Ch20:听觉智能——从语音识别到通用音频

导读 Ch20 讲的是"让机器听懂声音"这条线:从语音识别(ASR)的架构演进,到语音合成、通用音频建模、音频-语言多模态。Conformer 是这条线上声学编码架构的关键节点——它奠定了"卷积 + 自注意力合体"这个现代语音编码器的主流范式。

读完本笔记,建议顺着导读继续看 audiopalm 笔记(把语音直接接进大语言模型,做语音-文本统一建模)——你会发现 Conformer 这类强声学编码器是那些"语音大模型"的地基之一:先把声音编码好,才谈得上让语言模型理解它。也可以对照 whisper(大规模弱监督的通用 ASR),看"更好的架构"和"更多的数据"这两条提升 ASR 的路各自走多远。

所以这一节是想说:本笔记是导读 Ch20 "语音识别架构"这一格的深度展开,是理解后续语音大模型的地基。


思考题

以下问题检验你是否真正理解了 Conformer 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么 Transformer 擅长全局、CNN 擅长局部?这个"偏科"的根源在两者的什么机制上?

提示

根源在"感受野"和"连接方式"。自注意力让任意两个位置直接计算相关性——第 1 帧和第 100 帧一步就能互相看到,所以天然抓全局;但它对"相邻帧的精细局部模式"没有归纳偏置,得靠数据和层数硬学。卷积用固定大小的局部滑窗,一层只能看到核大小范围内的邻居——所以天然抓局部(有位置不变的局部归纳偏置);但要让第 1 帧影响第 100 帧,得堆很多层让感受野一点点扩大。Conformer 让两者互补:注意力管远、卷积管近。

Q2:消融实验显示"去掉卷积块"是所有改动里掉分最多的(4.3→4.9)。这说明纯 Transformer 在语音上缺的是什么?

提示

缺的是细粒度局部声学特征的建模能力。语音里音素的辨别高度依赖相邻几十毫秒的精细波形/频谱模式(比如爆破音 p/t/k 的区别在很短的时间窗内)。纯自注意力没有"局部优先"的归纳偏置,它把所有位置平等对待,要学出这种局部敏感性既费参数又不稳。卷积模块提供了现成的局部特征提取器,直接补上这个短板——所以它贡献最大。

Q3:为什么卷积放在自注意力"之后"比"之前"好?试从"信息流"的角度解释。

提示

先注意力后卷积 = 先建立全局语境,再在这个语境上精修局部。自注意力先把每一帧的表示更新成"融合了全句上下文的表示",然后卷积在这些"已经理解了大局"的特征上抓局部模式——此时的局部精修是有全局背景支撑的。反过来先卷积后注意力,卷积在还没有全局信息的原始特征上抓局部,抓到的局部模式没有语境,注意力再来整合时信息已经被局部卷积"定型"了一部分。实验上前者 dev-other 4.4,后者 4.5。

Q4:卷积核大小从 3 扫到 65,为什么 32 最优而 65 反而变差?

提示

核大小决定卷积的局部感受野。太小(3)看的邻域太窄,抓不到足够的局部声学结构;增大到 17、32,感受野覆盖了一个音素/音节尺度的有效局部上下文,效果提升。但太大(65)时,卷积的感受野和自注意力的"全局"职责重叠了——卷积本该管局部,核太大它就去抢全局的活,反而稀释了它的局部专长,还增加了参数和过拟合风险。所以有一个"局部够用但不越界"的甜点(32)。

Q5:Conformer(M) 只有 30.7M 参数却超过 139M 的 Transformer Transducer。这个"参数效率"来自哪里?是什么让它不需要那么多参数?

提示

来自"全局和局部在同一个块里深度融合"。纯 Transformer 要靠堆很多层/很宽的维度来间接学局部模式,纯 CNN 要靠堆层来间接扩全局感受野——两者都在用参数"绕路"补自己缺的那一头。Conformer 一个块里同时放了注意力(现成的全局机制)和卷积(现成的局部机制),每种能力都用最匹配的算子直接实现,不需要用大量参数去模拟另一种能力。所以同样的表达力,参数少得多。这是"架构归纳偏置"胜过"暴力堆参数"的典型。

Q6:Conformer 卷积模块用了 BatchNorm。如果你要把 Conformer 部署成"边说边出字"的流式识别,BatchNorm 会带来什么麻烦?

提示

BatchNorm 在训练时用一个 batch 内的统计量(均值/方差)做归一化,推理时用训练期间累积的全局统计量。流式场景有两个问题:一是流式推理往往是逐帧/小 batch 甚至单条,batch 统计量不可靠;二是流式要求"只用过去信息",而 BatchNorm 的统计量若在时间维度上聚合会泄露未来信息或需要看到整段。这会导致训练-推理不一致、精度下降。后续流式 Conformer 常把 BatchNorm 换成 LayerNorm/GroupNorm 或做因果化处理来规避。

Q7:有了 Conformer 这么强的声学编码器,为什么加上外接语言模型后 WER 还能进一步下降(test-other 4.3%→3.9%)?声学模型和语言模型各自补的是什么?

提示

声学模型(Conformer)擅长"这段声音听起来像什么词",但它对"这句话作为语言是否通顺/合理"的知识有限,尤其在噪声大或同音词场景容易听错。语言模型在海量文本上学过"词的搭配和句子的合理性"(本文的 LM 是 3 层 LSTM、词级困惑度 63.9),能纠正声学上模棱两可但语言上明显不合理的候选(比如把发音相近但语义荒谬的词换成合理的)。两者互补:声学管"听得清",语言管"说得通"。所以浅融合(shallow fusion)外接 LM 还能再降错误率。

所以这一节是想说:能回答这 7 题,你就真正理解了 Conformer 为什么合体、卷积为何是灵魂、排列/核大小/归一化的取舍,以及声学与语言模型的分工。


一些好奇心问答(FAQ)

Q1:WER 2.1% 到底算多好? 非常好。WER 是每 100 个词里错几个。2.1%(test-clean)意味着干净语音里每 100 词只错约 2 个,接近人类水平。test-other(噪声/口音更难)1.9%–3.9% 也是当时的顶尖成绩。

Q2:为什么叫 "Conformer"? Convolution(卷积)+ Transformer 的合成词。名字直接点明它的本质——卷积增强的 Transformer。

Q3:Macaron 前馈到底带来多少提升?值得吗? 消融显示把 Macaron 双半步前馈换成单个前馈,test-other 从 4.3% 涨到约 5.0%(在去掉卷积的对照里);单独看前馈这一项也有稳定小幅提升。它参数不变、只是重排,几乎免费,所以值得。

Q4:Conformer 只能做语音识别吗? 不是。它是个通用的序列编码器,"卷积+注意力"的思想被广泛迁移——语音翻译、语音合成前端、甚至视觉(CoAtNet 类工作)都借鉴了它。只要任务同时需要局部和全局建模,它就适用。

Q5:不用外接语言模型行不行? 行。无 LM 时大模型也有 2.1%/4.3%,已经很强。外接 LM 能再降一点(1.9%/3.9%),代价是推理更慢、系统更复杂。是否值得看应用对延迟和精度的权衡。

Q6:训练要多少数据/算力? 数据用 LibriSpeech 970 小时标注语音 + 800M 词文本(训 LM)。算力论文没细报,但三个尺寸模型都需要 sweep 超参,属于工业级实验室的量级。

所以这一节是想说:Conformer 的实操问题(指标解读、命名、组件价值、通用性、LM 取舍)都有明确答案,理解权衡比记数字重要。


如果你想再深入

按"前置 → 核心来源 → 对比 → 后续影响"排序:

  1. 前置:Attention is All You Need(Vaswani et al. 2017) — 自注意力的地基,读懂它才懂 MHSA 模块。
  2. 核心来源:Transformer-XL(Dai et al. 2019) — 相对位置编码来源。
  3. 核心来源:Macaron-Net(Lu et al. 2019) — 两片半步前馈夹心结构来源。
  4. 对比:ContextNet(Han et al. 2020) — 纯 CNN 语音路线的代表,对照能看出"加自注意力"的价值。
  5. 后续影响:Wav2Vec2 / Whisper — 看强声学编码器如何演进到自监督预训练和大规模弱监督。

所以这一节是想说:把 Transformer + Transformer-XL + Macaron-Net + ContextNet 连起来读,就能看清 Conformer 每个部件的来龙去脉。


原文信息

BibTeX

@inproceedings{gulati2020conformer,
  title     = {Conformer: Convolution-augmented Transformer for Speech Recognition},
  author    = {Gulati, Anmol and Qin, James and Chiu, Chung-Cheng and Parmar, Niki and Zhang, Yu and Yu, Jiahui and Han, Wei and Wang, Shibo and Zhang, Zhengdong and Wu, Yonghui and Pang, Ruoming},
  booktitle = {Proc. Interspeech 2020},
  year      = {2020}
}

链接

  • arXiv:arxiv.org/abs/2005.08100
  • 数据集:LibriSpeech(970 小时标注语音)
  • 相关:Transformer-XL、Macaron-Net、ContextNet

所以这一节是想说:这是 Gulati et al. 2020 年发表在 Interspeech 的工作,用"卷积增强的 Transformer"刷新了 LibriSpeech 语音识别 SOTA,并成为现代语音编码器的主流骨干。

引用本笔记 / Cite this note
BibTeX
@online{eai_conformer_2026,
  title       = {(readable note) Conformer},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2020 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/conformer/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?