Conformer
这是一份写给"没接触过语音识别和 Transformer"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。
一句话讲什么(TL;DR)
Transformer 擅长看"全局大局",卷积擅长抠"局部细节",Conformer 把两者塞进同一个模块里——让语音识别既看得远又看得清,用更少的参数刷出了 LibriSpeech 的最好成绩(测试集 word 错误率低到 1.9%/3.9%)。
所以这一节是想说:这篇论文的核心就一句话——把"卷积"和"自注意力"合体,语音识别的全局和局部一起抓。
这是个什么场景
你在嘈杂的咖啡馆听朋友说话。要听懂一句话,你的大脑同时在做两件事:
- 抠局部细节:每个音素(p、a、t 这种最小发音单位)的具体发音,靠的是相邻几十毫秒的声音波形——这是"局部"信息。
- 联系全局上下文:这个词到底是 "recognize" 还是 "wreck a nice",得联系整句话的语境判断——这是"全局"信息。
自动语音识别(ASR,Automatic Speech Recognition) 就是让机器把一段声音波形转成文字。它面对同样的两难:既要抠清楚每一小段声音是什么音,又要联系长距离上下文判断整句话。
在 Conformer 之前,机器有两派工具,各有偏科:
- Transformer(自注意力):擅长捕捉"内容相关的全局交互"——任意两个时刻都能直接互相看,看得远。但它抓不好细粒度的局部模式,且要看清局部得堆很多层。
- CNN(卷积神经网络):擅长用局部感受野逐层抓局部特征(像边缘、形状)。但局部连接的代价是——想抓全局信息就得堆很多层或很多参数。
Conformer 想做的就是:把这两个偏科生的长处合到一个模块里,用更少的参数同时抓好全局和局部。
所以这一节是想说:语音识别要同时抓"每个音的细节"和"整句的语境",而 Transformer 和 CNN 各偏科一头,Conformer 来做合体。

之前的人怎么做的,为什么不够好
方案 A:RNN(循环神经网络) ASR 长期的默认选择,能建模时序依赖。类比:一个字一个字顺着听。问题:难并行、训练慢,长距离依赖会衰减。
方案 B:纯 Transformer / Transformer Transducer 用自注意力建模全局。类比:一眼扫全句,任意两词直接连线。问题:抠不好局部细粒度特征(相邻几帧的精细声学模式),要达到高精度往往需要很大模型(论文对比的 Transformer Transducer 用了 139M 参数)。
方案 C:纯 CNN(QuartzNet、Jasper、ContextNet) 用卷积逐层抓局部。类比:拿放大镜一小段一小段看。问题:抓全局要堆很多层。ContextNet 想补救,往每个残差块里塞 squeeze-and-excitation 模块抓长上下文,但那只是对整段做个全局平均,抓不到"动态的全局上下文"。
方案 D:把卷积和注意力拼一起(早期尝试) 已有工作(如 Lite Transformer)把输入分成两个并行分支(自注意力 + 卷积),输出拼接。类比:两个专家各看一遍再合并意见。问题:这些主要针对机器翻译/移动端,且并行拼接的方式在语音上不是最优。
核心难题:怎么把卷积和自注意力有机地组织在一起(而不是简单并行),让全局和局部信息在参数高效的前提下深度融合?
所以这一节是想说:前人要么偏全局(Transformer)、要么偏局部(CNN)、要么拼得不够巧(并行分支),缺一个把两者深度合体的架构。
这篇论文的新想法
类比:想象一个"三明治"结构。中间夹着"望远镜"(自注意力,看全局)和"放大镜"(卷积,看局部),上下各垫一片"面包"(前馈网络,做特征变换)。这就是 Conformer 块(Conformer block)。
Conformer 的核心创新是一个新的编码器基本块,把四个模块按特定顺序堆起来:
前馈模块 → 自注意力模块 → 卷积模块 → 前馈模块
关键的三个设计判断:
- 卷积放在自注意力之后(不是之前,也不是并行)——论文实验证明这个顺序对语音最好。直觉:先用注意力抓全局语境,再用卷积在这个语境上精修局部。
- 两片前馈"面包"用半步残差夹住中间(借鉴 Macaron-Net)——不是 Transformer 那样只在注意力后放一个前馈,而是前后各放一个"半量"前馈。
- 自注意力用相对位置编码(借鉴 Transformer-XL)——让模型对不同长度的语音更鲁棒。
合起来,Conformer 让"看得远"和"看得清"在同一个块里深度交织,而不是浅浅地并排。
【偏科 vs 合体】
纯 Transformer:全局强 / 局部弱(要高精度需大模型, 对比用 139M)
纯 CNN: 局部强 / 全局弱(抓全局要堆很多层)
早期拼接: 自注意力 ‖ 卷积 (并行两分支再拼接, 语音上不最优)
Conformer 块(三明治, 深度交织):
½前馈(面包)
→ 自注意力(望远镜/全局, 用相对位置编码)
→ 卷积(放大镜/局部, 放在注意力"之后")
→ ½前馈(面包)
→ LayerNorm
参数更省, 全局 + 局部在同一块内融合
所以这一节是想说:把自注意力(全局)和卷积(局部)夹在两片 Macaron 前馈之间,卷积放在注意力之后——这个"三明治"块就是 Conformer 的全部创新。
它分几步做的(方法)
Conformer 编码器的整体结构:
声音波形 → 80维滤波器组特征
│
▼ 卷积下采样层 (subsampling)
│
▼ ┌───────── Conformer Block × N ─────────┐
│ ½ FFN → MHSA → Conv → ½ FFN → LayerNorm │ (Macaron三明治)
└────────────────────────────────────────┘
│
▼ 单层 LSTM 解码器 (Transducer)
│
▼ 文字
下面逐个模块拆开,每个按"输入 → 处理 → 输出"讲清楚。
5.1 输入前端:滤波器组特征 + 卷积下采样
输入:原始语音波形。
处理:提取 80 通道的滤波器组(filterbank)特征——用 25ms 的窗口、10ms 的步长(stride)计算。这相当于把声音切成一帧帧的"频谱切片",每帧 80 个数字描述各频段的能量。再加数据增强 SpecAugment(掩码参数 F=27,10 个时间掩码,最大时间掩码比例 pS=0.05)——随机遮住一些频段/时段,逼模型别死记硬背。然后过一个卷积下采样层,减少序列长度。
输出:一串下采样后的特征向量,喂给 Conformer 块。
小结:把波形变成频谱帧、做数据增强、下采样,为主干做好准备。
5.2 前馈模块(FFN):Macaron 式半步残差
类比:面包片——对每个位置的特征做一次"深加工"。
输入 → 处理 → 输出:标准 Transformer 前馈是"线性层 → 激活 → 线性层"。Conformer 的前馈用pre-norm 残差 + Swish 激活 + dropout,第一层线性用 4 倍扩展因子(先放大再压回)。关键区别:Conformer 有两个前馈模块,分别在注意力前后,且各用半步残差(residual 权重 ×½)——这是 Macaron-Net 的思路,把 Transformer 里那一个前馈拆成两个半量的夹在两头。
为什么:消融实验证明,两个半步 Macaron 前馈比单个前馈(同参数量)效果更好。
小结:前后两片半量前馈"面包"夹住中间,比单片前馈更强。
5.3 多头自注意力模块(MHSA):相对位置编码
类比:望远镜——让每个时刻直接看到序列里任意其他时刻。
输入 → 处理 → 输出:多头自注意力让每个时间帧根据"内容相关性"去关注序列里所有其他帧,捕捉全局依赖。关键改进:借用 Transformer-XL 的相对正弦位置编码——不编码"绝对第几帧",而是编码"两帧相隔多远"。这让编码器对不同长度的语音(utterance)更鲁棒。用 pre-norm 残差 + dropout 稳定深层训练。
为什么相对位置:语音长度千变万化,绝对位置编码在长度变化时泛化差;相对位置只关心"隔多远",更稳。
小结:自注意力抓全局,配相对位置编码让它对语音长度变化更鲁棒。
5.4 卷积模块(Conv):门控 + 深度卷积
类比:放大镜——在全局语境上精修局部细节。
输入 → 处理 → 输出:卷积模块的内部顺序是——
- LayerNorm;
- 逐点卷积(pointwise conv)扩展 2 倍通道 + GLU(门控线性单元)激活——门控机制让模型自己决定哪些信息通过;
- 一层 1D 深度卷积(depthwise conv)——每个通道独立做卷积,参数少;
- BatchNorm(帮助训练深层模型);
- Swish 激活;
- 逐点卷积 + dropout。
深度卷积的核大小经过扫描({3,7,17,32,65}),32 最优(太大反而变差)。
为什么:这个模块专门抓相邻帧的局部声学模式,是 Conformer 相对纯 Transformer 的最大增益来源(见消融)。
小结:门控 + 1D 深度卷积(核 32)+ BatchNorm,专抓局部声学细节。
5.5 Conformer 块的合体公式
类比:把三明治压紧。对输入 x_i,一个 Conformer 块的输出 y_i 是:
x̃ = x + ½·FFN(x)(第一片半量面包)x' = x̃ + MHSA(x̃)(望远镜)x'' = x' + Conv(x')(放大镜)y = LayerNorm(x'' + ½·FFN(x''))(第二片半量面包 + 收尾归一化)
人话:"先做半量前馈加工,再全局注意力,再局部卷积,最后再来半量前馈,收尾归一化"。四个模块全用残差连接,梯度好传。
解码器:所有模型都用单层 LSTM 解码器(Transducer 架构,RNN-T loss)。
训练配置:Adam(β1=0.9, β2=0.98, ε=1e-9),Transformer 学习率调度(10k 预热步,峰值 0.05/√d),dropout 0.1,L2 正则 1e-6。可选外接语言模型:3 层 LSTM、宽度 4096、词级困惑度 63.9。
小结:四模块残差堆叠成块、Macaron 半步残差夹心、单层 LSTM 解码——这就是完整的 Conformer。
5.6 三种尺寸:同一块怎么堆成大中小三档
类比:同一份三明治配方,可以做成小份、中份、大份——面包和配料一样,只是层数和厚度不同。
输入 → 处理 → 输出:Conformer 用完全相同的块结构,靠调三个旋钮堆出三个规模(论文的 S/M/L):
- Conformer(S):约 10.3M 参数——16 个编码器块、编码器维度 144、注意力头 4、卷积核 32、解码器单层 LSTM 维度 320。
- Conformer(M):约 30.7M 参数——16 个块、维度 256、4 个头、卷积核 32、解码器维度 640。
- Conformer(L):约 118.8M 参数——17 个块、维度 512、8 个头、卷积核 32、解码器维度 640。
三档的关键差异只有"块的宽度(维度)、注意力头数、块数",卷积核统一取扫描出的最优值 32。注意即使最大的 L 模型,也只有 118.8M 参数,却能打过 139M 的 Transformer Transducer——这就是"深度融合全局与局部"带来的参数效率。
正则化怎么配:因为语音数据相对有限、模型又深,Conformer 叠了多重正则化防过拟合——每个残差单元里的 dropout(0.1)、权重衰减(L2,1e-6)、以及训练中给权重加的 variational noise(变分噪声),再配上前端的 SpecAugment 数据增强。这套组合让大模型也能稳定训练不塌。
输出:一个可按算力预算选档(S/M/L)的编码器家族,块结构不变、只缩放规模。
小结:Conformer 用同一块结构、只调"宽度/头数/层数"就堆出 S/M/L 三档,配多重正则化,实现了从 10M 到 119M 的参数高效家族。
5.7 解码器与语言模型融合:把声学和语言拼起来
类比:Conformer 编码器是"耳朵",负责把声音听成一串富含信息的特征;但要真正吐出通顺的文字,还得配一张"嘴"(解码器),必要时再请一位"语文老师"(语言模型)帮忙润色。
输入:编码器输出的一串声学特征。
处理:Conformer 用 Transducer(RNN-T) 框架把编码器和解码器接起来——解码器只用一层 LSTM(论文特意验证:即便解码器这么小,性能也几乎不掉,说明强大的编码器才是关键,把复杂度都压在了编码器侧)。训练用 RNN-T 损失,它天然支持流式(streaming)识别,不必等整句说完才出字。为进一步降低词错误率,还可以做语言模型浅融合(shallow fusion):外接一个在 LibriSpeech 语言模型语料上训练的 3 层 LSTM 语言模型(宽度 4096),在解码打分时把声学得分和语言模型得分加权相加,让输出更符合语言习惯。实验里,加了 LM 的版本在各档模型上都进一步压低了 WER。
输出:最终的识别文字(可选地经语言模型润色)。
为什么解码器可以这么小:因为 Conformer 编码器已经把全局语境和局部细节都编码得很充分,"理解"这一步基本在编码器完成,解码器只需做轻量的序列输出,所以单层 LSTM 就够——这也是 Conformer 参数效率高的另一面。
小结:Conformer 用 RNN-T 框架 + 单层 LSTM 解码器(支持流式),必要时再浅融合一个 3 层 LSTM 语言模型进一步降 WER;解码器能做得极小,正因为强大的编码器已把理解这步做足。

关键数字(What works)
数字本身不重要,重要的是它们告诉你"合体到底值多少、哪个部件最关键"。
数字 1:三个尺寸模型 vs 前人(LibriSpeech WER%)
| 模型 | 参数量 | 无 LM (clean/other) | 有 LM (clean/other) |
|---|---|---|---|
| Conformer(S) | 10.3M | 2.7 / 6.3 | 2.1 / 5.0 |
| Conformer(M) | 30.7M | 2.3 / 5.0 | 2.0 / 4.3 |
| Conformer(L) | 118.8M | 2.1 / 4.3 | 1.9 / 3.9 |
| Transducer Transformer | 139M | 2.4 / 5.6 | 2.0 / 4.6 |
| ContextNet(L) | 112.7M | 2.1 / 4.6 | 1.9 / 4.1 |
关键含义:参数效率极高——30.7M 的 Conformer(M) 就超过了 139M 的 Transformer Transducer;118.8M 的大模型达到 1.9%/3.9%,刷新 SOTA。WER(word error rate,词错误率)越低越好。
数字 2:拆解 Conformer——哪个部件最关键(test-other WER%,无 LM)
| 架构变体 | test-other |
|---|---|
| 完整 Conformer | 4.3 |
| Swish 换 ReLU | 4.5 |
| 去掉卷积块 | 4.9 |
| 去掉卷积块 + Macaron | 5.0 |
| 再去掉相对位置编码 | 5.6 |
关键含义:卷积模块是最重要的部件(去掉后 4.3→4.9);Macaron 前馈和相对位置编码也都各有贡献。这直接证明了"给 Transformer 加卷积"是核心增益。
数字 3:卷积和注意力怎么组合(dev-clean/dev-other WER%)
| 组合方式 | dev-clean / dev-other |
|---|---|
| Conformer(卷积在注意力后) | 1.9 / 4.4 |
| 深度卷积换轻量卷积 | 2.0 / 4.8 |
| 卷积放在注意力前 | 1.9 / 4.5 |
| 注意力与卷积并行拼接 | 2.0 / 4.9 |
关键含义:卷积放在自注意力之后最好,且深度卷积优于轻量卷积,串行优于并行。
数字 4:超参扫描
| 超参 | 结论 |
|---|---|
| 注意力头数 | 从 4 增到 16 提升(尤其 dev-other) |
| 卷积核大小 | {3,7,17,32,65} 中 32 最优,65 变差 |
| 数据集 | LibriSpeech,970 小时标注语音 + 800M 词文本 |
| 特征 | 80 通道滤波器组,25ms 窗,10ms 步长 |
所以这一节是想说:数字证明三件事——参数效率极高、卷积模块是灵魂、组合方式(卷积在后、深度卷积、核 32)都有实验支撑。
实验结果说明了什么
问题一:把卷积加进 Transformer,到底带来多少提升? 消融给出了明确答案:从完整 Conformer 到去掉卷积块,test-other 从 4.3% 涨到 4.9%——卷积是所有改动里贡献最大的。这验证了核心假设:Transformer 的全局建模缺了局部细粒度特征,卷积正好补上。
问题二:为什么参数效率这么高? 因为全局和局部信息在同一个块里深度融合,而不是靠堆层数硬凑。纯 CNN 要抓全局得堆很多层,纯 Transformer 要抓局部也得堆;Conformer 一个块同时干两件事,所以 30.7M 就能打赢 139M。这是"架构设计"胜过"暴力堆参数"的经典案例。
问题三:组件的排列顺序真的重要吗? 重要。卷积放在注意力之后(4.4)比放在之前(4.5)好,比并行拼接(4.9)好很多。直觉:先让注意力建立全局语境,卷积再在这个"已经理解了大局"的表示上精修局部,比反过来或各干各的更合理。
问题四:小模型也能受益吗? 能。10.3M 的 Conformer(S) 在 test-other 上比同尺寸的 ContextNet(S) 好 0.7%。说明这套设计不是靠大模型才成立,小模型上同样有效——这对移动端/边缘部署很重要。
所以这一节是想说:实验系统回答了四个问题——卷积是灵魂、参数效率来自深度融合、排列顺序重要、大小模型都受益。
你应该懂的几个新词
ASR(自动语音识别):把语音波形转成文字的任务。Conformer 是它的一个编码器架构。
WER(词错误率,Word Error Rate):ASR 的核心评测指标——识别文本相对正确文本的错误比例(插入+删除+替换)。越低越好。
Transformer / 自注意力(self-attention):让序列里任意两个位置直接互相关注的机制,擅长全局长距离依赖。
CNN / 卷积:用局部滑窗抓局部特征的操作,擅长局部模式(边缘、相邻帧的声学模式)。
深度卷积(depthwise convolution):每个通道独立做卷积,参数量远小于普通卷积。Conformer 卷积模块的核心。
GLU(门控线性单元):一种带"门"的激活,让网络自己学习哪些信息通过、哪些屏蔽。
Macaron-Net 结构:把一个前馈层拆成前后两个半量前馈夹住中间模块,像马卡龙的两片饼干夹馅。
相对位置编码(relative positional encoding):编码"两个位置相隔多远"而非"绝对第几个",对变长序列更鲁棒。来自 Transformer-XL。
Transducer / RNN-T:一种流式 ASR 框架,编码器 + 预测网络 + 联合网络,用 RNN-T loss 训练。Conformer 用它当解码框架。
SpecAugment:语音的数据增强——随机遮住频谱的一些时间段/频段,防止过拟合。
LibriSpeech:语音识别最常用的公开数据集,来自公版有声书,970 小时标注语音。
所以这一节是想说:这十个词是读任何现代语音识别论文都会反复出现的基础词汇。
它有什么搞不定的
- 仍是纯声学编码器:Conformer 只是把声音编码得更好,不理解语义。想纠正"同音不同义"的错误还得靠外接语言模型(有 LM 时 test-other 从 4.3% 降到 3.9%)。
- 依赖大量标注语音:训练用了 970 小时标注语音——获取成本高。对低资源语言(标注数据少)不友好,本文没探讨。
- BatchNorm 的部署隐患:卷积模块用 BatchNorm,它依赖 batch 统计量。在流式/小 batch 推理时 BatchNorm 表现可能不稳(后续工作常换成其他归一化)。
- 推理延迟未深究:论文聚焦精度和参数效率,对真正流式低延迟场景(边说边出字)的延迟-精度权衡讨论有限。
- 核大小是全局固定的:所有层用同一个卷积核大小(32)。不同层可能适合不同感受野,但论文没做逐层自适应。
- 超参需要 sweep:三个尺寸模型都是"扫描不同深度/维度/头数组合再挑最好"得到的——迁移到新数据集/新任务时可能需要重新调。
所以这一节是想说:Conformer 把声学编码做到极致,但它不懂语义、吃标注数据、BatchNorm 有流式隐患——这些都是后续工作发力的方向。
它和别的论文是什么关系
- 上游(被它借用):
- Transformer(Attention is All You Need):自注意力模块的来源。
- Transformer-XL:相对位置编码来源。
- Macaron-Net:两片半步前馈夹心结构来源。
- ContextNet / QuartzNet / Jasper:纯 CNN 语音识别路线,Conformer 的直接对比对象。
- Lite Transformer:早期"卷积 + 注意力"并行分支尝试,Conformer 证明串行更好。
- 对比关系:
- 和 纯 Transformer Transducer:Conformer 用更少参数(30.7M vs 139M)超过它——加了卷积模块是关键。
- 和 纯 CNN(ContextNet):Conformer 用自注意力抓动态全局上下文,比 ContextNet 的全局平均更强。
- 下游 / 影响:Conformer 成为语音识别的默认骨干之一,被大量后续工作(Wav2Vec2 的变体、Whisper 的部分设计思路、各类流式 ASR)沿用。"卷积 + 注意力合体"的思想也影响了视觉领域(CoAtNet 等)。
所以这一节是想说:Conformer 站在 Transformer + Transformer-XL + Macaron-Net + CNN 语音路线的肩膀上,把"全局 + 局部合体"这个思想在语音识别里做到了标杆,并外溢到其他领域。
和本导读的关系
本笔记对应导读 Ch20:听觉智能——从语音识别到通用音频。
导读 Ch20 讲的是"让机器听懂声音"这条线:从语音识别(ASR)的架构演进,到语音合成、通用音频建模、音频-语言多模态。Conformer 是这条线上声学编码架构的关键节点——它奠定了"卷积 + 自注意力合体"这个现代语音编码器的主流范式。
读完本笔记,建议顺着导读继续看 audiopalm 笔记(把语音直接接进大语言模型,做语音-文本统一建模)——你会发现 Conformer 这类强声学编码器是那些"语音大模型"的地基之一:先把声音编码好,才谈得上让语言模型理解它。也可以对照 whisper(大规模弱监督的通用 ASR),看"更好的架构"和"更多的数据"这两条提升 ASR 的路各自走多远。
所以这一节是想说:本笔记是导读 Ch20 "语音识别架构"这一格的深度展开,是理解后续语音大模型的地基。
思考题
以下问题检验你是否真正理解了 Conformer 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:为什么 Transformer 擅长全局、CNN 擅长局部?这个"偏科"的根源在两者的什么机制上?
提示
根源在"感受野"和"连接方式"。自注意力让任意两个位置直接计算相关性——第 1 帧和第 100 帧一步就能互相看到,所以天然抓全局;但它对"相邻帧的精细局部模式"没有归纳偏置,得靠数据和层数硬学。卷积用固定大小的局部滑窗,一层只能看到核大小范围内的邻居——所以天然抓局部(有位置不变的局部归纳偏置);但要让第 1 帧影响第 100 帧,得堆很多层让感受野一点点扩大。Conformer 让两者互补:注意力管远、卷积管近。
Q2:消融实验显示"去掉卷积块"是所有改动里掉分最多的(4.3→4.9)。这说明纯 Transformer 在语音上缺的是什么?
提示
缺的是细粒度局部声学特征的建模能力。语音里音素的辨别高度依赖相邻几十毫秒的精细波形/频谱模式(比如爆破音 p/t/k 的区别在很短的时间窗内)。纯自注意力没有"局部优先"的归纳偏置,它把所有位置平等对待,要学出这种局部敏感性既费参数又不稳。卷积模块提供了现成的局部特征提取器,直接补上这个短板——所以它贡献最大。
Q3:为什么卷积放在自注意力"之后"比"之前"好?试从"信息流"的角度解释。
提示
先注意力后卷积 = 先建立全局语境,再在这个语境上精修局部。自注意力先把每一帧的表示更新成"融合了全句上下文的表示",然后卷积在这些"已经理解了大局"的特征上抓局部模式——此时的局部精修是有全局背景支撑的。反过来先卷积后注意力,卷积在还没有全局信息的原始特征上抓局部,抓到的局部模式没有语境,注意力再来整合时信息已经被局部卷积"定型"了一部分。实验上前者 dev-other 4.4,后者 4.5。
Q4:卷积核大小从 3 扫到 65,为什么 32 最优而 65 反而变差?
提示
核大小决定卷积的局部感受野。太小(3)看的邻域太窄,抓不到足够的局部声学结构;增大到 17、32,感受野覆盖了一个音素/音节尺度的有效局部上下文,效果提升。但太大(65)时,卷积的感受野和自注意力的"全局"职责重叠了——卷积本该管局部,核太大它就去抢全局的活,反而稀释了它的局部专长,还增加了参数和过拟合风险。所以有一个"局部够用但不越界"的甜点(32)。
Q5:Conformer(M) 只有 30.7M 参数却超过 139M 的 Transformer Transducer。这个"参数效率"来自哪里?是什么让它不需要那么多参数?
提示
来自"全局和局部在同一个块里深度融合"。纯 Transformer 要靠堆很多层/很宽的维度来间接学局部模式,纯 CNN 要靠堆层来间接扩全局感受野——两者都在用参数"绕路"补自己缺的那一头。Conformer 一个块里同时放了注意力(现成的全局机制)和卷积(现成的局部机制),每种能力都用最匹配的算子直接实现,不需要用大量参数去模拟另一种能力。所以同样的表达力,参数少得多。这是"架构归纳偏置"胜过"暴力堆参数"的典型。
Q6:Conformer 卷积模块用了 BatchNorm。如果你要把 Conformer 部署成"边说边出字"的流式识别,BatchNorm 会带来什么麻烦?
提示
BatchNorm 在训练时用一个 batch 内的统计量(均值/方差)做归一化,推理时用训练期间累积的全局统计量。流式场景有两个问题:一是流式推理往往是逐帧/小 batch 甚至单条,batch 统计量不可靠;二是流式要求"只用过去信息",而 BatchNorm 的统计量若在时间维度上聚合会泄露未来信息或需要看到整段。这会导致训练-推理不一致、精度下降。后续流式 Conformer 常把 BatchNorm 换成 LayerNorm/GroupNorm 或做因果化处理来规避。
Q7:有了 Conformer 这么强的声学编码器,为什么加上外接语言模型后 WER 还能进一步下降(test-other 4.3%→3.9%)?声学模型和语言模型各自补的是什么?
提示
声学模型(Conformer)擅长"这段声音听起来像什么词",但它对"这句话作为语言是否通顺/合理"的知识有限,尤其在噪声大或同音词场景容易听错。语言模型在海量文本上学过"词的搭配和句子的合理性"(本文的 LM 是 3 层 LSTM、词级困惑度 63.9),能纠正声学上模棱两可但语言上明显不合理的候选(比如把发音相近但语义荒谬的词换成合理的)。两者互补:声学管"听得清",语言管"说得通"。所以浅融合(shallow fusion)外接 LM 还能再降错误率。
所以这一节是想说:能回答这 7 题,你就真正理解了 Conformer 为什么合体、卷积为何是灵魂、排列/核大小/归一化的取舍,以及声学与语言模型的分工。
一些好奇心问答(FAQ)
Q1:WER 2.1% 到底算多好? 非常好。WER 是每 100 个词里错几个。2.1%(test-clean)意味着干净语音里每 100 词只错约 2 个,接近人类水平。test-other(噪声/口音更难)1.9%–3.9% 也是当时的顶尖成绩。
Q2:为什么叫 "Conformer"? Convolution(卷积)+ Transformer 的合成词。名字直接点明它的本质——卷积增强的 Transformer。
Q3:Macaron 前馈到底带来多少提升?值得吗? 消融显示把 Macaron 双半步前馈换成单个前馈,test-other 从 4.3% 涨到约 5.0%(在去掉卷积的对照里);单独看前馈这一项也有稳定小幅提升。它参数不变、只是重排,几乎免费,所以值得。
Q4:Conformer 只能做语音识别吗? 不是。它是个通用的序列编码器,"卷积+注意力"的思想被广泛迁移——语音翻译、语音合成前端、甚至视觉(CoAtNet 类工作)都借鉴了它。只要任务同时需要局部和全局建模,它就适用。
Q5:不用外接语言模型行不行? 行。无 LM 时大模型也有 2.1%/4.3%,已经很强。外接 LM 能再降一点(1.9%/3.9%),代价是推理更慢、系统更复杂。是否值得看应用对延迟和精度的权衡。
Q6:训练要多少数据/算力? 数据用 LibriSpeech 970 小时标注语音 + 800M 词文本(训 LM)。算力论文没细报,但三个尺寸模型都需要 sweep 超参,属于工业级实验室的量级。
所以这一节是想说:Conformer 的实操问题(指标解读、命名、组件价值、通用性、LM 取舍)都有明确答案,理解权衡比记数字重要。
如果你想再深入
按"前置 → 核心来源 → 对比 → 后续影响"排序:
- 前置:Attention is All You Need(Vaswani et al. 2017) — 自注意力的地基,读懂它才懂 MHSA 模块。
- 核心来源:Transformer-XL(Dai et al. 2019) — 相对位置编码来源。
- 核心来源:Macaron-Net(Lu et al. 2019) — 两片半步前馈夹心结构来源。
- 对比:ContextNet(Han et al. 2020) — 纯 CNN 语音路线的代表,对照能看出"加自注意力"的价值。
- 后续影响:Wav2Vec2 / Whisper — 看强声学编码器如何演进到自监督预训练和大规模弱监督。
所以这一节是想说:把 Transformer + Transformer-XL + Macaron-Net + ContextNet 连起来读,就能看清 Conformer 每个部件的来龙去脉。
原文信息
BibTeX
@inproceedings{gulati2020conformer,
title = {Conformer: Convolution-augmented Transformer for Speech Recognition},
author = {Gulati, Anmol and Qin, James and Chiu, Chung-Cheng and Parmar, Niki and Zhang, Yu and Yu, Jiahui and Han, Wei and Wang, Shibo and Zhang, Zhengdong and Wu, Yonghui and Pang, Ruoming},
booktitle = {Proc. Interspeech 2020},
year = {2020}
}
链接
- arXiv:arxiv.org/abs/2005.08100
- 数据集:LibriSpeech(970 小时标注语音)
- 相关:Transformer-XL、Macaron-Net、ContextNet
所以这一节是想说:这是 Gulati et al. 2020 年发表在 Interspeech 的工作,用"卷积增强的 Transformer"刷新了 LibriSpeech 语音识别 SOTA,并成为现代语音编码器的主流骨干。
◼
引用本笔记 / Cite this note
@online{eai_conformer_2026,
title = {(readable note) Conformer},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2020 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/conformer/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?