跳转到内容

AV2 视频编码评测方法与压缩性能

待复核

AV2(AOMedia Video 2)是 AV1 之后的新一代视频编码方向。这篇论文不是教你手写编码器,而是在说明“怎么公平评测 AV2”,并报告 AV2 v13.0 相比 AV1 的压缩收益。

日常类比:视频编码像把行李箱重新打包。AV1 已经很会省空间,AV2 继续找更聪明的折叠方法;论文里的 CTC(Common Test Conditions)则像统一称重规则,规定用哪批箱子、怎么称、怎么算省了多少。

如果没有统一 CTC,团队 A 可能只测动画,团队 B 只测电影片段,最后都说自己更省码率,却很难判断谁的结论更可信。

不理解这套评测方法,下面这些事会很难解释:

  • 为什么“BD-rate 降低 30%”必须先说明数据集、配置和指标
  • 为什么点播、直播、实时通信、UGC、HDR、屏幕内容不能混成一个粗糙平均
  • 为什么 PSNR、VMAF、SSIM、CAMBI 等指标会给出不同侧面的质量判断
  • 为什么复杂度倍率和码率收益必须一起看,否则压缩更省但设备跑不动

这篇论文的价值在于把“压缩效果好不好”拆成可复现实验。它让读者能看懂:收益来自哪类内容、哪种配置,以及代价是不是工程上能接受。

  1. CTC 是统一考场:测试序列、QP 档位、编码配置和指标都要固定。类比同一张试卷,才知道哪个学生真的做得好。

  2. 内容类别要分开看:自然视频、屏幕内容、UGC、静帧、HDR、扩展色度都有不同难点。类比衣服有棉衣、衬衫、雨衣,不能只看一件就评价收纳方案。

  3. 收益要配复杂度:AV2 可以节省码率,但编码和解码开销也会上升。类比更省油的车如果维修极贵,买不买还要看使用场景。

案例 1:把 BD-rate 读成“同画质少用多少码率”

Section titled “案例 1:把 BD-rate 读成“同画质少用多少码率””

论文报告 RA 模式下 AV2 相比 AV1 的总体 BD-rate 降低约 29.81%(PSNR-YUV 口径)。

av1_mbps = 5.0
bd_rate_saving = 0.2981
av2_mbps = av1_mbps * (1 - bd_rate_saving)
print(round(av2_mbps, 2)) # 3.51

逐部分解释:

  • av1_mbps 表示 AV1 达到某个画质大约需要 5 Mbps
  • bd_rate_saving 是论文里的平均节省比例,不是单个视频的保证值
  • 3.51 的意思是同等质量附近,AV2 可能用更低码率达到相近观感

案例 2:先按配置分桶,再比较结果

Section titled “案例 2:先按配置分桶,再比较结果”

AI、RA、LD、AS 代表不同使用场景,混在一起会误判。

tests = [
{"name": "movie_4k", "config": "RA", "bd_rate": -29.8},
{"name": "meeting", "config": "LD", "bd_rate": -22.0},
{"name": "ladder", "config": "AS", "bd_rate": -33.0},
]
by_config = {}
for item in tests:
by_config.setdefault(item["config"], []).append(item["bd_rate"])

逐部分解释:

  • RA 适合点播或允许随机访问的视频
  • LD 更关注低延迟,适合会议和互动场景
  • AS 关注自适应流媒体,多分辨率、多码率要一起比较

如果只看码率收益,容易忽略编码机成本和端侧解码压力。

saves_bandwidth = True
encode_cost_x = 33.0
decode_cost_x = 3.86
if saves_bandwidth and decode_cost_x < 4.0:
decision = "can test on high-end clients"
else:
decision = "keep as lab benchmark"

逐部分解释:

  • encode_cost_x 是编码端相对 AV1 的开销量级,适合提醒云端成本
  • decode_cost_x 更接近用户设备压力,移动端尤其敏感
  • decision 不是论文结论,而是工程团队把论文数字转成试点策略的例子
  1. 只看单一指标:PSNR 高不一定少色带,VMAF 高也不代表所有 HDR 场景都稳。
  2. 忽略 UGC:只测干净自然视频,会高估短视频平台这种历史压缩内容的表现。
  3. 混淆配置模式:LD 与 RA 的延迟假设不同,不能互相代替。
  4. 少测 QP 档位:RD 曲线点太少,BD-rate 拟合会不稳定。
  5. 把复杂度当附注:编码和解码倍率会直接影响云成本、电池和硬件支持节奏。

适用

  • 需要跨版本、跨方法比较视频压缩收益
  • 为流媒体、会议、UGC 或 HDR 场景设计统一评测
  • 把编码器实验接入 CI,需要固定测试集和指标口径
  • 向非编码专家解释“省码率”和“算得动”之间的取舍

不适用

  • 只做一次性离线转码,不需要可复现基准
  • 只追求主观展示效果,不关心统一指标
  • 团队完全使用私有硬件和私有素材,且不需要与公开结果对齐
  • 想直接学习编码器源码实现细节,这篇更偏评测方法和结果报告
  • AV1 时代:AOMedia 用开放标准推动免专利费的视频编码生态。
  • 2021-2025 年:AV2 工具链持续迭代,论文用版本化结果观察收益趋势。
  • 2026 年:这篇 arXiv 论文系统整理 AV2 CTC 和 v13.0 的压缩表现。
  • 今天:评测方法本身越来越重要,因为新标准不只比码率,也比复杂度、场景覆盖和可复现性。
  • 好的评测先于好的口号;没有统一 CTC,压缩收益数字很容易失真。
  • BD-rate 是平均比较工具,不是对每个视频都成立的承诺。
  • 视频标准是“画质、码率、延迟、复杂度”的多目标取舍。
  • 工程团队看 AV2 时,应同时读收益表、复杂度表和适用场景。
  • AOMedia AV2 仓库:AOMediaCodec/avm
  • AOM AV2 CTC 文档:论文中引用的官方 Common Test Conditions
  • FFmpeg 文档:理解 QP、码率控制和编解码参数
  • AV1 规范与公开教程:先理解上一代标准再看 AV2 更顺
  • streaming —— 自适应码率会影响 AS 配置的评测方式
  • codec —— 编码器优化的一般框架可类比理解
  • video-codec —— 视频编码中码率与计算成本的平衡
  • streaming —— ABR 与自适应流媒体的系统约束
  • aomedia-standards —— AOMedia 常见评测规则与公开基准
  • video-codec-evolution —— AV1/AV2 过渡中的关键里程碑

(暂无反向链接)