PaLM — Pathways 把 540B LLM 扩成统一底座
已复核 · 稳定内容PaLM: Scaling Language Modeling with Pathways 是一篇 LLM / Foundation Model 论文。本卡只基于 arXiv 官方元数据和论文静态阅读做研究整理;没有运行作者代码,也没有复现论文分数。
类比:像把很多单科老师请进一间超级教室:模型本体还是同一个 decoder,但它在语言、数学、代码、多语种任务上都开始表现出可迁移能力。
它在本轮 40 篇里的位置是 Batch 1 / foundation scaling:不是孤立收藏,而是补上 study 论文图谱里还缺的一块。
GPT-3 之后,行业想知道继续扩 dense decoder 是否还能带来跨任务收益,以及工程系统能否支撑 500B 级训练。
如果把它放进产品工程语境,核心问题是:团队到底应该把不确定性留给模型本身,还是拆给数据、工具、训练目标、评测和系统约束分别处理。
- 它给后续研究提供了一个可引用的名字和问题边界。
- 它把一个模糊能力拆成了可以讨论的机制或流程。
- 它提醒我们不要只看最终 benchmark,而要看数据、约束和验收方式。
- 它能和本库已有笔记形成交叉链接,方便以后按主题复习。
| 设计 | 作用 |
|---|---|
| Pathways 训练栈 | 用 Google 的分布式系统承载 540B 参数训练。 |
| 统一 decoder-only LM | 不为每个任务改架构,而是靠规模和数据覆盖。 |
| 大规模评测 | 同时看语言理解、推理、代码和多语种能力。 |
这三点合在一起,给这篇论文建立了一个最小可理解模型:先看它把问题切在哪里,再看它把哪部分交给模型、哪部分交给外部结构。
手工 toy 复现
Section titled “手工 toy 复现”把一个小模型分别拿去做翻译、数学和代码补全,会看到能力割裂;PaLM 的核心观察是同一底座规模变大后,少样本提示能跨更多任务工作。
这个 toy 复现只验证机制直觉,不声明论文原始指标已复现。真正升级为 VERIFIED 需要独立执行证据和 review receipt 绑定。
- PaLM 不是“只要变大就自动安全”:PaLM 不是“只要变大就自动安全”,安全和事实性仍要单独治理。
- 论文报告的是系统级结果:论文报告的是系统级结果,普通团队不能按同样算力复现。
- emergent ability 的表述容易被过度神化:emergent ability 的表述容易被过度神化,很多能力依赖评测阈值和 prompting。
- dense 540B 的服务成本很高:dense 540B 的服务成本很高,后来 MoE、小模型和蒸馏都在补这个问题。
- PaLM 证明 foundation model 可以成为多任务产品底座。
- 规模收益必须和训练系统、数据治理、评测矩阵一起看。
- 它是 Minerva、Flan-PaLM 等后续路线的重要上游。