GSM8K — 小学数学题把大模型算术短板照出来
已复核 · 稳定内容Training Verifiers to Solve Math Word Problems 是一篇 LLM / Math Evaluation 论文。本卡只基于 arXiv 官方元数据和论文静态阅读做研究整理;没有运行作者代码,也没有复现论文分数。
类比:像小学应用题:文字都看得懂,但一步漏算、单位错了,答案就错。
它在本轮 40 篇里的位置是 Batch 10 / evaluation and safety:不是孤立收藏,而是补上 study 论文图谱里还缺的一块。
LLM 在自然语言上强,但多步算术 word problem 容易出现中间步骤错误。
如果把它放进产品工程语境,核心问题是:团队到底应该把不确定性留给模型本身,还是拆给数据、工具、训练目标、评测和系统约束分别处理。
- 它给后续研究提供了一个可引用的名字和问题边界。
- 它把一个模糊能力拆成了可以讨论的机制或流程。
- 它提醒我们不要只看最终 benchmark,而要看数据、约束和验收方式。
- 它能和本库已有笔记形成交叉链接,方便以后按主题复习。
| 设计 | 作用 |
|---|---|
| GSM8K 数据集 | 整理高质量小学数学文字题和解答。 |
| 多样本生成 | 让模型生成多个候选解。 |
| Verifier 重排 | 训练验证器从候选答案中挑更可信的一条。 |
这三点合在一起,给这篇论文建立了一个最小可理解模型:先看它把问题切在哪里,再看它把哪部分交给模型、哪部分交给外部结构。
手工 toy 复现
Section titled “手工 toy 复现”同一题生成 20 个解法,有些列式对、有些算错。verifier 学会偏好步骤自洽且答案正确的候选。
这个 toy 复现只验证机制直觉,不声明论文原始指标已复现。真正升级为 VERIFIED 需要独立执行证据和 review receipt 绑定。
- verifier 也可能学到表面模式:verifier 也可能学到表面模式,不能保证证明正确。
- 小学数学不覆盖高等数学、代码和真实数据分析。:小学数学不覆盖高等数学、代码和真实数据分析。
- 多样本采样提高成本。:多样本采样提高成本。
- 训练集污染会显著影响数学 benchmark。:训练集污染会显著影响数学 benchmark。
- GSM8K 把数学推理评测变成 LLM 标配。
- “生成多个候选 + 验证器选择”是推理可靠性的通用结构。
- 后续 Minerva、PAL、Program of Thoughts 都在围绕它扩展。