AI 安全与可解释性 · 论文 · 第 1 组
待复核本分块共 9 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| Activation Patching — 因果干预可解释性方法 | activation-patching | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Anthropic Circuits — 把 Transformer 当电路逆向 | anthropic-circuits | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Causal Abstraction — 神经网络与算法的因果对齐 | causal-abstraction | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Constitutional AI — Anthropic 的对齐方法 | constitutional-ai | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Induction Heads — Transformer 的 in-context learning 引擎 | induction-heads | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Mesa-Optimization 2019 — 训出来的模型自己也是个优化器 | mesa-optimization-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Sleeper Agents — 故意藏后门的 LLM | sleeper-agents | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Sparse Autoencoders — 把 superposition 解出来 | sparse-autoencoders | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Toy Models of Superposition | toy-models-superposition | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |