跳转到内容

AI 安全与可解释性 · 论文 · 第 1 组

待复核

返回论文全景索引

本分块共 9 条,稳定上限为 100 条。

论文Slug难度可信状态简介
Activation Patching — 因果干预可解释性方法activation-patchingunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Anthropic Circuits — 把 Transformer 当电路逆向anthropic-circuitsunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Causal Abstraction — 神经网络与算法的因果对齐causal-abstractionunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Constitutional AI — Anthropic 的对齐方法constitutional-aiunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Induction Heads — Transformer 的 in-context learning 引擎induction-headsunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Mesa-Optimization 2019 — 训出来的模型自己也是个优化器mesa-optimization-2019unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Sleeper Agents — 故意藏后门的 LLMsleeper-agentsunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Sparse Autoencoders — 把 superposition 解出来sparse-autoencodersunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Toy Models of Superpositiontoy-models-superpositionunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。