强化学习 · 论文 · 第 1 组
待复核本分块共 8 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| A3C — 多个 CPU 同时跑游戏,让 RL 不再吃 GPU | a3c-2016 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AlphaGo — 击败围棋世界冠军 | alphago | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Decision Transformer — 把强化学习当成”文字接龙” | decision-transformer-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DPO — Direct Preference Optimization | dpo | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DQN — Deep Q-Network | dqn | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MuZero — 不用规则也能下棋 | muzero | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| PPO — Proximal Policy Optimization | ppo | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RLHF Christiano 2017 — 人类偏好做奖励 | rlhf-christiano | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |