跳转到内容

强化学习 · 论文 · 第 1 组

待复核

返回论文全景索引

本分块共 8 条,稳定上限为 100 条。

论文Slug难度可信状态简介
A3C — 多个 CPU 同时跑游戏,让 RL 不再吃 GPUa3c-2016unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
AlphaGo — 击败围棋世界冠军alphagounknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Decision Transformer — 把强化学习当成”文字接龙”decision-transformer-2021unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
DPO — Direct Preference OptimizationdpounknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
DQN — Deep Q-NetworkdqnunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
MuZero — 不用规则也能下棋muzerounknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
PPO — Proximal Policy OptimizationppounknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
RLHF Christiano 2017 — 人类偏好做奖励rlhf-christianounknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。