生成模型 / 扩散 · 论文 · 第 1 组
待复核本分块共 14 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| ControlNet — 给扩散模型加一条可控条件支路 | controlnet-2023 | intermediate | UNVERIFIED | 用 ControlNet 理解边缘、姿态和深度图如何稳定控制图像生成 |
| DALL-E 2 — 基于 CLIP + 扩散的图像生成 | dalle-2 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DDIM — 把扩散模型 1000 步采样压到 50 步 | ddim-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DDPM — Denoising Diffusion Probabilistic Models | ddpm | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DiT — Diffusion Transformer | dit | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DreamBooth — 用几张图把一个新主体塞进生成模型 | dreambooth-2022 | intermediate | UNVERIFIED | 用 DreamBooth 理解 subject-driven generation 怎样让扩散模型记住特定对象 |
| DreamFusion — 用 2D 扩散模型当老师,把 NeRF 教成 3D | dreamfusion-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| EDM — 把扩散模型的训练配方一次拆清楚 | edm-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LLaVA — 开源多模态对话模型 | llava | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Magic3D — 把 DreamFusion 的 NeRF 拆成”先粗后精”两阶段 | magic3d-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Parti — 把文生图当作翻译,用自回归 Transformer 一像素接一像素地写 | parti-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Prompt-to-Prompt — 改词不改构图的 cross-attention 编辑 | prompt-to-prompt-2022 | intermediate | UNVERIFIED | 用 Prompt-to-Prompt 理解扩散模型里文本 token 和图像布局如何对齐 |
| Stable Diffusion — 开源文生图引爆 | stable-diffusion | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Textual Inversion — 给新概念学一个专属 token | textual-inversion-2022 | intermediate | UNVERIFIED | 用 Textual Inversion 理解冻结扩散模型时如何只学习概念 embedding |