分布式训练 / GPU · 论文 · 第 1 组
待复核本分块共 24 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| Alpa — 把张量/流水/数据并行统一成一道搜索题 | alpa-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Aurora 2024 — 不用 NVIDIA 也能造 2 EFLOPS 超算 | aurora-exascale-2024 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Blink — 按拓扑动态拼生成树替代 NCCL ring | blink-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| CUDA Streams 并发量化研究 — 为什么 SM 利用率拉不满 | cuda-streams-concurrency-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| cuDNN — 把卷积写成矩阵乘,让所有深度学习框架共享底层加速 | cudnn-2014 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DeepSpeed ZeRO — 微软优化大模型训练显存 | deepspeed-zero | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| FasterTransformer 2021 — NVIDIA 第一代开源 LLM 推理引擎 | fastertransformer-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| FlashAttention — 不改算法,只改数据怎么进 GPU | flash-attention | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| FPGA HLS 2011 — 把 C 代码自动翻译成芯片电路的范式 | fpga-hls-2011 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| PyTorch FSDP — 把大模型切成 N 份分到 N 张卡 | fsdp-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GPipe — micro-batch 流水线让 GPU 排成生产线 | gpipe-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Kokkos — 一份 C++ 代码同时跑 CPU、GPU、Xeon Phi | kokkos-2014 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Megatron-LM — NVIDIA 大规模训练框架 | megatron-lm | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Nickolls-Dally 2010 — GPU 怎么从画三角形变成跑 AI | nickolls-dally-2010-cuda-era | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Owens 2007 GPGPU 综述 — CUDA 之前 GPU 通用计算的黑魔法时代 | owens-2007-gpgpu-survey | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| PipeDream — 1F1B 调度让流水线工位别空等 | pipedream-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Quantum Supremacy 2019 — 量子机用 200 秒做完超算 1 万年的事 | quantum-supremacy-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Ring All-Reduce — 把 HPC 的环形规约搬进深度学习 | ring-allreduce-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SGLang — 把 LLM 程序当成共享前缀的树来跑 | sglang-2024 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SYCL 2020 — 用一份标准 C++ 让 GPU/CPU/加速器一起跑 | sycl-cpp-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| TensorRT-LLM — NVIDIA 把 FT 升级成可调度的官方推理栈 | tensorrt-llm-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Thrust — 让 GPU 编程像写 STL 一样一行调用 | thrust-2010 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| vLLM — 把操作系统的分页搬进 GPU KV cache | vllm | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ZeRO 2020 — 把训练状态切成 N 份让万亿参数成为可能 | zero-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |