NLP 基础与 Scaling · 论文 · 第 1 组
待复核本分块共 100 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| Adafactor — 把 Adam 的优化器内存从 O(d) 压到 O(√d) | adafactor-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Adam — 让深度学习自己挑步长的优化器 | adam-2014 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AdamW — 把 weight decay 从梯度里拆出来 | adamw-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ALIGN — 用 18 亿条脏图文对训练,证明数据规模能压住噪声 | align-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Atlas — 把检索器和生成器一起训练,11B 打 540B | atlas-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Attention Is All You Need | attention | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Batch Normalization — 把每层激活值规整到 0 均值 1 方差,深网训练时间砍成 1/14 | batchnorm-2015 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BERT — 双向 Transformer 预训练 | bert | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BigBird — 用稀疏 attention 拉长 Transformer 视野 | bigbird-2020 | advanced | UNVERIFIED | 用 BigBird 理解局部、全局和随机 attention 怎样组成长序列模式 |
| BigGAN — 把 GAN 暴力放大到 ImageNet 512×512 | biggan-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BLIP-2 — 用 188M 小桥接器把冻结的视觉模型和大语言模型拼起来 | blip2-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| CCOPD — 让多轮对话别被自己的旧话带偏 | ccopd-distillation | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Chatbot Arena — 让真人盲投,给 LLM 排出公允座次 | chatbot-arena-2024 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Chinchilla — 训练大模型的数据/参数最优比 | chinchilla | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Classifier-Free Guidance — 让扩散模型自己听懂条件 | classifier-free-guidance-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Code Llama — 开源代码模型的完整训练配方 | codellama-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Codex — 让 GPT 学会写 Python,并造一把尺子量它 | codex-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| COMPOSE — 用引用图和 Mathlib 图预测未来定理 | compose-future-theorems | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Compositional Incoherence — 多组件 LLM 拼出来的概率账单不守恒 | compositional-incoherence | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Consistency Models — 把 50 步扩散压成 1 步出图 | consistency-models-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Continual Pretraining Survey 2026 — 大模型持续学习入门 | continual-pretrain-survey-2026 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DDPG 2015 — 让神经网络直接学会连续动作控制 | ddpg-2015 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AI safety via debate — 让两个 AI 互辩,人类只当评委 | debate-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DeBERTa — 把”内容”和”位置”拆成两路独立看的 BERT | deberta-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DeepSeek-Coder — 按整个仓库喂代码的开源 SOTA | deepseek-coder-2024 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DeepSeek R1 — 强化学习推理模型 | deepseek-r1 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Demystifying Data Organization — 给训练数据排队的四条原则 | demystifying-data-org | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Diffusion Posterior Samplers Fail — 用有限样本看清扩散后验采样为什么翻车 | diffusion-posterior-finite | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| DistServe — 把 prefill 和 decode 拆到不同 GPU 上跑 | distserve | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Double Descent — 模型越大越准,过参数化时代的反常识曲线 | double-descent-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Dropout — 训练时随机关掉一半神经元,反而学得更好 | dropout-2014 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ELECTRA — 把猜词题改成判真假题,训练效率 4 倍 | electra-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ELMo — 让词向量随上下文变化 | elmo-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Entity Tracking States — 语言模型不是一路记账,而是最后临时汇总 | entity-tracking-states | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Flamingo — 让冻结的大模型学会看图,几张样例就上手 | flamingo-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| FLAN — 用自然语言指令教模型学会”听话” | flan-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GAT — 让图神经网络的邻居自带权重 | gat-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GCN 2017 — 把卷积搬到图结构上的最简版本 | gcn-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Gemini 1.5 — 百万 token 多模态上下文的工程样板 | gemini-1.5-2024 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Goal Misgeneralization — 奖励函数完全正确,AI 还是可能学歪 | goal-misgeneralization-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GPT-3 — Language Models are Few-Shot Learners | gpt-3 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Graphormer — 标准 Transformer 直接刷爆 GNN | graphormer-2021 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GraphSAGE 2017 — 给没见过的节点也能算嵌入 | graphsage-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Grokking — 训练 loss 早归零,几千步后才突然学会 | grokking-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GRU 2014 — 用两个门替代 LSTM 三个门,编码-解码范式登场 | gru-2014 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GShard — 用注解让 600B 模型自动跨设备切片 | gshard-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| HullFT — 让测试时微调既会挑样本又省算力 | hullft-ttft | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Imagen — 文生图真正的引擎是语言模型 | imagen-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| KVBudget — 给每条请求划一块 KV cache 预算 | kv-cache-budget-2026 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Label Smoothing — 别让模型对正确答案过度自信 | label-smoothing-2016 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Layer Normalization — 把归一化方向从 batch 转到 feature,让 RNN/Transformer 也能稳定训 | layernorm-2016 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Linear Attention, Still: Why Mamba-style Models Plateau | linear-attention-still-2026 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Linformer — 把 attention 矩阵投影成线性复杂度 | linformer-2020 | advanced | UNVERIFIED | 用 Linformer 理解低秩假设如何压缩 self-attention |
| Lion — 让程序自己搜出来的优化器,比 AdamW 内存少一半 | lion-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LLaMA — Meta 开源大语言模型 | llama | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LLMSurgeon — 从模型回答反推训练数据配方 | llmsurgeon-data-mixture | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LoMo — 把同一句话换成图片也要看懂 | lomo-modality | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Longformer — 滑窗加少数全局 token,把长文档喂进 Transformer | longformer-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LongNet — 用 dilated attention 把上下文推到十亿 token 想象空间 | longnet-2023 | advanced | UNVERIFIED | 用 LongNet 理解扩张式 attention 如何在多尺度上连接超长序列 |
| Loong DocMT — 长文档翻译里的会挑上下文的代理 | loong-doc-mt | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LoRA — 给冻结大模型贴低秩便签 | lora | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| 彩票假设 — 大网里藏着一张能独立训出来的小网 | lottery-ticket-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LSTM — 用门控让神经网络记得住上一段话 | lstm-1997 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Mamba — 选择性状态空间模型 | mamba | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MAML — 学一个”好起点”,几步就能学会新任务 | maml-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MedCase-Structured — 把病例文字变成 FHIR 病历来考 LLM | medcase-fhir | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MemFT-LoRA — 用 LoRA 量出大模型能背多少精确内容 | mem-ft-lora | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MIRA Rubric — 给混合训练数据先定评分尺再筛选 | mira-rubric | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Mixture of Experts (MoE) | mixture-of-experts | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| mixup — 把两张图按比例叠成一张,标签也一起叠 | mixup-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Mode Connectivity — 神经网络的两个最优解之间有低洼走廊 | mode-connectivity-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| N-BEATS — 纯前馈网络在时序预测上打败统计派 | nbeats-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Cognitive Architectures for Language Agents (CoALA) | nlp-agent-2024 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RAG for AIGC: 检索增强生成在 AI 生成内容中的应用 — 学习笔记 | nlp-rag-2024 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| NTK — 把无限宽的神经网络变成一个可解的核方法 | ntk-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Optuna — 让超参搜索像写普通 Python 代码一样自然 | optuna | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Performer — 用随机特征把 softmax attention 拉成线性复杂度 | performer-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| PPC Preplan — 先想清楚题目类型再规划解法 | ppc-preplan | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Beyond LRU — 混杂负载下的 LLM 前缀缓存淘汰(UniCache) | prefix-cache-policy-2026 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ProjectionBench — 用逐步揭示信息测试科学假说生成 | projection-bench | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Prototypical Networks — 每类算个均值,比距离就够了 | prototypical-networks-2017 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Reasoning with Sampling — 在关键决策点重采样推理过程 | reasoning-with-sampling | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Reformer — 用哈希分桶把 attention 从 O(L²) 压到 O(L log L) | reformer-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| REPLUG — 不动 LLM 一根毛,只把检索器调到它的”口味”上 | replug-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Resolution Diagnostics — 判断 LLM 排名差距有没有统计分辨率 | resolution-diagnostics-llm | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Concrete Problems in AI Safety — 把 AI 安全风险拆成工程问题 | reward-hacking | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RiM Latent Reasoning — 给 LLM 一块不用说出口的工作记忆 | rim-latent-reasoning | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RoBERTa — 把 BERT 重训一遍就能拿 SOTA | roberta-2019 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RWKV — 让 RNN 拿到 Transformer 那张训练并行的入场券 | rwkv-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Soft Actor-Critic — 让强化学习既会拿分又愿意多试 | sac-2018 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Scaling Laws — 神经语言模型的缩放规律 | scaling-laws | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SchGen PCB — 把一句需求变成可编辑电路原理图 | schgen-pcb | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Self-RAG — 让模型自己决定何时该查资料 | self-rag-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Self-Refine — 让同一个模型自己改自己写的东西 | self-refine-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Self-Trained Verification — 让模型先看标准答案学会挑错 | self-trained-verification | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Seq2Seq — 把翻译变成端到端神经网络 | seq2seq-2014 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Sophia — 让二阶优化器第一次在 LLM 预训练里跑得动 | sophia-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SoundnessBench — 判断 AI 科学家会不会把坏点子当好点子 | soundness-bench | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| StarCoder — 把训练数据完整公开的 15B 代码模型 | starcoder-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| StyleGAN2 — 把 StyleGAN 的水滴瑕疵和潜空间纠葛一起修掉 | stylegan2-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |