智能体与 LLM 系统 · 论文 · 第 1 组
待复核本分块共 100 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| Active Environmental Injection — 多模态 Agent 的环境伪装攻击 | active-environmental-injection | intermediate | UNVERIFIED | 用 Active Environmental Injection 理解 GUI / 多模态 agent 为什么会被环境里的假按钮、假提示和视觉干扰劫持 |
| Agent Planning Benchmark — 把 agent 失败拆成规划诊断题 | agent-planning-benchmark-2026 | intermediate | UNVERIFIED | 用 APB 拆解 LLM agent 的规划、反馈修正、工具噪声和无解任务校准 |
| Agent-R1 — 把 LLM agent 当 RL 环境训练的模块化框架 | agent-r1-2511 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AgentDojo — 测试工具型 agent 的 prompt injection 攻防场 | agentdojo | intermediate | UNVERIFIED | 用 AgentDojo 理解为什么工具型 LLM agent 的安全评测必须把不可信工具数据、攻击目标和防御策略放进同一个动态环境 |
| Agentic Context Engineering — 把上下文当成会进化的 playbook | agentic-context-engineering-2025 | intermediate | UNVERIFIED | ACE 将上下文视为可演化 playbook,用生成、反思和整理缓解 context collapse |
| Agentless — 反 Agent 派的 SWE-bench 解法 | agentless | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AndroidWorld — 动态 Android 环境里的移动端 agent 评测 | androidworld | intermediate | UNVERIFIED | 用 AndroidWorld 理解移动 GUI agent 为什么需要真实 App、动态任务、初始化和成功检查,而不只是截图问答 |
| Anthropic Prompt Caching — 让长 prompt 只算一次,后续只付 10% | anthropic-prompt-caching | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| APEX — 给自进化 agent 配一张”策略图”防止它走老路 | apex-policy-exploration | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AppWorld — 多 App 世界里的交互式代码 agent | appworld | intermediate | UNVERIFIED | 用 AppWorld 理解为什么工具调用 benchmark 需要状态、用户、多个 App 和可执行代码,而不是单轮 API 序列 |
| AssistantBench — 真实耗时 Web 任务里的助手评测 | assistantbench | intermediate | UNVERIFIED | 用 AssistantBench 理解为什么 web agent 不能只测短路径点击,还要测耗时、开放、可自动验收的现实任务 |
| AutoGen — 多智能体对话框架 | autogen | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AWQ — 看激活脸色给权重打折 | awq | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| AWQ 2023 — 把 70B 大模型权重压到 35GB | awq-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BIG-Bench Hard — 从大题库里挑出模型最头疼的 23 类题 | big-bench-hard-2022 | intermediate | UNVERIFIED | 用 BBH 理解为什么 benchmark 需要难题子集和 CoT 对照 |
| BLOOM — 把 176B 多语种模型做成开放科学工程 | bloom-2022 | intermediate | UNVERIFIED | 用 BLOOM 理解大模型也可以用社区协作、数据治理和开放发布来推进 |
| Privacy Practices of Browser Agents — 浏览器 Agent 的隐私行为盘点 | browser-agent-privacy | intermediate | UNVERIFIED | 用 Privacy Practices of Browser Agents 理解浏览器 agent 为什么是高风险隐私边界,而不只是自动点击工具 |
| BrowserGym — Web Agent 研究的统一浏览器环境 | browsergym | intermediate | UNVERIFIED | 用 BrowserGym 理解为什么 web agent 需要统一 observation / action / evaluation 接口,而不是每个 benchmark 各跑一套 |
| Chain-of-Thought — 让大模型先写步骤再回答 | chain-of-thought | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ClawTrace — 把 agent 每步操作的”成本账”先算清再蒸馏 | clawtrace-cost-aware | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Code as Agent Harness — 把代码当 agent 的”骨架”来重新看 agentic AI | code-as-agent-harness | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Chain-of-Thought Prompting | cot | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| EAGLE — 让大模型先在”特征层”猜下一步而不是猜 token | eagle | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| EffiSkill — 把代码效率优化经验抽成两层 skill 库 | effiskill | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| EVE-Agent — 自我训练前先把证据钉在桌上 | eve-agent-evidence | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Evo-Memory — 给”会自己长记性”的 agent 出一份统一考卷 | evo-memory-2511 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| EXG 经验图 — 把 agent 的成败拼成一张可复用的关系图 | exg-experience-graphs | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GAIA — 通用 AI 助手的现实任务基准 | gaia | intermediate | UNVERIFIED | 用 GAIA 理解为什么真正的助手能力不等于专业考试高分,而是能组合推理、多模态、浏览和工具 |
| Generative Agents — 用记忆、反思和计划模拟可信的人类行为 | generative-agents | intermediate | UNVERIFIED | 用 Generative Agents 理解 LLM agent 为什么需要 memory stream、reflection 和 planning,而不只是单轮 prompt |
| Gorilla — 让 LLM 学会查 API 文档再调用 | gorilla-2023 | intermediate | UNVERIFIED | 用 Gorilla 理解 API grounding 如何降低工具调用幻觉 |
| GPTQ — 把 175B 大模型压成 4-bit 还几乎不掉点 | gptq-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GraphRAG — 微软的知识图谱 + RAG | graphrag | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| GSM8K — 小学数学题把大模型算术短板照出来 | gsm8k-2021 | intermediate | UNVERIFIED | 用 GSM8K 理解数学 word problem、verifier 和采样重排为什么重要 |
| HuggingGPT — 让 ChatGPT 当任务调度员,模型库当工具箱 | hugginggpt-2023 | intermediate | UNVERIFIED | 用 HuggingGPT 理解 LLM 如何规划并调用专用模型完成多模态任务 |
| InjecAgent — 工具型 LLM Agent 的间接 Prompt Injection 基准 | injecagent | intermediate | UNVERIFIED | 用 InjecAgent 理解为什么外部邮件、网页和工具内容会把 agent 从用户目标劫持到攻击者目标 |
| Inner Monologue — 让机器人把观察结果说回计划里 | inner-monologue-2022 | intermediate | UNVERIFIED | 用 Inner Monologue 理解闭环反馈如何让语言计划接上真实环境变化 |
| InstructGPT — RLHF 让 LLM 听话 | instructgpt | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Scaling Laws — 大模型训练不是玄学,是幂律预算题 | kaplan-scaling-laws-2020 | advanced | UNVERIFIED | 用 Kaplan scaling laws 理解参数、数据和计算量怎样一起决定语言模型损失 |
| KV-Fold — 把 KV cache 当成 fold 的累加器,一段一段读长文 | kv-fold | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LaMDA — 聊天模型先学会有用、具体和不乱说 | lamda-2022 | intermediate | UNVERIFIED | 用 LaMDA 理解开放域对话模型为什么需要质量、安全和 groundedness 三条线 |
| LATS — 把推理、行动和规划统一进语言 Agent 树搜索 | lats | intermediate | UNVERIFIED | 用 LATS 理解为什么 agent 不一定要线性执行 ReAct 轨迹,也可以在环境反馈下做搜索、反思和回溯 |
| Least-to-Most — 先拆小题,再解大题 | least-to-most-prompting-2022 | intermediate | UNVERIFIED | 用 Least-to-Most Prompting 理解复杂推理为什么要先分解再逐步求解 |
| LLM.int8() — 大模型激活值里藏着几个超大异常通道 | llm-int8-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| LLM-Wiki — 把外部知识编译成 agent 自己的”维基” | llm-wiki-retrieval-reasoning | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MCP-Bench — 用真实 MCP Server 测 agent 工具编排 | mcp-bench-2025 | intermediate | UNVERIFIED | MCP-Bench 通过 28 个 live MCP server 和 250 个工具评估多步工具编排 |
| MCP — 让一个 LLM 客户端能插任何外部能力的 USB 协议 | mcp-spec | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MCPWorld — API、GUI、混合 Computer Use 的统一测试床 | mcpworld-2025 | intermediate | UNVERIFIED | MCPWorld 用 white-box apps 统一评估 API、GUI 和混合 computer-use agents |
| MemCoder — code agent 跟着你 git commit 一起成长 | memcoder-co-evolution | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MemGPT — 把 LLM 记忆管理做成一套虚拟上下文操作系统 | memgpt | intermediate | UNVERIFIED | 用 MemGPT 理解为什么长程 agent 不能只靠扩大 context window,而要显式管理快速记忆、长期记忆和控制流 |
| MemGym — 给长程 agent memory 做一间健身房 | memgym | intermediate | UNVERIFIED | 用 MemGym 区分聊天记忆、执行记忆和可迁移的 agent 经验 |
| MemoryBank — 给 LLM 长期陪伴场景加用户记忆 | memorybank | intermediate | UNVERIFIED | 用 MemoryBank 理解长期记忆为什么不只是检索历史对话,还要更新用户画像、选择性遗忘和强化重要记忆 |
| MetaGPT — 多智能体软件公司 | metagpt | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MIND-Skill — 用归纳和演绎双 agent 抽 skill 并保证质量 | mind-skill | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Mind2Web — 面向任意网站的泛化 web agent 数据集 | mind2web | intermediate | UNVERIFIED | 用 Mind2Web 理解 web agent 为什么要跨网站、跨领域、跨交互模式评估,而不是只在固定模拟站点里刷分 |
| Minerva — 把语言模型拉进数学草稿纸 | minerva-2022 | advanced | UNVERIFIED | 用 Minerva 理解为什么数学推理需要专门的数据、逐步解题和采样验证 |
| Misevolution — 自进化 agent 也会”越改越坏”,连顶配模型也躲不过 | misevolution-2509 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Mistral 7B — 小模型靠架构细节打出性价比 | mistral-7b-2023 | intermediate | UNVERIFIED | 用 Mistral 7B 理解 grouped-query attention 和 sliding-window attention 如何服务高效开源模型 |
| MLE-bench — 用 Kaggle 任务衡量机器学习工程 agent | mle-bench | intermediate | UNVERIFIED | 用 MLE-bench 理解 ML 工程 agent 为什么不能只靠单元测试和代码 benchmark 来评估 |
| MMSkills — 把视觉 agent 的”操作经验”做成多模态卡片 | mmskills-multimodal | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| MRKL — 给大模型配一组专家工具和路由器 | mrkl-systems-2022 | intermediate | UNVERIFIED | 用 MRKL Systems 理解 neuro-symbolic agent 为什么要把 LLM、检索和计算模块拆开 |
| Super-NaturalInstructions — 1600+ 任务教模型读懂说明书 | natural-instructions-v2-2022 | intermediate | UNVERIFIED | 用 Super-NaturalInstructions 理解 declarative instructions 如何评测任务泛化 |
| NestedKV — 用三层记忆决定 KV cache 该留谁 | nestedkv | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| OpenHands — 开源 AI 软件工程师 | openhands | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| OPT — 把 GPT-3 级训练日志打开给研究社区 | opt-2022 | intermediate | UNVERIFIED | 用 OPT 理解开放权重、训练日志和复现实验对 LLM 研究的重要性 |
| Orca — Transformer 生成模型的分布式推理调度 | orca-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Orca — 让一批 LLM 请求随到随走,不再排队等最长那个 | orca-continuous-batching | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Orca — 小模型不只抄答案,还学解释轨迹 | orca-explanation-tuning-2023 | intermediate | UNVERIFIED | 用 Orca 理解 explanation tuning 为什么比只蒸馏最终答案更像教学生 |
| OSCAR — 离线转个方向,把 KV Cache 压到 2-bit | oscar-int2-kv | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| OSWorld — 把 GUI agent 放进真正的电脑里考试 | osworld | intermediate | UNVERIFIED | 用 OSWorld 理解为什么电脑操作 agent 不能只在网页或脚本环境里评测 |
| P-Tuning v2 — 把 prompt tuning 深插到每一层 | p-tuning-v2-2021 | intermediate | UNVERIFIED | 用 P-Tuning v2 理解深层连续提示为什么能跨规模和任务接近 fine-tuning |
| PagedAttention — 把 KV cache 当虚拟内存页来管理 | paged-attention | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| PagedAttention — 以页替代整段内存的显存管理 | paged-attention-vllm | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| PAL — 让 Python 成为语言模型的草稿纸 | pal-code-reasoning-2022 | intermediate | UNVERIFIED | 用 PAL 理解 Program-aided Language Models 如何把推理转成可运行代码 |
| PaLM — Pathways 把 540B LLM 扩成统一底座 | palm-2022 | advanced | UNVERIFIED | 用 PaLM 理解大规模 dense decoder 如何在多任务、推理和代码能力上同时冒头 |
| Plan-and-Solve — 零样本推理先写计划再执行 | plan-and-solve-prompting-2023 | intermediate | UNVERIFIED | 用 Plan-and-Solve 理解为什么 prompt 可以显式拆成 plan 和 solve 两段 |
| Prefix-Tuning — 不改模型,只给每层塞一段可训练前缀 | prefix-tuning-2021 | intermediate | UNVERIFIED | 用 Prefix-Tuning 理解连续 prompt 如何成为参数高效微调方法 |
| Program of Thoughts — 让模型写程序,把计算交给解释器 | program-of-thoughts-2022 | intermediate | UNVERIFIED | 用 Program of Thoughts 理解自然语言推理和精确计算为什么要分工 |
| Prompt Tuning — 规模变大后,软提示也能接近微调 | prompt-tuning-2021 | intermediate | UNVERIFIED | 用 Prompt Tuning 理解为什么 soft prompt 在大模型上突然变得有效 |
| QLoRA — 4-bit 量化底座上贴 LoRA 也能微调 | qlora-2023 | advanced | UNVERIFIED | 用 QLoRA 理解 NF4、double quantization 和 paged optimizers 如何降低微调门槛 |
| RAG (Lewis 2020) — 检索增强生成奠基 | rag-lewis-2020 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ReAct — Reasoning and Acting | react | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ReAct Agent — 推理和行动交替的工具使用范式 | react-agent | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Reflexion — 让 LLM 自我反思 | reflexion | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RETRO — DeepMind 的检索增强 LLM | retro | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| RULER — 真实长上下文能力不能只看 NIAH | ruler-long-context | intermediate | UNVERIFIED | 用 RULER 理解长上下文模型的有效窗口、检索幻觉和聚合推理为什么要分开评测 |
| SayCan — 机器人不只问“想做什么”,还问“我能做什么” | saycan-2022 | intermediate | UNVERIFIED | 用 SayCan 理解语言模型和机器人 affordance 如何合成可执行动作 |
| Self-Consistency — 让模型把同一道题做 40 遍再投票 | self-consistency-2022 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| 自进化 AI agent 综述 — 给”会自己升级”的 agent 画一张统一地图 | self-evolving-agents-survey | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Self-Evolving RecSys — 让 LLM agent 自己跑超参实验上线 | self-evolving-recsys-2602 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| BDI-LLM Self-Evolving Agents — 让 agent 自己改自己源代码 | self-evolving-software-agents | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Self-Instruct — 让模型自己造指令数据再学习 | self-instruct-2022 | intermediate | UNVERIFIED | 用 Self-Instruct 理解指令微调数据如何从少量种子任务扩展出来 |
| SkCC — 给 LLM agent 写一个真正的 skill 编译器 | skcc-skill-compiler | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Skill-as-Pseudocode — 把 agent 笔记本写成可校验的伪代码 | skill-as-pseudocode | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Skill-Pro — 不动权重学可复用 skill 的非参数 PPO | skill-pro-nonparametric-ppo | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Skill-SD — 用 agent 自己抽出的 skill 当 dynamic teacher 自蒸馏 | skill-sd-self-distillation | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SmoothQuant 2023 — 把激活的烫手山芋扔给权重 | smoothquant-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SparseGPT — 175B 大模型一次过剪 50%,不重训 | sparsegpt-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SpecInfer — 让大模型一次”猜一棵树”再并行验证 | specinfer-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| Speculative Decoding — 小模型先猜,大模型只验收 | speculative-decoding-2022 | advanced | UNVERIFIED | 用 Speculative Decoding 理解如何不改变分布地加速自回归生成 |
| STaR — 模型先试着讲理由,再用对的理由训练自己 | star-self-taught-reasoner-2022 | intermediate | UNVERIFIED | 用 STaR 理解 rationale bootstrapping 怎样减少人工推理标注 |