跳转到内容

智能体与 LLM 系统 · 论文 · 第 1 组

待复核

返回论文全景索引

本分块共 100 条,稳定上限为 100 条。

论文Slug难度可信状态简介
Active Environmental Injection — 多模态 Agent 的环境伪装攻击active-environmental-injectionintermediateUNVERIFIED用 Active Environmental Injection 理解 GUI / 多模态 agent 为什么会被环境里的假按钮、假提示和视觉干扰劫持
Agent Planning Benchmark — 把 agent 失败拆成规划诊断题agent-planning-benchmark-2026intermediateUNVERIFIED用 APB 拆解 LLM agent 的规划、反馈修正、工具噪声和无解任务校准
Agent-R1 — 把 LLM agent 当 RL 环境训练的模块化框架agent-r1-2511unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
AgentDojo — 测试工具型 agent 的 prompt injection 攻防场agentdojointermediateUNVERIFIED用 AgentDojo 理解为什么工具型 LLM agent 的安全评测必须把不可信工具数据、攻击目标和防御策略放进同一个动态环境
Agentic Context Engineering — 把上下文当成会进化的 playbookagentic-context-engineering-2025intermediateUNVERIFIEDACE 将上下文视为可演化 playbook,用生成、反思和整理缓解 context collapse
Agentless — 反 Agent 派的 SWE-bench 解法agentlessunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
AndroidWorld — 动态 Android 环境里的移动端 agent 评测androidworldintermediateUNVERIFIED用 AndroidWorld 理解移动 GUI agent 为什么需要真实 App、动态任务、初始化和成功检查,而不只是截图问答
Anthropic Prompt Caching — 让长 prompt 只算一次,后续只付 10%anthropic-prompt-cachingunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
APEX — 给自进化 agent 配一张”策略图”防止它走老路apex-policy-explorationunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
AppWorld — 多 App 世界里的交互式代码 agentappworldintermediateUNVERIFIED用 AppWorld 理解为什么工具调用 benchmark 需要状态、用户、多个 App 和可执行代码,而不是单轮 API 序列
AssistantBench — 真实耗时 Web 任务里的助手评测assistantbenchintermediateUNVERIFIED用 AssistantBench 理解为什么 web agent 不能只测短路径点击,还要测耗时、开放、可自动验收的现实任务
AutoGen — 多智能体对话框架autogenunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
AWQ — 看激活脸色给权重打折awqunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
AWQ 2023 — 把 70B 大模型权重压到 35GBawq-2023unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
BIG-Bench Hard — 从大题库里挑出模型最头疼的 23 类题big-bench-hard-2022intermediateUNVERIFIED用 BBH 理解为什么 benchmark 需要难题子集和 CoT 对照
BLOOM — 把 176B 多语种模型做成开放科学工程bloom-2022intermediateUNVERIFIED用 BLOOM 理解大模型也可以用社区协作、数据治理和开放发布来推进
Privacy Practices of Browser Agents — 浏览器 Agent 的隐私行为盘点browser-agent-privacyintermediateUNVERIFIED用 Privacy Practices of Browser Agents 理解浏览器 agent 为什么是高风险隐私边界,而不只是自动点击工具
BrowserGym — Web Agent 研究的统一浏览器环境browsergymintermediateUNVERIFIED用 BrowserGym 理解为什么 web agent 需要统一 observation / action / evaluation 接口,而不是每个 benchmark 各跑一套
Chain-of-Thought — 让大模型先写步骤再回答chain-of-thoughtunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
ClawTrace — 把 agent 每步操作的”成本账”先算清再蒸馏clawtrace-cost-awareunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Code as Agent Harness — 把代码当 agent 的”骨架”来重新看 agentic AIcode-as-agent-harnessunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Chain-of-Thought PromptingcotunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
EAGLE — 让大模型先在”特征层”猜下一步而不是猜 tokeneagleunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
EffiSkill — 把代码效率优化经验抽成两层 skill 库effiskillunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
EVE-Agent — 自我训练前先把证据钉在桌上eve-agent-evidenceunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Evo-Memory — 给”会自己长记性”的 agent 出一份统一考卷evo-memory-2511unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
EXG 经验图 — 把 agent 的成败拼成一张可复用的关系图exg-experience-graphsunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
GAIA — 通用 AI 助手的现实任务基准gaiaintermediateUNVERIFIED用 GAIA 理解为什么真正的助手能力不等于专业考试高分,而是能组合推理、多模态、浏览和工具
Generative Agents — 用记忆、反思和计划模拟可信的人类行为generative-agentsintermediateUNVERIFIED用 Generative Agents 理解 LLM agent 为什么需要 memory stream、reflection 和 planning,而不只是单轮 prompt
Gorilla — 让 LLM 学会查 API 文档再调用gorilla-2023intermediateUNVERIFIED用 Gorilla 理解 API grounding 如何降低工具调用幻觉
GPTQ — 把 175B 大模型压成 4-bit 还几乎不掉点gptq-2023unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
GraphRAG — 微软的知识图谱 + RAGgraphragunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
GSM8K — 小学数学题把大模型算术短板照出来gsm8k-2021intermediateUNVERIFIED用 GSM8K 理解数学 word problem、verifier 和采样重排为什么重要
HuggingGPT — 让 ChatGPT 当任务调度员,模型库当工具箱hugginggpt-2023intermediateUNVERIFIED用 HuggingGPT 理解 LLM 如何规划并调用专用模型完成多模态任务
InjecAgent — 工具型 LLM Agent 的间接 Prompt Injection 基准injecagentintermediateUNVERIFIED用 InjecAgent 理解为什么外部邮件、网页和工具内容会把 agent 从用户目标劫持到攻击者目标
Inner Monologue — 让机器人把观察结果说回计划里inner-monologue-2022intermediateUNVERIFIED用 Inner Monologue 理解闭环反馈如何让语言计划接上真实环境变化
InstructGPT — RLHF 让 LLM 听话instructgptunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Scaling Laws — 大模型训练不是玄学,是幂律预算题kaplan-scaling-laws-2020advancedUNVERIFIED用 Kaplan scaling laws 理解参数、数据和计算量怎样一起决定语言模型损失
KV-Fold — 把 KV cache 当成 fold 的累加器,一段一段读长文kv-foldunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
LaMDA — 聊天模型先学会有用、具体和不乱说lamda-2022intermediateUNVERIFIED用 LaMDA 理解开放域对话模型为什么需要质量、安全和 groundedness 三条线
LATS — 把推理、行动和规划统一进语言 Agent 树搜索latsintermediateUNVERIFIED用 LATS 理解为什么 agent 不一定要线性执行 ReAct 轨迹,也可以在环境反馈下做搜索、反思和回溯
Least-to-Most — 先拆小题,再解大题least-to-most-prompting-2022intermediateUNVERIFIED用 Least-to-Most Prompting 理解复杂推理为什么要先分解再逐步求解
LLM.int8() — 大模型激活值里藏着几个超大异常通道llm-int8-2022unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
LLM-Wiki — 把外部知识编译成 agent 自己的”维基”llm-wiki-retrieval-reasoningunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
MCP-Bench — 用真实 MCP Server 测 agent 工具编排mcp-bench-2025intermediateUNVERIFIEDMCP-Bench 通过 28 个 live MCP server 和 250 个工具评估多步工具编排
MCP — 让一个 LLM 客户端能插任何外部能力的 USB 协议mcp-specunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
MCPWorld — API、GUI、混合 Computer Use 的统一测试床mcpworld-2025intermediateUNVERIFIEDMCPWorld 用 white-box apps 统一评估 API、GUI 和混合 computer-use agents
MemCoder — code agent 跟着你 git commit 一起成长memcoder-co-evolutionunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
MemGPT — 把 LLM 记忆管理做成一套虚拟上下文操作系统memgptintermediateUNVERIFIED用 MemGPT 理解为什么长程 agent 不能只靠扩大 context window,而要显式管理快速记忆、长期记忆和控制流
MemGym — 给长程 agent memory 做一间健身房memgymintermediateUNVERIFIED用 MemGym 区分聊天记忆、执行记忆和可迁移的 agent 经验
MemoryBank — 给 LLM 长期陪伴场景加用户记忆memorybankintermediateUNVERIFIED用 MemoryBank 理解长期记忆为什么不只是检索历史对话,还要更新用户画像、选择性遗忘和强化重要记忆
MetaGPT — 多智能体软件公司metagptunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
MIND-Skill — 用归纳和演绎双 agent 抽 skill 并保证质量mind-skillunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Mind2Web — 面向任意网站的泛化 web agent 数据集mind2webintermediateUNVERIFIED用 Mind2Web 理解 web agent 为什么要跨网站、跨领域、跨交互模式评估,而不是只在固定模拟站点里刷分
Minerva — 把语言模型拉进数学草稿纸minerva-2022advancedUNVERIFIED用 Minerva 理解为什么数学推理需要专门的数据、逐步解题和采样验证
Misevolution — 自进化 agent 也会”越改越坏”,连顶配模型也躲不过misevolution-2509unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Mistral 7B — 小模型靠架构细节打出性价比mistral-7b-2023intermediateUNVERIFIED用 Mistral 7B 理解 grouped-query attention 和 sliding-window attention 如何服务高效开源模型
MLE-bench — 用 Kaggle 任务衡量机器学习工程 agentmle-benchintermediateUNVERIFIED用 MLE-bench 理解 ML 工程 agent 为什么不能只靠单元测试和代码 benchmark 来评估
MMSkills — 把视觉 agent 的”操作经验”做成多模态卡片mmskills-multimodalunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
MRKL — 给大模型配一组专家工具和路由器mrkl-systems-2022intermediateUNVERIFIED用 MRKL Systems 理解 neuro-symbolic agent 为什么要把 LLM、检索和计算模块拆开
Super-NaturalInstructions — 1600+ 任务教模型读懂说明书natural-instructions-v2-2022intermediateUNVERIFIED用 Super-NaturalInstructions 理解 declarative instructions 如何评测任务泛化
NestedKV — 用三层记忆决定 KV cache 该留谁nestedkvunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
OpenHands — 开源 AI 软件工程师openhandsunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
OPT — 把 GPT-3 级训练日志打开给研究社区opt-2022intermediateUNVERIFIED用 OPT 理解开放权重、训练日志和复现实验对 LLM 研究的重要性
Orca — Transformer 生成模型的分布式推理调度orca-2022unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Orca — 让一批 LLM 请求随到随走,不再排队等最长那个orca-continuous-batchingunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Orca — 小模型不只抄答案,还学解释轨迹orca-explanation-tuning-2023intermediateUNVERIFIED用 Orca 理解 explanation tuning 为什么比只蒸馏最终答案更像教学生
OSCAR — 离线转个方向,把 KV Cache 压到 2-bitoscar-int2-kvunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
OSWorld — 把 GUI agent 放进真正的电脑里考试osworldintermediateUNVERIFIED用 OSWorld 理解为什么电脑操作 agent 不能只在网页或脚本环境里评测
P-Tuning v2 — 把 prompt tuning 深插到每一层p-tuning-v2-2021intermediateUNVERIFIED用 P-Tuning v2 理解深层连续提示为什么能跨规模和任务接近 fine-tuning
PagedAttention — 把 KV cache 当虚拟内存页来管理paged-attentionunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
PagedAttention — 以页替代整段内存的显存管理paged-attention-vllmunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
PAL — 让 Python 成为语言模型的草稿纸pal-code-reasoning-2022intermediateUNVERIFIED用 PAL 理解 Program-aided Language Models 如何把推理转成可运行代码
PaLM — Pathways 把 540B LLM 扩成统一底座palm-2022advancedUNVERIFIED用 PaLM 理解大规模 dense decoder 如何在多任务、推理和代码能力上同时冒头
Plan-and-Solve — 零样本推理先写计划再执行plan-and-solve-prompting-2023intermediateUNVERIFIED用 Plan-and-Solve 理解为什么 prompt 可以显式拆成 plan 和 solve 两段
Prefix-Tuning — 不改模型,只给每层塞一段可训练前缀prefix-tuning-2021intermediateUNVERIFIED用 Prefix-Tuning 理解连续 prompt 如何成为参数高效微调方法
Program of Thoughts — 让模型写程序,把计算交给解释器program-of-thoughts-2022intermediateUNVERIFIED用 Program of Thoughts 理解自然语言推理和精确计算为什么要分工
Prompt Tuning — 规模变大后,软提示也能接近微调prompt-tuning-2021intermediateUNVERIFIED用 Prompt Tuning 理解为什么 soft prompt 在大模型上突然变得有效
QLoRA — 4-bit 量化底座上贴 LoRA 也能微调qlora-2023advancedUNVERIFIED用 QLoRA 理解 NF4、double quantization 和 paged optimizers 如何降低微调门槛
RAG (Lewis 2020) — 检索增强生成奠基rag-lewis-2020unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
ReAct — Reasoning and ActingreactunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
ReAct Agent — 推理和行动交替的工具使用范式react-agentunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Reflexion — 让 LLM 自我反思reflexionunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
RETRO — DeepMind 的检索增强 LLMretrounknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
RULER — 真实长上下文能力不能只看 NIAHruler-long-contextintermediateUNVERIFIED用 RULER 理解长上下文模型的有效窗口、检索幻觉和聚合推理为什么要分开评测
SayCan — 机器人不只问“想做什么”,还问“我能做什么”saycan-2022intermediateUNVERIFIED用 SayCan 理解语言模型和机器人 affordance 如何合成可执行动作
Self-Consistency — 让模型把同一道题做 40 遍再投票self-consistency-2022unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
自进化 AI agent 综述 — 给”会自己升级”的 agent 画一张统一地图self-evolving-agents-surveyunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Self-Evolving RecSys — 让 LLM agent 自己跑超参实验上线self-evolving-recsys-2602unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
BDI-LLM Self-Evolving Agents — 让 agent 自己改自己源代码self-evolving-software-agentsunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Self-Instruct — 让模型自己造指令数据再学习self-instruct-2022intermediateUNVERIFIED用 Self-Instruct 理解指令微调数据如何从少量种子任务扩展出来
SkCC — 给 LLM agent 写一个真正的 skill 编译器skcc-skill-compilerunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Skill-as-Pseudocode — 把 agent 笔记本写成可校验的伪代码skill-as-pseudocodeunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Skill-Pro — 不动权重学可复用 skill 的非参数 PPOskill-pro-nonparametric-ppounknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Skill-SD — 用 agent 自己抽出的 skill 当 dynamic teacher 自蒸馏skill-sd-self-distillationunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
SmoothQuant 2023 — 把激活的烫手山芋扔给权重smoothquant-2023unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
SparseGPT — 175B 大模型一次过剪 50%,不重训sparsegpt-2023unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
SpecInfer — 让大模型一次”猜一棵树”再并行验证specinfer-2023unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
Speculative Decoding — 小模型先猜,大模型只验收speculative-decoding-2022advancedUNVERIFIED用 Speculative Decoding 理解如何不改变分布地加速自回归生成
STaR — 模型先试着讲理由,再用对的理由训练自己star-self-taught-reasoner-2022intermediateUNVERIFIED用 STaR 理解 rationale bootstrapping 怎样减少人工推理标注

下一组