智能体与 LLM 系统 · 论文 · 第 2 组
待复核本分块共 21 条,稳定上限为 100 条。
| 论文 | Slug | 难度 | 可信状态 | 简介 |
|---|---|---|---|---|
| SWE-Agent — Princeton SWE-bench 解法 | swe-agent | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SWE-bench — 真实 GitHub Issue 评测 | swe-bench | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| SWE-Bench-CL — coding agent 不能只刷静态题 | swe-bench-cl | intermediate | UNVERIFIED | 用 SWE-Bench-CL 理解软件工程 agent 的持续学习、迁移和灾难性遗忘 |
| SWE-Skills-Bench — Agent 技能真的帮得上软件工程吗 | swe-skills-bench-2026 | intermediate | UNVERIFIED | 用 paired evaluation 衡量 SWE skills 对真实软件工程 agent 的边际收益和 token 成本 |
| Terminal-Bench — 在真实命令行任务里测试 agent | terminal-bench | intermediate | UNVERIFIED | 用 Terminal-Bench 理解终端环境为什么能暴露 agent 的长程执行、环境理解和验证能力 |
| ToolBench-X — 工具会坏时,agent 还能不能把事做完 | toolbench-x | intermediate | UNVERIFIED | 用 ToolBench-X 理解 tool-use benchmark 为什么要模拟规格漂移、调用错误、执行失败和结果冲突 |
| Toolformer — 教 LLM 自主调用 API | toolformer | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| ToolLLM — 用 16000+ API 训练模型进入真实工具世界 | toolllm-2023 | intermediate | UNVERIFIED | 用 ToolLLM 理解大规模 API 数据集、工具检索和工具评测如何支撑 agent |
| ToolSandbox — 状态化对话工具调用评测 | toolsandbox | intermediate | UNVERIFIED | 用 ToolSandbox 理解为什么工具调用 agent 需要测状态依赖、信息不足和多轮用户反馈,而不是只测单轮函数参数 |
| ToxiGen — 用生成模型造隐性仇恨测试集 | toxigen-2022 | intermediate | UNVERIFIED | 用 ToxiGen 理解安全评测为什么要覆盖隐性、对抗性和群体相关文本 |
| Tree of Thoughts — 让 LLM 像下棋一样多想几步再答 | tree-of-thoughts-2023 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| TruthfulQA — 专门问模型容易学人类谬误的问题 | truthfulqa-2021 | intermediate | UNVERIFIED | 用 TruthfulQA 理解语言模型为什么会模仿常见假话而不是坚持事实 |
| UL2 — 一个模型同时练完补空、续写和长文本 | ul2-2022 | advanced | UNVERIFIED | 用 UL2 理解 mixture-of-denoisers 如何统一不同语言模型训练范式 |
| VeriCache: Turning Lossy KV Cache into Lossless LLM Inference — 有损压缩草稿,无损输出验收 | vericache | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| VisualWebArena — 让网页 agent 真正看见界面 | visualwebarena | intermediate | UNVERIFIED | 用 VisualWebArena 理解多模态 web agent 为什么不能只读 DOM 文本,还要处理视觉线索 |
| Voyager — LLM 终身学习智能体 | voyager | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| WebArena — 可复现的真实网页 agent 环境 | webarena | intermediate | UNVERIFIED | 用 WebArena 理解为什么 web agent 需要功能性网站、真实状态和可验证任务,而不只是静态网页问答 |
| WebGPT — 让模型带着浏览器回答问题 | webgpt-2021 | intermediate | UNVERIFIED | 用 WebGPT 理解检索、引用和人类偏好如何组合成可追溯问答 |
| WebXSkill — 给 Web agent 的可执行 skill 是参数化代码 + URL 图索引 | webxskill | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |
| WizardLM — 用 Evol-Instruct 自动变难训练题 | wizardlm-2023 | intermediate | UNVERIFIED | 用 WizardLM 理解 instruction 数据不只要多,还要逐步变复杂 |
| Zombie Agents — 自进化 agent 的长期记忆能被持久化”借尸还魂” | zombie-agents-2602 | unknown | UNVERIFIED | 暂无独立描述;可先从标题与正文定位开始。 |