跳转到内容

智能体与 LLM 系统 · 论文 · 第 2 组

待复核

返回论文全景索引

本分块共 21 条,稳定上限为 100 条。

论文Slug难度可信状态简介
SWE-Agent — Princeton SWE-bench 解法swe-agentunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
SWE-bench — 真实 GitHub Issue 评测swe-benchunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
SWE-Bench-CL — coding agent 不能只刷静态题swe-bench-clintermediateUNVERIFIED用 SWE-Bench-CL 理解软件工程 agent 的持续学习、迁移和灾难性遗忘
SWE-Skills-Bench — Agent 技能真的帮得上软件工程吗swe-skills-bench-2026intermediateUNVERIFIED用 paired evaluation 衡量 SWE skills 对真实软件工程 agent 的边际收益和 token 成本
Terminal-Bench — 在真实命令行任务里测试 agentterminal-benchintermediateUNVERIFIED用 Terminal-Bench 理解终端环境为什么能暴露 agent 的长程执行、环境理解和验证能力
ToolBench-X — 工具会坏时,agent 还能不能把事做完toolbench-xintermediateUNVERIFIED用 ToolBench-X 理解 tool-use benchmark 为什么要模拟规格漂移、调用错误、执行失败和结果冲突
Toolformer — 教 LLM 自主调用 APItoolformerunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
ToolLLM — 用 16000+ API 训练模型进入真实工具世界toolllm-2023intermediateUNVERIFIED用 ToolLLM 理解大规模 API 数据集、工具检索和工具评测如何支撑 agent
ToolSandbox — 状态化对话工具调用评测toolsandboxintermediateUNVERIFIED用 ToolSandbox 理解为什么工具调用 agent 需要测状态依赖、信息不足和多轮用户反馈,而不是只测单轮函数参数
ToxiGen — 用生成模型造隐性仇恨测试集toxigen-2022intermediateUNVERIFIED用 ToxiGen 理解安全评测为什么要覆盖隐性、对抗性和群体相关文本
Tree of Thoughts — 让 LLM 像下棋一样多想几步再答tree-of-thoughts-2023unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
TruthfulQA — 专门问模型容易学人类谬误的问题truthfulqa-2021intermediateUNVERIFIED用 TruthfulQA 理解语言模型为什么会模仿常见假话而不是坚持事实
UL2 — 一个模型同时练完补空、续写和长文本ul2-2022advancedUNVERIFIED用 UL2 理解 mixture-of-denoisers 如何统一不同语言模型训练范式
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference — 有损压缩草稿,无损输出验收vericacheunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
VisualWebArena — 让网页 agent 真正看见界面visualwebarenaintermediateUNVERIFIED用 VisualWebArena 理解多模态 web agent 为什么不能只读 DOM 文本,还要处理视觉线索
Voyager — LLM 终身学习智能体voyagerunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
WebArena — 可复现的真实网页 agent 环境webarenaintermediateUNVERIFIED用 WebArena 理解为什么 web agent 需要功能性网站、真实状态和可验证任务,而不只是静态网页问答
WebGPT — 让模型带着浏览器回答问题webgpt-2021intermediateUNVERIFIED用 WebGPT 理解检索、引用和人类偏好如何组合成可追溯问答
WebXSkill — 给 Web agent 的可执行 skill 是参数化代码 + URL 图索引webxskillunknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。
WizardLM — 用 Evol-Instruct 自动变难训练题wizardlm-2023intermediateUNVERIFIED用 WizardLM 理解 instruction 数据不只要多,还要逐步变复杂
Zombie Agents — 自进化 agent 的长期记忆能被持久化”借尸还魂”zombie-agents-2602unknownUNVERIFIED暂无独立描述;可先从标题与正文定位开始。

上一组