BrowseComp 教会我们的:搜索 Agent 要测持续换路,不只测首屏命中
浏览 Agent 的难点不是发出一次搜索,而是在首轮无答案时持续拆线索、换关键词、核对来源并知道何时停止。BrowseComp 用难检索、短答案题把评分做得简单,但它测到的是一种窄能力;高分不能直接代表开放式研究质量,也可能混入训练记忆和运行时污染。
原文解决什么
Section titled “原文解决什么”OpenAI 自报发布的 BrowseComp 含 1,266 道难检索问题,目标答案短、原则上唯一且可由证据支持。题目设计会检查当时模型是否难以解决、简单搜索首屏是否直接出现答案,以及另一位检索者能否快速找到。这里不复述任何真实题目或答案,避免继续扩大污染。
文章还讨论 test-time compute:增加单次浏览投入,或对同一题多次尝试再聚合,厂商自报成绩会提高。这说明持续搜索和候选选择重要,但也带来成本与公平性问题。若两套 Agent 的页面访问数、运行时间和并行尝试不同,分数差不能只归因于策略更聪明。OpenAI 页面中的模型成绩和提升幅度均为厂商自报,本站未复现。
接入 Zero-to-AI 的实践
Section titled “接入 Zero-to-AI 的实践”不要直接拿公开 BrowseComp 题调提示,那会把评测集变成训练材料。本站可以自建小型私有题:答案来自固定快照中的多页公开资料或本地镜像,需要至少两次线索转换才能定位;grader 只保存答案哈希和来源定位,题面与答案不发布到搜索引擎。
评分分三层:短答案 exact match、支持答案的来源是否正确、trajectory 是否在预算内形成可复查链。允许回答“未找到”,错误但自信的答案不能靠长篇文字稀释。
一个低成本实验
Section titled “一个低成本实验”输入: 12 道自建合成题、固定网页快照、每题相同的时间、请求数和 token 上限;不使用 BrowseComp 原题。
步骤:
- A 组只能单轮搜索;B 组允许依据页面线索改写查询并最多换路三次。
- 每题保存查询、访问页、最终短答案和一条直接证据定位。
- 由不知道组别的审阅者判 exact match、证据支持与越预算情况。
成功证据: B 组在同预算下提高“答案正确且证据支持”的题数,污染 canary 未被访问,失败题能还原停止原因。
停止线: 题目或答案已进入公开索引、两组预算不等、或 Agent 找到 grader 文件;该题立即作废,不计分。
- 浏览工具一开就会提升:没有换路和证据判断,更多页面只是噪声。
- 多次尝试的高分可直接横比单次结果:test-time compute 必须单列。
- 短答案评测等于真实研究:开放任务还要求范围判断、综合和不确定性表达。
原文与证据边界
Section titled “原文与证据边界”本文依据 2026-08-30 可读取的 OpenAI 官方页面。1,266 是数据集规模;模型分数、算力曲线和聚合收益均为 OpenAI 自报。本轮未取得 TraceFetch 签名正文包,不能声明 verification.valid=true。本文不提供 BrowseComp 题目答案,实验只使用私有合成题,不能与官方榜单直接比较。
本文是原创中文实践解读,不是逐句翻译。阅读英文原文。