Harness 工程:让 Codex 在仓库里可靠工作
Harness 不是一段更长的提示词,而是 Agent 能看到、能操作、能自证的整套工作环境。先把仓库变得可读、可运行、可验证,再谈更长自治。模型卡住时,优先问“缺了哪种能力或反馈”,不要只把同一句要求再说一遍。
原文解决什么
Section titled “原文解决什么”文章复盘了一个极端实验:团队让 Codex 生成产品代码、测试、CI、文档和内部工具,人负责描述意图、设计约束和验收结果。真正的瓶颈不是打字速度,而是仓库知识散落、运行状态对 Agent 不可见、架构规则只存在于人的经验里。文章因此把工程重心移到环境、反馈环和控制系统。
- 用短
AGENTS.md当目录,而不是百科全书;详细设计、计划和产品约束放进可索引的仓库文档。 - 让每个 worktree 能独立启动,并把 UI、日志、指标和 trace 暴露给 Agent,使“修好了”可以被原路径验证。
- 把重要架构边界写成 lint 和结构测试。指令表达意图,机械门禁阻止越界。
- 把评审意见和线上缺陷回写成规则、工具或测试,并持续清理被 Agent 复制扩散的坏模式。
原文报告了代码规模、PR 吞吐和开发提速等数字,但这些来自 OpenAI 自己的内部项目,本站没有独立复现,也不能据此预测普通仓库的收益。
和 Zero-to-AI 现有实践如何接上
Section titled “和 Zero-to-AI 现有实践如何接上”本站已经提供 AGENTS.md 教程、隔离分支或 worktree、git diff 审查与 npm run verify 的组合方法,但这个独立站仓根目录目前没有 AGENTS.md。可确认的是验证入口和教学材料存在;要形成完整闭环,还需在练习仓显式创建规则文件,不能借用父工作区的规则充数。
一个低成本实验
Section titled “一个低成本实验”输入: 任取一个只改一页文案或样式的小任务、一个按 AGENTS.md 教程建立规则文件的练习仓,以及该仓的验证命令。
步骤:
- 新开 worktree 或练习分支,让 Agent 只读复述范围、禁止项和验证入口。
- 要求它完成改动,运行最窄检查,再运行
npm run verify。 - 人只看三项:实际 diff、命令退出码、页面原路径表现。
- 若失败,只补一个缺失能力:文档指针、可执行命令或机械门禁。
成功证据: Agent 无需人手复制命令,能定位入口、完成范围内修改,并区分静态验证与页面行为。
停止线: 同一任务连续两轮只是在加说明、没有消除可观察失败;此时停止扩写 AGENTS.md,先定位缺失的工具或测试。
- 把所有背景塞进
AGENTS.md:上下文会被稀释,旧规则也更难维护。 - 把“Agent 写了测试”当成通过:仍要看测试是否触达用户症状,以及命令是否真实运行。
- 照搬“少阻塞合并”:原文的取舍依赖高吞吐、强纠错和特定风险环境,不是通用许可。
原文与证据边界
Section titled “原文与证据边界”本文只提炼可迁移的仓库设计原则。OpenAI 的内部用户数、代码量、运行时长和效率均是原文报告,未由本站复现;本站可确认的是当前仓库存在规则入口、Git 隔离和验证命令,不能由此推导已达到同等自治水平。
本文是原创中文实践解读,不是逐句翻译。阅读英文原文。