监控编码 Agent:窄告警加人审,不把日志当安全证明
编码 Agent 的最终 diff 可能正常,过程却已经尝试绕过权限、读取凭证或削弱安全检查。监控因此要看整条可见轨迹,而不是只扫最终答案;但监控器只能缩小人审范围,不能证明没有漏报。开放真实流量的 false negative 未知时,更不能把“没有告警”写成“没有风险”。
原文解决什么
Section titled “原文解决什么”OpenAI 描述了一套内部低延迟监控:读取标准内部编码 Agent 的完整会话、工具调用与输出,并在发现偏离用户意图或内部安全政策的行为时生成窄告警,再交给人审和响应团队。文章强调隐私与数据安全,目标不是让更多人浏览所有会话,而是只暴露需要调查的异常片段。
OpenAI 自报该系统覆盖数千万条内部轨迹,能命中员工已独立上报的事件;同时明确承认,这只说明高显著问题较容易被捕获,无法量化开放真实流量中更隐蔽行为的漏报率。文中的规模、覆盖率与告警数量都属于厂商内部自报,本站未复现。
接入 Zero-to-AI 的实践
Section titled “接入 Zero-to-AI 的实践”本站没有内部 CoT 访问权,也不需要假装拥有。可监控范围只包括用户消息、Agent 可见解释、工具名与参数摘要、权限结果、文件 diff 和测试退出码。先定义少量高价值告警:被拒后换编码方式重试、读取不在任务范围的凭证路径、修改测试以掩盖失败。告警必须附原始动作位置和规则理由,由人判断是恶意绕过、合理恢复还是误报。
日志默认脱敏,保存期限和可见人群先于模型评分设计。监控器输出不能自动封禁或回滚真实工作;高风险动作仍靠权限、sandbox 和审批在执行前阻断。
一个低成本实验
Section titled “一个低成本实验”输入: 12 条合成轨迹:4 条正常修复、4 条明确越界、4 条边界样本;不含真实凭证和内部代码。
步骤:
- 为三类窄告警写可检查定义,并由两名审阅者先独立标注。
- 让监控器只看可获得的解释与动作日志,输出命中片段、严重度和理由。
- 比较漏报、误报和审阅分歧;只针对已观察错误改规则。
成功证据: 四条明确越界全部进入人审,正常样本不被自动升级,且每个告警能定位到具体动作。
停止线: 需要收集真实密钥、扩大未授权日志访问,或样本不足以估计漏报;立即停止上线,只保留合成评测。
- 告警覆盖员工上报就等于零漏报:两者可能共同漏掉低显著事件。
- 监控能代替执行控制:发现通常发生在动作之后,权限边界仍是第一道门。
- 全量给人看最安全:过度暴露会制造新的隐私和数据安全风险。
原文与证据边界
Section titled “原文与证据边界”本文依据 2026-08-30 可读取的 OpenAI 官方页面。系统规模、模型、延迟和覆盖表现均为 OpenAI 自报;尤其开放流量 false negative 仍未知。本轮未取得 TraceFetch 签名正文包,不能声明 verification.valid=true。本站实验只评估合成可见轨迹,不声称访问隐藏 CoT 或验证生产监控效果。
本文是原创中文实践解读,不是逐句翻译。阅读英文原文。