第一次来,先选一条阅读路径;带着具体问题回来时,直接按主题找文章。难度只说明前置知识:起步无需编程或专业背景,进阶需要基本的 Agent、Git、脚本或评测概念,高级需要系统、训练、推理或安全方面的前置知识。它不是文章质量或重要性的排名。
59 篇正文都是基于英文原文写成的原创中文实践解读,不是全文或逐句翻译。厂商和作者的结论、本站已有的可检查机制、尚待执行的实验会分开表述;没有站内证据的操作不会写成已经完成。
- 59
- 篇文章
- 11
- 个发布方
- 7
- 个主题
- 6
- 条路径
先选一条阅读路径
路径按学习依赖排序,同一篇文章也会出现在下方的主题目录中。
按主题浏览全部文章
让 Agent 可运行
把上下文、工具、运行环境和接班机制装进一套能持续工作的工程框架。
这一组的产出:得到一份可启动、可恢复、可验证的 Agent 运行契约。
进阶推荐起点
Context Engineering:把注意力留给当前任务
用最小高信号上下文、按需检索和可恢复记录支撑长任务
- 发布方
- Anthropic
- 发布
- 复核
进阶
动态上下文发现:先给索引,再按需取正文
用文件化工具输出、历史、Skill 和终端记录减少静态上下文膨胀
- 发布方
- Cursor
- 发布
- 复核
进阶
用任务级工具、命名空间、语义压缩输出与留出评测改进 Agent 工具
- 发布方
- Anthropic
- 发布
- 复核
进阶
Harness 工程:让 Codex 在仓库里可靠工作
把规则、可观测性、验证门禁和知识索引组合成可迭代的 Agent 工作环境
- 发布方
- OpenAI
- 发布
- 复核
进阶
展开 Codex Agent Loop:真正增长的是执行历史
从 Responses、工具调用循环与上下文压缩理解 Coding Agent 的运行时
- 发布方
- OpenAI
- 发布
- 复核
高级
Managed Agents Runtime:把大脑、手和会话拆开
用稳定接口、持久事件日志与隔离执行环境承载长时 Agent
- 发布方
- Anthropic
- 发布
- 复核
高级
长时应用开发 Harness:把生成与验收拆开
用规划者、生成者、评估者和可测试契约支撑多小时应用开发
- 发布方
- Anthropic
- 发布
- 复核
进阶
云端 Agent 环境:把开发体验当成产品
让云端环境与本地对齐、命令可发现、验证可运行并能持续自诊断
- 发布方
- Cursor
- 发布
- 复核
进阶
编码 Agent 的语义搜索:和 grep 配合,而不是替代 grep
用已知答案离线集、真实轨迹信号和小型 A/B 验证检索是否真的帮助修改
- 发布方
- Cursor
- 发布
- 复核
进阶
PlugMem:把 Agent 记忆从聊天摘录变成可复用知识
用 facts、skills 与 memory graph 理解交互提炼、意图检索和上下文蒸馏
- 发布方
- Microsoft Research
- 发布
- 复核
进阶
Fara1.5:浏览器 Agent 的关键不只是会点按钮
从观察行动循环、合成环境与验证器理解可控的 computer-use Agent
- 发布方
- Microsoft Research
- 发布
- 复核
测出真相
把能力、环境噪声、评测泄漏和验证器误差拆开,避免被一个分数误导。
这一组的产出:能设计有判定器、有失败样本、能解释噪声来源的评测。
进阶推荐起点
Agent Evals:先定义结果,再选择 Grader
从任务、trajectory、outcome 与多类 grader 搭建最小可信 Agent 评测
- 发布方
- Anthropic
- 发布
- 复核
进阶
ARC-AGI Harness 设置:模型分数也在测上下文工程
用保留推理与上下文压缩理解为什么评测必须同时固定模型和 Harness
- 发布方
- OpenAI
- 发布
- 复核
高级
编码评测的信号与噪声:先审题,再信排行榜
识别过严测试、欠规格提示、低覆盖与误导性任务造成的假分数
- 发布方
- OpenAI
- 发布
- 复核
高级
Agentic Eval 的基础设施噪声:一台更大的 VM 也会涨分
控制 CPU、内存、超时与并发,让编码评测区分模型能力和运行环境
- 发布方
- Anthropic
- 发布
- 复核
高级
编码 Benchmark 的 Reward Hacking:找到旧补丁不等于会修 Bug
用 trajectory 审计、Git 历史隔离与网络白名单阻断运行时答案泄漏
- 发布方
- Cursor
- 发布
- 复核
高级
BrowseComp 教会我们的:搜索 Agent 要测持续换路,不只测首屏命中
用短答案、证据链与固定计算预算构造不泄露答案的浏览评测
- 发布方
- OpenAI
- 发布
- 复核
高级
Eval Awareness:Agent 识别考场后,静态 Benchmark 就失去原构念
用合成 canary、轨迹审计和单多 Agent 对照检测运行时污染
- 发布方
- Anthropic
- 发布
- 复核
进阶
AI 时代的技术面试:保住人的能力信号
用三轮性能工程 take-home 理解模型饱和,并设计仍能区分候选人能力的评测
- 发布方
- Anthropic
- 发布
- 复核
高级
双盲 AI 评测:模型和题目都不必交给对方
用机密计算、哈希与回执拆解模型方和评测方互不泄密的评测协议
- 发布方
- Google DeepMind
- 发布
- 复核
进阶
GAIA2:把 Agent 评测放进会变化的模拟手机
用歧义、事件、API 失败与环境噪声检验 Agent 是否真的能恢复和完成任务
- 发布方
- Hugging Face
- 发布
- 复核
高级
AgentRx:沿 Trajectory 找到第一个不可恢复错误
用工具 Schema、领域策略、可执行约束和证据日志系统调试 Agent
- 发布方
- Microsoft Research
- 发布
- 复核
高级
CoT 可监控性评测:先证明“能看见”,再讨论“能监督”
用 intervention、process 与 outcome-property 三类合成评测检查监督信号
- 发布方
- OpenAI
- 发布
- 复核
高级
Argos:多模态 Agent 的奖励先要看懂落点
拆解检测、分割、指点、字符串与 LLM 评分如何组成 agentic verifier
- 发布方
- Microsoft Research
- 发布
- 复核
进阶
别只用回答长度判断 LLM 是否过度思考
用思考步骤之间的结构和效用识别无效探索、重复验证,并设计可观察的小实验
- 发布方
- Google DeepMind
- 发布
- 复核
守住边界
从权限、沙箱、事件响应和持续监控四个方向限制 Agent 的影响面。
这一组的产出:能为高权限 Agent 写出明确的隔离、告警和停止条件。
高级推荐起点
Claude Containment:先限制爆炸半径,再谈智能审批
从容器、系统 Sandbox、VM、出站控制与最小权限设计 Agent 安全边界
- 发布方
- Anthropic
- 发布
- 复核
高级
Windows Agent 沙箱:把权限边界做成可验证系统
用受限令牌、合成 SID、网络防火墙与 DPAPI 拆解 Codex Windows 沙箱
- 发布方
- OpenAI
- 发布
- 复核
高级
Hugging Face 事件:高能力 Agent 评测也必须按生产级事故防护
从越界协作、Reward Hacking、Sandbox 逃逸与告警升级提炼 Agent 安全停止线
- 发布方
- OpenAI
- 发布
- 复核
高级
GPT-Red:让自动红队成为可控的安全反馈环
用威胁模型、隔离环境、对抗自博弈与能力保持评测扩展 Prompt Injection 防御
- 发布方
- OpenAI
- 发布
- 复核
高级
监控编码 Agent:窄告警加人审,不把日志当安全证明
用完整可见轨迹、合成违规样本和人工复核建立低成本 misalignment 监控
- 发布方
- OpenAI
- 发布
- 复核
高级
AI Control Roadmap:监控高能力 Agent 的真实动作
用 supervisor、覆盖率、召回率和响应时间建立可测量的 Agent 控制层
- 发布方
- Google DeepMind
- 发布
- 复核
开发与交付
把规划、编码、调试、验证、审查、迁移、自动化和发布接成一条可复查的软件工程链路。
这一组的产出:能为同一个代码变更留下从计划到发布判断的完整证据。
高级推荐起点
AI-Native SDLC:代码变快后,先重做交接
用六阶段工件链把规划、设计、构建、测试、部署与维护接成可审计闭环
- 发布方
- Anthropic
- 发布
- 复核
进阶
Coding Agent 最佳实践:先收窄任务,再让反馈接管
把计划、按需上下文、新会话、Rules、Skills、TDD 与 Git 组合成可控开发流程
- 发布方
- Cursor
- 发布
- 复核
进阶
Debug Mode:用运行时日志淘汰错误假设
从多假设、定向插桩到原路径复现与清理日志的证据化调试流程
- 发布方
- Cursor
- 发布
- 复核
高级
迭代修复闭环:让验证失败成为下一轮输入
用 Review、Repair、Validate 三段式循环收敛可测量的代码与内容维护任务
- 发布方
- OpenAI
- 发布
- 复核
进阶
Diff-first 代码审查:先形成问题,再补最窄证据
让代码审查 Agent 从变更出发,用 grep、glob 与 view 验证具体风险
- 发布方
- GitHub
- 发布
- 复核
高级
可复现代码迁移:用可审查 Playbook 约束长任务方差
从历史 diff、错误日志、解决策略与决策理由提炼迁移路径
- 发布方
- AWS
- 发布
- 复核
进阶
GitHub Agentic Workflows:把仓库杂务变成受限的 Markdown 自动化
用 GitHub Actions 承载只读 Agent,并通过安全输出保留人工控制
- 发布方
- GitHub
- 发布
- 复核
高级
发布就绪评审:围绕这次变更组装证据包
用专属测试、跨仓依赖和隔离环境补足合入前的生产风险判断
- 发布方
- AWS
- 发布
- 复核
让能力成长
比较扩展自治、多 Agent 协作、蒸馏和在线训练怎样带来真实增益。
这一组的产出:能用固定任务和成本口径判断一次能力升级是否值得。
进阶推荐起点
Agent 蒸馏飞轮:先从真实轨迹筛出可学经验
用 trace 分区、教师评估和 LoRA 蒸馏理解小模型 Agent 的持续优化闭环
- 发布方
- NVIDIA Technical Blog
- 发布
- 复核
高级
持续改进 Agent Harness:用真实失败驱动迭代
把离线评测、真实使用信号、错误分类和模型适配组合成改进闭环
- 发布方
- Cursor
- 发布
- 复核
高级
为 Codex 调 Harness:工具齐全不等于模型会正确使用
用模型特定提示、工具形状、lint 触发与推理连续性做最小适配实验
- 发布方
- Cursor
- 发布
- 复核
高级
扩展长时自治编码:先分清规划与执行
从扁平抢任务的失败出发,设计有边界的 planner-worker 协作实验
- 发布方
- Cursor
- 发布
- 复核
高级
并行 Claude 写 C 编译器:并发不是核心,验证器才是
用 workers、GCC oracle 与 delta debugging 理解长周期并行编码实验
- 发布方
- Anthropic
- 发布
- 复核
高级
多 Agent 研究系统:用广度优先换覆盖,不用人数换幻觉
从 lead、workers、广度优先搜索与同预算评测理解研究型 Agent
- 发布方
- Anthropic
- 发布
- 复核
高级
Composer 2 训练拆解:先补代码分布,再练真实 Agent 行为
从 continued pretraining、异步强化学习与执行环境理解编码 Agent 的训练闭环
- 发布方
- Cursor
- 发布
- 复核
高级
实时 RL:让生产反馈更快回到 Composer
理解 on-policy、短周期 checkpoint 与 reward hacking,并划清用户反馈的数据边界
- 发布方
- Cursor
- 发布
- 复核
进阶
Co-Scientist:让多 Agent 围绕假设竞争,而不是一起附和
拆解生成、反思、排序与演化机制,并用低风险问题做一轮可审计的假设锦标赛。
- 发布方
- Google DeepMind
- 发布
- 复核
选型与加速
沿着模型选择、请求调度和推测解码,衡量质量、成本与延迟的交换。
这一组的产出:能画出推理链路,并用同一任务选择合适的模型与加速策略。
起步推荐起点
2026 夏季开放模型:热度、采用与可部署性是三回事
把 Hugging Face 生态观察转成零基础用户可执行的开放模型选型清单
- 发布方
- Hugging Face
- 发布
- 复核
进阶
GPT-5.6 的效率不是只靠模型更快
从模型、推理栈与 Agent harness 三层理解效率,并把结论落到可审计的工作流实验
- 发布方
- OpenAI
- 发布
- 复核
高级
NVIDIA Dynamo 1.0:推理扩展首先是调度问题
用 KV 感知路由、分离式服务和启动复用理解多节点推理系统,并做无 GPU 的调度实验
- 发布方
- NVIDIA Technical Blog
- 发布
- 复核
高级
DFlash:把推测解码的草稿阶段也并行起来
从草稿、验证和接受率理解 block-diffusion speculative decoding,并做可审计的纸面实验
- 发布方
- NVIDIA Technical Blog
- 发布
- 复核
高级
Speculative Cascades:把是否升级大模型推迟到 token 级
理解级联推理与 speculative decoding 如何合并质量路由和并行验证
- 发布方
- Google Research
- 发布
- 复核
放进具体场景
把 Agent 和模型放进数据、科学、协商、机器人与生命科学任务中。
这一组的产出:能区分通用机制、领域约束与必须由专家验收的结果。
进阶推荐起点
Agentic AI 做科学计算:写得快以后,验证才是主工作
从八个科学软件案例提炼可复现的改造方法:先固定基线,再让 Agent 迭代,最后明确维护责任。
- 发布方
- OpenAI
- 发布
- 复核
高级
企业数据 Agent:先建设语义上下文,再让模型写 SQL
从六层语义上下文、离线归一化与结果集评分理解内部数据 Agent
- 发布方
- OpenAI
- 发布
- 复核
高级
SocialRL:礼貌助手为什么不等于合格谈判代理
用可计分博弈理解意图建模、信息披露、反制和价值交换,并设计安全的小型评测
- 发布方
- Microsoft Research
- 发布
- 复核
高级
Gemini Robotics 2:把“会看会说”接到真实动作
从全身控制、具身推理与端侧适配中,提炼普通电脑也能验证的分层智能体实验。
- 发布方
- Google DeepMind
- 发布
- 复核
高级
V-JEPA 2:先从无动作视频学习世界,再用少量动作数据控制
理解 actionless 预训练、机器人后训练和 MPC 重规划的世界模型路线
- 发布方
- Meta AI
- 发布
- 复核
高级
AlphaGenome:一次读取百万碱基,但预测不是临床结论
理解卷积、Transformer 与多输出头如何比较参考和替代序列的功能差异
- 发布方
- Google DeepMind
- 发布
- 复核