跳转到内容

AI 技术文章实践库

进阶

最近复核于 2026-08-31

第一次来,先选一条阅读路径;带着具体问题回来时,直接按主题找文章。难度只说明前置知识:起步无需编程或专业背景,进阶需要基本的 Agent、Git、脚本或评测概念,高级需要系统、训练、推理或安全方面的前置知识。它不是文章质量或重要性的排名。

59 篇正文都是基于英文原文写成的原创中文实践解读,不是全文或逐句翻译。厂商和作者的结论、本站已有的可检查机制、尚待执行的实验会分开表述;没有站内证据的操作不会写成已经完成。

59
篇文章
11
个发布方
7
个主题
6
条路径

先选一条阅读路径

路径按学习依赖排序,同一篇文章也会出现在下方的主题目录中。

完成一次软件交付

从需求与计划进入编码、调试、验证和审查,最后把自动化与发布证据接上。

读完能做:能交付一个经过原路径调试、确定性检查、差异审查和发布就绪判断的代码变更。

  1. AI-Native SDLC:代码变快后,先重做交接
  2. Coding Agent 最佳实践:先收窄任务,再让反馈接管
  3. Debug Mode:用运行时日志淘汰错误假设
  4. 迭代修复闭环:让验证失败成为下一轮输入
  5. Diff-first 代码审查:先形成问题,再补最窄证据
  6. GitHub Agentic Workflows:把仓库杂务变成受限的 Markdown 自动化
  7. 发布就绪评审:围绕这次变更组装证据包

评测与安全闭环

先建立评测信号,再识别投机行为,最后把隔离和监控接上。

读完能做:得到一套既测结果、也约束执行过程的 Agent 验收方案。

  1. Agent Evals:先定义结果,再选择 Grader
  2. 编码评测的信号与噪声:先审题,再信排行榜
  3. 编码 Benchmark 的 Reward Hacking:找到旧补丁不等于会修 Bug
  4. Claude Containment:先限制爆炸半径,再谈智能审批
  5. 监控编码 Agent:窄告警加人审,不把日志当安全证明
  6. AI Control Roadmap:监控高能力 Agent 的真实动作

多 Agent 协作

从可交叉验证的并行任务开始,再讨论扩展、harness 和能力回流。

读完能做:能判断何时并行有效,以及如何把高质量轨迹沉淀回单体能力。

  1. 并行 Claude 写 C 编译器:并发不是核心,验证器才是
  2. 多 Agent 研究系统:用广度优先换覆盖,不用人数换幻觉
  3. 扩展长时自治编码:先分清规划与执行
  4. 持续改进 Agent Harness:用真实失败驱动迭代
  5. Agent 蒸馏飞轮:先从真实轨迹筛出可学经验

按主题浏览全部文章

让 Agent 可运行

把上下文、工具、运行环境和接班机制装进一套能持续工作的工程框架。

这一组的产出:得到一份可启动、可恢复、可验证的 Agent 运行契约。

进阶

Agent 工具设计:围绕任务闭环,不围绕 API 数量

用任务级工具、命名空间、语义压缩输出与留出评测改进 Agent 工具

发布方
Anthropic
发布
复核
进阶

用已知答案离线集、真实轨迹信号和小型 A/B 验证检索是否真的帮助修改

发布方
Cursor
发布
复核
进阶

PlugMem:把 Agent 记忆从聊天摘录变成可复用知识

用 facts、skills 与 memory graph 理解交互提炼、意图检索和上下文蒸馏

发布方
Microsoft Research
发布
复核

测出真相

把能力、环境噪声、评测泄漏和验证器误差拆开,避免被一个分数误导。

这一组的产出:能设计有判定器、有失败样本、能解释噪声来源的评测。

高级

Agentic Eval 的基础设施噪声:一台更大的 VM 也会涨分

控制 CPU、内存、超时与并发,让编码评测区分模型能力和运行环境

发布方
Anthropic
发布
复核
高级

编码 Benchmark 的 Reward Hacking:找到旧补丁不等于会修 Bug

用 trajectory 审计、Git 历史隔离与网络白名单阻断运行时答案泄漏

发布方
Cursor
发布
复核
高级

BrowseComp 教会我们的:搜索 Agent 要测持续换路,不只测首屏命中

用短答案、证据链与固定计算预算构造不泄露答案的浏览评测

发布方
OpenAI
发布
复核
高级

Eval Awareness:Agent 识别考场后,静态 Benchmark 就失去原构念

用合成 canary、轨迹审计和单多 Agent 对照检测运行时污染

发布方
Anthropic
发布
复核
进阶

AI 时代的技术面试:保住人的能力信号

用三轮性能工程 take-home 理解模型饱和,并设计仍能区分候选人能力的评测

发布方
Anthropic
发布
复核
高级

双盲 AI 评测:模型和题目都不必交给对方

用机密计算、哈希与回执拆解模型方和评测方互不泄密的评测协议

发布方
Google DeepMind
发布
复核
进阶

GAIA2:把 Agent 评测放进会变化的模拟手机

用歧义、事件、API 失败与环境噪声检验 Agent 是否真的能恢复和完成任务

发布方
Hugging Face
发布
复核
高级

AgentRx:沿 Trajectory 找到第一个不可恢复错误

用工具 Schema、领域策略、可执行约束和证据日志系统调试 Agent

发布方
Microsoft Research
发布
复核
高级

CoT 可监控性评测:先证明“能看见”,再讨论“能监督”

用 intervention、process 与 outcome-property 三类合成评测检查监督信号

发布方
OpenAI
发布
复核
进阶

别只用回答长度判断 LLM 是否过度思考

用思考步骤之间的结构和效用识别无效探索、重复验证,并设计可观察的小实验

发布方
Google DeepMind
发布
复核

守住边界

从权限、沙箱、事件响应和持续监控四个方向限制 Agent 的影响面。

这一组的产出:能为高权限 Agent 写出明确的隔离、告警和停止条件。

高级推荐起点

Claude Containment:先限制爆炸半径,再谈智能审批

从容器、系统 Sandbox、VM、出站控制与最小权限设计 Agent 安全边界

发布方
Anthropic
发布
复核
高级

Hugging Face 事件:高能力 Agent 评测也必须按生产级事故防护

从越界协作、Reward Hacking、Sandbox 逃逸与告警升级提炼 Agent 安全停止线

发布方
OpenAI
发布
复核
高级

GPT-Red:让自动红队成为可控的安全反馈环

用威胁模型、隔离环境、对抗自博弈与能力保持评测扩展 Prompt Injection 防御

发布方
OpenAI
发布
复核
高级

监控编码 Agent:窄告警加人审,不把日志当安全证明

用完整可见轨迹、合成违规样本和人工复核建立低成本 misalignment 监控

发布方
OpenAI
发布
复核
高级

AI Control Roadmap:监控高能力 Agent 的真实动作

用 supervisor、覆盖率、召回率和响应时间建立可测量的 Agent 控制层

发布方
Google DeepMind
发布
复核

开发与交付

把规划、编码、调试、验证、审查、迁移、自动化和发布接成一条可复查的软件工程链路。

这一组的产出:能为同一个代码变更留下从计划到发布判断的完整证据。

高级推荐起点

AI-Native SDLC:代码变快后,先重做交接

用六阶段工件链把规划、设计、构建、测试、部署与维护接成可审计闭环

发布方
Anthropic
发布
复核
进阶

Coding Agent 最佳实践:先收窄任务,再让反馈接管

把计划、按需上下文、新会话、Rules、Skills、TDD 与 Git 组合成可控开发流程

发布方
Cursor
发布
复核
进阶

GitHub Agentic Workflows:把仓库杂务变成受限的 Markdown 自动化

用 GitHub Actions 承载只读 Agent,并通过安全输出保留人工控制

发布方
GitHub
发布
复核

让能力成长

比较扩展自治、多 Agent 协作、蒸馏和在线训练怎样带来真实增益。

这一组的产出:能用固定任务和成本口径判断一次能力升级是否值得。

进阶推荐起点

Agent 蒸馏飞轮:先从真实轨迹筛出可学经验

用 trace 分区、教师评估和 LoRA 蒸馏理解小模型 Agent 的持续优化闭环

发布方
NVIDIA Technical Blog
发布
复核
高级

为 Codex 调 Harness:工具齐全不等于模型会正确使用

用模型特定提示、工具形状、lint 触发与推理连续性做最小适配实验

发布方
Cursor
发布
复核
高级

多 Agent 研究系统:用广度优先换覆盖,不用人数换幻觉

从 lead、workers、广度优先搜索与同预算评测理解研究型 Agent

发布方
Anthropic
发布
复核
高级

Composer 2 训练拆解:先补代码分布,再练真实 Agent 行为

从 continued pretraining、异步强化学习与执行环境理解编码 Agent 的训练闭环

发布方
Cursor
发布
复核
进阶

Co-Scientist:让多 Agent 围绕假设竞争,而不是一起附和

拆解生成、反思、排序与演化机制,并用低风险问题做一轮可审计的假设锦标赛。

发布方
Google DeepMind
发布
复核

选型与加速

沿着模型选择、请求调度和推测解码,衡量质量、成本与延迟的交换。

这一组的产出:能画出推理链路,并用同一任务选择合适的模型与加速策略。

起步推荐起点

2026 夏季开放模型:热度、采用与可部署性是三回事

把 Hugging Face 生态观察转成零基础用户可执行的开放模型选型清单

发布方
Hugging Face
发布
复核
高级

NVIDIA Dynamo 1.0:推理扩展首先是调度问题

用 KV 感知路由、分离式服务和启动复用理解多节点推理系统,并做无 GPU 的调度实验

发布方
NVIDIA Technical Blog
发布
复核
高级

DFlash:把推测解码的草稿阶段也并行起来

从草稿、验证和接受率理解 block-diffusion speculative decoding,并做可审计的纸面实验

发布方
NVIDIA Technical Blog
发布
复核
高级

Speculative Cascades:把是否升级大模型推迟到 token 级

理解级联推理与 speculative decoding 如何合并质量路由和并行验证

发布方
Google Research
发布
复核

放进具体场景

把 Agent 和模型放进数据、科学、协商、机器人与生命科学任务中。

这一组的产出:能区分通用机制、领域约束与必须由专家验收的结果。

进阶推荐起点

Agentic AI 做科学计算:写得快以后,验证才是主工作

从八个科学软件案例提炼可复现的改造方法:先固定基线,再让 Agent 迭代,最后明确维护责任。

发布方
OpenAI
发布
复核
高级

企业数据 Agent:先建设语义上下文,再让模型写 SQL

从六层语义上下文、离线归一化与结果集评分理解内部数据 Agent

发布方
OpenAI
发布
复核
高级

SocialRL:礼貌助手为什么不等于合格谈判代理

用可计分博弈理解意图建模、信息披露、反制和价值交换,并设计安全的小型评测

发布方
Microsoft Research
发布
复核
高级

Gemini Robotics 2:把“会看会说”接到真实动作

从全身控制、具身推理与端侧适配中,提炼普通电脑也能验证的分层智能体实验。

发布方
Google DeepMind
发布
复核
高级

V-JEPA 2:先从无动作视频学习世界,再用少量动作数据控制

理解 actionless 预训练、机器人后训练和 MPC 重规划的世界模型路线

发布方
Meta AI
发布
复核
高级

AlphaGenome:一次读取百万碱基,但预测不是临床结论

理解卷积、Transformer 与多输出头如何比较参考和替代序列的功能差异

发布方
Google DeepMind
发布
复核