AI 时代的技术面试:保住人的能力信号
“禁止 AI”不是可靠的技术评测方案:规则难监督,也脱离真实工作。更可行的目标是让题目在允许使用 AI 后,仍能保留人的能力信号。评测应该观察候选人如何定位瓶颈、验证假设、解释取舍和修正错误,而不是只看最终代码是否跑得快。
当通用模型逐渐解出原本用于筛选人的 take-home,分数会集中在高位。此时题目看似客观,实际上已经“饱和”:优秀候选人与只会转交任务给模型的人都能交出相似结果。反过来,一味增加冷门知识、时间压力或反 AI 监控,也可能测到记忆、设备条件和应试技巧,而非岗位需要的工程判断。
Anthropic 围绕性能工程 take-home 做了三轮设计迭代。关键不是找一道模型永远不会的谜题,而是持续检查两条信号:当前模型能否高分完成;人类候选人的表现是否仍与真实能力拉开差异。模型饱和时,应把静态答案改造成可观察的工作过程,例如要求先建立基线、提出多个瓶颈假设、用 profiling 证据选择改动,并说明失败尝试。题目还要限制无关变量,不能因为环境装不起来就错判能力。
接入 Zero-to-AI 的实践
Section titled “接入 Zero-to-AI 的实践”设计小型项目评测时,先写岗位能力表,再写评分点。每个评分点都必须能从提交物找到证据:基线数据对应测量能力,改动前后的实验对应因果判断,复盘对应沟通能力。允许使用 AI,但要求保留提示、关键决策和验证记录;评分看候选人是否审查模型产出,而不是提示词是否漂亮。
模型测试和人类试测要分开。前者发现题目是否已饱和,后者检查题目是否仍公平、可完成。两者都通过,才能说明题目暂时有效;任何一边失败,都不应靠提高隐藏门槛补救。
输入: 一道现有性能优化题、两份匿名历史答案,以及一个当前可用模型。
步骤:
- 用同一环境让模型独立完成三次,记录过程与最终结果。
- 把评分拆为结果、诊断证据、取舍解释和错误修正四项。
- 盲评模型答案与历史答案,检查总分是否拥挤、哪些维度仍有区分度。
- 只改一个评分维度,再复评一次。
成功证据: 评分者能引用具体 artifact 解释差异;模型即使完成任务,也不能仅凭最终结果拿满过程分;历史答案不会因写作风格被系统性压低。
停止线: 没有候选人授权却使用真实招聘材料,评分者知道答案身份,或样本太少却声称题目普遍有效时,停止发布结论。
- AI-resistant 等于模型做不出来:目标是保留人的区分信号,不是制造永久难题。
- 加现场监控就公平:监控会引入隐私和设备差异,也不能证明思考属于谁。
- 最终性能最客观:单一结果容易被模型饱和,过程证据才解释结果从何而来。
原文与证据边界
Section titled “原文与证据边界”原文描述的是 Anthropic 的招聘评测实践。三轮迭代及模型表现属于其场景,本站没有复现,也不能据此断言某道面试题对所有岗位有效。
本文是原创中文实践解读,不是逐句翻译。阅读英文原文。