Interview

1 篇内容

职业经验Anthropic Engineering

Designing AI-resistant technical evaluations

文章回顾了 Anthropic 性能工程团队如何设计并多次重做 take-home 面试,以在 AI 辅助普及后仍能区分候选人。原题是模拟加速器上的树遍历优化,要求候选人逐步完成并行化、SIMD/VLIW 利用、调试和工具构建,因此在早期能有效筛出强工程师,也确实招到了多位高绩效员工。随着 Claude Opus 4 和 4.5 在两小时约束内逐步追平甚至超过优秀人类,作者不得不把题目改成更陌生、更受限的谜题式优化问题,并减少那些模型已经轻松掌握的维度。文章总结出评估设计应兼顾真实工作、高信号、足够深度以及对 AI 的开放使用,但也承认越强调“抗模型”越容易牺牲岗位真实性和可解释性。最后作者公开了原始题目作为挑战,并用成绩对比说明人类在无限时间下仍有优势,但在短时约束下可区分性正在迅速下降。

推荐收录,因为文中给出了清晰的直接证据:原始 take-home 曾有效招人,但已被 Claude Opus 4/4.5 在 2 小时约束内追平甚至超越,迫使团队重设评估方式。适合负责面试设计、技术招聘和 AI 时代能力评估的人阅读,可迁移价值在于如何构造高信号任务与识别失效边界。