Eugene Yan

2 篇内容

科研议题Eugene Yan

Patterns for Building Cybersecurity Evals

文章系统梳理了构建 AI 网络安全评估的通用模式,先提出四个基本原语:沙箱化目标、影响任务难度的输入、可用工具以及确定性评分器,并指出因漏洞利用具有开放性,评估应主要关注结果,同时可用子任务部分给分来刻画攻击链进展(发现漏洞、复现 PoC、未授权代码执行、达成攻击者目标)。随后逐一分析 Cybench、CVE-Bench、CyberGym、ExploitGym、ExploitBench、MHBench 与 SCONE-Bench 等九个基准,比较任务来源、难度分层、容器环境、工具接口、评分标准与实测结果。关键结论是当前公开模型在真实 CVE 利用、长 PoC 生成、突破沙箱和开启防御后的表现普遍有限,而在多主机红队任务中系统框架比底层模型更关键。文章还讨论了公开漏洞导致的数据污染风险、结果型评分偏粗等问题,适用于 AI 安全、LLM Agent 评估与红队能力测量等场景。

推荐收录:文章不是简单罗列论文,而是从九个基准中提炼出网络安全 eval 的四类原语、金字塔式部分给分、零日/一日难度分层与开启防御对比等可迁移设计模式。对从事 AI 安全、LLM Agent、红队评估和安全基准建设的读者,可用它快速建立评估设计框架并判断现有基准的能力边界;需注意部分基准依赖公开漏洞与历史交易数据,存在数据污染风险和结果性评分偏粗的局限。

工具笔记Eugene Yan

How to Work and Compound with AI

文章总结作者与 AI 协作并让成果持续复利的方法。核心是把上下文当基础设施:整理目录树、维护 INDEX.md、用 CLAUDE.md 让每个新会话像新人入职,并分层保存事实与偏好。其次把品味编码为配置,按全局/仓库/项目分层,把高频流程做成按需加载的 skills,并在会话中纠正以迭代技能。验证上主张检查左移,用钩子、测试、eval、浏览器检查等低成本反馈推动自主执行,长任务用次级会话监督漂移。规模化委派强调先定义成功标准再交付大任务,并行多会话并用 worktree 与状态提示保持可观测;最后通过公开工作、挖掘会话记录更新配置、定期重构来闭环。作者认为具体工具会变,但这些原则也适用于 agent harness、团队规范与组织基础设施。

推荐收录。文章给出了可直接操作和迁移的 AI 协作工作流:CLAUDE.md 分层、skills 生成与迭代、验证阶梯、并行委派、transcript 挖掘和定期重构,并附有具体示例与机制说明。适合使用 Claude Code/LLM 的工程师、AI 工程团队和关注开发者生产力的读者,可用来设计 agent harness、团队规范或组织上下文基础设施。风险是具体工具与配置会随模型演进快速过时,但底层原则仍长期有效。