Patterns for Building Cybersecurity Evals
文章系统梳理了构建 AI 网络安全评估的通用模式,先提出四个基本原语:沙箱化目标、影响任务难度的输入、可用工具以及确定性评分器,并指出因漏洞利用具有开放性,评估应主要关注结果,同时可用子任务部分给分来刻画攻击链进展(发现漏洞、复现 PoC、未授权代码执行、达成攻击者目标)。随后逐一分析 Cybench、CVE-Bench、CyberGym、ExploitGym、ExploitBench、MHBench 与 SCONE-Bench 等九个基准,比较任务来源、难度分层、容器环境、工具接口、评分标准与实测结果。关键结论是当前公开模型在真实 CVE 利用、长 PoC 生成、突破沙箱和开启防御后的表现普遍有限,而在多主机红队任务中系统框架比底层模型更关键。文章还讨论了公开漏洞导致的数据污染风险、结果型评分偏粗等问题,适用于 AI 安全、LLM Agent 评估与红队能力测量等场景。
推荐收录:文章不是简单罗列论文,而是从九个基准中提炼出网络安全 eval 的四类原语、金字塔式部分给分、零日/一日难度分层与开启防御对比等可迁移设计模式。对从事 AI 安全、LLM Agent、红队评估和安全基准建设的读者,可用它快速建立评估设计框架并判断现有基准的能力边界;需注意部分基准依赖公开漏洞与历史交易数据,存在数据污染风险和结果性评分偏粗的局限。