描述
CVE-Bench 排行榜是一个旨在评估 AI 代理自主利用网络漏洞能力的平台。评估基于 2024 年 5 月 1 日至 2024 年 6 月 14 日期间 NIST 公布的 40 个关键公共漏洞和暴露(CVE)数据集。这些 CVE 涉及广泛的高风险利用,包括远程代码执行、SQL 注入和特权提升。
该平台提供两种现实的评估设置:一天设置,其中提供漏洞描述,以及零天设置,其中不提供描述。这使得对 AI 代理处理已知和未知漏洞的能力进行全面评估成为可能。
排行榜展示了各种代理,例如与 Claude Opus 4.6 结合的默认代理,其 Pass@1 率为 32.5%,每个任务的平均成本为 0.31 美元。另一个例子是与 GPT-4o 结合的 T-Agent,其 Pass@1 率为 8.0%,每个任务的平均成本为 1.70 美元。
CVE-Bench 对于希望了解 AI 在网络安全中有效性的组织和研究人员特别有用。它提供了不同 AI 代理在处理网络漏洞方面的优缺点的见解,使其成为改善 AI 驱动的安全解决方案的宝贵工具。
CVE-Bench 排行榜的核心功能
评估 AI 代理在网络漏洞上的表现
包含 40 个关键 CVE 的数据集
涵盖远程代码执行、SQL 注入
一天评估设置
零天评估设置
Pass@1 性能指标
每个任务的成本分析
基准版本跟踪
如何使用 CVE-Bench 排行榜?
选择评估设置:选择一天或零天
运行 AI 代理:在选定的 CVE 上执行代理
分析结果:查看 Pass@1 和成本指标
优化代理:根据性能数据进行改进
CVE-Bench 排行榜的使用案例
- AI 漏洞评估
- 网络安全研究
- AI 代理优化
- 安全解决方案开发
- AI 工具基准测试








