跳转到主要内容
ToolPotion

CVE-Bench 排行榜

CVE-Bench 排行榜评估 AI 代理利用网络漏洞的能力,使用 40 个关键 CVE 的数据集。它提供两种评估设置:有漏洞描述的一天设置和没有描述的零天设置。

访问URL
CVE-Bench 排行榜 screenshot

描述

CVE-Bench 排行榜是一个旨在评估 AI 代理自主利用网络漏洞能力的平台。评估基于 2024 年 5 月 1 日至 2024 年 6 月 14 日期间 NIST 公布的 40 个关键公共漏洞和暴露(CVE)数据集。这些 CVE 涉及广泛的高风险利用,包括远程代码执行、SQL 注入和特权提升。

该平台提供两种现实的评估设置:一天设置,其中提供漏洞描述,以及零天设置,其中不提供描述。这使得对 AI 代理处理已知和未知漏洞的能力进行全面评估成为可能。

排行榜展示了各种代理,例如与 Claude Opus 4.6 结合的默认代理,其 Pass@1 率为 32.5%,每个任务的平均成本为 0.31 美元。另一个例子是与 GPT-4o 结合的 T-Agent,其 Pass@1 率为 8.0%,每个任务的平均成本为 1.70 美元。

CVE-Bench 对于希望了解 AI 在网络安全中有效性的组织和研究人员特别有用。它提供了不同 AI 代理在处理网络漏洞方面的优缺点的见解,使其成为改善 AI 驱动的安全解决方案的宝贵工具。

CVE-Bench 排行榜的核心功能

  • 评估 AI 代理在网络漏洞上的表现

  • 包含 40 个关键 CVE 的数据集

  • 涵盖远程代码执行、SQL 注入

  • 一天评估设置

  • 零天评估设置

  • Pass@1 性能指标

  • 每个任务的成本分析

  • 基准版本跟踪

如何使用 CVE-Bench 排行榜?

  1. 选择评估设置:选择一天或零天

  2. 运行 AI 代理:在选定的 CVE 上执行代理

  3. 分析结果:查看 Pass@1 和成本指标

  4. 优化代理:根据性能数据进行改进

CVE-Bench 排行榜的使用案例

  • AI 漏洞评估
  • 网络安全研究
  • AI 代理优化
  • 安全解决方案开发
  • AI 工具基准测试

CVE-Bench 排行榜的常见问题

CVE-Bench 排行榜 评价

加载中...

与 CVE-Bench 排行榜 类似的热门AI工具

AI 应用

在线网站漏洞扫描器,内置AI分析师,协调OWASP ZAP、Nuclei、Nmap、WPScan和sqlmap等行业工具,然后将原始发现转化为一份优先级报告,包含通俗易懂的总结和修复步骤。

AI 网络安全工具

AI 应用

Horizon3 提供自主渗透测试,帮助组织在攻击者能够利用漏洞之前识别和修复这些漏洞。通过真实世界的攻击模拟,它实现了持续的安全验证和关键风险的优先排序,确保了主动防御策略。

AI 网络安全工具

Equixly 提供持续的 API 入侵测试,配备 Agentic AI Hacker。它全天候自主发现和测试 API,在攻击者之前识别可利用的风险。该平台集成到 DevSecOps 工作流中,为现代、API 驱动的架构提供实时验证和修复洞察。

AI 网络安全工具

Aptori 是一个原生 AI 应用安全平台,可持续验证运行时行为,证明可利用性,并优先处理真实风险。它加速修复,验证关闭,并为受监管的企业提供受管证据,确保在 AI 时代实现安全设计软件。

AI 网络安全工具

AI 应用

Adversa AI 提供一个自主平台,用于持续的 AI 红队演练,专门针对 AI 代理、LLM 和 GenAI 应用。它识别并修复安全漏洞,确保 AI 系统能够大规模部署而不会引入不当风险。该服务映射到 OWASP 和 NIST 标准,为定制 AI 解决方案提供量身定制的安全保障。

AI 网络安全工具

Mindgard 提供自动化的 AI 红队演练和安全测试,以发现、评估和防御 AI 模型、代理和应用程序。它充当自主红队,绘制 AI 攻击面图并识别高影响力的漏洞,防止其被利用,从而确保强大的 AI 系统安全性。

AI 网络安全工具

AI 应用

CyberSanctus是一家网络安全公司,提供基于威胁的渗透测试、红队演练和漏洞评估,以及一个名为CodeHound的AI驱动的智能合约审计工具,专为Solidity项目设计。

AI 网络安全工具

AI 应用

White Hat 是一款由人工智能驱动的网络安全聊天机器人,专为道德黑客设计。它提供智能、个性化和实时的策略与资源,帮助用户加固防御、掌握技能,并为任何网络安全挑战构建强大的红队和蓝队策略。

AI 网络安全工具