본문으로 건너뛰기
ToolPotion

CVE-Bench 리더보드

CVE-Bench 리더보드는 40개의 주요 CVE 데이터셋을 사용하여 AI 에이전트가 웹 취약점을 자율적으로 악용하는 능력을 평가합니다. 취약점 설명이 포함된 하루 평가와 설명이 없는 제로데이 평가의 두 가지 평가 설정을 제공합니다.

URL 방문
CVE-Bench 리더보드 screenshot

설명

CVE-Bench 리더보드는 AI 에이전트가 웹 취약점을 자율적으로 악용하는 능력을 평가하기 위해 설계된 플랫폼입니다. 평가는 2024년 5월 1일부터 2024년 6월 14일 사이에 NIST에 의해 발표된 40개의 주요 공통 취약점 및 노출(CVE) 데이터셋을 기반으로 합니다. 이러한 CVE는 원격 코드 실행, SQL 인젝션 및 권한 상승을 포함한 다양한 고위험 악용을 다룹니다.

이 플랫폼은 평가를 위한 두 가지 현실적인 설정을 제공합니다: 취약점 설명이 제공되는 하루 설정과 설명이 제공되지 않는 제로데이 설정입니다. 이를 통해 AI 에이전트가 알려진 취약점과 알려지지 않은 취약점을 모두 처리하는 능력을 종합적으로 평가할 수 있습니다.

리더보드에는 Claude Opus 4.6과 결합된 기본 에이전트가 포함되어 있으며, 이 에이전트는 작업당 평균 비용이 $0.31인 32.5%의 Pass@1 비율을 달성했습니다. 또 다른 예로는 GPT-4o와 결합된 T-Agent가 있으며, 이 에이전트는 작업당 평균 비용이 $1.70인 8.0%의 Pass@1 비율을 기록했습니다.

CVE-Bench는 사이버 보안에서 AI의 효과를 이해하고자 하는 조직과 연구자에게 특히 유용합니다. 이는 웹 취약점을 처리하는 다양한 AI 에이전트의 강점과 약점에 대한 통찰력을 제공하여 AI 기반 보안 솔루션을 개선하는 데 유용한 도구입니다.

CVE-Bench 리더보드의 핵심 기능

  • 웹 취약점에 대한 AI 에이전트 평가

  • 40개의 주요 CVE 데이터셋

  • 원격 코드 실행 및 SQL 인젝션 포함

  • 하루 평가 설정

  • 제로데이 평가 설정

  • Pass@1 성능 지표

  • 작업당 비용 분석

  • 벤치마크 버전 추적

CVE-Bench 리더보드 사용 방법은?

  1. 평가 설정 선택: 하루 또는 제로데이 선택

  2. AI 에이전트 실행: 선택한 CVE에서 에이전트 실행

  3. 결과 분석: Pass@1 및 비용 지표 검토

  4. 에이전트 최적화: 성능 데이터를 기반으로 개선

CVE-Bench 리더보드의 사용 사례

  • AI 취약점 평가
  • 사이버 보안 연구
  • AI 에이전트 최적화
  • 보안 솔루션 개발
  • AI 도구 벤치마킹

CVE-Bench 리더보드의 FAQ

CVE-Bench 리더보드 리뷰

로딩 중...

CVE-Bench 리더보드와(과) 비슷한 인기 AI 도구

AI 앱

내장된 AI 분석가가 OWASP ZAP, Nuclei, Nmap, WPScan 및 sqlmap과 같은 산업 도구를 조정하여 원시 결과를 우선 순위가 매겨진 보고서로 변환하는 온라인 웹사이트 취약점 스캐너입니다.

AI 사이버 보안 도구

AI 앱

Horizon3는 조직이 공격자가 취약점을 악용하기 전에 이를 식별하고 수정할 수 있도록 자율 침투 테스트를 제공합니다. 실제 공격 시뮬레이션을 통해 지속적인 보안 검증과 중요한 위험의 우선 순위를 정할 수 있어, 능동적인 방어 전략을 보장합니다.

AI 사이버 보안 도구

Equixly는 Agentic AI Hacker를 통해 지속적인 API 침투 테스트를 제공합니다. 이 솔루션은 API를 24시간 연중무휴로 자동 탐색 및 테스트하여 공격자보다 먼저 악용 가능한 위험을 식별합니다. 이 플랫폼은 DevSecOps 워크플로우에 통합되어 현대적인 API 중심 아키텍처에 대한 실시간 검증 및…

AI 사이버 보안 도구

Aptori는 런타임 동작을 지속적으로 검증하고, 악용 가능성을 증명하며, 실제 위험을 우선순위화하는 AI 네이티브 애플리케이션 보안 플랫폼입니다. 규제 대상 기업을 위해 수정 작업을 가속화하고, 완료를 확인하며, 관리된 증거를 제공하여 AI 시대에 안전하게 설계된 소프트웨어를 보장합니다.

AI 사이버 보안 도구

Adversa AI는 AI 에이전트, LLM 및 GenAI 애플리케이션을 위해 특별히 설계된 지속적인 AI 레드팀 운영을 위한 자율 플랫폼을 제공합니다. 보안 취약점을 식별 및 수정하여 AI 시스템이 과도한 위험 없이 대규모로 배포되도록 보장합니다. 이 서비스는 OWASP 및 NIST 표준에 맞춰 맞춤형 AI 솔루션을…

AI 사이버 보안 도구

Mindgard는 AI 모델, 에이전트 및 애플리케이션을 발견, 평가 및 방어하기 위한 자동화된 AI 레드팀 및 보안 테스트를 제공합니다. 자율적인 레드팀 역할을 수행하여 AI 공격 표면을 매핑하고 악용되기 전에 높은 영향력의 취약점을 식별하여 강력한 AI 시스템 보안을 보장합니다.

AI 사이버 보안 도구

CyberSanctus는 위협 기반 침투 테스트, 레드 팀 활동 및 취약성 평가를 제공하는 사이버 보안 회사로, Solidity 프로젝트를 위한 AI 기반 스마트 계약 감사 도구인 CodeHound를 함께 제공합니다.

AI 사이버 보안 도구

AI 앱

White Hat은 윤리적 해커를 위한 AI 기반 사이버 보안 챗봇입니다. 사용자가 방어를 강화하고, 기술을 숙달하며, 모든 사이버 보안 과제에 대한 강력한 레드팀 및 블루팀 전략을 구축할 수 있도록 지능적이고 개인화된 실시간 전략 및 리소스를 제공합니다.

AI 사이버 보안 도구