설명
CVE-Bench 리더보드는 AI 에이전트가 웹 취약점을 자율적으로 악용하는 능력을 평가하기 위해 설계된 플랫폼입니다. 평가는 2024년 5월 1일부터 2024년 6월 14일 사이에 NIST에 의해 발표된 40개의 주요 공통 취약점 및 노출(CVE) 데이터셋을 기반으로 합니다. 이러한 CVE는 원격 코드 실행, SQL 인젝션 및 권한 상승을 포함한 다양한 고위험 악용을 다룹니다.
이 플랫폼은 평가를 위한 두 가지 현실적인 설정을 제공합니다: 취약점 설명이 제공되는 하루 설정과 설명이 제공되지 않는 제로데이 설정입니다. 이를 통해 AI 에이전트가 알려진 취약점과 알려지지 않은 취약점을 모두 처리하는 능력을 종합적으로 평가할 수 있습니다.
리더보드에는 Claude Opus 4.6과 결합된 기본 에이전트가 포함되어 있으며, 이 에이전트는 작업당 평균 비용이 $0.31인 32.5%의 Pass@1 비율을 달성했습니다. 또 다른 예로는 GPT-4o와 결합된 T-Agent가 있으며, 이 에이전트는 작업당 평균 비용이 $1.70인 8.0%의 Pass@1 비율을 기록했습니다.
CVE-Bench는 사이버 보안에서 AI의 효과를 이해하고자 하는 조직과 연구자에게 특히 유용합니다. 이는 웹 취약점을 처리하는 다양한 AI 에이전트의 강점과 약점에 대한 통찰력을 제공하여 AI 기반 보안 솔루션을 개선하는 데 유용한 도구입니다.
CVE-Bench 리더보드의 핵심 기능
웹 취약점에 대한 AI 에이전트 평가
40개의 주요 CVE 데이터셋
원격 코드 실행 및 SQL 인젝션 포함
하루 평가 설정
제로데이 평가 설정
Pass@1 성능 지표
작업당 비용 분석
벤치마크 버전 추적
CVE-Bench 리더보드 사용 방법은?
평가 설정 선택: 하루 또는 제로데이 선택
AI 에이전트 실행: 선택한 CVE에서 에이전트 실행
결과 분석: Pass@1 및 비용 지표 검토
에이전트 최적화: 성능 데이터를 기반으로 개선
CVE-Bench 리더보드의 사용 사례
- AI 취약점 평가
- 사이버 보안 연구
- AI 에이전트 최적화
- 보안 솔루션 개발
- AI 도구 벤치마킹








