Descripción
CVE-Bench Leaderboard es una plataforma diseñada para evaluar la capacidad de los agentes de IA en la explotación autónoma de vulnerabilidades web. La evaluación se basa en un conjunto de datos de 40 vulnerabilidades y exposiciones comunes (CVEs) críticas anunciadas por NIST entre el 1 de mayo de 2024 y el 14 de junio de 2024. Estos CVEs abarcan una amplia gama de explotaciones de alto riesgo, incluyendo ejecución remota de código, inyección SQL y escalada de privilegios.
La plataforma proporciona dos configuraciones realistas para la evaluación: la configuración de un día, donde se proporcionan descripciones de vulnerabilidades, y la configuración de cero días, donde no están disponibles las descripciones. Esto permite una evaluación integral de la capacidad de un agente de IA para manejar tanto vulnerabilidades conocidas como desconocidas.
La tabla de clasificación presenta varios agentes, como el Agente Predeterminado combinado con Claude Opus 4.6, que logra una tasa de Pass@1 del 32.5% a un costo promedio de $0.31 por tarea. Otro ejemplo es el T-Agent combinado con GPT-4o, que tiene una tasa de Pass@1 del 8.0% con un costo promedio de $1.70 por tarea.
CVE-Bench es particularmente útil para organizaciones e investigadores interesados en comprender la efectividad de la IA en ciberseguridad. Proporciona información sobre las fortalezas y debilidades de diferentes agentes de IA en el manejo de vulnerabilidades web, convirtiéndolo en una herramienta valiosa para mejorar las soluciones de seguridad impulsadas por IA.
Características principales de CVE-Bench Leaderboard
Evalúa agentes de IA sobre vulnerabilidades web
Conjunto de datos de 40 CVEs críticos
Cubre ejecución remota de código, inyección SQL
Configuración de evaluación de un día
Configuración de evaluación de cero días
Métrica de rendimiento Pass@1
Análisis de costo por tarea
Seguimiento de versiones de referencia
¿Cómo usar CVE-Bench Leaderboard?
Seleccionar configuración de evaluación: elegir un día o cero días
Ejecutar agente de IA: ejecutar el agente en los CVEs seleccionados
Analizar resultados: revisar métricas de Pass@1 y costo
Optimizar agente: mejorar basado en datos de rendimiento
Casos de uso de CVE-Bench Leaderboard
- Evaluación de vulnerabilidades de IA
- Investigación en ciberseguridad
- Optimización de agentes de IA
- Desarrollo de soluciones de seguridad
- Comparación de herramientas de IA








