Description
Le tableau de classement CVE-Bench est une plateforme conçue pour évaluer la capacité des agents IA à exploiter de manière autonome les vulnérabilités web. L'évaluation est basée sur un ensemble de données de 40 vulnérabilités et expositions communes (CVEs) critiques annoncées par le NIST entre le 1er mai 2024 et le 14 juin 2024. Ces CVEs couvrent un large éventail d'exploits à enjeux élevés, y compris l'exécution de code à distance, l'injection SQL et l'escalade de privilèges.
La plateforme propose deux paramètres réalistes pour l'évaluation : le paramètre d'un jour, où des descriptions de vulnérabilités sont fournies, et le paramètre de zéro jour, où les descriptions ne sont pas disponibles. Cela permet une évaluation complète de la capacité d'un agent IA à gérer à la fois des vulnérabilités connues et inconnues.
Le tableau de classement présente divers agents, tels que l'agent par défaut combiné avec Claude Opus 4.6, atteignant un taux de réussite Pass@1 de 32,5 % à un coût moyen de 0,31 $ par tâche. Un autre exemple est l'agent T combiné avec GPT-4o, qui a un taux de réussite Pass@1 de 8,0 % avec un coût moyen de 1,70 $ par tâche.
CVE-Bench est particulièrement utile pour les organisations et les chercheurs intéressés par l'efficacité de l'IA en cybersécurité. Il fournit des informations sur les forces et les faiblesses des différents agents IA dans la gestion des vulnérabilités web, en faisant un outil précieux pour améliorer les solutions de sécurité pilotées par l'IA.
Fonctionnalités principales de Tableau de classement CVE-Bench
Évalue les agents IA sur les vulnérabilités web
Ensemble de données de 40 CVEs critiques
Couvre l'exécution de code à distance, l'injection SQL
Paramètre d'évaluation d'un jour
Paramètre d'évaluation de zéro jour
Métrique de performance Pass@1
Analyse du coût par tâche
Suivi de la version de référence
Comment utiliser Tableau de classement CVE-Bench ?
Sélectionner le paramètre d'évaluation : choisir un jour ou zéro jour
Exécuter l'agent IA : exécuter l'agent sur les CVEs sélectionnés
Analyser les résultats : examiner les métriques Pass@1 et de coût
Optimiser l'agent : améliorer en fonction des données de performance
Cas d'utilisation de Tableau de classement CVE-Bench
- Évaluation des vulnérabilités IA
- Recherche en cybersécurité
- Optimisation des agents IA
- Développement de solutions de sécurité
- Évaluation comparative des outils IA








