Beschreibung
CVE-Bench Leaderboard ist eine Plattform, die entwickelt wurde, um die Fähigkeit von KI-Agenten zur autonomen Ausnutzung von Web-Sicherheitsanfälligkeiten zu bewerten. Die Bewertung basiert auf einem Datensatz von 40 kritischen Common Vulnerabilities and Exposures (CVEs), die von NIST zwischen dem 1. Mai 2024 und dem 14. Juni 2024 bekannt gegeben wurden. Diese CVEs decken eine Vielzahl von hochriskanten Ausnutzungen ab, einschließlich Remote-Code-Ausführung, SQL-Injection und Privilegieneskalation.
Die Plattform bietet zwei realistische Einstellungen für die Bewertung: die Ein-Tages-Einstellung, bei der Sicherheitsanfälligkeitsbeschreibungen bereitgestellt werden, und die Null-Tages-Einstellung, bei der keine Beschreibungen verfügbar sind. Dies ermöglicht eine umfassende Bewertung der Fähigkeit eines KI-Agenten, sowohl mit bekannten als auch mit unbekannten Sicherheitsanfälligkeiten umzugehen.
Die Rangliste zeigt verschiedene Agenten, wie den Standard-Agenten in Kombination mit Claude Opus 4.6, der eine Pass@1-Rate von 32,5 % bei durchschnittlichen Kosten von 0,31 $ pro Aufgabe erreicht. Ein weiteres Beispiel ist der T-Agent in Kombination mit GPT-4o, der eine Pass@1-Rate von 8,0 % bei durchschnittlichen Kosten von 1,70 $ pro Aufgabe hat.
CVE-Bench ist besonders nützlich für Organisationen und Forscher, die daran interessiert sind, die Effektivität von KI in der Cybersicherheit zu verstehen. Es bietet Einblicke in die Stärken und Schwächen verschiedener KI-Agenten im Umgang mit Web-Sicherheitsanfälligkeiten und ist ein wertvolles Werkzeug zur Verbesserung KI-gesteuerter Sicherheitslösungen.
CVE-Bench Leaderboard's Kernfunktionen
Bewertet KI-Agenten zu Web-Sicherheitsanfälligkeiten
Datensatz von 40 kritischen CVEs
Deckt Remote-Code-Ausführung, SQL-Injection ab
Ein-Tages-Bewertungseinstellung
Null-Tages-Bewertungseinstellung
Pass@1 Leistungskennzahl
Kostenanalyse pro Aufgabe
Verfolgung der Benchmark-Version
Wie verwendet man CVE-Bench Leaderboard?
Wählen Sie die Bewertungseinstellung: wählen Sie Ein-Tag oder Null-Tag
Führen Sie den KI-Agenten aus: führen Sie den Agenten auf den ausgewählten CVEs aus
Analysieren Sie die Ergebnisse: überprüfen Sie die Pass@1- und Kostenkennzahlen
Optimieren Sie den Agenten: verbessern Sie ihn basierend auf Leistungsdaten
CVE-Bench Leaderboard's Anwendungsfälle
- KI-Sicherheitsanfälligkeitsbewertung
- Cybersicherheitsforschung
- Optimierung von KI-Agenten
- Entwicklung von Sicherheitslösungen
- Benchmarking von KI-Tools








