الوصف
تعتبر قائمة المتصدرين في CVE-Bench منصة مصممة لتقييم قدرة وكلاء الذكاء الاصطناعي على استغلال ثغرات الويب بشكل مستقل. يعتمد التقييم على مجموعة بيانات تحتوي على 40 ثغرة حرجة من الثغرات الشائعة (CVEs) التي أعلنت عنها NIST بين 1 مايو 2024 و14 يونيو 2024. تشمل هذه الثغرات مجموعة واسعة من الاستغلالات عالية المخاطر، بما في ذلك تنفيذ التعليمات البرمجية عن بُعد، حقن SQL، وتصعيد الامتيازات.
توفر المنصة إعدادين واقعيين للتقييم: إعداد اليوم الواحد، حيث يتم تقديم أوصاف الثغرات، وإعداد صفر اليوم، حيث لا تتوفر الأوصاف. يتيح ذلك تقييمًا شاملاً لقدرة وكيل الذكاء الاصطناعي على التعامل مع الثغرات المعروفة وغير المعروفة.
تتضمن قائمة المتصدرين وكلاء مختلفين، مثل الوكيل الافتراضي المدمج مع Claude Opus 4.6، الذي حقق معدل Pass@1 بنسبة 32.5% بتكلفة متوسطة قدرها 0.31 دولار لكل مهمة. مثال آخر هو T-Agent المدمج مع GPT-4o، الذي لديه معدل Pass@1 بنسبة 8.0% بتكلفة متوسطة قدرها 1.70 دولار لكل مهمة.
تعتبر CVE-Bench مفيدة بشكل خاص للمنظمات والباحثين المهتمين بفهم فعالية الذكاء الاصطناعي في مجال الأمن السيبراني. توفر رؤى حول نقاط القوة والضعف لوكلاء الذكاء الاصطناعي المختلفين في التعامل مع ثغرات الويب، مما يجعلها أداة قيمة لتحسين حلول الأمان المدفوعة بالذكاء الاصطناعي.
الميزات الأساسية لـ قائمة المتصدرين في CVE-Bench
تقييم وكلاء الذكاء الاصطناعي على ثغرات الويب
مجموعة بيانات تحتوي على 40 ثغرة حرجة
تشمل تنفيذ التعليمات البرمجية عن بُعد، حقن SQL
إعداد تقييم ليوم واحد
إعداد تقييم لصفر يوم
مقياس أداء Pass@1
تحليل التكلفة لكل مهمة
تتبع إصدار المعيار
كيفية استخدام قائمة المتصدرين في CVE-Bench؟
اختر إعداد التقييم: اختر يوم واحد أو صفر يوم
قم بتشغيل وكيل الذكاء الاصطناعي: نفذ الوكيل على الثغرات المختارة
تحليل النتائج: راجع مقاييس Pass@1 والتكلفة
تحسين الوكيل: تحسين بناءً على بيانات الأداء
حالات استخدام قائمة المتصدرين في CVE-Bench
- تقييم ثغرات الذكاء الاصطناعي
- بحث في الأمن السيبراني
- تحسين وكيل الذكاء الاصطناعي
- تطوير حلول الأمان
- تقييم أدوات الذكاء الاصطناعي








