تخطَّ إلى المحتوى الرئيسي
ToolPotion

AgentDojo

AgentDojo هو بيئة ديناميكية مصممة لتقييم هجمات حقن التعليمات والدفاعات لوكلاء نماذج اللغة الكبيرة (LLM). تم تطويره بواسطة باحثين من ETH Zurich وInvariant Labs، ويوفر أدوات لتقييم الأداء وإنشاء نماذج جديدة للهجوم والدفاع، مما يساعد في دراسة ثغرات الذكاء الاصطناعي.

زيارة الرابط
مشاركة
AgentDojo screenshot

الوصف

AgentDojo هو منصة متطورة تم تطويرها لتقييم هجمات حقن التعليمات والدفاعات بشكل خاص لوكلاء نماذج اللغة الكبيرة (LLM). أنشأها فريق من الباحثين من ETH Zurich وInvariant Labs، وتعد AgentDojo أداة حيوية لفهم وتخفيف الثغرات في أنظمة الذكاء الاصطناعي. لقد حصلت المنصة على اعتراف لمساهماتها في سلامة الذكاء الاصطناعي، حيث فازت بجائزة SafeBench الأولى إلى جانب Cybench وBackdoorLLM.

الوظيفة الأساسية لـ AgentDojo هي توفير بيئة محكومة حيث يمكن للمستخدمين تشغيل تقييمات لاختبار مرونة نماذج الذكاء الاصطناعي ضد هجمات حقن التعليمات. يمكن للمستخدمين تثبيت الحزمة وتنفيذ التقييمات باستخدام السكربتات، مع توفر وثائق مفصلة لإرشادهم خلال العملية. وهذا يجعلها موردًا لا يقدر بثمن للباحثين والمطورين الذين يتطلعون إلى تعزيز أمان أنظمة الذكاء الاصطناعي.

تتيح AgentDojo أيضًا للمستخدمين إنشاء آليات ونماذج دفاع جديدة، حيث تقدم وثائق شاملة حول كيفية تطوير خطوط أنابيب مخصصة. تضمن هذه المرونة أن يتمكن المستخدمون من تخصيص دفاعاتهم وفقًا للاحتياجات المحددة، مما يجعل المنصة قابلة للتكيف مع سيناريوهات البحث والتطوير المختلفة.

تتجلى تأثيرات المنصة بشكل أكبر من خلال استخدامها في إظهار ثغرات نماذج الذكاء الاصطناعي مثل Claude 3.5 Sonnet ضد حقن التعليمات. تؤكد هذه القدرة على أهمية AgentDojo في الجهود المستمرة لتأمين تقنيات الذكاء الاصطناعي. ومع ذلك، يجب على المستخدمين ملاحظة أن واجهة برمجة التطبيقات (API) لا تزال قيد التطوير، مما قد يؤدي إلى تغييرات في المستقبل.

بشكل عام، تستهدف AgentDojo الباحثين في الذكاء الاصطناعي، والمطورين، وخبراء الأمان الذين يركزون على تحسين قوة أنظمة الذكاء الاصطناعي ضد الهجمات الخبيثة. تجعل ميزاتها الشاملة وقدرتها على التكيف منها أداة حيوية في مجال أبحاث أمان الذكاء الاصطناعي.

الميزات الأساسية لـ AgentDojo

  • تقييم هجمات حقن التعليمات

  • تطوير نماذج دفاع جديدة

  • تشغيل تقييمات باستخدام السكربتات

  • وثائق شاملة

  • إنشاء خطوط أنابيب مخصصة

  • إظهار ثغرات الذكاء الاصطناعي

  • واجهة برمجة التطبيقات قيد التطوير

  • فائز بجائزة SafeBench

كيفية استخدام AgentDojo؟

  1. تثبيت: تحميل وإعداد الحزمة

  2. تشغيل التقييم: تنفيذ السكربتات لاختبار النماذج

  3. تطوير: إنشاء نماذج دفاع جديدة

  4. توثيق: الرجوع إلى الأدلة التفصيلية للإعداد

حالات استخدام AgentDojo

  • أبحاث أمان الذكاء الاصطناعي
  • تطوير نماذج الدفاع
  • تقييم أنظمة الذكاء الاصطناعي
  • إنشاء خطوط أنابيب مخصصة
  • إظهار ثغرات الذكاء الاصطناعي

الأسئلة الشائعة من AgentDojo

تقييمات AgentDojo

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل AgentDojo

تطبيقات الذكاء الاصطناعي

garak هو ماسح ثغرات LLM مفتوح المصدر مصمم لتقييم أمان نماذج اللغة الكبيرة. يقدم العديد من الإضافات وآلاف من المطالبات لاختبار أمان النموذج، بدعم من NVIDIA والمجتمع.

أدوات الأمن السيبراني بالذكاء الاصطناعيالرعاية الصحية وعلوم الحياة

تطبيقات الذكاء الاصطناعي

Giskard هي منصة أمان تعتمد على الذكاء الاصطناعي تركز على فرق الاختراق المستمرة وأمان نماذج اللغة الكبيرة. تساعد في اكتشاف الثغرات، ومنع الهلوسة، وحماية أنظمة الذكاء الاصطناعي من…

أدوات الأمن السيبراني بالذكاء الاصطناعيالتمويل والخدمات المصرفية

تطبيقات الذكاء الاصطناعي

تقدم Equixly اختبار اختراق مستمر لواجهات برمجة التطبيقات (APIs) باستخدام مخترق ذكاء اصطناعي عميلي (Agentic AI Hacker). يكتشف ويختبر واجهات برمجة التطبيقات بشكل مستقل على مدار…

أدوات الأمن السيبراني بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

تقدم Mindgard اختبارات أمان واختبارات فريق أحمر آلية لاكتشاف وتقييم نماذج وعوامل وتطبيقات الذكاء الاصطناعي والدفاع عنها. تعمل كفريق أحمر مستقل، حيث ترسم سطح هجوم الذكاء الاصطناعي…

أدوات الأمن السيبراني بالذكاء الاصطناعيالرعاية الصحية وعلوم الحياة

مستودعات GitHub للذكاء الاصطناعي

ماسح أمان أجنسي هو أداة لفحص الثغرات ومجموعة أدوات فرق الاختراق المدعومة بالذكاء الاصطناعي مصممة لتحديد ومعالجة الثغرات في نماذج اللغة الكبيرة (LLMs). توفر أدوات للمتخصصين في…

أدوات الأمن السيبراني بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

Spikee هي مجموعة أدوات بسيطة لحقن الطلبات مصممة لتقييم واستغلال ثغرات تطبيقات نماذج اللغة الكبيرة (LLM) ضد هجمات حقن الطلبات المستهدفة، مع التركيز على تهديدات الأمن السيبراني مثل…

أدوات الأمن السيبراني بالذكاء الاصطناعي

تطبيقات الذكاء الاصطناعي

تقدم Adversa AI منصة مستقلة لاختبار الاختراق المستمر للذكاء الاصطناعي، مصممة خصيصًا لوكلاء الذكاء الاصطناعي، ونماذج اللغات الكبيرة (LLMs)، وتطبيقات الذكاء الاصطناعي التوليدي…

أدوات الأمن السيبراني بالذكاء الاصطناعيالتمويل والخدمات المصرفية

تطبيقات الذكاء الاصطناعي

تقدم ActiveFence، المعروفة الآن باسم Alice، منصة شاملة لأمان الذكاء الاصطناعي. توفر معلومات عن التهديدات، فرق الاختراق، وحواجز حماية في الوقت الحقيقي لحماية أنظمة الذكاء الاصطناعي…

أدوات الأمن السيبراني بالذكاء الاصطناعيالإعلام والترفيه