Descripción
Spikee, desarrollado por Reversec, es un Kit de Inyección de Prompts Simple para Evaluación y Explotación. Está diseñado para evaluar la susceptibilidad de los modelos de lenguaje grande (LLMs) y sus aplicaciones a ataques de inyección de prompts dirigidos. A diferencia de las herramientas existentes que se centran en escenarios de jailbreak genéricos, Spikee prioriza las amenazas de ciberseguridad como la exfiltración de datos, el scripting entre sitios (XSS) y la agotamiento de recursos. Estos escenarios se basan en resultados del mundo real y prácticas de pentesting.
Spikee proporciona una herramienta práctica para que los evaluadores generen conjuntos de datos personalizables, apliquen plugins de evasión estática o estrategias de ataque dinámicas, y prueben objetivos que incluyen LLMs, guardrails y aplicaciones completas. Se integra con herramientas como Burp Suite, permitiendo a los usuarios analizar resultados y tasas de falsos positivos para los guardrails.
La herramienta se puede aplicar a lo largo de la tubería de seguridad de aplicaciones LLM para evaluar y mejorar la resiliencia contra ataques de inyección de prompts. Los casos de uso clave incluyen probar LLMs en aislamiento, utilizar conjuntos de datos personalizados, evaluar guardrails individuales y evaluar toda la tubería de aplicaciones impulsadas por LLM.
La versión 0.2 de Spikee añade soporte para estrategias de ataque dinámicas y un sistema de evaluación flexible para evaluar el éxito del ataque. También ofrece instrucciones detalladas de configuración y uso, incluyendo generación de conjuntos de datos, pruebas de objetivos y análisis de resultados. Los usuarios pueden generar conjuntos de datos a partir de semillas, personalizarlos con plugins y filtros, y ejecutar pruebas contra objetivos como GPT-4o utilizando ataques dinámicos.
Los desarrollos futuros para Spikee incluyen la integración con herramientas de pentesting, habilitación de ataques visuales, mejora del sistema de evaluación y expansión de bibliotecas con nuevos jailbreaks y técnicas de ataque. Se aceptan contribuciones de la comunidad para ayudar a evolucionar la herramienta en función de la investigación emergente y los comentarios.
Características principales de Spikee
Generación de conjuntos de datos personalizables
Plugins de evasión estática
Estrategias de ataque dinámicas
Integración con Burp Suite
Análisis de falsos positivos de guardrails
Sistema de evaluación flexible
Escenarios enfocados en ciberseguridad
Pruebas basadas en resultados del mundo real
Evaluación de la tubería de seguridad de aplicaciones LLM
Soporte para estrategias de ataque dinámicas
¿Cómo usar Spikee?
Inicializar: Instalar Spikee a través de PyPI y configurar el espacio de trabajo
Generar Conjunto de Datos: Personalizar con semillas, plugins y filtros
Probar Objetivo: Ejecutar pruebas contra LLMs o guardrails
Analizar Resultados: Calcular métricas y generar informes
Casos de uso de Spikee
- Pruebas de Aislamiento de LLM
- Pruebas de Conjuntos de Datos Personalizados
- Evaluación de Guardrails
- Evaluación de la Tubería
- Análisis de Amenazas de Ciberseguridad








