#506 · IA y herramientas de prompts

Escáner de patrones de inyección de prompts

Haz una revisión preventiva de texto que vaya a entrar en un flujo con modelos de lenguaje. El escáner localiza frases frecuentes asociadas con intentos de anular instrucciones, revelar mensajes internos, cambiar de rol o introducir delimitadores sospechosos. El resultado es una señal heurística para revisión humana, no una garantía de seguridad.

Entrada de texto

Texto para revisar
Espacio publicitario

Cómo usar esta herramienta de texto

  1. Pega o carga el texto de entrada.
  2. Ajusta únicamente las opciones relevantes para este análisis.
  3. Pulsa el botón principal o usa Ctrl/Cmd + Enter.
  4. Revisa el resumen, la interpretación y las métricas antes de copiar o descargar.

Qué hace esta herramienta

Busca señales textuales frecuentes asociadas con prompt injection y las presenta como incidencias para revisión.

Se aplican expresiones regulares por categorías, como anulación de instrucciones, revelación de prompts internos, cambio de rol y delimitadores sospechosos.

Es un detector heurístico: puede producir falsos positivos y no detecta todos los ataques posibles.

Ejemplo

Un texto que contenga «ignore previous instructions» y pida mostrar el system prompt aparecerá con al menos dos categorías de señal.

Casos de uso

  • Revisar contenido recuperado por RAG.
  • Inspeccionar entradas de usuarios antes de concatenarlas a un prompt.
  • Auditar conjuntos de datos con instrucciones embebidas.

Consejos para obtener mejores resultados

  • Mantén separados los datos no confiables de las instrucciones.
  • No uses el resultado como único control de seguridad.
  • Registra el origen del contenido que activa señales.
  • Añade validaciones de salida y controles de privilegios en la aplicación.

Detalles del procesamiento

El escáner funciona íntegramente en el navegador y clasifica coincidencias por patrones visibles en el texto.

Las inyecciones pueden redactarse de muchas formas, incluidos idiomas o técnicas no cubiertos por estas expresiones.

Preguntas frecuentes

¿Cómo detectar frases de prompt injection en texto recuperado por RAG?

Pega el contenido recuperado y usa sensibilidad normal o alta. El informe marcará categorías y posiciones de las coincidencias.

¿Una coincidencia significa que el texto es definitivamente malicioso?

No. Es una señal heurística que requiere revisar el contexto; algunos textos legítimos pueden mencionar esos patrones.

¿El escáner detecta intentos de revelar el system prompt?

Sí, busca formulaciones frecuentes en inglés y español que solicitan mostrar instrucciones internas.

¿Puedo usar este resultado para bloquear automáticamente una petición?

No debería ser el único criterio. Combínalo con aislamiento de instrucciones, validación y políticas de seguridad de tu aplicación.

¿Por qué un ataque puede pasar sin ser detectado?

Porque las inyecciones pueden usar reformulaciones, otros idiomas, codificación o estrategias no contempladas por los patrones locales.

Resumen de módulos

MóduloDescripción
EntradaTexto pegado o archivo local
ProcesamientoEjecución local en el navegador
SalidaSeñales detectadas
ExportaciónTXT y, cuando procede, CSV/JSON