Saltar al contenido principal
Guardrails

Ataques de prompt

Protege al agente frente a la inyección de prompt y las manipulaciones maliciosas.

Ataques de prompt

La pestaña Ataques de prompt protege al agente frente a la manipulación por inyección de prompt: un usuario que intenta forzarlo a ignorar sus instrucciones o a ejecutar acciones no autorizadas.

Activar el filtro de ataques de prompt

Activa Habilitar el filtro de ataques de prompt para que el agente detecte y bloquee mensajes con patrones de inyección o manipulación.

Al activarlo queda disponible el ajuste de nivel.

Nivel de moderación para la inyección de prompt

Elige la sensibilidad del filtro:

NivelQué hace
NingunoSin filtrado
BajoBloquea solo los intentos explícitos de inyección
MedioBloquea los patrones moderadamente sospechosos
AltoBloquea cualquier mensaje con indicios de manipulación (el más restrictivo)
consejo

Usa Alto en agentes que trabajan con datos sensibles, o que pueden ejecutar acciones críticas como enviar correos o iniciar robots RPA.