Guardrails
Configura los guardrails del agente para moderar y proteger sus interacciones con los usuarios.
Guardrails
La página Guardrails configura los filtros de seguridad que se aplican a cada mensaje que el agente envía y recibe. Úsalos para bloquear contenido inadecuado, proteger datos sensibles y mantener al agente dentro del alcance previsto.
Accede desde el icono Guardrails de la navegación lateral del editor.
Toda la configuración se guarda sola y se aplica a la versión de trabajo actual.
Las pestañas
| Pestaña | Qué configura |
|---|---|
| General | Activar los guardrails, el análisis con IA, el mensaje de bloqueo |
| Contenido dañino | Discurso de odio, insultos, contenido sexual, violencia y conducta indebida |
| Ataques de prompt | Detección de inyección de prompt y manipulaciones maliciosas |
| Profanidad | Lenguaje inapropiado u ofensivo |
| Verificación de fundamentación contextual | Respuestas sin base en los documentos de contexto |
| Verificación de relevancia | Respuestas fuera del contexto de la conversación |
| Temas denegados | Asuntos concretos que el agente no debe tocar |
| Información sensible | Datos personales (PII): enmascararlos o bloquearlos |
La pestaña General
Activar los guardrails
Habilita o deshabilita todos los guardrails del agente. Desactivado, no se aplica ningún filtro: el agente puede devolver respuestas inadecuadas o inseguras.
Activar los guardrails aumenta el tiempo de respuesta del agente, porque cada mensaje se contrasta con las reglas definidas.
Usar IA para reforzar los guardrails
Con esto activo, un modelo de lenguaje revisa los mensajes y las respuestas para aplicar los guardrails en los casos más subjetivos o contextuales: aquellos que los filtros deterministas no resuelven.
Esto hace llamadas extra al LLM en cada interacción, lo que aumenta el consumo de tokens y el coste por conversación. Solo está disponible con Activar los guardrails habilitado.
El mensaje para prompts bloqueados
El texto que se le muestra al usuario cuando los guardrails bloquean un mensaje. Úsalo para explicar las políticas del agente.