Saltar al contenido principal
Guardrails

Contenido dañino

Bloquea o modera las respuestas con discurso de odio, insultos, contenido sexual, violencia o conducta indebida.

Contenido dañino

La pestaña Contenido dañino habilita un filtro que detecta y bloquea contenido dañino en las respuestas del agente.

Activar el filtro de contenido dañino

Activa Habilitar el filtro de contenido dañino para que el agente bloquee o modere las respuestas con discurso de odio, insultos, violencia o conducta indebida.

Al activarlo quedan disponibles los ajustes de nivel por categoría.

Nivel de moderación por categoría

Ajusta la sensibilidad del filtro para cada categoría por separado:

CategoríaQué detecta
Discurso de odioLenguaje que ataca a grupos por raza, religión, género y similares
InsultosImproperios y lenguaje degradante dirigido a personas
Contenido sexualContenido explícito o sugerente de naturaleza sexual
ViolenciaDescripciones de actos violentos, o incitación a ellos
Conducta indebidaComportamientos inadecuados que no encajan en las categorías anteriores

Para cada una, elige un nivel de moderación:

NivelQué hace
NingunoSin filtrado: el contenido no se revisa
BajoBloquea solo el contenido explícitamente dañino
MedioBloquea el contenido moderadamente dañino
AltoBloquea cualquier indicio de contenido dañino (el más restrictivo)