Pular para o conteúdo principal
Guardrails

Ataques de prompt

Proteja o agente contra tentativas de injeção de prompt e manipulações maliciosas.

Ataques de prompt

A aba Ataques de prompt protege o agente contra tentativas de manipulação via injeção de prompt — quando um usuário tenta forçar o agente a ignorar suas instruções ou executar ações não autorizadas.

Habilitar filtro de ataques de prompt​

Ative o toggle Habilitar filtro de ataques de prompt para que o agente detecte e bloqueie mensagens com padrões de injeção ou manipulação.

Ao habilitar, a configuração de nível fica disponível.

Nível de moderação para injeção de prompt​

Selecione a sensibilidade do filtro:

NívelComportamento
NenhumSem filtragem
BaixoBloqueia apenas tentativas explícitas de injeção
MédioBloqueia padrões moderadamente suspeitos
AltoBloqueia qualquer mensagem com indício de manipulação (mais restritivo)
dica

Use o nível Alto para agentes que operam com dados sensíveis ou têm acesso a ações críticas, como envio de e-mails ou acionamento de robôs RPA.