ISMS Copilot Docs

Moderação de Conteúdo e Segurança - ISMS Copilot

O ISMS Copilot utiliza moderação automática de conteúdo para detectar e prevenir conteúdo inapropriado ou prejudicial em mensagens de chat. Este processo é executado em segundo plano para manter um ambiente seguro e em conformidade para todos os usuários, preservando sua privacidade e a velocidade do fluxo de trabalho.

O ISMS Copilot utiliza moderação automática de conteúdo para detectar e prevenir conteúdo inapropriado ou prejudicial em mensagens de chat. Este processo é executado em segundo plano para manter um ambiente seguro, em conformidade para todos os usuários, preservando sua privacidade e a velocidade do fluxo de trabalho.

A moderação é executada de forma assíncrona após o envio de uma mensagem — não adiciona nenhuma latência à sua experiência de chat.

Como a Moderação Funciona

Quando você envia uma mensagem de chat, o ISMS Copilot a salva imediatamente e entrega a resposta da IA sem atraso. Em paralelo, uma verificação de moderação de conteúdo é executada em segundo plano:

  1. Mensagem analisada — Sua mensagem é enviada para uma API de moderação (OpenAI por padrão, Mistral AI para usuários com Proteção Avançada de Dados)
  2. Categorias verificadas — A API verifica violações de políticas, incluindo discurso de ódio, assédio, violência, automutilação e outros conteúdos prejudiciais
  3. Resultado registrado — O resultado da moderação é armazenado em nossos registros de auditoria com pontuações de categorias e carimbos de data/hora
  4. Administradores alertados — Se o conteúdo for sinalizado, nossa equipe recebe um alerta automático para revisão

Este processo é totalmente automatizado e do tipo "dispara e esquece" — seu chat continua sem interrupções.

Provedores de Moderação

O ISMS Copilot utiliza diferentes APIs de moderação com base nas configurações de proteção de dados:

  • API de Moderação da OpenAI — Padrão para todos os usuários. Verifica: conteúdo sexual, ódio, assédio, violência, automutilação
  • API de Moderação da Mistral AI — Utilizada quando a Proteção Avançada de Dados está ativada. Verifica: conteúdo sexual, ódio e discriminação, violência e ameaças, conteúdo perigoso e criminoso, automutilação, saúde, financeiro, direito, informações pessoalmente identificáveis (PII)

As categorias da Mistral incluem verificações de saúde, financeiro, direito e PII. Estas podem ocasionalmente sinalizar discussões legítimas sobre conformidade com ISMS. Nossa equipe revisa todos os alertas para evitar falsos positivos.

Proteção Avançada de Dados e Moderação

Se você ativou a Proteção Avançada de Dados, suas mensagens de chat normalmente não são armazenadas em nossos servidores ou enviadas a provedores de IA de terceiros. No entanto, a moderação de conteúdo cria uma exceção:

  • Mensagens limpas — O conteúdo da mensagem NÃO é armazenado; apenas metadados e pontuações de moderação são retidos por 30 dias
  • Mensagens sinalizadas — O conteúdo completo é sempre armazenado por 1 ano e incluído em alertas para administradores, independentemente da configuração de ADP

Sobrescrita de segurança: Conteúdo sinalizado é sempre armazenado e compartilhado com nossa equipe, mesmo com a Proteção Avançada de Dados ativada. Isso é necessário para conformidade legal, prevenção de abusos e manutenção da segurança da plataforma para todos os usuários.

Esta sobrescrita é baseada em interesse legítimo sob o Artigo 6(1)(f) do GDPR — prevenir danos e aplicar nossa Política de Uso Aceitável é um interesse legítimo que prevalece sobre as preferências individuais de proteção de dados em casos sinalizados.

Retenção de Dados

Os eventos de moderação são retidos de acordo com o seguinte cronograma:

  • Eventos não sinalizados — Metadados e pontuações de moderação retidos por 30 dias; conteúdo da mensagem NÃO é armazenado
  • Eventos sinalizados — Conteúdo completo da mensagem e metadados retidos por 1 ano para fins de auditoria e conformidade legal

O conteúdo de mensagens sinalizadas pode ser retido por mais tempo se necessário para investigações em andamento, processos legais ou obrigações regulatórias.

O Que Acontece Quando o Conteúdo É Sinalizado

Quando a API de moderação sinaliza sua mensagem como potencialmente violadora de nossas políticas:

  1. Alerta enviado — Nossa equipe de administradores recebe uma notificação via webhook com as categorias sinalizadas, carimbo de data/hora e visualização da mensagem
  2. Revisão humana — Um membro da equipe revisa a mensagem e o contexto para confirmar se viola nossa Política de Uso Aceitável
  3. Ação (se confirmado) — Podemos entrar em contato com você, emitir um aviso, suspender funcionalidades ou encerrar sua conta, dependendo da gravidade e de violações repetidas
  4. Falsos positivos — Se a sinalização estiver incorreta (por exemplo, uma discussão legítima sobre conformidade), nenhuma ação é tomada

Limitação de taxa: Você só pode acionar um alerta de moderação por hora. Mensagens sinalizadas subsequentes dentro desse período são registradas, mas não geram alertas duplicados.

Privacidade e Transparência

Estamos comprometidos com a transparência em relação às nossas práticas de moderação:

  • Sem censura silenciosa — Não bloqueamos ou filtramos suas mensagens em tempo real. A moderação é para aplicação de segurança, não para controle de conteúdo
  • Processadores de terceiros — OpenAI (com sede nos EUA) e Mistral AI (com sede na França) atuam como subprocessadores apenas para moderação. Consulte nosso Registro de Atividades de Processamento para mais detalhes
  • Divulgação completa — Esta política e nossa Política de Privacidade documentam todos os fluxos de dados de moderação e bases legais

A moderação de conteúdo é baseada em:

  • Interesse legítimo (Art. 6(1)(f) do GDPR) — Prevenir abusos, aplicar nossos termos e manter a segurança da plataforma
  • Necessidade contratual (Art. 6(1)(b) do GDPR) — Aplicar nossos Termos de Serviço e Política de Uso Aceitável
  • Obrigação legal (Art. 6(1)(c) do GDPR) — Cumprir leis aplicáveis que exigem a remoção ou denúncia de conteúdo ilegal

Seus Direitos

Sob o GDPR, você tem direitos em relação aos seus dados de moderação:

  • Acesso — Solicitar cópias dos eventos de moderação associados à sua conta
  • Retificação — Solicitar correção de registros de moderação imprecisos
  • Apagamento — Solicitar a exclusão de dados de moderação não sinalizados (dados sinalizados podem ser retidos para conformidade legal)
  • Oposição — Opor-se ao processamento de moderação, embora possamos continuar se tivermos motivos legítimos convincentes (segurança, obrigações legais)

Para exercer seus direitos ou fazer perguntas sobre moderação, entre em contato conosco em contact@ismscopilot.com.

Dúvidas?

Para mais informações sobre nossas práticas de privacidade e segurança, consulte:

On this page