Moderação de Conteúdo e Segurança - ISMS Copilot
O ISMS Copilot utiliza moderação automática de conteúdo para detectar e prevenir conteúdo inapropriado ou prejudicial em mensagens de chat. Este processo é executado em segundo plano para manter um ambiente seguro e em conformidade para todos os usuários, preservando sua privacidade e a velocidade do fluxo de trabalho.
O ISMS Copilot utiliza moderação automática de conteúdo para detectar e prevenir conteúdo inapropriado ou prejudicial em mensagens de chat. Este processo é executado em segundo plano para manter um ambiente seguro, em conformidade para todos os usuários, preservando sua privacidade e a velocidade do fluxo de trabalho.
A moderação é executada de forma assíncrona após o envio de uma mensagem — não adiciona nenhuma latência à sua experiência de chat.
Como a Moderação Funciona
Quando você envia uma mensagem de chat, o ISMS Copilot a salva imediatamente e entrega a resposta da IA sem atraso. Em paralelo, uma verificação de moderação de conteúdo é executada em segundo plano:
- Mensagem analisada — Sua mensagem é enviada para uma API de moderação (OpenAI por padrão, Mistral AI para usuários com Proteção Avançada de Dados)
- Categorias verificadas — A API verifica violações de políticas, incluindo discurso de ódio, assédio, violência, automutilação e outros conteúdos prejudiciais
- Resultado registrado — O resultado da moderação é armazenado em nossos registros de auditoria com pontuações de categorias e carimbos de data/hora
- Administradores alertados — Se o conteúdo for sinalizado, nossa equipe recebe um alerta automático para revisão
Este processo é totalmente automatizado e do tipo "dispara e esquece" — seu chat continua sem interrupções.
Provedores de Moderação
O ISMS Copilot utiliza diferentes APIs de moderação com base nas configurações de proteção de dados:
- API de Moderação da OpenAI — Padrão para todos os usuários. Verifica: conteúdo sexual, ódio, assédio, violência, automutilação
- API de Moderação da Mistral AI — Utilizada quando a Proteção Avançada de Dados está ativada. Verifica: conteúdo sexual, ódio e discriminação, violência e ameaças, conteúdo perigoso e criminoso, automutilação, saúde, financeiro, direito, informações pessoalmente identificáveis (PII)
As categorias da Mistral incluem verificações de saúde, financeiro, direito e PII. Estas podem ocasionalmente sinalizar discussões legítimas sobre conformidade com ISMS. Nossa equipe revisa todos os alertas para evitar falsos positivos.
Proteção Avançada de Dados e Moderação
Se você ativou a Proteção Avançada de Dados, suas mensagens de chat normalmente não são armazenadas em nossos servidores ou enviadas a provedores de IA de terceiros. No entanto, a moderação de conteúdo cria uma exceção:
- Mensagens limpas — O conteúdo da mensagem NÃO é armazenado; apenas metadados e pontuações de moderação são retidos por 30 dias
- Mensagens sinalizadas — O conteúdo completo é sempre armazenado por 1 ano e incluído em alertas para administradores, independentemente da configuração de ADP
Sobrescrita de segurança: Conteúdo sinalizado é sempre armazenado e compartilhado com nossa equipe, mesmo com a Proteção Avançada de Dados ativada. Isso é necessário para conformidade legal, prevenção de abusos e manutenção da segurança da plataforma para todos os usuários.
Esta sobrescrita é baseada em interesse legítimo sob o Artigo 6(1)(f) do GDPR — prevenir danos e aplicar nossa Política de Uso Aceitável é um interesse legítimo que prevalece sobre as preferências individuais de proteção de dados em casos sinalizados.
Retenção de Dados
Os eventos de moderação são retidos de acordo com o seguinte cronograma:
- Eventos não sinalizados — Metadados e pontuações de moderação retidos por 30 dias; conteúdo da mensagem NÃO é armazenado
- Eventos sinalizados — Conteúdo completo da mensagem e metadados retidos por 1 ano para fins de auditoria e conformidade legal
O conteúdo de mensagens sinalizadas pode ser retido por mais tempo se necessário para investigações em andamento, processos legais ou obrigações regulatórias.
O Que Acontece Quando o Conteúdo É Sinalizado
Quando a API de moderação sinaliza sua mensagem como potencialmente violadora de nossas políticas:
- Alerta enviado — Nossa equipe de administradores recebe uma notificação via webhook com as categorias sinalizadas, carimbo de data/hora e visualização da mensagem
- Revisão humana — Um membro da equipe revisa a mensagem e o contexto para confirmar se viola nossa Política de Uso Aceitável
- Ação (se confirmado) — Podemos entrar em contato com você, emitir um aviso, suspender funcionalidades ou encerrar sua conta, dependendo da gravidade e de violações repetidas
- Falsos positivos — Se a sinalização estiver incorreta (por exemplo, uma discussão legítima sobre conformidade), nenhuma ação é tomada
Limitação de taxa: Você só pode acionar um alerta de moderação por hora. Mensagens sinalizadas subsequentes dentro desse período são registradas, mas não geram alertas duplicados.
Privacidade e Transparência
Estamos comprometidos com a transparência em relação às nossas práticas de moderação:
- Sem censura silenciosa — Não bloqueamos ou filtramos suas mensagens em tempo real. A moderação é para aplicação de segurança, não para controle de conteúdo
- Processadores de terceiros — OpenAI (com sede nos EUA) e Mistral AI (com sede na França) atuam como subprocessadores apenas para moderação. Consulte nosso Registro de Atividades de Processamento para mais detalhes
- Divulgação completa — Esta política e nossa Política de Privacidade documentam todos os fluxos de dados de moderação e bases legais
Base Legal
A moderação de conteúdo é baseada em:
- Interesse legítimo (Art. 6(1)(f) do GDPR) — Prevenir abusos, aplicar nossos termos e manter a segurança da plataforma
- Necessidade contratual (Art. 6(1)(b) do GDPR) — Aplicar nossos Termos de Serviço e Política de Uso Aceitável
- Obrigação legal (Art. 6(1)(c) do GDPR) — Cumprir leis aplicáveis que exigem a remoção ou denúncia de conteúdo ilegal
Seus Direitos
Sob o GDPR, você tem direitos em relação aos seus dados de moderação:
- Acesso — Solicitar cópias dos eventos de moderação associados à sua conta
- Retificação — Solicitar correção de registros de moderação imprecisos
- Apagamento — Solicitar a exclusão de dados de moderação não sinalizados (dados sinalizados podem ser retidos para conformidade legal)
- Oposição — Opor-se ao processamento de moderação, embora possamos continuar se tivermos motivos legítimos convincentes (segurança, obrigações legais)
Para exercer seus direitos ou fazer perguntas sobre moderação, entre em contato conosco em contact@ismscopilot.com.
Dúvidas?
Para mais informações sobre nossas práticas de privacidade e segurança, consulte: