ISMS Copilot Docs

Moderação de Conteúdo e Segurança - ISMS Copilot

O ISMS Copilot utiliza moderação automática de conteúdo para detectar e prevenir conteúdo inapropriado ou prejudicial em mensagens de chat. Este processo é executado em segundo plano para manter um ambiente seguro e em conformidade para todos os usuários, preservando sua privacidade e a velocidade do fluxo de trabalho.

O ISMS Copilot utiliza moderação automática de conteúdo para detectar e prevenir conteúdo inapropriado ou prejudicial em mensagens de chat. Este processo é executado em segundo plano para manter um ambiente seguro, em conformidade para todos os usuários, preservando sua privacidade e a velocidade do fluxo de trabalho.

A moderação é executada de forma assíncrona após o envio de uma mensagem, não adiciona nenhuma latência à sua experiência de chat.

Como a Moderação Funciona

Quando você envia uma mensagem de chat, o ISMS Copilot a salva imediatamente e entrega a resposta da IA sem atraso. Em paralelo, uma verificação de moderação de conteúdo é executada em segundo plano:

  1. Mensagem analisada, Sua mensagem é enviada para uma API de moderação (OpenAI por padrão, Mistral AI para usuários com Proteção Avançada de Dados)
  2. Categorias verificadas, A API verifica violações de políticas, incluindo discurso de ódio, assédio, violência, automutilação e outros conteúdos prejudiciais
  3. Resultado registrado, O resultado da moderação é armazenado em nossos registros de auditoria com pontuações de categorias e carimbos de data/hora
  4. Administradores alertados, Se o conteúdo for sinalizado, nossa equipe recebe um alerta automático para revisão

Este processo é totalmente automatizado e do tipo "dispara e esquece", seu chat continua sem interrupções.

Provedores de Moderação

O ISMS Copilot utiliza diferentes APIs de moderação com base nas configurações de proteção de dados:

  • API de Moderação da OpenAI, Padrão para todos os usuários. Verifica: conteúdo sexual, ódio, assédio, violência, automutilação
  • API de Moderação da Mistral AI, Utilizada quando a Proteção Avançada de Dados está ativada. Verifica: conteúdo sexual, ódio e discriminação, violência e ameaças, conteúdo perigoso e criminoso, automutilação, saúde, financeiro, direito, informações pessoalmente identificáveis (PII)

As categorias da Mistral incluem verificações de saúde, financeiro, direito e PII. Estas podem ocasionalmente sinalizar discussões legítimas sobre conformidade com ISMS. Nossa equipe revisa todos os alertas para evitar falsos positivos.

Proteção Avançada de Dados e Moderação

Se você ativou a Proteção Avançada de Dados, suas mensagens de chat normalmente não são armazenadas em nossos servidores ou enviadas a provedores de IA de terceiros. No entanto, a moderação de conteúdo cria uma exceção:

  • Mensagens limpas, O conteúdo da mensagem NÃO é armazenado; apenas metadados e pontuações de moderação são retidos por 30 dias
  • Mensagens sinalizadas, O conteúdo completo é sempre armazenado por 1 ano e incluído em alertas para administradores, independentemente da configuração de ADP

Sobrescrita de segurança: Conteúdo sinalizado é sempre armazenado e compartilhado com nossa equipe, mesmo com a Proteção Avançada de Dados ativada. Isso é necessário para conformidade legal, prevenção de abusos e manutenção da segurança da plataforma para todos os usuários.

Esta sobrescrita é baseada em interesse legítimo sob o Artigo 6(1)(f) do GDPR, prevenir danos e aplicar nossa Política de Uso Aceitável é um interesse legítimo que prevalece sobre as preferências individuais de proteção de dados em casos sinalizados.

Retenção de Dados

Os eventos de moderação são retidos de acordo com o seguinte cronograma:

  • Eventos não sinalizados, Metadados e pontuações de moderação retidos por 30 dias; conteúdo da mensagem NÃO é armazenado
  • Eventos sinalizados, Conteúdo completo da mensagem e metadados retidos por 1 ano para fins de auditoria e conformidade legal

O conteúdo de mensagens sinalizadas pode ser retido por mais tempo se necessário para investigações em andamento, processos legais ou obrigações regulatórias.

O Que Acontece Quando o Conteúdo É Sinalizado

Quando a API de moderação sinaliza sua mensagem como potencialmente violadora de nossas políticas:

  1. Alerta enviado, Nossa equipe de administradores recebe uma notificação via webhook com as categorias sinalizadas, carimbo de data/hora e visualização da mensagem
  2. Revisão humana, Um membro da equipe revisa a mensagem e o contexto para confirmar se viola nossa Política de Uso Aceitável
  3. Ação (se confirmado), Podemos entrar em contato com você, emitir um aviso, suspender funcionalidades ou encerrar sua conta, dependendo da gravidade e de violações repetidas
  4. Falsos positivos, Se a sinalização estiver incorreta (por exemplo, uma discussão legítima sobre conformidade), nenhuma ação é tomada

Limitação de taxa: Você só pode acionar um alerta de moderação por hora. Mensagens sinalizadas subsequentes dentro desse período são registradas, mas não geram alertas duplicados.

Privacidade e Transparência

Estamos comprometidos com a transparência em relação às nossas práticas de moderação:

  • Sem censura silenciosa, Não bloqueamos ou filtramos suas mensagens em tempo real. A moderação é para aplicação de segurança, não para controle de conteúdo
  • Processadores de terceiros, OpenAI (com sede nos EUA) e Mistral AI (com sede na França) atuam como subprocessadores apenas para moderação. Consulte nosso Registro de Atividades de Processamento para mais detalhes
  • Divulgação completa, Esta política e nossa Política de Privacidade documentam todos os fluxos de dados de moderação e bases legais

A moderação de conteúdo é baseada em:

  • Interesse legítimo (Art. 6(1)(f) do GDPR), Prevenir abusos, aplicar nossos termos e manter a segurança da plataforma
  • Necessidade contratual (Art. 6(1)(b) do GDPR), Aplicar nossos Termos de Serviço e Política de Uso Aceitável
  • Obrigação legal (Art. 6(1)(c) do GDPR), Cumprir leis aplicáveis que exigem a remoção ou denúncia de conteúdo ilegal

Seus Direitos

Sob o GDPR, você tem direitos em relação aos seus dados de moderação:

  • Acesso, Solicitar cópias dos eventos de moderação associados à sua conta
  • Retificação, Solicitar correção de registros de moderação imprecisos
  • Apagamento, Solicitar a exclusão de dados de moderação não sinalizados (dados sinalizados podem ser retidos para conformidade legal)
  • Oposição, Opor-se ao processamento de moderação, embora possamos continuar se tivermos motivos legítimos convincentes (segurança, obrigações legais)

Para exercer seus direitos ou fazer perguntas sobre moderação, entre em contato conosco em contact@ismscopilot.com.

Dúvidas?

Para mais informações sobre nossas práticas de privacidade e segurança, consulte:

Nesta página