ISMS Copilot Docs

Moderación de Contenido y Seguridad - ISMS Copilot

ISMS Copilot utiliza moderación automática de contenido para detectar y prevenir contenido inapropiado o dañino en los mensajes de chat. Este proceso se ejecuta en segundo plano para mantener un entorno seguro y conforme para todos los usuarios, preservando tu privacidad y la velocidad de tu flujo de trabajo.

ISMS Copilot utiliza moderación automática de contenido para detectar y prevenir contenido inapropiado o dañino en los mensajes de chat. Este proceso se ejecuta en segundo plano para mantener un entorno seguro y conforme para todos los usuarios, preservando tu privacidad y la velocidad de tu flujo de trabajo.

La moderación se ejecuta de forma asíncrona después de enviar un mensaje — no añade latencia a tu experiencia de chat.

Cómo Funciona la Moderación

Cuando envías un mensaje de chat, ISMS Copilot lo guarda inmediatamente y entrega tu respuesta de IA sin demora. En paralelo, se ejecuta una verificación de moderación de contenido en segundo plano:

  1. Mensaje analizado — Tu mensaje se envía a una API de moderación (OpenAI por defecto, Mistral AI para usuarios de Protección Avanzada de Datos)
  2. Categorías verificadas — La API escanea en busca de violaciones de políticas, incluyendo discurso de odio, acoso, violencia, autolesiones y otro contenido dañino
  3. Resultado registrado — El resultado de la moderación se almacena en nuestros registros de auditoría con puntuaciones por categoría y marcas de tiempo
  4. Alertas a administradores — Si el contenido es marcado, nuestro equipo recibe una alerta automática para revisión

Este proceso es completamente automatizado y de tipo "dispara y olvida" — tu chat continúa sin interrupciones.

Proveedores de Moderación

ISMS Copilot utiliza diferentes APIs de moderación según tu configuración de protección de datos:

  • API de Moderación de OpenAI — Predeterminada para todos los usuarios. Verifica: contenido sexual, odio, acoso, violencia, autolesiones
  • API de Moderación de Mistral AI — Se utiliza cuando la Protección Avanzada de Datos está habilitada. Verifica: contenido sexual, odio y discriminación, violencia y amenazas, contenido peligroso y delictivo, autolesiones, salud, financiero, legal, información de identificación personal (PII)

Las categorías de Mistral incluyen verificaciones de salud, financiero, legal y PII. Estas pueden ocasionalmente marcar discusiones legítimas sobre cumplimiento de ISMS. Nuestro equipo revisa todas las alertas para evitar falsos positivos.

Protección Avanzada de Datos y Moderación

Si has habilitado Advanced Data Protection, tus mensajes de chat normalmente no se almacenan en nuestros servidores ni se envían a proveedores de IA de terceros. Sin embargo, la moderación de contenido crea una excepción:

  • Mensajes limpios — El contenido del mensaje NO se almacena; solo se retienen metadatos y puntuaciones de moderación durante 30 días
  • Mensajes marcados — El contenido completo siempre se almacena durante 1 año e incluido en las alertas a administradores, independientemente de la configuración de ADP

Anulación por seguridad: El contenido marcado siempre se almacena y comparte con nuestro equipo, incluso con la Protección Avanzada de Datos habilitada. Esto es necesario para el cumplimiento legal, la prevención de abusos y el mantenimiento de la seguridad de la plataforma para todos los usuarios.

Esta anulación se basa en el interés legítimo según el Artículo 6(1)(f) del GDPR — prevenir daños y hacer cumplir nuestra Política de Uso Aceptable es un interés legítimo que prevalece sobre las preferencias individuales de protección de datos en casos marcados.

Retención de Datos

Los eventos de moderación se conservan según el siguiente calendario:

  • Eventos no marcados — Metadatos y puntuaciones de moderación se conservan durante 30 días; el contenido del mensaje NO se almacena
  • Eventos marcados — El contenido completo del mensaje y los metadatos se conservan durante 1 año para fines de auditoría y cumplimiento legal

El contenido de mensajes marcados puede conservarse por más tiempo si es necesario para investigaciones en curso, procedimientos legales u obligaciones regulatorias.

Qué Ocurre Cuando se Marca Contenido

Cuando la API de moderación marca tu mensaje como potencialmente violatorio de nuestras políticas:

  1. Alerta enviada — Nuestro equipo de administradores recibe una notificación por webhook con las categorías marcadas, la marca de tiempo y una vista previa del mensaje
  2. Revisión humana — Un miembro del equipo revisa el mensaje y el contexto para confirmar si viola nuestra Política de Uso Aceptable
  3. Acción (si se confirma) — Podemos contactarte, emitir una advertencia, suspender funciones o terminar tu cuenta dependiendo de la gravedad y las violaciones repetidas
  4. Falsos positivos — Si la marca fue incorrecta (por ejemplo, una discusión legítima sobre cumplimiento), no se toma ninguna acción

Límite de frecuencia: Solo puedes activar una alerta de moderación por hora. Los mensajes marcados posteriores dentro de esa ventana se registran, pero no generan alertas duplicadas.

Privacidad y Transparencia

Estamos comprometidos con la transparencia en nuestras prácticas de moderación:

  • Sin censura silenciosa — No bloqueamos ni filtramos tus mensajes en tiempo real. La moderación es para hacer cumplir la seguridad, no para controlar el contenido
  • Procesadores de terceros — OpenAI (con sede en EE. UU.) y Mistral AI (con sede en Francia) actúan como subprocesadores solo para moderación. Consulta nuestro Registro de Actividades de Tratamiento para más detalles
  • Divulgación completa — Esta política y nuestra Política de Privacidad documentan todos los flujos de datos de moderación y las bases legales

La moderación de contenido se basa en:

  • Interés legítimo (Art. 6(1)(f) del GDPR) — Prevenir abusos, hacer cumplir nuestros términos y mantener la seguridad de la plataforma
  • Necesidad contractual (Art. 6(1)(b) del GDPR) — Hacer cumplir nuestros Términos de Servicio y Política de Uso Aceptable
  • Obligación legal (Art. 6(1)(c) del GDPR) — Cumplir con las leyes aplicables que requieren la eliminación o denuncia de contenido ilegal

Tus Derechos

Según el GDPR, tienes derechos respecto a tus datos de moderación:

  • Acceso — Solicitar copias de los eventos de moderación asociados a tu cuenta
  • Rectificación — Solicitar la corrección de registros de moderación inexactos
  • Supresión — Solicitar la eliminación de datos de moderación no marcados (los datos marcados pueden conservarse por cumplimiento legal)
  • Oposición — Oponerte al procesamiento de moderación, aunque podemos continuar si tenemos motivos legítimos convincentes (seguridad, obligaciones legales)

Para ejercer tus derechos o hacer preguntas sobre la moderación, contáctanos en contact@ismscopilot.com.

¿Preguntas?

Para más información sobre nuestras prácticas de privacidad y seguridad, consulta:

On this page