ISMS Copilot Docs

Moderacja treści i bezpieczeństwo - ISMS Copilot

ISMS Copilot wykorzystuje automatyczną moderację treści do wykrywania i zapobiegania nieodpowiednim lub szkodliwym treściom w wiadomościach czatu. Proces ten działa w tle, aby zapewnić bezpieczne i zgodne z przepisami środowisko dla wszystkich użytkowników, zachowując prywatność i szybkość pracy.

ISMS Copilot wykorzystuje automatyczną moderację treści do wykrywania i zapobiegania nieodpowiednim lub szkodliwym treściom w wiadomościach czatu. Proces ten działa w tle, aby zapewnić bezpieczne, zgodne z przepisami środowisko dla wszystkich użytkowników, zachowując jednocześnie prywatność i szybkość pracy.

Moderacja działa asynchronicznie po wysłaniu wiadomości — nie wprowadza żadnych opóźnień w korzystaniu z czatu.

Jak działa moderacja

Gdy wysyłasz wiadomość czatu, ISMS Copilot zapisuje ją natychmiast i dostarcza odpowiedź AI bez opóźnień. Równolegle w tle uruchamiana jest weryfikacja treści:

  1. Analiza wiadomości — Twoja wiadomość jest przesyłana do API moderacji (domyślnie OpenAI, Mistral AI dla użytkowników z zaawansowaną ochroną danych)
  2. Sprawdzanie kategorii — API skanuje pod kątem naruszeń polityki, w tym mowy nienawiści, nękania, przemocy, samookaleczeń i innych szkodliwych treści
  3. Zapisywanie wyniku — Wynik moderacji jest przechowywany w dziennikach audytu wraz z wynikami kategorii i znacznikami czasu
  4. Powiadamianie administratorów — Jeśli treść zostanie oznaczona, nasz zespół otrzymuje automatyczne powiadomienie do przejrzenia

Proces ten jest w pełni zautomatyzowany i działa według zasady „odpal i zapomnij” — czat działa bez przerw.

Dostawcy moderacji

ISMS Copilot korzysta z różnych API moderacji w zależności od ustawień ochrony danych:

  • OpenAI Moderation API — Domyślne dla wszystkich użytkowników. Sprawdza pod kątem: treści seksualnych, nienawiści, nękania, przemocy, samookaleczeń
  • Mistral AI Moderation API — Używane, gdy włączona jest zaawansowana ochrona danych. Sprawdza pod kątem: treści seksualnych, nienawiści i dyskryminacji, przemocy i gróźb, niebezpiecznych i przestępczych treści, samookaleczeń, zdrowia, finansów, prawa, danych osobowych (PII)

Kategorie Mistral obejmują również sprawdzanie treści związanych ze zdrowiem, finansami, prawem i PII. Mogą one czasami oznaczać prawidłowe dyskusje dotyczące zgodności z ISMS. Nasz zespół przegląda wszystkie alerty, aby uniknąć fałszywych pozytywów.

Zaawansowana ochrona danych i moderacja

Jeśli włączyłeś Zaawansowaną ochronę danych, Twoje wiadomości czatu nie są zwykle przechowywane na naszych serwerach ani wysyłane do zewnętrznych dostawców AI. Moderacja treści stanowi jednak jedno odstępstwo:

  • Czyste wiadomości — Treść wiadomości NIE jest przechowywana; jedynie metadane i wyniki moderacji są zachowywane przez 30 dni
  • Oznaczone wiadomości — Pełna treść jest zawsze przechowywana przez 1 rok i dołączana do alertów dla administratorów, niezależnie od ustawień ADP

Nadpisanie zabezpieczeń: Oznaczone treści są zawsze przechowywane i udostępniane naszemu zespołowi, nawet przy włączonej zaawansowanej ochronie danych. Jest to konieczne dla zgodności prawnej, zapobiegania nadużyciom i utrzymania bezpieczeństwa platformy dla wszystkich użytkowników.

To nadpisanie opiera się na uzasadnionym interesie zgodnie z art. 6 ust. 1 lit. f RODO — zapobieganie szkodom i egzekwowanie naszej Polityki akceptowalnego użytkowania stanowi uzasadniony interes, który przeważa nad indywidualnymi preferencjami ochrony danych w przypadku oznaczonych treści.

Przechowywanie danych

Zdarzenia związane z moderacją są przechowywane zgodnie z poniższym harmonogramem:

  • Zdarzenia nieoznaczone — Metadane i wyniki moderacji przechowywane przez 30 dni; treść wiadomości NIE jest przechowywana
  • Zdarzenia oznaczone — Pełna treść wiadomości i metadane przechowywane przez 1 rok w celach audytowych i zgodności prawnej

Treść oznaczonych wiadomości może być przechowywana dłużej, jeśli jest to wymagane w związku z trwającymi dochodzeniami, postępowaniami sądowymi lub obowiązkami regulacyjnymi.

Co się dzieje, gdy treść zostanie oznaczona

Gdy API moderacji oznaczy Twoją wiadomość jako potencjalnie naruszającą nasze polityki:

  1. Wysyłanie alertu — Nasz zespół administratorów otrzymuje powiadomienie webhook z oznaczoną kategorią, znacznikiem czasu i podglądem wiadomości
  2. Przegląd przez człowieka — Członek zespołu sprawdza wiadomość i kontekst, aby potwierdzić, czy narusza ona naszą Politykę akceptowalnego użytkowania
  3. Działanie (jeśli potwierdzone) — W zależności od wagi i powtarzalności naruszeń możemy się z Tobą skontaktować, wydać ostrzeżenie, zawiesić funkcje lub zakończyć Twoje konto
  4. Fałszywe pozytywy — Jeśli oznaczenie było błędne (np. prawidłowa dyskusja dotycząca zgodności), nie podejmujemy żadnych działań

Ograniczenie liczby alertów: Możesz wywołać tylko jedno powiadomienie o moderacji na godzinę. Kolejne oznaczone wiadomości w tym oknie czasowym są rejestrowane, ale nie generują duplikatów alertów.

Prywatność i przejrzystość

Zobowiązujemy się do przejrzystości naszych praktyk moderacyjnych:

  • Brak cichej cenzury — Nie blokujemy ani nie filtrujemy Twoich wiadomości w czasie rzeczywistym. Moderacja służy egzekwowaniu bezpieczeństwa, a nie kontroli treści
  • Procesory zewnętrzne — OpenAI (z siedzibą w USA) i Mistral AI (z siedzibą we Francji) działają jako podprocesory wyłącznie do celów moderacji. Szczegóły znajdziesz w naszym Rejestrze czynności przetwarzania
  • Pełna jawność — Niniejsza polityka oraz nasza Polityka prywatności dokumentują wszystkie przepływy danych związane z moderacją oraz podstawy prawne

Podstawa prawna

Moderacja treści opiera się na:

  • Uzasadnionym interesie (art. 6 ust. 1 lit. f RODO) — Zapobieganie nadużyciom, egzekwowanie naszych warunków i utrzymanie bezpieczeństwa platformy
  • Konieczności umownej (art. 6 ust. 1 lit. b RODO) — Egzekwowanie naszych Warunków świadczenia usług i Polityki akceptowalnego użytkowania
  • Obowiązku prawnego (art. 6 ust. 1 lit. c RODO) — Zgodność z obowiązującymi przepisami wymagającymi usunięcia lub zgłaszania nielegalnych treści

Twoje prawa

Zgodnie z RODO przysługują Ci prawa dotyczące danych związanych z moderacją:

  • Dostęp — Żądanie kopii zdarzeń moderacyjnych związanych z Twoim kontem
  • Sprostowanie — Żądanie poprawienia nieprawidłowych zapisów moderacyjnych
  • Usunięcie — Żądanie usunięcia danych moderacyjnych nieoznaczonych (oznaczone dane mogą być przechowywane ze względu na zgodność prawną)
  • Sprzeciw — Sprzeciw wobec przetwarzania danych w ramach moderacji, choć możemy kontynuować, jeśli mamy ważne uzasadnione podstawy (bezpieczeństwo, obowiązki prawne)

Aby skorzystać ze swoich praw lub zadać pytania dotyczące moderacji, skontaktuj się z nami pod adresem contact@ismscopilot.com.

Pytania?

Więcej informacji na temat naszych praktyk dotyczących prywatności i bezpieczeństwa znajdziesz w:

On this page