Moderacja treści i bezpieczeństwo - ISMS Copilot
ISMS Copilot wykorzystuje automatyczną moderację treści do wykrywania i zapobiegania nieodpowiednim lub szkodliwym treściom w wiadomościach czatu. Proces ten działa w tle, aby zapewnić bezpieczne i zgodne z przepisami środowisko dla wszystkich użytkowników, zachowując prywatność i szybkość pracy.
ISMS Copilot wykorzystuje automatyczną moderację treści do wykrywania i zapobiegania nieodpowiednim lub szkodliwym treściom w wiadomościach czatu. Proces ten działa w tle, aby zapewnić bezpieczne, zgodne z przepisami środowisko dla wszystkich użytkowników, zachowując jednocześnie prywatność i szybkość pracy.
Moderacja działa asynchronicznie po wysłaniu wiadomości — nie wprowadza żadnych opóźnień w korzystaniu z czatu.
Jak działa moderacja
Gdy wysyłasz wiadomość czatu, ISMS Copilot zapisuje ją natychmiast i dostarcza odpowiedź AI bez opóźnień. Równolegle w tle uruchamiana jest weryfikacja treści:
- Analiza wiadomości — Twoja wiadomość jest przesyłana do API moderacji (domyślnie OpenAI, Mistral AI dla użytkowników z zaawansowaną ochroną danych)
- Sprawdzanie kategorii — API skanuje pod kątem naruszeń polityki, w tym mowy nienawiści, nękania, przemocy, samookaleczeń i innych szkodliwych treści
- Zapisywanie wyniku — Wynik moderacji jest przechowywany w dziennikach audytu wraz z wynikami kategorii i znacznikami czasu
- Powiadamianie administratorów — Jeśli treść zostanie oznaczona, nasz zespół otrzymuje automatyczne powiadomienie do przejrzenia
Proces ten jest w pełni zautomatyzowany i działa według zasady „odpal i zapomnij” — czat działa bez przerw.
Dostawcy moderacji
ISMS Copilot korzysta z różnych API moderacji w zależności od ustawień ochrony danych:
- OpenAI Moderation API — Domyślne dla wszystkich użytkowników. Sprawdza pod kątem: treści seksualnych, nienawiści, nękania, przemocy, samookaleczeń
- Mistral AI Moderation API — Używane, gdy włączona jest zaawansowana ochrona danych. Sprawdza pod kątem: treści seksualnych, nienawiści i dyskryminacji, przemocy i gróźb, niebezpiecznych i przestępczych treści, samookaleczeń, zdrowia, finansów, prawa, danych osobowych (PII)
Kategorie Mistral obejmują również sprawdzanie treści związanych ze zdrowiem, finansami, prawem i PII. Mogą one czasami oznaczać prawidłowe dyskusje dotyczące zgodności z ISMS. Nasz zespół przegląda wszystkie alerty, aby uniknąć fałszywych pozytywów.
Zaawansowana ochrona danych i moderacja
Jeśli włączyłeś Zaawansowaną ochronę danych, Twoje wiadomości czatu nie są zwykle przechowywane na naszych serwerach ani wysyłane do zewnętrznych dostawców AI. Moderacja treści stanowi jednak jedno odstępstwo:
- Czyste wiadomości — Treść wiadomości NIE jest przechowywana; jedynie metadane i wyniki moderacji są zachowywane przez 30 dni
- Oznaczone wiadomości — Pełna treść jest zawsze przechowywana przez 1 rok i dołączana do alertów dla administratorów, niezależnie od ustawień ADP
Nadpisanie zabezpieczeń: Oznaczone treści są zawsze przechowywane i udostępniane naszemu zespołowi, nawet przy włączonej zaawansowanej ochronie danych. Jest to konieczne dla zgodności prawnej, zapobiegania nadużyciom i utrzymania bezpieczeństwa platformy dla wszystkich użytkowników.
To nadpisanie opiera się na uzasadnionym interesie zgodnie z art. 6 ust. 1 lit. f RODO — zapobieganie szkodom i egzekwowanie naszej Polityki akceptowalnego użytkowania stanowi uzasadniony interes, który przeważa nad indywidualnymi preferencjami ochrony danych w przypadku oznaczonych treści.
Przechowywanie danych
Zdarzenia związane z moderacją są przechowywane zgodnie z poniższym harmonogramem:
- Zdarzenia nieoznaczone — Metadane i wyniki moderacji przechowywane przez 30 dni; treść wiadomości NIE jest przechowywana
- Zdarzenia oznaczone — Pełna treść wiadomości i metadane przechowywane przez 1 rok w celach audytowych i zgodności prawnej
Treść oznaczonych wiadomości może być przechowywana dłużej, jeśli jest to wymagane w związku z trwającymi dochodzeniami, postępowaniami sądowymi lub obowiązkami regulacyjnymi.
Co się dzieje, gdy treść zostanie oznaczona
Gdy API moderacji oznaczy Twoją wiadomość jako potencjalnie naruszającą nasze polityki:
- Wysyłanie alertu — Nasz zespół administratorów otrzymuje powiadomienie webhook z oznaczoną kategorią, znacznikiem czasu i podglądem wiadomości
- Przegląd przez człowieka — Członek zespołu sprawdza wiadomość i kontekst, aby potwierdzić, czy narusza ona naszą Politykę akceptowalnego użytkowania
- Działanie (jeśli potwierdzone) — W zależności od wagi i powtarzalności naruszeń możemy się z Tobą skontaktować, wydać ostrzeżenie, zawiesić funkcje lub zakończyć Twoje konto
- Fałszywe pozytywy — Jeśli oznaczenie było błędne (np. prawidłowa dyskusja dotycząca zgodności), nie podejmujemy żadnych działań
Ograniczenie liczby alertów: Możesz wywołać tylko jedno powiadomienie o moderacji na godzinę. Kolejne oznaczone wiadomości w tym oknie czasowym są rejestrowane, ale nie generują duplikatów alertów.
Prywatność i przejrzystość
Zobowiązujemy się do przejrzystości naszych praktyk moderacyjnych:
- Brak cichej cenzury — Nie blokujemy ani nie filtrujemy Twoich wiadomości w czasie rzeczywistym. Moderacja służy egzekwowaniu bezpieczeństwa, a nie kontroli treści
- Procesory zewnętrzne — OpenAI (z siedzibą w USA) i Mistral AI (z siedzibą we Francji) działają jako podprocesory wyłącznie do celów moderacji. Szczegóły znajdziesz w naszym Rejestrze czynności przetwarzania
- Pełna jawność — Niniejsza polityka oraz nasza Polityka prywatności dokumentują wszystkie przepływy danych związane z moderacją oraz podstawy prawne
Podstawa prawna
Moderacja treści opiera się na:
- Uzasadnionym interesie (art. 6 ust. 1 lit. f RODO) — Zapobieganie nadużyciom, egzekwowanie naszych warunków i utrzymanie bezpieczeństwa platformy
- Konieczności umownej (art. 6 ust. 1 lit. b RODO) — Egzekwowanie naszych Warunków świadczenia usług i Polityki akceptowalnego użytkowania
- Obowiązku prawnego (art. 6 ust. 1 lit. c RODO) — Zgodność z obowiązującymi przepisami wymagającymi usunięcia lub zgłaszania nielegalnych treści
Twoje prawa
Zgodnie z RODO przysługują Ci prawa dotyczące danych związanych z moderacją:
- Dostęp — Żądanie kopii zdarzeń moderacyjnych związanych z Twoim kontem
- Sprostowanie — Żądanie poprawienia nieprawidłowych zapisów moderacyjnych
- Usunięcie — Żądanie usunięcia danych moderacyjnych nieoznaczonych (oznaczone dane mogą być przechowywane ze względu na zgodność prawną)
- Sprzeciw — Sprzeciw wobec przetwarzania danych w ramach moderacji, choć możemy kontynuować, jeśli mamy ważne uzasadnione podstawy (bezpieczeństwo, obowiązki prawne)
Aby skorzystać ze swoich praw lub zadać pytania dotyczące moderacji, skontaktuj się z nami pod adresem contact@ismscopilot.com.
Pytania?
Więcej informacji na temat naszych praktyk dotyczących prywatności i bezpieczeństwa znajdziesz w: