Moderacja treści i bezpieczeństwo - ISMS Copilot
ISMS Copilot wykorzystuje automatyczną moderację treści do wykrywania i zapobiegania nieodpowiednim lub szkodliwym treściom w wiadomościach czatu. Proces ten działa w tle, aby zapewnić bezpieczne i zgodne z przepisami środowisko dla wszystkich użytkowników, zachowując prywatność i szybkość pracy.
ISMS Copilot wykorzystuje automatyczną moderację treści do wykrywania i zapobiegania nieodpowiednim lub szkodliwym treściom w wiadomościach czatu. Proces ten działa w tle, aby zapewnić bezpieczne, zgodne z przepisami środowisko dla wszystkich użytkowników, zachowując jednocześnie prywatność i szybkość pracy.
Moderacja działa asynchronicznie po wysłaniu wiadomości, nie wprowadza żadnych opóźnień w korzystaniu z czatu.
Jak działa moderacja
Gdy wysyłasz wiadomość czatu, ISMS Copilot zapisuje ją natychmiast i dostarcza odpowiedź AI bez opóźnień. Równolegle w tle uruchamiana jest weryfikacja treści:
- Analiza wiadomości, Twoja wiadomość jest przesyłana do API moderacji (domyślnie OpenAI, Mistral AI dla użytkowników z zaawansowaną ochroną danych)
- Sprawdzanie kategorii, API skanuje pod kątem naruszeń polityki, w tym mowy nienawiści, nękania, przemocy, samookaleczeń i innych szkodliwych treści
- Zapisywanie wyniku, Wynik moderacji jest przechowywany w dziennikach audytu wraz z wynikami kategorii i znacznikami czasu
- Powiadamianie administratorów, Jeśli treść zostanie oznaczona, nasz zespół otrzymuje automatyczne powiadomienie do przejrzenia
Proces ten jest w pełni zautomatyzowany i działa według zasady „odpal i zapomnij”, czat działa bez przerw.
Dostawcy moderacji
ISMS Copilot korzysta z różnych API moderacji w zależności od ustawień ochrony danych:
- OpenAI Moderation API, Domyślne dla wszystkich użytkowników. Sprawdza pod kątem: treści seksualnych, nienawiści, nękania, przemocy, samookaleczeń
- Mistral AI Moderation API, Używane, gdy włączona jest zaawansowana ochrona danych. Sprawdza pod kątem: treści seksualnych, nienawiści i dyskryminacji, przemocy i gróźb, niebezpiecznych i przestępczych treści, samookaleczeń, zdrowia, finansów, prawa, danych osobowych (PII)
Kategorie Mistral obejmują również sprawdzanie treści związanych ze zdrowiem, finansami, prawem i PII. Mogą one czasami oznaczać prawidłowe dyskusje dotyczące zgodności z ISMS. Nasz zespół przegląda wszystkie alerty, aby uniknąć fałszywych pozytywów.
Zaawansowana ochrona danych i moderacja
Jeśli włączyłeś Zaawansowaną ochronę danych, Twoje wiadomości czatu nie są zwykle przechowywane na naszych serwerach ani wysyłane do zewnętrznych dostawców AI. Moderacja treści stanowi jednak jedno odstępstwo:
- Czyste wiadomości, Treść wiadomości NIE jest przechowywana; jedynie metadane i wyniki moderacji są zachowywane przez 30 dni
- Oznaczone wiadomości, Pełna treść jest zawsze przechowywana przez 1 rok i dołączana do alertów dla administratorów, niezależnie od ustawień ADP
Nadpisanie zabezpieczeń: Oznaczone treści są zawsze przechowywane i udostępniane naszemu zespołowi, nawet przy włączonej zaawansowanej ochronie danych. Jest to konieczne dla zgodności prawnej, zapobiegania nadużyciom i utrzymania bezpieczeństwa platformy dla wszystkich użytkowników.
To nadpisanie opiera się na uzasadnionym interesie zgodnie z art. 6 ust. 1 lit. f RODO, zapobieganie szkodom i egzekwowanie naszej Polityki akceptowalnego użytkowania stanowi uzasadniony interes, który przeważa nad indywidualnymi preferencjami ochrony danych w przypadku oznaczonych treści.
Przechowywanie danych
Zdarzenia związane z moderacją są przechowywane zgodnie z poniższym harmonogramem:
- Zdarzenia nieoznaczone, Metadane i wyniki moderacji przechowywane przez 30 dni; treść wiadomości NIE jest przechowywana
- Zdarzenia oznaczone, Pełna treść wiadomości i metadane przechowywane przez 1 rok w celach audytowych i zgodności prawnej
Treść oznaczonych wiadomości może być przechowywana dłużej, jeśli jest to wymagane w związku z trwającymi dochodzeniami, postępowaniami sądowymi lub obowiązkami regulacyjnymi.
Co się dzieje, gdy treść zostanie oznaczona
Gdy API moderacji oznaczy Twoją wiadomość jako potencjalnie naruszającą nasze polityki:
- Wysyłanie alertu, Nasz zespół administratorów otrzymuje powiadomienie webhook z oznaczoną kategorią, znacznikiem czasu i podglądem wiadomości
- Przegląd przez człowieka, Członek zespołu sprawdza wiadomość i kontekst, aby potwierdzić, czy narusza ona naszą Politykę akceptowalnego użytkowania
- Działanie (jeśli potwierdzone), W zależności od wagi i powtarzalności naruszeń możemy się z Tobą skontaktować, wydać ostrzeżenie, zawiesić funkcje lub zakończyć Twoje konto
- Fałszywe pozytywy, Jeśli oznaczenie było błędne (np. prawidłowa dyskusja dotycząca zgodności), nie podejmujemy żadnych działań
Ograniczenie liczby alertów: Możesz wywołać tylko jedno powiadomienie o moderacji na godzinę. Kolejne oznaczone wiadomości w tym oknie czasowym są rejestrowane, ale nie generują duplikatów alertów.
Prywatność i przejrzystość
Zobowiązujemy się do przejrzystości naszych praktyk moderacyjnych:
- Brak cichej cenzury, Nie blokujemy ani nie filtrujemy Twoich wiadomości w czasie rzeczywistym. Moderacja służy egzekwowaniu bezpieczeństwa, a nie kontroli treści
- Procesory zewnętrzne, OpenAI (z siedzibą w USA) i Mistral AI (z siedzibą we Francji) działają jako podprocesory wyłącznie do celów moderacji. Szczegóły znajdziesz w naszym Rejestrze czynności przetwarzania
- Pełna jawność, Niniejsza polityka oraz nasza Polityka prywatności dokumentują wszystkie przepływy danych związane z moderacją oraz podstawy prawne
Podstawa prawna
Moderacja treści opiera się na:
- Uzasadnionym interesie (art. 6 ust. 1 lit. f RODO), Zapobieganie nadużyciom, egzekwowanie naszych warunków i utrzymanie bezpieczeństwa platformy
- Konieczności umownej (art. 6 ust. 1 lit. b RODO), Egzekwowanie naszych Warunków świadczenia usług i Polityki akceptowalnego użytkowania
- Obowiązku prawnego (art. 6 ust. 1 lit. c RODO), Zgodność z obowiązującymi przepisami wymagającymi usunięcia lub zgłaszania nielegalnych treści
Twoje prawa
Zgodnie z RODO przysługują Ci prawa dotyczące danych związanych z moderacją:
- Dostęp, Żądanie kopii zdarzeń moderacyjnych związanych z Twoim kontem
- Sprostowanie, Żądanie poprawienia nieprawidłowych zapisów moderacyjnych
- Usunięcie, Żądanie usunięcia danych moderacyjnych nieoznaczonych (oznaczone dane mogą być przechowywane ze względu na zgodność prawną)
- Sprzeciw, Sprzeciw wobec przetwarzania danych w ramach moderacji, choć możemy kontynuować, jeśli mamy ważne uzasadnione podstawy (bezpieczeństwo, obowiązki prawne)
Aby skorzystać ze swoich praw lub zadać pytania dotyczące moderacji, skontaktuj się z nami pod adresem contact@ismscopilot.com.
Pytania?
Więcej informacji na temat naszych praktyk dotyczących prywatności i bezpieczeństwa znajdziesz w: