Zarządzanie incydentami i ciągłość działania
ISMS Copilot ustanowił procedury zarządzania incydentami i ciągłości działania, aby zapewnić szybkie wykrywanie, powstrzymanie i odzyskiwanie po incydentach bezpieczeństwa lub zakłóceniach usług…
ISMS Copilot ustanowił procedury zarządzania incydentami i ciągłości działania, aby zapewnić szybkie wykrywanie, powstrzymanie i odzyskiwanie po incydentach bezpieczeństwa lub zakłóceniach usług. Nasze podejście priorytetowo traktuje ochronę danych klientów oraz dostępność usług.
Reagowanie na incydenty jest zintegrowane z procesem zarządzania zmianami oraz procedurami eskalacji, aby zapewnić skoordynowaną reakcję.
Proces reagowania na incydenty
Nasze zarządzanie incydentami opiera się na pięcioetapowym podejściu:
- Wykrywanie — Systemy monitoringu, zgłoszenia klientów lub skanowanie bezpieczeństwa identyfikują potencjalne incydenty
- Ocena — Określenie wagi i zakresu incydentu w celu ustalenia poziomu reakcji
- Powstrzymanie — Podjęcie natychmiastowych działań w celu ograniczenia wpływu i zapobieżenia rozprzestrzenianiu się
- Odzyskiwanie — Przywrócenie systemów do normalnego działania po wdrożeniu poprawek
- Przegląd poincydentowy — Przeprowadzenie analizy przyczyn źródłowych i wdrożenie środków zapobiegawczych
Role i obowiązki
Nasz zespół reagowania na incydenty obejmuje zdefiniowane role:
- Dowódca Incydentu — CEO kieruje ogólną koordynacją reakcji oraz komunikacją z interesariuszami
- Pierwszy i Drugi Dyżurny — Techniczni respondenci dostępni w celu szybkiej oceny i naprawy
- Koordynator Komunikacji — Zarządza powiadomieniami dla klientów oraz aktualizacjami statusu
W przypadku incydentów bezpieczeństwa dotyczących danych klientów lub implikacji zgodnościowych, niezwłocznie eskalujemy sprawę do kierownictwa.
Procedury eskalacji
Incydenty są eskalowane w zależności od wagi i wpływu:
- Koordynacja zespołu poprzez dedykowany kanał Slack #incidents
- Powiadomienie kierownictwa drogą mailową w przypadku incydentów o wysokiej wadze
- Komunikacja z klientami w przypadku incydentów wpływających na usługi
- Powiadomienie organów regulacyjnych, jeśli wymagają tego przepisy GDPR lub inne ramy zgodności
Planowanie ciągłości działania
Poza reagowaniem na incydenty, utrzymujemy procedury ciągłości działania, w tym:
- Możliwości tworzenia kopii zapasowych i odzyskiwania po awarii
- Monitorowanie zależności od podmiotów trzecich i planowanie awaryjne
- Nadmiarowość infrastruktury dla krytycznych usług
- Procedury przechowywania i odzyskiwania danych
- Mechanizmy przełączania awaryjnego i odporności dostawców AI
Przełączanie awaryjne i odporność dostawców AI
Aby zapewnić ciągłość usług zgodnościowych opartych na AI podczas awarii dostawców, ISMS Copilot wdraża mechanizmy automatycznego przełączania awaryjnego:
Domyślna ścieżka dostawcy (Anthropic/OpenAI):
- Monitorowanie wyłącznika awaryjnego: Monitorowanie stanu zdrowia głównego dostawcy AI (Anthropic Claude) w czasie rzeczywistym śledzi błędy 5xx, limity szybkości 529 oraz awarie sieciowe w oknie przesuwnym
- Automatyczne przełączanie awaryjne: Gdy błędy przekroczą próg, żądania są automatycznie przekierowywane do dostawcy zapasowego (OpenAI) bez interwencji użytkownika
- Automatyczne odzyskiwanie: System okresowo sprawdza główny dostawcę, aby wykryć powrót do zdrowia i przełączyć się z powrotem, gdy jest zdrowy
- Powiadomienie użytkowników: Trwały baner informuje użytkowników o zdarzeniach przełączania awaryjnego, podczas gdy usługa działa nieprzerwanie
- Omijanie wyboru dostawcy: Użytkownicy, którzy jawnie wybiorą określone modele (np. Gemini, Grok, Mistral), omijają automatyczne przełączanie awaryjne — ich wybór jest respektowany
Automatyczne przełączanie awaryjne zapewnia wysoką dostępność dla większości użytkowników korzystających z domyślnych ścieżek dostawców, minimalizując zakłócenia podczas incydentów u dostawców AI.
Tryb zaawansowanej ochrony danych (tylko UE, poprzez Mistral):
- Brak przełączania awaryjnego: Użytkownicy z włączoną zaawansowaną ochroną danych (przetwarzanie tylko w UE) korzystają wyłącznie z Mistral AI
- Ograniczenie do jednego dostawcy: Mistral jest obecnie naszym jedynym dostawcą z siedzibą w UE z umowami o braku przechowywania danych, więc nie ma zapasowego dostawcy w UE
- Wpływ na usługę: Awaria Mistral może spowodować przerwę w działaniu usługi dla użytkowników tylko z UE do czasu przywrócenia działania dostawcy
- Racjonalizacja kompromisu: Tryb tylko UE priorytetowo traktuje suwerenność danych i brak przechowywania danych nad odpornością na awarie
- Przyszłe usprawnienia: Aktywnie pracujemy nad dodaniem drugiego dostawcy z UE, aby umożliwić przełączanie awaryjne dla użytkowników zaawansowanej ochrony danych
Organizacje wybierające tryb zaawansowanej ochrony danych akceptują ten kompromis dostępności w zamian za ścisłą rezydencję danych w UE i brak przechowywania danych przez dostawcę AI. W przypadku krytycznych wymagań dotyczących czasu działania, oceń, czy tryb domyślny (z automatycznym przełączaniem awaryjnym, ale przetwarzaniem w USA) jest akceptowalny dla twojej postawy zgodności.
Monitorowanie i przejrzystość:
- Metryki stanu dostawcy są monitorowane w sposób ciągły za pomocą instrumentacji wyłącznika awaryjnego
- Zdarzenia przełączania awaryjnego są rejestrowane i przeglądane w analizie poincydentowej
- Komunikacja na stronie statusu informuje użytkowników o trwających incydentach u dostawców
- Stan wyłącznika awaryjnego jest udostępniany poprzez wewnętrzny punkt końcowy monitoringu dla widoczności operacyjnej
Incydenty po wdrożeniu uruchamiają nasze procedury wycofywania zmian w ramach zarządzania zmianami, przy jednoczesnym utrzymaniu dokumentacji incydentów do przeglądu.
Dokumentacja i wyciąganie wniosków
Każdy incydent generuje dokumentację zawierającą oś czasu, ocenę wpływu, przyczynę źródłową oraz działania zapobiegawcze. Te wnioski są wprowadzane z powrotem do rejestru ryzyka i planowania zapobiegania zagrożeniom.
Nasze procedury zarządzania incydentami są zgodne z ogólnym frameworkiem ISMS i wspierają wymagania zgodności SOC 2, ISO 27001 oraz NIST.