Gestão de Incidentes e Continuidade de Negócios
O ISMS Copilot estabeleceu procedimentos de gestão de incidentes e continuidade de negócios para garantir detecção, contenção e recuperação rápidas de incidentes de segurança ou interrupções de serviço…
O ISMS Copilot estabeleceu procedimentos de gestão de incidentes e continuidade de negócios para garantir detecção, contenção e recuperação rápidas de incidentes de segurança ou interrupções de serviço. Nossa abordagem prioriza a proteção de dados do cliente e a disponibilidade do serviço.
A resposta a incidentes está integrada ao nosso processo de gestão de mudanças e procedimentos de escalonamento para garantir uma resposta coordenada.
Processo de Resposta a Incidentes
Nossa gestão de incidentes segue uma abordagem em cinco fases:
- Detecção — Sistemas de monitoramento, relatórios de clientes ou varreduras de segurança identificam potenciais incidentes
- Avaliação — Gravidade e escopo do incidente são avaliados para determinar o nível de resposta
- Contenção — Ações imediatas são tomadas para limitar o impacto e evitar a propagação
- Recuperação — Sistemas são restaurados à operação normal com correções implementadas
- Revisão Pós-Incidente — Análise da causa raiz é conduzida e medidas preventivas são implementadas
Funções e Responsabilidades
Nossa equipe de resposta a incidentes inclui funções definidas:
- Comandante do Incidente — O CEO lidera a coordenação geral da resposta e a comunicação com as partes interessadas
- Plantão Primário e Secundário — Respondedores técnicos disponíveis para avaliação e remediação rápidas
- Responsável pela Comunicação — Gerencia notificações aos clientes e atualizações de status
Para incidentes de segurança envolvendo dados de clientes ou implicações de conformidade, escalamos para a liderança imediatamente.
Procedimentos de Escalonamento
Os incidentes são escalonados com base na gravidade e impacto:
- Coordenação da equipe via canal dedicado do Slack #incidents
- Notificação à liderança por e-mail para incidentes de alta gravidade
- Comunicação com o cliente para incidentes que afetam o serviço
- Notificação regulatória, se exigido pelo GDPR ou outros frameworks de conformidade
Planejamento de Continuidade de Negócios
Além da resposta a incidentes, mantemos procedimentos de continuidade de negócios, incluindo:
- Capacidades de backup e recuperação de desastres
- Monitoramento de dependências de terceiros e planejamento de contingência
- Redundância de infraestrutura para serviços críticos
- Procedimentos de retenção e recuperação de dados
- Mecanismos de failover e resiliência de provedores de IA
Failover e Resiliência de Provedores de IA
Para garantir a continuidade dos serviços de conformidade baseados em IA durante interrupções de provedores, o ISMS Copilot implementa mecanismos de failover automático:
Caminho do Provedor Padrão (Anthropic/OpenAI):
- Monitoramento de Circuit Breaker: Acompanhamento em tempo real da saúde do provedor de IA primário (Anthropic Claude) monitora erros 5xx, limites de taxa 529 e falhas de rede em uma janela deslizante
- Failover Automático: Quando os erros excedem o limite, as solicitações são automaticamente redirecionadas para o provedor de backup (OpenAI) sem intervenção do usuário
- Recuperação Automática: O sistema verifica periodicamente o provedor primário para detectar a recuperação e voltar a utilizá-lo quando saudável
- Notificação ao Usuário: Um banner persistente alerta os usuários durante eventos de failover, enquanto o serviço continua ininterrupto
- Bypass de Seleção de Provedor: Usuários que selecionam explicitamente modelos específicos (por exemplo, Gemini, Grok, Mistral) contornam o failover automático — sua seleção é respeitada
O failover automático oferece alta disponibilidade para a maioria dos usuários em caminhos de provedores padrão, minimizando interrupções durante incidentes com provedores de IA.
Modo de Proteção Avançada de Dados (Somente UE via Mistral):
- Failover Não Disponível: Usuários com o Modo de Proteção Avançada de Dados ativado (processamento somente na UE) utilizam exclusivamente o Mistral AI
- Limitação de Provedor Único: O Mistral é atualmente nosso único provedor baseado na UE com acordos de retenção zero, portanto, não há backup na UE
- Impacto no Serviço: Interrupções no Mistral podem causar interrupção do serviço para usuários somente da UE até que o provedor se recupere
- Racional da Troca: O modo somente UE prioriza a soberania de dados e retenção zero em detrimento da resiliência de failover
- Melhoria Futura: Estamos trabalhando ativamente para adicionar um segundo provedor na UE e habilitar failover para usuários do Modo de Proteção Avançada de Dados
Organizações que escolhem o Modo de Proteção Avançada de Dados aceitam essa troca de disponibilidade em troca de residência estrita de dados na UE e retenção zero pelo provedor de IA. Para requisitos críticos de uptime, avalie se o modo padrão (com failover automático, mas processamento nos EUA) é aceitável para sua postura de conformidade.
Monitoramento e Transparência:
- Métricas de saúde dos provedores são monitoradas continuamente via instrumentação de circuit breaker
- Eventos de failover são registrados e revisados em análises pós-incidente
- Comunicações na página de status informam os usuários sobre incidentes em andamento com provedores
- O status do circuit breaker é exposto via endpoint de monitoramento interno para visibilidade operacional
Incidentes pós-implantação acionam nossos procedimentos de rollback de gestão de mudanças, mantendo a documentação do incidente para revisão.
Documentação e Aprendizado
Cada incidente gera documentação, incluindo linha do tempo, avaliação de impacto, causa raiz e ações preventivas. Esses aprendizados retroalimentam nosso registro de riscos e planejamento de prevenção de ameaças.
Nossos procedimentos de gestão de incidentes estão alinhados com nosso framework geral de ISMS e suportam os requisitos de conformidade SOC 2, ISO 27001 e NIST.