ISMS Copilot Docs

Benchmark: Claude Code com e sem ISMS Copilot

Como medimos o Claude Code trabalhando sozinho em comparação com o Claude Code delegando perguntas de GRC ao ISMS Copilot: método, gabarito, pontuação, resultados, o caso em que a delegação não ajuda e as ressalvas.

Medimos uma pergunta: ao realizar trabalho de GRC no Claude Code, qual é o custo em uso do Claude para uma resposta correta se o Claude Code pesquisar sozinho e qual é o custo se o Claude Code repassar a pergunta ao ISMS Copilot por meio do MCP? Esta página apresenta o método, todos os números principais, a execução em que a delegação não ajudou e o que os resultados apoiam ou não.

O que isso apoia

Nos itens testados, o Claude Code delegando ao ISMS Copilot igualou a precisão do Claude Code pesquisando sozinho com busca na web: o veredito de precisão pré-registrado foi empate em todos os cenários. Gastou menos dinheiro da API do Claude por resposta correta em consultas e conselhos rápidos e aproximadamente o mesmo em uma longa sessão mista de codificação e conformidade. Os frameworks testados são ISO/IEC 27001:2022 Anexo A, ISO/IEC 42001:2023 Anexo A, CMMC 2.0 Nível 2, DORA RTS (UE) 2024/1774 e NIS2 IR (UE) 2024/2690, e apenas esses. As interações delegadas contam contra o plano do ISMS Copilot, o que não está incluído nos valores em dólar.

Configuração

ItemValor
DatasTodas as execuções em 2026-09-28 (UTC)
OrquestradorClaude Code 2.1.283, sem interface, uma configuração e pasta de trabalho vazias e novas para cada execução
Modeloclaude-sonnet-5 em ambas as configurações, fixo. Busca na web e busca de dados executam subchamadas do Claude Haiku 4.5, e seu custo está incluído.
ExecuçõesN=3 por cenário por configuração, executadas como pares correspondentes (ambas as configurações iniciam o mesmo cenário ao mesmo tempo)
Uso do ClaudeChave da API do Claude, preços de lista, conforme relatado pelo Claude Code para cada execução
ISMS CopilotO MCP de conta de produção, em uma conta do ISMS Copilot (nossa)

As duas configurações recebem prompts de tarefas idênticos, e os prompts nunca mencionam o ISMS Copilot:

Claude Code sozinhoClaude Code + ISMS Copilot
FerramentasRead, Glob, Grep, Write, Edit, WebSearch, WebFetchAs mesmas, mais as ferramentas de conversação do ISMS Copilot (create_conversation, send_message, get_reply)
InstruçõesNenhumaA regra de roteamento publicada do Claude Code em Delegar trabalho de GRC do seu agente (2026-09-28), como o arquivo CLAUDE.md do projeto

Ambas as configurações têm busca na web e busca de dados porque um usuário real os tem. A regra de roteamento decide o que é delegado. As outras ferramentas de conta (contexto da empresa, espaços de trabalho, memórias, documentos) não foram permitidas, então os resultados não dependem de um perfil de empresa armazenado. As memórias do lado do servidor da conta do ISMS Copilot ainda poderiam moldar suas respostas.

Cenários

  • S1, consultas. 20 temas de requisitos, e a tarefa é fornecer o identificador exato para cada um: 4 artigos do DORA RTS, 4 pontos do anexo do NIS2 IR, 4 controles do Anexo A da ISO/IEC 42001:2023, 4 práticas do CMMC Level 2 e 4 controles do Anexo A da ISO/IEC 27001:2022. A resposta é um arquivo JSON.
  • S3, sessão longa. Uma sessão do Claude Code com 8 prompts em um pequeno repositório Python: 4 edições de código (verificadas por testes ocultos) alternadas com 4 perguntas de GRC com respostas-chave. As respostas de GRC são pontuadas; as verificações de código são relatadas separadamente.
  • S4, conselho rápido. 5 perguntas de sim ou não, cada uma com o identificador que a decide e um motivo em uma frase. Correta apenas se o sim ou não e o identificador correspondem.
  • Verificação reservada. 20 novos itens do DORA RTS e NIS2 IR, no formato S1, que nunca estiveram na chave de respostas antes (veja "A história" abaixo).

Todos os dados de teste são fictícios. Nenhum dado de cliente foi usado.

Como a chave de respostas foi construída

Cada item com resposta-chave tem o identificador canônico, o requisito em uma frase, uma citação e uma referência ou trecho da fonte. A chave foi construída apenas a partir de fontes oficiais e nunca a partir do ISMS Copilot, pois isso seria circular:

  • DORA RTS (EU) 2024/1774 e NIS2 IR (EU) 2024/2690: o texto oficial do Escritório de Publicações da UE (CELEX 32024R1774 e 32024R2690), citado nos endereços do EUR-Lex.
  • CMMC 2.0 Level 2: o Guia de Avaliação do Level 2 do CMMC do DoD, com a publicação do NIST de onde vêm os números das práticas.
  • ISO/IEC 27001:2022 Anexo A: números e títulos dos controles da própria listagem do padrão da ISO.
  • ISO/IEC 42001:2023 Anexo A: números e títulos dos controles do mapeamento do NIST AI RMF para ISO/IEC 42001.

A chave foi congelada antes da primeira execução, e cada execução registra um resumo dela. Não foi alterada durante o benchmark.

Pontuação

A pontuação é mecânica: nenhum modelo julga nenhuma resposta. Um script lê o campo de identificador de cada resposta, normaliza-o por tipo e o compara com a chave:

  • DORA RTS: "Article 7", "Art. 7(4)" e "Article 7(4) of ..." todos contam como Article 7.
  • NIS2 IR: a resposta deve ser um ponto real do anexo e deve estar na lista de aceitação pré-registrada do item (o ponto operativo e seu título). Um ponto irmão está errado.
  • ISO/IEC 27001:2022 e ISO/IEC 42001:2023: o número do Anexo A deve corresponder exatamente. A numeração de 2013 ou uma referência ao Anexo B para 42001 está errada.
  • CMMC Level 2: o número da prática deve corresponder ("SC.L2-3.13.11" e "3.13.11" ambos contam).

Um arquivo ausente, JSON inválido ou um identificador não analisável conta como errado. Execuções que atingissem um limite teriam sido pontuadas como estavam e nunca reexecutadas.

Métrica

A métrica principal é dólares da API do Claude por resposta correta: o custo do Claude das 3 execuções de um cenário dividido pelo número de respostas corretas nessas 3 execuções. É o preço de tabela que o Claude Code relata, ou seja, o que um assinante do Claude paga por uso extra além do plano. Inclui as subchamadas de busca na web e as taxas de busca.

O uso do plano do ISMS Copilot não está incluído nesse valor, e não é gratuito. As interações delegadas contam contra o seu plano do ISMS Copilot (veja Onde o uso do ISMS Copilot é cobrado). Deixá-lo de fora favorece a configuração de delegação nesta métrica.

Precisão, tokens do orquestrador, interações e tempo são relatados ao lado. Tokens e dólares diferem: contexto repetido lido do cache de prompts é cobrado a uma fração do preço de entrada, então uma configuração pode usar mais tokens e ainda custar menos dólares.


Pré-registro e a emenda registrada

O design, a chave de respostas, o pontuador e as regras de vitória foram comprometidos antes de qualquer execução, com o compromisso de publicar os resultados independentemente do que mostrasse. As regras de vitória pré-registradas: precisão vence com 10 pontos percentuais ou mais; dólares por resposta correta vence com 1.25 vez ou mais; qualquer coisa mais próxima é empate. A reexecução v3 e a verificação reservada foram pré-registradas da mesma forma antes de suas primeiras execuções.

Uma emenda foi feita durante a primeira execução (v2). Um limite de 2 milhões de tokens do orquestrador por execução, destinado a ser um protetor contra execuções descontroladas, interrompeu o benchmark após o primeiro par, quando o Claude Code sozinho terminou uma execução de consulta normalmente com 2.38 milhões de tokens (todas as 20 corretas). O limite foi aumentado para 6 milhões para ambas as configurações; a mudança foi registrada com seu horário, e nada foi reexecutado. A alteração foi feita após aquele primeiro resultado ter sido visto. Sem ela, nenhum cenário teria um veredito. Os limites de dólares e o teto geral de gastos não mudaram.


A história: v2, a correção, v3 e a verificação reservada

A v2 encontrou uma lacuna de conhecimento. Na primeira execução justa, o ISMS Copilot correspondeu ao Claude Code sozinho em todos os itens de ISO/IEC 27001, ISO/IEC 42001 e CMMC, mas errou a maioria dos números de artigos do DORA RTS e pontos do anexo do NIS2 IR. Suas respostas marcaram esses identificadores como não confirmados.

Precisão v2Claude Code sozinhoClaude Code + ISMS Copilot
Pesquisas S160/6037/60
Sessão longa S312/129/12
Aconselhamento rápido S415/159/15

A correção. Adicionamos ao ISMS Copilot conhecimento sobre DORA RTS e NIS2 IR em nível de artigo e ponto de anexo, construído a partir dos textos oficiais da UE, e incluímos uma linha na regra de roteamento: verificar qualquer resposta que o ISMS Copilot marcar como não confirmada. Em seguida, reexecutamos os mesmos cenários com a mesma chave e o mesmo avaliador.

v3 (mesma chave, mesmo avaliador, ambas as configurações reexecutadas):

CenárioConfiguraçãoCorretasPrecisãoCusto Claude $ (3 execuções)Claude $ por resposta corretaTokens medianos do orquestrador por execução
Pesquisas S1Sozinho60/60100%6.920.1153,194,935
Pesquisas S1+ ISMS Copilot60/60100%3.180.0531,337,252
Sessão longa S3Sozinho12/12100%1.650.1381,537,697
Sessão longa S3+ ISMS Copilot12/12100%1.750.1461,742,489
Aconselhamento rápido S4Sozinho15/15100%0.890.059501,237
Aconselhamento rápido S4+ ISMS Copilot15/15100%0.390.026255,659

Verdictos pré-registrados: a precisão é empate em todos os três cenários. O custo por resposta correta favorece a configuração com delegação nos cenários S1 e S4, e S3 é empate. No S3, todas as verificações de código passaram em ambas as configurações.

O ganho veio das próprias respostas do ISMS Copilot. Um diagnóstico adicionado após as execuções (sem veredicto anexado) constatou que suas respostas continham o identificador correto de DORA RTS e NIS2 IR em 24 dos 24 itens do S1 antes de qualquer verificação na web pelo Claude Code. Nenhuma resposta da v3 marcou um identificador como não confirmado, então a nova linha de verificação não foi acionada. O Claude Code ainda verificou na web nos cenários S1 e S3 sem ser solicitado, o que não alterou nenhuma resposta, mas aumentou o custo da configuração com delegação.

A verificação reservada (20 novos itens). Como a correção de conhecimento foi baseada nas falhas da v2, verificamos se houve treinamento para o teste: 10 artigos do DORA RTS e 10 pontos do anexo do NIS2 IR que a chave nunca continha, construídos a partir dos textos oficiais da mesma forma, no formato S1.

ReservadosConfiguraçãoCorretasPrecisãoCusto Claude $ (3 execuções)Claude $ por resposta corretaTokens medianos do orquestrador por execução
20 novos itens DORA RTS e NIS2 IRSozinho58/6096.7%4.010.0691,974,985
20 novos itens DORA RTS e NIS2 IR+ ISMS Copilot60/60100%3.100.0522,258,506

Verdictos pré-registrados: a precisão é empate (a diferença é inferior a 10 pontos), e o custo por resposta correta favorece a configuração com delegação (razão de 1.34 entre o custo sem e com delegação). A configuração com delegação usou mais tokens aqui porque o Claude Code reverificou as respostas do ISMS Copilot na web em duas das três execuções. Na execução em que não o fez, ele gravou a resposta do ISMS Copilot no arquivo e obteve 20/20 por US$ 0.15.

Onde a delegação não ajuda

O primeiro benchmark executado testou três pequenas tarefas de ISO 27001 que o Claude já conhecia: uma verificação de lacunas em quatro políticas fictícias curtas, um rascunho de política de controle de acesso e entradas de Declaração de Aplicabilidade para 10 controles. Cada tarefa gravou seu entregável em um arquivo, e não foram necessárias consultas. Nenhuma configuração tinha ferramentas web, e as respostas foram verificadas apenas quanto à completude, não quanto à correção.

Tarefa (mediana de 3 execuções)Claude $, sozinhoClaude $, + ISMS CopilotTokens do orquestrador, sozinhoTokens do orquestrador, + ISMS Copilot
Verificação de lacunas0.1630.266143,053495,530
Política de controle de acesso0.1050.218131,748427,071
Entradas da SoA0.1130.182133,516349,717

A delegação usou de 1.6 a 2.1 vezes mais dinheiro do Claude aqui. As execuções com delegação levaram mais turnos (carregando as ferramentas MCP, aguardando a resposta), o Claude Code ainda leu todos os arquivos locais, e o entregável completo voltou pelo Claude Code, que então o gravou no disco. Quando uma tarefa é pequena, o Claude já conhece a resposta e nada precisa ser consultado, mantenha-a no seu agente. Veja o que delegar e o que manter local.

Ressalvas

  • N pequeno. 3 execuções por cenário por configuração, em um dia.
  • Um orquestrador. Apenas Claude Code. As regras de roteamento para Codex, Cursor, OpenCode e Grok estão documentadas, mas esses orquestradores não foram medidos.
  • Um modelo. claude-sonnet-5. Outro modelo ou uma versão posterior do Claude Code pode se comportar de forma diferente.
  • Uma conta. Todas as interações delegadas foram executadas em uma única conta de produção do ISMS Copilot, cujas memórias do lado do servidor podem influenciar as respostas.
  • Dados fictícios. Empresas, políticas e código inventados.
  • Revisão de documentos não testada. O MCP não tem um caminho para upload de documentos. Uma revisão de política de 40 páginas executada na v2 resultou em empate, mas o Claude Code fez a revisão sozinho em ambas as configurações, então isso não diz nada sobre o ISMS Copilot revisar seus documentos.
  • Autor da chave. Os itens foram escritos por um modelo Claude, da mesma família do orquestrador, a partir dos textos oficiais. Os itens reservados foram verificados em relação ao texto oficial antes das execuções.
  • O que é publicado. Esta página contém o método e todos os números principais. As transcrições brutas permanecem privadas: elas contêm identificadores de conversas de produção e saídas literais do modelo. Os prompts das tarefas, a chave de respostas, o avaliador e as saídas avaliadas são mantidos em nosso repositório interno e não são publicados com esta página.

O que afirmamos e o que não afirmamos

Afirmamos:

  • Nos itens testados nos cinco frameworks acima, o Claude Code com ISMS Copilot igualou a precisão do Claude Code pesquisando sozinho com busca na web (empate de precisão em todos os cenários, segundo a regra pré-registrada).
  • Naqueles casos de consultas e perguntas de aconselhamento rápido, gastou menos dinheiro da API do Claude por resposta correta (cerca de metade na execução v3, cerca de três quartos nos itens reservados) e aproximadamente o mesmo em uma sessão longa mista.

Não afirmamos:

  • Que o ISMS Copilot é mais barato que o Claude, ou qualquer porcentagem de economia na sua fatura.
  • Respostas melhores que as do Claude. Os resultados de precisão são empates.
  • Nada sobre frameworks não testados, outros orquestradores ou modelos, ou revisão de documentos.
  • Que a delegação economiza uso do Claude em tarefas pequenas que o Claude já conhece. Custou mais ali.
  • Que os turnos delegados são gratuitos. Eles contam contra o seu plano do ISMS Copilot.

Reexecutamos este benchmark após alterações nas ferramentas MCP ou no conhecimento de frameworks do ISMS Copilot e publicamos os novos números aqui com suas datas. Para o mecanismo por trás desses números, veja O que a delegação economiza (e o que não economiza).

Nesta página