ISMS Copilot Docs

Benchmark: Claude Code con e senza ISMS Copilot

Come abbiamo misurato Claude Code che lavora autonomamente rispetto a Claude Code che delega le domande GRC a ISMS Copilot: metodo, chiave delle risposte, punteggio, risultati, il caso in cui la delega non aiuta e le limitazioni.

Abbiamo misurato una domanda: quando si lavora su GRC in Claude Code, quanto costa una risposta corretta in termini di utilizzo di Claude se Claude Code la ricerca autonomamente e quanto costa se Claude Code affida la domanda a ISMS Copilot tramite MCP. Questa pagina descrive il metodo, tutti i dati principali, l’esecuzione in cui la delega non ha aiutato e cosa i risultati supportano e cosa no.

Cosa supporta questo studio

Negli elementi testati, Claude Code che delega a ISMS Copilot ha eguagliato l’accuratezza di Claude Code che ricerca autonomamente con la ricerca web: il verdetto pre-registrato sull’accuratezza è stato un pareggio in ogni scenario. Ha speso meno in termini di costo API di Claude per ogni risposta corretta su ricerche e consigli rapidi e circa la stessa somma per una sessione lunga mista di coding e compliance. I framework testati sono ISO/IEC 27001:2022 Allegato A, ISO/IEC 42001:2023 Allegato A, CMMC 2.0 Livello 2, DORA RTS (UE) 2024/1774 e NIS2 IR (UE) 2024/2690, e solo questi. I turni delegati vengono conteggiati nel piano ISMS Copilot, che non è incluso nelle cifre in dollari.

Configurazione

ElementoValore
DateTutte le esecuzioni il 2026-09-28 (UTC)
OrchestratoreClaude Code 2.1.283, headless, una nuova configurazione vuota e una cartella di lavoro vuota per ogni esecuzione
Modelloclaude-sonnet-5 in entrambe le configurazioni, bloccato. La ricerca web e il recupero web eseguono sottocall di Claude Haiku 4.5, e il loro costo è incluso.
EsecuzioniN=3 per scenario per configurazione, eseguite come coppie abbinate (entrambe le configurazioni iniziano lo stesso scenario nello stesso momento)
Utilizzo di ClaudeChiave API di Claude, prezzi di listino, come riportato da Claude Code per ogni esecuzione
ISMS CopilotL’MCP dell’account di produzione, su un account ISMS Copilot (il nostro)

Le due configurazioni ricevono prompt di compito identici e i prompt non menzionano mai ISMS Copilot:

Solo Claude CodeClaude Code + ISMS Copilot
StrumentiRead, Glob, Grep, Write, Edit, WebSearch, WebFetchGli stessi, più gli strumenti di conversazione di ISMS Copilot (create_conversation, send_message, get_reply)
IstruzioniNessunaLa regola di instradamento pubblicata di Claude Code da Delega il lavoro GRC dal tuo agent (2026-09-28), come file CLAUDE.md del progetto

Entrambe le configurazioni hanno ricerca e recupero web, perché un utente reale li utilizza. La regola di instradamento decide cosa viene delegato. Gli altri strumenti dell’account (contesto aziendale, workspace, memorie, documenti) non erano consentiti, quindi i risultati non dipendono da un profilo aziendale memorizzato. Le memorie lato server dell’account di ISMS Copilot potrebbero comunque influenzare le sue risposte.

Scenari

  • S1, ricerche. 20 temi di requisiti; il compito è fornire l’identificatore esatto per ciascuno: 4 articoli DORA RTS, 4 punti dell’allegato NIS2 IR, 4 controlli dell’Allegato A ISO/IEC 42001:2023, 4 pratiche CMMC Level 2 e 4 controlli dell’Allegato A ISO/IEC 27001:2022. La risposta è un file JSON.
  • S3, sessione lunga. Una sessione Claude Code con 8 prompt su un piccolo repository Python: 4 modifiche al codice (verificate da test nascosti) alternate a 4 domande GRC con risposte chiave. Le risposte GRC vengono valutate; i controlli del codice vengono riportati separatamente.
  • S4, consigli rapidi. 5 domande sì/no, ciascuna con l’identificatore che la decide e una motivazione in una frase. Corretta solo se sia il sì/no sia l’identificatore corrispondono.
  • Dati non utilizzati. 20 nuovi elementi da DORA RTS e NIS2 IR, nel formato S1, mai presenti prima nella chiave delle risposte (vedi "La storia" sotto).

Tutti i dati di test sono fittizi. Nessun dato cliente è stato utilizzato.

Come è stata costruita la chiave delle risposte

Ogni elemento chiave contiene l’identificatore canonico, il requisito in una frase, una citazione e un riferimento o citazione dalla fonte. La chiave è stata costruita solo da fonti ufficiali, mai da ISMS Copilot, perché sarebbe stato circolare:

  • DORA RTS (EU) 2024/1774 e NIS2 IR (EU) 2024/2690: il testo ufficiale dall’Ufficio delle pubblicazioni dell’UE (CELEX 32024R1774 e 32024R2690), citato agli indirizzi EUR-Lex.
  • CMMC 2.0 Level 2: la Guida di valutazione CMMC Level 2 del DoD, con la pubblicazione NIST da cui provengono i numeri delle pratiche.
  • ISO/IEC 27001:2022 Allegato A: numeri e titoli dei controlli dall’elenco ufficiale ISO dello standard.
  • ISO/IEC 42001:2023 Allegato A: numeri e titoli dei controlli dalla mappatura NIST AI RMF a ISO/IEC 42001.

La chiave è stata bloccata prima della prima esecuzione e ogni esecuzione ne registra un digest. Non è stata modificata durante il benchmark.

Valutazione

La valutazione è meccanica: nessun modello giudica alcuna risposta. Uno script legge il campo identificatore di ogni risposta, lo normalizza in base al tipo e poi lo confronta con la chiave:

  • DORA RTS: "Articolo 7", "Art. 7(4)" e "Articolo 7(4) di..." contano tutti come Articolo 7.
  • NIS2 IR: la risposta deve essere un punto reale dell’allegato e deve essere nell’elenco di accettazione pre-registrato dell’elemento (il punto operativo e la sua intestazione). Un punto fratello è sbagliato.
  • ISO/IEC 27001:2022 e ISO/IEC 42001:2023: il numero dell’Allegato A deve corrispondere esattamente. La numerazione 2013 o un riferimento all’Allegato B per 42001 è sbagliato.
  • CMMC Level 2: il numero della pratica deve corrispondere ("SC.L2-3.13.11" e "3.13.11" contano entrambi).

Un file mancante, un JSON non valido o un identificatore non analizzabile conta come sbagliato. Le esecuzioni che hanno raggiunto un limite sarebbero state valutate così come erano, senza essere rieseguite.

Metrica

La metrica principale è dollari API di Claude per risposta corretta: il costo di Claude delle 3 esecuzioni di uno scenario diviso per le risposte corrette in quelle 3 esecuzioni. È il prezzo di listino che Claude Code riporta, cioè quanto paga un abbonato Claude per l’utilizzo extra oltre il piano. Include le sottocall di ricerca web e le relative commissioni.

L’utilizzo del piano ISMS Copilot non è compreso in questa cifra e non è gratuito. I turni delegati vengono addebitati sul piano ISMS Copilot (vedi Dove viene fatturato l’utilizzo di ISMS Copilot). Escluderlo avvantaggia la configurazione con delega su questa metrica.

Vengono riportati anche accuratezza, token dell’orchestratore, turni e tempo. Token e dollari differiscono: la lettura ripetuta del contesto dalla cache dei prompt viene fatturata a una frazione del prezzo di input, quindi una configurazione può usare più token e costare comunque meno in dollari.

Pre-registrazione e modifica registrata

Design, chiave delle risposte, valutatore e regole di vittoria sono stati confermati prima di qualsiasi esecuzione, con l’impegno di pubblicare i risultati indipendentemente da ciò che avrebbero mostrato. Le regole di vittoria pre-registrate: l’accuratezza vince con 10 punti percentuali o più, i dollari per risposta corretta con 1.25 volte o più; tutto ciò che è più vicino è un pareggio. La riesecuzione v3 e il controllo su dati non utilizzati in fase di addestramento sono stati ciascuno pre-registrati allo stesso modo prima della loro prima esecuzione.

Una modifica è stata apportata durante la prima esecuzione (v2). Un limite per esecuzione di 2 milioni di token dell’orchestratore, pensato come protezione contro esecuzioni incontrollate, ha interrotto il benchmark dopo la prima coppia, quando Claude Code da solo ha completato un’esecuzione di ricerca normalmente a 2.38 milioni di token (tutte e 20 corrette). Il limite è stato innalzato a 6 milioni per entrambe le configurazioni, la modifica è stata registrata con il suo orario e nulla è stato rieseguito. È stata fatta dopo che quel primo risultato era stato visto. Senza di essa, nessun scenario avrebbe avuto un verdetto. I limiti in dollari e il tetto di spesa complessivo non sono cambiati.

La storia: v2, la correzione, v3 e il controllo su dati non utilizzati

v2 ha evidenziato una lacuna di conoscenza. Nel primo test equo, ISMS Copilot ha eguagliato Claude Code da solo su ogni elemento di ISO/IEC 27001, ISO/IEC 42001 e CMMC, ma ha perso la maggior parte dei numeri degli articoli del DORA RTS e dei punti dell’allegato NIS2 IR. Le sue risposte hanno contrassegnato quegli identificatori come non confermati.

Accuratezza v2Solo Claude CodeClaude Code + ISMS Copilot
Ricerche S160/6037/60
Sessione lunga S312/129/12
Consigli rapidi S415/159/15

La correzione. Abbiamo aggiunto a ISMS Copilot la conoscenza di DORA RTS e NIS2 IR a livello di articolo e punto di allegato, costruita a partire dai testi ufficiali dell’UE, e abbiamo aggiunto una riga alla regola di instradamento: verifica qualsiasi risposta che ISMS Copilot contrassegna come non confermata. Poi abbiamo rieseguito gli stessi scenari con la stessa chiave e lo stesso valutatore.

v3 (stessa chiave, stesso valutatore, entrambe le configurazioni rieseguite):

ScenarioConfigurazioneCorretteAccuratezzaCosto Claude $ (3 esecuzioni)Costo Claude $ per risposta correttaToken mediani dell’orchestratore per esecuzione
Ricerche S1Solo60/60100%6.920.1153,194,935
Ricerche S1+ ISMS Copilot60/60100%3.180.0531,337,252
Sessione lunga S3Solo12/12100%1.650.1381,537,697
Sessione lunga S3+ ISMS Copilot12/12100%1.750.1461,742,489
Consigli rapidi S4Solo15/15100%0.890.059501,237
Consigli rapidi S4+ ISMS Copilot15/15100%0.390.026255,659

Verdetti pre-registrati: l’accuratezza è un pareggio in tutti e tre gli scenari. Il costo per risposta corretta favorisce la configurazione con delega in S1 e S4, mentre S3 è un pareggio. In S3, tutti i controlli del codice sono passati in entrambe le configurazioni.

Il guadagno è venuto dalle risposte di ISMS Copilot stesso. Una diagnostica aggiunta dopo le esecuzioni (senza verdetto associato) ha rilevato che le sue risposte riportavano l’identificatore corretto di DORA RTS e NIS2 IR su 24 elementi S1 su 24 prima di qualsiasi controllo web da parte di Claude Code. Nessuna risposta di v3 ha contrassegnato un identificatore come non confermato, quindi la nuova riga di verifica non è stata esercitata. Claude Code ha comunque eseguito un doppio controllo sul web in S1 e S3 senza essere richiesto, il che non ha modificato alcuna risposta ma ha aumentato il costo della configurazione con delega.

Controllo su dati non utilizzati (20 nuovi elementi). Poiché la correzione della conoscenza era limitata alle lacune di v2, abbiamo verificato l’addestramento specifico per il test: 10 articoli DORA RTS e 10 punti dell’allegato NIS2 IR che la chiave non conteneva mai, costruiti a partire dai testi ufficiali nello stesso modo, nel formato S1.

Controllo su dati non utilizzatiConfigurazioneCorretteAccuratezzaCosto Claude $ (3 esecuzioni)Costo Claude $ per risposta correttaToken mediani dell’orchestratore per esecuzione
20 nuovi elementi DORA RTS e NIS2 IRSolo58/6096.7%4.010.0691,974,985
20 nuovi elementi DORA RTS e NIS2 IR+ ISMS Copilot60/60100%3.100.0522,258,506

Verdetti pre-registrati: l’accuratezza è un pareggio (la differenza è inferiore a 10 punti) e il costo per risposta corretta favorisce la configurazione con delega (1.34 volte). La configurazione con delega ha utilizzato più token in questo caso perché Claude Code ha ricontrollato le risposte di ISMS Copilot sul web in due delle tre esecuzioni. Nell’esecuzione in cui non lo ha fatto, ha scritto la risposta di ISMS Copilot nel file e ha ottenuto 20/20 con 0.15 $.

Dove la delega non aiuta

Il primo benchmark eseguito ha testato tre piccoli compiti ISO 27001 che Claude già conosce: un controllo delle lacune su quattro brevi politiche fittizie, una bozza di politica di controllo degli accessi e voci della Dichiarazione di Applicabilità per 10 controlli. Ogni compito ha scritto il proprio deliverable in un file e non erano necessarie ricerche. Nessuna configurazione aveva strumenti web e le risposte sono state verificate solo per completezza, non per correttezza.

Compito (mediana di 3 esecuzioni)Costo Claude $, soloCosto Claude $, + ISMS CopilotToken orchestratore, soloToken orchestratore, + ISMS Copilot
Controllo delle lacune0.1630.266143,053495,530
Politica di controllo degli accessi0.1050.218131,748427,071
Voci SoA0.1130.182133,516349,717

La delega ha utilizzato da 1.6 a 2.1 volte più denaro di Claude in questo caso. Le esecuzioni con delega hanno richiesto più turni (caricamento degli strumenti MCP, attesa della risposta); Claude Code ha comunque letto ogni file locale e il deliverable completo è tornato attraverso Claude Code, che poi lo ha scritto su disco. Quando un compito è piccolo, Claude già conosce la risposta e non è necessario cercare nulla, mantienilo nel tuo agente. Vedi cosa delegare e cosa mantenere locale.

Avvertenze

  • N piccolo. 3 esecuzioni per scenario per configurazione, in un solo giorno.
  • Un solo orchestratore. Solo Claude Code. Le regole di instradamento per Codex, Cursor, OpenCode e Grok sono documentate, ma quegli orchestatori non sono stati misurati.
  • Un solo modello. claude-sonnet-5. Un altro modello o una versione successiva di Claude Code potrebbe comportarsi diversamente.
  • Un solo account. Tutti i turni delegati sono stati eseguiti su un account di produzione ISMS Copilot, le cui memorie lato server potrebbero influenzare le risposte.
  • Elementi fittizi. Aziende, politiche e codice inventati.
  • Revisione documenti non testata. L’MCP non ha un percorso di caricamento documenti. Una revisione di una politica di 40 pagine è stata eseguita in v2 e ha pareggiato, ma Claude Code ha effettuato la revisione da solo in entrambe le configurazioni, quindi non dice nulla sulla capacità di ISMS Copilot di revisionare i tuoi documenti.
  • Autore della chiave. Gli elementi sono stati scritti da un modello Claude, della stessa famiglia dell’orchestratore, a partire dai testi ufficiali. Gli elementi del test di verifica sono stati controllati rispetto al testo ufficiale prima delle esecuzioni.
  • Cosa viene pubblicato. Questa pagina riporta il metodo e tutti i numeri principali. Le trascrizioni grezze rimangono private: contengono identificatori di conversazione di produzione e output verbali dei modelli. I prompt dei compiti, la chiave delle risposte, il valutatore e gli output valutati sono conservati nel nostro repository interno e non vengono pubblicati con questa pagina.

Cosa affermiamo e cosa non affermiamo

Affermiamo che:

  • Sugli elementi testati nei cinque framework sopra citati, Claude Code con ISMS Copilot ha eguagliato l’accuratezza di Claude Code che effettua ricerche da solo con ricerca web (un pareggio di accuratezza in ogni scenario, secondo la regola pre-registrata).
  • Su quelle ricerche e domande di consigli rapidi, ha speso meno denaro dell’API Claude per risposta corretta (circa la metà nell’esecuzione v3, circa tre quarti sugli elementi di verifica) e circa la stessa quantità in una sessione mista lunga.

Non affermiamo che:

  • ISMS Copilot sia più economico di Claude o che ci sia un risparmio percentuale sulla tua fattura.
  • Le risposte di ISMS Copilot siano migliori di quelle di Claude. I risultati di accuratezza sono pareggi.
  • Qualcosa sui framework che non abbiamo testato, su altri orchestatori o modelli, o sulla revisione dei documenti.
  • Che la delega risparmi l’utilizzo di Claude nei piccoli compiti che Claude già conosce. In quei casi, è costato di più.
  • Che i turni delegati siano gratuiti. Contano contro il tuo piano ISMS Copilot.

Rieseguiamo questo benchmark dopo modifiche agli strumenti MCP o alle conoscenze dei framework di ISMS Copilot e pubblichiamo i nuovi numeri qui con la loro data. Per il meccanismo dietro questi numeri, vedi Cosa risparmia la delega (e cosa no).

In questa pagina