ISMS Copilot Docs

Benchmark: Claude Code met en zonder ISMS Copilot

Hoe we Claude Code alleen hebben vergeleken met Claude Code dat GRC-vragen delegeert aan ISMS Copilot: methode, antwoordsleutel, scoring, resultaten, het geval waarin delegatie niet helpt en de kanttekeningen.

We maten één vraag: wat kost een correct antwoord in Claude-gebruik als Claude Code GRC-werk alleen uitvoert, en wat kost het als Claude Code de vraag via MCP doorgeeft aan ISMS Copilot? Deze pagina beschrijft de methode, alle kopcijfers, de run waarbij delegatie niet hielp en wat de resultaten wel en niet ondersteunen.

Wat dit ondersteunt

Op de geteste items leverde Claude Code met delegatie naar ISMS Copilot dezelfde nauwkeurigheid als Claude Code dat alleen met webzoekopdrachten werkt: de vooraf geregistreerde nauwkeurigheidsbeoordeling was in elk scenario een gelijkspel. Het gaf minder Claude API-kosten per correct antwoord voor opzoeken en snelle adviezen, en ongeveer hetzelfde voor een lange gemengde codesessie met compliance. De geteste frameworks zijn ISO/IEC 27001:2022 Bijlage A, ISO/IEC 42001:2023 Bijlage A, CMMC 2.0 Niveau 2, DORA RTS (EU) 2024/1774 en NIS2 IR (EU) 2024/2690, en alleen deze. Gedelegeerde beurten tellen mee voor je ISMS Copilot-abonnement, wat niet in de dollarcijfers is verwerkt.

Opzet

ItemWaarde
DataAlle runs op 2026-09-28 (UTC)
OrchestratorClaude Code 2.1.283, headless, een verse lege configuratie en werkmap voor elke run
Modelclaude-sonnet-5 in beide opstellingen, vastgezet. Webzoekopdrachten en webfetch gebruiken Claude Haiku 4.5-subaanroepen, en hun kosten zijn inbegrepen.
RunsN=3 per scenario per opstelling, uitgevoerd als gekoppelde paren (beide opstellingen starten hetzelfde scenario tegelijkertijd)
Claude-gebruikClaude API-sleutel, lijstprijzen, zoals gerapporteerd door Claude Code voor elke run
ISMS CopilotDe productie-account MCP, op één ISMS Copilot-account (van ons)

De twee opstellingen krijgen identieke taakprompts, en de prompts vermelden nooit ISMS Copilot:

Claude Code alleenClaude Code + ISMS Copilot
ToolsRead, Glob, Grep, Write, Edit, WebSearch, WebFetchDezelfde, plus de ISMS Copilot-conversatietools (create_conversation, send_message, get_reply)
InstructiesGeenDe gepubliceerde Claude Code-routeringsregel uit GRC-werk delegeren vanaf je agent (2026-09-28), als het projectbestand CLAUDE.md

Beide opstellingen hebben webzoekopdrachten en -fetch, omdat een echte gebruiker deze heeft. De routeringsregel bepaalt wat wordt gedelegeerd. De andere accounttools (bedrijfscontext, werkruimtes, geheugens, documenten) waren niet toegestaan, dus de resultaten zijn niet afhankelijk van een opgeslagen bedrijfsprofiel. De server-side accountgeheugens van ISMS Copilot kunnen wel de antwoorden beïnvloeden.

Scenario's

  • S1, opzoeken. 20 vereistenonderwerpen, en de taak is om de exacte identifier voor elk te geven: 4 DORA RTS-artikelen, 4 NIS2 IR-bijlagepunten, 4 ISO/IEC 42001:2023 Bijlage A-controles, 4 CMMC Level 2-praktijken en 4 ISO/IEC 27001:2022 Bijlage A-controles. Het antwoord is een JSON-bestand.
  • S3, lange sessie. Één Claude Code-sessie met 8 prompts op een kleine Python-repository: 4 codebewerkingen (gecontroleerd door verborgen tests) afgewisseld met 4 GRC-vragen met gesleutelde antwoorden. De GRC-antwoorden worden gescoord; de codecontroles worden apart gerapporteerd.
  • S4, snel advies. 5 ja/nee-vragen, elk met de identifier die het beslist en een eenzinnige reden. Alleen correct als zowel het ja/nee als de identifier overeenkomen.
  • Achtergehouden set. 20 nieuwe items uit DORA RTS en NIS2 IR, in het S1-formaat, die nooit eerder in de antwoordsleutel zaten (zie "Het verhaal" hieronder).

Alle testgegevens zijn fictief. Er zijn geen klantgegevens gebruikt.

Hoe de antwoordsleutel is opgebouwd

Elk gesleuteld item bevat de canonieke identifier, de vereiste in één zin, een citatie en een citaat of verwijzing naar de bron. De sleutel is uitsluitend opgebouwd uit officiële bronnen en nooit uit ISMS Copilot, omdat dat cirkelredenering zou zijn:

  • DORA RTS (EU) 2024/1774 en NIS2 IR (EU) 2024/2690: de officiële tekst van het Publicatiebureau van de EU (CELEX 32024R1774 en 32024R2690), geciteerd met de EUR-Lex-adressen.
  • CMMC 2.0 Level 2: de DoD CMMC Level 2-beoordelingsgids, met de NIST-publicatie waar de praktijknummers vandaan komen.
  • ISO/IEC 27001:2022 Bijlage A: controlenummers en titels uit de eigen lijst van ISO van de norm.
  • ISO/IEC 42001:2023 Bijlage A: controlenummers en titels uit de NIST AI RMF naar ISO/IEC 42001-kruistabel.

De sleutel is bevroren voor de eerste run, en elke run registreert een digest ervan. Deze is niet gewijzigd tijdens de benchmark.

Scoren

Het scoren verloopt mechanisch: geen model beoordeelt antwoorden. Een script leest het identifier-veld van elk antwoord en normaliseert dit per type, waarna het wordt vergeleken met de sleutel:

  • DORA RTS: "Article 7", "Art. 7(4)" en "Article 7(4) of ..." tellen allemaal als Artikel 7.
  • NIS2 IR: het antwoord moet een echt bijlagepunt zijn en moet in de vooraf geregistreerde acceptatielijst van het item staan (het werkzame punt en de bijbehorende kop). Een broederpunt is fout.
  • ISO/IEC 27001:2022 en ISO/IEC 42001:2023: het Bijlage A-nummer moet exact overeenkomen. Nummering uit 2013 of een Bijlage B-verwijzing voor 42001 is fout.
  • CMMC Level 2: het praktijknummer moet overeenkomen ("SC.L2-3.13.11" en "3.13.11" tellen allebei).

Een ontbrekend bestand, ongeldige JSON of een onleesbare identifier telt als fout. Runs die een limiet raakten, zouden zijn gescoord zoals ze waren en niet opnieuw zijn uitgevoerd.

Metriek

De primaire metriek is Claude API-dollars per correct antwoord: de Claude-kosten van de 3 runs van een scenario, gedeeld door het aantal correcte antwoorden over die 3 runs. Dit is de lijstprijs die Claude Code rapporteert, wat een Claude-abonnee betaalt voor extra gebruik boven het abonnement. Hierin zijn de webzoek-subaanroepen en zoekkosten inbegrepen.

Het gebruik van ISMS Copilot-abonnementen is niet in deze cijfers verwerkt, en het is niet gratis. Gedelegeerde beurten tellen mee voor je ISMS Copilot-abonnement (zie Waar ISMS Copilot-gebruik in rekening wordt gebracht). Door dit weg te laten, bevoordeelt dit de opstelling met delegatie op deze metriek.

Nauwkeurigheid, orchestrator-tokens, beurten en tijd worden ernaast gerapporteerd. Tokens en dollars verschillen: herhaaldelijk gelezen context uit de promptcache wordt gefactureerd tegen een fractie van de inputprijs, dus een opstelling kan meer tokens gebruiken en toch minder dollars kosten.

Voorafgaande registratie en de geregistreerde wijziging

Het ontwerp, de antwoordsleutel, de scorer en de winstregels zijn vastgelegd voordat er runs zijn uitgevoerd, met de toezegging om de resultaten te publiceren, wat deze ook zouden tonen. De vooraf geregistreerde winstregels: nauwkeurigheid wint bij 10 procentpunten of meer, dollars per correct antwoord bij 1.25 keer of meer; alles wat dichterbij ligt, is een gelijkspel. De v3-herhaling en de controle met achtergehouden items zijn elk op dezelfde manier vooraf geregistreerd voor hun eerste run.

Één wijziging is aangebracht tijdens de eerste run (v2). Een limiet van 2 miljoen orchestrator-tokens per run, bedoeld als beveiliging tegen weglopen, stopte de benchmark na het eerste paar, toen Claude Code alleen een opzoekrun normaal afrondde op 2.38 miljoen tokens (alle 20 correct). De limiet is verhoogd naar 6 miljoen voor beide opstellingen; de wijziging is geregistreerd met tijdstempel, en niets is opnieuw uitgevoerd. Deze is aangebracht nadat het eerste resultaat was waargenomen. Zonder deze wijziging zou geen scenario een oordeel hebben. Dollar-limieten en het totale uitgavenplafond zijn niet gewijzigd.

Het verhaal: v2, de fix, v3 en de controle met achtergehouden items

v2 vond een kennisleemte. In de eerste eerlijke run evenaarde ISMS Copilot Claude Code alleen op elk ISO/IEC 27001-, ISO/IEC 42001- en CMMC-item, maar miste de meeste DORA RTS-artikelnummers en NIS2 IR-bijlagepunten. Zijn antwoorden markeerden die identifiers als onbevestigd.

v2-nauwkeurigheidClaude Code alleenClaude Code + ISMS Copilot
S1 opzoeken60/6037/60
S3 lange sessie12/129/12
S4 snelle adviezen15/159/15

De fix. We voegden DORA RTS- en NIS2 IR-kennis toe aan ISMS Copilot op artikelniveau en bijlagepuntniveau, opgebouwd uit de officiële EU-teksten, en voegden een regel toe aan de routeringsregel: verifieer elk antwoord dat ISMS Copilot als onbevestigd markeert. Vervolgens voerden we dezelfde scenario’s opnieuw uit met dezelfde sleutel en scorer.

v3 (zelfde sleutel, dezelfde scorer, beide opstellingen opnieuw uitgevoerd):

ScenarioOpstellingCorrectNauwkeurigheidClaude $ (3 runs)Claude $ per correctMediaan orchestrator-tokens per run
S1 opzoekenAlleen60/60100%6.920.1153,194,935
S1 opzoeken+ ISMS Copilot60/60100%3.180.0531,337,252
S3 lange sessieAlleen12/12100%1.650.1381,537,697
S3 lange sessie+ ISMS Copilot12/12100%1.750.1461,742,489
S4 snelle adviezenAlleen15/15100%0.890.059501,237
S4 snelle adviezen+ ISMS Copilot15/15100%0.390.026255,659

Vooraf geregistreerde oordelen: de nauwkeurigheid is gelijk in alle drie de scenario’s. Dollars per correct antwoord bevoordelen de delegerende opstelling bij S1 en S4, en S3 is een gelijkspel. Bij S3 zijn alle codecontroles in beide opstellingen geslaagd.

De winst kwam door de eigen antwoorden van ISMS Copilot. Een diagnostische test die na de runs werd toegevoegd (geen oordeel gekoppeld) vond dat de antwoorden de juiste DORA RTS- en NIS2 IR-identifier droegen bij 24 van de 24 S1-items voordat Claude Code een webcheck uitvoerde. Geen v3-antwoord markeerde een identifier als onbevestigd, dus de nieuwe verificatieregel werd niet toegepast. Claude Code controleerde in S1 en S3 toch nog op het web zonder dat dit werd gevraagd, wat geen antwoord veranderde maar de kosten van de delegerende opstelling verhoogde.

De controle met achtergehouden items (20 nieuwe items). Omdat de kennisfix was afgebakend op basis van de missers in v2, hebben we gecontroleerd op "leren voor de test": 10 DORA RTS-artikelen en 10 NIS2 IR-bijlagepunten die de sleutel nooit bevatte, opgebouwd uit de officiële teksten op dezelfde manier, in het S1-formaat.

Achtergehouden setOpstellingCorrectNauwkeurigheidClaude $ (3 runs)Claude $ per correctMediaan orchestrator-tokens per run
20 nieuwe DORA RTS- en NIS2 IR-itemsAlleen58/6096.7%4.010.0691,974,985
20 nieuwe DORA RTS- en NIS2 IR-items+ ISMS Copilot60/60100%3.100.0522,258,506

Vooraf geregistreerde oordelen: de nauwkeurigheid is een gelijkspel (het verschil is minder dan 10 punten), en dollars per correct antwoord bevoordelen de delegerende opstelling (1.34 keer). De delegerende opstelling gebruikte hier meer tokens omdat Claude Code de antwoorden van ISMS Copilot in twee van de drie runs opnieuw op het web controleerde. In de run waarin dit niet gebeurde, schreef Claude Code het antwoord van ISMS Copilot naar het bestand en scoorde 20 van de 20 voor $0.15.

Waar delegatie niet helpt

De eerste benchmark die we uitvoerden, testte drie kleine ISO 27001-taken die Claude al kent: een gap-check van vier korte fictieve beleidsdocumenten, een ontwerp voor een toegangcontrolebeleid en SoA-vermeldingen voor 10 controls. Elke taak schreef zijn leverbaar item naar een bestand, en er waren geen opzoeken nodig. Geen van beide opstellingen had webtools, en antwoorden werden alleen gecontroleerd op volledigheid, niet op juistheid.

Taak (mediaan van 3 runs)Claude $, alleenClaude $, + ISMS CopilotOrchestrator-tokens, alleenOrchestrator-tokens, + ISMS Copilot
Gap check0.1630.266143,053495,530
Toegangcontrolebeleid0.1050.218131,748427,071
SoA-vermeldingen0.1130.182133,516349,717

Delegatie gebruikte hier 1.6 tot 2.1 keer meer Claude-geld. De delegerende runs duurden langer (laden van de MCP-tools, wachten op het antwoord), Claude Code las toch elk lokaal bestand, en het volledige leverbare item kwam terug via Claude Code, dat het vervolgens naar de schijf schreef. Als een taak klein is, Claude het antwoord al weet en er niets hoeft te worden opgezocht, houd het dan in je agent. Zie wat je moet delegeren en wat lokaal moet blijven.

Kanttekeningen

  • Klein N. 3 runs per scenario per opstelling, op één dag.
  • Één orchestrator. Alleen Claude Code. Routeringsregels voor Codex, Cursor, OpenCode en Grok zijn gedocumenteerd, maar die orchestrators zijn niet gemeten.
  • Één model. claude-sonnet-5. Een ander model of een latere versie van Claude Code kan zich anders gedragen.
  • Één account. Alle gedelegeerde beurten liepen op één productie-ISMS Copilot-account, waarvan de server-side geheugens antwoorden kunnen beïnvloeden.
  • Fictieve testgegevens. Verzonnen bedrijven, beleidsdocumenten en code.
  • Documentreview niet getest. De MCP heeft geen uploadpad voor documenten. Een review van een beleid van 40 pagina’s liep in v2 en was een gelijkspel, maar Claude Code voerde de review zelf uit in beide opstellingen, dus dit zegt niets over ISMS Copilot die jouw documenten reviewt.
  • Auteur van de sleutel. De items zijn geschreven door een Claude-model, uit dezelfde familie als de orchestrator, op basis van de officiële teksten. De achtergehouden items zijn gecontroleerd tegen de officiële tekst voordat de runs werden uitgevoerd.
  • Wat gepubliceerd is. Deze pagina bevat de methode en alle kopcijfers. De ruwe transcripties blijven privé: ze bevatten productiegespreks-ID’s en letterlijke modeluitvoer. De taakprompts, antwoordsleutel, scorer en gescoorde uitvoeren worden bewaard in onze interne repository en worden niet met deze pagina gepubliceerd.

Wat we beweren en wat niet

We beweren:

  • Dat Claude Code met ISMS Copilot op de geteste items in de vijf hierboven genoemde frameworks dezelfde nauwkeurigheid behaalde als Claude Code dat alleen met websearch werkte (een gelijkspel in nauwkeurigheid in elk scenario, volgens de vooraf geregistreerde regel).
  • Dat het voor die opzoeken en snelle-adviesvragen minder Claude API-geld per correct antwoord uitgaf (ongeveer de helft in de v3-run, ongeveer driekwart op de achtergehouden items), en ongeveer hetzelfde in een lange gemengde sessie.

We beweren niet:

  • Dat ISMS Copilot goedkoper is dan Claude, of een percentage besparing op je rekening.
  • Betere antwoorden dan Claude. De nauwkeurigheidsresultaten zijn gelijkspelen.
  • Iets over frameworks die we niet hebben getest, andere orchestrators of modellen, of documentreview.
  • Dat delegatie Claude-gebruik bespaart bij kleine taken die Claude al kent. Het kostte daar juist meer.
  • Dat gedelegeerde beurten gratis zijn. Ze tellen mee voor je ISMS Copilot-abonnement.

We voeren deze benchmark opnieuw uit na wijzigingen in de MCP-tools of in de frameworkkennis van ISMS Copilot, en publiceren de nieuwe cijfers hier met de bijbehorende datum. Voor het mechanisme achter deze cijfers, zie Wat delegatie bespaart (en wat niet).

Op deze pagina