ISMS Copilot Docs

Benchmark: Claude Code mit und ohne ISMS Copilot

Wie wir Claude Code allein im Vergleich zu Claude Code mit Delegierung von GRC-Fragen an ISMS Copilot gemessen haben: Methode, Lösungsschlüssel, Bewertung, Ergebnisse, der Fall, in dem Delegierung nicht hilft, und die Einschränkungen.

Wir haben eine Frage untersucht: Was kostet eine korrekte Antwort in Bezug auf die Claude-Nutzung, wenn GRC-Arbeiten in Claude Code durchgeführt werden – einmal, wenn Claude Code die Recherche allein mit Websuche durchführt, und einmal, wenn Claude Code die Frage über MCP an ISMS Copilot delegiert? Diese Seite beschreibt die Methode, alle Hauptkennzahlen, den Durchlauf, bei dem die Delegierung nicht half, sowie die Aussagen, die sich aus den Ergebnissen ableiten lassen und die nicht unterstützt werden.

Was damit belegt wird

Bei den getesteten Elementen erreichte Claude Code durch die Delegierung an ISMS Copilot die gleiche Genauigkeit wie bei der alleinigen Recherche mit Websuche: Das vorab festgelegte Genauigkeitsurteil war in jedem Szenario ein Unentschieden. Es wurden weniger Claude-API-Kosten pro korrekter Antwort für Nachschlageaufgaben und schnelle Beratung verbraucht, und etwa die gleichen Kosten für eine lange, gemischte Codier- und Compliance-Sitzung. Die getesteten Frameworks sind ISO/IEC 27001:2022 Anhang A, ISO/IEC 42001:2023 Anhang A, CMMC 2.0 Level 2, DORA RTS (EU) 2024/1774 und NIS2 IR (EU) 2024/2690 – und nur diese. Delegierte Anfragen werden gegen Ihr ISMS Copilot-Kontingent verbucht, was nicht in den Dollar-Beträgen enthalten ist.

Aufbau

ElementWert
DatumAlle Durchläufe am 2026-09-28 (UTC)
OrchestratorClaude Code 2.1.283, headless, eine frische, leere Konfiguration und ein neues Arbeitsverzeichnis für jeden Durchlauf
Modellclaude-sonnet-5 in beiden Setups, festgepinnt. Websuche und Webabruf nutzen Claude Haiku 4.5-Unteraufrufe, deren Kosten sind enthalten.
DurchläufeN=3 pro Szenario pro Setup, als gepaarte Durchläufe (beide Setups starten dasselbe Szenario zur gleichen Zeit)
Claude-NutzungClaude-API-Schlüssel, Listenpreise, wie von Claude Code für jeden Durchlauf gemeldet
ISMS CopilotDas Produktionskonto-MCP auf einem ISMS Copilot-Konto (unseres)

Beide Setups erhalten identische Aufgabenstellungen, und die Aufgabenstellungen erwähnen niemals ISMS Copilot:

Claude Code alleinClaude Code + ISMS Copilot
ToolsRead, Glob, Grep, Write, Edit, WebSearch, WebFetchDieselben, plus die ISMS Copilot-Konversations-Tools (create_conversation, send_message, get_reply)
AnweisungenKeineDie veröffentlichte Claude Code-Weiterleitungsregel aus GRC-Arbeit an ISMS Copilot delegieren (2026-09-28), als Projekt-CLAUDE.md

Beide Setups verfügen über Websuche und -abruf, da ein echter Nutzer diese ebenfalls hat. Die Weiterleitungsregel entscheidet, was delegiert wird. Die anderen Kontotools (Unternehmenskontext, Arbeitsbereiche, Speicher, Dokumente) waren nicht erlaubt, sodass die Ergebnisse nicht von einem gespeicherten Unternehmensprofil abhängen. Die serverseitigen Kontospeicher von ISMS Copilot könnten dennoch dessen Antworten beeinflussen.

Szenarien

  • S1, Nachschlagen. 20 Anforderungsthemen, wobei die Aufgabe darin besteht, den exakten Bezeichner für jedes Thema zu nennen: 4 Artikel aus DORA RTS, 4 Punkte aus dem NIS2-IR-Anhang, 4 Kontrollen aus ISO/IEC 42001:2023 Anhang A, 4 Praktiken aus CMMC Level 2 und 4 Kontrollen aus ISO/IEC 27001:2022 Anhang A. Die Antwort ist eine JSON-Datei.
  • S3, lange Sitzung. Eine Claude Code-Sitzung mit 8 Prompts in einem kleinen Python-Repository: 4 Codebearbeitungen (durch versteckte Tests überprüft), abwechselnd mit 4 GRC-Fragen mit schlüsselbasierten Antworten. Die GRC-Antworten werden bewertet; die Codeprüfungen werden separat gemeldet.
  • S4, schnelle Beratung. 5 Ja/Nein-Fragen, jeweils mit dem Bezeichner, der die Antwort entscheidet, und einem ein-Satz-Grund. Nur korrekt, wenn sowohl die Ja/Nein-Antwort als auch der Bezeichner übereinstimmen.
  • Held-out. 20 neue Elemente aus DORA RTS und NIS2 IR im S1-Format, die vorher nie im Antwortschlüssel enthalten waren (siehe „Die Geschichte“ weiter unten).

Alle Testdaten sind fiktiv. Es wurden keine Kundendaten verwendet.

Erstellung des Antwortschlüssels

Jedes Element im Schlüssel enthält den kanonischen Bezeichner, die Anforderung in einem Satz, eine Quellenangabe sowie ein Zitat oder einen Verweis auf die Quelle. Der Schlüssel wurde ausschließlich aus offiziellen Quellen erstellt und niemals aus ISMS Copilot, da dies zirkulär wäre:

  • DORA RTS (EU) 2024/1774 und NIS2 IR (EU) 2024/2690: der offizielle Text vom Amt für Veröffentlichungen der Europäischen Union (CELEX 32024R1774 und 32024R2690), zitiert nach den EUR-Lex-Adressen.
  • CMMC 2.0 Level 2: der DoD-CMMC-Level-2-Bewertungsleitfaden mit der NIST-Publikation, aus der die Praktikennummern stammen.
  • ISO/IEC 27001:2022 Anhang A: Kontrollnummern und -titel aus der offiziellen ISO-Liste des Standards.
  • ISO/IEC 42001:2023 Anhang A: Kontrollnummern und -titel aus der NIST-AI-RMF-zu-ISO/IEC-42001-Übersichtstabelle.

Der Schlüssel wurde vor dem ersten Durchlauf festgeschrieben, und jeder Durchlauf zeichnet einen Hash-Wert davon auf. Er wurde während des Benchmarks nicht geändert.

Bewertung

Die Bewertung erfolgt mechanisch: Kein Modell bewertet eine Antwort. Ein Skript liest das Bezeichnerfeld jeder Antwort, normalisiert es nach Typ und vergleicht es mit dem Schlüssel:

  • DORA RTS: „Article 7“, „Art. 7(4)“ und „Article 7(4) of ...“ zählen alle als Artikel 7.
  • NIS2 IR: Die Antwort muss ein tatsächlicher Anhangspunkt sein und in der vorab registrierten Akzeptanzliste des Elements enthalten sein (der operative Punkt und seine Überschrift). Ein Geschwisterpunkt ist falsch.
  • ISO/IEC 27001:2022 und ISO/IEC 42001:2023: Die Anhang-A-Nummer muss exakt übereinstimmen. Die Nummerierung von 2013 oder ein Anhang-B-Verweis für 42001 ist falsch.
  • CMMC Level 2: Die Praktikennummer muss übereinstimmen („SC.L2-3.13.11“ und „3.13.11“ zählen beide).

Eine fehlende Datei, ungültiges JSON oder ein nicht parsebarer Bezeichner zählt als falsch. Durchläufe, die ein Limit erreicht hätten, wären so bewertet worden, wie sie waren, und nicht wiederholt worden.

Metrik

Die primäre Metrik ist Claude-API-Dollar pro korrekter Antwort: die Claude-Kosten der 3 Durchläufe eines Szenarios geteilt durch die korrekten Antworten in diesen 3 Durchläufen. Es handelt sich um den Listenpreis, den Claude Code meldet – also den Preis, den ein Claude-Abonnent für zusätzliche Nutzung über das Kontingent hinaus zahlt. Dazu gehören die Unteraufrufe für die Websuche und die Suchgebühren.

Die Nutzung des ISMS Copilot-Kontingents ist nicht in dieser Zahl enthalten, und sie ist nicht kostenlos. Delegierte Anfragen werden gegen Ihr ISMS Copilot-Kontingent verbucht (siehe Wo die ISMS Copilot-Nutzung abgerechnet wird). Dass sie hier nicht berücksichtigt wird, begünstigt das delegierende Setup bei dieser Metrik.

Genauigkeit, Orchestrator-Tokens, Anfragen und Zeit werden zusätzlich gemeldet. Tokens und Dollar unterscheiden sich: Wiederholt gelesener Kontext aus dem Prompt-Cache wird mit einem Bruchteil des Eingabepreises abgerechnet, sodass ein Setup mehr Tokens verwenden kann und trotzdem weniger Dollar kostet.

Vorabregistrierung und das protokollierte Amendment

Design, Antwortschlüssel, Bewertungsskript und Gewinnregeln wurden vor jedem Durchlauf festgeschrieben, mit dem Versprechen, die Ergebnisse unabhängig vom Ergebnis zu veröffentlichen. Die vorab registrierten Gewinnregeln: Genauigkeit gewinnt bei 10 oder mehr Prozentpunkten Unterschied, Dollar pro korrekter Antwort bei dem 1.25-fachen oder mehr; alles, was näher beieinander liegt, gilt als Unentschieden. Der v3-Wiederholungslauf und die Prüfung der zurückbehaltenen Elemente wurden jeweils auf dieselbe Weise vor ihrem ersten Durchlauf registriert.

Eine Änderung wurde während des ersten Durchlaufs (v2) vorgenommen. Ein Limit von 2 Millionen Orchestrator-Tokens pro Durchlauf, das als Schutz vor Endlosschleifen gedacht war, stoppte den Benchmark nach dem ersten Paar, als Claude Code allein einen Nachschlagedurchlauf mit 2.38 Millionen Tokens normal abschloss (alle 20 korrekt). Das Limit wurde für beide Setups auf 6 Millionen angehoben, die Änderung wurde mit Zeitstempel protokolliert, und nichts wurde wiederholt. Die Anpassung erfolgte, nachdem das erste Ergebnis vorlag. Ohne sie hätte kein Szenario ein Urteil erhalten. Dollar-Limits und die allgemeine Ausgabenobergrenze blieben unverändert.

Die Geschichte: v2, die Korrektur, v3 und die Prüfung mit zurückbehaltenen Elementen

v2 entdeckte eine Wissenslücke. Beim ersten fairen Durchlauf stimmte ISMS Copilot mit Claude Code allein bei jedem ISO/IEC 27001-, ISO/IEC 42001- und CMMC-Punkt überein, verpasste aber die meisten DORA-RTS-Artikelnummern und NIS2-IR-Anhangspunkte. Seine Antworten markierten diese Kennungen als unbestätigt.

v2-GenauigkeitClaude Code alleinClaude Code + ISMS Copilot
S1 Nachschlagen60/6037/60
S3 lange Sitzung12/129/12
S4 schnelle Beratung15/159/15

Die Korrektur. Wir fügten ISMS Copilot Wissen zu DORA RTS und NIS2 IR auf Artikel- und Anhangspunkt-Ebene hinzu, basierend auf den offiziellen EU-Texten, und ergänzten die Routing-Regel um: Überprüfe jede Antwort, die ISMS Copilot als unbestätigt markiert. Dann führten wir dieselben Szenarien mit demselben Schlüssel und Bewerter erneut durch.

v3 (gleicher Schlüssel, gleicher Bewerter, beide Setups erneut durchgeführt):

SzenarioSetupRichtigGenauigkeitClaude $ (3 Durchläufe)Claude $ pro richtige AntwortMedian Orchestrator-Tokens pro Durchlauf
S1 NachschlagenAllein60/60100%6.920.1153,194,935
S1 Nachschlagen+ ISMS Copilot60/60100%3.180.0531,337,252
S3 lange SitzungAllein12/12100%1.650.1381,537,697
S3 lange Sitzung+ ISMS Copilot12/12100%1.750.1461,742,489
S4 schnelle BeratungAllein15/15100%0.890.059501,237
S4 schnelle Beratung+ ISMS Copilot15/15100%0.390.026255,659

Vorab registrierte Urteile: Die Genauigkeit ist in allen drei Szenarien unentschieden. Die Kosten pro richtiger Antwort begünstigen das delegierende Setup bei S1 und S4, bei S3 ist es unentschieden. Bei S3 bestand jeder Code-Check in beiden Setups.

Der Gewinn kam von den eigenen Antworten von ISMS Copilot. Eine nachträgliche Diagnose (ohne Urteilsbewertung) ergab, dass seine Antworten bei 24 von 24 S1-Punkten die richtige DORA-RTS- und NIS2-IR-Kennung enthielten, noch bevor Claude Code eine Webprüfung durchführte. Keine v3-Antwort markierte eine Kennung als unbestätigt, sodass die neue Überprüfungsregel nicht angewendet wurde. Claude Code prüfte in S1 und S3 dennoch eigeninitiativ im Web nach, was keine Antwort änderte, aber die Kosten des delegierenden Setups erhöhte.

Die Prüfung mit zurückbehaltenen Elementen (20 neue Punkte). Da die Wissenskorrektur auf den Fehlern von v2 basierte, prüften wir auf Überanpassung: 10 DORA-RTS-Artikel und 10 NIS2-IR-Anhangspunkte, die der Schlüssel nie enthielt, basierend auf den offiziellen Texten auf dieselbe Weise, im S1-Format.

Prüfung mit zurückbehaltenen ElementenSetupRichtigGenauigkeitClaude $ (3 Durchläufe)Claude $ pro richtige AntwortMedian Orchestrator-Tokens pro Durchlauf
20 neue DORA-RTS- und NIS2-IR-PunkteAllein58/6096.7%4.010.0691,974,985
20 neue DORA-RTS- und NIS2-IR-Punkte+ ISMS Copilot60/60100%3.100.0522,258,506

Vorab registrierte Urteile: Die Genauigkeit ist unentschieden (der Unterschied liegt unter 10 Punkten), und die Kosten pro richtiger Antwort begünstigen das delegierende Setup (1.34-fach). Das delegierende Setup verbrauchte hier mehr Tokens, weil Claude Code in zwei von drei Durchläufen die Antworten von ISMS Copilot eigeninitiativ im Web nachprüfte. Im Durchlauf, in dem es das nicht tat, schrieb es die Antwort von ISMS Copilot in die Datei und erreichte 20 von 20 für 0.15 $.

Wann Delegation nicht hilft

Der erste Benchmark, den wir durchführten, testete drei kleine ISO-27001-Aufgaben, die Claude bereits kennt: eine Lückenprüfung von vier kurzen fiktiven Richtlinien, einen Entwurf einer Zugriffskontrollrichtlinie und Einträge zur Erklärung zur Anwendbarkeit für 10 Kontrollen. Jede Aufgabe schrieb ihr Ergebnis in eine Datei, und es waren keine Nachschlageoperationen erforderlich. Kein Setup hatte Web-Tools, und die Antworten wurden nur auf Vollständigkeit, nicht auf Richtigkeit geprüft.

Aufgabe (Median von 3 Durchläufen)Claude $, alleinClaude $, + ISMS CopilotOrchestrator-Tokens, alleinOrchestrator-Tokens, + ISMS Copilot
Lückenprüfung0.1630.266143,053495,530
Zugriffskontrollrichtlinie0.1050.218131,748427,071
SoA-Einträge0.1130.182133,516349,717

Die Delegation verbrauchte hier 1.6- bis 2.1-mal mehr Claude-Geld. Die delegierenden Durchläufe benötigten mehr Schritte (Laden der MCP-Tools, Warten auf die Antwort), Claude Code las trotzdem jede lokale Datei, und das vollständige Ergebnis kam über Claude Code zurück, das es dann auf die Festplatte schrieb. Wenn eine Aufgabe klein ist, Claude die Antwort bereits kennt und nichts nachgeschlagen werden muss, behalten Sie sie in Ihrem Agenten. Siehe Was delegiert und was lokal behalten werden soll.

Einschränkungen

  • Kleine Stichprobe. 3 Durchläufe pro Szenario pro Setup, an einem Tag.
  • Ein Orchestrator. Nur Claude Code. Routing-Regeln für Codex, Cursor, OpenCode und Grok sind dokumentiert, aber diese Orchestratoren wurden nicht gemessen.
  • Ein Modell. claude-sonnet-5. Ein anderes Modell oder eine spätere Version von Claude Code kann sich anders verhalten.
  • Ein Konto. Alle delegierten Schritte liefen über ein einziges Produktionskonto von ISMS Copilot, dessen serverseitige Speicher die Antworten beeinflussen können.
  • Fiktive Testdaten. Erfundene Unternehmen, Richtlinien und Code.
  • Dokumentenprüfung nicht getestet. Das MCP bietet keinen Pfad zum Hochladen von Dokumenten. Eine 40-seitige Richtlinienprüfung lief in v2 und endete unentschieden, aber Claude Code führte die Prüfung in beiden Setups selbst durch, sodass dies keine Aussage über die Dokumentenprüfung durch ISMS Copilot zulässt.
  • Autor der Testitems. Die Items wurden von einem Claude-Modell erstellt, derselben Familie wie der Orchestrator, basierend auf den offiziellen Texten. Die held-out-Items wurden vor den Durchläufen gegen den offiziellen Text geprüft.
  • Was veröffentlicht wird. Diese Seite enthält die Methode und alle Hauptkennzahlen. Die Roh-Transkripte bleiben privat: Sie enthalten Produktions-Kennungen für Gespräche und wörtliche Modellausgaben. Die Aufgabenstellungen, der Antwortschlüssel, der Bewerter und die bewerteten Ausgaben werden in unserem internen Repository aufbewahrt und nicht mit dieser Seite veröffentlicht.

Was wir behaupten und was nicht

Wir behaupten:

  • Bei den getesteten Items in den fünf genannten Frameworks erreichte Claude Code mit ISMS Copilot die gleiche Genauigkeit wie Claude Code allein mit Websuche (ein Unentschieden in jedem Szenario, gemäß der vorab registrierten Regel).
  • Bei diesen Nachschlage- und Schnellberatungsfragen gab es weniger Claude-API-Kosten pro richtiger Antwort (etwa die Hälfte im v3-Durchlauf, etwa drei Viertel bei den held-out-Items) und etwa gleich viel bei einer langen gemischten Sitzung.

Wir behaupten nicht:

  • Dass ISMS Copilot günstiger als Claude ist oder dass es eine prozentuale Ersparnis auf Ihrer Rechnung gibt.
  • Dass die Antworten besser als die von Claude sind. Die Genauigkeitsergebnisse sind Unentschieden.
  • Irgendetwas über Frameworks, die wir nicht getestet haben, andere Orchestratoren oder Modelle oder die Dokumentenprüfung.
  • Dass Delegation Claude-Nutzung bei kleinen Aufgaben spart, die Claude bereits kennt. Dort war es teurer.
  • Dass delegierte Schritte kostenlos sind. Sie werden gegen Ihren ISMS Copilot-Tarif angerechnet.

Wir wiederholen diesen Benchmark nach Änderungen an den MCP-Tools oder am Framework-Wissen von ISMS Copilot und veröffentlichen die neuen Zahlen hier mit ihrem Datum. Zum Mechanismus hinter diesen Zahlen siehe Was Delegation spart (und was nicht).

Auf dieser Seite