ISMS Copilot Docs

Benchmark: Claude Code z ISMS Copilot i bez niego

Jak mierzyliśmy działanie Claude Code samodzielnie w porównaniu z Claude Code delegującym pytania GRC do ISMS Copilot: metoda, klucz odpowiedzi, punktacja, wyniki, przypadek, w którym delegacja nie pomaga, oraz zastrzeżenia.

Zmierzyliśmy jedno pytanie: ile kosztuje poprawna odpowiedź w użyciu API Claude, gdy prace GRC wykonuje się w Claude Code, jeśli Claude Code bada ją samodzielnie, a ile, jeśli Claude Code przekazuje pytanie do ISMS Copilot przez MCP? Ta strona zawiera metodę, wszystkie główne wyniki, przypadek, w którym delegacja nie pomogła, oraz to, co wyniki potwierdzają, a czego nie.

Co to potwierdza

Na przetestowanych elementach Claude Code delegujący zadania do ISMS Copilot uzyskał taką samą dokładność jak Claude Code działający samodzielnie z wyszukiwaniem w sieci: zarejestrowana wcześniej ocena dokładności była remisem w każdym scenariuszu. Zużył mniej środków na API Claude na poprawną odpowiedź w przypadku wyszukiwań i szybkich porad, a mniej więcej tyle samo w długiej sesji mieszanej (kodowanie i zgodność). Przetestowane ramy to ISO/IEC 27001:2022 Załącznik A, ISO/IEC 42001:2023 Załącznik A, CMMC 2.0 Poziom 2, DORA RTS (UE) 2024/1774 i NIS2 IR (UE) 2024/2690 – i tylko te. Delegowane wywołania są liczone w ramach planu ISMS Copilot, czego nie uwzględniają kwoty w dolarach.

Konfiguracja

PozycjaWartość
DatyWszystkie uruchomienia 2026-09-28 (UTC)
OrkiestratorClaude Code 2.1.283, tryb headless, nowa pusta konfiguracja i folder roboczy dla każdego uruchomienia
Modelclaude-sonnet-5 w obu konfiguracjach, zablokowany. Wyszukiwanie w sieci i pobieranie z sieci uruchamiają podwywołania Claude Haiku 4.5, a ich koszt jest uwzględniany.
UruchomieniaN=3 na scenariusz na konfigurację, uruchamiane jako sparowane pary (obie konfiguracje rozpoczynają ten sam scenariusz w tym samym czasie)
Użycie ClaudeKlucz API Claude, cennik detaliczny, zgodnie z raportem Claude Code dla każdego uruchomienia
ISMS CopilotProdukcyjny account MCP na jednym koncie ISMS Copilot (naszym)

Obie konfiguracje otrzymują identyczne polecenia zadań, a polecenia nigdy nie wspominają o ISMS Copilot:

Tylko Claude CodeClaude Code + ISMS Copilot
NarzędziaRead, Glob, Grep, Write, Edit, WebSearch, WebFetchTe same, plus narzędzia konwersacyjne ISMS Copilot (create_conversation, send_message, get_reply)
InstrukcjeBrakOpublikowana reguła trasowania Claude Code z Delegowanie prac GRC z twojego agenta (2026-09-28), jako projekt CLAUDE.md

Obie konfiguracje mają wyszukiwanie i pobieranie z sieci, ponieważ rzeczywisty użytkownik je posiada. Reguła trasowania decyduje, co zostanie delegowane. Inne narzędzia konta (kontekst firmy, obszary robocze, pamięci, dokumenty) nie były dozwolone, więc wyniki nie zależą od zapisanego profilu firmy. Serwerowe pamięci konta ISMS Copilot mogły jednak kształtować jego odpowiedzi.

Scenariusze

  • S1, wyszukiwania. 20 tematów wymagań, a zadaniem jest podanie dokładnego identyfikatora dla każdego: 4 artykuły DORA RTS, 4 punkty załącznika NIS2 IR, 4 kontrole załącznika A normy ISO/IEC 42001:2023, 4 praktyki CMMC Level 2 oraz 4 kontrole załącznika A normy ISO/IEC 27001:2022. Odpowiedź to plik JSON.
  • S3, długa sesja. Jedna sesja Claude Code składająca się z 8 poleceń w małym repozytorium Python: 4 edycje kodu (sprawdzane przez ukryte testy) przeplatające się z 4 pytaniami GRC z kluczowymi odpowiedziami. Odpowiedzi GRC są punktowane, a sprawdzenia kodu są raportowane oddzielnie.
  • S4, szybkie porady. 5 pytań typu tak/nie, każde z identyfikatorem decydującym o odpowiedzi oraz uzasadnieniem w jednym zdaniu. Odpowiedź jest poprawna tylko wtedy, gdy zarówno odpowiedź tak/nie, jak i identyfikator są zgodne.
  • Zastrzeżone. 20 nowych elementów z DORA RTS i NIS2 IR w formacie S1, które nigdy wcześniej nie pojawiły się w kluczu odpowiedzi (zob. „Historia” poniżej).

Wszystkie dane testowe są fikcyjne. Nie użyto żadnych danych klientów.

Jak powstał klucz odpowiedzi

Każdy element klucza zawiera kanoniczny identyfikator, wymaganie w jednym zdaniu, cytowanie oraz cytat lub odwołanie do źródła. Klucz powstał wyłącznie na podstawie oficjalnych źródeł i nigdy nie korzystał z ISMS Copilot, ponieważ byłoby to błędne koło:

  • DORA RTS (UE) 2024/1774 i NIS2 IR (UE) 2024/2690: oficjalny tekst z Biura Publikacji UE (CELEX 32024R1774 i 32024R2690), z cytowaniem adresów EUR-Lex.
  • CMMC 2.0 Level 2: Przewodnik oceny CMMC Level 2 Departamentu Obrony, z publikacją NIST, z której pochodzą numery praktyk.
  • ISO/IEC 27001:2022 Załącznik A: numery i tytuły kontroli z własnego wykazów normy ISO.
  • ISO/IEC 42001:2023 Załącznik A: numery i tytuły kontroli z mapowania NIST AI RMF do ISO/IEC 42001.

Klucz został zamrożony przed pierwszym uruchomieniem, a każde uruchomienie rejestruje jego skrót. Nie uległ zmianie podczas benchmarku.

Punktacja

Punktacja jest mechaniczna: żaden model nie ocenia odpowiedzi. Skrypt odczytuje pole identyfikatora z każdej odpowiedzi, normalizuje je według rodzaju, a następnie porównuje z kluczem:

  • DORA RTS: „Article 7”, „Art. 7(4)” i „Article 7(4) of ...” są traktowane jako Article 7.
  • NIS2 IR: odpowiedź musi być rzeczywistym punktem załącznika i musi znajdować się na zarejestrowanej wcześniej liście akceptowalnych odpowiedzi (punkt operacyjny i jego nagłówek). Punkt pokrewny jest błędny.
  • ISO/IEC 27001:2022 i ISO/IEC 42001:2023: numer załącznika A musi być identyczny. Numeracja z 2013 r. lub odwołanie do załącznika B w przypadku 42001 jest błędne.
  • CMMC Level 2: numer praktyki musi być zgodny („SC.L2-3.13.11” i „3.13.11” są traktowane jako poprawne).

Brakujący plik, nieprawidłowy JSON lub nieczytelny identyfikator są traktowane jako błąd. Uruchomienia, które osiągnęły limit, zostałyby ocenione w takim stanie i nigdy nie byłyby powtarzane.

Metryka

Główna metryka to dolary API Claude na poprawną odpowiedź: koszt Claude z 3 uruchomień scenariusza podzielony przez liczbę poprawnych odpowiedzi w tych 3 uruchomieniach. Jest to cennik listowy raportowany przez Claude Code, czyli to, co abonent Claude płaci za dodatkowe użycie poza planem. Uwzględnia podwywołania wyszukiwania w sieci i opłaty za wyszukiwanie.

Użycie planu ISMS Copilot nie jest uwzględniane w tej kwocie, a nie jest darmowe. Delegowane tury są liczone w ramach planu ISMS Copilot (zob. Gdzie rozliczane jest użycie ISMS Copilot). Pominięcie tego faworyzuje konfigurację z delegowaniem w tej metryce.

Dokładność, tokeny orkiestratora, tury i czas są raportowane obok. Tokeny i dolary się różnią: powtarzany kontekst odczytany z pamięci podręcznej poleceń jest rozliczany po obniżonej cenie wejściowej, więc konfiguracja może używać więcej tokenów, a mimo to kosztować mniej dolarów.

Pre-rejestracja i zarejestrowana poprawka

Projekt, klucz odpowiedzi, system punktacji i reguły wygranej zostały zatwierdzone przed jakimkolwiek uruchomieniem, z zobowiązaniem do opublikowania wyników niezależnie od tego, co pokazywały. Zarejestrowane reguły wygranej: dokładność wygrywa przy 10 punktach procentowych lub więcej, dolary na poprawną odpowiedź przy 1.25-krotności lub więcej; wszystko, co jest bliżej, to remis. Ponowne uruchomienie v3 i sprawdzenie zastrzeżonych elementów zostały zarejestrowane w ten sam sposób przed pierwszym uruchomieniem.

Jedna poprawka została wprowadzona podczas pierwszego uruchomienia (v2). Limit 2 milionów tokenów orkiestratora na uruchomienie, który miał służyć jako zabezpieczenie przed niekontrolowanym wzrostem, zatrzymał benchmark po pierwszej parze, gdy samodzielny Claude Code ukończył uruchomienie wyszukiwania normalnie przy 2.38 miliona tokenów (wszystkie 20 poprawnych). Limit został podniesiony do 6 milionów dla obu konfiguracji, zmiana została zarejestrowana z podaniem czasu, a nic nie zostało powtórzone. Została wprowadzona po zobaczeniu pierwszego wyniku. Bez niej żaden scenariusz nie miałby werdyktu. Limity dolarowe i ogólny limit wydatków nie uległy zmianie.

Historia: v2, poprawka, v3 i test na nowych danych

v2 ujawniło lukę w wiedzy. W pierwszym sprawiedliwym uruchomieniu ISMS Copilot dopasował się do samodzielnego Claude Code we wszystkich punktach ISO/IEC 27001, ISO/IEC 42001 i CMMC, ale nie rozpoznał większości numerów artykułów DORA RTS oraz punktów załączników NIS2 IR. W swoich odpowiedziach oznaczył te identyfikatory jako niepotwierdzone.

Dokładność v2Samodzielny Claude CodeClaude Code + ISMS Copilot
Wyszukiwanie S160/6037/60
Długa sesja S312/129/12
Szybka porada S415/159/15

Poprawka. Dodaliśmy do ISMS Copilot wiedzę na temat DORA RTS i NIS2 IR na poziomie artykułów i punktów załączników, opartą na oficjalnych tekstach UE, oraz dodaliśmy linię do reguły routingu: zweryfikuj każdą odpowiedź, którą ISMS Copilot oznacza jako niepotwierdzoną. Następnie powtórzyliśmy te same scenariusze z tym samym kluczem i systemem oceny.

v3 (ten sam klucz, ten sam system oceny, oba ustawienia powtórzone):

ScenariuszUstawieniePoprawneDokładnośćKoszt Claude $ (3 uruchomienia)Koszt Claude $ na poprawną odpowiedźMediana tokenów orkiestratora na uruchomienie
Wyszukiwanie S1Samodzielny60/60100%6.920.1153,194,935
Wyszukiwanie S1+ ISMS Copilot60/60100%3.180.0531,337,252
Długa sesja S3Samodzielny12/12100%1.650.1381,537,697
Długa sesja S3+ ISMS Copilot12/12100%1.750.1461,742,489
Szybka porada S4Samodzielny15/15100%0.890.059501,237
Szybka porada S4+ ISMS Copilot15/15100%0.390.026255,659

Zarejestrowane wcześniej werdykty: dokładność jest remisem we wszystkich trzech scenariuszach. Koszt na poprawną odpowiedź faworyzuje ustawienie z delegowaniem w S1 i S4, a w S3 jest remis. W S3 wszystkie sprawdzenia kodu zakończyły się sukcesem w obu ustawieniach.

Zysk wynikał z własnych odpowiedzi ISMS Copilot. Diagnostyka dodana po testach (bez werdyktu) wykazała, że jego odpowiedzi zawierały poprawne identyfikatory DORA RTS i NIS2 IR w 24 z 24 punktów S1 przed jakimkolwiek sprawdzeniem w sieci przez Claude Code. Żadna odpowiedź w v3 nie oznaczała identyfikatora jako niepotwierdzonego, więc nowa linia weryfikacyjna nie została użyta. Claude Code nadal samodzielnie sprawdzał w sieci w S1 i S3, mimo że nie było to wymagane, co nie zmieniło żadnej odpowiedzi, ale podniosło koszt ustawienia z delegowaniem.

Test na nowych danych (20 nowych punktów). Ponieważ poprawka wiedzy została dostosowana na podstawie błędów z v2, sprawdziliśmy, czy nie było „uczenia się na teście”: 10 artykułów DORA RTS i 10 punktów załączników NIS2 IR, których klucz nigdy nie zawierał, przygotowanych na podstawie oficjalnych tekstów w taki sam sposób, w formacie S1.

Nowe daneUstawieniePoprawneDokładnośćKoszt Claude $ (3 uruchomienia)Koszt Claude $ na poprawną odpowiedźMediana tokenów orkiestratora na uruchomienie
20 nowych punktów DORA RTS i NIS2 IRSamodzielny58/6096.7%4.010.0691,974,985
20 nowych punktów DORA RTS i NIS2 IR+ ISMS Copilot60/60100%3.100.0522,258,506

Zarejestrowane wcześniej werdykty: dokładność jest remisem (różnica poniżej 10 punktów), a koszt na poprawną odpowiedź faworyzuje ustawienie z delegowaniem (1.34 razy). Ustawienie z delegowaniem zużyło więcej tokenów, ponieważ Claude Code ponownie sprawdzał odpowiedzi ISMS Copilot w sieci w dwóch z trzech uruchomień. W uruchomieniu, w którym tego nie zrobił, zapisał odpowiedź ISMS Copilot do pliku i uzyskał 20/20 za 0.15 $.

Gdzie delegowanie nie pomaga

Pierwszy test porównawczy sprawdzał trzy niewielkie zadania dotyczące ISO 27001, które Claude już znał: sprawdzenie luk w czterech krótkich fikcyjnych politykach, projekt polityki kontroli dostępu oraz wpisy do Deklaracji Stosowalności dla 10 kontroli. Każde zadanie zapisywało swój rezultat do pliku, a żadne wyszukiwania nie były potrzebne. Żadne z ustawień nie miało narzędzi sieciowych, a odpowiedzi były sprawdzane jedynie pod kątem kompletności, nie poprawności.

Zadanie (mediana z 3 uruchomień)Koszt Claude $, samodzielnieKoszt Claude $, + ISMS CopilotTokeny orkiestratora, samodzielnieTokeny orkiestratora, + ISMS Copilot
Sprawdzenie luk0.1630.266143,053495,530
Polityka kontroli dostępu0.1050.218131,748427,071
Wpisy do Deklaracji Stosowalności0.1130.182133,516349,717

Delegowanie zużyło tutaj od 1.6 do 2.1 razy więcej środków na Claude. Uruchomienia z delegowaniem zajęły więcej tur (ładowanie narzędzi MCP, oczekiwanie na odpowiedź), Claude Code nadal odczytywał wszystkie lokalne pliki, a pełny rezultat wracał przez Claude Code, który następnie zapisywał go na dysku. Jeśli zadanie jest małe, Claude już zna odpowiedź i nic nie trzeba wyszukiwać, zachowaj je w swoim agencie. Zobacz co delegować, a co zachować lokalnie.

Zastrzeżenia

  • Mała liczba prób. 3 uruchomienia na scenariusz na ustawienie, w jednym dniu.
  • Jeden orkiestrator. Tylko Claude Code. Reguły routingu dla Codex, Cursor, OpenCode i Grok są udokumentowane, ale te orkiestratory nie zostały zmierzone.
  • Jeden model. claude-sonnet-5. Inny model lub późniejsza wersja Claude Code może zachowywać się inaczej.
  • Jeden klient. Wszystkie tury z delegowaniem działały na jednym produkcyjnym koncie ISMS Copilot, którego pamięć po stronie serwera mogła kształtować odpowiedzi.
  • Fikcyjne dane. Wymyślone firmy, polityki i kod.
  • Przegląd dokumentów nie został przetestowany. MCP nie ma ścieżki przesyłania dokumentów. 40-stronicowy przegląd polityki został przeprowadzony w wersji v2 i zakończył się remisem, ale Claude Code wykonał przegląd samodzielnie w obu ustawieniach, więc nie mówi to nic o tym, jak ISMS Copilot przeglądałby Twoje dokumenty.
  • Autor klucza. Elementy zostały napisane przez model Claude, z tej samej rodziny co orkiestrator, na podstawie oficjalnych tekstów. Elementy testowe zostały sprawdzone względem oficjalnych tekstów przed uruchomieniami.
  • Co zostało opublikowane. Ta strona zawiera metodę i wszystkie główne liczby. Surowa transkrypcja pozostaje prywatna: zawiera produkcyjne identyfikatory konwersacji i dosłowne wyjścia modelu. Zadania, klucz odpowiedzi, system oceny i oceny wyników są przechowywane w naszym wewnętrznym repozytorium i nie są publikowane razem z tą stroną.

Co twierdzimy, a czego nie

Twierdzimy:

  • W przypadku przetestowanych elementów w pięciu wymienionych frameworkach Claude Code z ISMS Copilot uzyskał taką samą dokładność jak Claude Code badający samodzielnie z wyszukiwaniem sieciowym (remis w dokładności we wszystkich scenariuszach, zgodnie z wcześniej zarejestrowaną regułą).
  • W przypadku tych wyszukiwań i pytań dotyczących szybkiej porady zużył mniej środków na API Claude za poprawną odpowiedź (około połowy w uruchomieniu v3, około trzech czwartych na elementach testowych), a w przypadku długiej sesji mieszanej było to podobne.

Nie twierdzimy:

  • Że ISMS Copilot jest tańszy niż Claude ani że oszczędza jakikolwiek procent na rachunku.
  • Że dostarcza lepszych odpowiedzi niż Claude. Wyniki dokładności to remisy.
  • Nic na temat frameworków, których nie testowaliśmy, innych orkiestratorów lub modeli, ani przeglądu dokumentów.
  • Że delegowanie oszczędza użycie Claude w przypadku małych zadań, które Claude już zna. Kosztowało tam więcej.
  • Że tury z delegowaniem są darmowe. Liczą się one do Twojego planu ISMS Copilot.

Powtarzamy ten benchmark po zmianach w narzędziach MCP lub wiedzy ISMS Copilot na temat frameworków i publikujemy tutaj nowe liczby wraz z ich datą. Aby poznać mechanizm stojący za tymi liczbami, zobacz Co oszczędza delegowanie (a co nie).

Na tej stronie