Benchmark: Claude Code z ISMS Copilot i bez niego
Jak mierzyliśmy działanie Claude Code samodzielnie w porównaniu z Claude Code delegującym pytania GRC do ISMS Copilot: metoda, klucz odpowiedzi, punktacja, wyniki, przypadek, w którym delegacja nie pomaga, oraz zastrzeżenia.
Zmierzyliśmy jedno pytanie: ile kosztuje poprawna odpowiedź w użyciu API Claude, gdy prace GRC wykonuje się w Claude Code, jeśli Claude Code bada ją samodzielnie, a ile, jeśli Claude Code przekazuje pytanie do ISMS Copilot przez MCP? Ta strona zawiera metodę, wszystkie główne wyniki, przypadek, w którym delegacja nie pomogła, oraz to, co wyniki potwierdzają, a czego nie.
Co to potwierdza
Na przetestowanych elementach Claude Code delegujący zadania do ISMS Copilot uzyskał taką samą dokładność jak Claude Code działający samodzielnie z wyszukiwaniem w sieci: zarejestrowana wcześniej ocena dokładności była remisem w każdym scenariuszu. Zużył mniej środków na API Claude na poprawną odpowiedź w przypadku wyszukiwań i szybkich porad, a mniej więcej tyle samo w długiej sesji mieszanej (kodowanie i zgodność). Przetestowane ramy to ISO/IEC 27001:2022 Załącznik A, ISO/IEC 42001:2023 Załącznik A, CMMC 2.0 Poziom 2, DORA RTS (UE) 2024/1774 i NIS2 IR (UE) 2024/2690 – i tylko te. Delegowane wywołania są liczone w ramach planu ISMS Copilot, czego nie uwzględniają kwoty w dolarach.
Konfiguracja
| Pozycja | Wartość |
|---|---|
| Daty | Wszystkie uruchomienia 2026-09-28 (UTC) |
| Orkiestrator | Claude Code 2.1.283, tryb headless, nowa pusta konfiguracja i folder roboczy dla każdego uruchomienia |
| Model | claude-sonnet-5 w obu konfiguracjach, zablokowany. Wyszukiwanie w sieci i pobieranie z sieci uruchamiają podwywołania Claude Haiku 4.5, a ich koszt jest uwzględniany. |
| Uruchomienia | N=3 na scenariusz na konfigurację, uruchamiane jako sparowane pary (obie konfiguracje rozpoczynają ten sam scenariusz w tym samym czasie) |
| Użycie Claude | Klucz API Claude, cennik detaliczny, zgodnie z raportem Claude Code dla każdego uruchomienia |
| ISMS Copilot | Produkcyjny account MCP na jednym koncie ISMS Copilot (naszym) |
Obie konfiguracje otrzymują identyczne polecenia zadań, a polecenia nigdy nie wspominają o ISMS Copilot:
| Tylko Claude Code | Claude Code + ISMS Copilot | |
|---|---|---|
| Narzędzia | Read, Glob, Grep, Write, Edit, WebSearch, WebFetch | Te same, plus narzędzia konwersacyjne ISMS Copilot (create_conversation, send_message, get_reply) |
| Instrukcje | Brak | Opublikowana reguła trasowania Claude Code z Delegowanie prac GRC z twojego agenta (2026-09-28), jako projekt CLAUDE.md |
Obie konfiguracje mają wyszukiwanie i pobieranie z sieci, ponieważ rzeczywisty użytkownik je posiada. Reguła trasowania decyduje, co zostanie delegowane. Inne narzędzia konta (kontekst firmy, obszary robocze, pamięci, dokumenty) nie były dozwolone, więc wyniki nie zależą od zapisanego profilu firmy. Serwerowe pamięci konta ISMS Copilot mogły jednak kształtować jego odpowiedzi.
Scenariusze
- S1, wyszukiwania. 20 tematów wymagań, a zadaniem jest podanie dokładnego identyfikatora dla każdego: 4 artykuły DORA RTS, 4 punkty załącznika NIS2 IR, 4 kontrole załącznika A normy ISO/IEC 42001:2023, 4 praktyki CMMC Level 2 oraz 4 kontrole załącznika A normy ISO/IEC 27001:2022. Odpowiedź to plik JSON.
- S3, długa sesja. Jedna sesja Claude Code składająca się z 8 poleceń w małym repozytorium Python: 4 edycje kodu (sprawdzane przez ukryte testy) przeplatające się z 4 pytaniami GRC z kluczowymi odpowiedziami. Odpowiedzi GRC są punktowane, a sprawdzenia kodu są raportowane oddzielnie.
- S4, szybkie porady. 5 pytań typu tak/nie, każde z identyfikatorem decydującym o odpowiedzi oraz uzasadnieniem w jednym zdaniu. Odpowiedź jest poprawna tylko wtedy, gdy zarówno odpowiedź tak/nie, jak i identyfikator są zgodne.
- Zastrzeżone. 20 nowych elementów z DORA RTS i NIS2 IR w formacie S1, które nigdy wcześniej nie pojawiły się w kluczu odpowiedzi (zob. „Historia” poniżej).
Wszystkie dane testowe są fikcyjne. Nie użyto żadnych danych klientów.
Jak powstał klucz odpowiedzi
Każdy element klucza zawiera kanoniczny identyfikator, wymaganie w jednym zdaniu, cytowanie oraz cytat lub odwołanie do źródła. Klucz powstał wyłącznie na podstawie oficjalnych źródeł i nigdy nie korzystał z ISMS Copilot, ponieważ byłoby to błędne koło:
- DORA RTS (UE) 2024/1774 i NIS2 IR (UE) 2024/2690: oficjalny tekst z Biura Publikacji UE (CELEX 32024R1774 i 32024R2690), z cytowaniem adresów EUR-Lex.
- CMMC 2.0 Level 2: Przewodnik oceny CMMC Level 2 Departamentu Obrony, z publikacją NIST, z której pochodzą numery praktyk.
- ISO/IEC 27001:2022 Załącznik A: numery i tytuły kontroli z własnego wykazów normy ISO.
- ISO/IEC 42001:2023 Załącznik A: numery i tytuły kontroli z mapowania NIST AI RMF do ISO/IEC 42001.
Klucz został zamrożony przed pierwszym uruchomieniem, a każde uruchomienie rejestruje jego skrót. Nie uległ zmianie podczas benchmarku.
Punktacja
Punktacja jest mechaniczna: żaden model nie ocenia odpowiedzi. Skrypt odczytuje pole identyfikatora z każdej odpowiedzi, normalizuje je według rodzaju, a następnie porównuje z kluczem:
- DORA RTS: „Article 7”, „Art. 7(4)” i „Article 7(4) of ...” są traktowane jako Article 7.
- NIS2 IR: odpowiedź musi być rzeczywistym punktem załącznika i musi znajdować się na zarejestrowanej wcześniej liście akceptowalnych odpowiedzi (punkt operacyjny i jego nagłówek). Punkt pokrewny jest błędny.
- ISO/IEC 27001:2022 i ISO/IEC 42001:2023: numer załącznika A musi być identyczny. Numeracja z 2013 r. lub odwołanie do załącznika B w przypadku 42001 jest błędne.
- CMMC Level 2: numer praktyki musi być zgodny („SC.L2-3.13.11” i „3.13.11” są traktowane jako poprawne).
Brakujący plik, nieprawidłowy JSON lub nieczytelny identyfikator są traktowane jako błąd. Uruchomienia, które osiągnęły limit, zostałyby ocenione w takim stanie i nigdy nie byłyby powtarzane.
Metryka
Główna metryka to dolary API Claude na poprawną odpowiedź: koszt Claude z 3 uruchomień scenariusza podzielony przez liczbę poprawnych odpowiedzi w tych 3 uruchomieniach. Jest to cennik listowy raportowany przez Claude Code, czyli to, co abonent Claude płaci za dodatkowe użycie poza planem. Uwzględnia podwywołania wyszukiwania w sieci i opłaty za wyszukiwanie.
Użycie planu ISMS Copilot nie jest uwzględniane w tej kwocie, a nie jest darmowe. Delegowane tury są liczone w ramach planu ISMS Copilot (zob. Gdzie rozliczane jest użycie ISMS Copilot). Pominięcie tego faworyzuje konfigurację z delegowaniem w tej metryce.
Dokładność, tokeny orkiestratora, tury i czas są raportowane obok. Tokeny i dolary się różnią: powtarzany kontekst odczytany z pamięci podręcznej poleceń jest rozliczany po obniżonej cenie wejściowej, więc konfiguracja może używać więcej tokenów, a mimo to kosztować mniej dolarów.
Pre-rejestracja i zarejestrowana poprawka
Projekt, klucz odpowiedzi, system punktacji i reguły wygranej zostały zatwierdzone przed jakimkolwiek uruchomieniem, z zobowiązaniem do opublikowania wyników niezależnie od tego, co pokazywały. Zarejestrowane reguły wygranej: dokładność wygrywa przy 10 punktach procentowych lub więcej, dolary na poprawną odpowiedź przy 1.25-krotności lub więcej; wszystko, co jest bliżej, to remis. Ponowne uruchomienie v3 i sprawdzenie zastrzeżonych elementów zostały zarejestrowane w ten sam sposób przed pierwszym uruchomieniem.
Jedna poprawka została wprowadzona podczas pierwszego uruchomienia (v2). Limit 2 milionów tokenów orkiestratora na uruchomienie, który miał służyć jako zabezpieczenie przed niekontrolowanym wzrostem, zatrzymał benchmark po pierwszej parze, gdy samodzielny Claude Code ukończył uruchomienie wyszukiwania normalnie przy 2.38 miliona tokenów (wszystkie 20 poprawnych). Limit został podniesiony do 6 milionów dla obu konfiguracji, zmiana została zarejestrowana z podaniem czasu, a nic nie zostało powtórzone. Została wprowadzona po zobaczeniu pierwszego wyniku. Bez niej żaden scenariusz nie miałby werdyktu. Limity dolarowe i ogólny limit wydatków nie uległy zmianie.
Historia: v2, poprawka, v3 i test na nowych danych
v2 ujawniło lukę w wiedzy. W pierwszym sprawiedliwym uruchomieniu ISMS Copilot dopasował się do samodzielnego Claude Code we wszystkich punktach ISO/IEC 27001, ISO/IEC 42001 i CMMC, ale nie rozpoznał większości numerów artykułów DORA RTS oraz punktów załączników NIS2 IR. W swoich odpowiedziach oznaczył te identyfikatory jako niepotwierdzone.
| Dokładność v2 | Samodzielny Claude Code | Claude Code + ISMS Copilot |
|---|---|---|
| Wyszukiwanie S1 | 60/60 | 37/60 |
| Długa sesja S3 | 12/12 | 9/12 |
| Szybka porada S4 | 15/15 | 9/15 |
Poprawka. Dodaliśmy do ISMS Copilot wiedzę na temat DORA RTS i NIS2 IR na poziomie artykułów i punktów załączników, opartą na oficjalnych tekstach UE, oraz dodaliśmy linię do reguły routingu: zweryfikuj każdą odpowiedź, którą ISMS Copilot oznacza jako niepotwierdzoną. Następnie powtórzyliśmy te same scenariusze z tym samym kluczem i systemem oceny.
v3 (ten sam klucz, ten sam system oceny, oba ustawienia powtórzone):
| Scenariusz | Ustawienie | Poprawne | Dokładność | Koszt Claude $ (3 uruchomienia) | Koszt Claude $ na poprawną odpowiedź | Mediana tokenów orkiestratora na uruchomienie |
|---|---|---|---|---|---|---|
| Wyszukiwanie S1 | Samodzielny | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| Wyszukiwanie S1 | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| Długa sesja S3 | Samodzielny | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| Długa sesja S3 | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| Szybka porada S4 | Samodzielny | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| Szybka porada S4 | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Zarejestrowane wcześniej werdykty: dokładność jest remisem we wszystkich trzech scenariuszach. Koszt na poprawną odpowiedź faworyzuje ustawienie z delegowaniem w S1 i S4, a w S3 jest remis. W S3 wszystkie sprawdzenia kodu zakończyły się sukcesem w obu ustawieniach.
Zysk wynikał z własnych odpowiedzi ISMS Copilot. Diagnostyka dodana po testach (bez werdyktu) wykazała, że jego odpowiedzi zawierały poprawne identyfikatory DORA RTS i NIS2 IR w 24 z 24 punktów S1 przed jakimkolwiek sprawdzeniem w sieci przez Claude Code. Żadna odpowiedź w v3 nie oznaczała identyfikatora jako niepotwierdzonego, więc nowa linia weryfikacyjna nie została użyta. Claude Code nadal samodzielnie sprawdzał w sieci w S1 i S3, mimo że nie było to wymagane, co nie zmieniło żadnej odpowiedzi, ale podniosło koszt ustawienia z delegowaniem.
Test na nowych danych (20 nowych punktów). Ponieważ poprawka wiedzy została dostosowana na podstawie błędów z v2, sprawdziliśmy, czy nie było „uczenia się na teście”: 10 artykułów DORA RTS i 10 punktów załączników NIS2 IR, których klucz nigdy nie zawierał, przygotowanych na podstawie oficjalnych tekstów w taki sam sposób, w formacie S1.
| Nowe dane | Ustawienie | Poprawne | Dokładność | Koszt Claude $ (3 uruchomienia) | Koszt Claude $ na poprawną odpowiedź | Mediana tokenów orkiestratora na uruchomienie |
|---|---|---|---|---|---|---|
| 20 nowych punktów DORA RTS i NIS2 IR | Samodzielny | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 nowych punktów DORA RTS i NIS2 IR | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Zarejestrowane wcześniej werdykty: dokładność jest remisem (różnica poniżej 10 punktów), a koszt na poprawną odpowiedź faworyzuje ustawienie z delegowaniem (1.34 razy). Ustawienie z delegowaniem zużyło więcej tokenów, ponieważ Claude Code ponownie sprawdzał odpowiedzi ISMS Copilot w sieci w dwóch z trzech uruchomień. W uruchomieniu, w którym tego nie zrobił, zapisał odpowiedź ISMS Copilot do pliku i uzyskał 20/20 za 0.15 $.
Gdzie delegowanie nie pomaga
Pierwszy test porównawczy sprawdzał trzy niewielkie zadania dotyczące ISO 27001, które Claude już znał: sprawdzenie luk w czterech krótkich fikcyjnych politykach, projekt polityki kontroli dostępu oraz wpisy do Deklaracji Stosowalności dla 10 kontroli. Każde zadanie zapisywało swój rezultat do pliku, a żadne wyszukiwania nie były potrzebne. Żadne z ustawień nie miało narzędzi sieciowych, a odpowiedzi były sprawdzane jedynie pod kątem kompletności, nie poprawności.
| Zadanie (mediana z 3 uruchomień) | Koszt Claude $, samodzielnie | Koszt Claude $, + ISMS Copilot | Tokeny orkiestratora, samodzielnie | Tokeny orkiestratora, + ISMS Copilot |
|---|---|---|---|---|
| Sprawdzenie luk | 0.163 | 0.266 | 143,053 | 495,530 |
| Polityka kontroli dostępu | 0.105 | 0.218 | 131,748 | 427,071 |
| Wpisy do Deklaracji Stosowalności | 0.113 | 0.182 | 133,516 | 349,717 |
Delegowanie zużyło tutaj od 1.6 do 2.1 razy więcej środków na Claude. Uruchomienia z delegowaniem zajęły więcej tur (ładowanie narzędzi MCP, oczekiwanie na odpowiedź), Claude Code nadal odczytywał wszystkie lokalne pliki, a pełny rezultat wracał przez Claude Code, który następnie zapisywał go na dysku. Jeśli zadanie jest małe, Claude już zna odpowiedź i nic nie trzeba wyszukiwać, zachowaj je w swoim agencie. Zobacz co delegować, a co zachować lokalnie.
Zastrzeżenia
- Mała liczba prób. 3 uruchomienia na scenariusz na ustawienie, w jednym dniu.
- Jeden orkiestrator. Tylko Claude Code. Reguły routingu dla Codex, Cursor, OpenCode i Grok są udokumentowane, ale te orkiestratory nie zostały zmierzone.
- Jeden model.
claude-sonnet-5. Inny model lub późniejsza wersja Claude Code może zachowywać się inaczej. - Jeden klient. Wszystkie tury z delegowaniem działały na jednym produkcyjnym koncie ISMS Copilot, którego pamięć po stronie serwera mogła kształtować odpowiedzi.
- Fikcyjne dane. Wymyślone firmy, polityki i kod.
- Przegląd dokumentów nie został przetestowany. MCP nie ma ścieżki przesyłania dokumentów. 40-stronicowy przegląd polityki został przeprowadzony w wersji v2 i zakończył się remisem, ale Claude Code wykonał przegląd samodzielnie w obu ustawieniach, więc nie mówi to nic o tym, jak ISMS Copilot przeglądałby Twoje dokumenty.
- Autor klucza. Elementy zostały napisane przez model Claude, z tej samej rodziny co orkiestrator, na podstawie oficjalnych tekstów. Elementy testowe zostały sprawdzone względem oficjalnych tekstów przed uruchomieniami.
- Co zostało opublikowane. Ta strona zawiera metodę i wszystkie główne liczby. Surowa transkrypcja pozostaje prywatna: zawiera produkcyjne identyfikatory konwersacji i dosłowne wyjścia modelu. Zadania, klucz odpowiedzi, system oceny i oceny wyników są przechowywane w naszym wewnętrznym repozytorium i nie są publikowane razem z tą stroną.
Co twierdzimy, a czego nie
Twierdzimy:
- W przypadku przetestowanych elementów w pięciu wymienionych frameworkach Claude Code z ISMS Copilot uzyskał taką samą dokładność jak Claude Code badający samodzielnie z wyszukiwaniem sieciowym (remis w dokładności we wszystkich scenariuszach, zgodnie z wcześniej zarejestrowaną regułą).
- W przypadku tych wyszukiwań i pytań dotyczących szybkiej porady zużył mniej środków na API Claude za poprawną odpowiedź (około połowy w uruchomieniu v3, około trzech czwartych na elementach testowych), a w przypadku długiej sesji mieszanej było to podobne.
Nie twierdzimy:
- Że ISMS Copilot jest tańszy niż Claude ani że oszczędza jakikolwiek procent na rachunku.
- Że dostarcza lepszych odpowiedzi niż Claude. Wyniki dokładności to remisy.
- Nic na temat frameworków, których nie testowaliśmy, innych orkiestratorów lub modeli, ani przeglądu dokumentów.
- Że delegowanie oszczędza użycie Claude w przypadku małych zadań, które Claude już zna. Kosztowało tam więcej.
- Że tury z delegowaniem są darmowe. Liczą się one do Twojego planu ISMS Copilot.
Powtarzamy ten benchmark po zmianach w narzędziach MCP lub wiedzy ISMS Copilot na temat frameworków i publikujemy tutaj nowe liczby wraz z ich datą. Aby poznać mechanizm stojący za tymi liczbami, zobacz Co oszczędza delegowanie (a co nie).