Порівняння: Claude Code з ISMS Copilot і без нього
Як ми вимірювали роботу Claude Code самостійно порівняно з Claude Code, який делегує питання GRC до ISMS Copilot: метод, еталонні відповіді, оцінювання, результати, випадок, коли делегування не допомогло, та обмеження.
Ми виміряли одне питання: коли ви виконуєте роботу з GRC у Claude Code, скільки коштує правильна відповідь у витратах на використання Claude, якщо Claude Code досліджує її самостійно, і скільки вона коштує, якщо Claude Code передає питання ISMS Copilot через MCP? На цій сторінці наведено метод, усі ключові цифри, запуск, де делегування не допомогло, а також те, що результати підтверджують і не підтверджують.
Що це підтверджує
На тестованих елементах Claude Code, який делегує роботу ISMS Copilot, показав таку ж точність, як і Claude Code, який досліджує самостійно за допомогою вебпошуку: попередньо зареєстрований вердикт щодо точності був нічиєю в кожному сценарії. Витрати на API Claude за кожну правильну відповідь були нижчими для пошуків і швидких порад, а для довгої змішаної сесії з програмування та відповідності витрати були приблизно такими ж. Тестовані фреймворки: ISO/IEC 27001:2022 Додаток A, ISO/IEC 42001:2023 Додаток A, CMMC 2.0 Рівень 2, DORA RTS (EU) 2024/1774 і NIS2 IR (EU) 2024/2690, і лише вони. Делеговані звернення враховуються у вашому плані ISMS Copilot, який не включено до доларових цифр.
Налаштування
| Елемент | Значення |
|---|---|
| Дати | Усі запуски 2026-09-28 (UTC) |
| Оркестратор | Claude Code 2.1.283, без інтерфейсу, нова порожня конфігурація та робоча папка для кожного запуску |
| Модель | claude-sonnet-5 у обох налаштуваннях, зафіксована. Вебпошук і вебзапит використовують підвиклики Claude Haiku 4.5, і їх вартість включено. |
| Запуски | N=3 на сценарій на налаштування, виконані як парні запуски (обидва налаштування починають той самий сценарій одночасно) |
| Використання Claude | Ключ API Claude, ціни за списком, як повідомляє Claude Code для кожного запуску |
| ISMS Copilot | Виробничий обліковий запис MCP на одному обліковому записі ISMS Copilot (нашому) |
Обидва налаштування отримують ідентичні завдання, і завдання ніколи не згадують ISMS Copilot:
| Claude Code самостійно | Claude Code + ISMS Copilot | |
|---|---|---|
| Інструменти | Read, Glob, Grep, Write, Edit, WebSearch, WebFetch | Ті самі, плюс інструменти ISMS Copilot для діалогу (create_conversation, send_message, get_reply) |
| Інструкції | Відсутні | Опубліковане правило маршрутизації Claude Code з Делегування роботи з GRC вашим агентом (2026-09-28), як проектний файл CLAUDE.md |
Обидва налаштування мають вебпошук і вебзапит, бо в реального користувача вони є. Правило маршрутизації вирішує, що буде делеговано. Інші інструменти облікового запису (контекст компанії, робочі простори, пам’ять, документи) були заборонені, тому результати не залежать від збереженого профілю компанії. Серверна пам’ять облікового запису ISMS Copilot все ж могла впливати на його відповіді.
Сценарії
- S1, пошук. 20 тем вимог, завдання: надати точний ідентифікатор для кожної: 4 статті DORA RTS, 4 пункти додатка NIS2 IR, 4 контролі Додатка A до ISO/IEC 42001:2023, 4 практики рівня 2 CMMC і 4 контролі Додатка A до ISO/IEC 27001:2022. Відповідь: файл JSON.
- S3, довга сесія. Одна сесія Claude Code з 8 запитами до невеликого репозиторію Python: 4 редагування коду (перевірені прихованими тестами), які чергуються з 4 питаннями GRC із ключовими відповідями. Оцінки за відповіді GRC фіксуються; перевірки коду повідомляються окремо.
- S4, швидка порада. 5 питань «так» або «ні», кожне з ідентифікатором, який визначає відповідь, і одним реченням пояснення. Правильно лише за умови, якщо збігаються і «так»/«ні», і ідентифікатор.
- Утримані дані. 20 нових елементів із DORA RTS і NIS2 IR у форматі S1, яких ніколи не було в ключі відповідей раніше (див. «Історія: v2, виправлення, v3 і перевірка на утриманих даних» нижче).
Усі тестові дані вигадані. Дані клієнтів не використовувалися.
Як було створено ключ відповідей
Кожен елемент із ключем містить канонічний ідентифікатор, вимогу в одному реченні, посилання та цитату або вказівник на джерело. Ключ було створено виключно на основі офіційних джерел, ніколи не з ISMS Copilot, бо це було б циркулярним:
- DORA RTS (EU) 2024/1774 і NIS2 IR (EU) 2024/2690: офіційний текст із Офісу публікацій ЄС (CELEX 32024R1774 і 32024R2690), з посиланням на адреси EUR-Lex.
- CMMC 2.0 Level 2: Посібник з оцінки рівня 2 CMMC від Міністерства оборони США, із публікацією NIST, звідки походять номери практик.
- ISO/IEC 27001:2022 Додаток A: номери та назви контролів із власного переліку стандарту від ISO.
- ISO/IEC 42001:2023 Додаток A: номери та назви контролів із таблиці відповідності NIST AI RMF до ISO/IEC 42001.
Ключ було зафіксовано перед першим запуском, і кожен запуск фіксує його хеш. Він не змінювався під час тестування.
Оцінювання
Оцінювання механічне: жодна модель не оцінює відповідей. Скрипт зчитує поле ідентифікатора з кожної відповіді, нормалізує його за типом, а потім порівнює з ключем:
- DORA RTS: "Article 7", "Art. 7(4)" і "Article 7(4) of ..." усі вважаються статтею 7.
- NIS2 IR: відповідь має бути дійсним пунктом додатка і має бути в попередньо зареєстрованому списку прийнятних варіантів для цього елемента (діючий пункт і його заголовок). Суміжний пункт вважається неправильним.
- ISO/IEC 27001:2022 і ISO/IEC 42001:2023: номер Додатка A має збігатися точно. Нумерація 2013 року або посилання на Додаток B для 42001 вважаються неправильними.
- CMMC Level 2: номер практики має збігатися ("SC.L2-3.13.11" і "3.13.11" обидва вважаються правильними).
Відсутній файл, недійсний JSON або незрозумілий ідентифікатор вважаються неправильними. Запуски, які досягли ліміту, оцінювалися так, як були, і ніколи не перезапускалися.
Метрика
Основна метрика: долари API Claude за кожну правильну відповідь: вартість Claude для 3 запусків сценарію, поділена на кількість правильних відповідей у цих 3 запусках. Це ціна за списком, яку повідомляє Claude Code, тобто те, що абонент Claude платить за додаткове використання понад план. Вона включає підвиклики вебпошуку та плату за пошук.
Використання плану ISMS Copilot не включено до цієї цифри, і воно не є безкоштовним. Делеговані звернення враховуються у вашому плані ISMS Copilot (див. Де враховується використання ISMS Copilot). Виключення цієї вартості сприяє налаштуванню з делегуванням за цією метрикою.
Точність, токени оркестратора, звернення та час також наводяться. Токени та долари відрізняються: повторно прочитані контексти з кешу запитів оплачуються за часткою ціни введення, тому налаштування може використовувати більше токенів і все ж коштувати менше доларів.
Попередня реєстрація та зафіксована поправка
Дизайн, ключ відповідей, система оцінювання та правила перемоги були зафіксовані перед будь-яким запуском із зобов’язанням опублікувати результати незалежно від того, що вони показали. Попередньо зареєстровані правила перемоги: точність виграє при різниці в 10 відсотків або більше, долари за правильну відповідь виграють при різниці в 1.25 раза або більше; будь-який менший розрив вважається нічиєю. Перезапуск v3 і резервна перевірка були попередньо зареєстровані тим самим способом перед їхнім першим запуском.
Одну поправку було зроблено під час першого запуску (v2). Ліміт у 2 мільйони токенів оркестратора на запуск, призначений для захисту від зациклювання, зупинив тестування після першої пари, коли Claude Code самостійно завершив запуск пошуку на 2.38 мільйона токенів (усі 20 правильно). Ліміт було підвищено до 6 мільйонів для обох налаштувань, зміна була зафіксована з зазначенням часу, і нічого не перезапускалося. Її було зроблено після того, як був отриманий перший результат. Без неї жоден зі сценаріїв не мав би вердикту. Ліміти на долари та загальний ліміт витрат не змінювалися.
Історія: v2, виправлення, v3 і перевірка на утриманих даних
v2 виявила прогалину в знаннях. Під час першого чесного тесту ISMS Copilot збігався з Claude Code у всіх пунктах ISO/IEC 27001, ISO/IEC 42001 і CMMC, але не знайшов більшості номерів статей DORA RTS та пунктів додатку NIS2 IR. У своїх відповідях він позначав ці ідентифікатори як непідтверджені.
| Точність v2 | Claude Code самостійно | Claude Code + ISMS Copilot |
|---|---|---|
| S1 пошук | 60/60 | 37/60 |
| S3 довга сесія | 12/12 | 9/12 |
| S4 швидка консультація | 15/15 | 9/15 |
Виправлення. Ми додали до ISMS Copilot знання про DORA RTS і NIS2 IR на рівні статей і пунктів додатку, побудовані на основі офіційних текстів ЄС, а також додали правило маршрутизації: перевіряти будь-яку відповідь, яку ISMS Copilot позначає як непідтверджену. Потім ми повторно запустили ті ж сценарії з тим самим ключем і оцінювачем.
v3 (те ж ключ, той же оцінювач, обидва налаштування повторно запущені):
| Сценарій | Налаштування | Правильно | Точність | Витрати Claude $ (3 запуски) | Claude $ за правильну відповідь | Медіана токенів оркестратора за запуск |
|---|---|---|---|---|---|---|
| S1 пошук | Самостійно | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| S1 пошук | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| S3 довга сесія | Самостійно | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| S3 довга сесія | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| S4 швидка консультація | Самостійно | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| S4 швидка консультація | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Попередньо зареєстровані висновки: точність однакова у всіх трьох сценаріях. Витрати на долар за правильну відповідь сприяють налаштуванню з делегуванням у S1 і S4, а в S3 нічия. У S3 усі перевірки коду пройшли в обох налаштуваннях.
Приріст відбувся завдяки власним відповідям ISMS Copilot. Діагностика, додана після запусків (без висновків), виявила, що його відповіді містили правильні ідентифікатори DORA RTS і NIS2 IR у 24 з 24 пунктів S1 ще до будь-якої веб-перевірки Claude Code. Жодна відповідь v3 не позначала ідентифікатор як непідтверджений, тому нове правило перевірки не застосовувалося. Claude Code все одно перевіряв у вебі в S1 і S3 без запиту, що не змінило жодної відповіді, але збільшило вартість налаштування з делегуванням.
Перевірка на утриманих даних (20 нових пунктів). Оскільки виправлення знань було засноване на помилках v2, ми перевірили, чи не було «навчання на тесті»: 10 статей DORA RTS і 10 пунктів додатку NIS2 IR, яких ключ ніколи не містив, побудовані на основі офіційних текстів тим самим способом, у форматі S1.
| Утримані дані | Налаштування | Правильно | Точність | Витрати Claude $ (3 запуски) | Claude $ за правильну відповідь | Медіана токенів оркестратора за запуск |
|---|---|---|---|---|---|---|
| 20 нових пунктів DORA RTS і NIS2 IR | Самостійно | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 нових пунктів DORA RTS і NIS2 IR | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Попередньо зареєстровані висновки: точність: нічия (різниця менше 10 пунктів), а витрати на долар за правильну відповідь сприяють налаштуванню з делегуванням (у 1.34 рази). Налаштування з делегуванням використало більше токенів тут, тому що Claude Code повторно перевіряв відповіді ISMS Copilot у вебі в двох із трьох запусків. У запуску, де він цього не робив, він записав відповідь ISMS Copilot у файл і отримав 20 з 20 за 0.15 $.
Де делегування не допомагає
Перший бенчмарк, який ми провели, тестував три невеликі завдання за ISO 27001, які Claude вже знає: перевірка прогалин у чотирьох коротких вигаданих політиках, проект політики контролю доступу та записи до Заяви про застосовність для 10 заходів контролю. Кожне завдання записувало свій результат у файл, і пошук не знадобився. Жодне налаштування не мало веб-інструментів, а відповіді перевірялися лише на повноту, а не на правильність.
| Завдання (медіана 3 запусків) | Витрати Claude $, самостійно | Витрати Claude $, + ISMS Copilot | Токени оркестратора, самостійно | Токени оркестратора, + ISMS Copilot |
|---|---|---|---|---|
| Перевірка прогалин | 0.163 | 0.266 | 143,053 | 495,530 |
| Політика контролю доступу | 0.105 | 0.218 | 131,748 | 427,071 |
| Записи до Заяви про застосовність | 0.113 | 0.182 | 133,516 | 349,717 |
Делегування витрачало в 1.6–2.1 рази більше коштів Claude тут. Запуски з делегуванням займали більше кроків (завантаження інструментів MCP, очікування відповіді), Claude Code все одно читав усі локальні файли, а повний результат повертався через Claude Code, який потім записував його на диск. Якщо завдання невелике, а Claude вже знає відповідь і нічого не потрібно шукати, тримайте його в agent. Див. що делегувати, а що залишити локально.
Обмеження
- Малий обсяг даних. 3 запуски на сценарій на налаштування, за один день.
- Один оркестратор. Лише Claude Code. Правила маршрутизації для Codex, Cursor, OpenCode і Grok документовані, але ці оркестратори не вимірювалися.
- Одна модель.
claude-sonnet-5. Інша модель або пізніша версія Claude Code може поводитися інакше. - Один обліковий запис. Усі кроки з делегуванням виконувалися на одному виробничому обліковому записі ISMS Copilot, серверні спогади якого могли впливати на відповіді.
- Вигадані тестові дані. Вигадані компанії, політики та код.
- Перегляд документів не тестувався. MCP не має шляху для завантаження документів. Перегляд політики на 40 сторінок виконувався в v2 і завершився нічиєю, але Claude Code здійснював перегляд самостійно в обох налаштуваннях, тому це нічого не каже про те, як ISMS Copilot переглядатиме ваші документи.
- Автор ключових пунктів. Пункти були написані моделлю Claude, тієї ж сімейства, що й оркестратор, на основі офіційних текстів. Утримані пункти перевірялися за офіційним текстом перед запусками.
- Що опубліковано. На цій сторінці наведено метод і всі основні цифри. Сирі транскрипти залишаються приватними: вони містять виробничі ідентифікатори бесід і дослівні виводи моделі. Завдання, ключ відповідей, оцінювач і оцінені результати зберігаються в нашому внутрішньому репозиторії та не опубліковуються разом із цією сторінкою.
Що ми стверджуємо і чого не стверджуємо
Ми стверджуємо:
- На тестованих пунктах у п’яти фреймворках вище Claude Code з ISMS Copilot досяг тієї ж точності, що й Claude Code, який досліджував самостійно з веб-пошуком (нічия в точності в кожному сценарії, згідно з заздалегідь зареєстрованим правилом).
- На цих пошуках і запитаннях швидкої консультації він витратив менше коштів API Claude на правильну відповідь (приблизно вдвічі менше в запуску v3, приблизно три чверті від вартості на утриманих пунктах), і приблизно стільки ж на довгій змішаній сесії.
Ми не стверджуємо:
- Що ISMS Copilot дешевший за Claude або дає певний відсоток економії на вашому рахунку.
- Що відповіді кращі за Claude. Результати точності: нічия.
- Нічого про фреймворки, які ми не тестували, інші оркестратори чи моделі, або перегляд документів.
- Що делегування економить використання Claude для невеликих завдань, які Claude вже знає. Там це коштувало дорожче.
- Що кроки з делегуванням безкоштовні. Вони враховуються у вашому плані ISMS Copilot.
Ми повторно запускаємо цей бенчмарк після змін у інструментах MCP або знаннях фреймворків ISMS Copilot і публікуємо нові цифри тут із зазначенням дати. Щоб дізнатися про механізм цих цифр, див. Що економить делегування (а що ні).