Benchmark : Claude Code avec et sans ISMS Copilot
Comment nous avons mesuré Claude Code travaillant seul par rapport à Claude Code délégant les questions GRC à ISMS Copilot : méthode, corrigé, notation, résultats, le cas où la délégation n’aide pas et les mises en garde.
Nous avons mesuré une question : lors de travaux de GRC dans Claude Code, quel est le coût en utilisation de Claude pour une réponse correcte si Claude Code effectue la recherche seul, et quel est ce coût si Claude Code transmet la question à ISMS Copilot via MCP ? Cette page présente la méthode, tous les chiffres principaux, l’exécution où la délégation n’a pas aidé, ainsi que ce que les résultats soutiennent ou non.
Ce que cela soutient
Sur les éléments testés, Claude Code délégant à ISMS Copilot a obtenu la même précision que Claude Code recherchant seul avec une recherche web : le verdict de précision préenregistré a été un match nul dans chaque scénario. Il a dépensé moins d’argent d’API Claude par réponse correcte pour les recherches et les conseils rapides, et environ le même pour une longue session mixte de codage et de conformité. Les cadres testés sont ISO/CEI 27001:2022 Annexe A, ISO/CEI 42001:2023 Annexe A, CMMC 2.0 Niveau 2, DORA RTS (UE) 2024/1774 et NIS 2 IR (UE) 2024/2690, et uniquement ceux-là. Les tours délégués comptent contre votre forfait ISMS Copilot, ce qui n’est pas inclus dans les chiffres en dollars.
Configuration
| Élément | Valeur |
|---|---|
| Dates | Toutes les exécutions le 2026-09-28 (UTC) |
| Orchestrateur | Claude Code 2.1.283, sans interface, une configuration vide et un dossier de travail frais pour chaque exécution |
| Modèle | claude-sonnet-5 dans les deux configurations, verrouillé. La recherche web et la récupération web exécutent des sous-appels Claude Haiku 4.5, et leur coût est inclus. |
| Exécutions | N=3 par scénario par configuration, exécutées en paires appariées (les deux configurations commencent le même scénario en même temps) |
| Utilisation de Claude | Clé API Claude, tarifs publics, tels que rapportés par Claude Code pour chaque exécution |
| ISMS Copilot | Le MCP de compte de production, sur un compte ISMS Copilot (le nôtre) |
Les deux configurations reçoivent des invites de tâche identiques, et les invites ne mentionnent jamais ISMS Copilot :
| Claude Code seul | Claude Code + ISMS Copilot | |
|---|---|---|
| Outils | Read, Glob, Grep, Write, Edit, WebSearch, WebFetch | Les mêmes, plus les outils de conversation ISMS Copilot (create_conversation, send_message, get_reply) |
| Instructions | Aucune | La règle de routage Claude Code publiée dans Déléguer les travaux GRC depuis votre agent (2026-09-28), en tant que fichier CLAUDE.md du projet |
Les deux configurations disposent de la recherche web et de la récupération, car un utilisateur réel les utilise. La règle de routage décide ce qui est délégué. Les autres outils de compte (contexte de l’entreprise, espaces de travail, mémoires, documents) n’étaient pas autorisés, donc les résultats ne dépendent pas d’un profil d’entreprise stocké. Les mémoires de compte côté serveur d’ISMS Copilot pourraient tout de même influencer ses réponses.
Scénarios
- S1, recherches. 20 thèmes d’exigences, et la tâche consiste à fournir l’identifiant exact pour chacun : 4 articles du RTS DORA, 4 points de l’annexe du RI NIS 2, 4 contrôles de l’annexe A de l’ISO/CEI 42001:2023, 4 pratiques CMMC Level 2 et 4 contrôles de l’annexe A de l’ISO/CEI 27001:2022. La réponse est un fichier JSON.
- S3, longue session. Une session Claude Code de 8 invites sur un petit dépôt Python : 4 modifications de code (vérifiées par des tests cachés) alternant avec 4 questions GRC avec réponses clés. Les réponses GRC sont notées ; les vérifications de code sont rapportées séparément.
- S4, conseils rapides. 5 questions oui ou non, chacune avec l’identifiant qui la détermine et une raison en une phrase. La réponse est considérée comme correcte uniquement si le oui ou non et l’identifiant correspondent.
- Échantillon non utilisé. 20 nouveaux éléments issus du RTS DORA et du RI NIS 2, au format S1, qui n’étaient jamais apparus dans la clé de réponse auparavant (voir « L'histoire : v2, la correction, v3 et la vérification sur échantillon non utilisé » ci-dessous).
Tous les jeux de données sont fictifs. Aucune donnée client n’a été utilisée.
Comment la clé de réponse a été construite
Chaque élément clé contient l’identifiant canonique, l’exigence en une phrase, une citation et une référence ou extrait de la source. La clé a été construite uniquement à partir de sources officielles, et jamais à partir d’ISMS Copilot, car cela aurait été circulaire :
- DORA RTS (UE) 2024/1774 et NIS2 IR (UE) 2024/2690 : le texte officiel du Bureau des publications de l’UE (CELEX 32024R1774 et 32024R2690), cité avec les adresses EUR-Lex.
- CMMC 2.0 Level 2 : le guide d’évaluation CMMC Level 2 du DoD, avec la publication NIST dont proviennent les numéros de pratiques.
- ISO/CEI 27001:2022 Annexe A : les numéros et titres des contrôles à partir de la liste officielle de l’ISO.
- ISO/CEI 42001:2023 Annexe A : les numéros et titres des contrôles à partir de la table de correspondance entre le NIST AI RMF et l’ISO/CEI 42001.
La clé a été figée avant la première exécution, et chaque exécution enregistre un condensat de celle-ci. Elle n’a pas changé pendant le benchmark.
Notation
La notation est mécanique : aucun modèle ne juge aucune réponse. Un script lit le champ identifiant de chaque réponse, le normalise par type, puis le compare avec la clé :
- RTS DORA : « Article 7 », « Art. 7(4) » et « Article 7(4) de... » comptent tous comme Article 7.
- RI NIS 2 : la réponse doit être un point d’annexe réel et figurer dans la liste d’acceptation préenregistrée de l’élément (le point opératif et son titre). Un point frère est incorrect.
- ISO/CEI 27001:2022 et ISO/CEI 42001:2023 : le numéro de l’annexe A doit correspondre exactement. La numérotation 2013 ou une référence à l’annexe B pour 42001 est incorrecte.
- CMMC Level 2 : le numéro de pratique doit correspondre (« SC.L2-3.13.11 » et « 3.13.11 » comptent tous les deux).
Un fichier manquant, un JSON invalide ou un identifiant non analysable compte comme incorrect. Les exécutions ayant atteint une limite auraient été notées telles quelles, sans être relancées.
Métrique
La métrique principale est les dollars d'API Claude par réponse correcte : le coût Claude des 3 exécutions d'un scénario divisé par le nombre de réponses correctes sur ces 3 exécutions. Il s'agit du tarif public que Claude Code signale, c'est-à-dire ce qu'un abonné Claude paie pour une utilisation supplémentaire au-delà du forfait. Cela inclut les sous-appels de recherche web et les frais de recherche.
L'utilisation du forfait ISMS Copilot n'est pas incluse dans ce chiffre, et elle n'est pas gratuite. Les tours délégués comptent contre votre forfait ISMS Copilot (voir Où l'utilisation d'ISMS Copilot est facturée). Ne pas l'inclure favorise la configuration avec délégation sur cette métrique.
La précision, les tokens de l'orchestrateur, les tours et le temps sont également rapportés. Tokens et dollars diffèrent : la relecture répétée du contexte à partir du cache d'invites est facturée à une fraction du prix d'entrée, donc une configuration peut utiliser plus de tokens tout en coûtant moins de dollars.
Préenregistrement et l'amendement consigné
La conception, la clé de réponse, le système de notation et les règles de victoire ont été validés avant toute exécution, avec l'engagement de publier les résultats quels qu'ils soient. Les règles de victoire préenregistrées : la précision gagne à partir de 10 points de pourcentage ou plus, les dollars par réponse correcte à partir de 1.25 fois ou plus ; tout résultat plus proche est considéré comme une égalité. La nouvelle exécution v3 et la vérification sur échantillon non utilisé ont chacune été préenregistrées de la même manière avant leur première exécution.
Un amendement a été apporté pendant la première exécution (v2). Une limite par exécution de 2 millions de tokens de l'orchestrateur, prévue comme garde-fou contre les emballements, a arrêté le benchmark après la première paire, lorsque Claude Code seul a terminé une exécution de recherche normalement à 2.38 millions de tokens (toutes les 20 réponses correctes). La limite a été portée à 6 millions pour les deux configurations, le changement a été consigné avec son heure, et rien n'a été relancé. Il a été effectué après que ce premier résultat ait été observé. Sans cela, aucun scénario n'aurait eu de verdict. Les plafonds en dollars et le plafond global de dépenses n'ont pas changé.
L'histoire : v2, la correction, v3 et la vérification sur échantillon non utilisé
v2 a révélé une lacune de connaissances. Lors du premier test équitable, ISMS Copilot a correspondu à Claude Code seul sur chaque élément ISO/IEC 27001, ISO/IEC 42001 et CMMC, mais a manqué la plupart des numéros d'articles du RTS DORA et des points de l'annexe IR NIS 2. Ses réponses ont marqué ces identifiants comme non confirmés.
| Précision v2 | Claude Code seul | Claude Code + ISMS Copilot |
|---|---|---|
| Recherches S1 | 60/60 | 37/60 |
| Session longue S3 | 12/12 | 9/12 |
| Conseils rapides S4 | 15/15 | 9/15 |
La correction. Nous avons ajouté les connaissances RTS DORA et IR NIS 2 à ISMS Copilot au niveau des articles et des points d'annexe, construites à partir des textes officiels de l'UE, et nous avons ajouté une ligne à la règle de routage : vérifier toute réponse qu'ISMS Copilot marque comme non confirmée. Ensuite, nous avons relancé les mêmes scénarios avec la même clé et le même évaluateur.
v3 (même clé, même évaluateur, les deux configurations relancées) :
| Scénario | Configuration | Correct | Précision | Coût Claude $ (3 exécutions) | Coût Claude $ par réponse correcte | Tokens médians de l'orchestrateur par exécution |
|---|---|---|---|---|---|---|
| Recherches S1 | Seul | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| Recherches S1 | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| Session longue S3 | Seul | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| Session longue S3 | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| Conseils rapides S4 | Seul | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| Conseils rapides S4 | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Verdicts préenregistrés : la précision est à égalité dans les trois scénarios. Le coût par réponse correcte favorise la configuration avec délégation pour S1 et S4, et S3 est à égalité. Dans S3, chaque vérification de code a réussi dans les deux configurations.
Le gain est venu des réponses d'ISMS Copilot lui-même. Un diagnostic ajouté après les exécutions (sans verdict associé) a révélé que ses réponses contenaient le bon identifiant RTS DORA et IR NIS 2 pour 24 des 24 éléments S1 avant toute vérification web par Claude Code. Aucune réponse v3 n'a marqué un identifiant comme non confirmé, donc la nouvelle ligne de vérification n'a pas été utilisée. Claude Code a tout de même vérifié sur le web dans S1 et S3 sans qu'on le lui demande, ce qui n'a changé aucune réponse mais a augmenté le coût de la configuration avec délégation.
La vérification sur échantillon non utilisé (20 nouveaux éléments). Comme la correction des connaissances était basée sur les erreurs de v2, nous avons vérifié s'il y avait un apprentissage spécifique au test : 10 articles RTS DORA et 10 points de l'annexe IR NIS 2 que la clé ne contenait pas, construits à partir des textes officiels de la même manière, au format S1.
| Vérification sur échantillon non utilisé | Configuration | Correct | Précision | Coût Claude $ (3 exécutions) | Coût Claude $ par réponse correcte | Tokens médians de l'orchestrateur par exécution |
|---|---|---|---|---|---|---|
| 20 nouveaux éléments RTS DORA et IR NIS 2 | Seul | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 nouveaux éléments RTS DORA et IR NIS 2 | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Verdicts préenregistrés : la précision est à égalité (la différence est inférieure à 10 points), et le coût par réponse correcte favorise la configuration avec délégation (1.34 fois). La configuration avec délégation a utilisé plus de tokens ici car Claude Code a revérifié les réponses d'ISMS Copilot sur le web dans deux des trois exécutions. Dans l'exécution où il ne l'a pas fait, il a écrit la réponse d'ISMS Copilot dans le fichier et a obtenu 20/20 pour 0.15 $.
Où la délégation n’aide pas
Le premier benchmark exécuté testait trois petites tâches ISO 27001 que Claude connaît déjà : une vérification d’écarts pour quatre politiques fictives courtes, un projet de politique de contrôle d’accès et des entrées de Déclaration d’Applicabilité pour 10 contrôles. Chaque tâche a écrit son livrable dans un fichier, et aucune recherche n’était nécessaire. Aucune des configurations n’avait d’outils web, et les réponses étaient vérifiées pour leur exhaustivité uniquement, non pour leur exactitude.
| Tâche (médiane de 3 exécutions) | Coût Claude $, seul | Coût Claude $, + ISMS Copilot | Tokens de l’orchestrateur, seul | Tokens de l’orchestrateur, + ISMS Copilot |
|---|---|---|---|---|
| Vérification d’écarts | 0.163 | 0.266 | 143,053 | 495,530 |
| Politique de contrôle d’accès | 0.105 | 0.218 | 131,748 | 427,071 |
| Entrées SoA | 0.113 | 0.182 | 133,516 | 349,717 |
La délégation a utilisé 1.6 à 2.1 fois plus d’argent Claude ici. Les exécutions avec délégation ont pris plus de tours (chargement des outils MCP, attente de la réponse), Claude Code a tout de même lu chaque fichier local, et le livrable complet est revenu par Claude Code, qui l’a ensuite écrit sur le disque. Quand une tâche est petite et que Claude connaît déjà la réponse sans avoir besoin de recherche, gardez-la dans votre agent. Voir ce qu’il faut déléguer et ce qu’il faut garder local.
Mises en garde
- Petit N : 3 exécutions par scénario par configuration, sur une journée.
- Un seul orchestrateur : Claude Code uniquement. Les règles de routage pour Codex, Cursor, OpenCode et Grok sont documentées, mais ces orchestrateurs n’ont pas été mesurés.
- Un seul modèle :
claude-sonnet-5. Un autre modèle ou une version ultérieure de Claude Code peut se comporter différemment. - Un seul compte : tous les tours délégés ont été exécutés sur un seul compte ISMS Copilot de production, dont les mémoires côté serveur peuvent influencer les réponses.
- Données fictives : entreprises, politiques et code inventés.
- Révision de documents non testée : le MCP ne propose pas de voie de téléchargement de documents. Une révision de politique de 40 pages a été exécutée en v2 et a abouti à une égalité, mais Claude Code a effectué la révision lui-même dans les deux configurations, donc cela ne dit rien sur la capacité d’ISMS Copilot à réviser vos documents.
- Auteur des éléments : les éléments ont été écrits par un modèle Claude, de la même famille que l’orchestrateur, à partir des textes officiels. Les éléments réservés ont été vérifiés par rapport au texte officiel avant les exécutions.
- Ce qui est publié : cette page contient la méthode et tous les chiffres principaux. Les transcriptions brutes restent privées : elles contiennent des identifiants de conversation de production et des sorties verbatim des modèles. Les invites de tâche, la clé de réponse, l’évaluateur et les sorties évaluées sont conservés dans notre dépôt interne et ne sont pas publiés avec cette page.
Ce que nous affirmons et ce que nous n’affirmons pas
Nous affirmons :
- Sur les éléments testés dans les cinq cadres mentionnés ci-dessus, Claude Code avec ISMS Copilot a égalé la précision de Claude Code recherchant seul avec une recherche web (une égalité de précision dans chaque scénario, selon la règle préenregistrée).
- Sur ces recherches et questions de conseils rapides, il a dépensé moins d’argent d’API Claude par réponse correcte (environ la moitié dans l’exécution v3, environ les trois quarts sur les éléments réservés), et à peu près la même chose sur une longue session mixte.
Nous n’affirmons pas :
- Qu’ISMS Copilot est moins cher que Claude, ou qu’il permet une économie en pourcentage sur votre facture.
- Que les réponses sont meilleures que celles de Claude. Les résultats de précision sont des égalités.
- Rien concernant les cadres que nous n’avons pas testés, d’autres orchestrateurs ou modèles, ou la révision de documents.
- Que la délégation économise l’utilisation de Claude sur les petites tâches que Claude connaît déjà. Cela a coûté plus cher dans ce cas.
- Que les tours délégés sont gratuits. Ils comptent contre votre forfait ISMS Copilot.
Nous relançons ce benchmark après les modifications apportées aux outils MCP ou aux connaissances des cadres d’ISMS Copilot, et nous publions les nouveaux chiffres ici avec leur date. Pour le mécanisme derrière ces chiffres, voir Ce que la délégation économise (et ce qu’elle n’économise pas).