Benchmark: Claude Code con y sin ISMS Copilot
Cómo medimos Claude Code trabajando solo frente a Claude Code delegando preguntas de GRC a ISMS Copilot: método, clave de respuestas, puntuación, resultados, el caso en el que la delegación no ayuda y las salvedades.
Medimos una pregunta: al realizar trabajo de GRC en Claude Code, ¿cuánto cuesta una respuesta correcta en uso de Claude si Claude Code la investiga solo, y cuánto cuesta si Claude Code delega la pregunta a ISMS Copilot mediante MCP? Esta página ofrece el método, todos los números principales, la ejecución en la que la delegación no ayudó, y qué respaldan y qué no los resultados.
Qué respalda esto
En los elementos probados, Claude Code delegando a ISMS Copilot igualó la precisión de Claude Code investigando solo con búsqueda web: el veredicto de precisión preregistrado fue un empate en todos los escenarios. Gastó menos dinero de la API de Claude por respuesta correcta en búsquedas y consejos rápidos, y aproximadamente lo mismo en una sesión larga mixta de codificación y cumplimiento. Los marcos probados son ISO/IEC 27001:2022 Anexo A, ISO/IEC 42001:2023 Anexo A, CMMC 2.0 Nivel 2, DORA RTS (UE) 2024/1774 y NIS2 IR (UE) 2024/2690, y solo esos. Las interacciones delegadas cuentan para tu plan de ISMS Copilot, lo cual no está incluido en las cifras en dólares.
Configuración
| Elemento | Valor |
|---|---|
| Fechas | Todas las ejecuciones el 2026-09-28 (UTC) |
| Orquestador | Claude Code 2.1.283, sin interfaz gráfica, con una configuración y carpeta de trabajo vacías nuevas para cada ejecución |
| Modelo | claude-sonnet-5 en ambas configuraciones, fijado. La búsqueda web y la recuperación web ejecutan subllamadas de Claude Haiku 4.5, y su costo está incluido. |
| Ejecuciones | N=3 por escenario por configuración, ejecutadas como pares emparejados (ambas configuraciones inician el mismo escenario al mismo tiempo) |
| Uso de Claude | Clave de API de Claude, precios de lista, según lo reportado por Claude Code para cada ejecución |
| ISMS Copilot | El MCP de cuenta de producción, en una cuenta de ISMS Copilot (la nuestra) |
Ambas configuraciones reciben indicaciones de tarea idénticas, y las indicaciones nunca mencionan ISMS Copilot:
| Solo Claude Code | Claude Code + ISMS Copilot | |
|---|---|---|
| Herramientas | Read, Glob, Grep, Write, Edit, WebSearch, WebFetch | Las mismas, más las herramientas de conversación de ISMS Copilot (create_conversation, send_message, get_reply) |
| Instrucciones | Ninguna | La regla de enrutamiento de Claude Code publicada en Delegar trabajo de GRC desde tu agente (2026-09-28), como el archivo CLAUDE.md del proyecto |
Ambas configuraciones tienen búsqueda web y recuperación, porque un usuario real las tiene. La regla de enrutamiento decide qué se delega. Las otras herramientas de cuenta (contexto de la empresa, espacios de trabajo, memorias, documentos) no estaban permitidas, por lo que los resultados no dependen de un perfil de empresa almacenado. Las memorias de cuenta del lado del servidor de ISMS Copilot podrían seguir dando forma a sus respuestas.
Escenarios
- S1, búsquedas. 20 temas de requisitos, y la tarea es dar el identificador exacto para cada uno: 4 artículos de DORA RTS, 4 puntos del anexo de NIS2 IR, 4 controles del Anexo A de ISO/IEC 42001:2023, 4 prácticas de CMMC Level 2 y 4 controles del Anexo A de ISO/IEC 27001:2022. La respuesta es un archivo JSON.
- S3, sesión larga. Una sesión de Claude Code con 8 indicaciones en un repositorio pequeño de Python: 4 ediciones de código (verificadas por pruebas ocultas) alternadas con 4 preguntas de GRC con respuestas clave. Las respuestas de GRC se puntúan; las verificaciones de código se reportan por separado.
- S4, consejo rápido. 5 preguntas de sí o no, cada una con el identificador que la decide y una razón de una oración. Correcta solo si tanto el sí o no como el identificador coinciden.
- Reservado. 20 elementos nuevos de DORA RTS y NIS2 IR, en el formato S1, que nunca antes estuvieron en la clave de respuestas (ver "La historia" más abajo).
Todos los datos de prueba son ficticios. No se usaron datos de clientes.
Cómo se construyó la clave de respuestas
Cada elemento con clave tiene el identificador canónico, el requisito en una oración, una cita y una cita textual o referencia a la fuente. La clave se construyó únicamente a partir de fuentes oficiales, y nunca a partir de ISMS Copilot, porque eso sería circular:
- DORA RTS (EU) 2024/1774 y NIS2 IR (EU) 2024/2690: el texto oficial de la Oficina de Publicaciones de la UE (CELEX 32024R1774 y 32024R2690), citado con las direcciones de EUR-Lex.
- CMMC 2.0 Level 2: la Guía de Evaluación de CMMC Level 2 del DoD, con la publicación de NIST de la que provienen los números de las prácticas.
- ISO/IEC 27001:2022 Anexo A: números y títulos de controles de la propia lista de la norma de ISO.
- ISO/IEC 42001:2023 Anexo A: números y títulos de controles del mapeo cruzado de NIST AI RMF a ISO/IEC 42001.
La clave se congeló antes de la primera ejecución, y cada ejecución registra un resumen de la misma. No cambió durante el benchmark.
Puntuación
La puntuación es mecánica: ningún modelo juzga ninguna respuesta. Un script lee el campo de identificador de cada respuesta y lo normaliza por tipo, luego lo compara con la clave:
- DORA RTS: "Artículo 7", "Art. 7(4)" y "Artículo 7(4) de ..." se cuentan todos como Artículo 7.
- NIS2 IR: la respuesta debe ser un punto real del anexo y debe estar en la lista de aceptación pre-registrada del elemento (el punto operativo y su encabezado). Un punto hermano es incorrecto.
- ISO/IEC 27001:2022 e ISO/IEC 42001:2023: el número del Anexo A debe coincidir exactamente. La numeración de 2013 o una referencia al Anexo B para 42001 es incorrecta.
- CMMC Level 2: el número de la práctica debe coincidir ("SC.L2-3.13.11" y "3.13.11" se cuentan ambos).
Un archivo faltante, JSON no válido o un identificador no analizable se cuenta como incorrecto. Las ejecuciones que alcanzaron un límite se habrían puntuado como estaban, y nunca se habrían reejecutado.
Métrica
La métrica principal es dólares de la API de Claude por respuesta correcta: el costo de Claude de las 3 ejecuciones de un escenario dividido entre las respuestas correctas en esas 3 ejecuciones. Es el precio de lista que reporta Claude Code, es decir, lo que paga un suscriptor de Claude por el uso adicional más allá del plan. Incluye las subllamadas de búsqueda web y las tarifas de búsqueda.
El uso del plan de ISMS Copilot no está incluido en esta cifra, y no es gratuito. Las interacciones delegadas cuentan para tu plan de ISMS Copilot (consulta Dónde se factura el uso de ISMS Copilot). Omitirlo favorece a la configuración de delegación en esta métrica.
Se reportan además la precisión, los tokens del orquestador, las interacciones y el tiempo. Tokens y dólares difieren: el contexto repetido leído desde la caché de indicaciones se factura a una fracción del precio de entrada, por lo que una configuración puede usar más tokens y costar menos dólares.
Pre-registro y la enmienda registrada
El diseño, la clave de respuestas, el evaluador y las reglas de victoria se comprometieron antes de cualquier ejecución, con el compromiso de publicar los resultados sin importar lo que mostrasen. Las reglas de victoria pre-registradas: la precisión gana con 10 puntos porcentuales o más; los dólares por respuesta correcta, con 1.25 veces o más; cualquier cosa más cercana es un empate. La nueva ejecución v3 y la verificación con datos reservados se pre-registraron de la misma manera antes de su primera ejecución.
Se realizó una enmienda durante la primera ejecución (v2). Un límite por ejecución de 2 millones de tokens del orquestador, pensado como protección contra desbordamientos, detuvo el benchmark después del primer par, cuando Claude Code solo terminó una ejecución de búsqueda normalmente con 2.38 millones de tokens (las 20 correctas). El límite se aumentó a 6 millones para ambas configuraciones; el cambio se registró con su hora, y nada se reejecutó. Se hizo después de que se hubiera visto ese primer resultado. Sin él, ningún escenario habría tenido un veredicto. Los límites de dólares y el techo de gasto general no cambiaron.
La historia: v2, la corrección, v3 y la verificación con datos reservados
v2 encontró una brecha de conocimiento. En la primera ejecución justa, ISMS Copilot coincidió con Claude Code solo en todos los elementos de ISO/IEC 27001, ISO/IEC 42001 y CMMC, pero no aciertó la mayoría de los números de artículo del DORA RTS ni los puntos del anexo IR de NIS 2. Sus respuestas marcaron esos identificadores como no confirmados.
| Precisión de v2 | Solo Claude Code | Claude Code + ISMS Copilot |
|---|---|---|
| Búsquedas S1 | 60/60 | 37/60 |
| Sesión larga S3 | 12/12 | 9/12 |
| Consejos rápidos S4 | 15/15 | 9/15 |
La corrección. Añadimos conocimiento de DORA RTS y NIS 2 IR a ISMS Copilot a nivel de artículo y puntos de anexo, construido a partir de los textos oficiales de la UE, y agregamos una línea a la regla de enrutamiento: verificar cualquier respuesta que ISMS Copilot marque como no confirmada. Luego, volvimos a ejecutar los mismos escenarios con la misma clave y el mismo evaluador.
v3 (misma clave, mismo evaluador, ambas configuraciones reejecutadas):
| Escenario | Configuración | Correctas | Precisión | Coste de Claude $ (3 ejecuciones) | Coste de Claude $ por respuesta correcta | Tokens medianos del orquestador por ejecución |
|---|---|---|---|---|---|---|
| Búsquedas S1 | Solo | 60/60 | 100% | 6.92 | 0.115 | 3,194,935 |
| Búsquedas S1 | + ISMS Copilot | 60/60 | 100% | 3.18 | 0.053 | 1,337,252 |
| Sesión larga S3 | Solo | 12/12 | 100% | 1.65 | 0.138 | 1,537,697 |
| Sesión larga S3 | + ISMS Copilot | 12/12 | 100% | 1.75 | 0.146 | 1,742,489 |
| Consejos rápidos S4 | Solo | 15/15 | 100% | 0.89 | 0.059 | 501,237 |
| Consejos rápidos S4 | + ISMS Copilot | 15/15 | 100% | 0.39 | 0.026 | 255,659 |
Verdictos pre-registrados: la precisión es un empate en los tres escenarios. El coste por respuesta correcta favorece a la configuración con delegación en S1 y S4, mientras que S3 es un empate. En S3, todas las verificaciones de código aprobaron en ambas configuraciones.
La mejora provino de las propias respuestas de ISMS Copilot. Un diagnóstico añadido después de las ejecuciones (sin veredicto asociado) encontró que sus respuestas incluían el identificador correcto de DORA RTS y NIS 2 IR en 24 de 24 elementos de S1 antes de cualquier verificación web por parte de Claude Code. Ninguna respuesta de v3 marcó un identificador como no confirmado, por lo que la nueva línea de verificación no se activó. Claude Code siguió verificando en la web en S1 y S3 sin que se le pidiera, lo que no cambió ninguna respuesta pero aumentó el coste de la configuración con delegación.
Verificación con datos reservados (20 elementos nuevos). Dado que la corrección de conocimiento se limitó a los fallos de v2, comprobamos si se estaba ajustando al test: 10 artículos del DORA RTS y 10 puntos del anexo IR de NIS 2 que la clave nunca contenía, construidos a partir de los textos oficiales de la misma manera, en el formato S1.
| Datos reservados | Configuración | Correctas | Precisión | Coste de Claude $ (3 ejecuciones) | Coste de Claude $ por respuesta correcta | Tokens medianos del orquestador por ejecución |
|---|---|---|---|---|---|---|
| 20 elementos nuevos de DORA RTS y NIS 2 IR | Solo | 58/60 | 96.7% | 4.01 | 0.069 | 1,974,985 |
| 20 elementos nuevos de DORA RTS y NIS 2 IR | + ISMS Copilot | 60/60 | 100% | 3.10 | 0.052 | 2,258,506 |
Verdictos pre-registrados: la precisión es un empate (la diferencia es menor a 10 puntos) y el coste por respuesta correcta favorece a la configuración con delegación (1.34 veces). La configuración con delegación usó más tokens aquí porque Claude Code volvió a verificar las respuestas de ISMS Copilot en la web en dos de las tres ejecuciones. En la ejecución en la que no lo hizo, escribió la respuesta de ISMS Copilot al archivo y obtuvo 20/20 por 0.15 $.
Dónde la delegación no ayuda
El primer benchmark que ejecutamos probó tres tareas pequeñas de ISO 27001 que Claude ya conoce: una verificación de brechas de cuatro políticas ficticias breves, un borrador de política de control de acceso y entradas de Declaración de Aplicabilidad para 10 controles. Cada tarea escribió su entregable en un archivo y no se necesitaron búsquedas. Ninguna configuración tenía herramientas web, y las respuestas se verificaron solo por completitud, no por corrección.
| Tarea (mediana de 3 ejecuciones) | Claude $, solo | Claude $, + ISMS Copilot | Tokens del orquestador, solo | Tokens del orquestador, + ISMS Copilot |
|---|---|---|---|---|
| Verificación de brechas | 0.163 | 0.266 | 143,053 | 495,530 |
| Política de control de acceso | 0.105 | 0.218 | 131,748 | 427,071 |
| Entradas de SoA | 0.113 | 0.182 | 133,516 | 349,717 |
La delegación usó entre 1.6 y 2.1 veces más dinero de Claude aquí. Las ejecuciones con delegación requirieron más turnos (cargando las herramientas MCP, esperando la respuesta), Claude Code siguió leyendo todos los archivos locales y el entregable completo volvió a través de Claude Code, que luego lo escribió en el disco. Cuando una tarea es pequeña, Claude ya conoce la respuesta y no es necesario buscar nada, manténla en tu agente. Consulta qué delegar y qué mantener local.
Advertencias
- N pequeño. 3 ejecuciones por escenario y configuración, en un solo día.
- Un solo orquestador. Solo Claude Code. Las reglas de enrutamiento para Codex, Cursor, OpenCode y Grok están documentadas, pero esos orquestadores no se midieron.
- Un solo modelo.
claude-sonnet-5. Otro modelo o una versión posterior de Claude Code puede comportarse de manera diferente. - Una sola cuenta. Todos los turnos delegados se ejecutaron en una cuenta de producción de ISMS Copilot, cuyas memorias del lado del servidor pueden dar forma a las respuestas.
- Datos ficticios. Empresas, políticas y código inventados.
- Revisión de documentos no probada. El MCP no tiene una ruta de carga de documentos. Una revisión de una política de 40 páginas se ejecutó en v2 y fue un empate, pero Claude Code realizó la revisión en ambas configuraciones, por lo que no aporta información sobre ISMS Copilot revisando tus documentos.
- Autor de los elementos. Los elementos fueron escritos por un modelo de Claude, de la misma familia que el orquestador, a partir de los textos oficiales. Los elementos reservados se verificaron contra el texto oficial antes de las ejecuciones.
- Lo que se publica. Esta página incluye el método y todos los números principales. Las transcripciones en bruto siguen siendo privadas: contienen identificadores de conversación de producción y salidas literales del modelo. Las indicaciones de tareas, la clave de respuestas, el evaluador y las salidas evaluadas se guardan en nuestro repositorio interno y no se publican con esta página.
Lo que afirmamos y lo que no
Afirmamos:
- En los elementos probados en los cinco frameworks mencionados, Claude Code con ISMS Copilot igualó la precisión de Claude Code investigando solo con búsqueda web (un empate en precisión en todos los escenarios, según la regla preregistrada).
- En esas búsquedas y preguntas de consejos rápidos, gastó menos dinero de la API de Claude por respuesta correcta (aproximadamente la mitad en la ejecución de v3, aproximadamente tres cuartos en los elementos reservados) y aproximadamente lo mismo en una sesión larga mixta.
No afirmamos:
- Que ISMS Copilot sea más barato que Claude, ni ningún porcentaje de ahorro en tu factura.
- Respuestas mejores que las de Claude. Los resultados de precisión son empates.
- Nada sobre frameworks que no probamos, otros orquestadores o modelos, ni sobre la revisión de documentos.
- Que la delegación ahorre uso de Claude en tareas pequeñas que Claude ya conoce. Costó más allí.
- Que los turnos delegados sean gratuitos. Cuentan en tu plan de ISMS Copilot.
Volvemos a ejecutar este benchmark después de cambios en las herramientas MCP o en el conocimiento de frameworks de ISMS Copilot, y publicamos los nuevos números aquí con su fecha. Para el mecanismo detrás de estos números, consulta Qué ahorra la delegación (y qué no).