Calidad y fundamentación del modelo
Qué hay detrás de los alias de las APIs, cómo el conocimiento curado llega al modelo, el registro de evaluaciones detrás de nuestras elecciones de modelos y qué no afirmamos.
Esta página responde a la pregunta que un ingeniero de cumplimiento debería hacerse antes de dirigir un agente a cualquier API de modelo: ¿por qué este sería bueno para el trabajo? Documenta qué sirve a los alias, cómo el conocimiento de los marcos normativos llega al modelo, las evaluaciones detrás de nuestras elecciones de modelos y los límites de cada afirmación realizada aquí.
La gama de modelos
La API sirve un pequeño conjunto de alias. Detrás de ellos:
- La categoría estándar (
isms-fast,isms-thinkingy sus variantes-eu) ejecuta GLM 5.2, un modelo de código abierto robusto, con una ventana de contexto de 1 millón de tokens. La ruta global y la ruta de la UE ejecutan la misma clase de modelo; la diferencia es la región de procesamiento, no la capacidad. - La vía de alto volumen (
isms-mini) ejecuta Mistral Small, un modelo más pequeño, para trabajos de alto volumen que no requieren un análisis profundo: formato, extracción, clasificación y normalización de JSON.
Los proveedores aguas arriba exactos pueden cambiar. Los alias son el contrato estable para tu integración, y un cambio en el modelo detrás de un alias sigue los términos de actualización.
Cómo el conocimiento llega al modelo
La API no es un modelo afinado, y el conocimiento de cumplimiento no está en los pesos. El mecanismo es la inyección en el momento de la inferencia:
- Tu solicitud llega como una finalización de chat compatible con OpenAI.
- El servidor detecta los marcos normativos mencionados en tus mensajes (modo
auto), o toma los módulos exactos que especificas conismscopilot: { "frameworks": [...] }. - El módulo de referencia curado para cada marco normativo seleccionado se ensambla en el mensaje, junto con el mensaje del sistema del servidor publicado y la política de Integridad de Referencia.
- La respuesta te indica qué se ejecutó: el encabezado
x-isms-frameworksy el objeto de respuestaismscopilotenumeran cada módulo inyectado con una estimación de tokens etiquetada.
Esto es deliberado. El conocimiento en los pesos no puede ser auditado, fechado ni corregido por respuesta. El conocimiento en el mensaje sí puede serlo: cada módulo lleva un sello de verificación, el catálogo es consultable, y los bytes inyectados se facturan como tokens de entrada ordinarios que puedes ver en usage.prompt_tokens.
Lo fundamentado no es infalible. La inyección de conocimiento fundamenta la respuesta cuando se selecciona un módulo. No es una afirmación de que las alucinaciones sean imposibles, ni es una opinión de auditoría.
## La evidencia en archivo
Cada afirmación de calidad que realizamos internamente está respaldada por una evaluación registrada con fecha y método. Se trata de nuestras propias evaluaciones internas, con los tamaños de muestra que realmente ejecutamos; lea las advertencias como parte de los resultados.
### Selección de modelos: GLM 5.2 vs Mistral Small (2026-07-03)
La evaluación en modo dual que eligió GLM 5.2 para el nivel estándar. Tres tareas de cumplimiento (análisis de brechas ISO 27001, mapeo de incidentes de proveedores SOC 2, una DPIA de GDPR), cuatro brazos, tres muestras cada uno: 36 generaciones, evaluadas de forma ciega por un modelo de frontera según una rúbrica de cinco criterios de 0 a 2. Ambos brazos del modelo se ejecutaron con inyección de conocimiento.
| Brazo | Puntuación | Latencia mediana |
| --- | --- | --- |
| GLM 5.2, rápido | 87.8 | 0.8 s |
| GLM 5.2, thinking | 90.0 | 1.0 s |
| Mistral Small, rápido | 73.3 | 10.4 s |
| Mistral Small, thinking | 74.4 | 23.7 s |
Advertencias registradas en el informe: ejecución en un solo día, N=9 por brazo; no interprete las diferencias por tarea como significativas; la latencia se midió en condiciones de evaluación, no en producción, y no la citamos públicamente.
### Trampas de citación (2026-08-17)
Cinco trampas de prompts diseñadas para detectar inventos confiados de hechos de cumplimiento: alcance de exclusión, alcance de investigación y desarrollo, dependencia de personas clave, retención de registros y un cambio de nombre benigno que no debería activar nada. GLM 5.2 (thinking) aprobó 5 de 5. Mistral Small aprobó 4 de 5, fallando en la trampa de retención de registros. Esta es la repetición fiel; un intento anterior de puntuación con un evaluador más rudimentario se marcó como no decisivo en nuestros documentos de diseño y no cuenta como evidencia.
### Puertas de prompts hostiles (2026-08-17)
Los mismos pesos de GLM 5.2 sirven a nuestro producto heyGRC, cuya puerta de lanzamiento incluye suites de resistencia a inyecciones y hostiles. GLM aprobó la puerta completa dos veces consecutivas (núcleo, hostil, línea base, benigno, grounding: todo en verde). Mistral Small había fallado previamente en la suite hostil. Corroborante, no independiente: mismos pesos, diferente arnés del producto.
### Disciplina del prompt del servidor (2026-08-02)
El prompt del servidor publicado solo se lanzó después de una puerta pre-registrada: las reglas se congelaron antes de la ejecución, luego 848 llamadas en los alias. Ejecución final: 20/20 de precisión en fixtures de corrección de línea base (sin regresión por inyección), 16/16 de atribución correcta de identidad, 24/24 de denegación de elicitación de propiedad intelectual. La primera ejecución falló una regla y el prompt se iteró, no las reglas; el fallo está registrado en el archivo de resultados.
### Determinismo de detección (2026-06-05)
La detección de frameworks en modo `auto` es una función determinista y probada, no una llamada al modelo. Su puerta de evaluación tiene una precisión y exhaustividad del 98%+ en el conjunto de fixtures, y se ejecuta en CI en cada cambio.
## Verificación que puedes comprobar
No tienes que confiar en esta página. Todo lo que describe es observable desde una sola llamada a la API:
- `GET /v1/frameworks` enumera el catálogo en vivo (101 módulos observados el 2026-08-26; el endpoint en vivo es autoritativo, no este número).
- `GET /v1/frameworks/changelog` registra adiciones, correcciones y actualizaciones de verificación en el registro con fechas.
- [El prompt del sistema se publica textualmente](/docs/api/system-prompt) y `x-isms-policy-version` nombra la versión que sirvió cada solicitud.
- `x-isms-frameworks` le indica qué se inyectó en su propia solicitud, cada vez.
- La postura de cero retención de datos está documentada en [Cero retención de datos](/docs/api/zero-data-retention).Qué no afirmamos
- No afirmamos que la calidad sea superior a la de Claude o cualquier otro modelo de vanguardia. No existe en nuestros registros ninguna evaluación directa frente a las APIs de modelos de vanguardia sin procesar. Está en fase de diseño un benchmark consciente del modo (nuestros alias frente a modelos de vanguardia sin procesar, publicando pérdidas junto a victorias); hasta que se ejecute, no se realiza ninguna afirmación al respecto en ningún lugar de nuestro material.
- No afirmamos que el conocimiento sea el texto del estándar. Los módulos son referencias curadas compiladas por nosotros; los estándares con derechos de autor en sí deben ser licenciados por usted si necesita el texto original.
- No afirmamos que la detección sea exhaustiva. En el modo
auto, la detección es a nivel de nombre: un número de control sin el nombre del marco de referencia no puede inyectar nada. Especifique el marco de referencia cuando lo conozca.
⚠️ Importante No publicamos números de latencia. Las mediciones en condiciones de evaluación no son mediciones de producción.
- Nada aquí constituye una opinión de auditoría ni asesoramiento legal.
Qué implica esta elección
Para trabajos de cumplimiento, el caso es: un modelo de pesos abiertos robusto, fundamentado bajo demanda en una referencia mantenida y verificable, con divulgación por respuesta de lo inyectado, a un precio diseñado para un rendimiento a escala de agentes. Para razonamiento avanzado de frontera, entrada multimodal o agentes con llamadas a herramientas, una API de modelos de vanguardia puede seguir siendo la herramienta adecuada, y nada aquí lo prohíbe. Consulte Modelos y regiones para ver la tabla de alias y Conocimiento de marcos de referencia para conocer los mecanismos de inyección.