Qualité et ancrage des modèles
Ce qui se cache derrière les alias d'API, comment les connaissances sélectionnées parviennent au modèle, les évaluations derrière nos choix de modèles, et ce que nous ne revendiquons pas.
Cette page répond à la question qu'un ingénieur en conformité devrait se poser avant de pointer un agent vers une API de modèle : pourquoi celui-ci serait-il adapté à la tâche ? Elle documente ce qui alimente les alias, comment les connaissances sur les cadres réglementaires parviennent au modèle, les évaluations derrière nos choix de modèles, ainsi que les limites de chaque affirmation présentée ici.
La gamme de modèles
L'API propose un petit ensemble d'alias. Voici ce qui les alimente :
- Niveau standard (
isms-fast,isms-thinking, et leurs variantes-eu) utilise GLM 5.2, un modèle open-weights performant, avec une fenêtre de contexte de 1 million de tokens. Le chemin global et le chemin UE utilisent la même classe de modèle ; la différence réside uniquement dans la région de traitement, et non dans les capacités. - Voie rapide (
isms-mini) utilise Mistral Small, un modèle plus petit, pour les tâches à haut volume ne nécessitant pas d'analyse approfondie : mise en forme, extraction, classification, normalisation JSON.
Les fournisseurs en amont exacts peuvent changer. Les alias constituent le contrat stable pour votre intégration, et toute modification du modèle derrière un alias suit les conditions de mise à niveau.
Comment les connaissances parviennent au modèle
L'API n'est pas un modèle affiné, et les connaissances en conformité ne sont pas intégrées dans les poids. Le mécanisme repose sur une injection au moment de l'inférence :
- Votre requête arrive sous forme de complétion de conversation compatible OpenAI.
- Le serveur détecte les cadres réglementaires nommés dans vos messages (mode
auto), ou prend les modules exacts que vous spécifiez avecismscopilot: { "frameworks": [...] }. - Le module de référence sélectionné pour chaque cadre est intégré dans l'invite, accompagné de l'invite serveur publié et de la politique d'intégrité des références.
- La réponse vous indique ce qui a été utilisé : l'en-tête
x-isms-frameworkset l'objet de réponseismscopilotlistent chaque module injecté avec une estimation de tokens étiquetée.
Ceci est intentionnel. Les connaissances intégrées dans les poids ne peuvent pas être auditées, datées ou corrigées par réponse. Les connaissances injectées dans l'invite le peuvent : chaque module porte un tampon de vérification, le catalogue est interrogeable, et les octets injectés sont facturés comme des tokens d'entrée ordinaires que vous pouvez consulter dans usage.prompt_tokens.
L'ancrage n'est pas infaillible. L'injection de connaissances ancrent la réponse lorsqu'un module est sélectionné. Cela ne signifie pas que les hallucinations sont impossibles, et ce n'est pas une opinion d'audit.
## Les preuves disponibles
Toute affirmation de qualité que nous formulons en interne est étayée par une évaluation datée et enregistrée selon une méthode rigoureuse. Il s'agit de nos propres évaluations internes, avec les tailles d'échantillons réellement utilisées ; veuillez consulter les mises en garde dans le cadre des résultats.
### Sélection des modèles : GLM 5.2 vs Mistral Small (2026-07-03)
L'évaluation en mode dual qui a conduit au choix de GLM 5.2 pour le niveau standard. Trois tâches de conformité (analyse des écarts ISO 27001, cartographie des incidents fournisseurs SOC 2, une DPIA RGPD), quatre branches, trois échantillons chacune : 36 générations, évaluées en aveugle par un modèle de pointe selon une grille de notation de cinq critères notés de 0 à 2. Les deux branches du modèle ont fonctionné avec injection de connaissances.
| Branche | Score | Latence médiane |
| --- | --- | --- |
| GLM 5.2, fast | 87.8 | 0,8 s |
| GLM 5.2, thinking | 90,0 | 1,0 s |
| Mistral Small, fast | 73,3 | 10,4 s |
| Mistral Small, thinking | 74,4 | 23,7 s |
Mises en garde telles qu'enregistrées dans le rapport : exécution sur une seule journée, N=9 par branche ; ne pas interpréter les différences par tâche comme significatives ; la latence a été mesurée dans des conditions d'évaluation, non en production, et nous ne la communiquons pas publiquement.
### Pièges de citation (2026-08-17)
Cinq pièges de prompt conçus pour détecter l'invention confiante de faits de conformité : portée d'exclusion, portée de recherche et développement, dépendance à une personne clé, conservation des journaux, et un renommage anodin qui ne devrait déclencher aucune alerte. GLM 5.2 (thinking) a réussi 5 tests sur 5. Mistral Small en a réussi 4 sur 5, échouant au piège de la conservation des journaux. Il s'agit du réexamen fidèle ; une tentative de notation antérieure avec un système de notation moins précis avait été marquée comme non décisive dans nos documents de conception et ne compte pas comme preuve.
### Portes d'entrée des prompts hostiles (2026-08-17)
Les mêmes poids de GLM 5.2 alimentent notre produit heyGRC, dont la porte d'entrée de lancement inclut des suites de résistance aux attaques et aux injections. GLM a réussi l'intégralité de la porte d'entrée à deux reprises consécutives (noyau, hostile, de base, anodin, ancrage : tous au vert). Mistral Small avait précédemment échoué à la suite hostile. Élément de corroboration, non indépendant : mêmes poids, différents environnements de test.
### Discipline du prompt serveur (2026-08-02)
Le prompt serveur publié n'a été finalisé qu'après une porte d'entrée préenregistrée : les règles étaient figées avant l'exécution, puis 848 appels ont été effectués sur les alias. Exécution finale : 20/20 de précision sur les cas de test de base (pas de régression due aux injections), 16/16 attributions correctes d'identité, 24/24 refus d'extraction de propriété intellectuelle. La première exécution a échoué à une règle et le prompt a été itéré, sans modification des règles ; cet échec est enregistré dans le fichier de résultats.
### Déterminisme de détection (2026-06-05)
La détection de cadre en mode `auto` est une fonction déterministe et testée, et non un appel de modèle. Sa porte d'entrée d'évaluation affiche une précision/rappel de 98 % ou plus sur l'ensemble de tests, et elle s'exécute en CI à chaque modification.
## Vérifications que vous pouvez effectuer
Vous n'êtes pas obligé de faire confiance à cette page. Tout ce qu'elle décrit peut être vérifié via un seul appel API :
- `GET /v1/frameworks` liste le catalogue en direct (101 modules observés le 2026-08-26 ; le point de terminaison en direct fait foi, pas ce chiffre).
- `GET /v1/frameworks/changelog` enregistre les ajouts, corrections et rafraîchissements de vérification du registre, avec leurs dates.
- [Le prompt système est publié intégralement](/docs/api/system-prompt), et `x-isms-policy-version` indique la version qui a servi chaque requête.
- `x-isms-frameworks` vous indique ce qui a été injecté dans votre propre requête, à chaque fois.
- La politique de non-conservation des données est documentée dans [Non-conservation des données](/docs/api/zero-data-retention).Ce que nous ne revendiquons pas
- Nous ne revendiquons pas une supériorité de qualité par rapport à Claude ou à tout autre modèle de pointe. Aucune évaluation comparative directe avec les API brutes de modèles de pointe n'est disponible pour l'instant. Un benchmark adapté aux modes (nos alias par rapport aux modèles bruts de pointe, publiant les pertes ainsi que les victoires) est en cours de conception ; tant qu'il n'est pas exécuté, aucune telle revendication n'est faite dans notre documentation.
- Nous ne revendiquons pas que les connaissances correspondent au texte exact de la norme. Les modules sont des références sélectionnées et assemblées par nos soins ; les normes protégées par copyright doivent être licenciées par vous si vous avez besoin du texte source.
- Nous ne revendiquons pas une détection exhaustive. En mode
auto, la détection se fait au niveau du nom : un simple numéro de contrôle sans nom de cadre ne peut rien injecter. Spécifiez le cadre lorsque vous le connaissez. - Nous ne communiquons pas publiquement de chiffres de latence. Les mesures effectuées dans des conditions d'évaluation ne sont pas des mesures de production.
- Rien ici ne constitue un avis d'audit ou un conseil juridique.
Ce que cela implique pour votre choix
Pour les travaux de conformité, l'option est la suivante : un modèle à poids ouverts performant, ancré à la demande dans une référence maintenue et vérifiable, avec une divulgation par réponse de ce qui a été injecté, à un prix adapté au débit des agents. Pour des raisonnements complexes nécessitant des modèles de pointe, des entrées multimodales ou des agents utilisant des outils, une API de modèle de pointe peut rester l'outil approprié, et rien ici n'interdit une architecture hybride utilisant les deux. Consultez Modèles et régions pour le tableau des alias et Connaissances des cadres pour les mécanismes d'injection.