Qualità e grounding del modello
Cosa si nasconde dietro gli alias delle API, come la conoscenza curata raggiunge il modello, le valutazioni che supportano le nostre scelte di modelli e cosa non affermiamo.
Questa pagina risponde alla domanda che un ingegnere della compliance dovrebbe porsi prima di indirizzare un agente verso qualsiasi API di modello: perché questo modello sarebbe adatto al compito? Documenta cosa alimenta gli alias, come la conoscenza dei framework raggiunge il modello, le valutazioni dietro le nostre scelte di modelli e i limiti di ogni affermazione fatta qui.
La lineup
L'API offre un piccolo set di alias. Dietro di essi:
- La fascia standard (
isms-fast,isms-thinkinge le loro varianti-eu) esegue GLM 5.2, un modello open-weights di alto livello, con una finestra di contesto di 1M token. Il percorso globale e quello UE eseguono la stessa classe di modello; la differenza risiede nella regione di elaborazione, non nelle capacità. - La corsia bulk (
isms-mini) esegue Mistral Small, un modello più piccolo, per lavori ad alto volume che non richiedono un'analisi approfondita: formattazione, estrazione, classificazione, normalizzazione JSON.
I fornitori upstream esatti possono cambiare. Gli alias rappresentano il contratto stabile per la vostra integrazione e una modifica al modello dietro un alias segue i termini di aggiornamento.
Come la conoscenza raggiunge il modello
L'API non è un modello fine-tuned e la conoscenza sulla compliance non è nei pesi. Il meccanismo è l'iniezione al momento dell'inferenza:
- La vostra richiesta arriva come una normale chat completion compatibile con OpenAI.
- Il server rileva i framework nominati nei vostri messaggi (modalità
auto), oppure prende i moduli esatti che specificate conismscopilot: { "frameworks": [...] }. - Il modulo di riferimento curato per ogni framework selezionato viene assemblato nel prompt, insieme al prompt del server pubblicato e alla politica di Integrità del Riferimento.
- La risposta vi indica cosa è stato eseguito: l'intestazione
x-isms-frameworkse l'oggetto di rispostaismscopilotelencano ogni modulo iniettato con una stima dei token etichettata.
Questo è intenzionale. La conoscenza nei pesi non può essere sottoposta ad audit, datata o corretta per ogni risposta. La conoscenza nel prompt può esserlo: ogni modulo include un timbro di verifica, il catalogo è interrogabile e i byte iniettati vengono addebitati come normali token di input che potete vedere in usage.prompt_tokens.
Il grounding non è infallibile. L'iniezione di conoscenza fornisce un fondamento alla risposta quando viene selezionato un modulo. Non è un'affermazione che le allucinazioni siano impossibili, né è un'opinione di audit.
## Le prove archiviate
Ogni affermazione di qualità che facciamo internamente è supportata da valutazioni datate e registrate con metodo. Si tratta delle nostre valutazioni interne, con i campioni effettivamente utilizzati; leggere le avvertenze come parte dei risultati.
### Selezione del modello: GLM 5.2 vs Mistral Small (2026-07-03)
La valutazione in modalità duale che ha scelto GLM 5.2 per il livello standard. Tre attività di conformità (analisi dei gap ISO 27001, mappatura degli incidenti dei fornitori SOC 2, una DPIA GDPR), quattro rami, tre campioni ciascuno: 36 generazioni, giudicate alla cieca da un modello di frontiera secondo una rubrica a cinque criteri da 0 a 2. Entrambi i rami del modello sono stati eseguiti con iniezione di conoscenza.
| Ramo | Punteggio | Latenza mediana |
| --- | --- | --- |
| GLM 5.2, fast | 87.8 | 0,8 s |
| GLM 5.2, thinking | 90,0 | 1,0 s |
| Mistral Small, fast | 73,3 | 10,4 s |
| Mistral Small, thinking | 74,4 | 23,7 s |
Avvertenze registrate nel report: esecuzione in un solo giorno, N=9 per ramo; non interpretare le differenze per attività come significative; la latenza è stata misurata in condizioni di valutazione, non in produzione, e non la comunichiamo pubblicamente.
### Trappole di citazione (2026-08-17)
Cinque trappole di prompt progettate per rilevare invenzioni di fatti di conformità: esclusione della portata, ambito di ricerca e sviluppo, dipendenza da persone chiave, conservazione dei log e una ridenominazione benigna che non dovrebbe attivare nulla. GLM 5.2 (thinking) ha superato 5 su 5. Mistral Small ne ha superate 4 su 5, fallendo la trappola sulla conservazione dei log. Si tratta della ripetizione fedele; un tentativo precedente di punteggio con un valutatore più grezzo è stato segnalato come non decisivo nei nostri documenti di progettazione e non conta come prova.
### Porte per prompt ostili (2026-08-17)
Gli stessi pesi di GLM 5.2 servono al nostro prodotto heyGRC, il cui lancio include suite di resistenza a prompt ostili e a iniezioni. GLM ha superato l'intera suite due volte consecutive (core, ostile, baseline, benign, grounding: tutti verdi). Mistral Small aveva precedentemente fallito la suite ostile. Corroborante, non indipendente: stessi pesi, diverso sistema di prodotto.
### Disciplina del prompt del server (2026-08-02)
Il prompt del server pubblicato è stato distribuito solo dopo un gate pre-registrato: le regole sono state congelate prima dell'esecuzione, poi 848 chiamate attraverso gli alias. Esecuzione finale: 20/20 di accuratezza su fixture baseline corrette (nessuna regressione da iniezione), 16/16 di attribuzione corretta dell'identità, 24/24 di rifiuto dell'estrazione di proprietà intellettuale. Il primo tentativo ha fallito una regola e il prompt è stato iterato, non le regole; il fallimento è registrato nel file dei risultati.
### Determinismo di rilevamento (2026-06-05)
Il rilevamento del framework in modalità `auto` è una funzione deterministica e testata, non una chiamata al modello. Il suo gate di valutazione registra una precisione/richiamo superiore al 98% sul set di fixture e viene eseguito in CI ad ogni modifica.
## Verifica che puoi controllare
Non devi fidarti di questa pagina. Tutto ciò che descrive è osservabile tramite una singola chiamata API:
- `GET /v1/frameworks` elenca il catalogo attivo (101 moduli osservati il 2026-08-26; l'endpoint attivo è autorevole, non questo numero).
- `GET /v1/frameworks/changelog` registra aggiunte, correzioni e aggiornamenti di verifica del registro con le date.
- [Il system prompt è pubblicato integralmente](/docs/api/system-prompt) e `x-isms-policy-version` indica la versione che ha servito ogni richiesta.
- `x-isms-frameworks` ti dice cosa è stato iniettato nella tua richiesta, ogni volta.
- La postura di zero conservazione dei dati è documentata in [Zero conservazione dei dati](/docs/api/zero-data-retention).Cosa non affermiamo
- Non affermiamo che la qualità sia superiore a quella di Claude o di qualsiasi altro modello di frontiera. Non esistiamo valutazioni comparative dirette contro le API raw dei modelli di frontiera. È in fase di progettazione un benchmark consapevole del modello (i nostri alias rispetto ai modelli raw di frontiera, con pubblicazione delle perdite insieme ai successi); fino al completamento di tale valutazione, non viene fatta alcuna affermazione di questo tipo nei nostri contenuti.
- Non affermiamo che la conoscenza corrisponda al testo dello standard. I moduli sono riferimenti curati assemblati da noi; gli standard protetti da copyright devono essere acquistati da voi se avete bisogno del testo originale.
- Non affermiamo che la rilevazione sia esaustiva. Nella modalità
auto, la rilevazione avviene a livello di nome: un semplice numero di controllo senza il nome del framework non può fornire alcun risultato. Specificate il framework quando lo conoscete. - Non pubblichiamo dati di latenza. Le misurazioni delle condizioni di valutazione non sono misurazioni di produzione.
- Qui non viene fornita alcuna opinione di audit o consulenza legale.
La scelta che ne consegue
Per lavori di compliance, il caso è questo: un modello open-weights robusto, con grounding su richiesta in un riferimento mantenuto e verificabile, con disclosure per ogni risposta di ciò che è stato iniettato, a un prezzo pensato per il throughput su scala agentica. Per ragionamenti complessi di frontiera, input multimodali o agenti con tool-calling, un'API di frontiera potrebbe comunque essere lo strumento giusto e qui non viene vietata un'architettura ibrida che utilizzi entrambi. Consultate Modelli e regioni per la tabella degli alias e Conoscenza dei framework per i meccanismi di iniezione.