ISMS Copilot Docs

AI-modeltesten en -validatie

ISMS Copilot voert uitgebreide interne testen uit voordat nieuwe AI-modellen of modelupdates worden geïmplementeerd. Dit zorgt ervoor dat het platform audit-grade nauwkeurigheid behoudt…

Overzicht

ISMS Copilot voert uitgebreide interne testen uit voordat nieuwe AI-modellen of modelupdates worden geïmplementeerd. Dit zorgt ervoor dat het platform audit-grade nauwkeurigheid behoudt voor compliance-frameworks zoals ISO 27001, SOC 2 en ISO 42001.

Dit artikel legt onze modeltestworkflow uit en de kwaliteitsnormen die we toepassen voordat een model in productie gaat.

Testworkflow

Bij het evalueren van een nieuw model of modelvariant volgen we dit proces:

1. Geïsoleerde Branch-testing

We implementeren het kandidaatmodel in een speciale branch-omgeving. Dit isoleert het testen van productiesystemen en maakt een uitgebreide evaluatie mogelijk zonder actieve gebruikers te beïnvloeden.

2. Evaluatie van compliance-taken

We testen het model op kerncompliance-taken die het daadwerkelijke gebruik van ISMS Copilot vertegenwoordigen:

  • Framework mapping - Nauwkeurig in kaart brengen van controls tussen standaarden (bijv. ISO 27001 ↔ ISO 42001)
  • Nauwkeurigheid van control-referenties - Correct citeren van Annex A-controls versus beheerssysteemclausules
  • Beleidsgeneratie - Produceren van audit-klare documenten met de juiste structuur en terminologie
  • Gap-analyse - Identificeren van compliance-knelpunten in geüploade documenten

Testprompts gebruiken hetzelfde dynamische kennisinjectiesysteem dat productie aandrijft, wat zorgt voor realistische evaluatieomstandigheden.

3. Beslissingscriteria

Een model moet aan deze eisen voldoen om naar productie te gaan:

  • Nul control-hallucinaties - Geen verzonnen of verkeerd geïdentificeerde framework-controls
  • Structurele nauwkeurigheid - Correct onderscheid tussen Annex A-controls en clausules
  • Fouten erkennen - Vermogen om fouten te herkennen en te corrigeren wanneer hierop wordt gewezen
  • Prestatieverbeteringen - Meetbare verbeteringen (snelheid, tokenlimieten, kosten) zonder verlies van nauwkeurigheid

Modellen die niet slagen voor nauwkeurigheidstesten worden afgewezen, ongeacht prestatievoordelen. Werk gericht op audits vereist betrouwbaarheid boven snelheid.

4. Implementatiepijplijn

Als het testen slaagt:

  1. Implementeren in ontwikkelomgeving voor uitgebreide validatie
  2. Monitoren van prestaties in de praktijk en edge cases
  3. Implementeren in productie met terugdraaicapaciteit

Als het testen mislukt, keren we terug naar het vorige model en documenteren we de bevindingen voor toekomstig gebruik.

Praktijkvoorbeeld: Grok-4-Fast-Reasoning

Dit voorbeeld laat onze testnormen in actie zien.

Testcontext

Doelstelling: Evalueren van Grok-4-Fast-Reasoning als vervanging voor Grok-4 om tokenlimietfouten op te lossen en kosten te verlagen.

Testtaak: In kaart brengen van ISO 27001:2022-controls naar ISO 42001:2023-controls met nauwkeurige control-referenties zoals verstrekt in de context.

De fout

Het model produceerde deze mappingfout:

  • ISO 42001 Control: A.8.5 Informatie voor belanghebbenden
  • Grok-4-Fast-Reasoning toegewezen aan: A.7.4 Communicatie
  • Correcte mapping: Clausule 7.4 Communicatie (niet Annex A.7.4)

In ISO 27001:2022 is Annex A.7.4 "Fysieke beveiligingsmonitoring" (bewaking/detectie in faciliteiten). Het model verwardde het nummeren van Annex A-controls met het nummeren van beheerssysteemclausules – een fundamentele structurele fout voor compliance-werk.

Fouten erkennen mislukt

De reactie van het model op correctie was even zorgwekkend:

  1. Gevraagd om zijn fout te herkennen → Identificeerde de fout niet
  2. Specifiek gevraagd naar A.7.4 → Leverde correcte informatie maar erkende de fout in de tabel niet
  3. Direct uitgedaagd → Stelde "Ik heb niet gehallucineerd" en verdedigde de onjuiste mapping
  4. Erkende de fout pas nadat het "onbetrouwbaar" werd genoemd met de problematische tabel geciteerd

Beslissing

Resultaat: ❌ Niet geschikt voor productie

Redenering:

  • De snelheid was indrukwekkend, maar fouten in control-referenties zijn onacceptabel voor auditgerichte outputs
  • Slecht fouten erkennen kan gebruikers misleiden die op de output vertrouwen
  • Kan werken voor concepten, maar vereist menselijke validatie bij elke control-referentie

Genomen actie: Teruggekeerd naar Grok-4 voor productie-implementatie.

Wat dit betekent voor gebruikers

Wanneer u ISMS Copilot gebruikt, profiteert u van modellen die deze kwaliteitscontroles hebben doorstaan:

  • Framework-nauwkeurigheid - Controls en clausules worden correct gerefereerd
  • Betrouwbaarheid - Modellen die hallucineren of correctie weigeren, worden afgewezen
  • Auditgereedheid - Outputs zijn getest tegen echte compliance-mappingtaken

Hoewel we uitgebreid testen, controleer altijd AI-outputs aan de hand van officiële standaarden voordat u deze aan auditors voorlegt. Raadpleeg onze richtlijnen voor verantwoord gebruik voor best practices.

Gerelateerde bronnen

On this page