Machine learning-modellen falen niet op dezelfde manier als traditionele software. Ze geven geen foutmeldingen en crashen niet. Ze blijven voorspellingen genereren en die voorspellingen blijven er aannemelijk uitzien, terwijl de onderliggende nauwkeurigheid stilzwijgend afneemt. Een McKinsey-evaluatie van AI-risicobeheer merkt op dat modelmonitoring in productie de tracking van datadrift, modelstatistieken en bias-statistieken in resultaten moet behandelen als een continue discipline in plaats van een eenmalige validatiestap.
Dat is een beheersingsprobleem, en het is precies het soort probleem dat Lean Six Sigma-professionals al decennia lang oplossen met regelkaarten.
Datadrift en conceptdrift zijn twee nieuwe bronnen van bijzondere-oorzaakvariatie
In een fabricageproces is variatie afkomstig van machines, materialen, methoden en mensen. In een uitgerold model komt variatie voort uit de data die het voeden.
Een kwaliteitsmanager die een oorzakenanalyse uitvoert op een verslechterd model, moet deze veranderingen aan de invoerzijde (data drift) scheiden van gevallen waarin de relatie tussen de invoer en de juiste uitvoer zelf is veranderd (concept drift). Beide zijn procesvariatie. Geen van beide komt naar voren bij een code review.
Het mechanisme: de gemiddeldelijn, regelgrenzen en de Western Electric-regels
Een regelkaart toegepast op een modelstatistiek werkt op dezelfde manier als op een productielijn.
Toegepast op de dagelijkse nauwkeurigheid of het foutpercentage van een model, sporen deze regels geleidelijke verslechtering op die een eenvoudige drempelwaarde voor nauwkeurigheid over het hoofd zou zien.
Een klinische casus die het bestuderen waard is
Een peer-reviewed raamwerk uit 2024, ontwikkeld voor radiologische AI-systemen, laat zien hoe dit er in de praktijk uitziet. Onderzoekers combineerden SPC met machine learning om
op te sporen. Dat is een probleem met de gemiddelde runlengte (ARL), dezelfde statistiek die wordt gebruikt om te beoordelen hoe snel een traditionele regelkaart een verschoven proces signaleert.
Door machine learning verbeterde kaarten beginnen eenvoudige drempelwaarden te vervangen
SPC voor ML-drift staat evenmin stil.
, waarbij prestaties worden beoordeeld op basis van de gemiddelde runlengte. Dit is van belang voor professionals die moeten kiezen tussen een standaardbenadering voor procescapability en een meer adaptieve methode, een keuze die niet verschilt van de beslissingen over gereedschapsselectie die in elke module voor Lean Six Sigma-gereedschapsselectie worden onderwezen. Een recenter artikel uit 2025 over bootstrapped regelgrenzen voor concept drift gaat nog verder; hierin worden regelkaarten specifiek opgebouwd rond voorspellingsscores van modellen in plaats van ruwe kenmerkstatistieken. Dit voorkomt het probleem van vals alarm dat gewone Sigma-drempelwaarden veroorzaken wanneer data niet normaal verdeeld zijn.
Modelmonitoring integreren in een DMAIC-beheersplan
Niets van dit alles vervangt de discipline van DMAIC. Een programma voor modelmonitoring verdient zijn plaats in de Control-fase op dezelfde wijze als elk gestabiliseerd proces: definieer de statistiek (nauwkeurigheid, foutpercentage, het gemiddelde of aandeel van een kenmerk), stel grenzen vast op basis van een stabiele nulmetingsperiode en wijs een eigenaar toe om overschrijdingen te onderzoeken. Het engineeringteam van Databricks verwoordt het bij het beschrijven van productie-ML-pipelines heel helder:
, wat een governance-omschrijving is van exact wat een Black Belt de overgang van meten naar beheersen zou noemen.
Wie is de eigenaar van de kaart zodra het model in gebruik is genomen?
Iemand moet het onderzoek naar de overschrijding bezitten, en die eigenaarschapsvraag is waar de meeste modelmonitoringprogramma's stilzwijgend op mislukken. Een Black Belt weet al hoe hij een escalatiepad moet opstellen voor een buiten-controle-signaal op een bewerkt onderdeel; dezelfde vaardigheid kan worden toegepast op een nauwkeurigheidsdiagram van een model, mits het data science-team het gedrag bij de nulmeting duidelijk genoeg documenteert zodat iemand buiten het modelbouwteam het kan lezen. Sponsoring vanuit het leiderschap is hier specifiek van belang omdat waarschuwingen voor modeldrift gemakkelijk kunnen worden afgedaan als ruis, totdat een krediet-, fraude- of klinische beslissing misgaat in productie. Het inbouwen van dat eigenaarschap in een project charter, met een genoemde Process Owner en een gedocumenteerde reactiedrempel, is een standaard DMAIC-praktijk toegepast op een nieuw soort proces.
Bronnen
- Databricks (2019), Productionizing Machine Learning: From Deployment to Drift Detection: https://www.databricks.com/blog/2019/09/18/productionizing-machine-learning-from-deployment-to-drift-detection.html
- Zamzmi, G. et al. (2024/2025), Out-of-Distribution Detection and Radiological Data Monitoring Using Statistical Process Control, PMC: https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11950585/
- arXiv (2024), Out-of-Distribution Detection and Data Drift Monitoring using Statistical Process Control: https://arxiv.org/abs/2402.08088
- arXiv (2025), A Review of Artificial Intelligence Impacting Statistical Process Monitoring and Future Directions: https://arxiv.org/pdf/2503.01858
- arXiv (2025), Bootstrapped Control Limits for Score-Based Concept Drift Control Charts: https://arxiv.org/pdf/2507.16749
- JANUS Associates, NIST.AI.100-1 AI Risk Management Framework overview: https://janusassociates.com/resources/nist-ai-risk-management-framework/


