Machine learning-modellen falen niet op dezelfde manier als traditionele software. Ze genereren geen uitzonderingen en crashen niet. Ze blijven voorspellingen doen, en die voorspellingen blijven er aannemelijk uitzien, terwijl de onderliggende nauwkeurigheid geruisloos afneemt. In een review van McKinsey over AI-risicobeheer wordt opgemerkt dat het monitoren van modellen in productie het volgende moet bijhouden: datadrift, modelstatistieken en biasstatistieken in resultaten als een continue discipline in plaats van een eenmalige validatiestap.
Dat is een beheersingsprobleem, en het is precies het soort probleem dat Lean Six Sigma-professionals al tientallen jaren oplossen met of .
Datadrift en conceptdrift zijn twee nieuwe bronnen van bijzondere-oorzaakvariatie
In een productieproces is variatie afkomstig van machines, materialen, methoden en mensen. Bij een ingezet model is variatie afkomstig van de data die het model voeden.
Een kwaliteitsmanager die oorzakenanalyse uitvoert op een verslechterd model, moet deze fricties aan de invoerzijde (datadrift) scheiden van gevallen waarin de relatie tussen de invoer en de juiste uitvoer zelf is veranderd (conceptdrift). Beide zijn procesvariatie. Geen van beide komt naar voren bij een code-review.
Het mechanisme: de gemiddeldelijn, regelgrenzen en de Western Electric-regels
A regelkaart toegepast op een modelstatistiek werkt op dezelfde manier als op een productielijn.
Toegepast op de dagelijkse nauwkeurigheid of het foutpercentage van een model, sporen deze regels geleidelijke achteruitgang op die een eenvoudige drempelwaarde voor nauwkeurigheid over het hoofd zou zien.
Een klinische casus die het bestuderen waard is
Een peer-reviewed kader uit 2024, ontwikkeld voor radiologische AI-systemen, laat zien hoe dit er in de praktijk uitziet. Onderzoekers combineerden SPC met machine learning om het volgende op te sporen:
Dat is een 'average run length'-probleem, dezelfde metriek die wordt gebruikt om te beoordelen hoe snel een traditionele regelkaart een verschoven proces signaleert.
Door machine learning verbeterde kaarten beginnen eenvoudige drempelwaarden te vervangen
SPC voor ML-drift staat evenmin stil.
, waarbij prestaties worden beoordeeld op basis van 'average run length'. Dit is van belang voor professionals die moeten kiezen tussen een standaard procescapability -benadering en iets flexibelers, een keuze die niet verschilt van de beslissingen over gereedschapsselectie die in elke Lean Six Sigma tool selection -module. Een recenter wetenschappelijk artikel uit 2025 over gebootstrappte regelgrenzen voor conceptdrift gaat nog verder. Hierin worden regelkaarten specifiek opgebouwd rond voorspellingsscores van modellen in plaats van ruwe kenmerkstatistieken, wat het probleem van vals alarm voorkomt dat gewone sigma-grenzen veroorzaken wanneer data niet normaal verdeeld zijn.
Modelmonitoring integreren in een DMAIC-beheersplan
Niets van dit alles vervangt de discipline van DMAIC. Een modelmonitoringprogramma verdient zijn plaats in de Control-fase op dezelfde manier als elk gestabiliseerd proces: definieer de metriek (nauwkeurigheid, foutpercentage, het gemiddelde of aandeel van een kenmerk), stel grenzen vast op basis van een stabiele nulmetingsperiode en wijs eigenaarschap toe voor het onderzoeken van overschrijdingen. Het engineeringteam van Databricks, dat productie-ML-pipelines beschrijft, verwoordt het duidelijk:
, wat een governance-beschrijving is van precies wat een Black Belt de overgang van meten naar beheersen zou noemen.
Wie is de eigenaar van de kaart zodra het model in gebruik is genomen?
Iemand moet het onderzoek naar afwijkingen beheren, en die kwestie van eigenaarschap is waar de meeste modelmonitoringprogramma's stilzwijgend op stuklopen. Een Black Belt weet al hoe hij een escalatiepad moet opstellen voor een 'out-of-control'-signaal op een bewerkt onderdeel; dezelfde vaardigheid kan worden toegepast op een kwaliteitsgrafiek voor de nauwkeurigheid van een model, mits het data science-team het basisgedrag duidelijk genoeg documenteert voor iemand buiten het modelbouwteam. Sponsoring door het management is hier specifiek van belang omdat waarschuwingen voor modeldrift gemakkelijk als ruis worden afgedaan totdat een krediet-, fraude- of klinische beslissing in productie misgaat. Het verankeren van dat eigenaarschap in een project charter, met een benoemde Process Owner en een gedocumenteerde reactiedrempel, is een standaard DMAIC -praktijk toegepast op een nieuwer soort proces.
Bronnen
- Databricks (2019), Productionizing Machine Learning: From Deployment to Drift Detection: https://www.databricks.com/blog/2019/09/18/productionizing-machine-learning-from-deployment-to-drift-detection.html
- Zamzmi, G. et al. (2024/2025), Out-of-Distribution Detection and Radiological Data Monitoring Using Statistical Process Control, PMC: https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11950585/
- arXiv (2024), Out-of-Distribution Detection and Data Drift Monitoring using Statistical Process Control: https://arxiv.org/abs/2402.08088
- arXiv (2025), A Review of Artificial Intelligence Impacting Statistical Process Monitoring and Future Directions: https://arxiv.org/pdf/2503.01858
- arXiv (2025), Bootstrapped Control Limits for Score-Based Concept Drift Control Charts: https://arxiv.org/pdf/2507.16749
- JANUS Associates, NIST.AI.100-1 AI Risk Management Framework overview: https://janusassociates.com/resources/nist-ai-risk-management-framework/


