I modelli di machine learning non falliscono allo stesso modo del software tradizionale. Non generano eccezioni né vanno in crash. Continuano a produrre previsioni e tali previsioni continuano a sembrare plausibili, mentre l'accuratezza sottostante si erode silenziosamente. Una revisione di McKinsey sulle pratiche di gestione del rischio legato all'IA rileva che il monitoraggio dei modelli in produzione deve tracciare la deriva dei dati (data drift), le metriche del modello e le metriche di bias nei risultati come una disciplina continua piuttosto che come una fase di validazione una tantum.
Questo è un problema di controllo, ed è esattamente il tipo di problema che i professionisti del Lean Six Sigma risolvono con carte di controllo da decenni.
Data Drift e Concept Drift sono due nuove fonti di variazione per cause speciali
In un processo produttivo, la variazione proviene da macchine, materiali, metodi e persone. In un modello distribuito, la variazione proviene dai dati che lo alimentano.
Un responsabile della qualità che esegue un analisi delle cause radice su un modello degradato deve separare questi spostamenti dal lato degli input (data drift) dai casi in cui la relazione tra gli input e l'output corretto è cambiata essa stessa (concept drift). Entrambi rappresentano una variazione di processo. Nessuno dei due emerge durante una revisione del codice.
La meccanica: linea centrale, limiti di controllo e regole della Western Electric
A carta di controllo applicata a una metrica di un modello funziona nello stesso modo in cui funziona su una linea di produzione.
Applicate all'accuratezza o al tasso di errore giornaliero di un modello, queste regole rilevano un degrado graduale che una semplice soglia di accuratezza non coglierebbe.
Un caso clinico che vale la pena studiare
Un framework del 2024 sottoposto a revisione paritaria, creato per i sistemi di IA radiologica, mostra come questo si presenti nella pratica. I ricercatori hanno combinato la SPC con il machine learning per rilevare
Si tratta di un problema di ARL (Average Run Length), la stessa metrica utilizzata per valutare la rapidità con cui una carta di controllo tradizionale segnala un processo fuori controllo.
Le carte ottimizzate per il Machine Learning stanno iniziando a sostituire le soglie semplici
Anche la SPC per la deriva del ML non rimane statica.
, valutando le prestazioni in base all'Average Run Length. Questo è importante per i professionisti che devono scegliere tra un approccio la capacità del processo standard e uno più adattivo, un esercizio del tutto simile alle decisioni di selezione degli strumenti insegnate in qualsiasi Selezione degli strumenti Lean Six Sigma modulo. Un articolo più recente del 2025 sui limiti di controllo basati su bootstrap per la deriva dei concetti (concept drift) estende ulteriormente questo approccio, creando carte di controllo specificamente incentrate sui punteggi di previsione del modello anziché sulle statistiche grezze delle caratteristiche. Ciò evita il problema dei falsi allarmi che i semplici limiti sigma creano quando i dati non sono distribuiti normalmente.
Integrare il monitoraggio dei modelli in un piano di controllo DMAIC
Niente di tutto questo sostituisce la disciplina del DMAIC. Un programma di monitoraggio dei modelli guadagna il suo posto nella fase di Controllo allo stesso modo di qualsiasi processo stabilizzato: definire la metrica (accuratezza, tasso di errore, media o proporzione di una caratteristica), impostare i limiti a partire da un periodo baseline stabile e assegnare la responsabilità dell'analisi dei superamenti dei limiti. Il team di ingegneria di Databricks, descrivendo le pipeline di ML in produzione, lo afferma chiaramente:
, che è una descrizione di governance di ciò che un Black Belt definirebbe esattamente come il passaggio dalla misurazione al controllo.
Chi è il responsabile della carta di controllo una volta distribuito il modello
Qualcuno deve occuparsi dell'analisi dei superamenti dei limiti, ed è proprio su questa questione di titolarità che la maggior parte dei programmi di monitoraggio dei modelli fallisce silenziosamente. Un Black Belt sa già come definire un percorso di escalation per un segnale fuori controllo su un componente lavorato; la stessa competenza si trasferisce a una carta di accuratezza del modello, a condizione che il team di Data Science documenti il comportamento baseline in modo abbastanza chiaro da consentire a qualcuno esterno al team di sviluppo del modello di leggerlo. Il supporto della leadership è fondamentale qui proprio perché gli allarmi sulla deriva del modello sono facili da ignorare come semplice rumore di fondo fino a quando una decisione di credito, una frode o una scelta clinica non va storta in produzione. Integrare tale titolarità nel charter di progetto, con un Process Owner designato e una soglia di risposta documentata, è la normale DMAIC pratica applicata a un tipo di processo più recente.
Fonti
- Databricks (2019), Productionizing Machine Learning: From Deployment to Drift Detection: https://www.databricks.com/blog/2019/09/18/productionizing-machine-learning-from-deployment-to-drift-detection.html
- Zamzmi, G. et al. (2024/2025), Out-of-Distribution Detection and Radiological Data Monitoring Using Statistical Process Control, PMC: https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11950585/
- arXiv (2024), Out-of-Distribution Detection and Data Drift Monitoring using Statistical Process Control: https://arxiv.org/abs/2402.08088
- arXiv (2025), A Review of Artificial Intelligence Impacting Statistical Process Monitoring and Future Directions: https://arxiv.org/pdf/2503.01858
- arXiv (2025), Bootstrapped Control Limits for Score-Based Concept Drift Control Charts: https://arxiv.org/pdf/2507.16749
- JANUS Associates, NIST.AI.100-1 Panoramica dell'AI Risk Management Framework: https://janusassociates.com/resources/nist-ai-risk-management-framework/


