Self-Healing ML Pipelines: Automating Drift Detection and Remediation in Production Systems
Discuss this preprint
Start a discussion What are Sciety discussions?Listed in
This article is not in any list yet, why not save it to one of your lists.Abstract
Machine learning (ML) models deployed in production face inevitable challenges such as concept drift, data distribution shifts, and pipeline failures, which can erode performance and reliability. Traditional monitoring systems identify anomalies but require manual intervention, leading to delays in remediation and increased operational costs. This paper explores the paradigm of self-healing ML pipelines, which integrate automated drift detection with remediation mechanisms to sustain performance in dynamic environments. We examine architectural patterns, frameworks, and practical implementations that enable continuous monitoring, adaptive retraining, and pipeline recovery with minimal human input. Case studies from diverse sectors highlight how production-grade ML systems can evolve toward resilience, scalability, and long-term trustworthiness through automation. This work contributes a comprehensive survey of drift detection techniques, remediation strategies, and self-healing frameworks, offering insights for researchers and practitioners designing reliable production ML systems.