La Régression Logistique en Maintenance Prédictive : Ce Qu'elle Peut (et Ne Peut Pas) Prédire
La régression logistique est peu coûteuse, interprétable et bien maîtrisée — mais elle répond à une question plus étroite que ce que pensent la plupart des équipes de maintenance, et savoir précisément laquelle détermine si elle a sa place dans le pipeline.


La régression logistique revient régulièrement dans les pipelines de maintenance prédictive, et pour de bonnes raisons : son ajustement est rapide, ses coefficients s'interprètent directement comme l'effet de chaque covariable sur les chances de défaillance, et elle se dégrade avec souplesse sur les jeux de données modestes et imparfaits dont disposent réellement les équipes industrielles. L'erreur récurrente n'est pas de la choisir — c'est d'attendre d'elle une réponse à une question qu'elle n'a jamais été conçue pour traiter.
La régression logistique est peu coûteuse, interprétable et bien maîtrisée — mais elle répond à une question plus étroite que ce que pensent la plupart des équipes de maintenance, et savoir précisément laquelle détermine si elle a sa place dans le pipeline.
§ 02Ce que Produit Réellement un Classifieur Binaire de Défaillance
Un modèle de régression logistique entraîné pour la maintenance prédit la probabilité qu'un actif tombe en panne dans une fenêtre fixe — les 30 prochains jours, le prochain cycle de maintenance — à partir d'un instantané de covariables au moment du scoring. C'est une sortie fondamentalement différente de l'estimation de durée de vie utile restante d'un modèle de survie : elle indique à un planificateur quel est le degré d'urgence d'un actif par rapport aux autres de la flotte cette semaine, pas précisément quand il risque de tomber en panne. Pour le triage et la priorisation des ordres de travail, c'est souvent exactement le niveau de granularité nécessaire, et moins coûteux à obtenir correctement qu'un modèle de survie complet — l'erreur consiste à interpréter un score d'urgence bien calibré comme un calendrier.
§ 03Où les Hypothèses du Modèle Cèdent
Le modèle suppose une relation linéaire entre chaque covariable et le logarithme des chances de défaillance, ce que la dégradation mécanique viole systématiquement — l'effet de l'amplitude de vibration sur le risque de défaillance est rarement une droite ; il reste plat pendant longtemps puis s'accélère brusquement en fin de vie, un profil qu'un modèle linéaire en log-odds ne capture que si l'on construit manuellement à l'avance les bons termes d'interaction et polynomiaux. Le second défaut, plus discret, est le déséquilibre des classes : les défaillances sont rares par construction dans une flotte bien entretenue, et un modèle entraîné sans rééquilibrage ou pondération délibérée atteint souvent une précision élevée en prédisant simplement « pas de défaillance » pour presque tout — un modèle inutile déguisé en bon modèle.
§ 04Quand Elle Reste le Bon Choix
Elle trouve sa place dans trois situations : comme référence rapide que tout modèle plus élaboré doit surpasser avant que sa complexité supplémentaire soit justifiée, dans les régimes de données réellement restreintes où un ensemble d'arbres ou un modèle neuronal surapprendrait bien avant de converger, et partout où une décision de maintenance doit être expliquée à un auditeur de sécurité ou à un régulateur en termes de facteurs précis et nommés plutôt que par un score de boîte noire. Rien de tout cela ne plaide contre des modèles plus sophistiqués — cela plaide pour savoir laquelle de ces trois conditions s'applique réellement avant d'en choisir un.


