bacground gradient shape
background gradient
background gradient

IA

Intervalles de prédiction : pourquoi une prévision ponctuelle est un pari, pas une prédiction.

Intervalles de prédiction : pourquoi une prévision ponctuelle est un pari, pas une prédiction.

Votre outil de maintenance annonce la panne de la pompe P-204 dans 18 jours. Il ne dit pas à quel point ce chiffre est sûr. Sans intervalles de prédiction, personne ne sait s'il faut immobiliser la ligne ou la laisser tourner.

Ce chiffre arrive seul. « 18 jours ± 6 jours » et « 18 jours ± 40 jours » affichent la même date et commandent deux décisions opposées : dans un cas on planifie l'arrêt, dans l'autre on instrumente et on réévalue. Une prévision sans son intervalle n'est pas une prédiction. C'est un pari avec un point décimal.

Une sortie ponctuelle n'est pas arbitrable

Un MES affiche une date de fin de série. Un ERP affiche un volume à produire. Un modèle de maintenance prédictive affiche un délai avant défaillance. Les trois sortent un nombre propre, directement consommable par le système aval. Aucun des trois n'affiche son incertitude.

C'est ce qui les rend inexploitables au moment de décider. Une décision industrielle se prend sur un écart : entre ce que le modèle annonce et ce qu'il pourrait annoncer s'il se trompait. Sans cet écart, la prévision n'est pas arbitrable. Le responsable maintenance ne peut ni la suivre ni la rejeter avec un argument. Il la suit par habitude, ou il l'ignore par prudence.

Les capteurs n'y sont pour rien. Un réseau de capteurs IIoT (industrial IoT sensors) qui remonte vibration, température et données de production donne au modèle une matière abondante. Le modèle restitue un point, et ce qu'il sait de sa propre incertitude s'arrête à l'entrée de l'inférence. Une bonne précision agrégée (RMSE, MAPE) masque d'ailleurs les prévisions sur lesquelles il se trompe le plus lourdement.

Une erreur moyenne ne dit rien de la prévision en cours

Le RMSE est une statistique de lot, pas une propriété de la prévision du moment

Le RMSE est au modèle ce que le MTBF est au parc : une moyenne rétrospective qui ne dit rien de la machine devant vous. Les indicateurs classiques de maintenance (MTBF, MTTR, disponibilité, OEE) décrivent un comportement d'ensemble sur une période passée. Personne ne s'en sert pour décider de démonter un roulement ce mardi.

Le RMSE fonctionne pareil. Calculé après coup, sur un jeu de test, sur des centaines de séries. Il ne se transporte pas sur la prévision affichée à l'écran. Un modèle au RMSE excellent produit quand même des prévisions locales très mauvaises, et il les produit avec la même assurance typographique que les bonnes. C'est la limite de fond de toute métrique de précision globale.

Ce que les compétitions M4 et M5 ont montré

La communauté académique de la prévision a réglé ce débat il y a plusieurs années. Les compétitions M reposent sur des métriques d'erreur agrégées, sMAPE et MASE, mesurées sur des dizaines de milliers de séries.

Le M4 avait pourtant demandé autre chose : un intervalle à 95 % en plus du point. Seules 20 soumissions en ont fourni un, alors que 25 % du prix y était consacré. La plupart des méthodes ont produit des intervalles trop étroits. Les organisateurs avaient prévenu que les intervalles à 95 % sous-estimeraient largement la réalité, et que l'écart s'aggraverait avec l'horizon de prévision. Ils avaient raison.

Le M5 en a tiré la conséquence, avec une piste « Uncertainty » dédiée : 42 840 séries de ventes, neuf quantiles demandés de 0,005 à 0,995. Le critère de qualité n'y est plus l'erreur moyenne mais la calibration, c'est-à-dire l'écart entre la couverture observée et le niveau nominal annoncé (Makridakis et al., 2022).

La communauté qui organise les compétitions de prévision a donc cessé de se contenter du point. L'industrie, elle, en est restée au chiffre unique.

Intervalle de confiance ou intervalle de prédiction ? La distinction qui change tout

Les deux termes circulent comme des synonymes. La confusion coûte cher.

Un intervalle de confiance est une fourchette qui porte sur un paramètre de la population, typiquement la moyenne du phénomène observé. Un intervalle de prédiction est une fourchette qui porte sur une observation future encore non réalisée, celle sur laquelle la décision va se prendre. Le second est toujours plus large que le premier : il additionne l'incertitude sur le paramètre estimé et la variabilité propre de l'observation à venir.

Rob Hyndman, éditeur de l'International Journal of Forecasting, a documenté un cas où un intervalle de confiance avait servi d'intervalle de prédiction. Au lieu de couvrir 95 % de l'espace de probabilité de l'observation future, il en couvrait environ 20 % (Hyndman, 2013). Le chiffre affiché disait 95. La couverture réelle était de 20. Rien dans la sortie ne permettait de s'en apercevoir.

TrustalAI Predictive documente sa sortie comme un intervalle de confiance à 95 % (95 % CI). C'est la notation officielle du produit, et celle qu'emploient les équipes de data science industrielle. Ce qui compte ici est la grandeur encadrée : la prévision à venir, panne, pic de demande ou volume à produire, et non un paramètre agrégé du jeu d'entraînement. La borne est recalculée pour chaque prévision, au moment où elle est produite.

Un intervalle par prévision, plus la dérive et le hors-domaine

18 jours ± 6 jours, ou 18 jours ± 40 jours

Reprenons la pompe P-204. Le modèle annonce une défaillance dans 18 jours, et TrustalAI Predictive attache son intervalle à 95 % à cette prévision.

Premier cas, 18 jours ± 6 jours. La fenêtre tient dans un créneau de production. On planifie l'arrêt, on commande la pièce, on prévient l'exploitation.

Second cas, 18 jours ± 40 jours. La date affichée est identique. La borne basse tombe dans une semaine, la borne haute dans deux mois. On ne planifie rien. On resserre l'échantillonnage des capteurs, on ajoute une mesure de vibration, on réévalue dans dix jours.

Même date, deux arbitrages opposés. Ce qui a changé, c'est ce qu'on sait de la fiabilité du modèle sur ce cas précis.

Pourquoi l'intervalle seul ne suffit pas

Attacher un intervalle calibré à chaque prédiction est un champ de recherche outillé. La conformal prediction fournit des garanties de couverture sans hypothèse sur la distribution des données et valables à échantillon fini : pour un niveau d'erreur α, la vraie valeur tombe dans l'intervalle avec une probabilité d'au moins 1−α, quel que soit le modèle sous-jacent (Kaiser & Herzog, 2025). L'écosystème français y contribue, avec la bibliothèque open source MAPIE, née d'une collaboration entre Capgemini, Quantmetry, Michelin et l'ENS Paris-Saclay sous le programme Confiance.ai.

Cette garantie a une condition : l'échangeabilité des données. Les séries temporelles industrielles la violent par construction, entre dépendances temporelles fortes et dérive de distribution au fil de l'exploitation (IEEE, 2025). Un intervalle posé une fois et jamais resurveillé finit donc par mentir lui aussi, avec la même autorité que le point qu'il était censé corriger.

D'où l'architecture de TrustalAI Predictive, qui combine trois signaux plutôt qu'un :

  • l'intervalle de confiance à 95 % attaché à chaque prévision ;

  • la détection de dérive des modèles (model drift), qui surveille le décrochage progressif du modèle par rapport au procédé réel ;

  • la détection hors distribution (out-of-distribution), qui signale les situations sorties du domaine de validité sur lequel le modèle a été construit.

La dérive est le plus dangereux des trois, parce qu'elle est muette. Aucune erreur, aucune alerte : le modèle continue de prédire avec le même aplomb sur un procédé qui a changé. Les équipes la découvrent quand un métier se plaint, et à ce moment-là le modèle se trompe depuis des semaines. Même mécanisme d'usure lente sur les chaînes PLM, MES et ERP dont les prédictions embarquées pilotent des décisions à plusieurs millions d'euros.

Les trois terrains : l'aval raisonne déjà en fourchette

Un point commun relie les trois grands usages des modèles prédictifs en industrie, et il est rarement relevé. La décision aval raisonne déjà en fourchette. C'est l'amont qui envoie un point.


Terrain

Ce que la décision utilise déjà

Ce que le modèle envoie

Grandeur de fourchette

Maintenance prédictive

Une fenêtre d'immobilisation

Un délai avant panne

RUL bornée, mesurée par le PICP

Réseau d'énergie

Une marge de dimensionnement en MW

Un pic de demande

Quantiles de charge

Supply chain

Un stock de sécurité en unités

Un volume de demande

Quantile au taux de service

Maintenance prédictive : la RUL et son intervalle

La durée de vie résiduelle (RUL, remaining useful life) est l'objet central de la maintenance prédictive (predictive maintenance). La recherche récente la produit bornée. Des travaux récents publiés dans Applied Sciences évaluent l’incertitude prédictive sur les jeux NASA C-MAPSS et rapportent qu’une recalibration conformelle améliore la couverture des intervalles de prédiction.

La grandeur de référence n'y est plus le RMSE seul mais le PICP (Prediction Interval Coverage Probability), soit la proportion de valeurs réelles effectivement contenues dans l'intervalle annoncé. La littérature est explicite sur le point de départ : une estimation ponctuelle sans intervalle est trompeuse en exploitation réelle, où le bruit et la variabilité des conditions dominent (ScienceDirect, 2023).

Le « 18 jours ± 6 jours » du terrain correspond donc littéralement à ce que produit la recherche. Les équipes MRO qui arbitrent entre maintenance préventive calendaire et intervention conditionnelle travaillent déjà avec des fenêtres. Elles reçoivent des dates.

Réseau d'énergie : le pic de demande à ± MW

Le secteur électrique a basculé il y a une dizaine d'années. Les compétitions GEFCom, organisées par le groupe de travail IEEE sur la prévision énergétique, ont une piste dédiée à la prévision probabiliste de charge : on n'y évalue plus le point seul, mais les intervalles et quantiles prédictifs à des niveaux nominaux fixés (Hong et al., 2016).

La raison est économique, et RTE l'écrit dans son Bilan prévisionnel. L'approche retenue est volontairement prudente, parce que le sous-dimensionnement du système est largement plus coûteux que son surdimensionnement. Le gestionnaire du réseau dimensionne sur des aléas, pas sur un scénario central. Une décision d'infrastructure critique (critical infrastructure) prise sur une distribution, donc. Et le modèle d'IA qui l'alimente sort souvent un chiffre unique.

Supply chain : le stock de sécurité est déjà un intervalle

Un planificateur supply chain travaille tous les jours sur une distribution, souvent sans le formuler ainsi. Le stock de sécurité est un intervalle de prédiction exprimé en unités : sa taille dépend du degré d'incertitude de la demande et de l'erreur de prévision, et il se calcule à partir des quantiles d'erreur sur le délai de réapprovisionnement, au niveau de service visé.

La prévision quantile est donc nécessaire au calcul du stock de sécurité, et elle reste largement négligée en pratique. Le planificateur reconstruit à la main, avec des hypothèses héritées des années 1960, la fourchette que son modèle de demande ne lui donne pas. Même logique sur les marchés, où l'on n'exécute pas un ordre de la même façon selon la confiance attachée à la prévision de prix : c'est l'objet de la fiabilité par prédiction appliquée au trading.

Fiabilité par prédiction ou monitoring agrégé : une différence de moment

Les outils de monitoring détectent la dérive après coup, sur un historique agrégé. Quand l'alerte tombe, la décision est déjà prise et l'incident a déjà un coût. Entre le monitoring agrégé et la fiabilité par prédiction (per-prediction reliability), la différence tient moins à ce qui est mesuré qu'au moment où on le mesure.


Monitoring agrégé / post-mortem

Fiabilité par prédiction

Quand

Après exécution, sur une fenêtre d'historique

Avant la décision, au moment de l'inférence

Sur quoi

Une population de prédictions

Chaque prévision, une par une

Ce qu'on apprend

Le modèle a dérivé le mois dernier

Cette prévision-ci est fiable, ou elle ne l'est pas

Décision possible

Réentraîner, corriger a posteriori

Exécuter, escalader ou suspendre maintenant

Latence

Heures à semaines

20 ms

Impact sur le modèle

Souvent un réentraînement

Aucun : couche externe, black-box

Le monitoring reste utile. Il pilote le cycle de vie du modèle, alimente la traçabilité, déclenche les réentraînements. Il ne peut simplement pas qualifier la prévision qui part vers le MES dans les vingt millisecondes qui suivent. La couche de fiabilité (reliability layer) s'installe en parallèle du modèle existant, en plug-and-play, sans accès au code ni aux poids, d'où le qualificatif black-box.

Elle rend un score de confiance (confidence score) en temps réel (real-time). C'est la logique déjà appliquée aux modèles de vision par TrustalAI Vision, transposée aux séries temporelles.

Ce que ça change pour un CTO

L'intérêt opérationnel tient à une chose : pouvoir traiter les prédictions différemment selon leur fiabilité.

  • Intervalle serré : exécution automatique, la prévision part directement dans le MES, l'ERP ou le plan de charge.

  • Intervalle large : revue humaine, on instrumente davantage, on croise avec d'autres capteurs, on décale l'arbitrage.

  • Hors distribution ou dérive détectée : suspension de l'automatisation, le cas repasse en supervision humaine et le modèle est signalé à l'équipe data.

Ce tri change aussi la nature du problème d'alertes, et ce problème a un seuil chiffré. La norme EEMUA 191, référence de la gestion d'alarmes industrielles avec l'ISA-18.2, vise environ une alarme toutes les dix minutes par opérateur en régime stationnaire.

Au-delà d'une douzaine d'alarmes par heure, l'opérateur est considéré comme surchargé et sa capacité de réponse chute fortement (Chemical Engineering). Une alerte qui arrive sans niveau de confiance ne peut pas être priorisée : elle entre dans la file au même rang que les autres. C'est ainsi que les fausses alertes (false alerts) finissent par faire rater les vraies.

Trier par fiabilité fait baisser le volume d'alarmes traitées en priorité sans supprimer de signal. Rien n'est jeté, ce qui est incertain change de file. Et le coût de la non-fiabilité devient chiffrable : heures d'ingénierie passées à vérifier des anomalies qui n'en sont pas, un arrêt non planifié (unplanned downtime) de plus, du temps d'arrêt subi malgré le modèle, des coûts de maintenance engagés pour rien.

Ce que le règlement demande

L'EU AI Act (Règlement UE 2024/1689) prévoit, à son article 15, que les systèmes d'IA à haut risque atteignent un niveau approprié d'exactitude et de robustesse, et que « les niveaux d'exactitude et les métriques d'exactitude pertinentes » soient déclarés dans la notice d'utilisation. Un RMSE moyen mesuré sur un jeu de test historique est une déclaration faible. Une métrique de fiabilité produite prévision par prévision, horodatée et journalisée, est une déclaration documentée et traçable. TrustalAI contribue à cette démonstration de conformité, elle ne la garantit pas à elle seule. Le sujet est traité en détail dans notre Livre Blanc EU AI Act.

Ce que TrustalAI Predictive apporte

TrustalAI Predictive est la couche de fiabilité de TrustalAI pour les modèles prédictifs, séries temporelles et scoring. Elle attache un intervalle de confiance à 95 % à chaque prévision, détecte la dérive des modèles et signale les situations hors domaine de validité. Y compris sur des systèmes embarqués, où sortir du domaine de conception est un enjeu de sécurité à part entière, comme en ADAS.

Métriques officielles du produit, mesurées en environnement opérationnel réel (TRL9) : −81 % d'erreurs, −84 % de faux positifs, 20 ms de latence.

Pour une équipe technique, trois propriétés comptent autant que ces chiffres. Aucun réentraînement : la couche se branche en parallèle du modèle existant, sur son flux de sortie. Aucun accès au modèle : compatible black-box, sans exposition de la propriété intellectuelle. Aucun changement de processus : le pipeline d'inférence reste en place, que le modèle repose sur du deep learning ou sur des méthodes statistiques classiques. C'est ce qui rend la couche applicable telle quelle aux prédictions embarquées dans les chaînes PLM, MES et supply chain, où une prévision non qualifiée se propage à toute la planification aval.

Passer à la pratique

Le test est simple à cadrer, précisément parce qu'il ne touche pas au modèle. On rejoue vos données historiques à travers TrustalAI Predictive, on sépare les prévisions qui auraient été exécutées automatiquement de celles qui auraient été escaladées, puis on regarde combien d'incidents passés tombaient dans la seconde catégorie.

Testez la compatibilité de TrustalAI Predictive avec vos modèles prédictifs existants : demandez un PoC de 2 semaines sur vos données historiques, sans réentraînement et sans accès à votre modèle.

FAQ

Quelle est la différence entre un intervalle de confiance et un intervalle de prédiction ?

Un intervalle de confiance encadre un paramètre de la population, le plus souvent une moyenne. Un intervalle de prédiction encadre une observation future encore non réalisée, celle sur laquelle la décision porte. Le second est toujours plus large, car il cumule l'incertitude sur le paramètre estimé et la variabilité propre de l'observation à venir. Confondre les deux donne un faux sentiment de précision.

Pourquoi le RMSE ne suffit-il pas à évaluer un modèle prédictif en production ?

Le RMSE est une statistique de lot, calculée après coup sur un jeu de test et sur de nombreuses séries. Il décrit une performance moyenne, jamais la prévision affichée à l'instant T. Un modèle au RMSE excellent produit malgré tout des prévisions locales très mauvaises, sans aucun signal distinctif. Décider sur un RMSE revient à juger une machine sur le MTBF de son parc.

Comment savoir si une prévision d'IA est fiable au moment où elle est produite ?

Il faut une métrique calculée par prévision, et non sur un historique agrégé. Un intervalle de confiance à 95 % attaché à la sortie indique l'amplitude d'erreur plausible sur ce cas précis. Il doit être complété par une détection de dérive des modèles et une détection hors distribution, qui signalent le décrochage progressif du modèle et les situations sorties de son domaine de validité.

Faut-il réentraîner son modèle pour obtenir un intervalle de prédiction ?

Non. TrustalAI Predictive fonctionne en couche externe : elle se branche en parallèle du modèle existant, en plug-and-play, sans réentraînement, sans annotation supplémentaire et sans accès au code ni aux poids. Le modèle reste inchangé, le pipeline d'inférence aussi. L'intervalle de confiance et les signaux de dérive s'ajoutent à la sortie, en temps réel, avec une latence de 20 ms.

Qu'est-ce que le PICP en maintenance prédictive ?

Le PICP, ou Prediction Interval Coverage Probability, mesure la proportion de valeurs réelles effectivement contenues dans l'intervalle annoncé. Un intervalle à 95 % dont le PICP observé vaut 70 % est mal calibré : il promet une couverture qu'il ne tient pas. C'est la grandeur qui permet de vérifier qu'une fourchette de durée de vie résiduelle est honnête, au-delà de la seule erreur moyenne.

Partager

Gradient Circle Image
Gradient Circle Image
Gradient Circle Image

Fiabilisez votre IA dès maintenant

Fiabilisez votre IA dès maintenant

Fiabilisez votre IA dès maintenant