
IA
Intervalles de prédiction : pourquoi une prévision ponctuelle est un pari, pas une prédiction.

Votre outil de maintenance annonce la panne de la pompe P-204 dans 18 jours. Il ne dit pas à quel point ce chiffre est sûr. Sans intervalles de prédiction, personne ne sait s'il faut immobiliser la ligne ou la laisser tourner.
Ce chiffre arrive seul. « 18 jours ± 6 jours » et « 18 jours ± 40 jours » affichent la même date et commandent deux décisions opposées : dans un cas on planifie l'arrêt, dans l'autre on instrumente et on réévalue. Une prévision sans son intervalle n'est pas une prédiction. C'est un pari avec un point décimal.
Une sortie ponctuelle n'est pas arbitrable
Un MES affiche une date de fin de série. Un ERP affiche un volume à produire. Un modèle de maintenance prédictive affiche un délai avant défaillance. Les trois sortent un nombre propre, directement consommable par le système aval. Aucun des trois n'affiche son incertitude.
C'est ce qui les rend inexploitables au moment de décider. Une décision industrielle se prend sur un écart : entre ce que le modèle annonce et ce qu'il pourrait annoncer s'il se trompait. Sans cet écart, la prévision n'est pas arbitrable. Le responsable maintenance ne peut ni la suivre ni la rejeter avec un argument. Il la suit par habitude, ou il l'ignore par prudence.
Les capteurs n'y sont pour rien. Un réseau de capteurs IIoT (industrial IoT sensors) qui remonte vibration, température et données de production donne au modèle une matière abondante. Le modèle restitue un point, et ce qu'il sait de sa propre incertitude s'arrête à l'entrée de l'inférence. Une bonne précision agrégée (RMSE, MAPE) masque d'ailleurs les prévisions sur lesquelles il se trompe le plus lourdement.
Une erreur moyenne ne dit rien de la prévision en cours
Le RMSE est une statistique de lot, pas une propriété de la prévision du moment
Le RMSE est au modèle ce que le MTBF est au parc : une moyenne rétrospective qui ne dit rien de la machine devant vous. Les indicateurs classiques de maintenance (MTBF, MTTR, disponibilité, OEE) décrivent un comportement d'ensemble sur une période passée. Personne ne s'en sert pour décider de démonter un roulement ce mardi.
Le RMSE fonctionne pareil. Calculé après coup, sur un jeu de test, sur des centaines de séries. Il ne se transporte pas sur la prévision affichée à l'écran. Un modèle au RMSE excellent produit quand même des prévisions locales très mauvaises, et il les produit avec la même assurance typographique que les bonnes. C'est la limite de fond de toute métrique de précision globale.
Ce que les compétitions M4 et M5 ont montré
La communauté académique de la prévision a réglé ce débat il y a plusieurs années. Les compétitions M reposent sur des métriques d'erreur agrégées, sMAPE et MASE, mesurées sur des dizaines de milliers de séries.
Le M4 avait pourtant demandé autre chose : un intervalle à 95 % en plus du point. Seules 20 soumissions en ont fourni un, alors que 25 % du prix y était consacré. La plupart des méthodes ont produit des intervalles trop étroits. Les organisateurs avaient prévenu que les intervalles à 95 % sous-estimeraient largement la réalité, et que l'écart s'aggraverait avec l'horizon de prévision. Ils avaient raison.
Le M5 en a tiré la conséquence, avec une piste « Uncertainty » dédiée : 42 840 séries de ventes, neuf quantiles demandés de 0,005 à 0,995. Le critère de qualité n'y est plus l'erreur moyenne mais la calibration, c'est-à-dire l'écart entre la couverture observée et le niveau nominal annoncé (Makridakis et al., 2022).
La communauté qui organise les compétitions de prévision a donc cessé de se contenter du point. L'industrie, elle, en est restée au chiffre unique.
Intervalle de confiance ou intervalle de prédiction ? La distinction qui change tout
Les deux termes circulent comme des synonymes. La confusion coûte cher.
Un intervalle de confiance est une fourchette qui porte sur un paramètre de la population, typiquement la moyenne du phénomène observé. Un intervalle de prédiction est une fourchette qui porte sur une observation future encore non réalisée, celle sur laquelle la décision va se prendre. Le second est toujours plus large que le premier : il additionne l'incertitude sur le paramètre estimé et la variabilité propre de l'observation à venir.
Rob Hyndman, éditeur de l'International Journal of Forecasting, a documenté un cas où un intervalle de confiance avait servi d'intervalle de prédiction. Au lieu de couvrir 95 % de l'espace de probabilité de l'observation future, il en couvrait environ 20 % (Hyndman, 2013). Le chiffre affiché disait 95. La couverture réelle était de 20. Rien dans la sortie ne permettait de s'en apercevoir.
TrustalAI Predictive documente sa sortie comme un intervalle de confiance à 95 % (95 % CI). C'est la notation officielle du produit, et celle qu'emploient les équipes de data science industrielle. Ce qui compte ici est la grandeur encadrée : la prévision à venir, panne, pic de demande ou volume à produire, et non un paramètre agrégé du jeu d'entraînement. La borne est recalculée pour chaque prévision, au moment où elle est produite.
Un intervalle par prévision, plus la dérive et le hors-domaine
18 jours ± 6 jours, ou 18 jours ± 40 jours
Reprenons la pompe P-204. Le modèle annonce une défaillance dans 18 jours, et TrustalAI Predictive attache son intervalle à 95 % à cette prévision.
Premier cas, 18 jours ± 6 jours. La fenêtre tient dans un créneau de production. On planifie l'arrêt, on commande la pièce, on prévient l'exploitation.
Second cas, 18 jours ± 40 jours. La date affichée est identique. La borne basse tombe dans une semaine, la borne haute dans deux mois. On ne planifie rien. On resserre l'échantillonnage des capteurs, on ajoute une mesure de vibration, on réévalue dans dix jours.
Même date, deux arbitrages opposés. Ce qui a changé, c'est ce qu'on sait de la fiabilité du modèle sur ce cas précis.
Pourquoi l'intervalle seul ne suffit pas
Attacher un intervalle calibré à chaque prédiction est un champ de recherche outillé. La conformal prediction fournit des garanties de couverture sans hypothèse sur la distribution des données et valables à échantillon fini : pour un niveau d'erreur α, la vraie valeur tombe dans l'intervalle avec une probabilité d'au moins 1−α, quel que soit le modèle sous-jacent (Kaiser & Herzog, 2025). L'écosystème français y contribue, avec la bibliothèque open source MAPIE, née d'une collaboration entre Capgemini, Quantmetry, Michelin et l'ENS Paris-Saclay sous le programme Confiance.ai.
Cette garantie a une condition : l'échangeabilité des données. Les séries temporelles industrielles la violent par construction, entre dépendances temporelles fortes et dérive de distribution au fil de l'exploitation (IEEE, 2025). Un intervalle posé une fois et jamais resurveillé finit donc par mentir lui aussi, avec la même autorité que le point qu'il était censé corriger.
D'où l'architecture de TrustalAI Predictive, qui combine trois signaux plutôt qu'un :
l'intervalle de confiance à 95 % attaché à chaque prévision ;
la détection de dérive des modèles (model drift), qui surveille le décrochage progressif du modèle par rapport au procédé réel ;
la détection hors distribution (out-of-distribution), qui signale les situations sorties du domaine de validité sur lequel le modèle a été construit.
La dérive est le plus dangereux des trois, parce qu'elle est muette. Aucune erreur, aucune alerte : le modèle continue de prédire avec le même aplomb sur un procédé qui a changé. Les équipes la découvrent quand un métier se plaint, et à ce moment-là le modèle se trompe depuis des semaines. Même mécanisme d'usure lente sur les chaînes PLM, MES et ERP dont les prédictions embarquées pilotent des décisions à plusieurs millions d'euros.
Les trois terrains : l'aval raisonne déjà en fourchette
Un point commun relie les trois grands usages des modèles prédictifs en industrie, et il est rarement relevé. La décision aval raisonne déjà en fourchette. C'est l'amont qui envoie un point.
Terrain | Ce que la décision utilise déjà | Ce que le modèle envoie | Grandeur de fourchette |
|---|---|---|---|
Maintenance prédictive | Une fenêtre d'immobilisation | Un délai avant panne | RUL bornée, mesurée par le PICP |
Réseau d'énergie | Une marge de dimensionnement en MW | Un pic de demande | Quantiles de charge |
Supply chain | Un stock de sécurité en unités | Un volume de demande | Quantile au taux de service |
Maintenance prédictive : la RUL et son intervalle
La durée de vie résiduelle (RUL, remaining useful life) est l'objet central de la maintenance prédictive (predictive maintenance). La recherche récente la produit bornée. Des travaux récents publiés dans Applied Sciences évaluent l’incertitude prédictive sur les jeux NASA C-MAPSS et rapportent qu’une recalibration conformelle améliore la couverture des intervalles de prédiction.
La grandeur de référence n'y est plus le RMSE seul mais le PICP (Prediction Interval Coverage Probability), soit la proportion de valeurs réelles effectivement contenues dans l'intervalle annoncé. La littérature est explicite sur le point de départ : une estimation ponctuelle sans intervalle est trompeuse en exploitation réelle, où le bruit et la variabilité des conditions dominent (ScienceDirect, 2023).
Le « 18 jours ± 6 jours » du terrain correspond donc littéralement à ce que produit la recherche. Les équipes MRO qui arbitrent entre maintenance préventive calendaire et intervention conditionnelle travaillent déjà avec des fenêtres. Elles reçoivent des dates.
Réseau d'énergie : le pic de demande à ± MW
Le secteur électrique a basculé il y a une dizaine d'années. Les compétitions GEFCom, organisées par le groupe de travail IEEE sur la prévision énergétique, ont une piste dédiée à la prévision probabiliste de charge : on n'y évalue plus le point seul, mais les intervalles et quantiles prédictifs à des niveaux nominaux fixés (Hong et al., 2016).
La raison est économique, et RTE l'écrit dans son Bilan prévisionnel. L'approche retenue est volontairement prudente, parce que le sous-dimensionnement du système est largement plus coûteux que son surdimensionnement. Le gestionnaire du réseau dimensionne sur des aléas, pas sur un scénario central. Une décision d'infrastructure critique (critical infrastructure) prise sur une distribution, donc. Et le modèle d'IA qui l'alimente sort souvent un chiffre unique.
Supply chain : le stock de sécurité est déjà un intervalle
Un planificateur supply chain travaille tous les jours sur une distribution, souvent sans le formuler ainsi. Le stock de sécurité est un intervalle de prédiction exprimé en unités : sa taille dépend du degré d'incertitude de la demande et de l'erreur de prévision, et il se calcule à partir des quantiles d'erreur sur le délai de réapprovisionnement, au niveau de service visé.
La prévision quantile est donc nécessaire au calcul du stock de sécurité, et elle reste largement négligée en pratique. Le planificateur reconstruit à la main, avec des hypothèses héritées des années 1960, la fourchette que son modèle de demande ne lui donne pas. Même logique sur les marchés, où l'on n'exécute pas un ordre de la même façon selon la confiance attachée à la prévision de prix : c'est l'objet de la fiabilité par prédiction appliquée au trading.
Fiabilité par prédiction ou monitoring agrégé : une différence de moment
Les outils de monitoring détectent la dérive après coup, sur un historique agrégé. Quand l'alerte tombe, la décision est déjà prise et l'incident a déjà un coût. Entre le monitoring agrégé et la fiabilité par prédiction (per-prediction reliability), la différence tient moins à ce qui est mesuré qu'au moment où on le mesure.
Monitoring agrégé / post-mortem | Fiabilité par prédiction | |
|---|---|---|
Quand | Après exécution, sur une fenêtre d'historique | Avant la décision, au moment de l'inférence |
Sur quoi | Une population de prédictions | Chaque prévision, une par une |
Ce qu'on apprend | Le modèle a dérivé le mois dernier | Cette prévision-ci est fiable, ou elle ne l'est pas |
Décision possible | Réentraîner, corriger a posteriori | Exécuter, escalader ou suspendre maintenant |
Latence | Heures à semaines | 20 ms |
Impact sur le modèle | Souvent un réentraînement | Aucun : couche externe, black-box |
Le monitoring reste utile. Il pilote le cycle de vie du modèle, alimente la traçabilité, déclenche les réentraînements. Il ne peut simplement pas qualifier la prévision qui part vers le MES dans les vingt millisecondes qui suivent. La couche de fiabilité (reliability layer) s'installe en parallèle du modèle existant, en plug-and-play, sans accès au code ni aux poids, d'où le qualificatif black-box.
Elle rend un score de confiance (confidence score) en temps réel (real-time). C'est la logique déjà appliquée aux modèles de vision par TrustalAI Vision, transposée aux séries temporelles.
Ce que ça change pour un CTO
L'intérêt opérationnel tient à une chose : pouvoir traiter les prédictions différemment selon leur fiabilité.
Intervalle serré : exécution automatique, la prévision part directement dans le MES, l'ERP ou le plan de charge.
Intervalle large : revue humaine, on instrumente davantage, on croise avec d'autres capteurs, on décale l'arbitrage.
Hors distribution ou dérive détectée : suspension de l'automatisation, le cas repasse en supervision humaine et le modèle est signalé à l'équipe data.
Au-delà d'une douzaine d'alarmes par heure, l'opérateur est considéré comme surchargé et sa capacité de réponse chute fortement (Chemical Engineering). Une alerte qui arrive sans niveau de confiance ne peut pas être priorisée : elle entre dans la file au même rang que les autres. C'est ainsi que les fausses alertes (false alerts) finissent par faire rater les vraies.
Trier par fiabilité fait baisser le volume d'alarmes traitées en priorité sans supprimer de signal. Rien n'est jeté, ce qui est incertain change de file. Et le coût de la non-fiabilité devient chiffrable : heures d'ingénierie passées à vérifier des anomalies qui n'en sont pas, un arrêt non planifié (unplanned downtime) de plus, du temps d'arrêt subi malgré le modèle, des coûts de maintenance engagés pour rien.
Ce que le règlement demande
L'EU AI Act (Règlement UE 2024/1689) prévoit, à son article 15, que les systèmes d'IA à haut risque atteignent un niveau approprié d'exactitude et de robustesse, et que « les niveaux d'exactitude et les métriques d'exactitude pertinentes » soient déclarés dans la notice d'utilisation. Un RMSE moyen mesuré sur un jeu de test historique est une déclaration faible. Une métrique de fiabilité produite prévision par prévision, horodatée et journalisée, est une déclaration documentée et traçable. TrustalAI contribue à cette démonstration de conformité, elle ne la garantit pas à elle seule. Le sujet est traité en détail dans notre Livre Blanc EU AI Act.
Ce que TrustalAI Predictive apporte
TrustalAI Predictive est la couche de fiabilité de TrustalAI pour les modèles prédictifs, séries temporelles et scoring. Elle attache un intervalle de confiance à 95 % à chaque prévision, détecte la dérive des modèles et signale les situations hors domaine de validité. Y compris sur des systèmes embarqués, où sortir du domaine de conception est un enjeu de sécurité à part entière, comme en ADAS.
Métriques officielles du produit, mesurées en environnement opérationnel réel (TRL9) : −81 % d'erreurs, −84 % de faux positifs, 20 ms de latence.
Pour une équipe technique, trois propriétés comptent autant que ces chiffres. Aucun réentraînement : la couche se branche en parallèle du modèle existant, sur son flux de sortie. Aucun accès au modèle : compatible black-box, sans exposition de la propriété intellectuelle. Aucun changement de processus : le pipeline d'inférence reste en place, que le modèle repose sur du deep learning ou sur des méthodes statistiques classiques. C'est ce qui rend la couche applicable telle quelle aux prédictions embarquées dans les chaînes PLM, MES et supply chain, où une prévision non qualifiée se propage à toute la planification aval.
Passer à la pratique
Le test est simple à cadrer, précisément parce qu'il ne touche pas au modèle. On rejoue vos données historiques à travers TrustalAI Predictive, on sépare les prévisions qui auraient été exécutées automatiquement de celles qui auraient été escaladées, puis on regarde combien d'incidents passés tombaient dans la seconde catégorie.
Testez la compatibilité de TrustalAI Predictive avec vos modèles prédictifs existants : demandez un PoC de 2 semaines sur vos données historiques, sans réentraînement et sans accès à votre modèle.
FAQ
Quelle est la différence entre un intervalle de confiance et un intervalle de prédiction ?
Un intervalle de confiance encadre un paramètre de la population, le plus souvent une moyenne. Un intervalle de prédiction encadre une observation future encore non réalisée, celle sur laquelle la décision porte. Le second est toujours plus large, car il cumule l'incertitude sur le paramètre estimé et la variabilité propre de l'observation à venir. Confondre les deux donne un faux sentiment de précision.
Pourquoi le RMSE ne suffit-il pas à évaluer un modèle prédictif en production ?
Le RMSE est une statistique de lot, calculée après coup sur un jeu de test et sur de nombreuses séries. Il décrit une performance moyenne, jamais la prévision affichée à l'instant T. Un modèle au RMSE excellent produit malgré tout des prévisions locales très mauvaises, sans aucun signal distinctif. Décider sur un RMSE revient à juger une machine sur le MTBF de son parc.
Comment savoir si une prévision d'IA est fiable au moment où elle est produite ?
Il faut une métrique calculée par prévision, et non sur un historique agrégé. Un intervalle de confiance à 95 % attaché à la sortie indique l'amplitude d'erreur plausible sur ce cas précis. Il doit être complété par une détection de dérive des modèles et une détection hors distribution, qui signalent le décrochage progressif du modèle et les situations sorties de son domaine de validité.
Faut-il réentraîner son modèle pour obtenir un intervalle de prédiction ?
Non. TrustalAI Predictive fonctionne en couche externe : elle se branche en parallèle du modèle existant, en plug-and-play, sans réentraînement, sans annotation supplémentaire et sans accès au code ni aux poids. Le modèle reste inchangé, le pipeline d'inférence aussi. L'intervalle de confiance et les signaux de dérive s'ajoutent à la sortie, en temps réel, avec une latence de 20 ms.
Qu'est-ce que le PICP en maintenance prédictive ?
Le PICP, ou Prediction Interval Coverage Probability, mesure la proportion de valeurs réelles effectivement contenues dans l'intervalle annoncé. Un intervalle à 95 % dont le PICP observé vaut 70 % est mal calibré : il promet une couverture qu'il ne tient pas. C'est la grandeur qui permet de vérifier qu'une fourchette de durée de vie résiduelle est honnête, au-delà de la seule erreur moyenne.
Partager
Articles connexes






