bacground gradient shape
background gradient
background gradient

IA

Fiabilité d'une prédiction IA : votre modèle est un GPS qui n'affiche jamais son cercle

Fiabilité d'une prédiction IA : votre modèle est un GPS qui n'affiche jamais son cercle

La fiabilité d'une prédiction IA ne se lit pas dans son score de confiance. Elle se mesure au moment de l'inférence, prédiction par prédiction, comme un GPS affiche un rayon d'incertitude autour du point bleu. Votre modèle, lui, ne montre que le point.

Vous connaissez la scène. Vous roulez, le point bleu colle à la route, le cercle est serré. Vous entrez dans un tunnel et l'écran change d'attitude : le cercle s'élargit, le point devient une zone. Le système ne s'excuse pas. Il ne se tait pas non plus. Il vous dit qu'il est moins sûr, au lieu de faire semblant du contraire.

C'est ce que la quasi-totalité des systèmes d'IA industriels ne font pas. Ils sortent une boîte englobante, une classe, une prévision. Un point bleu, toujours net. D'où la question de cet article : pourquoi le cercle manque-t-il, et que faudrait-il pour l'afficher ?

Le cercle de votre GPS n'est pas une image, c'est une valeur d'API

Premier basculement, et il surprend souvent les équipes techniques. Le cercle n'est pas une convention graphique. C'est une valeur numérique, calculée, transmise à chaque position.

Dans Android, la méthode Location.getAccuracy() renvoie un rayon horizontal en mètres, associé à un niveau de confiance explicite : le 68ᵉ centile. La documentation le formule sans détour. Si l'on trace un cercle de ce rayon autour de la position rapportée, « there is a 68% chance that the true location falls within this circle » (Android Developers).

Trois détails comptent, dans cette phrase.

  • Le rayon vaut pour une mesure. Il n'est agrégé ni sur la journée, ni sur le trajet.

  • Il porte un confidence level déclaré. Environ une fois sur trois, l'erreur réelle dépasse donc le rayon annoncé. C'est assumé, documenté, exploitable.

  • La méthode hasAccuracy() existe. Le système sait dire qu'il n'a pas de rayon à fournir. Un modèle de vision, lui, sort toujours un nombre.

Le service lui-même raisonne pareil. GPS.gov n'annonce pas une exactitude sèche : l'erreur moyenne quotidienne du signal est tenue sous un seuil donné avec 95 % de probabilité, et la précision obtenue dépend ensuite de la géométrie satellitaire et des blocages de signal (GPS.gov).

Personne, en navigation, n'annonce une précision sans dire à quelle probabilité elle correspond. C'est pourtant ce que fait l'IA industrielle quand elle annonce « 94 % de mAP » et s'arrête là.

Pourquoi le cercle s'élargit, et pourquoi la vérité terrain n'y est pour rien

Le tunnel fait une bonne image d'ouverture, mais la mécanique se lit mieux dans un canyon urbain. Là, le signal n'est pas perdu, il est dégradé. Les satellites visibles se raréfient et se répartissent mal, les façades renvoient des trajets multiples, la géométrie du problème se détériore.

Le récepteur dispose d'un indicateur pour ça : le DOP, ou dilution de précision, décliné en GDOP, PDOP, HDOP, VDOP et TDOP. Le DOP est un facteur qui relie la précision des mesures brutes à celle du positionnement final. Voici le point décisif, documenté par l'ESA : la matrice de géométrie dont il dérive ne dépend pas des mesures, seulement de la configuration géométrique, et se calcule à partir de l'almanach (ESA Navipedia).

Autrement dit, le récepteur n'a pas besoin de savoir où il est vraiment pour savoir qu'il est mal placé pour le savoir. Aucune vérité terrain n'intervient.

Or c'est la condition opérationnelle d'une ligne de production, d'un carrefour instrumenté ou d'un véhicule en circulation : personne ne dispose de la vérité terrain au moment où la décision se prend. Le PoC ITS de TrustalAI V-Tracking a été validé ainsi, sur 100 vidéos d'une minute et sans vérité terrain. MOTA porté de 42 % à 72 %, précision de 0,65 à 0,91, recall de 0,51 à 0,83.

Le parallèle avec le DOP n'est pas rhétorique, il est structurel. Dans les deux cas, on estime la qualité d'une sortie à partir de ce qui est observable au moment de l'inférence.

Ce que l'aéronautique appelle l'intégrité, et que l'IA industrielle n'a pas

Deuxième basculement. La distinction que nous portons sur l'IA a été normée il y a trente ans, dans un autre domaine, pour de bonnes raisons.

L'intégrité, telle que la définit l'ESA, est la mesure de la confiance que l'on peut placer dans l'exactitude de l'information fournie par un système de navigation. Elle inclut la capacité du système à émettre une alerte en temps utile lorsque son usage devient dangereux (ESA Navipedia).

Quatre paramètres l'encadrent. Ils forment, sans l'avoir cherché, le cahier des charges d'une couche de fiabilité (reliability layer).


Paramètre d'intégrité (GNSS)

Ce qu'il mesure

Transposition à l'IA industrielle

Alert Limit (AL)

erreur maximale tolérable pour l'usage en cours

le seuil (threshold) au-delà duquel une détection ne doit plus déclencher d'action automatique

Protection Level (PL)

borne statistique haute de l'erreur, calculée en ligne

le rayon de la bulle de fiabilité attachée à la prédiction

Time to Alert (TTA)

délai maximal entre la perte de fiabilité et l'alerte

la latence de la couche de fiabilité, en temps réel (<100ms)

Integrity Risk (IR)

probabilité que PL soit dépassé sans alerte

le risque de défaillance silencieuse (silent failure)

La règle qui les relie tient en une ligne : le Protection Level doit rester sous l'Alert Limit. Sinon le système se déclare indisponible, plutôt que de continuer à afficher un point. Le RAIM en est l'implémentation embarquée (Inside GNSS). Le parallèle s'arrête à l'idée, et autant le dire franchement : TrustalAI ne revendique aucune certification aéronautique, aucune conformité ICAO. L'aéronautique fournit un vocabulaire et un précédent, pas un label. Ce qu'elle démontre, c'est qu'une industrie confrontée à des erreurs irréversibles a fini par séparer deux grandeurs que l'IA confond encore : la performance globale du système, et la fiabilité de l'information qu'il délivre maintenant.

Non, le score de confiance de votre modèle n'est pas un cercle

C'est l'objection la plus fréquente, et la plus légitime. « Mon détecteur sort déjà un score de confiance, ça ne suffit pas ? » Non. Cinq résultats de la littérature expliquent pourquoi, chacun sous un angle différent.

Il parle de la classe, pas de la position, et la corrélation est de 0,217

Un détecteur produit deux choses distinctes : une étiquette de classe assortie d'une probabilité, et une boîte englobante issue d'une régression. Le score porte sur la première.

Jiang et ses coauteurs ont mesuré l'écart. La corrélation de Pearson entre le confidence score de classification et la qualité de localisation, mesurée en IoU, est de 0,217, soit quasi nulle (Jiang et al., Acquisition of Localization Confidence for Accurate Object Detection, ECCV 2018, figure 2). Leur branche de localisation dédiée monte à 0,617, ce qui confirme que la grandeur manquante est bien une grandeur à part.

En clair : le score dit à quel point le modèle pense que c'est un piéton. Il ne dit pas où est ce piéton, ni à combien de centimètres près. Or c'est la seconde information qui commande le freinage.

Sur la classe elle-même, il est mal calibré

Admettons qu'on ne s'intéresse qu'à la classe. Le score reste un mauvais candidat. Guo et ses coauteurs ont montré que les réseaux modernes sont mal calibrés et systématiquement sur-confiants, à rebours des architectures plus anciennes (Guo et al., On Calibration of Modern Neural Networks, ICML 2017).

La métrique qu'ils introduisent, l'ECE (Expected Calibration Error), est devenue le standard du domaine. Sa conclusion pratique tient en une ligne : un score de 0,95 ne signifie pas « juste 95 fois sur 100 ».

Il reste haut sur ce que le modèle n'a jamais vu

Résultat le plus dérangeant, et le plus directement lié à notre tunnel. Nguyen, Yosinski et Clune ont soumis à des réseaux entraînés des images totalement non reconnaissables par un humain, du bruit structuré. Classification avec 99,99 % de confiance (Nguyen et al., Deep Neural Networks are Easily Fooled, CVPR 2015).

Le score ne s'effondre pas quand le modèle sort de son domaine. Il reste haut. C'est l'inverse du comportement d'un récepteur GNSS, et c'est le cœur du problème : un système hors distribution (out-of-distribution) continue d'afficher un point net. Nous avons traité le cas industriel dans détecter qu'une pièce sort du domaine d'apprentissage.

Il ignore le contexte, alors que l'erreur de calibration en dépend

Küppers et ses coauteurs ont montré que l'erreur de calibration d'un détecteur dépend de la position de l'objet dans l'image et croît à l'approche des bords. Ils proposent la D-ECE, une calibration conditionnée à la position et à l'échelle (CVPR Workshops 2020).

On retrouve le canyon urbain. Un objet petit, décentré, partiellement occulté n'est pas dans la même situation qu'un objet centré et net. La géométrie du problème a changé ; le score, lui, ne bouge pas.

Il confond deux incertitudes de nature différente

Kendall et Gal distinguent deux familles. L'incertitude aléatoire est le bruit inhérent aux observations, capteur, éclairage, occlusion ; davantage de données ne la réduit pas. L'incertitude épistémique est l'ignorance du modèle lui-même, ce qu'il n'a pas appris. Les auteurs soulignent que la seconde est déterminante pour les applications critiques (NeurIPS 2017).

L'autoroute relève de l'aléatoire : un peu de bruit, cercle serré. Le tunnel relève de l'épistémique : le système sort de son domaine de validité. Un vrai cercle sépare les deux. Un score de confiance les additionne en un seul nombre et perd l'information qui compte.

L'automobile a d'ailleurs un nom pour ce terrain. La norme ISO 21448 (SOTIF) traite non pas des pannes, mais des insuffisances de la fonction prévue : les cas où le système fonctionne comme spécifié et provoque quand même une situation dangereuse. Elle distingue les scénarios unsafe-known, hors domaine opérationnel, des unsafe-unknown, hors distribution d'apprentissage.

Fiabilité par prédiction ou monitoring agrégé : ce n'est pas la même mesure

Beaucoup d'équipes répondent à ce problème par de l'outillage de surveillance. C'est utile, et ce n'est pas la même chose. Le monitoring, c'est relire le trajet le soir. Le cercle, c'est le voir au carrefour. Nous avons posé la distinction en détail dans monitoring IA et fiabilité par prédiction et dans pourquoi le monitoring ne suffit plus en production.


Monitoring agrégé (aggregate monitoring)

Fiabilité par prédiction (per-prediction reliability)

Moment de la mesure

après exécution : post-mortem, analyse post-hoc

au moment de l'inférence, avant la décision

Granularité

fenêtres temporelles, lots, performance globale

une prédiction, une bulle, un rayon

Signal produit

dérive de données (data drift), dérive des étiquettes (label drift), dégradation de performance (performance degradation)

métriques de confiance attachées à chaque sortie

Ce qu'on rate

les défaillances silencieuses (silent failure) noyées dans la moyenne, et l'erreur critique isolée

rien de ce qui est mesurable à l'inférence

Action possible

réentraîner, alerter l'équipe data science, ajuster un seuil global

router la prédiction : agir, ralentir, escalader

Objet gouverné

gouvernance des modèles (model governance), observabilité (observability), journaux d'événements et logs

risque opérationnel de la décision en cours

Apport conformité

traçabilité (traceability), auditabilité (auditability), a posteriori

preuve par prédiction, versable au dossier de compliance

Une précision, parce que la confusion revient souvent. Même un monitoring temps réel reste un monitoring agrégé : il resserre la fenêtre, il ne descend pas au niveau de la prédiction. Il vous dira que le taux de faux positifs (false positives) a augmenté sur la dernière heure. Pas laquelle des 180 000 détections de cette heure était douteuse.

Les deux approches ne s'excluent pas. La dérive des modèles (model drift) et les dérives de données restent des sujets de fond, et la couche de fiabilité les alimente plutôt qu'elle ne les remplace. Simplement, le monitoring répond à « mon modèle se dégrade-t-il ? », et la fiabilité par prédiction à « puis-je suivre celle-ci, maintenant ? ». C'est la même bascule que celle décrite dans fiabilité par prédiction et performance globale.

À quoi ressemble un cercle en computer vision : la Reliability Bubble

En vision 2D, le cercle a une forme précise. TrustalAI Vision attache à chaque détection quatre grandeurs d'incertitude : σx et σy sur la position, σw et σh sur les dimensions de la boîte. C'est ce que nous appelons la Reliability Bubble. Plus la bulle serre la boîte englobante, plus la détection est fiable.

L'exemple canonique tient en deux lignes, et il retourne l'intuition des équipes perception.


Mesure

Objet fiable

Objet incertain

Distance estimée

7 m ± 0,6 m

6 m ± 1,3 m

Vitesse estimée

3 m/s ± 0,5 m/s

3,4 m/s ± 1,2 m/s

Regardez la distance seule : l'objet à 6 m est le plus proche, donc a priori le plus urgent. Regardez le rayon : c'est lui, le plus risqué. Mêmes détections qu'avant, hiérarchisées par ce qui compte, et cette séparation est ce qui rend une prédiction actionnable.

Sur la famille vision, la mesure se paie peu : -80 % d'erreurs de position et d'orientation, 92 % de faux positifs en moins, une latence de 20 ms sur CPU et de 8 ms sur NVIDIA Jetson Orin (source : Client Deck TrustalAI V10). All results measured in real operating conditions against each product's baseline model.

Quand plusieurs sources observent la même scène, cette incertitude sert de poids de fusion. C'est TrustalAI Vision et sa déclinaison multi-sources V-Fusion, dont le PoC mené avec l'Institut VEDECOM a mesuré -65 % d'erreurs de position, -63 % d'erreurs d'orientation et -83 % de faux positifs face à sept méthodes de fusion probabiliste. Une fusion qui sait à quelle source se fier plutôt que de moyenner à l'aveugle, sujet détaillé dans notre article sur la perception coopérative.

Le même cercle, en prédictif : l'intervalle

La transposition aux modèles prédictifs est immédiate. Une prévision ponctuelle, « panne dans 18 jours », est un point bleu. La version utilisable est « panne dans 18 jours ± 6 jours, 95 % CI ». C'est ce que produit TrustalAI Predictive sur les séries temporelles et les modèles de scoring : -81 % d'erreurs, -84 % de faux positifs, 20 ms de latence.

Le changement de décision est net. Sur un point sec, un planificateur arbitre au jugé. Sur un intervalle, il arbitre sur une fenêtre : intervenir tôt si le coût d'arrêt est élevé, attendre si la borne haute laisse de la marge. Nous avons développé ce raisonnement dans l'intervalle de confiance comme métrique de décision et dans pourquoi une prévision ponctuelle est un pari.

Ce que coûte un vrai cercle, et pourquoi la plupart des méthodes restent en laboratoire

Dessiner un cercle autour d'une prédiction est un problème résolu depuis longtemps en recherche. Le dessiner en 20 ms, sur le flux de production, sans réentraînement, ne l'est pas. C'est là que se joue l'écart entre une publication et une ligne de production.

Le benchmark KITTI, sur une même baseline YOLOv8 fine-tunée (1 493 frames, 10 049 données labellisées, temps mesurés sur NVIDIA L4), situe les ordres de grandeur.


Méthode

AUPR ↑

AUROC ↑

AURC ↓

NLL ↓

Temps moyen

YOLOv8 + T-Vision (TrustalAI Vision)

0,84

0,86

2,76

13,78

≈ 14,7 ms

YOLOv8 + réseau bayésien (BNN)

0,73

0,71

3,59

44,67

356,67 ms

YOLOv8 + MC-Dropout

0,78

0,76

3,46

11,85

191,48 ms

YOLOv8 + Ensemble

0,83

0,82

3,26

20,33

71,63 ms

Deux lectures, et la seconde compte autant que la première.

  • TrustalAI obtient la meilleure qualité d'estimation d'incertitude sur AUPR, AUROC et AURC parmi les méthodes testées, pour un temps d'inférence (inference time) environ 13 fois inférieur à MC-Dropout, 24 fois inférieur à un réseau bayésien et 5 fois inférieur à un ensemble.

  • MC-Dropout obtient un meilleur NLL, 11,85 contre 13,78. Le dire est plus honnête que de l'omettre, et le point se défend : il paie ce NLL 191 ms. En edge, une méthode à 191 ms n'est pas une méthode lente, c'est une méthode absente.

L'approche n'invente pas pour autant une catégorie. Elle occupe une case identifiée de la taxonomie de référence des méthodes de quantification d'incertitude, la branche Single Network Deterministic Methods → External Methods (Gawlikowski et al., A survey of uncertainty in deep neural networks, Artificial Intelligence Review 2023). C'est la seule compatible à la fois avec le temps réel et le plug-and-play : pas de réentraînement, pas d'échantillonnage multiple, pas d'accès aux poids du modèle, donc une compatibilité black-box stricte.

Ce que la réglementation demande déjà, et ce qu'elle ne demande pas encore

L'EU AI Act, Règlement (UE) 2024/1689, pose une exigence de fond à l'article 15. Les systèmes d'IA à haut risque (high-risk) doivent atteindre un niveau approprié d'exactitude (accuracy), de robustesse et de cybersécurité, et se comporter de manière constante à cet égard tout au long de leur cycle de vie. L'article 15(3) ajoute que ces niveaux d'exactitude et les métriques correspondantes sont déclarés dans la notice d'utilisation.

Lisez la nuance, elle est structurante. La notice porte une exactitude agrégée, établie une fois, en amont. Elle ne dit rien de la prédiction de 14 h 32. L'exploitant, lui, ne décide jamais « en moyenne » : il décide une prédiction à la fois.

Les articles voisins pointent dans la même direction. L'article 9 organise la gestion des risques, l'article 12 impose la journalisation, l'article 13 encadre l'information fournie à l'utilisateur. L'article 14 exige un contrôle humain effectif : pour intervenir utilement, un opérateur doit savoir quand intervenir, et une exactitude moyenne ne le lui dira jamais.

Une couche de fiabilité contribue à cette conformité en produisant, par prédiction, la trace qui manque entre la notice et la décision. Elle ne la garantit pas : la conformité reste une démarche d'ensemble, portée par le fournisseur et l'exploitant. Nos décryptages détaillent le sujet dans ce que la loi impose aux systèmes IA industriels et dans la classification des risques.

Ce que ça change en aval : trois régimes d'action

Un cercle n'a d'intérêt que si quelque chose en fait quelque chose. Un automate programmable ne sait pas arbitrer un doute qu'on ne lui transmet pas. Transmettez-le, et trois régimes apparaissent.

  • Cercle serré, la prédiction est suivie automatiquement. Le robot garde sa cadence, la pièce part en ligne.

  • Cercle intermédiaire, le système ralentit, reprend une image ou interroge une seconde source. En robotique industrielle, c'est la différence entre deux secondes de ralentissement et un arrêt de ligne.

  • Cercle large, escalade humaine ou refus d'agir. On est dans le tunnel : le système sait qu'il ne sait plus, et le dit avant de se tromper.

Ce routage transforme une mesure d'incertitude en gain opérationnel : moins d'arrêts inutiles sur les lignes de vision, moins de faux rejets (false rejects) en contrôle qualité, moins d'incidents de perception (perception incidents) en conduite autonome, moins de fausses alertes en vidéoprotection urbaine.

Côté intégration, la contrainte est volontairement basse.


Contrainte d'intégration

Ce que ça implique

Modèle client

inchangé, compatibilité black-box, aucun réentraînement

Latence ajoutée

20ms sur CPU, 8 ms sur NVIDIA Jetson Orin

Sortie produite

métriques de fiabilité par prédiction : σx, σy, σw, σh en vision 2D, intervalle de confiance en prédictif

Processus métier

inchangé, la couche s'insère avant la décision, pas à la place du modèle

La couche se branche en parallèle du modèle d'apprentissage automatique existant, sans toucher au pipeline de décision, en edge comme en cloud. Le détail est décrit dans fiabiliser un modèle de vision sans réentraînement et dans la fiabilité edge à 20 ms. Pour les intégrateurs système, l'argument est plus direct encore : vous livrez une machine qui sait quand elle ne sait pas, et vous pouvez le prouver à la réception.

Ce n'est pas le point bleu qui vous conduit à destination

Quatre choses se sont déplacées en cours de route.

  • Le cercle existe déjà, comme valeur documentée, par mesure, avec un niveau de confiance explicite.

  • Il se calcule sans vérité terrain, à partir de la structure du problème, au moment où la décision se prend.

  • L'aéronautique a séparé précision et intégrité il y a trente ans, et certifie la seconde.

  • Le score de confiance natif n'est pas ce cercle : sa corrélation avec la qualité de localisation est de 0,217, et il reste haut sur ce que le modèle n'a jamais vu.

On présente souvent l'incertitude comme un aveu de faiblesse. Un modèle qui doute serait un modèle moins bon. C'est l'inverse. Un système qui sort toujours un point net n'est pas plus sûr, il est seulement moins informatif. Le cercle n'est pas l'aveu d'une faiblesse : c'est ce qui rend le point utilisable.

Ce n'est pas le point bleu qui vous conduit à destination. C'est le cercle.

FAQ : Fiabilité d'une prédiction IA

Comment savoir si une prédiction IA est fiable ?

En lui attachant une mesure d'incertitude calculée au moment de l'inférence, indépendamment du score de confiance du modèle. Concrètement, on produit une borne autour de la sortie : un rayon en vision 2D, un intervalle en prédictif. Une prédiction est fiable quand cette borne reste sous le seuil toléré par l'action qu'elle déclenche. Même principe que le cercle d'un GPS autour du point bleu.

Le score de confiance de mon modèle ne suffit-il pas ?

Non, pour trois raisons mesurées. Il porte sur la classe, pas sur la position : la corrélation de Pearson avec la qualité de localisation est de 0,217 (Jiang et al., ECCV 2018). Il est mal calibré et sur-confiant sur les architectures modernes (Guo et al., ICML 2017). Et il reste très élevé sur des entrées hors distribution, jusqu'à 99,99 % sur des images non reconnaissables (Nguyen et al., CVPR 2015).

Quelle différence entre monitoring agrégé et fiabilité par prédiction ?

Le monitoring agrégé mesure après exécution, sur des fenêtres temporelles ou des lots : il détecte une dérive de données ou une dégradation de performance. La fiabilité par prédiction mesure avant la décision, sortie par sortie. Le premier vous dit que le modèle se dégrade, la seconde vous dit si vous pouvez suivre cette prédiction-ci, maintenant. Les deux sont complémentaires et ne répondent pas à la même question.

Qu'est-ce qu'une Reliability Bubble ?

C'est la représentation visuelle de l'incertitude attachée à une détection en vision 2D. TrustalAI Vision produit quatre grandeurs par détection : σx et σy pour la position, σw et σh pour les dimensions de la boîte englobante. Plus la bulle serre la boîte, plus la détection est fiable. Les modules en aval s'en servent pour hiérarchiser les objets par risque plutôt que par distance ou par score.

Faut-il réentraîner son modèle pour obtenir cette mesure ?

Non. La couche de fiabilité se branche en parallèle du modèle existant et n'accède ni à ses poids ni aux données propriétaires du client : la compatibilité est black-box. C'est ce qui distingue les méthodes externes des approches bayésiennes ou par ensembles, qui exigent de modifier ou de dupliquer le modèle, et qui coûtent entre 70 et 360 ms par image sur un GPU de datacenter.

Partager

Gradient Circle Image
Gradient Circle Image
Gradient Circle Image

Fiabilisez votre IA dès maintenant

Fiabilisez votre IA dès maintenant

Fiabilisez votre IA dès maintenant