Pourquoi moyenner vos prévisions peut masquer le risque qui compte
Combiner plusieurs prévisions fait généralement mieux que se fier à une seule. Mais quand les prévisions divergent sur le risque, la moyenne peut faire disparaître le seul avertissement qui comptait.


Il est bien établi que combiner des prévisions fonctionne. La moyenne de plusieurs modèles ou analystes raisonnables est, en moyenne, plus précise que la plupart des prévisions individuelles qui la composent. Les erreurs de sens opposé se compensent. C'est pourquoi les ensembles de modèles, les consensus et les avis de comité sont omniprésents en finance, en assurance, en ingénierie et en planification.
Le piège tient dans les mots « en moyenne ». Quand la décision porte sur le risque — combien de capital conserver, quelle provision pour aléas prévoir, quelle protection acheter — la prévision moyenne n'est souvent pas le chiffre dont vous avez besoin.
Combiner plusieurs prévisions fait généralement mieux que se fier à une seule. Mais quand les prévisions divergent sur le risque, la moyenne peut faire disparaître le seul avertissement qui comptait.
§ 02Quand la moyenne est le mauvais résumé
Imaginez trois sources évaluant le même risque. Deux le jugent faible. La troisième le juge élevé, peut-être parce qu'elle dispose d'informations que les autres n'ont pas, peut-être parce qu'elle se trompe. La moyenne tombe confortablement bas. Si la source divergente avait raison, la décision fondée sur cette moyenne est gravement sous-protégée, et rien dans le chiffre moyen n'indique qu'un avertissement avait été émis.
Ce n'est pas un cas rare. Les modèles catastrophe pour un même péril divergent régulièrement. Les évaluations de risque d'un même projet d'infrastructure peuvent différer largement. Les analystes qui suivent une même action prennent souvent des positions opposées. Le désaccord est normal ; ce qui compte, c'est ce que le processus de décision en fait.
§ 03Cinq votes concordants n'en font parfois qu'un
Un second problème est plus discret. Des sources qui semblent indépendantes ne le sont souvent pas : elles utilisent le même fournisseur de données, le même modèle de base, ou se lisent simplement les unes les autres. Les moyenner donne à la vue commune bien plus de poids qu'elle n'en mérite, et rend le consensus plus certain qu'il ne l'est.
§ 04« Faible confiance » n'est pas une décision
Beaucoup de systèmes répondent au désaccord par un score de confiance, puis produisent quand même un chiffre. Un chiffre peu fiable finit tout de même par être utilisé. Pour les décisions à fort enjeu, il vaut souvent mieux dire clairement que les éléments ne permettent pas encore de décider, et pourquoi, que de publier un chiffre sur lequel personne ne devrait s'appuyer.
§ 05Ce qu'un meilleur processus conserve
Trois habitudes aident. Conserver l'avis de chaque source plutôt que le seul résultat moyenné, pour qu'une divergence puisse être retrouvée plus tard. Dimensionner les décisions de risque par rapport à l'éventail des avis crédibles, pas seulement à leur milieu. Et permettre au processus de refuser de décider quand les éléments sont trop faibles ou trop dépendants d'une seule source.
Ce sont les principes d'ARGUS Council, notre approche pour certifier des décisions quand des modèles, des analystes ou des agents IA divergent : chaque avis conservé, une décision qui tient compte de tous, et un refus formel quand les éléments manquent.


