Économétrie et Machine Learning : mêmes données, questions différentes
Économétrie et machine learning partagent outils et données, mais répondent à des questions distinctes. Comprendre cette différence fait toute la différence entre un modèle qui prédit bien et une analyse sur laquelle on peut fonder des décisions.
Deux disciplines souvent confondues
Économétrie et machine learning sont souvent confondus parce qu'ils partagent outils, données, et parfois même les mêmes algorithmes. Pourtant, ils sont construits pour des objectifs différents. Comprendre cette distinction fait la différence entre un modèle qui prédit bien et une analyse sur laquelle on peut fonder des décisions.
Ce que chaque discipline cherche à faire
L'économétrie se concentre sur l'estimation de relations et la quantification d'effets. Son objectif n'est pas principalement la prédiction, mais l'inférence : mesurer l'impact d'une variable sur une autre, sous des hypothèses explicites, avec incertitude et garanties statistiques.
Le machine learning se concentre sur la prédiction et la généralisation. Son objectif est d'apprendre des patterns à partir de données qui se transfèrent bien à de nouveaux cas, jugé par la performance empirique sur des données de test et la robustesse opérationnelle.
La différence clé : prédiction versus estimation
Un modèle peut être excellent en prédiction et néanmoins inadapté à la prise de décision.
Si la question est :
- Quelle sera la demande la semaine prochaine ? → Les méthodes de prédiction sont prioritaires.
Si la question est :
- Quel est l'impact d'un changement de prix de 5% sur la demande ? → L'estimation et le raisonnement causal sont nécessaires.
Cette distinction est critique car l'exactitude prédictive n'implique pas la validité causale. Un R² élevé ou un bon MAE ne garantit pas qu'un coefficient puisse être interprété comme un effet.
Comment les méthodes divergent en pratique
1. Logique de validation
L'économétrie s'appuie sur des vérifications de spécification et l'inférence : hypothèses d'identification, tests statistiques, intervalles de confiance, diagnostics de résidus, critères d'information (AIC, BIC).
Le machine learning s'appuie sur la performance de généralisation : train/test split, cross-validation, KPIs prédictifs (MAE, RMSE, accuracy), avec un accent fort sur la prévention du surapprentissage.
2. Structure des modèles
L'économétrie utilise fréquemment des modèles paramétriques conçus pour l'interprétabilité, où les hypothèses sont explicites et la signification des paramètres est centrale.
Le machine learning utilise souvent des modèles non-paramétriques flexibles optimisés pour la performance, où le livrable principal est un prédicteur fiable plutôt que des paramètres interprétables.
3. Mécanique d'estimation
Beaucoup d'estimateurs économétriques ont des solutions analytiques ou des objectifs d'optimisation dont les propriétés peuvent être étudiées formellement.
La plupart des modèles ML modernes sont entraînés par optimisation itérative avec des hyperparamètres sélectionnés par validation, et le focus est sur l'efficacité empirique plutôt que l'interprétabilité des paramètres.
Pourquoi c'est crucial pour les décisions business comme l'élasticité-prix
L'élasticité-prix n'est pas un score de feature importance. C'est une estimation de comment la demande change quand le prix change, toutes choses égales par ailleurs.
En contexte business réel, le prix est rarement indépendant :
- Les politiques de pricing réagissent aux signaux de demande
- Les promotions corrèlent avec la saisonnalité et le marketing
- Les ruptures de stock déforment la demande observée
- Les mouvements concurrentiels impactent prix et volume simultanément
Cela crée des risques classiques de biais : confusion et endogénéité. Dans ces contextes, les outils économétriques et d'inférence causale sont ce qui rend une estimation d'élasticité exploitable pour la décision, car ils sont conçus pour séparer corrélation et effet, et quantifier l'incertitude.
La convergence moderne : inférence causale et ML scalable
Le paysage a évolué. L'économétrie a bénéficié de l'optimisation et du calcul modernes, tandis que le ML a incorporé des concepts causaux quand les décisions dépendent des effets.
Les boîtes à outils pratiques combinent aujourd'hui les deux mondes :
- Machine learning pour la modélisation flexible des nuisances et les contrôles haute dimension
- Frameworks d'inférence causale comme le double machine learning et l'orthogonalisation pour l'estimation robuste des effets
- Optimisation et régularisation modernes pour la stabilité et la scalabilité
Le résultat est un workflow qui peut à la fois prédire de façon fiable et estimer des effets de façon responsable, selon la question business.
Règle simple
Utilisez le machine learning quand le critère de succès est la performance prédictive en production.
Utilisez l'économétrie et l'inférence causale quand le critère de succès est la quantification d'impact, le support à la décision, et des estimations avec une incertitude maîtrisée.
Dans beaucoup de projets réels, l'approche la plus robuste n'est pas de choisir un camp, mais d'utiliser la bonne discipline pour la bonne question et de les intégrer dans un système cohérent de bout en bout.