Les possibilités infinies de la prévision en data science
Découvrir les méthodes de forecasting à travers un exemple concret inspiré du concours Kaggle Favorita. Panorama des stratégies et guide de cadrage projet.
Pourquoi la prévision ne ressemble pas à une régression classique
Quand j'ai commencé la data science, ma première mission était un sujet de prévision. Avec une formation en économétrie, j'associais naturellement forecasting et modèles type ARIMA, identification manuelle via ACF/PACF, puis ajustement de paramètres. Avec l'expérience terrain, j'ai compris que cette vision est trop étroite.
En entreprise, la prévision est rarement un problème de "bien fitter une série". C'est un problème industriel de décision, à grande échelle, avec des signaux exogènes, des séries intermittentes, des historiques courts et une exigence de robustesse et de coût maîtrisé.
Pour illustrer les différents angles possibles, je prends comme fil rouge un cadre proche du concours Favorita Grocery Sales Forecasting : prédire les ventes de couples magasin-produit à 16 jours d'horizon à partir d'une table transactionnelle.
Le vrai changement de paradigme : passer de 1 série à des millions
Dans le retail, plusieurs contraintes rendent l'approche "un modèle statistique par série" peu réaliste :
- Le volume est massif : des centaines de points de vente, des centaines de milliers de produits
- Les ventes sont souvent intermittentes ou erratiques, surtout à la maille jour ou semaine
- Les facteurs exogènes sont structurants : promotions, calendrier, événements, parfois prix
- Beaucoup de séries ont un historique trop court pour apprendre une saisonnalité complète
- Le coût de calcul devient une contrainte de premier ordre
Ce contexte pousse vers des approches mutualisées : machine learning global, deep learning, ou stratégies hybrides.
Reframer la prévision comme un problème de régression
La stratégie la plus courante en production consiste à transformer une série temporelle en dataset supervisé :
- Des lags (y à t-1, t-2, …)
- Des agrégats roulants (moyennes, médianes, tendances locales)
- Des variables calendaires (jour de semaine, mois, vacances)
- Des signaux exogènes (promotion, prix, événements)
L'intérêt : on peut entraîner un modèle global sur un grand nombre de séries, au lieu d'un modèle par série.
Panorama des principales stratégies de forecasting
1. Direct forecasting
Entraîner un seul modèle qui prédit directement la valeur à l'horizon H, en utilisant uniquement des features issues du passé.
Forces : simple, stable, peu coûteux, un seul modèle à maintenir
Limites : perd en "récence" si les features sont décalées loin dans le passé
2. Recursive forecasting
Entraîner un modèle à horizon 1, puis itérer la prédiction jour après jour en réinjectant les prédictions dans les features.
Forces : exploite la récence au maximum, un seul modèle
Limites : propagation des erreurs, parallélisation difficile, sensible aux anomalies récentes
3. Multi-step direct
Entraîner un modèle par horizon, donc 16 modèles pour 16 jours.
Forces : pas de propagation d'erreur, chaque horizon optimisé spécifiquement, parallélisable
Limites : complexité opérationnelle (16 modèles à maintenir), coût plus élevé
4. Split direct (par blocs d'horizons)
Compromis entre direct et multi-step, en découpant l'horizon en blocs.
Forces : réduit le nombre de modèles, conserve une partie de la récence
Limites : toujours plusieurs modèles, récence partiellement sacrifiée
5. Méthode "recency aggregation"
Ne plus raisonner à la journée mais construire des features d'agrégation, puis prédire les jours comme un vecteur.
Forces : très efficace en coût, features interprétables, bonne base de production
Limites : nécessite de recalculer des features à chaque date de prédiction
6. Pivot forecasting (par cadre calendaire)
Changer la question posée au modèle : prédire "le prochain lundi" avec des features alignées sur les derniers lundis.
Forces : capture des patterns spécifiques, utile pour ensembling
Limites : multiplication de modèles selon le pivot choisi
7. Prévision hiérarchique
Prévoir à un niveau agrégé, puis redescendre au niveau fin via des proportions ou réconciliation algorithmique.
Forces : séries agrégées moins intermittentes, réduit le nombre de séries à modéliser
Limites : la reconstruction peut introduire un biais
Ce que ce panorama change au démarrage d'un projet
Au lieu de choisir "un modèle", on choisit une stratégie.
Les bonnes questions de cadrage deviennent :
- Quel est l'horizon de prévision et à quelle fréquence produire des forecasts ?
- Combien de séries et quelle distribution (volume, intermittence) ?
- Quelles variables exogènes disponibles et fiables ?
- Quel niveau de granularité requis ?
- Quel compromis coût, robustesse, maintenabilité ?
Mon objectif avec ce post : montrer que la prévision n'est pas un sujet monotone, mais un espace de design, d'architecture et d'arbitrage, où il existe plusieurs solutions valides selon le contexte.