Définition
Un Data Warehouse (ou *entrepôt de données* en français) est un système de stockage centralisé qui consolide les données issues de multiples sources (boutique en ligne, ERP, CRM, régies publicitaires, logistique, service client…) dans un référentiel unique, structuré et historisé. Contrairement à une base de production qui gère les transactions en temps réel, l'entrepôt de données est optimisé pour la lecture analytique : il permet d'interroger des millions de lignes, de croiser des cohortes, de reconstruire des tunnels de conversion et d'alimenter les tableaux de bord décisionnels.
Dans un contexte e-commerce/DTC, c'est la colonne vertébrale de la *data stack*. Sans lui, chaque canal (Shopify, Meta Ads, Klaviyo, Stripe, entrepôt logistique) reste un silo isolé, et le merchant pilote à l'aveugle.
Analogie
Imaginez votre boutique physique : vous avez un cahier de caisse, un carnet de fidélité, un registre fournisseurs et un classeur de retours produits. Chacun vit sa vie. Si un jour vous voulez savoir *« quel segment client génère le plus de marge nette après retours sur les 90 derniers jours ? »*, vous devez ouvrir les quatre cahiers, recopier les données, et espérer ne pas vous tromper.
Le Data Warehouse, c'est le classeur unique du directeur financier : toutes les écritures y arrivent, normalisées, datées, avec une seule définition du chiffre d'affaires. Vous posez une question, vous obtenez une réponse en quelques secondes.
Formule
La valeur d'un entrepôt de données se mesure souvent par le taux de couverture analytique :
Couverture = (Sources intégrées / Sources totales) × 100
Et son ROI data approximatif :
ROI = (Gains décisionnels + Temps analyste économisé) / Coût total (stockage + ETL + BI)
Exemple concret : une marque DTC réalise 2,4 M€ de CA annuel, avec 6 sources de données (Shopify, Meta, Google Ads, Klaviyo, Stripe, Odoo). Avant l'entrepôt, l'équipe passe 12 h/semaine à consolider des CSV. Après intégration, elle tombe à 2 h/semaine, soit 520 h/an économisées. À 45 €/h chargée, cela représente 23 400 € de valeur pour un coût annuel de stack d'environ 6 000 € (BigQuery + Fivetran + Looker Studio).
Tableau comparatif
| Critère | Base de production (OLTP) | Data Warehouse (OLAP) | Data Lake |
|---|---|---|---|
| Objectif | Faire tourner la boutique | Analyser & reporter | Stocker brut, tout format |
| Structure | Normalisée (3NF) | En étoile / flocon | Schéma à la lecture |
| Requêtes | Unitaires, rapides | Massives, agrégées | Variables |
| Historisation | Limitée | Complète (SCD) | Totale |
| Utilisateurs | Développeurs, ops | Analystes, dirigeants | Data scientists |
| Exemple DTC | Shopify Admin | BigQuery + dbt | S3 + Parquet |
| Latence cible | < 100 ms | 1 à 30 s | Dépend du moteur |
Applications concrètes en DTC
1. Cohortes RFM : segmentez vos clients selon Récence, Fréquence, Montant. Un entrepôt bien modélisé permet de sortir une cohorte « VIP inactifs 60 jours » en une requête, puis de la pousser vers Klaviyo pour une campagne de réactivation.
2. Attribution multi-touch : croisez les clics Meta, les sessions GA4 et les commandes Shopify pour sortir un ROAS réel par canal, au-delà du last-click.
3. Prévision de stock : en joignant ventes historiques, délais fournisseurs et saisonnalité, vous anticipez les ruptures. Une marque de cosmétiques naturels a ainsi réduit ses ruptures de 18 % à 4 % en 6 mois.
4. LTV par canal d'acquisition : comparez la valeur vie client à 12 mois des cohortes issues de TikTok Ads vs SEO. Résultat typique : un CPA TikTok plus bas, mais une LTV 30 % inférieure — décision budgétaire éclairée.
5. Détection de fraude : croisement des adresses IP, des moyens de paiement et des historiques de remboursement pour flaguer les profils à risque.
Erreurs fréquentes
- Confondre Data Warehouse et Data Lake. Le lac stocke brut, l'entrepôt structure. Les mélanger mène à un « data swamp ».
- Négliger la gouvernance. Sans dictionnaire de données, « chiffre d'affaires » veut dire TTC pour le marketing et HT pour la finance. Résultat : deux dashboards, deux vérités.
- Charger sans modéliser. Un entrepôt sans couche sémantique (dbt, LookML) devient un capharnaüm de tables orders_v2_final_final.
- Ignorer la qualité. Une adresse e-mail mal normalisée fait exploser le taux de doublons clients. Visez > 98 % de complétude sur les champs critiques.
- Sur-dimensionner dès le départ. Une marque à 500 k€ de CA n'a pas besoin d'un Snowflake à 40 k€/an. BigQuery ou DuckDB suffisent.
- Oublier le temps réel quand il faut. Pour le stock et la fraude, un entrepôt batch quotidien est trop lent : ajoutez un flux streaming ou un CDP.
Termes liés
- ETL / ELT : extraction, transformation, chargement des données vers l'entrepôt.
- Data Mart : sous-ensemble de l'entrepôt dédié à un métier (marketing, finance).
- Schéma en étoile : modélisation avec tables de faits et dimensions.
- CDP (Customer Data Platform) : entrepôt orienté activation marketing temps réel.
- dbt : outil de transformation SQL qui industrialise la modélisation.
- OLAP : mode d'interrogation analytique multidimensionnel.
- SCD (Slowly Changing Dimension) : gestion de l'historique des dimensions clients/produits.
- KPI : indicateur clé de performance (AOV, LTV, CAC, ROAS) alimenté par l'entrepôt.