Definición
Un Data Pipeline (tubería de datos) es una infraestructura automatizada que mueve datos desde uno o varios orígenes hasta uno o varios destinos, aplicando transformaciones en el camino. En el contexto del comercio electrónico DTC (Direct-to-Consumer), un pipeline conecta fuentes como Shopify, Meta Ads, Klaviyo, TikTok Ads, Stripe o un ERP, y los entrega limpios y consolidados a un data warehouse (BigQuery, Snowflake, Redshift) o a una herramienta de BI (Looker, Metabase, Power BI).
El objetivo no es solo "mover" datos, sino garantizar que lleguen completos, íntegros y a tiempo para que los equipos de growth, CRM y finanzas tomen decisiones con una única fuente de verdad.
Analogía
Imagina una tienda DTC con 4 sucursales físicas y 3 canales online. Cada mañana, un mensajero recoge los cierres de caja, los vales de tarjeta, los pedidos web y las devoluciones, los une en un único informe y lo deja sobre la mesa del CFO antes de las 9:00.
Ese mensajero, su ruta, sus reglas de validación y su hora de entrega son el Data Pipeline. Si el mensajero se retrasa, si pierde un sobre o si mezcla monedas, el informe llega mal y las decisiones se toman a ciegas.
Fórmula
Un pipeline se modela como una función compuesta:
Destino = T_n( T_(n-1)( ... T_1( O_1 ∪ O_2 ∪ ... ∪ O_m ) ... ) )
Donde:
- O_i = origen i (API, webhook, CSV, base de datos)
- T_j = transformación j (limpieza, normalización, join, agregación)
- n = número de etapas de transformación
Métricas clave de salud del pipeline:
Freshness (h) = Timestamp_actual − Timestamp_último_dato_disponible Throughput (reg/h) = Registros_procesados / Horas_de_ventana Error_Rate (%) = (Registros_fallidos / Registros_totales) × 100
Ejemplo real: un pipeline DTC con Freshness = 2 h, Throughput = 45.000 reg/h y Error_Rate = 0,3 % se considera saludable para reporting diario.
Comparativa: ETL vs ELT vs Reverse ETL
| Característica | ETL | ELT | Reverse ETL |
|---|---|---|---|
| Orden | Extraer → Transformar → Cargar | Extraer → Cargar → Transformar | Warehouse → Herramienta operativa |
| Motor típico | Informatica, Talend | dbt + BigQuery/Snowflake | Census, Hightouch |
| Latencia | Alta (batch pesado) | Media-baja | Baja (minutos) |
| Coste en DTC | Alto por licencias | Bajo, escalable | Medio |
| Caso típico | Migración legacy ERP | Modelo de atribución | Enviar LTV a Klaviyo |
| Ideal para | Finanzas | Growth y BI | CRM y Ads |
Aplicación en DTC / E-commerce
1. Atribución multicanal. Un pipeline une orders de Shopify con spend de Meta, Google y TikTok, y calcula ROAS blended por cohorte. Ejemplo: 12.400 pedidos/mes cruzados con 38.000 € de inversión publicitaria → ROAS 2,84.
2. Sincronización de stock. Cada 15 minutos se sincroniza el inventario del ERP con la tienda y con marketplaces (Amazon, Zalando). Reduce overselling por debajo del 0,5 %.
3. Segmentación CRM. Reverse ETL envía segmentos calculados (p. ej. "clientes con LTV > 180 € y sin compra en 60 días") a Klaviyo para campañas de reactivación.
4. Reporting financiero. Consolidación nocturna de Stripe, PayPal y Shopify Payments para conciliación diaria con menos del 0,1 % de descuadre.
Errores comunes
- No versionar las transformaciones. Cambiar una regla de negocio sin control de versiones rompe la trazabilidad y el histórico.
- Ignorar la idempotencia. Reprocesar un lote duplica pedidos y dispara KPIs falsos. Todo pipeline debe poder re-ejecutarse sin efectos colaterales.
- Confundir frescura con exactitud. Un dato "de hace 5 minutos" puede ser tan erróneo como uno de ayer si la fuente envía eventos incompletos.
- No monitorizar el Error_Rate. Un 2 % de fallos silenciosos en 500.000 eventos mensuales son 10.000 registros perdidos.
- Acoplar lógica de negocio al conector. Si la regla "cliente VIP = 3+ pedidos en 90 días" vive dentro del conector y no en el modelo, cada cambio requiere reingeniería.
- Olvidar el coste de almacenamiento. Guardar eventos crudos sin política de retención multiplica la factura del warehouse en pocos meses.
Términos relacionados
- ETL / ELT: paradigmas clásicos de integración.
- Reverse ETL: devuelve datos del warehouse a herramientas operativas.
- Data Warehouse: destino analítico (BigQuery, Snowflake, Redshift).
- Data Lake: almacén de datos crudos en formato abierto (S3, GCS).
- Orquestador: Airflow, Dagster, Prefect — programan y monitorizan el pipeline.
- dbt: capa de transformación SQL versionada.
- CDC (Change Data Capture): captura cambios incrementales en origen.
- Data Quality: validaciones de completitud, unicidad y consistencia.
- CDP: plataforma que unifica perfiles de cliente, a menudo alimentada por pipelines.