Data pipeline: qué es y cómo mueve los datos de origen a destino
Data pipeline
¿Qué es?
Un data pipeline (tubería o canalización de datos) es el conjunto de procesos automatizados que mueve datos desde uno o varios orígenes hasta un destino, transformándolos por el camino. El origen puede ser una base de datos operativa, una API o ficheros; el destino, un data warehouse, un data lake o un sistema que los consume.
El término es más amplio que ETL o ELT: un pipeline es la infraestructura completa de movimiento de datos, mientras que ETL/ELT describen un patrón concreto de pasos dentro de ella.
Etapas habituales
Un pipeline típico encadena varias fases:
- Ingesta: capturar los datos del origen, ya sea por lotes o en continuo.
- Transformación: limpiar, normalizar, enriquecer o agregar los datos para que sean útiles.
- Carga: depositar el resultado en el destino analítico.
- Orquestación y monitorización: coordinar el orden de las tareas, gestionar dependencias y vigilar que todo se ejecuta sin errores.
Tipos de data pipeline
- Batch (por lotes): procesa los datos en bloques a intervalos definidos —cada hora, cada noche—. Es el enfoque más común en analítica y reporting.
- Streaming (en tiempo real): procesa los eventos según llegan, con latencia de segundos o menos. Necesario para detección de fraude, monitorización o personalización en vivo.
- Híbrido: combina ambos, con un flujo continuo para lo urgente y lotes para lo pesado.
Para qué sirve
- Automatizar el flujo de datos para que la analítica trabaje siempre con información fresca y sin intervención manual.
- Garantizar calidad y consistencia aplicando las mismas reglas de transformación de forma repetible.
- Desacoplar los sistemas operativos de los analíticos, evitando que las consultas pesadas afecten a producción.
- Escalar el tratamiento de datos a medida que crecen los volúmenes y las fuentes.
Data pipeline frente a ETL
| ETL / ELT | Data pipeline | |
|---|---|---|
| Qué describe | Un patrón de pasos (extraer, transformar, cargar) | Toda la infraestructura de movimiento de datos |
| Alcance | La transformación de datos | Ingesta, transformación, carga, orquestación |
| Modo | Casi siempre por lotes | Batch, streaming o híbrido |
Regla práctica: todo ETL es un pipeline, pero no todo pipeline es un ETL. Un pipeline de streaming que mueve eventos sin una fase de transformación clásica sigue siendo un data pipeline.
Más información
- ETL — el patrón clásico de extracción, transformación y carga
- ELT — la variante que transforma ya dentro del destino
- Data streaming — cómo se procesan los datos en continuo
- dbt — la herramienta de transformación dentro del pipeline
- Eventos vs batch: los fundamentos de la integración de datos — capítulo de la guía práctica de arquitectura de datos de Dataprix.
Para comparar herramientas de integración y movimiento de datos, el directorio de integración de datos de Dataprix recoge fichas y análisis editorial de las principales soluciones.
Contenido elaborado con asistencia de inteligencia artificial — Equipo Editorial Dataprix. Verifica la información antes de tomar decisiones.