Skip to main content

En promedio, las organizaciones trabajan habitualmente con 400 fuentes de datos. Con literalmente cientos de conjuntos de datos que gestionar, la integración de datos y el análisis preciso de datos pueden ser imposibles sin los flujos de trabajo adecuados.

En esta guía, te presentaré los flujos de trabajo ETL y te ofreceré consejos para crear canalizaciones de datos ETL que permitan mejorar la funcionalidad y la calidad de los datos.

¿Qué son los flujos de trabajo ETL?

Nuestra guía definitiva sobre ETL explica los detalles específicos del proceso ETL, incluidos los procesos de extracción, transformación y carga. Para lograr una funcionalidad óptima, estos procesos deben trabajar conjuntamente para que la información fluya de manera eficiente desde la fuente de datos hasta el almacenamiento de datos.

Continue Reading for Free

Create a free account to finish this article, plus get ongoing access to timely insights and practical resources.

Los flujos de trabajo ETL se encargan de este proceso general. Normalmente incluyen diversas herramientas de API, conectores y pasos de procesamiento de datos para garantizar que el proceso de extracción, transformación y carga funcione correctamente y satisfaga las necesidades de la organización.

Ventajas de los flujos de trabajo ETL

Algunas ventajas de contar con flujos de trabajo ETL sólidos son:

  • Mejor acceso a los datos. Con los procesos ETL adecuados, puedes facilitar el acceso a los datos en tiempo real a los empleados. El proceso de extracción, transformación y carga garantiza que los datos estén listos para usarse en cuanto llegan al almacenamiento de datos, lo que facilita la ejecución de informes SQL, modelos de datos y otras consultas.
  • Capacidad para gestionar macrodatos. Los procesos ETL avanzados pueden abordar grandes conjuntos de datos e integrar datos no estructurados sin procesos manuales que consuman mucho tiempo. Esto facilita que las organizaciones gestionen los macrodatos y obtengan beneficios de ellos.
  • Mejores procesos de transformación de datos. El flujo de trabajo ETL adecuado integra elementos como la depuración y la transformación de datos para mejorar la conversión de datos sin procesar en conjuntos de datos estructurados que puedas utilizar.
  • Fomento de la eficiencia mediante la automatización. La importación de datos de origen, la ejecución de procesos de validación y otras tareas pueden gestionarse mediante herramientas ETL compatibles con la automatización, lo que reduce el tiempo necesario para gestionar los datos.
  • Capacidad para aplicar reglas empresariales en los procesos de gestión de datos. Puedes personalizar las soluciones ETL para satisfacer diversas necesidades de la organización, incluida la integración de reglas empresariales y de cumplimiento en el flujo de trabajo de extracción, transformación y carga.

Descripción general del proceso ETL

Antes de analizar los componentes clave de los flujos de trabajo ETL y cómo modelarlos, examinemos primero cómo funcionan estos procesos, incluidos los objetivos y desafíos de cada paso.

Extraer

Durante la fase de extracción de ETL, la información se recopila de una o más fuentes de datos. La extracción de datos puede trabajar tanto con datos sin procesar como con datos procesados previamente, y es posible que tengas que manejar diversos tipos de archivos, incluidos CSV y XML.

  • Objetivo: Capturar los datos más completos y exhaustivos posibles.
  • Desafíos: Identificar lagos de datos y fuentes, obtener el acceso adecuado a los datos y programar la recopilación de datos para garantizar que los procesos estén actualizados.

Mejora tu bandeja de entrada con más sabiduría sobre liderazgo tecnológico para ofrecer mejores programas y sistemas.

Transformar

El proceso de transformación de datos consiste en convertir los datos a formatos compatibles con las bases de datos relacionales y otros métodos de almacenamiento y análisis de datos que quieras utilizar. Durante este paso de ETL, puedes considerar herramientas para realizar la asignación de datos y la limpieza, eliminación de duplicados, aplicación de formato, adición de metadatos y otras tareas, tanto mediante la automatización como a través de flujos de trabajo manuales.

  • Objetivo: Datos limpios y utilizables, con un formato compatible con tu sistema o almacén de datos de destino.
  • Desafíos: La calidad de los datos es un desafío habitual al que se enfrentan las organizaciones al transformar datos; cuanto menor sea la calidad, más trabajo de transformación de datos será necesario. Otros desafíos incluyen la posible pérdida de datos, la integración de varios tipos de datos y la garantía de la seguridad durante todo el proceso.

Cargar

En el paso final de los procesos ETL, cargas los datos en el almacén de datos definitivo, dejándolos disponibles para que la organización los utilice cuando sea necesario.

  • Objetivo: Garantizar que los datos seguros y limpios estén listos para su uso en análisis o por sistemas CRM u otro software empresarial.
  • Desafíos: Garantizar la calidad y la seguridad de los datos también supone un desafío en este paso, y las organizaciones deben crear procesos de gobernanza de datos para definir quién puede acceder a los datos y cómo puede hacerlo. También puede ser importante facilitar el acceso a los datos en tiempo real —o lo más cercano posible a este—, pero el procesamiento por lotes puede provocar retrasos en el proceso.

Componentes clave de los flujos de trabajo ETL

El primer paso para crear flujos de trabajo ETL es considerar los componentes clave que deben incluirse. Los casos de uso de estos flujos de trabajo varían, y es posible que debas tener en cuenta las dependencias de datos y procesos específicas de tu organización.

infografías de flujos de trabajo ETL

Sin embargo, algunos componentes que los ingenieros de datos suelen considerar para los flujos de trabajo ETL son:

  • Fuentes de datos. ¿De dónde proceden los datos? Pueden incluir archivos importados, correos electrónicos, API externas y bases de datos internas.
  • Comprobaciones de garantía de calidad. Es posible que se necesiten procesos de control de calidad automatizados y manuales en varios pasos del flujo de trabajo ETL para garantizar que los datos cumplen los estándares de calidad o se ajustan a los requisitos del almacén de datos final.
  • Procesos de transformación de datos. La eliminación de duplicados, el formato y otras tareas, a menudo automatizadas, ayudan a mejorar la calidad.
  • Conectores de integración. Las API y otras soluciones técnicas conectan diversas partes del proceso para lograr un flujo de datos fluido.
  • Lagos de datos o almacenes. Los procesos ETL suelen trabajar con grandes cantidades de datos y necesitas un lugar donde almacenar el producto final. Los recursos de computación en la nube son habituales.
  • Canalizaciones de datos. La canalización es toda la infraestructura que permite que los datos fluyan desde las fuentes, pasen por la transformación y lleguen a la ubicación final donde se cargan.
  • Software y soluciones técnicas. Puedes integrar diversos recursos tecnológicos para respaldar el flujo de trabajo y las distintas tareas que lo componen.

Modelado de flujos de trabajo ETL

Al modelar tus canalizaciones ETL, debes considerar si quieres procesar los datos por lotes o mediante flujo continuo.

Creación de una canalización ETL con procesamiento por lotes

Con el procesamiento por lotes, el flujo de trabajo gestiona los datos en lotes o fragmentos. Cada lote suele estar predeterminado por el tiempo: por ejemplo, puedes procesar lotes a diario, periódicamente a lo largo del día o al comienzo de cada hora.

El procesamiento por lotes es una buena solución cuando:

  • Quieres aprovechar las economías de escala
  • Dispones de automatización capaz de gestionar rápidamente grandes lotes de datos
  • El acceso y el procesamiento de los datos no son muy sensibles al tiempo

Creación de una canalización ETL con procesamiento mediante flujo continuo

El procesamiento mediante flujo continuo permite que los datos circulen por ETL en tiempo real sin que se acumulen lotes de datos en ningún paso del proceso. Es más flexible que el procesamiento por lotes, pero con este tipo de canalización puede resultar más difícil garantizar la calidad y la coherencia de los datos.

El procesamiento mediante flujo continuo es una buena solución cuando:

  • Los datos entran en tu proceso en pequeños fragmentos y en intervalos irregulares
  • El acceso a los datos es sensible al tiempo, por lo que es fundamental incorporarlos inmediatamente al proceso
  • Quieres acceder a información sobre tendencias sin esperar a que se procesen los datos por lotes

Ejemplos de flujos de trabajo ETL

Comprender el flujo de datos y las necesidades de gestión específicos de tu sector es fundamental para planificar correctamente los flujos de trabajo ETL. Considera estos ejemplos de distintos sectores para entender cómo pueden variar los requisitos y las dependencias.

ETL para flujos de datos sanitarios

Las organizaciones sanitarias necesitan acceder de forma precisa y oportuna a los datos de los pacientes y de los tratamientos, por lo que los procesos ETL son esenciales para lograr buenos resultados. Los datos pueden proceder de diversas fuentes, incluidos los portales de pacientes, las historias clínicas electrónicas, los equipos de diagnóstico por imagen y proveedores externos, como las empresas farmacéuticas.

Uno de los mayores desafíos del procesamiento ETL sanitario es crear procesos seguros que cumplan normativas como HIPAA. Estos procesos también dependen de fuentes de datos proporcionadas por pacientes, proveedores y sistemas automatizados, lo que genera retos adicionales en el proceso de transformación de datos.

Al modelar las canalizaciones de datos sanitarios, es posible que debas utilizar procesamiento mediante flujo continuo y por lotes. Por ejemplo, los proveedores pueden necesitar acceso en tiempo real a los datos de diagnóstico, mientras que los datos de codificación y facturación pueden procesarse por lotes al final del día para tramitar las reclamaciones.

ETL para los flujos de datos del comercio electrónico

Los datos del comercio electrónico proceden de muchas fuentes, incluidos correos electrónicos, portales de clientes, API y aplicaciones, redes sociales, sitios web, sistemas CRM y procesos contables o de pago. Esto supone un enorme desafío a la hora de transformar los datos sin degradarlos.

El procesamiento por lotes suele funcionar bien para muchos procesos de comercio electrónico. Por ejemplo, puedes recopilar los datos de los pedidos cada hora e introducirlos en procesos ETL que respalden las tareas de almacén y envío. También puedes extraer diariamente los datos de pago para actualizar los registros financieros. 

Sin embargo, si quieres ofrecer autoservicio las 24 horas del día, los 7 días de la semana a los clientes, los flujos de trabajo basados en secuencias pueden ser más adecuados. Por ejemplo, imagina que tienes un chatbot que proporciona a los clientes información sobre pedidos, pagos, devoluciones y créditos. Si tus procesos ETL se ejecutan en lotes diarios, la información que proporciona tu chatbot siempre está desactualizada al menos 24 horas. 

ETL para los flujos de datos financieros

Los bancos, las empresas de tarjetas de crédito, las aplicaciones de gestión financiera y otras organizaciones y servicios del sector financiero dependen en gran medida de datos precisos. Estas organizaciones también deben hacer frente a estrictas normativas y estándares de cumplimiento para mantener la seguridad de los datos.

Las fuentes de datos pueden incluir datos importados de otras organizaciones financieras, datos de ACH y de cámaras de compensación, información procedente de aplicaciones orientadas al cliente y formatos menos estructurados, como los correos electrónicos. Las organizaciones financieras también pueden querer utilizar una combinación de canalizaciones por lotes y de secuencias para satisfacer las necesidades de los clientes. 

Avances tecnológicos en los procesos ETL

Hace varias décadas, la tecnología en la nube revolucionó el procesamiento de datos y todavía es un componente fundamental de los avances en el software y las soluciones de almacenes de datos. Sin embargo, actualmente, las tendencias en el avance de la tecnología ETL tienden a centrarse en la integración de la IA, el aprendizaje automático y la automatización en los flujos de trabajo. Algunos avances específicos incluyen:

  • La capacidad de la IA para gestionar grandes volúmenes de datos. Las herramientas de inteligencia artificial pueden procesar enormes cantidades de datos en cuestión de segundos, lo que permite una escalabilidad de los procesos ETL que antes no existía. 
  • Procesamiento del lenguaje natural. El aprendizaje automático y el procesamiento del lenguaje natural permiten que las soluciones automatizadas aborden la transformación de datos con un conjunto más completo de habilidades de «pensamiento crítico» de lo que era posible anteriormente. Esto crea oportunidades para automatizar tareas que históricamente requerían intervención humana. 
  • Compatibilidad con la gobernanza de datos. Actualmente, casi todos los sectores se enfrentan a requisitos normativos más estrictos, y las soluciones tecnológicas ayudan cada vez más a respaldar el cumplimiento y la seguridad de los datos. 

Prácticas recomendadas para optimizar los flujos de trabajo ETL

Lo que funciona mejor para otra organización puede no ser la mejor práctica para tu empresa en lo que respecta a ETL. Sin embargo, he recopilado algunas prácticas recomendadas generales que puedes implementar para optimizar los flujos de trabajo ETL en casi cualquier entorno. 

  • Elige las herramientas adecuadas para tus necesidades. Investiga las herramientas de procesos y flujos de trabajo ETL para encontrar socios y soluciones que satisfagan tus necesidades de datos específicas. Considera la posibilidad de formar un equipo para definir los flujos de trabajo ETL deseados, enumerar los desafíos a los que te enfrentas y evaluar las posibles soluciones teniendo en cuenta esos factores. 
  • Asegúrate de que tus elecciones de flujos de trabajo sean correctas. Dedica tiempo a comprender las diferencias entre ETL y ELT y a determinar si necesitas flujos de trabajo por lotes o basados en secuencias. 
  • Supervisa tus procesos con regularidad. Utiliza herramientas como el Monitor de rendimiento de SQL Server u otros monitores de rendimiento pertinentes para comprender cómo funcionan tus flujos de trabajo ETL. Vigila las métricas de eficiencia y calidad, y realiza ajustes según sea necesario para mejorar continuamente.  
  • Integra tecnología que admita la calidad y la escalabilidad. Considera opciones como la computación paralela y la compresión de datos para optimizar tus flujos de trabajo. 

Conclusiones principales

El diseño de tus flujos de trabajo ETL puede determinar el éxito o el fracaso de tus procesos de datos. Dedica tiempo a considerar las implicaciones de las decisiones sobre los flujos de trabajo, define los flujos ideales y elige las herramientas adecuadas para respaldar la extracción, transformación y carga de datos.

Mantente al día sobre las prácticas recomendadas en tecnología y datos suscribiéndote al boletín de CTO Club.