Skip to main content

In media, le organizzazioni gestiscono regolarmente 400 fonti di dati. Dovendo gestire letteralmente centinaia di insiemi di dati, l'integrazione dei dati e un'analisi accurata possono essere impossibili senza i flussi di lavoro appropriati.

In questa guida, ti presenterò i flussi di lavoro ETL e ti fornirò consigli per creare pipeline di dati ETL che supportino funzionalità avanzate e la qualità dei dati.

Cosa sono i flussi di lavoro ETL?

La nostra guida completa all'ETL illustra nel dettaglio il processo ETL, comprese le procedure di estrazione, trasformazione e caricamento. Per garantire funzionalità ottimali, questi processi devono operare insieme affinché le informazioni fluiscano in modo efficiente dalla fonte dei dati al magazzino dati.

Continue Reading for Free

Create a free account to finish this article, plus get ongoing access to timely insights and practical resources.

I flussi di lavoro ETL sono responsabili di questo processo complessivo. In genere coinvolgono vari strumenti API, connettori e fasi di elaborazione dei dati per garantire che il processo di estrazione, trasformazione e caricamento funzioni correttamente e supporti le esigenze dell'organizzazione.

Vantaggi dei flussi di lavoro ETL

Alcuni vantaggi di flussi di lavoro ETL solidi includono:

  • Accesso avanzato ai dati. Con i processi ETL appropriati, puoi supportare l'accesso ai dati in tempo reale per i dipendenti. Il processo di estrazione, trasformazione e caricamento garantisce che i dati siano pronti per l'uso non appena raggiungono l'archiviazione dei dati, facilitando l'esecuzione di rapporti SQL, modelli di dati e altre query.
  • Capacità di gestire i megadati. I processi ETL avanzati possono gestire grandi insiemi di dati e integrare dati non strutturati senza processi manuali che richiedono molto tempo. Questo facilita la gestione e l'utilizzo dei megadati da parte delle organizzazioni.
  • Migliori processi di trasformazione dei dati. Il flusso di lavoro ETL appropriato integra elementi come la pulizia e la trasformazione dei dati per migliorare la conversione dei dati grezzi in insiemi di dati strutturati utilizzabili.
  • Supporto all'efficienza tramite l'automazione. L'importazione dei dati di origine, l'esecuzione dei processi di convalida e altre attività possono essere gestite da strumenti ETL che supportano l'automazione, riducendo il tempo necessario per gestire i dati.
  • Possibilità di applicare regole aziendali nei processi di gestione dei dati. Puoi personalizzare le soluzioni ETL per soddisfare diverse esigenze organizzative, inclusa l'integrazione delle regole aziendali e di conformità nel flusso di lavoro di estrazione, trasformazione e caricamento.

Panoramica del processo ETL

Prima di discutere i componenti chiave dei flussi di lavoro ETL e come modellarli, esaminiamo innanzitutto il funzionamento di questi processi, compresi gli obiettivi e le sfide di ogni fase.

Estrazione

Durante la fase di estrazione dell'ETL, le informazioni vengono raccolte da una o più fonti di dati. L'estrazione dei dati può riguardare dati grezzi così come dati precedentemente elaborati e potresti gestire vari tipi di file, inclusi CSV e XML.

  • Obiettivo: Acquisire i dati più olistici e completi possibile.
  • Sfide: Identificare i laghi di dati e le fonti, ottenere l'accesso appropriato ai dati e programmare la raccolta dei dati per garantire processi aggiornati.

Arricchisci la tua casella di posta con più saggezza sulla leadership tecnologica per offrire software e sistemi migliori.

Trasformazione

Il processo di trasformazione dei dati consiste nel convertire i dati in formati compatibili con i database relazionali e con gli altri metodi di archiviazione e analisi dei dati che desideri utilizzare. Durante questa fase dell'ETL, puoi valutare strumenti per eseguire la mappatura dei dati e attività di pulizia, rimozione dei duplicati, formattazione, aggiunta di metadati e altro ancora, sia tramite l'automazione sia mediante flussi di lavoro manuali.

  • Obiettivo: Dati puliti e utilizzabili, formattati per funzionare nel sistema o archivio dati di destinazione.
  • Sfide: La qualità dei dati è una sfida comune che le organizzazioni devono affrontare durante la trasformazione dei dati; più bassa è la qualità, maggiore sarà il lavoro di trasformazione richiesto. Altre sfide includono la potenziale perdita di dati, l'integrazione di più tipi di dati e la garanzia della sicurezza durante l'intero processo.

Caricamento

Nella fase finale dei processi ETL, carichi i dati nel magazzino dati finale, rendendoli disponibili per l'utilizzo secondo le necessità dell'organizzazione.

  • Obiettivo: Garantire che dati sicuri e puliti siano pronti per l'uso nelle analisi o da parte dei sistemi CRM o di altri software aziendali.
  • Sfide: Garantire la qualità e la sicurezza dei dati rappresenta una sfida anche in questa fase e le organizzazioni devono creare processi di governance dei dati per definire chi può accedere ai dati e come può farlo. Potrebbe essere importante supportare l'accesso ai dati in tempo reale, o il più vicino possibile al tempo reale, ma l'elaborazione a lotti può causare ritardi nel processo.

Componenti chiave dei flussi di lavoro ETL

Il primo passo nella creazione dei flussi di lavoro ETL consiste nel considerare i componenti chiave che dovrebbero essere inclusi. I casi d'uso di questi flussi di lavoro variano e potrebbe essere necessario considerare le dipendenze uniche da dati e processi della propria organizzazione.

infografica sui flussi di lavoro ETL

Tuttavia, alcuni componenti che gli ingegneri dei dati considerano comunemente per i flussi di lavoro ETL includono:

  • Origini dei dati. Da dove provengono i dati? Potrebbero essere inclusi file importati, e-mail, API esterne e database interni.
  • Controlli di garanzia della qualità. Potrebbero essere necessari processi di controllo qualità automatizzati e manuali in varie fasi del flusso di lavoro ETL per garantire che i dati soddisfino gli standard di qualità o siano conformi ai requisiti dell'archivio dati finale.
  • Processi di trasformazione dei dati. La deduplicazione, la formattazione e altre attività, spesso automatizzate, contribuiscono a migliorare la qualità.
  • Connettori di integrazione. Le API e altre soluzioni tecniche collegano varie parti del processo per garantire un flusso di dati continuo.
  • Lago di dati o magazzino dati. I processi ETL gestiscono in genere grandi quantità di dati e serve un luogo in cui archiviare il prodotto finale. Le risorse di calcolo cloud sono comuni.
  • Pipeline di dati. La pipeline è l'intera infrastruttura che consente ai dati di fluire dalle origini, passando per la trasformazione, fino alla posizione finale in cui vengono caricati.
  • Software e soluzioni tecniche. È possibile integrare diverse risorse tecnologiche per supportare il flusso di lavoro e le varie attività che ne fanno parte.

Modellazione dei flussi di lavoro ETL

Quando si modellano le proprie pipeline ETL, è necessario considerare se si desidera elaborare i dati in modalità batch o tramite flusso continuo.

Creazione di una pipeline ETL con elaborazione batch

Con l'elaborazione batch, il flusso di lavoro gestisce i dati in batch o blocchi. Ogni batch è generalmente predeterminato in base al tempo: ad esempio, si potrebbe eseguire l'elaborazione quotidianamente, periodicamente durante la giornata o all'inizio di ogni ora.

L'elaborazione batch è una buona soluzione quando:

  • Si desidera sfruttare le economie di scala
  • È presente un'automazione in grado di gestire rapidamente grandi batch di dati
  • L'accesso e l'elaborazione dei dati non sono altamente sensibili al fattore tempo

Creazione di una pipeline ETL con elaborazione tramite flusso continuo

L'elaborazione tramite flusso continuo consente ai dati di fluire attraverso ETL in tempo reale senza accumulare batch di dati in nessuna fase del processo. È più flessibile dell'elaborazione batch, ma con questo tipo di pipeline può essere più difficile garantire la qualità e la coerenza dei dati.

L'elaborazione tramite flusso continuo è una buona soluzione quando:

  • I dati entrano nel processo in piccoli blocchi e a intervalli irregolari
  • L'accesso ai dati è sensibile al fattore tempo, rendendo fondamentale inserirli immediatamente nel processo
  • Si desidera accedere a informazioni sulle tendenze senza attendere l'elaborazione dei dati in batch

Esempi di flussi di lavoro ETL

Comprendere il flusso e le esigenze di gestione dei dati specifici del proprio settore è fondamentale per pianificare con successo i flussi di lavoro ETL. Considerare questi esempi relativi a diversi settori per comprendere come potrebbero variare requisiti e dipendenze.

ETL per i flussi di dati sanitari

Le organizzazioni sanitarie richiedono un accesso accurato e tempestivo ai dati dei pazienti e dei trattamenti, rendendo i processi ETL essenziali per il successo. I dati possono provenire da diverse fonti, tra cui portali per i pazienti, cartelle cliniche elettroniche, apparecchiature di diagnostica per immagini e fornitori terzi come le aziende farmaceutiche.

Una delle principali sfide dell'ETL sanitario consiste nella creazione di processi sicuri conformi a normative come l'HIPAA. Questi processi dipendono inoltre da origini dei dati alimentate da pazienti, fornitori e automazione, creando ulteriori difficoltà nel processo di trasformazione dei dati.

Quando si modellano le pipeline di dati sanitari, potrebbe essere necessario utilizzare l'elaborazione tramite flusso continuo e batch. Ad esempio, i fornitori potrebbero aver bisogno di accedere in tempo reale ai dati diagnostici, mentre i dati relativi alla codifica e alla fatturazione possono essere elaborati in batch alla fine della giornata ai fini delle richieste di rimborso.

ETL per i flussi di dati dell'e-commerce

I dati dell'e-commerce provengono da numerose fonti, tra cui e-mail, portali clienti, API e app, social media, siti web, sistemi CRM e processi contabili o di pagamento. Questo crea una sfida enorme nella trasformazione dei dati senza comprometterne l'integrità.

L'elaborazione in lotti funziona generalmente bene per molti processi di e-commerce. Ad esempio, si possono acquisire i dati degli ordini ogni ora e inserirli nei processi ETL che supportano le attività di magazzino e spedizione. È anche possibile estrarre quotidianamente i dati dei pagamenti, in modo da aggiornare i registri finanziari. 

Tuttavia, se si desidera offrire ai clienti un servizio accessibile autonomamente attivo 24 ore su 24, 7 giorni su 7, i flussi di lavoro basati su flussi continui potrebbero essere più appropriati. Ad esempio, si potrebbe avere un chatbot che fornisce ai clienti informazioni su ordini, pagamenti, resi e crediti. Se i processi ETL vengono eseguiti in lotti giornalieri, le informazioni fornite dal chatbot sono sempre obsolete di almeno 24 ore. 

ETL per i flussi di dati finanziari

Le banche, le società di carte di credito, le app per la gestione del denaro e altre organizzazioni e servizi del settore finanziario fanno ampio affidamento su dati accurati. Queste organizzazioni devono inoltre rispettare normative rigorose e standard di conformità per mantenere sicuri i dati.

Le fonti di dati possono includere dati importati da altre organizzazioni finanziarie, dati ACH e delle stanze di compensazione, informazioni provenienti dalle app rivolte ai clienti e formati meno strutturati come le e-mail. Le organizzazioni finanziarie potrebbero anche voler utilizzare una combinazione di pipeline in lotti e continue per soddisfare le esigenze dei clienti. 

Progressi tecnologici nei processi ETL

Diversi decenni fa, la tecnologia cloud ha rivoluzionato l'elaborazione dei dati e continua a essere una componente fondamentale dei progressi nel software e nelle soluzioni per magazzini di dati. Tuttavia, attualmente le tendenze nell'evoluzione della tecnologia ETL si concentrano sull'integrazione dell'IA, dell'apprendimento automatico e dell'automazione nei flussi di lavoro. Alcuni progressi specifici includono:

  • La capacità dell'IA di gestire grandi volumi di dati. Gli strumenti di intelligenza artificiale possono elaborare enormi quantità di dati in pochi secondi, consentendo una scalabilità dei processi ETL che in precedenza non era possibile. 
  • Elaborazione del linguaggio naturale. L'apprendimento automatico e l'elaborazione del linguaggio naturale permettono alle soluzioni automatizzate di affrontare la trasformazione dei dati con un insieme più completo di competenze di "pensiero critico" rispetto a quanto fosse possibile in precedenza. Ciò crea opportunità per automatizzare attività che storicamente richiedevano l'intervento umano. 
  • Supporto alla governance dei dati. Oggi quasi tutti i settori devono gestire requisiti normativi più rigorosi e le soluzioni tecnologiche contribuiscono sempre più a sostenere la conformità e la sicurezza dei dati. 

Buone pratiche per ottimizzare i flussi di lavoro ETL

Ciò che funziona meglio per un'altra organizzazione potrebbe non rappresentare la buona pratica migliore per la propria azienda quando si tratta di ETL. Tuttavia, ho raccolto alcune buone pratiche generali che è possibile implementare per ottimizzare i flussi di lavoro ETL in quasi qualsiasi ambiente. 

  • Scegliere gli strumenti giusti per le proprie esigenze. Fare ricerche sugli strumenti per i flussi di lavoro e i processi ETL, così da trovare partner e soluzioni in grado di soddisfare le proprie esigenze specifiche in materia di dati. Si può valutare la possibilità di riunire un team per mappare i flussi di lavoro ETL desiderati, elencare le difficoltà da affrontare e valutare le potenziali soluzioni alla luce di tali fattori. 
  • Assicurarsi che le scelte relative ai flussi di lavoro siano corrette. Prendersi il tempo necessario per comprendere la differenza tra ETL ed ELT e stabilire se siano necessari flussi di lavoro in lotti o continui. 
  • Monitorare regolarmente i processi. Utilizzare strumenti come SQL Server per il monitoraggio delle prestazioni o altri monitor delle prestazioni pertinenti per comprendere il rendimento dei flussi di lavoro ETL. Tenere sotto controllo le metriche di efficienza e qualità e apportare modifiche secondo necessità per un miglioramento continuo.  
  • Integrare tecnologie che supportino qualità e scalabilità. Valutare opzioni come il calcolo parallelo e la compressione dei dati per ottimizzare i flussi di lavoro. 

Punti chiave

La progettazione dei flussi di lavoro ETL può determinare il successo o il fallimento dei processi relativi ai dati. È importante valutare le implicazioni delle decisioni sui flussi di lavoro, delineare i flussi ideali e scegliere gli strumenti giusti per supportare l'estrazione, la trasformazione e il caricamento dei dati.

Restare aggiornati sulla tecnologia e sulle buone pratiche relative ai dati iscrivendosi alla newsletter del CTO Club.