Je vais concevoir un pipeline ETL databricks avec delta lake pour votre entrepôt de données

Certaines informations ont été traduites automatiquement.

Pakistan

Je parle Anglais

17 commandes terminées

Ingénieur logiciel, ingénieur en données

Je suis ingénieur en logiciel et en données avec une expérience en production dans la création de systèmes de niveau entreprise sur des plateformes cloud. En tant qu'ingénieur en données, j'ai travai...
À propos de ce service

La plupart des pipelines de données échouent silencieusement. Pas de trace d'audit, pas de contrôles de qualité,

un seul script qui fait tout. Vos analystes exécutent la même requête deux fois

et obtiennent des chiffres différents.


Je construis des pipelines qui ne font pas ça.


CE QUE VOUS OBTENEZ


Architecture medallion sur Databricks + Delta Lake :


  • bronze : données brutes déposées de manière immuable. Votre point de récupération.
  • silver : chaque ligne passe un contrôle de qualité. Les échecs sont enregistrés.
  • gold : tables Delta agrégées, prêtes pour le BI. Rapide. Fiable.


Orchestré en un DAG de workflow Databricks entièrement automatisé.


POURQUOI ÇA FONCTIONNE


  • Rerun idempotent : ne duplique ni ne perd de données
  • Metrics DQ auditable, enregistrée et consultable
  • Reconstruction possible à partir de la couche Bronze


JE TRAVAILLE AVEC


Sources : CSV, Parquet, JSON, REST API, PostgreSQL, S3, ADLS

Plateformes : Databricks sur Azure ou AWS


AVANT DE COMMANDER


Contactez-moi d'abord avec votre source de données et votre question métier.

Je confirme le périmètre avant que vous passiez commande. Pas de surprises.

Destination Platform:

Snowflake

Google BigQuery

Amazon Redshift

Outils et plateformes:

Fivetran

AWS Glue DataBrew

Mon portfolio