Je vais concevoir des pipelines ETL et des solutions d'ingénierie de données avec Databricks
Ingénieur de données
À propos de ce service
Ingénieur en données avec plus de 3 ans d'expérience pratique dans la création de pipelines de production sur Azure.
Je me spécialise dans la conception et le déploiement de flux de travail de données évolutifs utilisant Azure Data Factory, Databricks, PySpark et Delta Lake, depuis l'ingestion brute jusqu'aux modèles de données de la couche Gold prêtes pour l'analyse.
Ce que je peux réaliser pour vous :
pipelines ETL/ELT pilotés par métadonnées dans Azure Data Factory
Architecture Medallion (Bronze, Silver, Gold) dans Databricks
pipelines de streaming en temps réel utilisant Azure Event Hubs (compatible Kafka)
Conception d'entrepôts de données en étoile / dimensionnels
Suivi des changements SCD de type 1 et 2 avec autoCDC de Databricks
Transformations SQL complexes, PySpark et procédures stockées
Intégration d'API REST/SOAP avec tests Postman
Configuration du Unity Catalog et gouvernance des données
Pile technologique :
Python · PySpark · SQL · Azure Data Factory · Azure Databricks · Azure Data Lake Gen2 · Delta Lake · Unity Catalog · Event Hubs · Power BI
Points forts passés :
Publication de pipelines de couche dans Oracle
Amélioration de l'efficacité des API de 50 % via un traitement backend direct
Réduction du temps d'exécution de Spark de 30 % grâce à l'optimisation du partitionnement
Création d'une plateforme d'analytique en temps réel pour la réservation de courses sur Azure
