Je vais auditer et optimiser vos pipelines de données azure data factory et databricks
Spécialiste en ingénierie des données IA
À propos de ce service
Vos pipelines s'exécutent. Que tout fonctionne bien ou non, c'est une autre question. Les tâches prennent plus de temps que prévu, les coûts augmentent, les reruns créent des doublons, et personne ne peut dire quels échecs sont réellement importants.
J'audite les pipelines Azure Data Factory et Databricks pour vous indiquer ce qui ne va pas, ce qui vous coûte cher, et ce qu'il faut corriger en priorité.
Ce que je vérifie :
Conception du pipeline : orchestration, dépendances, gestion des retries et des échecs
Chargements incrémentiels : watermarking, idempotence, enregistrements tardifs
Performance Spark : partitionnement, shuffles, déséquilibres, taille du cluster
Tables Delta : taille des fichiers, OPTIMIZE/VACUUM, évolution du schéma
Coût : configuration du cluster, dépense en DBU, temps d'inactivité
Qualité des données : validation, reconciliation, journalisation
Vous recevez un rapport écrit avec chaque problème classé par impact et effort, des étapes de remédiation spécifiques, et des recommandations au niveau du code. Pas une liste de contrôle générique. Une lecture réelle de votre environnement.
Ingénieur Data senior, plus de 7 ans d'expérience dans la création de plateformes de données pour des clients d'entreprise. Microsoft Certified : Fabric Analytics Engineer Associate (DP-600).
Je travaille également avec Synapse et Microsoft Fabric. Envoyez-moi un message avec votre stack et le nombre de pipelines, et je vous dirai quel package correspond.

