Je vais construire des pipelines ETL AWS avec Airflow, Spark et Python
Ingénieur de données senior
À propos de ce service
Ingénieur Data senior avec plus de 10 ans d'expérience dans la création d'ETL en production pour des clients du Fortune 500 (Expedia, Ford, HP).
Je conçois des pipelines de données AWS fiables et prêts pour la production avec Python, PySpark, Airflow et Spark, pas des scripts jetables. Un vrai travail d'ingénierie : partitionnement, jointures broadcast, orchestration et tests.
Réalisations :
Réduction d'un job HiveQL de 64 heures à moins de 3 heures (gain de 95,6 %)
Migration de 500 TB de Hadoop vers AWS, entièrement validée
Création et gestion de ma propre plateforme SaaS multi-tenant de bout en bout
Ce que vous obtenez : des pipelines de code propres, documentés et déployables que votre équipe peut maintenir, pas une boîte noire.
Basé au Mexique (fuseau horaire compatible avec les États-Unis), collaboration en temps réel pendant vos heures de bureau. Anglais courant.
Vous n'êtes pas sûr du package qui vous convient ? Contactez-moi d'abord et je définirai avec vous le périmètre.
Outils et plateformes:
AWS Glue DataBrew
•
Autres
Mon portfolio
FAQ
Traduction automatique
Q : Travaillez-vous avec des sources de données en dehors d'AWS ?
R : Oui — j'ingère des données depuis des bases de données (PostgreSQL, MySQL), des API, des fichiers et des sources de streaming comme Kafka, en déposant les données dans S3, Redshift ou votre entrepôt de données préféré.
Q : Aurai-je accès au code source et à la documentation ?
R : Toujours. Vous recevez un code propre, versionné, ainsi que la documentation pour que votre équipe puisse tout exécuter et maintenir de manière autonome.
Q : Je ne suis pas sûr du package dont j'ai besoin. Pouvez-vous m'aider ?
R : Absolument. Envoyez-moi un message avec vos sources, votre destination et votre volume, et je vous recommanderai le package adapté ou créerai une offre personnalisée.
Q : Pouvez-vous réparer ou optimiser un pipeline existant au lieu d'en créer un nouveau ?
R : Oui. J'audite les pipelines cassés ou lents et je les optimise — mon travail sur HiveQL a réduit un job de 64 heures à moins de 3 heures.

