Je vais construire votre pipeline de données ETL en utilisant Python, SQL, Airflow et AWS
Ingénieur de données
À propos de ce service
Vous avez du mal avec des données désordonnées et dispersées, difficiles à faire confiance ? Je crée des pipelines ETL fiables qui transforment des données brutes en informations propres et prêtes à être interrogées, comme le font les équipes de production de données.
J’utilise Python, SQL, Apache Airflow, PySpark et AWS pour déplacer vos données de la source vers un entrepôt structuré, avec validation tout au long du processus pour détecter rapidement les mauvaises données.
Voici ce avec quoi je peux vous aider :
Conception et développement de pipelines ETL/ELT
Orchestration avec Apache Airflow (DAG programmés)
Ingestion de données depuis API, CSV et bases de données
Transformation de données avec Python/PySpark
Modélisation d’entrepôt de données (tables de faits/dimensionnelles, PostgreSQL)
Validation de la qualité des données et contrôles automatisés
J’ai créé des pipelines de bout en bout traitant plus de 100 000 enregistrements provenant de plusieurs sources, structurés en entrepôts propres et prêts pour l’analyse.
Je tiens à un code propre et une communication claire pour que vous sachiez ce qui se passe à chaque étape, et pas seulement recevoir une boîte noire à la fin.
Vous avez une autre source de données ou un besoin spécifique ? Contactez-moi d’abord, je serai heureux de vérifier si cela correspond avant de passer commande.
Destination Platform:
Amazon Redshift
•
PostgreSQL
•
mySQL
•
Amazon S3
Outils et plateformes:
AWS Glue DataBrew
•
Autres
