Je vais concevoir des pipelines etl pour l'ingénierie des données avec apache airflow
Data Scientist junior, ingénieur ML, Python, pipelines ETL
À propos de ce service
Vos données sont-elles stockées dans des APIs ou des fichiers sans moyen automatisé de les collecter et de les stocker ? Je crée des pipelines ETL prêts pour la production et des workflows d’ingénierie des données utilisant Apache Airflow 3, Python et SQL qui extraient, transforment et chargent vos données selon un calendrier, entièrement automatisés, sans intervention manuelle.
Ce que je propose :
- Pipeline automatisé avec des tâches indépendantes d’extraction, de transformation et de chargement
- Apache Airflow 3 avec API TaskFlow et planification quotidienne
- Stack Docker multi-conteneurs pour un déploiement propre et reproductible
- Base de données PostgreSQL ou MySQL avec des enregistrements structurés et interrogeables
- Code source complet livré via GitHub
Pourquoi me choisir ? Je possède une publication évaluée par des pairs lors d’une conférence IEEE, deux certifications DataCamp (Data Scientist certifié et Associate Data Scientist certifié), ainsi qu’un stage de recherche dans un laboratoire d’IA basé au Royaume-Uni. Mon pipeline ETL fonctionne en production, accumulant plus de 365 enregistrements structurés par an sans intervention manuelle.
Je travaille avec : des APIs REST et des sources de données basées sur des fichiers, en chargeant les données dans des bases SQL telles que PostgreSQL ou MySQL.
Note : Merci de m’envoyer un message avant de passer commande pour discuter de votre source de données et de vos besoins.
Destination Platform:
PostgreSQL
•
mySQL
Outils et plateformes:
Autres
Mon portfolio
FAQ
Traduction automatique
À quelles sources de données pouvez-vous vous connecter ?
Actuellement API REST. Si vous avez une autre source comme des fichiers CSV ou une base de données, envoyez-moi un message d’abord pour discuter de la faisabilité.
Vous gérez l'intégralité de l'ingénierie des données ou seulement des scripts ETL basiques ?
Ingénierie des données complète : architecture de pipeline, orchestration avec Apache Airflow, containerisation avec Docker, et code prêt pour la production, pas un script ponctuel.
Dois-je déjà avoir installé Apache Airflow ?
Non. Je vais configurer l’environnement du pipeline pour vous, y compris la configuration Docker si nécessaire.
Le pipeline s’exécutera-t-il automatiquement sans que je fasse quoi que ce soit ?
Oui. Les packages Standard et Premium incluent une automatisation entièrement planifiée utilisant Apache Airflow qui s’exécute selon votre calendrier défini sans déclenchement manuel.
Vais-je recevoir le code source ?
Oui, tous les packages incluent le code source Python complet et les fichiers DAG.
Pouvez-vous travailler avec ma base de données existante ?
Oui, à condition de pouvoir fournir les identifiants de connexion en toute sécurité. Je recommande d’en discuter avant de commander.
Le pipeline vérifie-t-il la présence de données mauvaises ou invalides ?
Oui. Les données entrantes sont validées avant leur chargement, en vérifiant les types, les champs obligatoires et les valeurs clairement invalides, afin qu’un enregistrement mal formé soit détecté plutôt que d’être silencieusement ajouté à votre base de données.
Que se passe-t-il si une étape du pipeline échoue ?
Chaque tâche réessaie automatiquement plusieurs fois avant d’échouer, et vous pouvez recevoir une alerte par email si une exécution échoue finalement, afin que les problèmes soient détectés immédiatement plutôt que plusieurs jours plus tard.

