Je vais construire des pipelines de données ETL, ELT avec Python, Spark, Airflow et dbt
Ingénieur Data et IA, Python, PySpark, Airflow et ETL Cloud
À propos de ce service
À propos de cette service :
Vous avez besoin que vos données soient nettoyées, transformées et transmises de manière fiable du source à la destination ? Je construis des pipelines ETL/ELT en utilisant des outils modernes d’ingénierie des données tels que Python, PySpark, SQL, Apache Airflow, dbt et Databricks, en suivant l’architecture Medallion (Bronze/Silver/Gold) pour des couches de données propres et adaptées à la production.
Un projet récent inclut un pipeline qui ingère des données en direct via API, l’orchestre avec Airflow avec des alertes automatiques en cas d’échec, la transforme à l’aide de plus de 10 modèles dbt avec plus de 60 tests de qualité des données, et l’affiche dans un tableau de bord Power BI ainsi qu’un pipeline Databricks séparé traitant des données e-commerce de bout en bout avec PySpark.
Ce que je propose :
- Conception et développement de pipelines ETL/ELT (batch)
- Nettoyage, validation et tests de qualité des données
- Mise en œuvre de l’architecture Medallion (Bronze/Silver/Gold)
- Orchestration avec Apache Airflow
- Transformation de données avec dbt, SQL, PySpark
- Développement de pipelines Databricks
- Ingestion de données via API
- Intégration de tableaux de bord (Power BI)
Pourquoi travailler avec moi :
- Travail de projet réel et vérifiable, chaque livrable est appuyé par un dépôt GitHub public
- Communication claire, délais réalistes
- Code propre, documenté, adapté à la production, pas de scripts jetables
Destination Platform:
PostgreSQL
•
Amazon S3
•
Autres
Outils et plateformes:
Azure Data Factory
•
Autres
Mon portfolio
FAQ
Traduction automatique
Quel type de pipelines de données pouvez-vous construire ?
Je construis des pipelines ETL/ELT qui extraient des données via API, bases de données, fichiers plats (CSV/Excel) ou sites web. Je nettoie, transforme et teste ces données avec Python, PySpark et dbt, puis je les livre dans un format structuré vers votre base de données ou entrepôt de données (comme PostgreSQL ou Databricks).
Je ne suis pas technique, pouvez-vous quand même m'aider ?
Absolument. La plupart de mes clients ne sont pas ingénieurs. Dites-moi votre objectif final en français simple (par exemple, « Je veux rassembler mes données de ventes quotidiennes et d’inventaire en un seul endroit »), et je m’occuperai de l’architecture technique en l’expliquant simplement.
Pouvez-vous automatiser une pipeline pour qu’elle s’exécute quotidiennement ou hebdomadairement ?
Oui. Je me spécialise dans l’utilisation d’Apache Airflow pour orchestrer et automatiser les workflows. Selon votre package, je peux mettre en place des exécutions planifiées, des dépendances de tâches et des alertes par email automatiques en cas d’échec d’une partie du pipeline.
Pouvez-vous aider avec le web scraping ?
Oui. Je peux créer des scrapers web en Python pour extraire des données de sites publics, en veillant à respecter les exigences légales et les règles du site. Je peux aussi intégrer directement avec des API, ce que je recommande toujours en premier pour une meilleure stabilité.
Qu’est-ce que l’« architecture Medallion » ?
C’est un modèle de conception de données qui organise les données en trois couches : Bronze (données brutes), Silver (données nettoyées et filtrées) et Gold (données prêtes pour l’analyse). Je l’utilise pour garantir que vos rapports finaux reposent sur des données très fiables et testées.
Cela peut-il s'intégrer avec des outils de BI ?
Oui. Je conçois la couche finale de votre pipeline de données pour que des outils comme Power BI, Tableau ou autres plateformes analytiques puissent se connecter directement et interroger efficacement les données.
Qu’est-ce que l’enrichissement de données par IA ?
L’enrichissement de données par IA consiste à utiliser des outils d’IA ou LLM pour ajouter plus de sens et de structure à des données brutes et désordonnées. Par exemple, les retours clients non structurés peuvent être automatiquement catégorisés par sentiment, ou des entités spécifiques (noms, lieux) peuvent être extraites de grands blocs de texte.
Pouvez-vous ajouter un enrichissement IA ou LLM à mes données ?
Oui. Je peux intégrer des workflows IA/LLM dans votre pipeline pour gérer des tâches comme la synthèse, la classification, le marquage, et la conversion de texte non structuré en champs de base de données propres et interrogeables avant qu’ils n’atteignent votre tableau de bord.
Utilisez-vous des tests de qualité des données ?
Oui. Je crois fermement que la qualité des données doit être intégrée dès le départ, pas ajoutée en dernier. J’utilise dbt pour mettre en place des tests automatisés (vérification des valeurs nulles, doublons ou valeurs acceptées) afin que votre pipeline vous alerte en cas de mauvaises données avant qu’elles ne cassent vos rapports.

