Je vais nettoyer, transformer et construire des pipelines ETL
Chuchoteur de données
À propos de ce service
J’aide les entreprises et les chercheurs à transformer des données désordonnées, incohérentes ou brutes en ensembles de données propres, fiables et prêts à l’analyse, avec des pipelines complets construits en Python ou R. Je propose également du conseil pour les équipes qui ont besoin d’un avis ou d’une seconde opinion plutôt que (ou en complément de) la réalisation pratique.
Travail d’ingénierie pratique
- Nettoyer et valider des ensembles de données désordonnés (valeurs manquantes, entrées corrompues, formats incohérents, doublons)
- Construire des pipelines ETL pour automatiser l’extraction, la transformation et le chargement des données depuis CSV, Excel, API ou bases de données
- Normaliser les noms de colonnes, les types de données et les structures incohérents provenant de plusieurs sources (intégration de données)
- Concevoir des modèles et schémas de données pour un stockage propre et évolutif
- Configurer et gérer des entrepôts de données (Snowflake, BigQuery, Redshift)
- Construire des pipelines de transformation avec dbt et orchestrer des exécutions récurrentes avec Apache Airflow
- Stocker et gérer les données dans le cloud (Amazon S3)
- Gouvernance des données : règles de validation, contrôles de qualité et normes de documentation
- Migration de données entre systèmes, formats ou plateformes
- Gérer des données de séries temporelles : lacunes, coupures de capteurs, modèles saisonniers, interpolation
- Analyse de tendance et prévisions de base sur des séries temporelles nettoyées
FAQ
Traduction automatique
Quels formats de fichiers acceptez-vous ?
CSV, Excel (.xlsx), JSON, et la plupart des exports de bases SQL. Si vos données proviennent d’une API, partagez la documentation et je confirmerai la faisabilité avant votre commande.
Rédigez-vous le code en Python ou R ?
Les deux — je recommanderai celui qui convient le mieux à vos outils et votre équipe, ou celui que vous spécifiez.
Pouvez-vous gérer des flux de données récurrents/automatisés, pas seulement un fichier unique ?
Oui, c’est justement l’objectif des packages de pipeline ETL — le script est conçu pour s’exécuter à nouveau avec de nouvelles données, pas seulement pour nettoyer ce que vous envoyez une seule fois.
Que faire si mon jeu de données dépasse les limites du package ?
Pas de problème, contactez-moi avant de commander avec le nombre de lignes, et je vous enverrai un devis personnalisé.

