Je vais construire des pipelines de données ETL automatisés avec pyspark et python

Certaines informations ont été traduites automatiquement.

Inde

Je parle Anglais
Ingénieur en données ayant conçu et construit une plateforme de données de santé à partir de zéro, traitant aujourd’hui plus de 5 millions de dossiers patients et plus de 10 téraoctets de données clin...
À propos de ce service

Vous avez besoin d’un traitement de données évolutif et performant pour votre entreprise ?

Je suis un ingénieur en données professionnel spécialisé en PySpark, Python, SQL et architectures cloud. J’aide les entreprises à transformer des ensembles de données brutes et non structurées en pipelines de données propres, fiables et exploitables.

Ce que je peux faire pour vous :

  • Construire des pipelines ETL/ELT robustes en batch et en temps réel avec PySpark.
  • Traiter de grands ensembles de données CSV, Parquet, JSON ou SQL avec une haute performance.
  • Intégrer PySpark avec Databricks, AWS (S3, Glue, Redshift), GCP et Azure.
  • Optimiser un code PySpark lent (repartitioning, mise en cache, jointures broadcast, correction des erreurs de mémoire).
  • Nettoyer, valider et structurer des ensembles de données brutes pour l’analyse ou le Machine Learning.

Pourquoi me choisir ?

  • Code prêt pour la production, entièrement commenté.
  • Instructions d’installation complètes.
  • Sécurité et confidentialité des données garanties à 100 %.

Destination Platform:

PostgreSQL

•

mySQL

•

Serveur Microsoft SQL

Outils et plateformes:

AWS Glue DataBrew

•

Azure Data Factory