Vous avez besoin d’un traitement de données évolutif et performant pour votre entreprise ?
Je suis un ingénieur en données professionnel spécialisé en PySpark, Python, SQL et architectures cloud. J’aide les entreprises à transformer des ensembles de données brutes et non structurées en pipelines de données propres, fiables et exploitables.
Ce que je peux faire pour vous :
- Construire des pipelines ETL/ELT robustes en batch et en temps réel avec PySpark.
- Traiter de grands ensembles de données CSV, Parquet, JSON ou SQL avec une haute performance.
- Intégrer PySpark avec Databricks, AWS (S3, Glue, Redshift), GCP et Azure.
- Optimiser un code PySpark lent (repartitioning, mise en cache, jointures broadcast, correction des erreurs de mémoire).
- Nettoyer, valider et structurer des ensembles de données brutes pour l’analyse ou le Machine Learning.
Pourquoi me choisir ?
- Code prêt pour la production, entièrement commenté.
- Instructions d’installation complètes.
- Sécurité et confidentialité des données garanties à 100 %.