Je vais construire des pipelines ETL avec pyspark et databricks
Ingénieur de données
À propos de ce service
Bonjour, je suis Arbind Sah, et je peux vous aider à concevoir des pipelines ETL évolutifs, traiter de Big Data ou optimiser des systèmes basés sur le cloud.
Je me spécialise dans Python, SQL et les outils natifs du cloud pour simplifier l’intégration de données, l’automatisation et l’analyse pour des entreprises de toutes tailles.
Ce que je peux faire pour vous :
-Conception et optimisation de pipelines ETL & Data en utilisant PySpark et Databricks pour une transformation de données fiable et prête pour la production.Solutions Utilisez Redshift, BigQuery, Spark et Databricks pour gérer efficacement de grands ensembles de données.
-Infrastructure cloud : Construire et gérer l’infrastructure sur AWS (EC2, RDS, S3, Lambda) et GCP, y compris les déploiements conteneurisés avec Docker.
-Optimisation et sécurité des bases de données : Améliorer les performances des requêtes, mettre en place une sécurité robuste et assurer la conformité avec les normes du secteur.
-Migration de données et réconciliation de schémas : Migrer et consolider des données entre PostgreSQL, MySQL et plateformes cloud, en gérant les incompatibilités de types, les valeurs nulles et la cartographie complexe des schémas.
Avec une forte orientation vers l’informatique en nuage, l’automatisation des données et l’analyse, je garantis des solutions de données évolutives, sécurisées et performantes.
Contactez-moi pour optimiser vos flux de données afin d’obtenir une efficacité maximale !
Mon portfolio
FAQ
Traduction automatique
De quelles informations avez-vous besoin de ma part pour commencer ?
Idéalement, fournissez vos données sources (ou un échantillon), le système ou le format cible, et ce que signifie « succès » pour la migration ou le pipeline. Si vous n’êtes pas sûr, envoyez-moi un message et je vous aiderai à définir le périmètre.
Pouvez-vous travailler avec des données désordonnées ou incohérentes ?
Oui — gérer les nulls, les incompatibilités de types et les formats incohérents fait partie intégrante de mon travail, ce n’est pas un cas exceptionnel que j’évite.
Fournissez-vous une documentation avec le pipeline livré ?
Oui, tous les pipelines sont accompagnés d’une documentation claire pour que votre équipe puisse maintenir et étendre le travail après la livraison.
Et si ma source ou ma cible de données n’est pas listée dans vos spécialités ?
Envoyez-moi d’abord un message avec les détails — je travaille principalement avec PostgreSQL, MySQL, PySpark/Databricks, et AWS/GCP, mais je suis heureux de discuter d’autres stacks avant votre commande.
Pouvez-vous réparer ou optimiser un pipeline existant au lieu d’en créer un nouveau ?
Oui — le débogage et l’optimisation de pipelines ETL existants font partie de ce que je fais régulièrement, pas seulement la création à partir de zéro.
Comment gérez-vous les grands ensembles de données ?
J’utilise PySpark et Databricks pour le traitement distribué, ce qui permet de gérer efficacement de grandes quantités de données plutôt que de faire échouer un seul script.
Combien de temps dure un projet typique ?
Cela dépend du volume et de la complexité des données — pour un calendrier précis, envoyez-moi un message avec les détails de votre projet avant de commander.
Signez-vous des NDA ?
Oui, je suis prêt à signer un NDA si votre projet en nécessite un — envoyez-le simplement avant que nous commencions.

