Je vais concevoir des pipelines de données en production avec pyspark, python et sql
Ingénieur Data et Backend
À propos de ce service
J'ai passé plus de 13 ans à construire des pipelines de données chez Goldman Sachs, Walmart Global Tech, Ola et deux startups financées par des investisseurs. Les pipelines que j'ai gérés déplacent des téraoctets par jour. Maintenant, je vais créer le vôtre.
CE QUE VOUS OBTENEZ
- Un pipeline PySpark / Python / SQL fonctionnel, pas un simple dump de notebook
- Idempotent et réexécutable, donc sûr à relancer après une erreur
- Gère les nulls, les doublons, les données tardives et le changement de schéma sans planter
- Code commenté et lisible, avec une courte vidéo pour vous l'expliquer
JE TRAVAILLE AVEC
PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)
TRAVAUX TYPIQUES
- Conversion de CSV/JSON/Parquet désordonnés en une table modélisée propre
- Un job ou une requête Spark qui doit vraiment se terminer
- Extraction planifiée depuis une API ou une base de données
- Fonctions de fenêtre, logique de déduplication, chargements incrémentiels, CDC
AVANT DE COMMANDER
Envoyez-moi un message avec un échantillon de données et le résultat attendu. Je vous dirai quel package convient, ou si je ne suis pas la personne qu'il vous faut. La définition du périmètre est gratuite.
Je suis en IST et je travaille en overlap avec les heures US et EU.
FAQ
Traduction automatique
Pouvez-vous travailler avec mes données si elles sont confidentielles ?
Oui. Je travaillerai à partir d’un échantillon basé uniquement sur le schéma ou de données synthétiques correspondant à votre structure, et je ne conserve rien après livraison. Je suis prêt à signer un NDA avant que vous envoyiez quoi que ce soit.
Quelle est la taille maximale des données ?
Confortablement jusqu’à plusieurs téraoctets — j’ai géré des pipelines traitant environ 3TB/jour. Pour les gros travaux, j’utilise Spark ou DuckDB plutôt que Pandas, pour qu’ils se terminent réellement.
Ai-je besoin de Spark ou juste de SQL ?
Envoyez-moi un message. La plupart du temps, la réponse est « vous n’avez pas besoin de Spark », même si la version Spark serait une commande plus grande.
Puis-je assurer la maintenance après la livraison ?
C’est le but. Code commenté, un README, et une vidéo explicative. Si votre équipe peut lire du Python, elle peut en prendre la responsabilité.

