Je vais concevoir des pipelines de données en production avec pyspark, python et sql

Certaines informations ont été traduites automatiquement.

Inde

Je parle Anglais, Hindi

Ingénieur Data et Backend

Plus de 13 ans à construire des plateformes de données et des systèmes backend — Goldman Sachs, Walmart Global Tech, Ola, et deux startups financées où j’ai dirigé des équipes de 6 à 12 ingénieurs. C...
À propos de ce service

J'ai passé plus de 13 ans à construire des pipelines de données chez Goldman Sachs, Walmart Global Tech, Ola et deux startups financées par des investisseurs. Les pipelines que j'ai gérés déplacent des téraoctets par jour. Maintenant, je vais créer le vôtre.


CE QUE VOUS OBTENEZ

- Un pipeline PySpark / Python / SQL fonctionnel, pas un simple dump de notebook

- Idempotent et réexécutable, donc sûr à relancer après une erreur

- Gère les nulls, les doublons, les données tardives et le changement de schéma sans planter

- Code commenté et lisible, avec une courte vidéo pour vous l'expliquer


JE TRAVAILLE AVEC

PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)


TRAVAUX TYPIQUES

- Conversion de CSV/JSON/Parquet désordonnés en une table modélisée propre

- Un job ou une requête Spark qui doit vraiment se terminer

- Extraction planifiée depuis une API ou une base de données

- Fonctions de fenêtre, logique de déduplication, chargements incrémentiels, CDC


AVANT DE COMMANDER

Envoyez-moi un message avec un échantillon de données et le résultat attendu. Je vous dirai quel package convient, ou si je ne suis pas la personne qu'il vous faut. La définition du périmètre est gratuite.


Je suis en IST et je travaille en overlap avec les heures US et EU.

Destination Platform:

Google BigQuery

Amazon Redshift

ClickHouse

Outils et plateformes:

Hevo Data

Kafka Connect

Debezium