Je construirai ou optimiserai des pipelines de données PySpark Databricks

Certaines informations ont été traduites automatiquement.

États-Unis

Je parle Anglais, Hindi

Conception et automatisation de systèmes IA full-stack, MLOps

Ingénieur IA/ML full-stack et statisticien appliqué avec 10 ans d’expérience dans les données, le ML et l’IA d’entreprise. Je construis des workflows agentiques, des systèmes RAG, des modèles prédicti...
À propos de ce service

Vous avez besoin d’un pipeline PySpark ou Databricks fiable, évolutif et compréhensible ?


Je vais examiner, construire, réparer ou optimiser un pipeline de données limité en utilisant PySpark, Spark SQL, Delta Lake et Azure Databricks si nécessaire.


Je peux traiter les jobs lents, les shuffles excessifs, la skew des jointures, le partitionnement, le pruning, les fonctions de fenêtre, les fonctionnalités temporelles, le traitement incrémental, Delta Lake, les vérifications de qualité des données et la refactorisation des UDF Python.


Votre livraison peut inclure du code corrigé, des résultats de performance, la mise en œuvre du pipeline, des vérifications de validation, des recommandations de benchmark, de la documentation et une passation technique.


Mes travaux récents incluent le traitement distribué de milliards d’enregistrements de réseaux de packages dans Azure Databricks sans utiliser de UDF Python. Je privilégie des améliorations explicables et faciles à maintenir.


Les packages couvrent des jobs, sources et transformations définis. Les coûts cloud, identifiants de production, administration de plateforme et tableaux de bord non liés sont exclus sauf si inclus dans une offre personnalisée.


Veuillez m’envoyer un message avant de commander avec le code, les schémas, l’échelle des données, le runtime actuel et le résultat souhaité.

Langue:

Anglais

Hindi

Expertise technique:

Apache Spark

Databricks

Snowflake

Expertise:

Pipelines de data

Développement ETL

Secteur:

Analyse de données

Droit

Marketing et publicité

Mon portfolio