Je construirai ou optimiserai des pipelines de données PySpark Databricks
Conception et automatisation de systèmes IA full-stack, MLOps
À propos de ce service
Vous avez besoin d’un pipeline PySpark ou Databricks fiable, évolutif et compréhensible ?
Je vais examiner, construire, réparer ou optimiser un pipeline de données limité en utilisant PySpark, Spark SQL, Delta Lake et Azure Databricks si nécessaire.
Je peux traiter les jobs lents, les shuffles excessifs, la skew des jointures, le partitionnement, le pruning, les fonctions de fenêtre, les fonctionnalités temporelles, le traitement incrémental, Delta Lake, les vérifications de qualité des données et la refactorisation des UDF Python.
Votre livraison peut inclure du code corrigé, des résultats de performance, la mise en œuvre du pipeline, des vérifications de validation, des recommandations de benchmark, de la documentation et une passation technique.
Mes travaux récents incluent le traitement distribué de milliards d’enregistrements de réseaux de packages dans Azure Databricks sans utiliser de UDF Python. Je privilégie des améliorations explicables et faciles à maintenir.
Les packages couvrent des jobs, sources et transformations définis. Les coûts cloud, identifiants de production, administration de plateforme et tableaux de bord non liés sont exclus sauf si inclus dans une offre personnalisée.
Veuillez m’envoyer un message avant de commander avec le code, les schémas, l’échelle des données, le runtime actuel et le résultat souhaité.
Mon portfolio
FAQ
Traduction automatique
Pouvez-vous optimiser un job PySpark existant ?
Oui. Je peux examiner la logique d’exécution, les jointures, les shuffles, la skew, le partitionnement, le caching, les fonctions de fenêtre, l’utilisation des UDF, les lectures/écritures et la structure du job. Les gains réels dépendent des données, de la configuration du cluster et de l’implémentation existante.
Pouvez-vous garantir une amélioration spécifique de la performance ?
Non. J’identifierai les goulots d’étranglement et validerai les améliorations lorsque l’accès à une exécution représentative sera disponible, mais le temps d’exécution dépend de la distribution des données, des ressources du cluster, de la concurrence, du stockage et de la configuration de la plateforme.
Travaillez-vous uniquement avec Azure Databricks ?
Ma expérience la plus récente porte sur Azure Databricks et PySpark, mais les concepts Spark s’appliquent également à d’autres environnements Spark gérés. Confirmez votre plateforme avant de commander.
Avez-vous besoin d’accéder aux données de production ?
Pas nécessairement. Des échantillons nettoyés, des schémas, des plans d’exécution, des captures d’écran de Spark UI, des logs et des données de test reproductibles suffisent souvent. Ne jamais envoyer de credentials de production non restreints via Fiverr.
Les coûts cloud et de cluster sont-ils inclus ?
Non. L’acheteur paie les coûts de Databricks, cloud, stockage, base de données et autres infrastructures. Utilisez un environnement non productif à coût contrôlé lorsque cela est possible.
Fournirez-vous le code source et la documentation ?
Oui. Les livrables suivent le package choisi et peuvent inclure notebooks, modules Python, SQL, exemples de configuration, tests, résultats, instructions README et un manuel d’exploitation.
Pouvez-vous construire une plateforme de bout en bout ?
Ce service couvre les pipelines limités et les jobs connectés. Une plateforme de données complète, une migration à l’échelle de l’organisation, un programme de gouvernance ou une opération continue en production nécessitent une découverte et une offre personnalisée.
Qu'est-ce qui compte comme une révision ?
Une révision corrige le travail livré selon les exigences convenues. Les nouvelles sources, transformations, notebooks, plateformes, schémas ou logique métier modifiée constituent un scope supplémentaire.

