Je vais concevoir et optimiser des pipelines de données Apache Spark à grande échelle

Certaines informations ont été traduites automatiquement.

Inde

Je parle Telugu, Anglais, Hindi

Ingénieur de données senior

Ingénieur de données senior avec plus de 8 ans d’expérience dans la construction et l’optimisation de pipelines de données distribués à grande échelle. Expérimenté en Apache Spark, Scala, PySpark, Hi...
À propos de ce service

Expert en optimisation Apache Spark et architecture de pipeline de données

Vos jobs Spark échouent-ils avec des erreurs Out-of-Memory (OOM), expirent-ils lors des broadcasts ou coûtent-ils trop cher en cloud computing ?

Je suis un ingénieur de données senior avec plus de 8 ans d’expérience en entreprise dans la construction, le dépannage et l’optimisation de pipelines de données distribués à grande échelle. Je me spécialise dans le traitement de charges de plusieurs téraoctets et la résolution de goulets d’étranglement complexes en Big Data en utilisant Apache Spark, Scala, PySpark, Hadoop et Hive.

Ce que je peux faire pour vous :

  • Optimisation des performances Spark : Résoudre le déséquilibre des données, optimiser les jointures coûteuses et ajuster l’allocation mémoire pour arrêter les échecs de jobs et réduire considérablement le temps d’exécution.
  • Développement de pipelines ETL : Concevoir et construire des pipelines d’ingestion de données robustes, évolutifs et tolérants aux fautes, en utilisant les meilleures pratiques pour le partitionnement et le stockage.
  • Débogage en production : Analyser en profondeur la lignée, les shuffles et l’utilisation des ressources du cluster pour corriger les problèmes silencieux de performance dans votre code existant.
  • Pile technologique principale : Apache Spark, Scala, Python/PySpark, Hadoop, Hive, SQL et plateformes cloud (AWS).

Que vous ayez besoin d’un diagnostic rapide pour une requête échouée ou d’une architecture de données d’entreprise de bout en bout, je peux vous aider.

Balises associées