Je vais construire des pipelines de données et ETL avec pyspark et databricks

Certaines informations ont été traduites automatiquement.

Inde

Je parle Anglais

Ingénieur de données pour PySpark, Databricks, SQL et Python

Bonjour, je suis Abhishek, ingénieur de données à plein temps chez GHD, travaillant avec PySpark, Databricks, SQL, Python et Azure. J’aide les entreprises et les ingénieurs à : - Construire et répare...
À propos de ce service

Vous avez besoin d’un pipeline de données fiable ou d’un job Spark trop lent ou qui échoue constamment ? Je suis un ingénieur de données à plein temps, travaillant chaque jour avec PySpark, Databricks, SQL et Azure.


CE QUE JE PEUX FAIRE POUR VOUS :

  1. Construire des pipelines ETL/ELT avec PySpark et Databricks (CSV, JSON, Parquet, APIs, bases de données)
  2. Charger des données dans Delta Lake, Databricks, Azure Synapse, PostgreSQL ou SQL Server
  3. Chargements incrémentiels, Delta MERGE / upserts, tables d’historique SCD Type 2
  4. Résoudre les problèmes de jobs Spark lents ou qui échouent : déséquilibre des données, shuffles, jointures, petits fichiers, erreurs de mémoire
  5. Vérifications de la qualité des données, déduplication et création de tableaux de reporting propres
  6. Planification avec Azure Data Factory ou Databricks Workflows

CE QUE VOUS RECEVREZ :

  1. Un code propre, commenté, prêt pour la production
  2. Un court document expliquant comment l’exécuter et le maintenir
  3. Les temps d’exécution avant/après pour l’optimisation

Veuillez me contacter avant de commander avec vos sources de données, volumes et objectifs, afin que je puisse confirmer le bon package et le délai. Aucune crédentiale de production n’est nécessaire ; des données d’échantillon ou un sandbox suffisent pour commencer.

Destination Platform:

Azure Synapse Analytics

Outils et plateformes:

Azure Data Factory

•

Autres