Je vais concevoir une pipeline de données de production open source full stack avec automatisation cicd

Certaines informations ont été traduites automatiquement.

Pakistan

Je parle Ourdou, Anglais

Ingénieur de données

Ingénieur en données spécialisé dans la construction de lac de données auto-hébergés de bout en bout sur Kubernetes en utilisant des technologies open-source. J’ai conçu et exploité une plateforme de ...
À propos de ce service

Vous cherchez un support flexible en ingénierie des données, que ce soit pour une correction rapide ou la construction complète d’un pipeline ? Je propose trois niveaux d’engagement :


Support horaire : dépannage rapide, petites tâches Spark/ETL ou consultation

Engagement à temps partiel : développement de pipeline ou modèle dbt sur 20 heures

Construction de projet complet : mise en place d’un lakehouse de bout en bout (plus de 50 heures)


Je suis un ingénieur des données avec une expérience pratique dans la création d’un lakehouse auto-hébergé complet sur Kubernetes, traitant environ 5 millions de lignes avec Apache Spark, Apache Iceberg, Trino, dbt-Trino et Google BigQuery.


Ce que je propose :

pipelines ETL Apache Spark pour ingestion, nettoyage et transformation

Contrôles de qualité des données avec PyDeequ

Modèles de couche Gold dbt-Trino : Star Schema, Data Vault, OBT, Marts

Orchestration Dagster et automatisation CI/CD

Documentation complète (niveaux Standard et Premium)


Contactez-moi avant de passer commande pour que nous puissions discuter de vos besoins spécifiques.

Plateforme de stockage:

Snowflake

BigQuery

Databricks

Type de projet:

New Build

Mon portfolio

Balises associées