Je vais construire des pipelines de données robustes et évolutifs en utilisant pyspark, databricks et airflow

Certaines informations ont été traduites automatiquement.

Inde

Je parle Anglais

Ingénieur de données certifié

Ingénieur de données orienté résultats avec 4,5 ans d’expérience dans la conception, le développement, le test, le support et l’optimisation de pipelines ETL/ELT évolutifs utilisant PySpark, Databrick...
À propos de ce service

Vous avez besoin de pipelines de données évolutifs et prêts pour la production ? Je crée des architectures de données performantes en utilisant Databricks, PySpark, SQL, Apache Airflow et Apache Kafka. De l’ingestion simple de fichiers au streaming en temps réel complexe, je fournis des solutions cloud optimisées et économiques.


Ce que je propose :

  • ETL/ELT de bout en bout : Pipelines de données sécurisés avec PySpark et SQL.
  • Optimisation Databricks : Mise en place de Delta Lake, Delta Live Tables (DLT) et Unity Catalog.
  • Orchestration : DAGs Apache Airflow automatisés avec gestion des erreurs.
  • Streaming en temps réel : Streaming d’événements à faible latence via Apache Kafka.
  • Optimisation des performances : Réduction des coûts cloud avec des requêtes optimisées.


Pourquoi me choisir ?

  • Code propre, prêt pour la production et réutilisable.
  • Expérience en cloud d’entreprise (AWS / Azure).
  • Documentation architecturale gratuite incluse.



Destination Platform:

Snowflake

Databricks Lakehouse

Teradata

Outils et plateformes:

Fivetran

Kafka Connect

Microsoft SSIS