Je vais construire des pipelines de données robustes et évolutifs en utilisant pyspark, databricks et airflow
Ingénieur de données certifié
À propos de ce service
Vous avez besoin de pipelines de données évolutifs et prêts pour la production ? Je crée des architectures de données performantes en utilisant Databricks, PySpark, SQL, Apache Airflow et Apache Kafka. De l’ingestion simple de fichiers au streaming en temps réel complexe, je fournis des solutions cloud optimisées et économiques.
Ce que je propose :
- ETL/ELT de bout en bout : Pipelines de données sécurisés avec PySpark et SQL.
- Optimisation Databricks : Mise en place de Delta Lake, Delta Live Tables (DLT) et Unity Catalog.
- Orchestration : DAGs Apache Airflow automatisés avec gestion des erreurs.
- Streaming en temps réel : Streaming d’événements à faible latence via Apache Kafka.
- Optimisation des performances : Réduction des coûts cloud avec des requêtes optimisées.
Pourquoi me choisir ?
- Code propre, prêt pour la production et réutilisable.
- Expérience en cloud d’entreprise (AWS / Azure).
- Documentation architecturale gratuite incluse.
FAQ
Traduction automatique
1. Quelles informations ou accès avez-vous besoin pour commencer ?
J’ai besoin d’une description claire de vos sources de données, du format final attendu, et d’un accès sécurisé et temporaire à votre environnement (comme des jetons d’accès personnels Databricks, des buckets de stockage cloud ou des environnements Airflow).
2. Gérez-vous à la fois le traitement par lots et le streaming en temps réel ?
Oui. Je construis des pipelines ETL batch standards avec PySpark et Databricks SQL, ainsi que des pipelines de streaming en temps réel à faible latence utilisant Apache Kafka et Databricks Delta Live Tables (DLT).
3. Les pipelines de données seront-ils entièrement automatisés ?
Oui. Je rédigerai des DAGs Apache Airflow personnalisés pour orchestrer, planifier, surveiller et automatiser l’ensemble de votre pipeline de données, avec une gestion robuste des erreurs et des alertes en cas d’échec.
4. Vais-je recevoir le code source et la documentation ?
Oui. Vous aurez une propriété à 100 % de tout le code source (notebooks PySpark, scripts SQL, fichiers DAG Airflow), ainsi qu’une documentation technique claire et facile à lire sur la façon de l’exécuter.

