Je vais construire des pipelines de données prêts pour la production avec Apache Spark et Kafka
Ingénieur logiciel FullStack senior
À propos de ce service
Je crée des pipelines de données qui tiennent la route en production, pas seulement en théorie.
Douze ans dans la banque et les services financiers signifient que j’ai passé la majorité de mon temps sur les aspects peu glamour : doublons, données arrivant tard, changements de schéma qui cassent tout en aval, et jobs qui doivent pouvoir être relancés en toute sécurité. C’est la différence entre un pipeline qui fonctionne en démo et un qui peut rester en marche.
Ce avec quoi je travaille : Apache Spark, Kafka, Avro, Apache Iceberg, PostgreSQL, Java, Python, sur GCP et Kubernetes.
Types de missions que je prends en charge :
- ETL batch ou streaming depuis des systèmes sources vers un entrepôt ou un lac de données
- Transformer des scripts fragiles en jobs Spark robustes
- Consommateurs et producteurs Kafka avec gestion d’erreurs et de retries raisonnables
- Réparer des pipelines lents, instables ou qui perdent des données silencieusement
J’explique ce que je fais en termes simples, et je vous dirai honnêtement si votre problème nécessite une solution plus simple que celle demandée.
Contactez-moi avant de commander avec vos sources de données et un volume approximatif, je vous dirai quel package correspond ou si je ne suis pas la bonne personne pour le projet.
Outils et plateformes:
Autres

