Je vais construire des pipelines de données qui
Ingénieur en IA et ML pour le fine-tuning de LLM, RAG et Data Science
À propos de ce service
Je crée des pipelines ETL de style production en utilisant PySpark pour la transformation, Airflow pour l'orchestration, et Delta Lake pour le stockage, la même stack que j'utilise dans mon travail quotidien d'ingénierie des données.
Ce qui est couvert :
- Logique de transformation Bronze vers Silver (brut vers nettoyé) en PySpark
- Conception de DAG Airflow avec une planification appropriée et gestion des dépendances
- Configuration de table Delta Lake avec versioning
- Optionnel : tableau de bord Trino/Metabase au-dessus des données nettoyées
- Architecture de pipeline entièrement interne, auto-hébergée, sans dépendance à des plateformes ETL gérées par des tiers (Fivetran, Airbyte Cloud, etc.) si vous préférez posséder toute la stack
Je vous demanderai le volume de vos données et le format de la source avant de commencer la conception du pipeline, car cela varie beaucoup entre un CSV de 10 000 lignes et une source en streaming, et je serai honnête dans l'estimation plutôt que de réutiliser un modèle générique.
FAQ
Traduction automatique
Travaillez-vous avec des sources de données cloud (S3, GCS, Azure Blob) ?
Oui — précisez votre source dans les exigences.
Pouvez-vous réparer un pipeline existant cassé plutôt que d'en créer un nouveau ?
Oui, contactez-moi d'abord avec les détails — le prix diffère des gigs de nouvelle création.
Ai-je besoin de ma propre instance Airflow ?
Non, je peux en mettre une en place (local/Docker) dans le cadre de la livraison, ou travailler avec la vôtre si vous me donnez accès.
Pouvez-vous construire cela sans dépendre d'outils ETL gérés par des tiers ?
Oui — je construis des pipelines entièrement en interne / auto-hébergés (PySpark + Airflow + Delta Lake) plutôt que de connecter des outils comme Fivetran ou Airbyte Cloud. Disponible dans la formule Premium.
