Je vais construire des pipelines de données qui

Certaines informations ont été traduites automatiquement.

Inde

Je parle Anglais

Ingénieur en IA et ML pour le fine-tuning de LLM, RAG et Data Science

Développeur en IA/ML avec une expérience pratique en production dans le fine-tuning de LLM (QLoRA/PEFT), systèmes RAG (ChromaDB, recherche vectorielle MongoDB Atlas, mémoire agentique), et ingénierie ...
À propos de ce service

Je crée des pipelines ETL de style production en utilisant PySpark pour la transformation, Airflow pour l'orchestration, et Delta Lake pour le stockage, la même stack que j'utilise dans mon travail quotidien d'ingénierie des données.

Ce qui est couvert :

  • Logique de transformation Bronze vers Silver (brut vers nettoyé) en PySpark
  • Conception de DAG Airflow avec une planification appropriée et gestion des dépendances
  • Configuration de table Delta Lake avec versioning
  • Optionnel : tableau de bord Trino/Metabase au-dessus des données nettoyées
  • Architecture de pipeline entièrement interne, auto-hébergée, sans dépendance à des plateformes ETL gérées par des tiers (Fivetran, Airbyte Cloud, etc.) si vous préférez posséder toute la stack

Je vous demanderai le volume de vos données et le format de la source avant de commencer la conception du pipeline, car cela varie beaucoup entre un CSV de 10 000 lignes et une source en streaming, et je serai honnête dans l'estimation plutôt que de réutiliser un modèle générique.

Destination Platform:

Amazon Redshift

Databricks Lakehouse

Outils et plateformes:

AWS Glue DataBrew

Google Cloud Dataflow