Je vais concevoir un pipeline de scraping web en Python ou d'automatisation IA
Ingénieur en automatisation IA et backend, Python FastAPI RAG
À propos de ce service
Je crée des pipelines de données qui continuent de fonctionner après la livraison, pas des scripts qui cassent en une semaine.
Ce que je fais :
- Extraire des données d'entreprise, de produits et de contacts depuis des sites et des API (Google Places, annuaires publics, sites personnalisés)
- Les nettoyer correctement : numéros de téléphone au format E.164, déduplication avec correspondance floue, vérification des emails (MX/SMTP), suppression des enregistrements obsolètes
- Les stocker dans une vraie base de données (PostgreSQL/Supabase) avec des exécutions programmées ou à la demande
- Couche IA optionnelle : évaluer et qualifier chaque enregistrement avec un LLM plus une raison en une ligne, ou extraire des données structurées à partir de textes désordonnés et de PDFs
J’utilise les API officielles lorsqu’elles existent et je ne recoure au scraping brut que lorsqu’il n’y a pas d’API, en vous indiquant laquelle est utilisée pour éviter de livrer quelque chose qui échoue lors du prochain changement de layout.
Travail récent : un moteur de leads en grille qui couvre presque toute la ville, au lieu des 60 résultats tronqués que la plupart des scrapers perdent silencieusement.
Stack : Python, httpx, BeautifulSoup, Playwright, Pandas, PostgreSQL, API LLM.
Envoyez-moi vos sites cibles et champs avant de commander pour que je puisse confirmer la faisabilité et vous donner un devis précis.
Technologie:
scrapy
•
sélénium
•
Beautiful Soup
•
Playwright
•
Pandas
Technique:
Automatisé(e)

