Je vais construire un scraper de site web personnalisé avec exécutions planifiées et export CSV propre
développement web
À propos de ce service
Je crée des scrapers Python propres qui récupèrent des données web pour vous selon un calendrier. Prix des produits, annonces immobilières, catalogues de concurrents, avis ou prospects.
Ce que vous obtenez. Un scraper fonctionnel construit avec Python et Playwright. Il gère les sites rendus en JavaScript, la pagination, les cas anti-bot, et l'extraction structurée via JSON LD ou des sélecteurs CSS configurables. Export en CSV, JSON, Excel, Google Sheets ou directement dans votre base de données.
Cas d’usage courants. Surveillance des prix des concurrents avec alertes Slack quotidiennes en cas de baisse. Agrégation d’annonces immobilières sur plusieurs portails. Extraction de catalogues produits e-commerce et d’avis. Génération de prospects à partir de répertoires et sites d’annonces. Actualités et articles pour l’analyse ou pipelines RAG.
Option premium : automatisation complète. Cron GitHub Actions, comparaison de CSV, alertes en cas de changement. Même architecture que mon repo public de surveillance des prix des concurrents sur GitHub.
Je suis honnête sur les limites. Les sites avec une protection anti-bot agressive comme Cloudflare Turnstile, murs de connexion ou accès résidentiel uniquement peuvent nécessiter des proxies payants ou ne pas valoir la peine d’être scrappés. Je vous préviendrai si votre cible entre dans cette catégorie.
Mon portfolio
FAQ
Traduction automatique
De quelles informations avez-vous besoin pour commencer ?
L’URL ou les URLs du ou des sites à scraper, les champs précis dont vous avez besoin (par exemple nom du produit, prix, SKU, URL de l’image), le format de sortie (CSV/JSON/Excel/Sheets/DB), et la fréquence d’exécution souhaitée (unique, quotidienne, horaire).
Le web scraping est-il légal ?
En général oui pour les données accessibles publiquement, mais cela dépend des Conditions d’Utilisation du site et de l’usage que vous faites des données (RGPD pour les données personnelles, droits d’auteur pour la réutilisation du contenu). Je ne scrape que des données publiques, respecte robots.txt quand c’est raisonnable, et ajoute des délais polis. Pour les cibles en zone grise, je signalerai le risque.
Que faire si le site change sa mise en page et casse le scraper ?
Mes scrapers utilisent une extraction en couches (JSON-LD en premier, microdonnées, sélecteurs CSS en secours) donc la plupart des redesigns ne les cassent pas. Les sélecteurs sont dans la configuration, pas dans le code, donc les petites modifications sont des corrections en une ligne. Si cela casse dans les 14 jours et peut être corrigé via la config, je le fais gratuitement.
Pouvez-vous gérer la connexion, le captcha ou la protection anti-bot ?
Connexion : oui si vous fournissez les identifiants et s’il n’y a pas de captcha difficile. Anti-bot basique (UA, limites de taux) : oui via headers et délais. Anti-bot difficile (Cloudflare Turnstile, hCaptcha, accès résidentiel) : possible avec proxies payants, mais le coût augmente et la fiabilité diminue. Je vous préviens à l’avance.
Où le scraper s’exécute-t-il après livraison ?
Basique/Standard : vous l’exécutez sur votre machine ou serveur (je fournis les instructions). Premium : je déploie sur GitHub Actions (gratuit pour le public, généreux pour le privé), exécute selon un calendrier sans votre intervention. AWS Lambda, Render ou votre propre VPS sur demande.
Qu’en est-il des coûts récurrents ?
GitHub Actions : gratuit dans la plupart des cas. Stockage : fichier CSV (gratuit). Proxies (si nécessaire) : à partir de 30 $/mois avec des fournisseurs comme Bright Data ou Smartproxy. Je ne facture rien après la livraison sauf si vous souhaitez que je maintienne ou étende le scraper.

