Je vais concevoir un scraper web programmé et un pipeline de données avec une sortie propre et dédupliquée
Développeur en automatisation Python et traitement de données
À propos de ce service
Vous avez besoin de données web fraîches chaque jour ou chaque semaine sans relancer un script manuellement ? Je conçois un scraper qui s’exécute automatiquement selon un calendrier, nettoie ce qu’il collecte, supprime les doublons et vous fournit un fichier ou une base de données prête à l’emploi.
Ce que vous obtenez : un scraper Python (Playwright ou Scrapy selon le site), des exécutions automatiques sur votre machine ou serveur, la validation de chaque enregistrement, une clé unique par élément pour éviter les doublons, des tentatives en cas de lenteur du site, et un journal qui indique clairement si une exécution a échoué et pourquoi. Sortie : CSV, XLSX, JSON ou SQLite.
Pourquoi moi : pour un client, j’ai créé une pipeline similaire : ingestion quotidienne de données publiques, suppression des doublons, scoring basé sur des règles, exécutions automatiques et récupération après erreur. Une exécution d’un mois réel a traité 318 962 enregistrements en environ 34 minutes sans erreur. Le client est confidentiel.
Ce qui n’est pas inclus : sites protégés par un login que vous ne possédez pas, contournement de CAPTCHA, données interdites par les termes du site, coûts d’hébergement ou de proxy. Je vous informe à l’avance si un site ne convient pas.
Technologie:
Python
•
Excel
•
scrapy
•
Playwright
•
Pandas
Technique:
Automatisé(e)
Mon portfolio
FAQ
Traduction automatique
Quels sites Web pouvez-vous récupérer ?
Pages publiques, y compris celles avec beaucoup de JavaScript. Je vérifie d’abord le site et ses termes. Sites protégés par un login que vous ne possédez pas ou qui interdisent le scraping ne conviennent pas.
Comment sont configurés les exécutions programmées ?
Avec cron (Linux/Mac) ou Task Scheduler (Windows) sur votre machine ou serveur, ou un conteneur Docker en Premium. Les coûts d’hébergement sont à votre charge.
Que faire si le site change plus tard ?
Les changements de layout peuvent casser un scraper. Pendant la période de révision, je corrige ce que j’ai livré ; les corrections ultérieures sont une nouvelle petite commande. Le journal d’erreurs vous indique quand une exécution ne retourne rien.
Que signifie ‘pages scrappées’ ?
Fiverr impose une limite de pages par service. Ici, c’est le nombre de pages que chaque exécution programmée peut récupérer : 100 dans Basic, 500 dans Standard, 1500 dans Premium. Pour des travaux plus importants, contactez-moi d’abord.
