Je vais concevoir un scraper web programmé et un pipeline de données avec une sortie propre et dédupliquée

Certaines informations ont été traduites automatiquement.

Tunisie

Je parle Français, Arabe, Anglais

Développeur en automatisation Python et traitement de données

Je suis un développeur Python spécialisé dans la transformation de données désordonnées en résultats fiables et structurés. Je crée des web scrapers, des pipelines de données programmés et des extract...
À propos de ce service

Vous avez besoin de données web fraîches chaque jour ou chaque semaine sans relancer un script manuellement ? Je conçois un scraper qui s’exécute automatiquement selon un calendrier, nettoie ce qu’il collecte, supprime les doublons et vous fournit un fichier ou une base de données prête à l’emploi.


Ce que vous obtenez : un scraper Python (Playwright ou Scrapy selon le site), des exécutions automatiques sur votre machine ou serveur, la validation de chaque enregistrement, une clé unique par élément pour éviter les doublons, des tentatives en cas de lenteur du site, et un journal qui indique clairement si une exécution a échoué et pourquoi. Sortie : CSV, XLSX, JSON ou SQLite.


Pourquoi moi : pour un client, j’ai créé une pipeline similaire : ingestion quotidienne de données publiques, suppression des doublons, scoring basé sur des règles, exécutions automatiques et récupération après erreur. Une exécution d’un mois réel a traité 318 962 enregistrements en environ 34 minutes sans erreur. Le client est confidentiel.


Ce qui n’est pas inclus : sites protégés par un login que vous ne possédez pas, contournement de CAPTCHA, données interdites par les termes du site, coûts d’hébergement ou de proxy. Je vous informe à l’avance si un site ne convient pas.

Technologie:

Python

•

Excel

•

scrapy

•

Playwright

•

Pandas

Type d'information:

Veille concurrentielle

•

Listes

Technique:

Automatisé(e)

Mon portfolio