J'extrais n'importe quel site public en un dataset csv ou json propre
Nettoyage de données, web scraping et automatisation de feuilles de calcul
À propos de ce service
Vous obtenez un dataset CSV et JSON propre à partir de n'importe quel site public, généralement en 48 heures.
Indiquez-moi l'URL et les champs dont vous avez besoin, comme le nom du produit, le prix, la note et le lien, et je vous renverrai un dataset structuré ainsi qu'un rapport de couverture qui montre précisément quelles pages ont été visitées et la complétude de chaque champ.
Comment ça fonctionne : un navigateur headless charge chaque page comme le ferait un vrai visiteur, ce qui permet de traiter les listes rendues par JavaScript. robots.txt est vérifié avant chaque requête et respecté. La pagination est suivie automatiquement jusqu'à la limite que vous fixez, avec une pause délibérée entre chaque page.
Vous recevez dataset.csv, dataset.json et coverage.md, qui listent chaque page visitée avec son statut et le nombre d'enregistrements, ainsi qu'un pourcentage de complétude par champ pour que vous puissiez voir ce que la source ne contenait pas réellement.
Pages publiques uniquement. Je ne scrape pas derrière des logins ou paywalls, je ne contourne pas CAPTCHAs ni limites de taux, et je ne collecte pas de données personnelles comme des listes d'emails ou de téléphones. Merci de ne pas commander ces services.
Ceci est un workflow assisté par IA avec une revue humaine avant livraison. Envoyez d'abord l'URL et je vous dirai honnêtement si cela peut être fait.
Technologie:
Python
•
Beautiful Soup
•
Playwright
•
Pandas
Technique:
Automatisé(e)
Mon portfolio
FAQ
Traduction automatique
Pouvez-vous scraper un site nécessitant une connexion ?
Non. Ce service couvre uniquement les pages accessibles publiquement. Tout ce qui est derrière un login, un paywall ou un CAPTCHA est hors de portée et je refuserai plutôt que d'essayer.
Pouvez-vous me créer une liste d'emails ou de numéros de téléphone ?
Non. Je ne collecte pas de données personnelles. Cela viole les conditions de Fiverr et la loi sur la vie privée dans la plupart des pays. Les données publiques d'annuaires d'entreprises comme les noms d'entreprise, catégories, prix et URLs publics sont acceptables.
Et si le site bloque le scraping dans robots.txt ?
Je vérifie robots.txt avant chaque requête et je le respecte. Si le chemin est interdit, je vous en informerai avant de commencer et j'annulerai la commande, plutôt que de contourner la restriction.
Les données dont j'ai besoin se trouvent sur la page de chaque article, pas dans la liste. Pouvez-vous l'obtenir ?
Oui, c'est le niveau Premium. La liste est d'abord collectée, puis chaque page de détail est visitée et fusionnée dans la même ligne. Indiquez-moi quels champs se trouvent sur la page de détail.
Utilisez-vous l'IA pour cela ?
Oui, c'est un workflow assisté par IA avec une revue humaine pour chaque livraison avant envoi. Le dataset est produit uniquement pour votre commande.

