Je vais créer un scraper web en python pour extraire des données propres

Certaines informations ont été traduites automatiquement.

Pakistan

Je parle Ourdou, Anglais, Hindi, Français, Allemand

7 commandes terminées

Ingénieur en agent IA et extraction de données, MSc en science des données

Je conçois des systèmes d'IA qui effectuent un vrai travail : agents à plusieurs étapes, pipelines d'extraction de documents et d'e-mails, et scrapers de données personnalisés. La plupart des gigs en ...
À propos de ce service

J'extrais des données de sites web qui ne veulent pas les partager.


Listes de produits, annuaires d'entreprises, sites d'emploi, immobilier, prix, avis, données de contact. Si c'est sur une page publique, je peux l'intégrer dans un tableau propre.


Ce qui différencie cela d'un scraper basique :


La plupart des scrapers échouent dès qu'un site charge du contenu avec JavaScript, pagine de manière étrange ou modifie sa mise en page. J'utilise Selenium pour les pages rendues dynamiquement et j'intègre une gestion des erreurs pour qu'une page défectueuse ne fasse pas échouer tout le processus. Au travail, j'ai créé les scrapers derrière environ 30 % de la base de données d'équipements de mon entreprise, donc c'est du travail en production, pas un script de tutoriel.


Ce que vous obtenez :

- Des données propres et dédupliquées en CSV, Excel ou JSON

- Exactement les champs demandés, sans colonnes inutiles

- Le script Python lui-même en Premium, pour que vous puissiez le relancer vous-même


Contactez-moi avant de commander avec l'URL du site et les champs dont vous avez besoin. Je vous dirai honnêtement si c'est possible à scraper et quel package correspond. Si ce n'est pas rentable, je vous le dirai.


Technologie:

Python

scrapy

sélénium

Beautiful Soup

Pandas

Type d'information:

Informations de contact

Listes

Technique:

Automatisé(e)

Mon portfolio