Je vais extraire des données de n'importe quel site web avec selenium et beautifulsoup
Étudiant à NIT Surat
À propos de ce service
Vous avez besoin de données propres et structurées extraites de sites web dynamiques, de répertoires ou d'annuaires publics ?
Je crée des web scrapers personnalisés pour extraire des données de n'importe quel site web même ceux avec JavaScript dynamique, défilement infini, pagination ou éléments interactifs. En utilisant Python (Selenium/BeautifulSoup) pour le scraping et Pandas pour un nettoyage rigoureux des données, je fournis des ensembles de données prêts à l'analyse à 100 %.
Ce que je peux scraper :
- Répertoires d'entreprises publics & listes de prospects (numéros de téléphone, emails, adresses, cartes)
- Annonces immobilières & sites d'emploi (titres, descriptions, localisations, tarifs)
- Catalogues e-commerce & produits (prix, spécifications, SKUs, évaluations, URLs d'images)
- Listes d'événements, données de marché & profils sociaux
Nettoyage complet des données (nettoyage Pandas) :
- Suppression du texte brut : suppression des symboles monétaires ($), virgules et caractères spéciaux avec regex.
- Types de données corrects : conversion des nombres en texte en nombres flottants ou entiers pour exécuter des formules immédiatement.
- Analyse des champs : séparation du texte combiné (par exemple, adresses complètes en rue, ville, état, code postal).
- Sortie propre : suppression des doublons et gestion appropriée des valeurs manquantes (NaN).
Fichiers propres .xlsx (Excel), .csv, .json ou un script d'automatisation Python entièrement documenté.
Technologie:
Python
•
Excel
•
sélénium
•
Beautiful Soup
•
Pandas
Type d'information:
Images
•
Immobilier
•
E-mails
•
Sites Web
•
Liens
Technique:
Automatisé(e)

