Je vais construire des bots de web scraping en Python et des pipelines d'extraction de données AI
Ingénieur LLM et Data Scientist : NLP, GenAI, ML qui génère des résultats
À propos de ce service
Je crée des scrapers et des pipelines de données qui continuent de fonctionner après la première exécution.
8 ans en ingénierie des données et IA. Travaux précédents :
- Développé des crawlers distribués sur Facebook, Instagram, TikTok, Twitter, moteurs de recherche et sites e-commerce, alimentant des tableaux de bord BI pour la direction
- Conçu un pipeline ETL qui a normalisé plus de 10 millions d’enregistrements de livres provenant d’Amazon, Ingram et Goodreads, et résolu automatiquement 50 % des doublons et conflits de données
- Créé des crawlers qui alimentaient des données brutes dans un produit IA interne
Ce que je peux faire :
- Données sur les produits, prix et avis provenant de boutiques en ligne
- Listes d’entreprises et annuaires pour la recherche de prospects
- Immobilier, offres d’emploi, actualités et événements
- Sites avec beaucoup de JavaScript, défilement infini et pages de connexion auxquelles vous avez accès
- Extraction IA : transformer des pages désordonnées et des PDFs en champs structurés propres avec LLMs
- Exécutions programmées qui envoient des données fraîches vers Google Sheets, une base de données ou votre API
Outils : Python, Scrapy, Playwright, Selenium, BeautifulSoup, Pandas, PostgreSQL, MongoDB, AWS
Chaque livraison est nettoyée, dédoublonnée et vérifiée avant de vous être envoyée.
Je ne scrape que des données accessibles publiquement. Envoyez-moi le lien du site avant de commander pour que je puisse confirmer que c’est possible.
Technologie:
Python
•
scrapy
•
sélénium
•
Apollo
•
Extracteur d’e-mails
Technique:
Automatisé(e)
FAQ
Traduction automatique
Pouvez-vous gratter n'importe quel site Web?
La plupart des sites publics, oui. Certains sites bloquent fortement le scraping ou l’interdisent dans leurs conditions. Envoyez-moi le lien avant de commander et je vous confirmerai ce qui est possible et combien de temps cela prendra.
Livrez-vous le code ou seulement les données ?
Data Pull fournit uniquement les données. Scraper + Code et Pipeline automatisé incluent le code source Python complet que vous pouvez exécuter à nouveau vous-même.
Pouvez-vous programmer le scraping selon un calendrier ?
Oui. Le Pipeline automatisé fonctionne quotidiennement, hebdomadairement ou à toute autre fréquence, avec des alertes si un site change et que le scraper doit être mis à jour.
Dans quels formats puis-je obtenir les données ?
CSV, Excel, JSON, Google Sheets ou directement dans votre base PostgreSQL, MySQL ou MongoDB. Je peux aussi l’exposer via une API simple.
Comment utilisez-vous l’IA dans le scraping ?
Pour les pages sans structure claire, comme les PDFs, listings ou descriptions en texte libre, j’utilise des LLMs pour extraire des champs tels que noms, prix et caractéristiques dans un tableau cohérent.
Scrapez-vous des données personnelles ou derrière des logins ?
Je scrape uniquement des données publiques, et des pages derrière un login uniquement si vous possédez le compte et avez l’autorisation d’accéder à ces données. Je ne collecte pas d’informations personnelles privées.

