Je vais construire des bots de web scraping en Python et des pipelines d'extraction de données AI

Certaines informations ont été traduites automatiquement.

Pakistan

Je parle Ourdou, Anglais, Hindi

Ingénieur LLM et Data Scientist : NLP, GenAI, ML qui génère des résultats

Ingénieur en intelligence artificielle senior avec 8 ans d'expérience dans la création de systèmes d'IA en production pour des clients dans la santé, la conformité, la finance et l'édition sur quatre ...
À propos de ce service

Je crée des scrapers et des pipelines de données qui continuent de fonctionner après la première exécution.


8 ans en ingénierie des données et IA. Travaux précédents :

  • Développé des crawlers distribués sur Facebook, Instagram, TikTok, Twitter, moteurs de recherche et sites e-commerce, alimentant des tableaux de bord BI pour la direction
  • Conçu un pipeline ETL qui a normalisé plus de 10 millions d’enregistrements de livres provenant d’Amazon, Ingram et Goodreads, et résolu automatiquement 50 % des doublons et conflits de données
  • Créé des crawlers qui alimentaient des données brutes dans un produit IA interne


Ce que je peux faire :

  • Données sur les produits, prix et avis provenant de boutiques en ligne
  • Listes d’entreprises et annuaires pour la recherche de prospects
  • Immobilier, offres d’emploi, actualités et événements
  • Sites avec beaucoup de JavaScript, défilement infini et pages de connexion auxquelles vous avez accès
  • Extraction IA : transformer des pages désordonnées et des PDFs en champs structurés propres avec LLMs
  • Exécutions programmées qui envoient des données fraîches vers Google Sheets, une base de données ou votre API


Outils : Python, Scrapy, Playwright, Selenium, BeautifulSoup, Pandas, PostgreSQL, MongoDB, AWS


Chaque livraison est nettoyée, dédoublonnée et vérifiée avant de vous être envoyée.


Je ne scrape que des données accessibles publiquement. Envoyez-moi le lien du site avant de commander pour que je puisse confirmer que c’est possible.

Technologie:

Python

•

scrapy

•

sélénium

•

Apollo

•

Extracteur d’e-mails

Type d'information:

Veille concurrentielle

Technique:

Automatisé(e)