Je vais concevoir un pipeline de scraping web en Python ou d'automatisation IA

Certaines informations ont été traduites automatiquement.

Inde

Je parle Hindi, Gujarati, Anglais

Ingénieur en automatisation IA et backend, Python FastAPI RAG

Je conçois des systèmes backend et IA destinés à de vrais utilisateurs, pas des démos qui s’effondrent avec 10 personnes. IA & automatisation : chatbots RAG qui répondent à partir de vos propres donn...
À propos de ce service

Je crée des pipelines de données qui continuent de fonctionner après la livraison, pas des scripts qui cassent en une semaine.


Ce que je fais :

- Extraire des données d'entreprise, de produits et de contacts depuis des sites et des API (Google Places, annuaires publics, sites personnalisés)

- Les nettoyer correctement : numéros de téléphone au format E.164, déduplication avec correspondance floue, vérification des emails (MX/SMTP), suppression des enregistrements obsolètes

- Les stocker dans une vraie base de données (PostgreSQL/Supabase) avec des exécutions programmées ou à la demande

- Couche IA optionnelle : évaluer et qualifier chaque enregistrement avec un LLM plus une raison en une ligne, ou extraire des données structurées à partir de textes désordonnés et de PDFs


J’utilise les API officielles lorsqu’elles existent et je ne recoure au scraping brut que lorsqu’il n’y a pas d’API, en vous indiquant laquelle est utilisée pour éviter de livrer quelque chose qui échoue lors du prochain changement de layout.


Travail récent : un moteur de leads en grille qui couvre presque toute la ville, au lieu des 60 résultats tronqués que la plupart des scrapers perdent silencieusement.


Stack : Python, httpx, BeautifulSoup, Playwright, Pandas, PostgreSQL, API LLM.


Envoyez-moi vos sites cibles et champs avant de commander pour que je puisse confirmer la faisabilité et vous donner un devis précis.

Technologie:

scrapy

sélénium

Beautiful Soup

Playwright

Pandas

Type d'information:

Veille concurrentielle

Technique:

Automatisé(e)