Je vais créer des scrapers en continu 24h/24 et 7j/7

Certaines informations ont été traduites automatiquement.

Pakistan

Je parle Anglais, Ourdou

Expert en Data Engineering et Business Intelligence

Après 3 ans en data engineering, j'ai compris que la vraie valeur ne réside pas dans l'écriture de code — c'est dans la transformation de données désordonnées en réponses pour l'entreprise. La plupart...
À propos de ce service

Ce n’est pas le service de web scraping habituel.


La plupart des gigs de scraping fournissent un jeu de données ponctuel, puis s’arrêtent là.

Mais, je construis des plateformes de données de niveau production qui collectent, traitent et analysent en continu les données du web.


Une histoire client


Mr. Enta, un journaliste à la retraite, voulait acheter une voiture d’occasion mais ne savait pas comment évaluer le marché. Au lieu de scraper les annonces une seule fois, nous avons créé une plateforme qui surveille le plus grand marché de voitures d’occasion du continent avec 500 000+ annonces en direct.


Le système fonctionnait 24/7 sur un serveur, collectant les prix historiques, les couleurs, les modèles et les tendances du marché. À la fin, il ne regardait pas simplement des données brutes. Il disposait d’une vue complète du comportement du marché.


Pour rendre les données utiles, j’ai également construit :

  • Un chatbot NLP pour interroger les données en anglais simple.
  • Un tableau de bord Superset pour l’analyse interactive et la visualisation des tendances.


C’est de l’ingénierie des données, pas seulement du web scraping.


Stack technologique : Python, Playwright, Selenium, BeautifulSoup, Requests, Pandas, PostgreSQL, MongoDB, Redis, Kafka, Airflow, Spark, dbt, Docker, ClickHouse, Superset, AWS.


Si vous avez besoin d’un CSV, beaucoup de gigs peuvent le faire.


Si vous cherchez une plateforme de données qui génère en continu de l’intelligence commerciale, discutons de votre projet.

Expertise:

Automatisations

Big data

Extraction des données

Technologie:

Amazon Redshift

Apache Hadoop

Apache Spark

Python

SQL

Mon portfolio