Je vais créer un robot d'exploration web en Python et un scraper programmé avec une base de données
Ingénieur data Python : web scraping, pipelines ETL et enrichissement de données
Niveau 1
Répond à certains critères de performance et présente un fort potentiel sur la place de marché.
À propos de ce service
Un scraper qui ne fonctionne qu’une seule fois est un fichier. Un scraper qui fonctionne chaque semaine est un système, et la différence réside dans ce qui se passe le jour où le site change sa mise en page. La plupart se cassent silencieusement, et le tableau de bord affiche des données erronées pendant deux semaines avant que quelqu’un ne s’en aperçoive.
Ce que je construis
- Scrapers et crawlers personnalisés en Python, pour un site ou plusieurs
- Exécutions planifiées sur votre serveur ou dans le cloud, écrivant dans PostgreSQL, BigQuery ou Sheets
- Retries, limitation de débit, rotation de proxy, gestion des connexions et du JavaScript
- Alertes lorsqu’un champ commence à revenir vide, ce qui permet de détecter une rupture silencieuse
Ce que vous obtenez
- Le scraper fonctionnel et le code source, à vous de garder et de modifier
- Des documents d’installation rédigés pour la personne qui le fera fonctionner ensuite, pas seulement pour vous
- Une courte passation pour qu’il puisse être redéployé sans moi
J’ai créé le crawler qui collecte et structure les déclarations de proxy de toutes les grandes compagnies aériennes américaines et européennes.
Je préfère vous dire qu’une source est une mauvaise idée plutôt que de construire quelque chose de fragile par-dessus. Envoyez-moi le site et la fréquence à laquelle vous avez besoin des données, et je définirai le périmètre et vous ferai une proposition avant que vous passiez commande.
Mon portfolio
FAQ
Traduction automatique
Est-ce que j'obtiens le code source ?
Oui, tout cela, et c'est à vous de le modifier, de le déployer à nouveau ou de le confier à un autre développeur. Pas de licence, pas de dépendance à l'exécution sur moi, pas d'obfuscation. Le dépôt comprend un readme expliquant l'installation, la configuration et comment modifier les champs qu'il collecte.
Peut-il fonctionner sans que je touche à rien ?
C'est précisément l'objectif des versions Standard et Premium. Programmé sur votre propre serveur, une petite VM cloud ou AWS Lambda, avec des journaux que vous pouvez consulter et des alertes en cas d'échec ou si aucune donnée n'est renvoyée. Où il fonctionne, c'est votre choix, et je le mettrai en place où vous préférez.
Que se passe-t-il lorsque le site change et que cela casse ?
Deux éléments limitent les dégâts. Des sélecteurs écrits contre une structure stable plutôt que contre des noms de classes générés, pour que de petites refontes ne le cassent pas. Et une vérification qui alerte lorsque un champ commence à renvoyer des valeurs vides, pour que vous soyez informé le jour même plutôt que deux semaines plus tard.
À quelles bases de données peut-il écrire ?
PostgreSQL, MySQL, SQLite, BigQuery, MongoDB ou fichiers CSV et Parquet si une base de données est plus que ce dont vous avez besoin. Google Sheets fonctionne pour des volumes plus petits. Dites-moi quelles sont les sources de données, et je l’écrirai dans ce qui convient.
Peut-il suivre les prix ou le stock dans le temps ?
Oui, et c'est l'une des meilleures raisons de construire plutôt que d'acheter une extraction ponctuelle. Des exécutions programmées avec un historique conservé permettent de voir les mouvements plutôt qu'une simple photo. La version Premium inclut la détection de changement et les alertes associées.
Que faire face à une protection anti-bot lourde ?
Sessions de navigateur réelles avec Playwright, rotation de proxy résidentiel, timing humain et persistance de session. La plupart des sites sont gérables. Certains ne valent pas le coût, et je vous le dirai plutôt que de vous faire une estimation pour un combat. Envoyez-moi d'abord l'URL, je vérifierai.
Pouvez-vous assurer la maintenance après la livraison ?
Une maintenance mensuelle est disponible en option séparée : je surveille les alertes, je répare les défaillances et j'ajuste lorsque la source change. Beaucoup de clients prennent le code et le font fonctionner eux-mêmes, c'est pourquoi la documentation est écrite pour un étranger.
En quoi cela diffère-t-il de votre service de data scraping ?
Ce service fournit un fichier. Celui-ci fournit une machine qui crée le fichier. Si vous avez besoin des données une seule fois, commandez celui-là, c'est moins cher et plus rapide. Si vous en aurez besoin à nouveau le mois prochain, c'est celui-ci, et la deuxième exécution compensera son coût.
Combien de temps dure une construction ?
Trois jours pour un scraper d’un seul site avec le code source. Cinq jours s'il est programmé et écrit dans une base de données. Sept jours pour un crawler multi-sites avec surveillance et documentation de transfert. Je donne une date après avoir vu le site, et la complexité peut la faire évoluer avant votre commande.
Pouvez-vous réparer ou reprendre un scraper construit par quelqu’un d’autre ?
Oui. Envoyez-moi le dépôt et expliquez-moi ce qui ne fonctionne pas. Je vous indiquerai ce qui est cassé, si le réparer est moins cher que de reconstruire, ou je vous donnerai une réponse honnête si ce n’est pas le cas. Parfois, le code est correct et le changement vient de la source.
