Il semble que ce service ait été suspendu
J'extrais des sites web et des documents en données Markdown propres pour llm et rag
Pays-Bas
Développeur Python pour web scraping et extraction de données
À propos de ce service
Vous avez besoin de transformer un site web ou un site de documentation en données structurées et propres ? C’est mon métier.
Je crée des scrapers Python personnalisés qui parcourent un site et transforment chaque page en Markdown, CSV ou JSON propre, avec métadonnées, manifeste et rapport de couverture pour que vous sachiez exactement ce qui a été capturé. Idéal pour les datasets llm et rag, les bases de connaissances, la recherche et les migrations.
Ce que vous obtenez :
- Données structurées et propres dans le format de votre choix
- Déduplication + rapport de couverture (pas de contenu inutile, pas de pages manquantes)
- Sites rendus en JavaScript gérés avec Playwright, pas seulement HTML statique
- Données que je vérifie et exécute moi-même avant livraison
Comment je travaille, en toute honnêteté :
- Je respecte robots.txt, limites de débit et conditions d’utilisation des sites
- Je ne contourne pas les protections anti-bot ou CAPTCHA. Si un site est protégé, je vous le dirai avant votre commande
- Les scrapers dépendent de la structure actuelle d’un site ; toute modification future est une tâche séparée
Vous souhaitez le code source ou des rafraîchissements réguliers des données ? Les deux sont disponibles en option.
Contactez-moi avec le site et les données dont vous avez besoin, et je vous dirai honnêtement si c’est compatible et comment je m’y prendrais.
Technologie:
Python
•
Beautiful Soup
•
Playwright
•
Pandas
Technique:
Automatisé(e)
FAQ
Traduction automatique
Pouvez-vous gratter n'importe quel site Web?
La plupart des sites statiques et rendus en JavaScript, oui. Je ne contourne pas les protections anti-bot ou CAPTCHA, donc une petite partie des sites très protégés est hors de portée. Je vous préviens toujours avant votre commande.
Dans quel format vais-je recevoir les données ?
Markdown, CSV ou JSON, selon votre préférence, plus un manifeste et un rapport de couverture. Je peux combiner les formats si nécessaire.
Le scraper continuera-t-il de fonctionner plus tard ?
Il fonctionne contre le site tel qu’il est au moment de la livraison. Si la structure du site change par la suite, la mise à jour est une tâche séparée, et je propose des rafraîchissements de données en option.
Est-ce que j'obtiens le code source ?
Par défaut, vous recevez les données. Le code source Python complet avec un README est disponible en option si vous souhaitez l’exécuter vous-même.

