Je vais extraire en masse des données e-commerce et créer un crawler fiable
Applications web professionnelles et collecte de données e-commerce
À propos de ce service
Obtenez des données structurées de commerce électronique à grande échelle, pas une autre tâche manuelle de feuille de calcul.
Je construis des crawlers pour des données de marché publiques ou autorisées, incluant la découverte de catégories, la pagination, la cartographie produit-vendeur, la déduplication, les points de contrôle et les exports CSV/JSON.
Le travail documenté inclut un ensemble de données Gmarket finalisé de 32 820 produits distincts et 4 203 vendeurs, ainsi qu’un projet Coupang couvrant 13 catégories avec 11 101 entrées de produits et 819 vendeurs dédupliqués. Ce sont des résultats de projets passés, non une promesse de volume ou de vitesse pour votre site.
Mon expérience inclut des environnements Coupang protégés par Akamai : détection des défis d’accès, enregistrement des échecs et récupération des exécutions interrompues. Les conditions d’accès doivent être testées ; je ne garantis pas un contournement universel.
BASIC : Un pilote à une source, jusqu’à 500 enregistrements et code d’extraction.
STANDARD : Jusqu’à 2 sources convenues, jusqu’à 10 000 enregistrements, déduplication, support de reprise et notes d’exécution.
PREMIUM : Jusqu’à 3 structures de sources convenues, 50 000 enregistrements, collecte par lots résumable, validation et transfert.
Le code source est inclus. Les frais de proxy, de service de données et d’hébergement sont séparés. Envoyez les URL cibles, les champs et le volume prévu avant de commander pour que je puisse confirmer la faisabilité.
Technologie:
Python
•
Playwright
Technique:
Automatisé(e)
Mon portfolio
FAQ
Traduction automatique
Avez-vous travaillé avec des sites e-commerce protégés par Akamai ?
Oui. Les enregistrements de projets documentent la collecte sur Coupang dans un environnement protégé par Akamai, avec classification des défis, diagnostics et récupération. Les résultats dépendent de l’environnement testé et des conditions d’accès ; cela ne garantit pas l’accès à tous les sites protégés.
Que signifient les chiffres de collecte du portfolio ?
Gmarket : 32 820 produits distincts et 4 203 vendeurs dans un ensemble de données récupéré/finalisé, pas toutes les catégories prévues. Coupang : 11 101 entrées de produits par catégorie sur 13 catégories et 819 vendeurs dédupliqués. Ce sont des exécutions séparées passées, non des promesses de vitesse.
Les coûts de proxy et de services tiers sont-ils inclus ?
Non. Tous les coûts nécessaires de proxy, de fournisseur de données ou d’hébergement sont convenus séparément avant la commande. La faisabilité dépend du site cible, des accès permis et des champs disponibles.
Pouvez-vous collecter le nombre de records demandé ?
Limites de portée : Basic 1 source/100 pages/500 enregistrements ; Standard 2 sources/2000 pages/10 000 enregistrements ; Premium 3 sources/10 000 pages/50 000 enregistrements. La collecte s’arrête à la limite convenue. La disponibilité des enregistrements et la faisabilité de la source sont confirmées avant la commande.
Quels données et fichiers vais-je recevoir ?
Les champs accessibles convenus, un schéma CSV/JSON cohérent, des résultats dédupliqués, le code source et les notes d’exécution. Les identifiants produits publics, les liens de catégories et les enregistrements de vendeurs professionnels sont des exemples ; leur disponibilité est vérifiée par source.
Que se passe-t-il si la collecte est interrompue ?
Les versions Standard et Premium incluent le support de reprise et de points de contrôle pour le flux de travail convenu, ainsi que des journaux pour le travail incomplet. Une refonte du site ou une nouvelle restriction d’accès peut nécessiter une mise à jour à portée séparée ; la maintenance continue n’est pas incluse.

