Je vais créer un ensemble de données massif pour l'entraînement AI
Développeur Python, spécialiste de l'extraction de données
Certifié par Fiverr Pro
Kawsar a été sélectionné par l'équipe Fiverr Pro pour son expertise.
Certifié pour
Scraping de données
Traitement de données
À propos de ce service
Vous avez besoin d'un grand ensemble de données propre pour entraîner ou affiner un modèle d'IA, pas d'un simple dump de scraping désordonné ou d'un petit fichier d'échantillon.
C'est le travail que je réalise. Je suis Kawsar, un développeur Python qui construit des scripts de scraping pour des ensembles de données massifs pour l'entraînement AI à partir de sources publiques, de génération synthétique, et d'exportations structurées CSV ou JSON.
Ce que je fournis :
- Ensembles de données d'entraînement AI personnalisés, adaptés à votre package et schéma
- Collecte sur le web public et/ou lignes synthétiques lorsque des données respectant la vie privée sont nécessaires
- CSV, JSON ou Excel propre prêt pour la préparation ML et LLM
- Mapping des champs, déduplication de base, et un court dictionnaire de données
- Script Python de collecte optionnel en Premium
- Échantillons gratuits avant la construction complète pour que vous puissiez valider le schéma
- Export JSONL prêt pour le fine-tuning de LLM (formats OpenAI, Hugging Face, et Llama)
Je crée des ensembles de données sur mesure pour les équipes ML et AI. Le volume dépend du package et de la difficulté de la source. Données uniquement publiques.
Envoyez-moi votre schéma, volume cible, et cas d'usage avant de commander.
NOTE :
- Données publiques uniquement. L'acheteur fournit le schéma et les URLs cibles lors du scraping
- Construction personnalisée pour chaque commande
- Pas de collecte de données personnelles
- Pas de devoirs scolaires ou universitaires
Plateforme:
mySQL
•
PL/SQL
•
PostgreSQL
•
SQLite
•
SQL Server
Expertise:
Conception
•
Normalisation
•
SQL
•
NoSQL
•
Performance
Clients avec lesquels j’ai travaillé
MyHeritage
Internet Software & Services
I've been hired to carry out certain web extraction-related jobs in order to build a database for user reviews, which will be used to develop the product and make changes in certain instances.
mai 2022-mai 2023
Fiverr
Internet Software & Services
The project was to gather a detailed list of 5000 keywords from various profession types and list their Google Rank, Link, and even Local Search Results, etc. Information and make a Report with these!
juil. 2024
Mon portfolio
FAQ
Traduction automatique
Quel type d’ensembles de données créez-vous ?
Ensembles de données structurés pour l'entraînement AI en ML et LLM : CSV/JSON tabulaires, corpus de textes, et collections de sources publiques. La labellisation d'images en grande quantité peut être envisagée si cela correspond.
Faites-vous du scraping web ou générez-vous des données synthétiques ?
Les deux. Nous choisissons la collecte publique, la génération synthétique, ou un mélange selon votre schéma, vos besoins en confidentialité, et le volume cible.
Allez-vous aussi entraîner mon modèle ?
Ce service concerne la création de l'ensemble de données. La formation du modèle et le fine-tuning de LLM sont des services séparés si vous en avez besoin.
Quels fichiers puis-je obtenir ?
CSV, JSON, JSONL ou Excel, plus un court dictionnaire de données. La version Premium peut inclure un script Python utilisé pour construire ou actualiser l'ensemble.
Dois-je fournir un schéma ?
Oui. Envoyez les noms des colonnes, étiquettes, formats, et lignes d'exemple si vous en avez. Cela garantit que l'ensemble est prêt pour le modèle.
Le travail avec LoRA ou l'ensemble de données pour influenceur AI est-il inclus ?
Non. Ce service concerne les données d'entraînement ML/AI, pas les packs LoRA pour influenceurs.
C’est pour des devoirs scolaires ou universitaires ?
Non. Je ne prends pas en charge les devoirs scolaires ou universitaires.

