Je vais collecter et nettoyer des données QA pour la formation de llm et d'IA

Certaines informations ont été traduites automatiquement.

Pakistan

Je parle Ourdou, Anglais

Développeur Python, expert en web scraping et analyse de données

Vous avez besoin d'extraire des données web ou de nettoyer des feuilles de calcul désordonnées pour obtenir des insights clairs ? Je suis un développeur Python spécialisé dans le web scraping, le net...
À propos de ce service

Vous avez besoin de données Q&A propres et structurées pour affiner ou entraîner un modèle d'IA/LLM ?

Je crée des pipelines de collecte de données qui extraient des paires question-réponse à partir de sources publiques basées sur des API (pas de scraping HTML fragile), nettoient le texte, filtrent le contenu de faible qualité ou contenant des PII, et livrent un JSONL d'instructions/réponses prêt à l'emploi, dans le format exact utilisé pour affiner des modèles comme GPT et Llama.

Ce que vous obtenez :

  • Paires Q&A propres, dédupliquées, au format JSONL
  • HTML supprimé, blocs de code conservés, espaces normalisés
  • Filtrage de qualité (seuils de score, longueur minimale, vérification PII)
  • Attribution complète des sources pour conformité aux licences
  • Un rapport de statistiques (taille du dataset, longueur moyenne, distribution des scores)

J'utilise des API publiques officielles plutôt que de scraper des sites qui l'interdisent (comme Reddit/Quora), pour que votre dataset soit propre, légal et fiable.

Indiquez-moi votre sujet/domaine et le nombre d'enregistrements dont vous avez besoin, et je confirmerai la portée avant que vous passiez commande.

Expertise:

Autres

Langage de programmation:

Python

Outils:

Jupyter Notebook