Je ferai le nettoyage, la déduplication et la normalisation de données avec python
Développeur Full Stack et spécialiste en automatisation avec 88 avis cinq étoiles
Niveau 2
Répond à des critères de performance élevés et a fait ses preuves en matière de satisfaction clients.
À propos de ce service
Un ensemble de données désordonné qui vous ralentit ? Je réalise un nettoyage professionnel des données sur CSV, Excel, JSON et dumps SQL. Doublons supprimés, champs normalisés, dates analysées, valeurs manquantes traitées.
Ce que je nettoie :
+ CSV, Excel, JSON, dumps SQL, TSV, Parquet
+ Catalogues produits et listes de prix extraits
+ Listes de clients et de mailing
+ Exportations d’enquêtes et soumissions de formulaires
+ Fichiers de transactions ou d’inventaire désordonnés
Opérations que je réalise :
+ Déduplication avec règles de clés personnalisées
+ Normalisation de chaînes (majuscules/minuscules, espaces, encodage)
+ Analyse de dates, numéros de téléphone et adresses
+ Gestion des valeurs manquantes (imputation, suppression, marquage)
+ Détection d’outliers et cartographie des champs
Outils que j’utilise :
+ Pandas, numpy, SQL, regex, Python
Ce que vous recevrez :
+ Un ensemble de données structuré et propre dans le format choisi
+ Script Python pour le nettoyage que vous pouvez relancer
+ Documentation de chaque règle appliquée
89 avis cinq étoiles sur mon profil et plus de 30 projets de scraping ayant produit des données désordonnées que j’ai nettoyées de A à Z. Je sais exactement à quel point les fichiers réels peuvent être cassés.
Important : contactez-moi AVANT de commander avec un fichier d’exemple et vos règles de nettoyage. Je confirmerai la portée et le délai.
Mon portfolio
FAQ
Traduction automatique
Quels formats de fichiers prenez-vous en charge ?
CSV, Excel (xlsx et xls), JSON, TSV, dumps SQL, Parquet, et texte simple. Si votre format est inhabituel, envoyez un exemple et je confirmerai avant que vous passiez commande.
Combien de lignes pouvez-vous nettoyer ?
Basique couvre jusqu'à 5 000 lignes, Standard jusqu'à 50 000, Premium est illimité. Pour des ensembles de données très volumineux, je crée un pipeline et traite par morceaux.
Comment décidez-vous ce qui compte comme un doublon ?
Vous me indiquez les champs clés. Si vous n'êtes pas sûr, je propose un ensemble de règles basé sur les données et vous approuvez avant que je ne l'exécute.
Comment gérez-vous les valeurs manquantes ?
Trois options : imputer à partir d'autres lignes ou sources externes, supprimer la ligne, ou la marquer pour révision. Je confirme par colonne avant d'exécuter.
Est-ce que je reçois le script Python ou seulement les données nettoyées ?
Les deux à partir de Standard. Le script est réutilisable pour de futurs fichiers et est accompagné d'une liste de règles documentée.
Mes données sont-elles confidentielles ?
Oui. Je travaille dans un espace privé, je supprime vos fichiers après livraison sur demande, et je signe un NDA si nécessaire.
Pouvez-vous gérer les dates et adresses en formats mixtes ?
Oui. Les dates sont analysées en ISO 8601, les téléphones en E.164, les adresses standardisées. Les cas particuliers sont signalés pour votre révision.

