Je vais faire correspondre, fusionner et dédupliquer vos ensembles de données désordonnés

Certaines informations ont été traduites automatiquement.

Mexique

Je parle Espagnol, Anglais, Français

Doctorant en astrophysique, conseil en statistiques

Doctorant en astrophysique. Je passe mes journées à faire des statistiques sur des données désordonnées, incomplètes et corrélées — catalogues de galaxies où rien n’est propre et chaque barre d’erreur...
À propos de ce service

Deux listes de la même personne, produit ou lieu, sans identifiant partagé : noms orthographiés différemment, fautes de frappe, champs manquants. La fonction VLOOKUP d'Excel abandonne immédiatement.


Je réalise une liaison probabiliste de dossiers : au lieu d’un « correspond / ne correspond pas », chaque paire candidate reçoit un score indiquant la probabilité qu’il s’agisse de la même entité, en fonction de la valeur réelle de chaque accord sur chaque champ. Se mettre d’accord sur un nom de famille rare est une preuve forte ; sur un nom commun, c’est faible. La méthode fait la différence.


Ce qui compte pour vous : vous choisissez le seuil. Une confiance élevée pour une fusion automatique, et une liste séparée de paires ambiguës pour qu’un humain puisse examiner, au lieu de fusionner silencieusement deux clients différents ou de garder le même deux fois.


J’utilise cela sur des catalogues astronomiques, où fusionner deux objets incorrects invalide la science. Vos données méritent le même soin.


Ce que je fournis : votre ensemble de données fusionné avec un score de confiance pour chaque correspondance ; une liste séparée « à revoir » pour les cas ambigus ; un rapport de qualité indiquant combien ont été appariés, combien ne l’ont pas été, et pourquoi ; et les doublons trouvés dans chaque fichier, pas seulement entre eux.


Envoyez un petit échantillon d’abord si vous souhaitez voir comment cela fonctionne avant de commander.

Technologie:

Python

Expertise:

Manipulation des données

Validation des données

etl