Plusieurs techniques de nettoyage des données permettent de traiter différentes catégories de problèmes de qualité. Le choix de la technique appropriée dépend du type d’erreur, du volume de données et du cas d’usage en aval.
identifie et fusionne ou supprime les enregistrements représentant une même entité du monde réel. La correspondance approximative, qui compare des enregistrements similaires mais non identiques — comme Jon Smith face à John Smith, à la même adresse — est indispensable lorsque la seule logique de correspondance exacte ne suffit pas à détecter les doublons. Dans les bases de données B2B, sans gestion active de la qualité des données, les doublons peuvent représenter entre 10 % et 30 % des contacts selon les estimations. Leur suppression réduit les coûts d’envoi des campagnes et améliore les métriques de délivrabilité.
convertit les données dans un format cohérent pour l’ensemble des enregistrements. Les numéros de téléphone exprimés sous les formes (555) 867-5309, 555-867-5309 et 5558675309 représentent la même valeur. La standardisation les regroupe en un format canonique unique. Cette discipline de standardisation des données est un prérequis pour la jointure d’enregistrements entre systèmes. Sans elle, une simple jointure SQL sur le numéro de téléphone traite ces trois formats comme trois clients différents.
résout les champs nuls ou vides selon l’une des trois stratégies suivantes :
- substitue une valeur dérivée statistiquement ou fondée sur des règles, par exemple en renseignant un champ de département manquant à partir du code postal.
- signale le champ comme inconnu, afin que les modèles en aval le traitent explicitement, plutôt que d’ignorer l’enregistrement ou d’attribuer la valeur zéro par défaut.
- élimine les enregistrements incomplets lorsque l’exhaustivité est impérative, comme dans le cadre des rapports financiers, où des enregistrements partiels violeraient les exigences d’audit.
La stratégie adéquate dépend de l’importance du champ pour le cas d’usage concerné. Imputer une catégorie de produit manquante pour un modèle de recommandation est raisonnable. En revanche, imputer un indicateur de consentement manquant dans un workflow de confidentialité ne l’est pas.
imposent des contraintes auxquelles les données doivent satisfaire pour être acceptées. Un champ de date de naissance ne peut pas contenir une date future. Une adresse e-mail doit correspondre à un format syntaxique valide. Un code pays doit figurer dans une liste de référence ISO. La validation des données constitue souvent le premier filtre d’un pipeline de données : elle intercepte les erreurs à l’ingestion avant qu’elles ne se propagent dans les tables de reporting et les systèmes d’activation.
met en évidence des valeurs statistiquement improbables, susceptibles de révéler des erreurs de saisie plutôt que de véritables extrêmes. Un montant de transaction de 1 000 000 $ dans un jeu de données dont la médiane est de 45 $ mérite un examen approfondi. Il peut s’agir d’une erreur de frappe, d’une erreur de conversion de devises ou d’un cas limite légitime nécessitant un traitement particulier. L’essentiel est de signaler l’anomalie pour qu’elle soit examinée, plutôt que de l’inclure ou de l’exclure sans la relever.
décomposent les champs composés en éléments atomiques. Un champ unique Nom complet divisé en Prénom et Nom de famille ouvre la voie à la personnalisation et au tri. Une adresse découpée en rue, ville, département et code postal facilite la segmentation géographique. Cette technique recoupe souvent la transformation des données, mais elle vise la correction plutôt que la modification du schéma.