Collez une liste ligne par ligne et ne conservez que les valeurs uniques. Vous pouvez également supprimer les lignes vides, modifier la casse et trier le résultat. Avant de normaliser les URLs, adresses e-mail, références et identifiants, vérifiez quelles différences ont de l'importance dans votre système.
Ce qui est exactement considéré comme un doublon
L'outil compare des chaînes de caractères, pas leur sens. Les doublons exacts sont les valeurs qui correspondent après les transformations choisies.
Sans nettoyage préalable, ces lignes peuvent être considérées comme différentes :
seo audit
SEO Audit
seo audit
Raisons des différences :
- casse différente ;
- espace ou tabulation en début ou fin de ligne ;
- deux espaces au lieu d'un ;
- espace insécable (NBSP) ;
- tirets ou guillemets différents ;
- caractère Unicode invisible ;
- formes différentes du mot ou ordre des mots différent.
Les phrases acheter un canapé et canapé acheter ne sont pas des doublons exacts. Leur possible proximité sémantique nécessite une analyse séparée.
Ordre sécurisé pour nettoyer une liste classique
Pour les mots-clés, tags, villes ou noms, cet ordre convient souvent :
- conserver une copie de l'original ;
- supprimer les espaces et tabulations en début et fin de ligne ;
- éliminer les lignes vides ;
- si nécessaire, uniformiser la casse ;
- supprimer les doublons exacts ;
- trier uniquement si l'ordre n'est plus nécessaire.
Les transformations doivent être effectuées avant la suppression des doublons. Sinon, Example et example resteraient des lignes séparées et, après un changement de casse ultérieur, deviendraient deux valeurs identiques.
Doublons exacts et sémantiques
Doublons exacts
seo audit
seo audit
Ils peuvent être supprimés automatiquement.
Doublons après normalisation simple
SEO audit
seo audit
Ils coïncideront après modification de la casse et suppression des espaces en fin de ligne.
Doublons sémantiques ou canoniques
acheter un ordinateur portable
achat d'un ordinateur portable
ordinateur portable acheter
Un utilitaire standard ne devrait pas les supprimer automatiquement. Pour les mots-clés, une analyse des résultats de recherche, de l'intention et un clustering sont nécessaires ; pour les produits, les règles du catalogue ; pour les personnes et les organisations, des identifiants ou une vérification manuelle.
Prudence particulière avec les listes d'URLs
On ne peut pas convertir systématiquement toute l'URL en minuscules. Selon la norme, le schéma et le nom d'hôte ne sont pas sensibles à la casse :
HTTPS://EXAMPLE.COM
https://example.com
Mais le chemin, les paramètres et le fragment peuvent être sensibles à la casse dans certains systèmes :
https://example.com/Catalog
https://example.com/catalog
Ces adresses ne peuvent pas être considérées comme une seule URL sans vérification du site.
De plus, l'outil de suppression exacte ne déterminera pas automatiquement si ces variantes sont équivalentes :
https://example.com/page
https://example.com/page/
https://example.com/page?utm_source=email
http://example.com/page
https://www.example.com/page
Leur regroupement dépend des redirections, des URLs canoniques, de la configuration du serveur et de votre objectif. Supprimez d'abord uniquement les doublons exacts, puis analysez la canonisation séparément.
Ce qu'il faut prendre en compte pour les adresses e-mail
La partie domaine après @ peut être mise en minuscules. La partie locale avant @ est plus complexe : la norme autorise la sensibilité à la casse, bien que de nombreux systèmes de messagerie modernes ne l'utilisent pas en pratique.
Par conséquent, la conversion complète de toutes les adresses e-mail en minuscules est généralement pratique pour une base de données connue, mais ne doit pas être considérée comme une règle universellement infaillible. Pour les envois en masse, il ne suffit pas non plus de supprimer les doublons textuels : il faut tenir compte du consentement des destinataires, des adresses invalides, des désabonnements et des contacts supprimés.
Références, codes, hachages et identifiants
Pour ces valeurs, la casse peut faire partie de l'identifiant :
abc123
ABC123
Avant de modifier la casse, consultez la documentation du CRM, de la boutique, de l'API ou de la base de données. Il en va de même pour les codes promotionnels, jetons, UUID dans des formats non standard, noms de fichiers et clés d'objets.
Unicode et différences invisibles
Un texte apparemment identique peut être représenté par des séquences Unicode différentes. Par exemple, une lettre avec un diacritique peut être stockée comme un seul caractère ou comme une lettre suivie d'un signe combinant distinct. Une comparaison ordinaire pourrait les considérer comme des chaînes différentes.
On rencontre également :
- espace insécable (NBSP) ;
- espace insécable étroit ;
- caractères de largeur nulle ;
- tirets différents :
-,–,—; - lettres visuellement similaires de l'alphabet latin et cyrillique.
L'utilitaire actuel n'est pas tenu d'effectuer une normalisation Unicode complète ni de détecter les substitutions d'alphabets. Si des doublons mystérieux subsistent après le nettoyage, vérifiez les points de code avec un analyseur spécialisé.
Faut-il trier le résultat ?
Le tri facilite la consultation et aide à repérer les lignes similaires côte à côte, mais modifie la séquence originale. Cela peut être critique pour :
- les listes de priorités ;
- les files d'attente de tâches ;
- les structures de menus ;
- les séquences de commandes ;
- les données où une ligne est liée à un numéro ou à une ligne adjacente.
Si l'ordre est important, supprimez les doublons en conservant la première occurrence et n'activez pas le tri.
Scénarios pratiques
Mots-clés
Uniformisez la casse, nettoyez les extrémités des lignes et supprimez les doublons exacts. Ne supprimez pas les permutations de mots ni les formulations proches avant d'avoir analysé les résultats de recherche et procédé au clustering.
Liste de domaines
Les noms de domaine peuvent être mis en minuscules. Vérifiez que la liste ne contient pas d'URLs complètes avec chemins et paramètres — pour elles, les règles sont plus strictes.
URLs provenant de plusieurs exports
Supprimez d'abord les doublons exacts. Déterminez ensuite séparément s'il faut exclure les paramètres UTM, les fragments, la barre oblique finale, le protocole ou www. Cette décision ne peut pas être prise de manière identique pour tous les sites.
Noms de produits
La correspondance exacte du nom ne signifie pas toujours un doublon de produit : la taille, la couleur, la configuration ou le SKU peuvent différer. Inversement, un même produit peut avoir des noms légèrement différents. Utilisez la référence ou un autre identifiant stable.
Base de données e-mails
Supprimez les lignes vides et les doublons, mais ne considérez pas cela comme une préparation complète pour l'envoi. Une vérification de la syntaxe, du statut d'abonnement, des désabonnements et des règles du service de messagerie spécifique est nécessaire.
Comment vérifier le résultat
- Comparez le nombre de lignes avant et après le traitement.
- Examinez quelques valeurs supprimées, si l'interface permet de conserver l'original à côté.
- Assurez-vous que la casse n'était pas significative.
- Vérifiez le début et la fin de la liste après le tri.
- Pour les données importantes, effectuez un test d'import sur une petite partie.
Questions fréquentes
Pourquoi des lignes similaires restent-elles après la suppression des doublons ?
Elles peuvent différer par les espaces, la casse, la ponctuation, les caractères Unicode ou la forme des mots. L'outil supprime les chaînes correspondantes, pas le sens identique.
Peut-on tout mettre les URLs en minuscules ?
Non. Il est sûr de normaliser la casse du schéma et du domaine, mais le chemin et les paramètres peuvent être sensibles à la casse.
Quelle occurrence est conservée en cas de répétition ?
En général, une des valeurs identiques est conservée. Si pour votre tâche il est important de conserver la première ou la dernière occurrence et l'ordre associé, vérifiez le comportement sur une courte liste de test.
Pourquoi le tri a-t-il perturbé la structure des données ?
Le tri fonctionne indépendamment sur les chaînes et ne connaît pas leurs groupes sémantiques. Ne l'utilisez pas pour des enregistrements multilignes ou des colonnes liées collées comme texte brut.
L'outil supprimera-t-il les doublons de pages avec des paramètres UTM ?
Pas comme doublons canoniques : les URLs avec des paramètres différents sont des chaînes distinctes. Pour les regrouper, vous devez déterminer séparément quels paramètres peuvent être supprimés sans altérer le sens.
Outils associés : Traitement de texte ; Combinateur de mots-clés ; Diffchecker.
Norme officielle :
RFC 3986 — URI Generic Syntax : https://www.rfc-editor.org/rfc/rfc3986
