Nettoyer un texte en un clic
Réparez d’un coup un texte collé depuis Word, un PDF ou un e-mail : espaces multiples, lignes vides, caractères invisibles, guillemets typographiques et retours à la ligne Windows.
Ce qu’un copier-coller ramène avec lui
Un texte qui sort de Word, d’un PDF, d’une page web ou d’un client de messagerie n’est presque jamais propre. Il transporte des caractères que vous n’avez pas tapés et que vous ne voyez pas : espaces insécables posées automatiquement par le correcteur, tabulations héritées d’une mise en page, doubles espaces après les points, indentations en début de ligne, guillemets courbes substitués à la volée, marque d’ordre des octets ajoutée en tête de fichier.
Tant que le texte reste dans un document, ces caractères sont inoffensifs : ils se contentent d’occuper la place d’une espace. Le problème apparaît dès qu’on le traite : un import CSV qui décale une colonne, une recherche qui ne trouve rien, un champ de formulaire refusé sans explication, deux lignes en apparence identiques que la déduplication laisse en double.
Les caractères invisibles, le vrai sujet
Sous le terme « caractère invisible » se cachent deux familles : les espaces qui n’en sont pas tout à fait, et les caractères de largeur nulle, qui n’occupent aucun pixel à l’écran. Voici ceux que cet outil traite, et ce qu’ils deviennent :
| Caractère | Code | D’où il vient | Ce qu’il devient |
|---|---|---|---|
| Espace insécable | U+00A0 | Word, correcteurs, en HTML | Espace ordinaire |
| Espace insécable étroite | U+202F | Typographie française soignée | Espace ordinaire |
| Espace fine | U+2009 | PDF, logiciels de mise en page | Espace ordinaire |
| Espace idéographique | U+3000 | Textes asiatiques, formulaires | Espace ordinaire |
| Tabulation | U+0009 | Indentation, colonnes de tableur | Espace ordinaire |
| Zero-width space | U+200B | Sites web, césures automatiques | Supprimé |
| Zero-width non-joiner et joiner | U+200C, U+200D | Emojis composés, écritures liées | Supprimé |
| Trait d’union conditionnel | U+00AD | Césure de fin de ligne | Supprimé |
| Marque d’ordre des octets (BOM) | U+FEFF | Début des fichiers UTF-8 | Supprimé |
| Séparateur de ligne et de paragraphe | U+2028, U+2029 | Exports de tableurs, PDF | Saut de ligne |
Trois raisons expliquent qu’ils causent autant de dégâts. D’abord, ils cassent les imports : un séparateur précédé d’une espace insécable n’est plus reconnu comme un séparateur, et un BOM en tête de fichier transforme le premier nom de colonne en un intitulé que le programme ne retrouve jamais. Ensuite, ils faussent les recherches et les comparaisons : « 1 000 € » saisi avec une insécable ne correspond pas à « 1 000 € » saisi avec une espace ordinaire, alors que les deux chaînes s’affichent exactement pareil. Enfin, et c’est le pire, ils sont invisibles à l’écran : aucune relecture, aussi attentive soit-elle, ne permet de les repérer à l’œil. Seule une normalisation systématique en vient à bout.
Ce que fait chaque option
- Espaces multiples : toute suite de deux espaces ou plus est réduite à une seule. C’est le correctif du double espace après le point, hérité des machines à écrire.
- Début et fin de ligne : retire l’indentation et les espaces traînantes de chaque ligne, cause numéro un des faux doublons dans une liste.
- Caractères invisibles : applique le tableau ci-dessus. À laisser active dans la quasi-totalité des cas.
- Retours Windows : convertit les fins de ligne
CRLFenLF. Utile avant de coller dans un éditeur de code, un fichier de configuration ou un dépôt Git. - Lignes vides en trop : compresse les séries de lignes vides en une seule et supprime celles du début et de la fin, sans écraser la séparation entre paragraphes.
- Tirets longs : le tiret cadratin (—), le demi-cadratin (–) et le signe moins (−) deviennent un simple trait d’union.
Le compteur affiché sous le résultat indique combien de caractères ont disparu : c’est souvent la seule preuve visible que le texte était sale.
Apostrophes et guillemets : à activer en connaissance de cause
L’option qui convertit les apostrophes courbes (’) en apostrophes droites (') et les guillemets français (« ») en guillemets droits (") est désactivée par défaut, et ce n’est pas un oubli. Pour un traitement technique — un identifiant, une requête, un fichier JSON, un import — l’apostrophe droite est ce qu’attendent la plupart des systèmes. Mais pour un texte destiné à être lu, la conversion est une régression typographique : en français, l’apostrophe correcte est l’apostrophe courbe, et les guillemets corrects sont les chevrons. N’activez cette option que si le texte part vers une machine, jamais vers une page imprimée ou publiée.
Dans quel ordre enchaîner
Ce nettoyage est presque toujours la première étape. Ensuite, selon l’objectif : supprimer les doublons puis trier pour une liste ; recoller les lignes pour un texte issu d’un PDF ; ne garder que les caractères autorisés pour préparer un identifiant. Tout se calcule dans votre navigateur : vous pouvez nettoyer un contrat ou un fichier client sans que la moindre ligne ne quitte votre ordinateur.
Questions fréquentes
Comment savoir si mon texte contient des caractères invisibles ?
Collez-le et regardez le compteur sous le résultat : s’il annonce des caractères retirés alors que le texte semble identique, c’est qu’il en contenait. L’autre indice classique : un texte dont la recherche « ne trouve pas » un mot pourtant visible à l’écran.
Les espaces insécables de la typographie française sont-elles perdues ?
Oui, elles deviennent des espaces ordinaires. C’est voulu pour un traitement technique, mais à éviter si vous préparez un texte pour l’impression ou la publication : la règle française impose une insécable avant les signes doubles et à l’intérieur des guillemets. Dans ce cas, décochez « Caractères invisibles ».
Mes paragraphes sont-ils conservés ?
Oui. Les sauts de ligne restent en place ; seules les lignes vides en surnombre sont compressées si vous activez l’option correspondante. Pour transformer un texte haché en un paragraphe continu, passez ensuite par supprimer les sauts de ligne.
Y a-t-il une limite de taille ?
Aucune limite imposée. Chaque option correspond à une passe unique sur le texte, sans expression régulière coûteuse : un document de plusieurs centaines de milliers de caractères est traité instantanément, y compris sur un téléphone.