Inspecteur Unicode
Collez un texte et obtenez une ligne par caractère : point de code, nom Unicode, catégorie générale, bloc, et un indicateur quand il est invisible, de contrôle, lettre sosie ou pleine chasse. Totaux en points de code, unités UTF-16, octets UTF-8 et graphèmes.
Rien n'est envoyé à un serveur : le texte reste dans votre navigateur, l'outil fonctionne hors ligne une fois la page chargée. Ctrl+Entrée lance le traitement.
- Les noms viennent d'une table intégrée d'environ 4 700 caractères (latin, grec, cyrillique, ponctuation, espaces, flèches, symboles, blocs emoji) plus des règles pour les formes pleine chasse, mathématiques, CJC, hangeul, usage privé et caractères tag
- La catégorie générale est calculée par le navigateur (échappements de propriétés Unicode), elle suit donc la version d'Unicode du navigateur
- Indicateurs : caractère invisible ou de format, contrôle, sosie (lettre cyrillique ou grecque qui imite une lettre latine), lettre pleine chasse ou mathématique
- Les graphèmes sont comptés avec le segmenteur du navigateur quand il existe, si bien qu'un emoji famille compte pour un
- Affiche les 3 000 premières lignes ; les totaux couvrent tout le texte
Ce que montre chaque ligne
Un texte est une suite de points de code ; ce que vous voyez à l'écran, ce sont des graphèmes, et ce qu'un fichier stocke, ce sont des octets. Ces trois comptes divergent dès qu'il y a des accents, des emoji ou des caractères invisibles. L'inspecteur déplie la suite, un point de code par ligne :
- Caractère : le caractère lui-même, ou un jeton court (ZWSP, NBSP, SHY, LRM) quand il n'a pas de forme visible.
- Point de code : U+ suivi de quatre à six chiffres hexadécimaux.
- Nom : le nom Unicode du caractère (LATIN SMALL LETTER A, ZERO WIDTH SPACE, CYRILLIC SMALL LETTER O), en anglais comme dans le standard.
- Catégorie : la catégorie générale (lettre, marque, nombre, ponctuation, symbole, séparateur, format, contrôle) telle que la calcule votre navigateur.
- Bloc : le bloc Unicode (Basic Latin, Latin-1 Supplement, General Punctuation, Cyrillic, Mathematical Alphanumeric Symbols).
- Indicateurs : invisible, contrôle, sosie, pleine chasse ou mathématique.
Usages courants
Comprendre pourquoi deux chaînes qui semblent identiques ne correspondent pas (un о cyrillique dans l'une, un o latin dans l'autre). Trouver le caractère qui casse un fichier JSON ou un import CSV. Comprendre pourquoi un message est plus long qu'il n'y paraît (diacritiques combinants, sélecteurs de variante). Vérifier ce qu'un code produit copié contient vraiment. Identifier un symbole que vous ne savez pas taper. Vérifier qu'un texte envoyé à un champ de formulaire ne contient que de l'ASCII quand le champ l'exige : cochez Masquer l'ASCII simple et ce qui reste est ce qu'il faut corriger.
Mode d'emploi
- Collez le texte (ou un seul caractère) et cliquez sur Inspecter.
- Cochez Caractères signalés seulement pour garder les lignes qui méritent un regard, ou Masquer l'ASCII simple pour ne voir que ce qui sort des 7 bits.
- Copiez ou téléchargez le rapport en texte tabulé.
Corriger ce que vous avez trouvé
L'inspecteur montre ; il ne change rien. Pour retirer les caractères invisibles et sosies qu'il signale, utilisez l'outil supprimer les caractères invisibles, qui s'appuie sur les mêmes tables et laisse choisir catégorie par catégorie. Pour nettoyer une sortie d'IA en une passe, Markdown et tirets compris, le nettoyeur de texte IA s'en charge ; pour les seuls guillemets, l'outil convertir les guillemets.
Rien de tout cela ne touche un watermark statistique : cette marque vit dans le choix des mots et survit à tout nettoyage de caractères. Si c'est votre question, le suppresseur de watermark Claude explique ce qui s'applique.
Confidentialité
L'inspection s'exécute dans votre navigateur ; votre texte n'est ni envoyé, ni stocké, ni journalisé.
Unmarker est un produit indépendant, sans lien avec Anthropic et non approuvé par elle.
Les questions qu'on nous pose
Quelle différence entre points de code, unités UTF-16 et graphèmes ?
Un point de code est un caractère Unicode. Les chaînes JavaScript comptent des unités UTF-16, si bien que les emoji et les caractères au-delà de U+FFFF comptent double. Un graphème est ce qu'un lecteur voit comme un caractère : un e accentué écrit en deux points de code est un graphème, tout comme un emoji famille composé de plusieurs points de code liés par U+200D.
Pourquoi certains caractères n'ont-ils pas de nom ?
La table intégrée couvre environ 4 700 caractères courants plus des règles pour les grands blocs réguliers (CJC, hangeul, mathématique, pleine chasse, usage privé). Les caractères rares hors de ces zones affichent leur bloc et leur catégorie mais pas de nom.
Que signifie l'indicateur sosie ?
Le caractère est une lettre cyrillique ou grecque qui ressemble à une lettre latine (a, e, o, p, c, x, y et d'autres). Dans un mot latin, c'est un moyen classique de tromper recherches et filtres, ou un accident de copier-coller.
Puis-je inspecter un seul caractère ?
Oui. Collez ce seul caractère ; la ligne donne son point de code, son nom, son bloc et sa catégorie.
Le texte est-il envoyé ?
Non. L'inspecteur est un script qui s'exécute dans votre navigateur et fonctionne hors ligne une fois la page chargée.
