← Blog · 14 septembre 2026 · Read in English

Ce qui ne se lit pas : le bruit typographique qu'une voix de synthèse doit ignorer

Crédits photo, 'Lire aussi', filets de séparation, entités HTML, puces : un article est plein de signes écrits pour l'oeil. Ce qu'une bonne préparation en fait avant de passer la main au moteur de voix.

Un article n'est pas fait que de phrases. Autour du texte, il y a une couche de signes qui servent l'oeil et n'ont aucun sens à l'oreille : la ligne « Photo : Julie Martin / AFP » sous l'image, le « Lire aussi » qui renvoie à un autre papier, le filet de séparation entre deux parties, le petit « 4 min de lecture » en tête, et, plus discret encore, les entités HTML que le copier-coller laisse traîner dans le texte source. À l'écran, tout cela se distingue au premier regard : une légende est en petit, un lien est souligné, un filet est un trait. À voix haute, rien de tout cela ne se voit. Une voix qui lit bêtement ce qu'on lui donne annoncera « crédit photo deux-points » au milieu d'un reportage, et l'auditeur se demandera ce qu'il vient d'entendre.

Le problème ne se voit qu'en écoutant

C'est le genre de défaut qui passe toutes les relectures visuelles. Vous relisez votre article, il est parfait. Vous ne pensez pas à la légende de la photo, parce que votre cerveau l'a rangée dans « ce qui n'est pas le texte » sans même vous le dire. Le moteur de voix, lui, n'a pas cette intuition. Pour lui, « Partager sur Facebook » est une phrase comme une autre, et «   » est une suite de caractères à prononcer. Nous avons mesuré ce que donne un texte non préparé passé tel quel : une entité oubliée comme   se lit « et n b s p », un … devient du charabia, et une ligne de crédit photo s'invite entre deux paragraphes de fond. Chacun de ces accidents, pris seul, dure une seconde. Mis bout à bout sur un site entier, ils font la différence entre un audio qu'on écoute et un audio qu'on coupe.

Ce qu'une préparation sérieuse retire, et pourquoi ancrée en début de ligne

La règle que nous appliquons est simple à énoncer : on retire ce qui est écrit pour l'oeil, on garde ce que le journaliste a voulu dire. Concrètement, une préparation de lecture enlève les lignes de crédit (« Photo : », « Crédit : », « Source : », « Légende : »), les renvois (« Lire aussi », « Voir aussi », « Sur le même sujet »), les appels à l'action (« Partager », « Abonnez-vous », « Newsletter »), la mention « Publicité », l'horodatage « Publié le... » et le « X min de lecture ». Le point délicat, celui qui sépare une règle utile d'une règle qui abîme le texte, c'est l'ancrage. « Photo : » en tête de ligne est un crédit et se retire ; « une photo : celle de 1998 » au milieu d'une phrase n'en est pas un et doit rester. C'est pour cela que nos motifs sont ancrés en début de ligne et suivis d'un séparateur : une règle trop gourmande mange la prose, et c'est exactement ce qu'on veut éviter. La démarche est la même que celle du mode charte, où chaque transformation est lisible et testée une par une plutôt que confiée à un modèle qui pourrait déplacer un mot au passage.

Les entités HTML, le piège du copier-coller

Il y a un cas particulier qui mérite d'être nommé, parce qu'il est invisible dans l'éditeur et bien réel dans la source : les entités HTML. Un texte importé depuis un CMS ou collé depuis une page web arrive souvent truffé de  , &, é, … et autres codes que le navigateur affiche correctement mais que le fichier contient à la lettre. Les laisser passer, c'est faire lire du code à voix haute. Nous les décodons avant la synthèse : les entités numériques sont calculées (é redevient « é », é » aussi), ce qui couvre tout l'alphabet accentué sans une table à maintenir, et les nommées courantes sont traduites (  en espace, & en « et », …` en points de suspension). Le lecteur n'entend jamais qu'il y a eu du HTML dans le texte, et c'est très bien ainsi. La même logique vaut pour le balisage markdown : un intertitre garde son texte mais perd son dièse, une puce garde son contenu mais perd son tiret.

Une question à poser à tout outil vocal

Quand vous évaluez une solution de lecture, la qualité de la voix saute aux oreilles en trois secondes. Le traitement du bruit typographique, lui, se cache : il faut lui donner un vrai article, avec sa légende de photo, son « Lire aussi » et ses entités, et écouter jusqu'au bout. C'est précisément ce que travaille la page text to speech français : ce qui se passe entre le texte brut que vous publiez et ce qui sort du haut-parleur. Un outil qui lit « crédit photo » ou « et n b s p » n'a pas fait ce travail, et aucune voix, si belle soit-elle, ne rattrapera cela. Le silence sur ce qui ne se dit pas est une forme de qualité, moins spectaculaire que le timbre, mais c'est elle qui décide si un auditeur reste.

Sonorisez vos articles avec WeDispatch

Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?

Demandez une démo

À lire aussi