Symboles mathématiques et opérateurs : ce qu'une voix de synthèse en fait
+, ×, ÷, =, <, ≤, ±, √, π : chaque signe a une lecture attendue et une lecture fausse. Le tableau des opérateurs qui piègent la synthèse vocale française, et comment reprendre la main dessus.
Un signe mathématique n'est pas un mot, et pourtant il faut bien le dire à voix haute. « 3 + 2 » se lit « trois plus deux », mais « + » tout seul, dans « les +18 ans » ou « clavier +/- », ne se lit pas pareil, et parfois ne se lit pas du tout. Le français lu par une machine trébuche moins sur les phrases que sur ces petits signes densément chargés de sens, où l'écriture tient en un caractère ce que la parole étale en trois mots. C'est un cas voisin de celui des nombres, que nous traitons dans lire les nombres à voix haute, mais il a sa difficulté propre : un opérateur dépend entièrement de ce qui l'entoure.
Le tableau des signes qui piègent
Voici les formes qui reviennent le plus souvent dans un texte grand public (une fiche produit, un article de vulgarisation, un billet de recette, un comparatif), avec la lecture qu'un humain attend et l'erreur fréquente d'un outil qui n'a pas été réglé pour le français.
| Forme écrite | Lecture attendue | Erreur fréquente |
|---|---|---|
| 3 + 2 | trois plus deux | « trois croix deux » |
| 5 − 2 | cinq moins deux | « cinq tiret deux » |
| 4 × 3 | quatre multiplié par trois | « quatre x trois », « quatre fois croix trois » |
| 12 ÷ 4 | douze divisé par quatre | « douze deux points tiret quatre » |
| a = b | a égal b | « a égale égale b » |
| 5 < 10 | cinq inférieur à dix | « cinq chevron dix » |
| x ≤ 3 | x inférieur ou égal à trois | « x point d'interrogation trois » |
| ± 2 | plus ou moins deux | « plus deux », « croix moins deux » |
| √9 | racine carrée de neuf | « v neuf », « coche neuf » |
| 50 % | cinquante pour cent | « cinquante pourcent » collé, « cinquante rond » |
| 3 ‰ | trois pour mille | « trois pour cent », « trois rond zéro » |
| π | pi | « n grec », le symbole ignoré |
| 2 × 10⁶ | deux fois dix puissance six | « deux x dix six » |
| ∞ | l'infini | le symbole avalé sans un son |
Chaque ligne est un test que vous pouvez faire passer à n'importe quel outil, y compris le nôtre, en deux minutes. La colonne de droite n'a rien de théorique : ce sont les lectures fausses qu'on entend réellement sur des voix génériques qui prédisent la prononciation caractère par caractère, sans modèle de ce qu'un signe veut dire.
Pourquoi c'est difficile pour une machine
Une voix neuronale ne calcule pas, elle prédit une prononciation à partir de ce qu'elle a appris. Or le même caractère change de lecture selon le contexte. Le « - » est un « moins » entre deux nombres, un trait d'union dans « quarante-deux », un tiret d'incise ailleurs. Le « / » est un « divisé par » dans un calcul, un « sur » dans une fraction, un « slash » dans une adresse web. Le « x » minuscule est tantôt la lettre, tantôt le signe de multiplication, et rien dans la suite de caractères ne le dit avec certitude. Un opérateur isolé est encore plus délicat : « + » à la fin de « 18+ » veut dire « et plus », pas « plus ».
La bonne préparation ne consiste donc pas à trouver une plus jolie voix, mais à normaliser le texte avant la synthèse : reconnaître qu'un motif est un calcul, une comparaison, un taux ou une notation, et le réécrire dans la forme que la voix lira juste. C'est un travail de règles, et c'est exactement la logique de la page text to speech français : ce qui compte se joue avant que le son sorte. Une belle voix mal alimentée lira « quatre x trois » ; une voix moyenne bien préparée dira « quatre multiplié par trois ».
Là où l'information a été perdue en amont
Beaucoup d'échecs ne viennent pas du moteur mais du texte qu'on lui donne. Une puissance écrite « 10^6 » au clavier, un « ² » qui a survécu à un copier-coller mais pas au flux RSS qui l'a aplati, un « ≤ » remplacé par « <= » à la saisie : autant de formes où la mise en forme portait un sens que la chaîne de caractères a perdu. C'est le même phénomène que pour les exposants et les indices, que nous détaillons dans exposants, indices et notation scientifique. La règle est simple : une voix ne peut lire correctement que ce que le texte lui donne à lire.
Ce que WeDispatch en fait, sans surpromesse
Les formes les plus courantes du tableau (les opérateurs entre deux nombres, le pourcentage, le pour mille, la comparaison simple, la racine) sont traitées par la normalisation appliquée à chaque article. C'est le socle, celui qu'on considère comme acquis, pas comme une option.
Restent les cas où le contexte est réellement ambigu, y compris pour un humain : « + » en fin de mention, un « x » qui pourrait être une lettre, une notation maison propre à un domaine. Là, deux réponses honnêtes. D'abord, un texte bien saisi lève l'ambiguïté à la source : écrire « et plus » plutôt que « + », « inférieur ou égal » plutôt qu'un signe qu'un export risque de casser, c'est déjà la moitié du travail, et c'est une bonne habitude de rédaction indépendamment de l'audio. Ensuite, pour une lecture particulière qui doit tenir sur tous vos articles, le lexique de prononciation vous laisse déclarer la forme attendue une fois pour toutes, sans rien régénérer. Ce que nous ne faisons pas : deviner l'intention derrière une notation que le texte ne rend pas explicite. Une machine qui tranche au hasard a l'air sûre d'elle, et c'est précisément là qu'elle se trompe en confiance.
Essayez sur vos propres textes
La formule gratuite de WeDispatch vous laisse produire la version audio d'un article dès aujourd'hui, et tester ces cas de vos propres yeux : essayez maintenant. Les forfaits, de 69 à 419 euros HT par mois, sont détaillés sur la page tarifs.
Sonorisez vos articles avec WeDispatch
Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?
Demandez une démo