Lire les nombres à voix haute en français : ce qu'une machine doit savoir
1 200 €, 15 h 30, 3,5 %, 1er, XIXe : chaque écriture a une lecture attendue et une lecture fausse. Le tableau des formes qui piègent la synthèse vocale française, et comment on les traite.
Un chiffre écrit ne dit pas comment il se lit. « 1 200 » se lit « mille deux cents », mais « 1200 » collé peut être pris pour une année, « douze cents ». « 15/03 » est une date pour vous et une division pour une machine qui n'a pas compris le contexte. Le français lu à voix haute est plein de ces formes où l'orthographe et la prononciation divergent, et c'est précisément là qu'une voix de synthèse trébuche, souvent sans prévenir.
Le problème n'est pas anecdotique. Un article de presse, une fiche produit, un rapport d'activité en sont remplis. Une voix qui lit parfaitement les phrases et bute sur un montant ou une heure casse la confiance exactement au moment où le lecteur avait besoin de l'information précise. Voici les formes qui posent réellement problème, ce qu'on attend d'elles, et l'erreur fréquente à côté.
Le tableau des formes qui piègent
| Forme écrite | Lecture attendue | Erreur fréquente |
|---|---|---|
| 1 200 € | mille deux cents euros | « douze cents euros », ou « un espace deux cents » |
| 3,5 % | trois virgule cinq pour cent | « trois cinq pour cent », ou « trois point cinq » |
| 15 h 30 | quinze heures trente | « quinze h trente », ou « quinze heures trois zéro » |
| 15/03 | quinze mars | « quinze slash zéro trois », « quinze divisé par trois » |
| 1er | premier | « un e r », « un er » |
| XIXe | dix-neuvième | « X I X e », « xixe » comme un mot |
| n° 12 | numéro douze | « n degré douze », « n rond douze » |
| 2 M€ | deux millions d'euros | « deux M euros », « deux méga euros » |
| 06 12 34 56 78 | zéro six, douze, trente-quatre... | la suite lue chiffre par chiffre sans groupement |
| 1/4 | un quart | « un sur quatre », « un slash quatre » |
Chacune de ces lignes est un test que vous pouvez faire passer à n'importe quel outil, y compris le nôtre, en deux minutes. La colonne de droite n'est pas théorique : ce sont les lectures fausses qu'on entend réellement sur des voix génériques qui prédisent la prononciation sans modèle du français.
Pourquoi c'est difficile pour une machine
Une voix neuronale ne « comprend » pas un nombre, elle prédit sa prononciation à partir de ce qu'elle a appris. Le même symbole change de lecture selon ce qui l'entoure : « / » est un « slash » dans une URL, un « mars » dans une date, un « sur » ou un « quart » dans une fraction. « h » est une heure après un nombre, une lettre ailleurs. La séparation des milliers par une espace, correcte en typographie française, ressemble pour un moteur mal préparé à deux nombres distincts.
La bonne préparation consiste à normaliser le texte avant la synthèse : reconnaître qu'un motif est une date, un montant, un pourcentage ou un numéro, et le réécrire dans la forme que la voix lira juste. C'est un travail de règles, pas de voix. Une jolie voix mal alimentée lira mal un montant ; une voix moyenne bien préparée le lira juste. C'est toute la logique de la page text to speech français : ce qui compte se joue avant que le son sorte.
Ce que WeDispatch en fait, sans surpromesse
Les formes du tableau ci-dessus (montants, pourcentages, heures, dates numériques usuelles, ordinaux courants, numéros) sont traitées par la normalisation appliquée à chaque article, dans les deux modes de lecture. C'est le socle, celui qu'on considère comme acquis et non comme une option.
Restent les cas où le contexte est ambigu même pour un humain. « 1200 » sans séparateur peut être une année ou un nombre selon le sens de la phrase, et aucune règle ne tranche à coup sûr. Dans ces cas, deux choses. D'abord, un texte bien saisi lève l'ambiguïté à la source : écrire « 1 200 » avec l'espace insécable, « 1200 » pour une année, c'est déjà la moitié du travail, et c'est une bonne habitude de rédaction indépendamment de l'audio. Ensuite, pour une lecture particulière qui doit tenir sur tous vos articles, le lexique de prononciation vous laisse déclarer la forme attendue une fois, sans régénérer quoi que ce soit.
Nous préférons le dire ainsi plutôt que de prétendre qu'une machine devine toujours. Elle ne devine pas : elle applique des règles solides sur la grande majorité des cas, et vous donne la main sur le reste.
Le test à faire avant de choisir
Prenez un article réel de votre site, pas un texte de démonstration. Repérez-y les cinq ou six endroits où un chiffre porte de l'information : un prix, une date, une statistique, un horaire, un numéro. Faites lire le passage par l'outil que vous évaluez et écoutez uniquement ces endroits. C'est plus rapide et bien plus prédictif qu'une écoute globale, parce que ces formes sont celles qui reviennent tous les jours dans vos contenus.
Le même principe vaut pour les liaisons, l'autre grand révélateur du français lu par machine, que nous avons détaillé dans les liaisons, le test le plus dur du français lu par une machine. Et si vous voulez une méthode complète pour départager deux voix, elle est dans comment évaluer une voix neuronale. Les chiffres, à eux seuls, éliminent déjà plus de candidats qu'on ne l'imagine.
Sonorisez vos articles avec WeDispatch
Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?
Demandez une démo