← Blog · 15 septembre 2026 · Read in English

Synthèse vocale française : lire les intervalles et les plages de nombres

2008-2012, pp. 12-15, 40-45 ans, un score de 3-1 : le trait d'union entre deux nombres est un piège pour une voix de synthèse. Le tableau des formes qui trébuchent, et le geste de rédaction qui les règle.

Le trait d'union est un caractère innocent qui cache trois métiers. Entre deux mots, il soude un mot composé. Devant un nombre, il peut être un signe moins. Entre deux nombres, il annonce presque toujours une plage : « 2008-2012 » se dit « de deux mille huit à deux mille douze ». Une voix de synthèse qui n'a pas appris à distinguer ces trois emplois lit le même signe de la même façon partout, et c'est là qu'une lecture par ailleurs correcte se met à dérailler sur une date, une pagination ou un score. Le problème est discret, parce qu'un intervalle mal lu reste presque compréhensible, mais il coûte cher : il signale à l'oreille que la voix ne suit pas le sens.

Le tableau des formes qui piègent

| Forme écrite | Lecture attendue | Erreur fréquente |
|---|---|---|
| 2008-2012 | de deux mille huit à deux mille douze | « deux mille huit tiret deux mille douze », « deux mille huit moins deux mille douze » |
| pp. 12-15 | pages douze à quinze | « p p douze quinze », « p p douze moins quinze » |
| 40-45 ans | quarante à quarante-cinq ans | « quarante moins quarante-cinq ans » |
| 3-1 (un score) | trois à un | « trois moins un », « trois tiret un » |
| de 5 à 10 | de cinq à dix | (forme sûre, rien à corriger) |
| 10-12 kg | dix à douze kilos | « dix moins douze kilos » |
| 1990-2000 | de mille neuf cent quatre-vingt-dix à deux mille | « mille neuf cent quatre-vingt-dix moins deux mille » |
| chap. 4-6 | chapitres quatre à six | « chap quatre six » |

Chaque ligne est un test que vous pouvez faire passer en deux minutes à n'importe quel outil, y compris le nôtre. La colonne de droite n'est pas théorique : ce sont les lectures qu'on entend réellement sur des voix génériques qui prédisent la prononciation sans modèle de ce que le texte veut dire.

Pourquoi c'est difficile pour une machine

Une voix neuronale ne comprend pas un intervalle, elle prédit sa prononciation à partir de ce qu'elle a vu. Or le même caractère, le trait d'union, sépare légitimement deux nombres dans trois situations qui ne se disent pas pareil. Dans « 2008-2012 », c'est une plage, donc « à ». Dans « -5 °C », c'est un signe, donc « moins ». Dans « quarante-cinq », c'est une soudure, et le nombre se lit d'un bloc. Rien dans le caractère lui-même ne tranche : seul le contexte le fait, et un contexte, ça se modélise ou ça se devine.

C'est toute la logique de la page text to speech français : l'essentiel se joue avant que le son sorte, dans la façon dont le texte est reconnu et réécrit pour la voix. Une jolie voix mal préparée lira « deux mille huit moins deux mille douze » sans sourciller ; une voix moyenne bien préparée dira « de deux mille huit à deux mille douze ». Le travail n'est pas dans le timbre, il est dans la lecture des motifs.

Ce que WeDispatch en fait, sans surpromesse

Les plages les plus courantes (années, pages, fourchettes d'âges, quantités usuelles) sont traitées par la normalisation appliquée à chaque article. C'est le socle, et il couvre la grande majorité de ce qu'on rencontre dans un texte réel.

Restent les cas où le contexte est ambigu même pour un humain. « 3-1 » est un score dans un compte rendu sportif, une soustraction dans un exercice de calcul, une référence d'article ailleurs. Aucune règle ne devine à coup sûr, et prétendre le contraire serait malhonnête. Dans ces cas, deux leviers. D'abord, une rédaction claire lève l'ambiguïté à la source, et nous y venons juste après. Ensuite, pour une forme qui revient sur tous vos contenus et qui doit se lire d'une certaine façon, le lexique de prononciation vous laisse déclarer la lecture attendue une fois, sans rien régénérer.

Le geste de rédaction qui règle presque tout

La forme la plus sûre est aussi la plus lisible à l'écrit : « de 5 à 10 ». Elle ne laisse aucune place au doute, ni pour la machine, ni pour l'œil. Écrire « de 2008 à 2012 » plutôt que « 2008-2012 », « pages 12 à 15 » plutôt que « pp. 12-15 », c'est déjà régler le cas avant qu'il n'atteigne la voix. Ce n'est pas une contrainte imposée par l'audio : c'est une bonne habitude de rédaction, qui rend le texte plus clair pour tout le monde et l'audio juste par surcroît.

Là où la forme abrégée doit rester (une pagination bibliographique, un score, un tableau), le lexique prend le relais pour les motifs qui reviennent, et l'écoute d'un article réel fait le reste du diagnostic. Le même principe vaut pour les nombres isolés, que nous avons détaillés dans lire les nombres à voix haute en français, et pour les dates, un autre terrain où la ponctuation change tout, traité dans la synthèse vocale et les dates. Pris ensemble, ces trois points éliminent, à l'oreille, la plupart des voix qui lisent bien les phrases et trébuchent dès qu'un chiffre porte de l'information.

Sonorisez vos articles avec WeDispatch

Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?

Demandez une démo

À lire aussi