Comment fonctionne la synthèse vocale, expliqué simplement
Entre le texte écrit et le son qui sort, il se passe plus de choses qu'on ne croit. Le trajet d'un article, étape par étape, et l'endroit précis où se joue la qualité d'une voix française.
On imagine souvent la synthèse vocale comme une machine qui lit les lettres l'une après l'autre, à voix haute, mécaniquement. C'était vrai des premières voix robotiques. Ce ne l'est plus. Une voix neuronale récente ne lit pas des lettres, elle produit un signal sonore qui ressemble à une voix humaine, à partir d'un texte qu'on a d'abord préparé. Comprendre ce trajet aide à savoir pourquoi deux outils, nourris du même article, ne rendent pas le même résultat, et où se trouve le vrai travail.
Le texte n'est pas lu tel qu'il est écrit
Première surprise : avant même d'atteindre le moteur de voix, le texte est transformé. Un article contient des formes qui s'écrivent court et se disent long. « 30 °C » se dit « trente degrés », « SNCF » s'épelle, « wedispatch.fr » se prononce lettre à lettre et syllabe à syllabe, « 1er » devient « premier ». Un moteur de voix à qui l'on donnerait « 30 °C » hésiterait ou lirait « trente C ». Cette étape de préparation remplace chaque forme par ce qu'elle doit devenir à l'oreille.
Chez nous, cette préparation produit deux textes à la fois, et c'est un choix que beaucoup d'outils négligent. Le premier, celui qui part vers le moteur, dit « trente degrés ». Le second, celui qui reste affiché sous le lecteur, garde « 30 °C », c'est-à-dire la graphie du journaliste. Nous avons corrigé en septembre un défaut exactement là-dessus : le texte préparé pour la machine se retrouvait parfois affiché à la place du vrai texte, et un lecteur voyait écrit « esse enne cé effe » au lieu de « SNCF ». Ce que la machine entend et ce que le lecteur voit sont deux choses, et elles doivent rester séparées.
Le lexique : ce qu'aucune règle ne devine
Après la préparation générale vient une étape que personne ne peut automatiser complètement : les noms propres. « Ploërmel » se dit « Plo-air-mel », et aucune règle de lecture du français ne le devine. Il faut connaître la commune. C'est là qu'intervient le lexique de prononciation, où un éditeur note une fois pour toutes comment se disent les noms que le moteur écorche, et ce réglage vaut ensuite pour tous ses articles suivants. Cette part du travail est la moins imitable d'un outil vocal, et c'est aussi la raison pour laquelle on peut corriger une prononciation sans tout régénérer.
Un détail honnête à ce sujet : nous avons un jour écouté soixante et onze cas de lecture difficiles, un par un. Le moteur brut en tenait vingt-quatre tout seul, sans aucune aide. Autrement dit, les voix récentes sont déjà bonnes sur beaucoup de cas, et la tentation serait d'en conclure qu'il n'y a rien à faire. C'est faux : ce sont justement les cas restants, les noms de lieux, les sigles maison, les mots rares, qui décident si un article s'écoute jusqu'au bout ou agace au troisième paragraphe.
Les règles de lecture du français
Vient ensuite la lecture proprement française : les liaisons, les consonnes finales muettes, l'accentuation en fin de groupe. Ces règles ne se déduisent pas de l'orthographe, elles se connaissent. C'est ce travail qui sépare une voix qui a appris le français d'une voix multilingue qui le devine, et qui explique pourquoi une voix française sonne parfois anglaise : un modèle calé sur l'anglais applique les mauvais réflexes. La liaison reste l'épreuve la plus dure, parce qu'elle dépend du sens et pas seulement des lettres.
C'est précisément ce que défend notre page text to speech français : lire une langue, ce n'est pas enchaîner des sons, c'est appliquer ses règles. Le moteur de voix fournit le timbre et le naturel ; la préparation et le lexique fournissent la justesse. Les deux comptent, mais ils ne font pas le même métier.
Le moteur, puis le recollage
Le texte ainsi préparé est enfin envoyé au moteur neuronal, qui produit le fichier audio. Si l'article demandait un calage mot à mot, pour surligner le texte au fil de la lecture, les positions des mots sont rendues par la machine sur le texte transformé, puis recollées sur le texte affiché. C'est pour cela qu'un horodatage doit tenir compte des substitutions faites en amont : « trente degrés » dure plus longtemps à dire que « 30 °C » n'occupe de place à l'écran.
Ce qu'il faut retenir
La synthèse vocale moderne n'est donc pas une boîte unique, mais une chaîne : préparer le texte, appliquer le lexique du client, appliquer les règles du français, produire le son, recoller ce qui doit l'être. Le moteur de voix, celui dont on parle le plus, n'est qu'un maillon. Quand un outil déçoit, ce n'est presque jamais la faute du timbre, qui est aujourd'hui excellent partout : c'est la préparation qui manque, ou le lexique qui n'existe pas. Un bon moyen de juger un outil est donc de lui donner non pas une belle phrase de démonstration, mais vos propres cas difficiles : un nom de commune, un sigle, une date, un montant. C'est là que la chaîne se révèle, ou se brise.
Sonorisez vos articles avec WeDispatch
Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?
Demandez une démo