← Blog · 7 octobre 2026 · Read in English

Synthèse vocale naturelle en français : les cinq défauts qui trahissent encore une machine

Une voix de synthèse française de 2026 ne sonne plus robotique, mais cinq défauts la trahissent encore à l'oreille attentive, et quelques-uns ont bel et bien disparu. Les cinq, avec pour chacun l'endroit où il s'entend encore chez nous, ou la raison pour laquelle il ne s'entend plus.

Les voix neuronales françaises ont franchi un cap : le timbre métallique, la cadence saccadée et l'intonation plate des anciennes synthèses ont largement disparu. Dire qu'une voix « sonne robotique » n'est plus vrai en 2026. Mais « ne plus sonner robotique » n'est pas « être indiscernable d'un humain ». Il reste des défauts, et les connaître sert à deux choses : savoir où relire un audio avant de le publier, et juger un outil sur pièces plutôt que sur sa démo. Voici les cinq qui trahissent encore une machine, dits sans les arranger, et, à la fin, ceux qui ont vraiment disparu. C'est le prolongement de notre travail sur ce que c'est que bien lire le français.

1. La liaison facultative, choisie au hasard

La liaison obligatoire (« les enfants ») et la liaison interdite (« les héros ») sont bien tenues. C'est la liaison facultative qui trahit : « ils ont attendu », « pas encore arrivé ». Un locuteur humain la fait ou ne la fait pas selon le registre, le débit, l'intention, et surtout de façon cohérente dans une même phrase. Une voix de synthèse tranche, mais sans logique de registre : elle peut lier là où un journaliste ne lierait pas, et l'inverse deux phrases plus loin. Ce n'est pas faux, c'est incohérent, et c'est cette incohérence qui s'entend. C'est pourquoi la liaison reste le test le plus dur du français lu par machine : il n'y a pas de bonne réponse unique, donc pas de règle qui la rende parfaite.

2. L'homographe tranché à l'envers

« Les poules du couvent couvent », « il est à l'est », « nous portions les portions ». Un homographe se prononce selon son sens, et son sens se lit dans la phrase. Les voix récentes s'appuient sur le contexte et réussissent la majorité des cas courants, mais elles se trompent encore sur les phrases ambiguës, les tournures rares ou les noms propres homographes d'un verbe. Quand le modèle se trompe, il le fait avec le même aplomb que lorsqu'il a raison, et rien ne signale l'erreur à l'écoute : il faut connaître le texte. C'est le défaut le plus sournois, parce qu'il ne grince pas, il ment. Nous le traitons en détail dans la lecture des homographes.

3. La prosodie qui s'aplatit sur les longues énumérations et les incises

Sur une phrase courte, l'intonation est juste. Sur une phrase à tiroirs, avec trois incises emboîtées et une énumération de six éléments, la mélodie se tasse : chaque élément reçoit le même contour, la hiérarchie entre l'essentiel et l'accessoire se perd. Un lecteur humain ralentit, baisse la voix sur une incise, relance sur la proposition principale. La machine, elle, lit à plat ce qu'un texte mal découpé lui donne à plat. Ce défaut est moins celui de la voix que du texte : il s'atténue nettement quand l'article est écrit pour l'oreille, avec des phrases plus courtes et une ponctuation qui respire.

4. L'émotion rapportée que la voix ne joue pas

Une voix neuronale rend très bien la question et l'exclamation : l'intonation monte, la fin de phrase est juste. Elle ne rend pas l'ironie, la colère rapportée, le deuil, le second degré. « Ah, bravo », dit avec ironie, sera lu comme un compliment sincère. Une citation de quelqu'un qui crie sera lue au même calme que le reste. Ce n'est pas un réglage manquant, c'est une limite de fond : la voix lit le sens littéral, pas l'intention. C'est d'ailleurs voulu pour un article de presse, qui s'informe et ne se joue pas, mais il faut le savoir pour les textes qui vivent de leur ton. Nous développons ce point dans ce que l'émotion d'une voix de synthèse rend, et ne rend pas.

5. Le nom propre rare, prononcé à la lettre

Un nom de lieu peu courant, un patronyme étranger, une raison sociale inventée : la voix applique les règles du français à des mots qui n'y obéissent pas, et le résultat est souvent faux. Ce défaut n'a pas de solution automatique parfaite, parce qu'il n'y a parfois qu'une seule bonne prononciation et qu'elle ne se devine pas. La réponse honnête n'est pas de prétendre que le moteur sait, c'est de le corriger une fois : un lexique de prononciation fixe la forme attendue, et le nom est ensuite dit correctement partout. Tant que personne ne tranche, le défaut reste.

Ce qui, en revanche, ne s'entend plus

Il serait malhonnête de ne lister que les manques. Plusieurs défauts marquants ont disparu. L'accent anglais latent sur les mots courants, dû à des modèles multilingues entraînés surtout en anglais, est le plus spectaculaire : il s'entendait sur des mots simples et il a été corrigé par des modèles réglés pour le français, comme nous l'expliquons dans pourquoi une voix française sonnait anglaise. Le timbre métallique a cédé la place à un grain de voix réaliste. Et l'intonation plate des questions simples, qui montait là où il fallait descendre, est aujourd'hui juste dans l'immense majorité des cas.

La leçon est simple : une voix de 2026 est bonne, pas parfaite, et le progrès a porté sur le son avant de porter sur le sens. C'est pour cela que notre parti pris reste la relecture avant publication, et la correction ciblée là où un mot trahit, plutôt que la promesse d'une machine qui ne se tromperait jamais.

Jugez une voix française sur ces cinq points

Le meilleur test est le vôtre, sur vos propres textes. Essayez sur un article qui contient une liaison facultative, un homographe et un nom propre rare, et écoutez ce que la voix en fait : vous saurez en dix minutes ce qu'une démo ne vous dira jamais.

Sonorisez vos articles avec WeDispatch

Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?

Demandez une démo

À lire aussi