Lexique

Synthèse vocale

La synthèse vocale transforme un texte écrit en parole. Les modèles neuronaux récents produisent des voix quasi indiscernables d'une voix humaine.

La synthèse vocale (ou TTS, pour text-to-speech) désigne l'ensemble des technologies qui transforment un texte écrit en parole audible. Pour une rédaction, c'est la brique qui permet de proposer chaque article en version audio sans mobiliser un studio ni un comédien.

Deux générations de technologie

La première génération, dite concaténative, assemblait des fragments de voix préenregistrés. Le résultat était intelligible mais mécanique : intonation plate, transitions audibles entre les segments, aucune adaptation au sens de la phrase. C'est la voix des anciens GPS et des serveurs vocaux, celle qui a longtemps donné mauvaise réputation à la lecture automatique.

La génération actuelle repose sur des réseaux de neurones entraînés sur de grands volumes de parole naturelle. Le modèle ne colle plus des morceaux : il génère le signal audio en tenant compte du contexte de la phrase entière. Il place les pauses aux endroits attendus, monte sur une question, ralentit sur une incise. Cette capacité à moduler le rythme et l'intonation s'appelle la prosodie, et c'est elle qui fait la différence entre une voix qu'on subit et une voix qu'on écoute. Le sujet est détaillé dans l'entrée consacrée à la voix neuronale.

Ce que cela change pour un titre de presse

Concrètement, une synthèse vocale de qualité éditoriale doit savoir lire un article de presse française : les sigles (SNCF, EPCI), les noms de communes, les nombres, les citations. C'est un travail de préparation du texte autant que de génération audio.

Pour une presse quotidienne régionale, l'enjeu est la couverture : publier des dizaines d'articles par jour rend la narration humaine impossible à généraliser. La synthèse vocale permet de couvrir 100 % de la production, du compte rendu de conseil municipal au portrait du week-end. WeDispatch applique cette approche aux sites de presse, avec un lecteur audio intégré qui se pose sur chaque article. La question n'est plus de savoir si la machine peut lire un texte, mais ce que la rédaction fait de cette capacité : accessibilité, nouveaux usages de lecture, monétisation.

Termes liés

  • Voix neuronale : Une voix neuronale est générée par un réseau de neurones entraîné sur de la parole humaine. Sa prosodie la rend difficile à distinguer d'un narrateur.
  • Lecteur audio intégré : Le lecteur audio intégré est le player qui s'affiche sur la page article et lance la version audio. Il s'installe en une ligne de code ou un plugin CMS.
  • Podcast automatique : Un podcast automatique transforme les articles publiés en épisodes audio diffusés sur Spotify et Apple Podcasts, sans production manuelle.

Donnez une voix à vos articles

WeDispatch transforme automatiquement vos articles en version audio, dès la publication. Essayez gratuitement sur vos propres articles : tester sans carte bancaire.

Demander une démo