Lexique

Voix neuronale

Une voix neuronale est générée par un réseau de neurones entraîné sur de la parole humaine. Sa prosodie la rend difficile à distinguer d'un narrateur.

Une voix neuronale est une voix de synthèse produite par un modèle d'apprentissage profond, par opposition aux anciennes voix concaténatives assemblées à partir de fragments enregistrés. La différence s'entend immédiatement, et elle tient à un mot : la prosodie.

La prosodie, ou pourquoi on ne les reconnaît plus

La prosodie regroupe tout ce qui, dans la parole, ne relève pas des mots eux-mêmes : le rythme, les pauses, la mélodie de la phrase, les variations d'intensité. Un lecteur humain ralentit avant une information importante, marque une respiration après une citation, monte légèrement en fin de question. Les anciennes synthèses ignoraient tout cela ; les modèles neuronaux l'ont appris en s'entraînant sur des milliers d'heures de parole naturelle.

Résultat : le modèle ne prononce pas des mots les uns après les autres, il interprète une phrase. Il distingue une énumération d'une incise, une citation du texte qui l'entoure. C'est ce qui explique qu'un auditeur qui découvre un article audio bien produit ne se demande souvent plus s'il écoute un humain ou une machine. Nous avons consacré un article de blog à ce basculement : pourquoi on ne reconnaît plus les voix de synthèse.

Ce qui compte pour une rédaction

Toutes les voix neuronales ne se valent pas sur du texte de presse. Trois critères font le tri. La tenue sur la longueur, d'abord : une voix convaincante sur deux phrases peut devenir monotone sur un article de 4 000 signes. Le français, ensuite : liaisons, noms propres locaux, sigles administratifs, chiffres. La stabilité, enfin : le ton doit rester le même d'un article à l'autre, car la voix devient une signature sonore du titre.

C'est ce dernier point qui ouvre sur le clonage : une rédaction peut faire de la voix d'un de ses journalistes un modèle neuronal dédié, sa voix signature, avec les précautions juridiques que cela impose.

Termes liés

  • Synthèse vocale : La synthèse vocale transforme un texte écrit en parole. Les modèles neuronaux récents produisent des voix quasi indiscernables d'une voix humaine.
  • Voix signature : Une voix signature est la voix clonée d'un journaliste ou d'une rédaction, utilisée avec son autorisation écrite pour lire les articles du titre.

Donnez une voix à vos articles

WeDispatch transforme automatiquement vos articles en version audio, dès la publication. Essayez gratuitement sur vos propres articles : tester sans carte bancaire.

Demander une démo