Lexique

Horodatage mot à mot

L'horodatage mot à mot associe chaque mot du texte à sa position exacte dans l'audio. C'est la base du surlignage, des citations et des chapitres.

L'horodatage mot à mot (word-level timestamps) est la donnée qui associe chaque mot d'un texte à l'instant précis où il est prononcé dans le fichier audio correspondant : le mot « municipal » commence à 42,3 secondes et finit à 42,9 secondes, par exemple. Invisible pour l'utilisateur, cette couche de données est ce qui transforme un simple fichier MP3 en contenu audio manipulable.

D'où viennent les timestamps

Deux origines possibles. Sur un enregistrement humain, il faut aligner a posteriori le texte et l'audio par reconnaissance vocale, avec une précision imparfaite. Sur un audio généré par synthèse vocale, le système sait exactement quand il prononce chaque mot puisque c'est lui qui produit le signal : les timestamps sont exacts par construction, sans traitement supplémentaire. C'est un avantage structurel de l'audio généré depuis le texte sur l'audio enregistré.

Ce que les timestamps permettent

Tout ce qui suppose de relier un point du texte à un point du son en dépend. Le surlignage du texte synchronisé, qui suit la voix mot après mot. Les sous-titres, dont chaque ligne doit apparaître au bon moment. Le partage de citations audio : sélectionner une phrase de l'article et obtenir l'extrait sonore exact correspondant, prêt à circuler sur les réseaux sociaux, comme le propose la fonctionnalité de citations audio. Les chapitres, qui permettent de lier une seconde précise de l'écoute (le début de chaque intertitre, par exemple) et de partager un lien qui démarre à cet endroit. Ou encore l'insertion publicitaire en milieu d'article, qui doit viser une fin de paragraphe et non un point arbitraire du fichier.

La leçon pour un éditeur qui compare des solutions audio : la qualité de la voix est ce qu'on entend, mais la richesse des données temporelles est ce qui conditionne tout ce qu'on pourra construire ensuite. Un audio sans timestamps est un fichier fermé ; un audio horodaté mot à mot est une matière première.

Termes liés

  • Texte synchronisé : Le texte synchronisé surligne chaque mot de l'article au moment où la voix le prononce. L'utilisateur lit et écoute en même temps.
  • Sous-titres automatiques : Les sous-titres automatiques sont des fichiers SRT ou VTT générés depuis l'audio, qui affichent le texte au bon moment dans les vidéos et players.
  • Midroll : Le midroll est un message publicitaire inséré en cours d'écoute, idéalement à une frontière de paragraphe pour ne pas casser la lecture.

Donnez une voix à vos articles

WeDispatch transforme automatiquement vos articles en version audio, dès la publication. Essayez gratuitement sur vos propres articles : tester sans carte bancaire.

Demander une démo