Écouter un long texte en synthèse vocale : la fatigue d'écoute, et ce qui aide vraiment
Au-delà d'un quart d'heure, l'oreille décroche. Les seuils où un texte long est signalé avant de lancer, le résumé parlé, et le découpage en épisodes et en chapitres, décrits à partir de ce qui est réellement implémenté.
Lire un article de mille mots à voix haute, c'est facile. Écouter un rapport de soixante pages d'une seule traite, c'est autre chose. Au-delà d'un certain point, l'oreille décroche : non pas parce que la voix est mauvaise, mais parce qu'une écoute longue sans repère, sans respiration entre les parties, sans savoir où l'on en est, épuise l'attention. La question n'est donc pas seulement « la voix est-elle bonne ? » mais « qu'est-ce qui, dans l'outil, rend un texte long réellement écoutable ? ». Voici ce qui est en place, et ce qui ne l'est pas, dit à partir du code.
Un texte long se signale avant de lancer
Le premier geste utile n'est pas technique, il est d'information. Trois fabrications sur treize qui échouaient chez un client avaient un point commun : des articles de plus de trente-huit mille caractères, que rien à l'écran ne distinguait d'un article de mille mots. Le coût en crédits se lisait, mais pas la durée d'écoute ni le risque. Depuis, deux seuils sont affichés avant de générer.
À partir d'environ quinze mille caractères, soit un quart d'heure d'écoute, l'écran annonce la durée et, si votre compte y a droit et ne l'a pas activé, propose le résumé parlé. L'idée est simple : personne n'écoute vingt minutes sans savoir de quoi il retourne. Donner l'essentiel en trente secondes, en tête du lecteur, laisse l'auditeur décider s'il poursuit. C'est ce que détaille notre article sur le résumé audio avant l'article complet.
Au-delà de cent mille caractères, le message change de nature : le texte est trop long pour un seul audio, parce que la taille maximale d'un fichier approche et que le texte lu est plus long que le texte affiché (« 1914 » se dit « mille neuf cent quatorze », donc gonfle le compte). L'écran propose alors de couper en deux, ou de retirer des passages. Le bouton est grisé exactement là où la génération refuserait, avec la raison : pas de mauvaise surprise au lancement.
Le découpage en épisodes, pour les documents vraiment longs
Un article de site tient dans un audio. Un document reçu (un rapport, un mémoire, un PDF de soixante pages) n'y tient pas, et deux heures et demie d'un bloc ne s'écoutent de toute façon pas dans les transports. Pour ces cas, l'écoute privée découpe le document en épisodes, et la logique mérite d'être connue parce qu'elle vise directement la fatigue d'écoute.
La cible est d'environ trente minutes par épisode, calée sur un débit réel de lecture (autour de mille cent cinquante caractères par minute). Le découpage ne tombe jamais au milieu d'un mot : il cherche d'abord une fin de paragraphe, à défaut une fin de phrase, près de la cible. Un document qui tient dans un seul épisode reste d'un seul tenant ; dès qu'il y en a plusieurs, chacun porte sa position, « (2/5) », pour qu'on sache où l'on en est.
Les chapitres, quand le document en a
Mieux qu'une coupe au métronome : couper là où l'auteur a lui-même coupé. Quand un document porte des chapitres, le découpage les suit. Il reconnaît un titre à sa forme : un mot-clé suivi d'un numéro (« Chapitre 3 », « Partie II », « Section 1 »), une numérotation en tête de ligne (« 1. Introduction »), un numéro romain, ou une ligne courte en capitales. Un chapitre trop long est recoupé à son tour en tranches d'une demi-heure ; des chapitres trop courts sont regroupés, pour ne pas multiplier les épisodes d'une minute. Le résultat est une écoute qui respire, avec des repères aux bons endroits, exactement comme on retrouve un passage grâce aux chapitres et au lien horodaté.
Cette mécanique est celle de l'écoute privée des documents, celle qui transforme une pile de textes en file d'écoute, comme nous l'expliquons à propos d'écouter ses articles et ses PDF comme une radio. C'est là qu'elle sert le plus : un long document personnel devient une série d'épisodes qu'on écoute à son rythme.
Ce qui reste du ressort de la langue
Le découpage aide, mais il ne fait pas tout. Une écoute longue dépend aussi de ce qui se passe à l'intérieur de chaque phrase : un débit tenable, des pauses justes sur la ponctuation, une lecture qui ne bute pas sur un sigle ou un nombre toutes les dix lignes. C'est le travail de fond sur le text to speech français, et il compte double sur un texte long : un défaut qu'on pardonne sur deux minutes devient insupportable sur trente. Un long texte bien écouté, c'est donc deux choses ensemble : un découpage qui donne des repères, et une lecture qui ne fatigue pas en soi. L'un sans l'autre ne suffit pas.
Sonorisez vos articles avec WeDispatch
Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?
Demandez une démo