Corriger une phrase dans un audio déjà généré, sans tout refaire
Une coquille, un prénom écorché, une info de dernière minute : comment reprendre un seul passage d'un article sonorisé sans régénérer l'ensemble, ce que ça coûte exactement, et pourquoi la coupe ne s'entend pas.
En audio classique, la moindre correction oblige à tout refaire. Un prénom mal prononcé, un chiffre erroné, une info qui tombe après publication : reprendre le passage suppose de réenregistrer l'article entier, ou de relancer une synthèse complète. C'est lent, c'est facturé au prix d'un article neuf, et le résultat est connu : bien souvent, la faute reste à l'antenne parce que la refaire n'en vaut pas la peine. Une rédaction qui publie vite finit par vivre avec ses coquilles audio.
Le problème n'est pas la qualité de la voix, c'est l'unité de travail. Tant que l'unité est « l'article », toute retouche coûte un article. La correction ciblée change l'unité : elle ne reprend que le passage que vous réécrivez, et laisse le reste intact au bit près.
Le mécanisme, décrit assez précisément pour être vérifié
Le point de départ est une propriété que peu d'outils exposent : l'audio généré est horodaté mot à mot. Chaque mot du transcript connaît sa position exacte dans le fichier. C'est ce qui rend le reste possible, et c'est le même socle que le surlignage synchronisé ou le partage d'un extrait à la seconde près.
La reprise se fait en trois gestes. D'abord, vous sélectionnez le passage à corriger dans le transcript, en cliquant le premier et le dernier mot ; grâce aux horodatages, l'outil récupère la portion audio exacte qui leur correspond. Ensuite, un champ se pré-remplit avec le texte actuel du passage : vous le corrigez, et seul ce passage sera resynthétisé, avec exactement la même voix et les mêmes réglages que le reste de l'article. Enfin, le nouveau segment est réinséré à la place de l'ancien, sur une frontière silencieuse de la voix, à la trame près. À l'écoute, il n'y a ni clic, ni raccord, ni changement de timbre : le reste de l'audio n'a pas bougé, parce qu'il n'a pas été régénéré.
Cette logique du « ne recalculer que ce qui change » est celle qui gouverne l'ensemble de la préparation d'un article, décrite sur la page text to speech français. Une correction n'est qu'un cas particulier : le plus petit changement possible, traité comme tel.
Ce que ça coûte, sans arrondi flatteur
La synthèse vocale se paie au caractère, et une correction ne fait pas exception, mais elle ne paie que les siens. La règle est simple : mille caractères font un crédit. Reprendre un prénom de vingt caractères coûte donc deux centièmes de crédit, et corriger dix mots dans un article de mille en coûte l'équivalent de ces dix mots, pas le prix de l'article. Ce n'est jamais gratuit, et ce n'est jamais le tarif d'une génération complète.
Deux garde-fous encadrent la dépense. Le coût est affiché pendant que vous tapez, avant tout débit, arrondi au centième supérieur, et il demande une confirmation explicite : aucun script ne peut dépenser à votre place. Et l'ancienne version continue d'être servie jusqu'à ce que la nouvelle soit prête, si bien qu'une correction en cours ne laisse jamais un article muet. À titre de comparaison, une régénération complète, elle, se facture comme une génération : un crédit par millier de caractères entamé. Le détail du calcul d'un article entier est dans combien coûte une version audio d'article.
Quand la correction ciblée, et quand la régénération
Les deux gestes coexistent, et le bon dépend de l'ampleur du changement. La correction ciblée est faite pour la retouche : une coquille, un nom propre écorché, un sigle mal lu, un chiffre qui change, une phrase reformulée. Elle est prête en quelques secondes, sans file d'attente, ce qui compte pour une dépêche ou une actualité chaude corrigée dans la minute.
La régénération reste la bonne réponse quand l'article a été profondément réécrit, quand vous changez de voix, ou quand la structure a bougé au point que recoudre n'aurait plus de sens. Le cas d'un article corrigé après publication sur un site WordPress, et de ce qui déclenche l'une ou l'autre, est traité dans régénérer l'audio d'un article mis à jour.
Un dernier réflexe évite de corriger deux fois la même chose. Si un nom, une marque ou une formule revient dans plusieurs de vos contenus et se lit mal partout, la retouche au coup par coup n'est pas la bonne échelle : le lexique de prononciation fixe la prononciation attendue une fois, et elle s'applique aux articles à venir sans que vous ayez à y repasser.
Ce que ça change dans une rédaction
Pour une équipe qui publie vite et corrige souvent, l'intérêt n'est pas seulement le coût, c'est le seuil de décision. Quand reprendre une faute coûte un article et prend le temps d'une régénération, on laisse passer. Quand ça coûte deux centièmes de crédit et prend quelques secondes, on corrige. La correction ciblée s'inscrit d'ailleurs dans le circuit de validation avant publication : un relecteur peut reprendre un passage douteux avant d'approuver, comme le décrit relire l'audio avant de publier, et la publication programmée est respectée, l'audio approuvé ne partant qu'à son heure.
Nous préférons le dire ainsi plutôt que de promettre une machine qui ne se trompe jamais. Elle se trompe parfois, comme toute lecture ; ce qui compte, c'est que la reprise soit assez rapide et assez peu coûteuse pour qu'on la fasse vraiment, au lieu de vivre avec la faute.
Sonorisez vos articles avec WeDispatch
Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?
Demandez une démo