← Blog · 11 septembre 2026 · Read in English

Sonoriser un article sans qu'aucune IA ne réécrive le texte

Beaucoup de rédactions ont une charte qui interdit tout contenu généré par IA. Comment produire une version audio dans ce cadre : un texte lu tel qu'il a été écrit, préparé par des règles et non par un modèle de langage.

Une rédaction nous a posé la question sans détour : « Est-ce exactement le même texte, à la virgule près, qui est lu ? Je n'en sais rien. » La remarque était juste, et elle touche un point que beaucoup d'outils audio préfèrent ne pas éclaircir. Entre l'article que vous publiez et la voix qui le lit, il se passe souvent une étape invisible : un modèle de langage « prépare » le texte. Et un modèle, par nature, peut déplacer un mot, arrondir un chiffre, lisser une tournure. Pour une charte rédactionnelle qui interdit tout contenu généré par IA, ce n'est pas un détail, c'est une ligne rouge.

Ce que « préparer le texte » veut dire, et où est le risque

Avant d'être lu à voix haute, un article passe par un nettoyage. Il faut retirer les crédits photo, les « à lire aussi », les mentions de partage, tout ce qui est écrit pour l'oeil et n'a aucun sens à l'oreille. Beaucoup de solutions confient ce travail à un modèle de langage, avec une consigne du type « tu ne réécris pas, tu prépares la lecture ». Le problème est que la consigne est un voeu, pas une garantie : la sortie reste produite par un modèle.

Nous l'avons mesuré, sur un article de contrôle de dix lignes passé par un modèle. Résultat : « en un an » rendu « en an » (un mot supprimé), un numéro de téléphone amputé de sa dernière paire de chiffres, une unité transformée en faute qui n'existait pas dans l'original. Rien de dramatique isolément, mais impossible à prévoir et impossible à garantir. Pour un média qui signe ses articles, c'est précisément l'inverse de ce qu'il vend à ses lecteurs.

Le mode où aucun modèle ne touche le texte

WeDispatch propose donc un chemin où le texte ne part chez aucun modèle de langage. Il n'y a plus qu'un moteur de voix au bout de la chaîne, et entre les deux, uniquement des règles. Le texte lu est celui du journaliste, transformé seulement par des transformations lisibles, testables, dont la liste tient sur un écran : retirer les lignes qui n'ont pas de sens à l'oral, rétablir quelques accents sûrs, et lire correctement les nombres, les dates, les heures, les scores, les pourcentages, les unités et les monnaies.

Ce dernier point est le coeur du sujet, et c'est un travail de langue, pas d'intelligence artificielle. Dire « 1 200 » c'est « mille deux cents », « 15 h 30 » c'est « quinze heures trente », « 3,5 % » c'est « trois virgule cinq pour cent » : chaque forme a une lecture attendue, et nous la produisons par des règles déterministes plutôt qu'en espérant qu'un modèle la devine. C'est exactement le sujet de notre article sur la lecture des nombres à voix haute, et c'est aussi la raison pour laquelle nous tenons ce parti pris de qualité à la française : bien lire une langue plutôt que mal en lire trente.

Ce que ce mode vous fait gagner, et ce qu'il vous coûte

Le gain est net : vous pouvez répondre oui à la question de départ. C'est le même texte, à la virgule près, et vous pouvez le prouver, parce que chaque transformation appliquée est journalisée. Rien n'est réécrit, rien n'est inventé, rien ne sort d'un modèle. Pour une charte qui interdit l'IA générative, la version audio devient enfin compatible avec la règle maison.

Le coût, il faut le dire franchement, existe. Développer un sigle à sa première occurrence, transformer « l'ARS » en « l'Agence régionale de santé », demande de comprendre le texte : c'est hors de portée d'une règle. Dans ce mode, les sigles ne sont donc pas développés automatiquement. C'est le prix de l'exactitude, et c'est à vous de choisir, pas à nous de choisir pour vous. Quand un sigle revient et doit toujours se dire de la même façon, la réponse reste le lexique de prononciation, qui vaut pour tout le site et ne dépend d'aucun modèle.

Voir avant de dépenser

La bonne façon de travailler ce genre de contrainte n'est pas de faire confiance sur parole, c'est de regarder. Avant qu'un crédit soit dépensé, vous pouvez voir comment un article va se dire : quelles lignes ont été retirées, comment chaque nombre et chaque unité seront prononcés. Un passage qui vous gêne se corrige en amont, une fois, pour toute la rédaction. C'est le même esprit que notre article sur les sigles et acronymes : on ne cache pas là où la lecture achoppe, on le montre et on donne le geste pour le régler.

Ce qu'on ne prétend pas

Nous ne prétendons pas que ce mode lit tout mieux qu'un modèle bien réglé. Un modèle sait développer un sigle, deviner un contexte, réparer une phrase bancale ; une règle ne le sait pas et ne le saura pas. Ce que ce mode garantit, c'est autre chose, et c'est ce qu'une charte exige : l'assurance qu'aucune machine n'a réécrit le travail du journaliste. Pour beaucoup de médias, cette assurance vaut plus qu'un sigle développé, parce qu'elle est la condition pour que l'audio existe du tout. Le reste, la prononciation d'un nom propre, la lecture d'un mot rare, se règle à la main, et c'est justement ce contrôle qu'ils étaient venus chercher.

Sonorisez vos articles avec WeDispatch

Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?

Demandez une démo

À lire aussi