← Blog · 6 octobre 2026 · Read in English

Cahier des charges pour une synthèse vocale : ce qu'il faut exiger dans un appel d'offres

Une collectivité ou un média qui lance un marché pour sonoriser ses contenus écrit souvent « voix naturelle » et rien d'autre. Voici les exigences qui se vérifient, et notre réponse à chacune, y compris là où nous répondons non.

Quand une collectivité, un média ou une institution lance un appel d'offres pour mettre ses contenus en audio, la qualité de ce qu'elle obtient dépend d'abord de ce qu'elle a su demander. Un cahier des charges qui se contente de « voix naturelle et agréable » n'engage personne : c'est invérifiable, et deux prestataires répondront « oui » sans mentir ni se ressembler. Les exigences utiles sont celles qu'un candidat peut prouver et qu'un évaluateur peut contrôler. En voici cinq, avec la réponse que nous y apportons nous-mêmes, limites comprises. Une grille vaut mieux quand celui qui la tend accepte d'y passer en premier.

1. L'accessibilité du lecteur, pas seulement de la voix

Ajouter de l'audio ne rend pas un site accessible si le lecteur lui-même ne l'est pas. L'exigence à écrire : le composant de lecture doit être utilisable au clavier seul, annoncé correctement par un lecteur d'écran, avec un focus visible, un contraste suffisant et le respect du réglage « animations réduites ». Demandez au candidat de citer les critères du référentiel qu'il vérifie, et comment.

Notre réponse : le lecteur est pensé pour ces critères, et nous détaillons lesquels dans notre article sur le lecteur audio accessible et les critères du RGAA. Là où nous ne promettons rien au-delà du réel : un lecteur accessible posé sur une page qui ne l'est pas ne rend pas la page conforme. L'audio est une brique, pas un label.

2. L'hébergement et le trajet du texte

Pour un acteur public, savoir où part le texte et pour combien de temps n'est pas une option. L'exigence : le candidat doit décrire le trajet d'un texte envoyé à son service, le lieu de traitement, et la durée de conservation effective.

Notre réponse : nous écrivons ce trajet noir sur blanc, hébergement compris, dans où vont les données, et c'est exactement le genre de question que nous traitons sur notre page text to speech en français. Nous ne prétendons pas être le choix de tout le monde : une organisation soumise à une contrainte d'hébergement très particulière doit confronter notre trajet au sien, et conclure elle-même.

3. La réversibilité, qu'on oublie à la signature

C'est l'exigence la plus négligée, et c'est celle qui coûte le plus cher quand elle manque. Il faut écrire noir sur blanc ce que le prestataire rend au départ du contrat : les fichiers audio produits, les textes, et ce que devient un flux de podcast auquel des auditeurs sont déjà abonnés.

Notre réponse : un client qui part emporte ses fichiers et ses textes, et son flux reste un flux standard, lisible par les plateformes sans passer par nous. Nous n'allons pas détailler ici un cas qui mérite son propre article, mais la règle que nous suivons est simple : ce que vous avez produit est à vous. Une exigence de réversibilité mal écrite transforme un changement de prestataire en reprise à zéro, et c'est le genre de piège qui ne se voit qu'au moment de partir.

4. Le prix au caractère, et ce qu'il recouvre

La synthèse vocale se facture au volume de texte, pas au nombre d'articles ni au mois forfaitaire. L'exigence : demandez un prix rapporté au caractère ou au signe, et demandez ce qui est compté (une régénération après correction est-elle refacturée ? une relecture partielle ?). C'est là que les offres se départagent vraiment.

Notre réponse : nous facturons au volume, et le coût s'affiche avant la fabrication, en durée d'écoute et en crédits, jamais après. Le détail du calcul et des cas limites est dans combien coûte la version audio d'un article. Nous ne communiquons pas un prix au million de caractères dans un article de blog, parce qu'un barème se lit sur la page des tarifs, à jour, pas dans un billet qui vieillira.

5. La prononciation, et le droit de la corriger

Une voix qui lit mal un nom propre, un sigle métier ou un terme local dévalue tout le reste. L'exigence : le candidat doit permettre de corriger une prononciation et de la mémoriser, sans régénérer tout l'article à la main à chaque fois.

Notre réponse : un lexique de prononciation permet de trancher un mot une fois et de l'appliquer ensuite, et nous signalons avant la lecture les mots dont la prononciation est douteuse plutôt que de les laisser passer. Ce que nous ne faisons pas : nous ne « jouons » pas un texte comme un comédien. L'ironie, la colère rapportée, le deuil restent hors de portée d'une voix de synthèse, et nous préférons le dire que le promettre.

Ce qu'on en retire

Les cinq exigences se recopient telles quelles dans un cahier des charges : lecteur accessible, trajet du texte documenté, réversibilité écrite, prix au caractère avec ses cas limites, prononciation corrigible. Chacune se vérifie, et c'est tout l'intérêt : elle oblige le candidat à répondre autre chose que « oui, bien sûr ». Un bon appel d'offres ne cherche pas le prestataire qui promet le plus, il cherche celui dont les réponses tiennent quand on les met à l'épreuve, y compris quand la réponse honnête est « non, pas encore ».

Sonorisez vos articles avec WeDispatch

Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?

Demandez une démo

À lire aussi