← Blog · 9 octobre 2026 · Read in English

Lire une interview à voix haute : les questions, les réponses, et deux voix

Une interview ne se lit pas comme un article suivi. L'intonation des questions en série et la distinction entre celui qui interroge et celui qui répond : ce qu'une synthèse vocale française en fait, et où elle s'arrête.

L'interview est un des formats les plus courants de la presse, et un des plus particuliers à l'oreille. Un article suivi a un seul fil, une seule voix implicite, celle du journaliste. Une interview en a deux qui se répondent, et elle avance par une mécanique propre : une question, une réponse, une relance, une autre réponse. Transposée en audio sans soin, elle devient un bloc où l'on ne sait plus qui parle ni quand une question commence. Deux difficultés se cachent là, et elles n'ont pas la même réponse : la mélodie des questions, et la distinction des deux interlocuteurs.

Une interview n'est pas un article comme un autre

Dans un article classique, l'intonation monte et descend au gré des phrases, mais le registre reste stable. Dans une interview, le texte alterne deux régimes toutes les quelques lignes : une question, souvent courte et tendue vers une réponse, puis un développement qui peut durer un paragraphe. Une voix de synthèse qui lit tout sur le même ton efface cette alternance, et l'auditeur perd le rythme du dialogue. Rendre une interview écoutable, ce n'est donc pas seulement bien prononcer les mots : c'est restituer le fait qu'il y a un échange.

Les questions, d'abord : l'intonation en série

Le premier travail porte sur les questions. En français, une question se reconnaît à la montée de la voix en fin de phrase, et le signal qui déclenche cette montée est le point d'interrogation. Dans une interview, les trois tournures interrogatives se côtoient souvent dans la même page, et elles n'appellent pas la même courbe.

| Forme écrite | Ce qui signale la question | Intonation attendue |
|--------------|----------------------------|---------------------|
| Pensez-vous revenir ? | l'inversion du sujet et du verbe | montée franche sur la dernière syllabe |
| Est-ce que le budget suffira ? | la locution « est-ce que » en tête | montée modérée, posée dès le début |
| Et après ? | rien, sauf le point d'interrogation | montée nette, portée par le seul signe |

La troisième ligne est la plus fragile, et la plus fréquente dans un entretien vivant : les relances courtes (« Et ensuite ? », « Vraiment ? ») ne tiennent que par leur point d'interrogation. Notre moteur le prend pour signal principal, donc ces relances montent correctement, à une seule condition, qui est le rappel le plus utile de cet article : que le point d'interrogation soit bien écrit. Une relance saisie sans son point sera lue comme une affirmation plate. C'est le même parti pris que celui défendu sur la page text to speech français : bien lire une langue, c'est retrouver ce qu'un lecteur humain fait sans y penser, pas déchiffrer des lettres. Le détail des trois formes et de leurs limites est traité à part dans l'article sur l'intonation des questions.

Deux voix, mais à une condition

Vient la question que tout éditeur pose : peut-on donner une voix à celui qui interroge et une autre à celui qui répond ? Oui, et le mécanisme est le même que pour les dialogues écrits. Une interview mise en forme ligne par ligne, où chaque prise de parole commence par un nom suivi de deux-points (« Dupont : nous avons tranché »), est reconnue comme un dialogue. À condition que le compte ait déclaré ses personnages et la voix de chacun, la ligne attribuée est lue par la voix du personnage jusqu'au bout, et le nom en tête reste sur la voix du corps, comme une simple attribution. Vous réglez ces attributions une fois, dans les règles de voix, et l'entretien gagne son relief.

Quand l'interview n'est pas mise en forme ainsi, mais écrite au fil du texte avec les réponses entre guillemets, c'est la logique des citations qui s'applique : la parole entre chevrons bascule sur une seconde voix, le reste garde celle du journaliste. Les deux chemins sont décrits dans l'article sur les plusieurs voix d'un article.

Ce que l'outil ne devine pas

L'honnêteté commande de dire où la machine s'arrête. Sans personnages déclarés et sans mise en forme reconnaissable, l'outil ne devine pas qui parle : il lit tout d'une seule voix, et c'est le bon choix, car inventer une attribution fausse s'entend immédiatement. Les questions restent correctement intonées grâce à leur ponctuation, mais la distinction des deux interlocuteurs, elle, demande le geste décrit plus haut.

Deux nuances échappent encore à la lecture automatique. La question rhétorique (« Faut-il vraiment le rappeler ? »), qui n'attend pas de réponse, appelle une intonation moins montante que le moteur ne sait pas distinguer d'une vraie question. Et l'ironie d'une réponse, le sous-entendu d'une relance, ne se jouent pas : un entretien ne se « joue » pas comme une scène. Ce qui est rendu, c'est la structure de l'échange et la mélodie des questions ; le reste est une approximation que nous préférons annoncer plutôt que promettre.

Le geste qui met l'interview en relief

En pratique, deux réglages suffisent. Mettez l'interview en forme avec un nom et deux-points en tête de chaque prise de parole, puis déclarez dans les règles de voix la voix de l'intervieweur et celle de l'invité. Les relances courtes gardent leur point d'interrogation, et la lecture restitue alors ce qu'une interview a de vivant : deux personnes qui se répondent, chacune reconnaissable à l'oreille. Pour un nom propre dont la prononciation ne va pas de soi, le lexique de prononciation fixe la lecture une fois pour toutes, et l'invité est nommé correctement d'un bout à l'autre de l'entretien.

Sonorisez vos articles avec WeDispatch

Ce blog sera lui-même sonorisé par WeDispatch. Envie de voir ce que ça donne sur vos contenus ?

Demandez une démo

À lire aussi