Une voix off pour votre podcast, sans studio
Intro, jingle, épisode narré, version audio d'un article : la voix de synthèse couvre tout ce qui, dans un podcast, n'a pas besoin d'être improvisé. Voici comment l'écrire, la produire et l'intégrer à vos épisodes.
Intros, outros et jingles
Le générique est la partie la plus réécrite d'un podcast et la moins agréable à réenregistrer. Avec une voix IA, vous figez une intro propre en une génération, vous la déclinez par saison en changeant une phrase, et vous produisez l'outro, le rappel d'abonnement ou la lecture du sponsor dans la même voix. Une intro de vingt secondes fait environ 300 caractères : la règle de comptage est simple, espaces et ponctuation compris.
Épisodes narrés et articles audio
Certains formats sont entièrement écrits : chroniques, récits, résumés d'actualité, versions audio d'une newsletter ou d'un blog. Ils se prêtent parfaitement à une narration synthétique régulière, publiée à heure fixe sans contrainte d'enregistrement. Le fonctionnement du moteur et ses limites sont décrits sur la page générateur de voix IA ; pour la lecture de textes longs en général, voyez le text to speech en français.
Mélanger narrateur synthétique et voix humaines
Le mélange fonctionne quand les rôles sont clairs : la voix IA porte le cadre (générique, transitions, encadrés, lecture de questions d'auditeurs), les hôtes portent la conversation. Choisissez une voix dont le timbre contraste avec celui des animateurs pour que l'oreille identifie tout de suite qui parle. Marie Neutre, en français, et Paul Neutral ou Jane, en anglais, tiennent la durée sans fatiguer ; les extraits sont sur la page des voix, tous sur le même texte pour comparer.
Écrire pour l'oreille
Un texte lu n'est pas un texte écrit. Phrases courtes, un sujet par phrase, verbes au présent, mots concrets. Lisez votre script à voix haute avant de le générer : si vous manquez de souffle, la voix aussi. La ponctuation est votre table de mixage, un point marque une vraie pause, une virgule une respiration, des points de suspension un ralentissement. Les sigles courants sont lus comme on les prononce ; testez les termes rares avec l'essai gratuit, deux phrases sans compte.
Longueur d'épisode et limite par génération
Une génération couvre 1 500 caractères, soit environ une minute et demie. Un épisode narré de dix minutes se produit donc en sept ou huit générations enchaînées, dans votre studio, avec la même voix : découpez par séquence, nommez les fichiers dans l'ordre, puis assemblez dans votre logiciel de montage. L'historique conserve chaque fichier 90 jours (voir la durée de conservation), le temps de finaliser l'épisode.
Niveau sonore et export
Exportez en MP3 pour la distribution et en WAV quand vous mixez avec des voix humaines ou de la musique : le WAV supporte mieux les traitements. Normalisez l'ensemble à la cible habituelle des plateformes d'écoute, posez la musique de générique plusieurs décibels sous la voix et laissez une demi-seconde de silence avant la première phrase. Les mêmes réflexes valent pour la vidéo, détaillés dans le guide voix off pour YouTube.
Prévenir vos auditeurs
Dites-le simplement, dans la description de l'émission ou dans l'intro : « narration générée par une voix de synthèse ». Le règlement européen sur l'IA exige cette information lorsqu'un contenu synthétique pourrait être pris pour authentique, et vos auditeurs apprécient la transparence. Chaque MP3 porte en outre un marquage technique dans ses métadonnées.
Combien ça coûte
Un segment narré de dix minutes, soit environ 10 000 caractères, revient à 0,90 € avec le pack de 100 000 caractères à 9 €, valable douze mois. Un podcast hebdomadaire entièrement narré tient dans l'abonnement Medium à 14,99 € par mois pour 200 000 caractères ; les générique seuls se contentent du pack. Tout est détaillé sur la page des tarifs, et l'usage commercial, sponsors compris, est inclus avec les crédits payants comme l'indique la FAQ sur les droits. Pour les formats courts dérivés de vos épisodes, voyez la voix IA pour TikTok et Reels ; pour des contenus pédagogiques, la voix off pour e-learning.