Voxtral TTS : ce que change un modèle vocal français et ouvert
12 octobre 2026 · 7 min de lecture · Chiffres vérifiés le 12 octobre 2026
Le 23 mars 2026, Mistral AI a publié Voxtral TTS, son premier modèle de synthèse vocale. Deux choses sortent de l'ordinaire : le laboratoire est français, et les poids du modèle sont téléchargeables. Pour quelqu'un qui produit des voix off, des podcasts ou des modules de formation, cela change le choix de l'outil, le prix de la minute et la façon de lire le droit d'usage. Voici ce qu'il faut retenir, en séparant ce que Mistral affirme de ce qui est vérifié.
Ce que Mistral annonce, noir sur blanc
Les faits ci-dessous viennent de l'annonce officielle et de la page tarifaire de Mistral, consultées le 12 octobre 2026. Voxtral TTS compte environ 4 milliards de paramètres. Il parle neuf langues : anglais, français, allemand, espagnol, néerlandais, portugais, italien, hindi et arabe. Le modèle hébergé s'appelle voxtral-mini-tts-latest et se facture 0,016 $ par tranche de 1 000 caractères, soit 16 $ par million. Il accepte une voix de référence de trois secondes pour imiter un timbre, et annonce une latence de modèle de 70 ms pour un échantillon de dix secondes.
Sur la qualité, Mistral écrit que Voxtral TTS « atteint une naturalité supérieure par rapport à ElevenLabs Flash v2.5 » et « la parité de qualité avec ElevenLabs v3 », avec un taux de préférence de 68,4 % en évaluation humaine. Ce sont les tests du fournisseur, pas une mesure indépendante : au moment où nous écrivons, aucun banc d'essai tiers ne les confirme ni ne les infirme. Le plus simple reste d'écouter le même texte sur plusieurs voix, ce que permet la page des voix, puis l'essai gratuit sur votre propre script.
Poids ouverts ou API : ce n'est pas la même chose
Un modèle « open weights » peut être téléchargé et exécuté sur votre propre machine. Les poids de Voxtral TTS sont sur Hugging Face sous licence CC BY-NC 4.0. Le « NC » signifie « non commercial » : vous pouvez tester, apprendre, produire pour vous-même, mais pas vendre un service ni intégrer le modèle dans un produit payant sans accord avec Mistral. Il faut aussi une carte graphique correcte et quelqu'un qui sait installer un modèle, ce qui n'est pas le cas de la plupart des créateurs.
L'API, elle, est commerciale : vous payez au caractère et vous pouvez publier, monétiser, livrer à des clients. C'est par cette voie que passent les services comme Aievalu. Si vous vous demandez ce qu'un audio généré vous autorise à faire, la réponse courte est dans notre FAQ sur les droits d'usage ; la réponse longue dépend de la chaîne : poids non commerciaux d'un côté, API et services licenciés de l'autre.
Pourquoi un laboratoire français change l'oreille
La plupart des moteurs de synthèse ont été conçus d'abord pour l'anglais, puis étendus. Le français arrive souvent avec des liaisons oubliées, des nombres lus à l'anglaise et une intonation qui monte au mauvais endroit. Un modèle entraîné par une équipe qui parle français au quotidien n'est pas une garantie, mais c'est un bon signal : la prosodie du français, ses virgules qui respirent, ses chiffres (« 1 500 », « 2026 », « 9 € ») sont traités comme un cas principal, pas comme une traduction. Nos propres tests sur des textes de 1 500 caractères vont dans ce sens, avec une limite que nous détaillons dans notre guide du text to speech en français : la ponctuation reste votre seul outil de direction.
Hébergement en Europe et textes non conservés
Un modèle français appelé depuis une API française, c'est aussi une chaîne de traitement qui peut rester en Union européenne. Côté Aievalu, les textes envoyés au moteur ne sont pas conservés : seule une empreinte technique est stockée, les audios restent 90 jours dans votre historique puis sont supprimés. Pour une entreprise qui fait relire ses scripts par un service juridique, ce point pèse autant que le prix.
Ce que coûte une minute, concrètement
À 16 $ le million de caractères, une minute de parole (environ 1 000 caractères) revient à 1,6 centime de dollar via l'API, hors développement. Les plateformes grand public facturent la même minute entre 0,17 et 0,24 $ sur leurs offres d'entrée, abonnement mensuel obligatoire. Aievalu se place entre les deux : un pack de 100 000 caractères pour 9 €, valable douze mois, soit environ 0,09 € la minute, sans abonnement. Le détail outil par outil, avec un calculateur, est sur le comparateur de prix des voix IA, et le face-à-face modèle contre modèle sur Voxtral vs ElevenLabs.
Ce qu'Aievalu fait de Voxtral, et ce qu'il ne fait pas
Aievalu utilise les voix prédéfinies de Voxtral TTS : Marie en français (trois tons : neutre, enjouée, joyeuse), Paul en anglais américain, Oliver et Jane en anglais britannique. Vous collez un texte, vous choisissez un ton, vous écoutez, vous téléchargez en MP3 ou en WAV. Chaque MP3 porte une étiquette technique indiquant qu'il s'agit d'une voix de synthèse, ce que la réglementation européenne demande désormais.
Les limites sont tout aussi claires. Pas de clonage de voix : nous n'exposons pas la fonction de référence audio, par choix, tant que la question du consentement n'est pas réglée simplement. Deux langues seulement, le français et l'anglais, alors que le modèle en parle neuf : nous n'ouvrons une langue qu'après l'avoir écoutée sérieusement. Et une génération est limitée à 1 500 caractères, environ une minute trente, ce qui oblige à découper les textes longs, comme expliqué dans le guide voix off pour podcast. Si vous avez besoin de clonage ou de trente langues, les meilleurs outils de voix IA de notre comparatif vous diront vers qui vous tourner.
Pour qui ce modèle change vraiment la donne
Pour le créateur YouTube ou TikTok qui publie en français, la combinaison « prosodie française correcte + prix au caractère » enlève l'argument principal de l'abonnement à 22 $. Pour une PME qui sonorise des modules de formation, l'hébergement européen et la non-conservation des textes facilitent la validation interne. Pour un développeur, l'API à 16 $ le million est l'une des moins chères du marché, à condition d'accepter d'écrire du code. Et pour un chercheur, les poids ouverts permettent enfin d'étudier un modèle de synthèse de ce niveau sans boîte noire.
La meilleure façon de se faire un avis prend deux minutes : collez un paragraphe de votre prochain script dans l'essai gratuit de la page d'accueil, écoutez, puis comparez avec votre outil actuel sur le même texte. Les tarifs complets sont sur la page tarifs.