Le 23 mars 2026, Mistral AI a publié Voxtral TTS, son premier modèle de synthèse vocale. Il parle neuf langues dont le français, adapte une voix à partir de trois secondes d’audio et se facture 0,016 $ les 1 000 caractères par API. Six mois plus tard, les équipes marketing se posent la question pour des voix-off de vidéos, des messages de standard, des podcasts ou des fiches produit lues à voix haute.
Cet article rassemble les chiffres publiés par Mistral, la licence à lire avant tout usage commercial, des calculs de coût sur des contenus courants et un protocole d’écoute pour décider avec vos propres textes.
CHIFFRES CLÉS
Voxtral TTS en quatre chiffres
Ces données viennent de la page de lancement de Mistral du 23 mars 2026 et de son article de recherche.
3 s
Audio de référence minimal pour adapter une voix, selon Mistral
Source : Mistral AI, 2026
9
Langues prises en charge, dont le français
Source : Mistral AI, 2026
0,016 $
Prix public de l’API pour 1 000 caractères
Source : Mistral AI, 2026
68,4 %
Préférence des auditeurs face à ElevenLabs Flash v2.5 pour le clonage de voix, lors d’un test mené par Mistral
Source : Mistral AI, 2026
Voxtral TTS en trois gestes
Mistral décrit un modèle construit sur Ministral 3B, avec un décodeur de 3,4 milliards de paramètres, un transformeur acoustique de 390 millions de paramètres et un codec audio de 300 millions de paramètres. Pour un marketeur, trois capacités comptent.
VOIX
Une voix à partir de trois secondes
Le modèle s’adapte à une voix avec une référence de trois secondes et restitue l’accent, les intonations et jusqu’aux hésitations. Le fonctionnement décrit vise une référence de 5 à 25 secondes. Mistral propose des voix en dialectes américain, britannique et français pour démarrer.
Contrôle : Obtenez un accord écrit avant tout clonage.
LANGUES
Neuf langues, un même timbre
Anglais, français, allemand, espagnol, néerlandais, portugais, italien, hindi et arabe. Une voix de référence française peut lire un texte anglais avec un accent français naturel : Mistral décrit cette adaptation comme un comportement non entraîné explicitement.
Contrôle : Faites relire chaque langue par un locuteur natif.
VITESSE
70 millisecondes de latence
Mistral mesure 70 ms de latence du modèle pour dix secondes de voix de référence et 500 caractères de texte. Le modèle génère jusqu’à deux minutes d’audio par requête. La documentation indique un délai avant le premier son d’environ 0,8 seconde en pcm et 3 secondes en mp3.
Contrôle : Testez le format audio adapté à votre usage.
La licence, ce détail qui change tout
Mistral distribue Voxtral TTS de deux manières : une API payante et des poids ouverts sur Hugging Face. Chaque accès porte ses conditions. La licence des poids fixe le cadre d’usage de votre équipe.
COMPARATIF
Deux façons d’accéder à Voxtral TTS
Le choix dépend de votre usage, de votre équipe technique et du cadre juridique.
Critères comparés : Licence, coût, voix disponibles, hébergement et usage commercial.
API Mistral et Mistral Studio
Recommandé pour : Les équipes marketing et contenus qui produisent des voix-off, des podcasts ou des messages vocaux
- Tarif public de 0,016 $ pour 1 000 caractères.
- Essai dans Mistral Studio et dans Le Chat.
- Création de voix personnalisées avec un échantillon audio.
- Conditions commerciales et politique d’usage de Mistral à lire.
Poids ouverts sur Hugging Face
Recommandé pour : Les équipes techniques qui testent le modèle en interne, hors usage commercial
- Licence CC BY NC 4.0.
- Plusieurs voix de référence fournies avec le modèle.
- Auto-hébergement possible pour des essais.
- Clonage de voix personnalisées via l’API, selon DataCamp.
Combien coûte une voix de marque ?
Au tarif public de 0,016 $ pour 1 000 caractères, le coût de génération se calcule à la ligne. Les valeurs suivantes sont des calculs éditoriaux d’IA & Marketing fondés sur une estimation d’environ 1 000 caractères par minute de parole. Ils excluent les taxes, le temps de production humaine et les éventuelles évolutions de tarif.
Coût de génération estimé au tarif public de 0,016 $ pour 1 000 caractères
| Contenu | Durée ou volume | Caractères estimés | Coût estimé |
|---|---|---|---|
| Message de standard | 30 secondes | 500 | 0,008 $ |
| Voix-off d’une vidéo produit | 2 minutes | 2 000 | 0,032 $ |
| Épisode de podcast | 20 minutes | 20 000 | 0,32 $ |
| Fiches produit lues à voix haute | 1 000 fiches de 300 caractères | 300 000 | 4,80 $ |
Les chiffres montrent un coût de génération très bas. Le budget réel dépend du script, de la validation par des locuteurs natifs, de l’accord des personnes dont la voix sert de référence et de la mention de l’usage de l’IA.
Écouter avant de décider
Mistral propose un espace d’essai, Mistral Studio, à ouvrir avant tout engagement. La vidéo ci-dessous, publiée par Mistral sur sa page de lancement, accompagne la section consacrée à cet essai.
Cinq étapes pour tester Voxtral TTS sur votre marque
Ce protocole est une recommandation éditoriale d’IA & Marketing. Il dure une demi-journée.
-
Choisir trois textes réels
Prenez des textes que vous publiez vraiment. Un texte de démonstration masque les difficultés : sigles, noms de marque, chiffres et mots étrangers.
Point de contrôle : Une annonce, une fiche produit et un message de service client sont retenus.
-
Écouter les voix de démarrage
Générez chaque texte avec les voix proposées dans Mistral Studio. Notez les erreurs de prononciation et les rythmes qui ne conviennent pas à votre ton.
Point de contrôle : Les voix françaises de Mistral Studio ont lu vos trois textes.
-
Préparer une voix de référence avec accord
Si vous souhaitez une voix maison, enregistrez entre 5 et 25 secondes propres avec l’accord écrit de la personne. Une référence bruyante donne un résultat bruyant.
Point de contrôle : Un accord écrit précise les usages, la durée et les langues.
-
Faire écouter à l’aveugle
Faites écouter les versions à cinq personnes de votre public, sans leur dire laquelle est générée. Recueillez leurs remarques sur le naturel, l’accent et la confiance inspirée.
Point de contrôle : Cinq personnes comparent les versions sans connaître la source.
-
Documenter la mention et la licence
Notez où figure la mention de voix générée, quel accès à Voxtral TTS vous utilisez et quelles conditions de Mistral s’appliquent. Conservez la date de vos vérifications.
Point de contrôle : La mention IA, la licence choisie et les échantillons sont archivés.
Une voix appartient à quelqu’un
Cette liste constitue une recommandation éditoriale. Faites-la valider par un juriste avant usage.
- L’identité de la personne et la date de l’enregistrement de référence.
- Les usages autorisés : canaux, produits et campagnes.
- Les langues et les territoires de diffusion.
- La durée de l’autorisation et les modalités de retrait.
- La mention d’une voix générée par IA prévue dans chaque contenu.
- Le contact chargé de recevoir une demande de suppression.
MISE EN SITUATION FICTIVE
Trois magasins de cycles, une seule voix
LE CONTEXTE
Une enseigne fictive de cycles possède des magasins en France, en Allemagne et en Espagne. Sa directrice accepte par écrit que sa voix serve aux messages d’accueil et aux annonces promotionnelles dans les trois langues.
LE DÉROULÉ
L’équipe fait signer une fiche de consentement qui précise usages, durée et langues. Elle enregistre vingt secondes propres, rédige des textes aux nombres écrits en toutes lettres et génère chaque message en français, en allemand et en espagnol. Un locuteur natif valide chaque version. Les vidéos portent la mention « voix générée par IA » et les échantillons sont archivés. Vingt messages de 500 caractères dans trois langues représentent 30 000 caractères, soit 0,48 $ au tarif public.
CE QUE CET EXEMPLE MONTRE
Le coût de génération reste très bas. Le travail se concentre sur l’accord signé, la validation par des locuteurs natifs et la mention de l’usage de l’IA.
PROMPT 1
Écrire un script pensé pour une voix de synthèse
Objectif : Obtenir un texte court, facile à lire pour un modèle de synthèse vocale, avec la liste des mots à faire relire.
Vous êtes un rédacteur audio. Rédigez un script de [durée en secondes] secondes pour [produit ou service], destiné à être lu par une voix de synthèse en [langue]. Écrivez les nombres en toutes lettres et épelez les sigles. Utilisez des phrases de quinze mots maximum. Indiquez les pauses par des retours à la ligne. Terminez par une seule invitation à l’action : [action]. Ajoutez, après le script, la liste des mots à faire relire par un locuteur natif : noms propres, marques et termes techniques.
À vérifier : Faites relire le script par un locuteur natif et n’incluez aucune donnée client dans le prompt.
Voxtral TTS pour une marque : points forts et limites
L’évaluation dépend de vos textes, de vos langues et du cadre juridique de votre usage.
Points forts
- Neuf langues dont le français.
- Adaptation d’une voix à partir de trois secondes d’audio.
- Tarif public bas et lisible.
- Latence de 70 millisecondes annoncée pour le modèle.
- Essai possible dans Mistral Studio.
Limites à anticiper
- Des comparaisons menées par Mistral, sans benchmark indépendant au lancement.
- Des poids ouverts sous licence non commerciale.
- Un clonage personnalisé par l’API.
- Une couverture limitée à neuf langues.
- Un cadre de consentement à construire en interne.
Questions fréquentes
FAQ
Voxtral TTS en cinq questions
Ces réponses reprennent la page de lancement et la documentation de Mistral consultées le 20 septembre 2026.
L’API est payante à 0,016 $ pour 1 000 caractères. Les poids ouverts sont téléchargeables sur Hugging Face sous licence CC BY NC 4.0, réservée aux usages non commerciaux. Mistral propose aussi un essai dans Mistral Studio et dans Le Chat.
Oui par l’API, selon les conditions de Mistral. Pour un auto-hébergement commercial, la page de lancement ne décrit pas d’autre licence que la CC BY NC : contactez Mistral.
Mistral indique une adaptation possible dès trois secondes. Le fonctionnement décrit repose sur une référence de 5 à 25 secondes.
Oui. Mistral liste le français parmi les neuf langues et propose des voix en dialecte français. Écoutez vos propres textes : noms de marque, chiffres et sigles demandent une relecture.
Oui, avec son accord explicite. La politique de Mistral interdit le clonage sans consentement explicite et l’usurpation d’identité. Prévoyez un accord écrit et une mention de l’usage de l’IA.
Écouter Voxtral TTS dans Mistral Studio
SOURCES
Sources et pour aller plus loin
Ces ressources ont été consultées le 20 septembre 2026 pour vérifier les informations de cet article.
- Mistral AI : Speaking of Voxtral
Annonce du 23 mars 2026 : capacités, prix, licence, latence et évaluation humaine.
- Documentation Mistral : Voices
Politique d’usage du clonage vocal et création de voix personnalisées.
- Documentation Mistral : Text to Speech
Clonage dès 2 à 3 secondes, langues et délais de bout en bout par format.
- Mistral AI : article de recherche Voxtral TTS
Architecture, référence audio de trois secondes et méthode d’évaluation par des locuteurs natifs.
- DataCamp : Voxtral TTS, guide avec exemples pratiques
Voix préréglées des poids ouverts, clonage par l’API et absence de benchmark indépendant au lancement.




