Résumé

Cet outil gratuit de synthèse vocale espagnole transforme un script brut en une version balisée de pauses et d'emphases, prête pour la narration ou un moteur vocal comme AnyVoice. Choisissez un accent régional (castillan, mexicain, latino-américain neutre ou rioplatense), réglez un style de pause, et prévisualisez le résultat avec la voix espagnole intégrée à votre navigateur : aucun envoi, aucun compte, aucun aller-retour serveur. Le formateur estime la durée parlée à partir d'une base de 150 mots par minute ajustée par votre curseur de vitesse, et balise les pauses longues, les pauses courtes et les mots emphasés pour que le script s'intègre directement dans un pipeline de production compatible SSML.

Mettez en forme vos scripts de synthèse vocale espagnole avec des accents régionaux

Collez un script, choisissez le castillan, le mexicain, le latino-américain neutre ou le rioplatense, et obtenez des balises de pause et d'emphase, avec une prévisualisation gratuite dans le navigateur avant de passer à un moteur vocal payant.

Formateur de script TTS espagnol et prévisualisation vocale

Collez votre script espagnol, choisissez un accent régional et un style de pause, puis prévisualisez-le avec la voix intégrée à votre navigateur. Le script balisé ci-dessous est prêt à être collé dans AnyVoice ou tout moteur compatible SSML.

Comment ça marche

Comment fonctionne le formateur de synthèse vocale espagnole

Phonétique sensible à l'accent

Choisissez le castillan d'Espagne, le mexicain, le latino-américain neutre ou le rioplatense argentin. Chaque option correspond à une balise BCP-47 (es-ES, es-MX, es-419, es-AR) : la prévisualisation dans le navigateur sélectionne alors une voix système compatible, si elle est installée.

Des balises de pause à partir de la ponctuation

Les virgules, deux-points et points-virgules reçoivent une balise de pause courte ; la ponctuation de fin de phrase en reçoit une plus longue. Les durées varient selon votre style de pause : conversationnel, narration dramatique ou dialogue rapide.

Estimation de la durée

Le nombre de mots divisé par 150 mots par minute, ajusté par votre curseur de vitesse, donne une estimation de durée parlée avant de réserver du temps studio pour l'enregistrement. Elle se met à jour à chaque frappe, ce qui vous permet d'ajuster un script pour tenir dans un spot de 30 secondes ou un explainer de 90 secondes sans deviner.

Guide des accents

Choisir le bon accent régional

Castillan (es-ES)

Distinction entre c/z et s. L'accent par défaut pour les SVI d'entreprise et les contenus destinés à l'Espagne.

Latino-américain neutre (es-419)

Seseo, rythme adouci. Le choix par défaut le plus sûr pour les livres audio pan-régionaux et les modules e-learning.

Rioplatense (es-AR)

Voseo et sheismo, le son y/ll glisse vers un son « ch ». À utiliser quand le brief demande spécifiquement un narrateur argentin ou uruguayen, ou quand l'identité régionale d'un PNJ de jeu vidéo fait partie du brief de personnage.

Du script à la prévisualisation en trois étapes

  1. 1

    Coller et baliser

    Déposez votre script espagnol dans la zone de texte. La ponctuation devient automatiquement des balises de pause ; encadrez un mot d'astérisques ou saisissez-le en MAJUSCULES pour marquer l'emphase.

  2. 2

    Régler l'accent et le rythme

    Choisissez un accent régional et un style de pause, puis ajustez le curseur de vitesse. Le nombre de mots et l'estimation de durée se mettent à jour à chaque changement.

  3. 3

    Prévisualiser ou exporter

    Lancez la prévisualisation dans le navigateur pour vérifier le rythme, puis copiez le script balisé dans AnyVoice ou le moteur compatible SSML de votre choix. La session note : la prévisualisation navigateur utilise la voix système fournie par l'OS du visiteur, à traiter comme un contrôle de rythme, pas comme une référence de mixage final.

Questions fréquentes

Cet outil génère-t-il le fichier audio de la voix IA ?
Non. Le bouton de prévisualisation utilise l'API speechSynthesis intégrée à votre navigateur et la voix système espagnole installée, pas une voix clonée. Pour une voix espagnole clonée et pilotée par l'émotion, passez le script balisé dans AnyVoice.
Pourquoi mon navigateur n'a-t-il aucune option de voix espagnole ?
La disponibilité des voix dépend du système d'exploitation, pas de cet outil. Windows et macOS embarquent au moins une voix es-ES ou es-MX par défaut ; certaines versions de Chrome OS et Android n'en ajoutent une qu'après l'installation du pack de langue espagnol.
Puis-je coller les balises de pause et d'emphase dans ElevenLabs ou Amazon Polly ?
La syntaxe des balises reproduit les éléments break time et emphasis de SSML, acceptés par Polly, Azure et le pipeline avancé d'AnyVoice. Certains moteurs attendent que ces balises soient encapsulées dans une enveloppe speak complète : vérifiez la documentation de votre moteur avant un enregistrement en production.
Comment l'estimation de durée est-elle calculée ?
Le nombre de mots divisé par 150 mots par minute, un repère courant de rythme voix off pour une narration neutre, ajusté par le curseur de vitesse. C'est une estimation, pas un temps de rendu précis à la frame près.
Y a-t-il une limite de caractères ?
Aucune limite stricte n'est imposée, mais l'API speechSynthesis du navigateur a tendance à bloquer au-delà d'environ 30 000 caractères en un seul énoncé, et certains moteurs tronquent aussi les longs énoncés SSML uniques. Découpez les longs chapitres en scènes, pour la prévisualisation comme pour le pipeline de production ; le nombre de mots et l'estimation de durée se rafraîchissent instantanément pour calibrer chaque scène.
Cet outil stocke-t-il ou envoie-t-il mon script quelque part ?
Non. Tout s'exécute dans l'onglet de votre navigateur. Rien n'est téléversé, journalisé ou envoyé à un serveur, à l'exception d'un signal anonyme d'utilisation de l'outil qui ne contient aucun contenu textuel.
Quel accent utiliser pour un SVI plutôt que pour une narration de livre audio ?
Les SVI et standards téléphoniques d'entreprise en Espagne utilisent par défaut le castillan ; les livres audio pan-régionaux et l'e-learning penchent vers le latino-américain neutre (es-419) ; la localisation de jeux vidéo situés en Argentine ou en Uruguay appelle le rioplatense. Quand un projet cible toute l'Amérique latine en une seule piste, es-419 reste le choix le plus sûr.

Prêt pour une voix espagnole clonée plutôt qu'une prévisualisation navigateur ?

AnyVoice clone une voix espagnole à partir d'un échantillon de 30 secondes et vous donne 8 sliders d'émotion en temps réel, davantage de contrôle qu'une voix TTS système ne peut offrir.