Résumé
Cet outil gratuit de synthèse vocale espagnole transforme un script brut en une version balisée de pauses et d'emphases, prête pour la narration ou un moteur vocal comme AnyVoice. Choisissez un accent régional (castillan, mexicain, latino-américain neutre ou rioplatense), réglez un style de pause, et prévisualisez le résultat avec la voix espagnole intégrée à votre navigateur : aucun envoi, aucun compte, aucun aller-retour serveur. Le formateur estime la durée parlée à partir d'une base de 150 mots par minute ajustée par votre curseur de vitesse, et balise les pauses longues, les pauses courtes et les mots emphasés pour que le script s'intègre directement dans un pipeline de production compatible SSML.
Mettez en forme vos scripts de synthèse vocale espagnole avec des accents régionaux
Collez un script, choisissez le castillan, le mexicain, le latino-américain neutre ou le rioplatense, et obtenez des balises de pause et d'emphase, avec une prévisualisation gratuite dans le navigateur avant de passer à un moteur vocal payant.
Comment fonctionne le formateur de synthèse vocale espagnole
Phonétique sensible à l'accent
Choisissez le castillan d'Espagne, le mexicain, le latino-américain neutre ou le rioplatense argentin. Chaque option correspond à une balise BCP-47 (es-ES, es-MX, es-419, es-AR) : la prévisualisation dans le navigateur sélectionne alors une voix système compatible, si elle est installée.
Des balises de pause à partir de la ponctuation
Les virgules, deux-points et points-virgules reçoivent une balise de pause courte ; la ponctuation de fin de phrase en reçoit une plus longue. Les durées varient selon votre style de pause : conversationnel, narration dramatique ou dialogue rapide.
Estimation de la durée
Le nombre de mots divisé par 150 mots par minute, ajusté par votre curseur de vitesse, donne une estimation de durée parlée avant de réserver du temps studio pour l'enregistrement. Elle se met à jour à chaque frappe, ce qui vous permet d'ajuster un script pour tenir dans un spot de 30 secondes ou un explainer de 90 secondes sans deviner.
Choisir le bon accent régional
Castillan (es-ES)
Distinction entre c/z et s. L'accent par défaut pour les SVI d'entreprise et les contenus destinés à l'Espagne.
Latino-américain neutre (es-419)
Seseo, rythme adouci. Le choix par défaut le plus sûr pour les livres audio pan-régionaux et les modules e-learning.
Rioplatense (es-AR)
Voseo et sheismo, le son y/ll glisse vers un son « ch ». À utiliser quand le brief demande spécifiquement un narrateur argentin ou uruguayen, ou quand l'identité régionale d'un PNJ de jeu vidéo fait partie du brief de personnage.
Du script à la prévisualisation en trois étapes
-
1
Coller et baliser
Déposez votre script espagnol dans la zone de texte. La ponctuation devient automatiquement des balises de pause ; encadrez un mot d'astérisques ou saisissez-le en MAJUSCULES pour marquer l'emphase.
-
2
Régler l'accent et le rythme
Choisissez un accent régional et un style de pause, puis ajustez le curseur de vitesse. Le nombre de mots et l'estimation de durée se mettent à jour à chaque changement.
-
3
Prévisualiser ou exporter
Lancez la prévisualisation dans le navigateur pour vérifier le rythme, puis copiez le script balisé dans AnyVoice ou le moteur compatible SSML de votre choix. La session note : la prévisualisation navigateur utilise la voix système fournie par l'OS du visiteur, à traiter comme un contrôle de rythme, pas comme une référence de mixage final.
Questions fréquentes
Cet outil génère-t-il le fichier audio de la voix IA ?
Pourquoi mon navigateur n'a-t-il aucune option de voix espagnole ?
Puis-je coller les balises de pause et d'emphase dans ElevenLabs ou Amazon Polly ?
Comment l'estimation de durée est-elle calculée ?
Y a-t-il une limite de caractères ?
Cet outil stocke-t-il ou envoie-t-il mon script quelque part ?
Quel accent utiliser pour un SVI plutôt que pour une narration de livre audio ?
Prêt pour une voix espagnole clonée plutôt qu'une prévisualisation navigateur ?
AnyVoice clone une voix espagnole à partir d'un échantillon de 30 secondes et vous donne 8 sliders d'émotion en temps réel, davantage de contrôle qu'une voix TTS système ne peut offrir.