Resumo

Esta ferramenta gratuita de texto para voz em espanhol transforma um roteiro simples em uma versão marcada com pausas e ênfase, pronta para narração ou para um mecanismo de voz como o AnyVoice. Escolha um sotaque regional (castelhano, mexicano, latino-americano neutro ou rioplatense), defina um estilo de pausa e ouça o resultado com a voz nativa do seu navegador: sem upload, sem conta, sem ida e volta a um servidor. O formatador estima a duração falada a partir de uma base de 150 palavras por minuto ajustada pelo controle de velocidade, e marca pausas longas, pausas curtas e palavras enfatizadas para o roteiro entrar direto em um pipeline de produção compatível com SSML.

Formate roteiros de texto para voz em espanhol com tags de sotaque regional

Cole um roteiro, escolha o espanhol castelhano, mexicano, latino-americano neutro ou rioplatense, e obtenha tags de pausa e ênfase, além de uma prévia gratuita no navegador antes de usar um mecanismo de voz pago.

Formatador de Roteiro TTS em Espanhol e Prévia de Voz

Cole seu roteiro em espanhol, escolha um sotaque regional e um estilo de pausa, e ouça a prévia com a voz nativa do seu navegador. O roteiro marcado abaixo está pronto para ser colado no AnyVoice ou em qualquer mecanismo compatível com SSML.

Como funciona

Como funciona o formatador de texto para voz em espanhol

Fonética sensível ao sotaque

Escolha o espanhol castelhano da Espanha, mexicano, latino-americano neutro ou rioplatense argentino. Cada opção mapeia para uma tag BCP-47 (es-ES, es-MX, es-419, es-AR) para que a prévia do navegador escolha uma voz do sistema compatível, quando instalada.

Tags de pausa a partir da pontuação

Vírgulas, dois-pontos e ponto e vírgula recebem uma tag de pausa curta; a pontuação de fim de frase recebe uma mais longa. As durações mudam conforme o estilo de pausa: conversacional, dramático ou diálogo rápido.

Estimativa de duração

A contagem de palavras dividida por 150 palavras por minuto, ajustada pelo controle de velocidade, gera uma estimativa de duração falada antes de reservar tempo de estúdio para a gravação. Ela é atualizada a cada tecla digitada, para você ajustar o roteiro a um anúncio de 30 segundos ou a um explicativo de 90 segundos sem precisar adivinhar.

Guia de sotaques

Escolhendo o sotaque regional certo

Castelhano (es-ES)

Distinção entre c/z e s. O padrão para URA corporativa e conteúdo voltado à Espanha.

Latino-americano neutro (es-419)

Seseo, ritmo suavizado. A opção mais segura para audiolivros pan-regionais e módulos de e-learning.

Rioplatense (es-AR)

Voseo e sheísmo: o som de y/ll desliza para sh. Use quando o briefing pedir especificamente um narrador argentino ou uruguaio, ou quando a identidade regional de um NPC de jogo fizer parte do briefing do personagem.

Do roteiro à prévia em três passos

  1. 1

    Cole e marque

    Cole seu roteiro em espanhol na caixa. A pontuação vira tags de pausa automaticamente; envolva uma palavra em asteriscos ou digite em MAIÚSCULAS para marcar ênfase.

  2. 2

    Defina sotaque e ritmo

    Escolha um sotaque regional e um estilo de pausa, depois ajuste o controle de velocidade. A contagem de palavras e a estimativa de duração são atualizadas a cada mudança.

  3. 3

    Pré-visualize ou exporte

    Reproduza a prévia no navegador para conferir o ritmo, depois copie o roteiro marcado para o AnyVoice ou o mecanismo compatível com SSML de sua escolha. Nota de sessão: a prévia no navegador usa a voz do sistema instalada no SO do visitante, então trate-a como uma checagem de ritmo, não como referência de mixagem final.

Perguntas frequentes

Isso gera o áudio de voz de IA de verdade?
Não. O botão de prévia usa a API speechSynthesis nativa do seu navegador e a voz do sistema em espanhol instalada, não uma voz clonada. Para uma voz em espanhol clonada e com controle emocional, rode o roteiro marcado pelo AnyVoice.
Por que meu navegador não tem opção de voz em espanhol?
A disponibilidade de vozes depende do sistema operacional, não desta ferramenta. Windows e macOS trazem pelo menos uma voz es-ES ou es-MX por padrão; algumas versões de Chrome OS e Android só adicionam uma depois que você instala o pacote de idioma espanhol.
Posso colar as tags de pausa e ênfase no ElevenLabs ou no Amazon Polly?
A sintaxe das tags espelha os elementos break time e emphasis do SSML, aceitos pelo Polly, pelo Azure e pelo pipeline avançado do AnyVoice. Alguns mecanismos esperam as tags dentro de um envelope speak completo, então confira a documentação do seu mecanismo antes de uma gravação de produção.
Como a estimativa de duração é calculada?
A contagem de palavras é dividida por 150 palavras por minuto, um parâmetro comum de ritmo de locução para narração neutra, ajustado pelo controle de velocidade. É uma estimativa, não um tempo de renderização preciso ao quadro.
Existe um limite de caracteres?
Nenhum limite rígido é aplicado, mas o speechSynthesis do navegador costuma travar acima de cerca de 30.000 caracteres em uma única elocução, e alguns mecanismos também truncam SSML longo de elocução única. Divida capítulos longos em cenas tanto para a prévia quanto para o pipeline de produção; a contagem de palavras e a estimativa de duração são atualizadas na hora para você dimensionar cada cena.
Isso armazena ou envia meu roteiro para algum lugar?
Não. Tudo roda na aba do seu navegador. Nada é enviado, registrado ou transmitido a um servidor, exceto um sinalizador anônimo de uso da ferramenta que não carrega nenhum conteúdo de texto.
Qual sotaque devo usar para URA versus narração de audiolivro?
URA e centrais telefônicas corporativas na Espanha usam castelhano por padrão; audiolivros pan-regionais e e-learning tendem ao latino-americano neutro (es-419); localização de jogos ambientados na Argentina ou no Uruguai pede rioplatense. Quando um projeto é lançado para toda a América Latina de uma vez, es-419 continua sendo a opção mais segura em uma única faixa.

Pronto para uma voz em espanhol clonada em vez de uma prévia no navegador?

O AnyVoice clona uma voz em espanhol a partir de uma amostra de 30 segundos e oferece 8 sliders de emoção em tempo real, mais controle do que uma voz TTS do sistema pode dar.