Resumen

Eres hispanohablante y produces contenido: esta herramienta gratuita de texto a voz en español convierte un guion plano en una versión con pausas y énfasis etiquetados, lista para narración o para un motor de voz como AnyVoice. Elige un acento regional (castellano, mexicano, latino neutro o rioplatense), fija un estilo de pausas, y escucha el resultado con la voz en español integrada en tu navegador, sin subida de archivos, sin cuenta, sin ida y vuelta al servidor. El formateador estima la duración hablada desde una base de 150 palabras por minuto ajustada por tu control de velocidad, y etiqueta pausas largas, cortas y palabras enfatizadas para que el guion entre directo en un pipeline compatible con SSML.

Formatea guiones de texto a voz en español con etiquetas de acento regional

Eres hispanohablante y produces contenido: pega un guion, elige castellano, mexicano, latino neutro o rioplatense, y obtén etiquetas de pausa y énfasis más una vista previa gratuita en el navegador antes de tocar un motor de voz de pago.

Formateador de guiones TTS en español y vista previa de voz

Pega tu guion en español, elige un acento regional y un estilo de pausas, y escúchalo con la voz nativa de tu navegador. El guion etiquetado de abajo está listo para pegarlo en AnyVoice o en cualquier motor compatible con SSML.

Cómo funciona

Cómo funciona el formateador de TTS en español

Fonética consciente del acento

Elige castellano de España, mexicano, latino neutro o rioplatense de Argentina. Cada opción se asocia a una etiqueta BCP-47 (es-ES, es-MX, es-419, es-AR), así la vista previa del navegador selecciona una voz del sistema equivalente cuando está instalada.

Pausas generadas desde la puntuación

Comas, dos puntos y punto y coma generan una pausa corta; la puntuación de final de frase genera una más larga. Las duraciones cambian según tu estilo de pausas: conversacional, dramático o diálogo rápido.

Estimación de duración

El número de palabras dividido entre 150 palabras por minuto, ajustado con el control de velocidad, te da una estimación de duración hablada antes de reservar tiempo de estudio para grabar. Se actualiza con cada pulsación, así que puedes recortar un guion hasta que encaje en un anuncio de 30 segundos o un explicativo de 90 sin ir a ciegas.

Guía de acentos

Cómo elegir el acento regional adecuado

Castellano (es-ES)

Distinción entre c/z y s. La opción por defecto para IVR corporativo y contenido dirigido a España.

Latino neutro (es-419)

Seseo, ritmo suavizado. La opción por defecto más segura para audiolibros panregionales y módulos de e-learning.

Rioplatense (es-AR)

Voseo y yeísmo rehilado, el sonido y/ll se desplaza hacia sh. Úsalo cuando el brief pida explícitamente un narrador argentino o uruguayo, o cuando la identidad regional de un NPC de videojuego forme parte del brief del personaje.

Del guion a la vista previa en tres pasos

  1. 1

    Pega y etiqueta

    Suelta tu guion en español en el cuadro de texto. La puntuación se convierte en etiquetas de pausa automáticamente; envuelve una palabra entre asteriscos o escríbela en MAYÚSCULAS para marcar énfasis.

  2. 2

    Ajusta acento y ritmo

    Elige un acento regional y un estilo de pausas, y luego ajusta el control de velocidad. El recuento de palabras y la estimación de duración se actualizan con cada cambio.

  3. 3

    Previsualiza o exporta

    Reproduce la vista previa del navegador para comprobar el ritmo, y luego copia el guion etiquetado en AnyVoice o en el motor compatible con SSML que uses. La nota de sesión: la vista previa del navegador usa la voz del sistema que traiga el equipo del visitante, así que trátala como un control de ritmo, no como referencia de mezcla final.

Preguntas frecuentes

¿Esto genera el audio real con voz de IA?
No. El botón de vista previa usa la API speechSynthesis integrada en tu navegador y la voz del sistema en español que tengas instalada, no una voz clonada. Para una voz en español clonada y con control emocional, pasa el guion etiquetado por AnyVoice.
¿Por qué mi navegador no tiene ninguna voz en español?
La disponibilidad de voces depende del sistema operativo, no de esta herramienta. Windows y macOS traen al menos una voz es-ES o es-MX por defecto; algunas versiones de Chrome OS y Android solo añaden una después de instalar el paquete de idioma español.
¿Puedo pegar las etiquetas de pausa y énfasis en ElevenLabs o Amazon Polly?
La sintaxis de las etiquetas refleja los elementos break time y emphasis de SSML, que Polly, Azure y el pipeline avanzado de AnyVoice aceptan. Algunos motores esperan las etiquetas envueltas en un elemento speak completo, así que revisa la documentación de tu motor antes de una producción real.
¿Cómo se calcula la estimación de duración?
El número de palabras dividido entre 150 palabras por minuto, un baremo habitual de ritmo de locución para narración neutra, ajustado con el control de velocidad. Es una estimación, no un tiempo de render preciso al fotograma.
¿Hay un límite de caracteres?
No se aplica un límite estricto, pero el speechSynthesis del navegador tiende a atragantarse a partir de unos 30.000 caracteres en una sola locución, y algunos motores también truncan SSML largo de una sola tirada. Divide los capítulos largos en escenas tanto para la vista previa como para la producción; el recuento de palabras y la estimación de duración se actualizan al instante para que puedas dimensionar cada escena.
¿Esta herramienta guarda o envía mi guion a algún sitio?
No. Todo se ejecuta en la pestaña de tu navegador. Nada se sube, se registra ni se envía a un servidor, salvo una señal anónima de uso de la herramienta que no lleva ningún contenido de texto.
¿Qué acento debería usar para IVR frente a narración de audiolibro?
El IVR y las centralitas corporativas en España usan por defecto castellano; los audiolibros panregionales y el e-learning se inclinan por el latino neutro (es-419); la localización de videojuegos ambientada en Argentina o Uruguay pide rioplatense. Cuando un proyecto se lanza a toda Latinoamérica a la vez, es-419 sigue siendo la opción de pista única más segura.

¿Prefieres una voz en español clonada en vez de una vista previa del navegador?

AnyVoice clona una voz en español a partir de una muestra de 30 segundos y te da 8 sliders de emoción en tiempo real, más control del que puede ofrecer una voz TTS del sistema.