# Generador de voz robótica: 5 presets de entrega mecánica

URL: https://anyvoice.app/es/tools/generador-de-voz-robotica
Type: tool
Locale: es
Published: 2026-08-04
Updated: 2026-08-04

---

> Elige un preset robótico y obtén una transcripción etiquetada con las métricas de pitch, formante y cadencia. Sin render de audio necesario.

## Generador de voz robótica: 5 presets de entrega mecánica

Escribe una línea, elige un preset y obtén una transcripción etiquetada con los números de pitch, formante y cadencia detrás, sin renderizar audio para verificar la lectura.

## Generador de voz robótica

Elige un preset, escribe una línea y ajusta la intensidad. La salida es una transcripción etiquetada, no un archivo de audio. Solo tu navegador procesa los datos; se envía solo un contador anónimo de ejecuciones.

*[Interactive widget — see the live page for the full experience]*

## Qué cambia en cada preset

### Firma acústica fija por preset

Cada preset posee su propio pitch shift y formant shift. Vocoder Bot ejecuta +2 semitonos con corte de formante 30%, Deep Drone ejecuta -8 semitonos con formante potenciada 10%. Estos son los números iniciales que introducirías en un plugin vocalizador o en la etiqueta de pitch de un motor TTS.

### La intensidad escala solo la densidad de pausas

El deslizador cambia con qué frecuencia aparece una etiqueta de pausa, desde cada 2 palabras a 100% hasta el intervalo base del preset a 0%, y en Glitch Stutter también incrementa la frecuencia de repetición de sílabas. Nunca toca los números de pitch o formante, así la identidad acústica permanece predecible.

### La salida es un script, no un render

Obtienes una transcripción etiquetada como [pause 120ms], el mismo formato de marcador que convertirías en una etiqueta SSML break o leerías durante una sesión de voz. Sin audio generado y sin nada excepto un contador anónimo de ejecuciones que abandona tu navegador.

## Preguntas de la sesión

### ¿Coincide la etiqueta [pause Xms] con la sintaxis SSML <break> que espera mi motor TTS?

No directamente. Es un marcador de texto plano que conviertes manualmente: [pause 120ms] se convierte en <break time="120ms"/> en la mayoría de motores compatibles con SSML, incluyendo Amazon Polly, Azure Speech y la propia API de AnyVoice. El texto plano mantiene la línea fácil de pegar en un documento de script o hoja de sesión.

### ¿Por qué Glitch Stutter omite palabras cortas como 'the' o 'and'?

El tartamudez solo se aplica a palabras con 4 o más letras nucleares, puntuación removida antes de la verificación. Palabras funcionales bajo 4 letras sonarían como interferencia aleatoria en lugar de una transmisión corrupta, así que están excluidas por diseño.

### ¿Puedo ejecutar 300 líneas de NPC a través de esto de una sola vez?

No, esto visualiza una línea a la vez en el navegador. Es una herramienta de alcance para elegir el preset correcto antes de comprometer un lote a tu tubería TTS o una sesión de grabación completa, no un procesador de lotes.

### ¿Cambiar el deslizador de intensidad modifica el pitch o el shift de formante?

No. Los números de pitch y formante permanecen fijos por preset, así la especificación que lees en el panel es precisa independientemente de la posición del deslizador. La intensidad solo ajusta la frecuencia de pausa y, en Glitch Stutter, la frecuencia de repetición de sílabas.

### ¿De dónde viene la línea base de 150 ppm para la cadencia estimada?

150 palabras por minuto es la cadencia de narración comúnmente citada en directrices de producción de audiolibros, con entregas estilo ACX aterrizando entre 150 y 160 ppm. Cada preset aplica su propio multiplicador de cadencia a esa línea base: Deep Drone ejecuta a 0.6x para una lectura mecánica más lenta.

### ¿Se genera realmente algo de audio aquí?

No. La herramienta produce solo texto, una transcripción etiquetada calculada en tu navegador. No hay render TTS, no hay archivo de audio, no hay llamada API externa: todo el cálculo se ejecuta en el lado del cliente.

### ¿Qué preset suena más cercano a un anuncio de PA versus una unidad industrial pesada?

Vocoder Bot (+2 st, formant -30%) suena como una voz de PA de canal de comunicaciones. Deep Drone (-8 st, formant +10%, pausas de 300ms) suena como una unidad industrial lenta y de gran tamaño. Monotone Synth se sienta entre los dos para una lectura de computadora de a bordo tranquila.

### ¿Almacena o envía la herramienta el texto de mi script a algún lugar?

No. La transcripción se calcula completamente en tu navegador y el texto que escribes nunca se envía a un servidor. La única llamada de red es un faro de ejecución de herramienta anónimo que registra una vista de página, no el contenido en sí.

## ¿Construyendo más que una línea ocasional?

Las herramientas de clonación de voz de AnyVoice cubren lotes completos de diálogos NPC, narración de audiolibros de múltiples capítulos y entrega controlada por emoción más allá de estos cinco presets robóticos.

*Call to action: Explora AnyVoice*


## FAQ

### ¿Coincide la etiqueta [pause Xms] con la sintaxis SSML <break> que espera mi motor TTS?

No directamente. Es un marcador de texto plano que conviertes manualmente: [pause 120ms] se convierte en <break time="120ms"/> en la mayoría de motores compatibles con SSML, incluyendo Amazon Polly, Azure Speech y la propia API de AnyVoice. El texto plano mantiene la línea fácil de pegar en un documento de script o hoja de sesión.

### ¿Por qué Glitch Stutter omite palabras cortas como 'the' o 'and'?

El tartamudez solo se aplica a palabras con 4 o más letras nucleares, puntuación removida antes de la verificación. Palabras funcionales bajo 4 letras sonarían como interferencia aleatoria en lugar de una transmisión corrupta, así que están excluidas por diseño.

### ¿Puedo ejecutar 300 líneas de NPC a través de esto de una sola vez?

No, esto visualiza una línea a la vez en el navegador. Es una herramienta de alcance para elegir el preset correcto antes de comprometer un lote a tu tubería TTS o una sesión de grabación completa, no un procesador de lotes.

### ¿Cambiar el deslizador de intensidad modifica el pitch o el shift de formante?

No. Los números de pitch y formante permanecen fijos por preset, así la especificación que lees en el panel es precisa independientemente de la posición del deslizador. La intensidad solo ajusta la frecuencia de pausa y, en Glitch Stutter, la frecuencia de repetición de sílabas.

### ¿De dónde viene la línea base de 150 ppm para la cadencia estimada?

150 palabras por minuto es la cadencia de narración comúnmente citada en directrices de producción de audiolibros, con entregas estilo ACX aterrizando entre 150 y 160 ppm. Cada preset aplica su propio multiplicador de cadencia a esa línea base: Deep Drone ejecuta a 0.6x para una lectura mecánica más lenta.

### ¿Se genera realmente algo de audio aquí?

No. La herramienta produce solo texto, una transcripción etiquetada calculada en tu navegador. No hay render TTS, no hay archivo de audio, no hay llamada API externa: todo el cálculo se ejecuta en el lado del cliente.

### ¿Qué preset suena más cercano a un anuncio de PA versus una unidad industrial pesada?

Vocoder Bot (+2 st, formant -30%) suena como una voz de PA de canal de comunicaciones. Deep Drone (-8 st, formant +10%, pausas de 300ms) suena como una unidad industrial lenta y de gran tamaño. Monotone Synth se sienta entre los dos para una lectura de computadora de a bordo tranquila.

### ¿Almacena o envía la herramienta el texto de mi script a algún lugar?

No. La transcripción se calcula completamente en tu navegador y el texto que escribes nunca se envía a un servidor. La única llamada de red es un faro de ejecución de herramienta anónimo que registra una vista de página, no el contenido en sí.