Resumen

Este generador de voz robótica te permite escribir una línea y visualizarla como transcripción etiquetada con pausas en cinco presets: Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize y Deep Drone. Cada preset incluye valores fijos de pitch shift y formant shift que introducirías en un motor TTS o cadena de vocalización, mientras que el deslizador de intensidad solo modifica la densidad de pausas y, en Glitch Stutter, la frecuencia de repetición de sílabas. Diseñado para desarrolladores de audio de videojuegos que estructuran diálogos NPC y productores de audiolibros que validan una lectura robótica antes del render completo, sin archivo de audio, sin llamadas API externas, solo la transcripción etiquetada.

Generador de voz robótica: 5 presets de entrega mecánica

Escribe una línea, elige un preset y obtén una transcripción etiquetada con los números de pitch, formante y cadencia detrás, sin renderizar audio para verificar la lectura.

Generador de voz robótica

Elige un preset, escribe una línea y ajusta la intensidad. La salida es una transcripción etiquetada, no un archivo de audio. Solo tu navegador procesa los datos; se envía solo un contador anónimo de ejecuciones.

Hasta 600 caracteres. Esta es la línea que introducirías en un motor TTS o una hoja de sesión de VO.

Ajusta solo la densidad de pausas (y frecuencia de tartamudez en Glitch Stutter). Los números de pitch y formante permanecen fijos por preset.

Vista previa de transcripción etiquetada

Cómo funciona

Qué cambia en cada preset

Firma acústica fija por preset

Cada preset posee su propio pitch shift y formant shift. Vocoder Bot ejecuta +2 semitonos con corte de formante 30%, Deep Drone ejecuta -8 semitonos con formante potenciada 10%. Estos son los números iniciales que introducirías en un plugin vocalizador o en la etiqueta de pitch de un motor TTS.

La intensidad escala solo la densidad de pausas

El deslizador cambia con qué frecuencia aparece una etiqueta de pausa, desde cada 2 palabras a 100% hasta el intervalo base del preset a 0%, y en Glitch Stutter también incrementa la frecuencia de repetición de sílabas. Nunca toca los números de pitch o formante, así la identidad acústica permanece predecible.

La salida es un script, no un render

Obtienes una transcripción etiquetada como [pause 120ms], el mismo formato de marcador que convertirías en una etiqueta SSML break o leerías durante una sesión de voz. Sin audio generado y sin nada excepto un contador anónimo de ejecuciones que abandona tu navegador.

Preguntas de la sesión

¿Coincide la etiqueta [pause Xms] con la sintaxis SSML <break> que espera mi motor TTS?
No directamente. Es un marcador de texto plano que conviertes manualmente: [pause 120ms] se convierte en <break time="120ms"/> en la mayoría de motores compatibles con SSML, incluyendo Amazon Polly, Azure Speech y la propia API de AnyVoice. El texto plano mantiene la línea fácil de pegar en un documento de script o hoja de sesión.
¿Por qué Glitch Stutter omite palabras cortas como 'the' o 'and'?
El tartamudez solo se aplica a palabras con 4 o más letras nucleares, puntuación removida antes de la verificación. Palabras funcionales bajo 4 letras sonarían como interferencia aleatoria en lugar de una transmisión corrupta, así que están excluidas por diseño.
¿Puedo ejecutar 300 líneas de NPC a través de esto de una sola vez?
No, esto visualiza una línea a la vez en el navegador. Es una herramienta de alcance para elegir el preset correcto antes de comprometer un lote a tu tubería TTS o una sesión de grabación completa, no un procesador de lotes.
¿Cambiar el deslizador de intensidad modifica el pitch o el shift de formante?
No. Los números de pitch y formante permanecen fijos por preset, así la especificación que lees en el panel es precisa independientemente de la posición del deslizador. La intensidad solo ajusta la frecuencia de pausa y, en Glitch Stutter, la frecuencia de repetición de sílabas.
¿De dónde viene la línea base de 150 ppm para la cadencia estimada?
150 palabras por minuto es la cadencia de narración comúnmente citada en directrices de producción de audiolibros, con entregas estilo ACX aterrizando entre 150 y 160 ppm. Cada preset aplica su propio multiplicador de cadencia a esa línea base: Deep Drone ejecuta a 0.6x para una lectura mecánica más lenta.
¿Se genera realmente algo de audio aquí?
No. La herramienta produce solo texto, una transcripción etiquetada calculada en tu navegador. No hay render TTS, no hay archivo de audio, no hay llamada API externa: todo el cálculo se ejecuta en el lado del cliente.
¿Qué preset suena más cercano a un anuncio de PA versus una unidad industrial pesada?
Vocoder Bot (+2 st, formant -30%) suena como una voz de PA de canal de comunicaciones. Deep Drone (-8 st, formant +10%, pausas de 300ms) suena como una unidad industrial lenta y de gran tamaño. Monotone Synth se sienta entre los dos para una lectura de computadora de a bordo tranquila.
¿Almacena o envía la herramienta el texto de mi script a algún lugar?
No. La transcripción se calcula completamente en tu navegador y el texto que escribes nunca se envía a un servidor. La única llamada de red es un faro de ejecución de herramienta anónimo que registra una vista de página, no el contenido en sí.

¿Construyendo más que una línea ocasional?

Las herramientas de clonación de voz de AnyVoice cubren lotes completos de diálogos NPC, narración de audiolibros de múltiples capítulos y entrega controlada por emoción más allá de estos cinco presets robóticos.