Resumo

Este gerador de voz robótica permite digitar um trecho e visualizá-lo como uma transcrição marcada com pausas em cinco predefinições: Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize e Deep Drone. Cada predefinição carrega mudanças de tom e formante fixas que você configuraria em um motor TTS ou cadeia de vocoder, enquanto o controle de intensidade muda apenas a densidade de pausa e, no Glitch Stutter, a frequência de repetição de sílabas. Construído para devs de áudio de games bloqueando diálogos de NPC e produtores de audiobook verificando uma leitura de personagem robótico antes de uma renderização completa, sem arquivo de áudio, sem chamada de API externa, apenas o script marcado.

Gerador de Voz Robótica: 5 Estilos de Entrega Robótica

Escreva um trecho, escolha uma predefinição e obtenha uma transcrição marcada com os números de tom, formante e andamento nos bastidores, sem renderização de áudio necessária para verificar a leitura.

Gerador de voz robótica

Escolha uma predefinição, escreva um trecho e ajuste a intensidade. O resultado é uma transcrição marcada com pausas, não um arquivo de áudio. Apenas um beacon anônimo de execução sai do seu navegador.

Até 600 caracteres. Esta é a linha que você colocaria em um motor TTS ou planilha de sessão de VO.

Redimensiona apenas a densidade de pausa (e frequência de gagueira no Glitch Stutter). Os números de tom e formante permanecem fixos por predefinição.

Visualização de transcrição marcada

Como funciona

O que cada predefinição realmente muda

Assinatura acústica fixa por predefinição

Cada predefinição carrega sua própria mudança de tom e formante. Vocoder Bot executa +2 semitons com redução de formante 30%, Deep Drone executa -8 semitons com formante aumentado 10%. Estes são os números iniciais que você inseriria em um plugin de vocoder ou tag de tom em um motor TTS.

Intensidade redimensiona apenas a densidade de pausa

O controle deslizante muda a frequência com que um marcador de pausa aparece, de cada 2 palavras em 100% até o intervalo de linha de base da predefinição em 0%, e no Glitch Stutter também aumenta a frequência com que uma sílaba se repete. Nunca toca nos números de tom ou formante, então a identidade acústica permanece previsível.

O resultado é um script, não uma renderização

Você obtém uma transcrição marcada como [pausa 120ms], o mesmo formato de marcador que você converteria em uma tag de quebra SSML ou leria durante uma sessão de voz. Nenhum áudio é gerado e nada além de um contador de execução anônimo sai do seu navegador.

Perguntas da sessão

A tag [pausa Xms] corresponde à sintaxe SSML <break> que meu motor TTS espera?
Não diretamente. É um espaço reservado em texto simples que você converte manualmente: [pausa 120ms] torna-se <break time="120ms"/> na maioria dos motores compatíveis com SSML, incluindo Amazon Polly, Azure Speech e a própria API AnyVoice. O texto simples mantém a linha fácil de colar em um documento de script ou planilha de sessão.
Por que Glitch Stutter pula palavras curtas como 'o' ou 'e'?
A gagueira se aplica apenas a palavras com 4 ou mais letras principais, pontuação removida antes da verificação. Palavras funcionais com menos de 4 letras pareceriam uma falha aleatória em vez de uma transmissão corrompida, então são excluídas por design.
Posso executar 300 linhas de NPC através disso de uma vez?
Não, isto visualiza uma linha de cada vez no navegador. É uma ferramenta de escopo para escolher a predefinição correta antes de confirmar um lote no seu pipeline TTS ou uma sessão de gravação completa, não um processador em lote.
Mover o controle deslizante de intensidade muda a mudança de tom ou formante?
Não. Os números de tom e formante permanecem fixos por predefinição, então a especificação que você lê no painel é precisa independentemente da posição do controle deslizante. A intensidade apenas ajusta a frequência de pausa e, no Glitch Stutter, a frequência de repetição de sílabas.
De onde vem a linha de base de 150 ppm para andamento estimado?
150 palavras por minuto é o andamento de narração comumente citado em diretrizes de produção de audiobook, com entregas no estilo ACX chegando entre 150 e 160 ppm. Cada predefinição aplica seu próprio multiplicador de andamento a essa linha de base: Deep Drone executa em 0,6x para uma leitura mecânica mais lenta.
Algum áudio é realmente gerado aqui?
Não. A ferramenta produz apenas texto, uma transcrição marcada calculada no seu navegador. Não há renderização TTS, nenhum arquivo de áudio e nenhuma chamada de API externa: todo o cálculo é executado no lado do cliente.
Qual predefinição soa mais próxima de um anúncio PA versus uma unidade industrial pesada?
Vocoder Bot (+2 st, formante -30%) soa como uma voz PA de canal de comunicação. Deep Drone (-8 st, formante +10%, pausas de 300ms) soa como uma unidade industrial lenta e de grande porte. Monotone Synth fica entre os dois para uma leitura de computador a bordo calma.
A ferramenta armazena ou envia meu texto de script em algum lugar?
Não. A transcrição é calculada inteiramente no seu navegador e o texto que você digita nunca é enviado para um servidor. A única chamada de rede é um beacon de execução anônimo que registra uma visualização de página, não o conteúdo em si.

Construindo mais que uma linha única?

As ferramentas de clonagem de voz da AnyVoice cobrem lotes completos de diálogos de NPC, narração de audiobook em vários capítulos e entrega controlada por emoção além destas cinco predefinições robóticas.