Riassunto

Questo generatore di voce robotica ti permette di digitare una riga e visualizzarla come trascrizione annotata con pause in 5 preset: Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize e Deep Drone. Ogni preset ha numeri fissi di shift di pitch e formante che inseriresti in un motore TTS o in una catena di vocoder, mentre lo slider di intensità cambia solo la densità delle pause e, su Glitch Stutter, la frequenza delle ripetizioni di sillabe. Costruito per i game audio dev che bloccano il dialogo degli NPC e i produttori di audiobook che controllano una lettura robotica prima di un rendering completo, nessun file audio, nessuna chiamata API esterna, solo lo script annotato.

Generatore di voce robotica: anteprima di 5 stili di consegna

Digita una riga, scegli un preset e ottieni una trascrizione annotata con i numeri di pitch, formante e pacing, senza bisogno di rendering audio.

Generatore di voce robotica

Scegli un preset, digita una riga e regola l'intensità. L'output è una trascrizione annotata, non un file audio. Nulla esce dal tuo browser se non un beacon di esecuzione anonimo.

Fino a 600 caratteri. Questa è la riga che inseriresti in un motore TTS o in un foglio di sessione.

Scala solo la densità delle pause (e la frequenza dello stutter su Glitch Stutter). I numeri di pitch e formante rimangono fissi per preset.

Anteprima trascrizione annotata

Come funziona

Cosa cambia realmente ogni preset

Firma acustica fissa per preset

Ogni preset ha il suo shift di pitch e di formante. Vocoder Bot gira a +2 semitoni con formante ridotto del 30%, Deep Drone gira a -8 semitoni con formante incrementato del 10%. Questi sono i numeri di partenza che inseriresti in un plugin vocoder o nel tag di pitch di un motore TTS.

L'intensità scala solo la densità delle pause

Lo slider cambia la frequenza con cui un tag di pausa atterra, da ogni 2 parole al 100% fino all'intervallo di base del preset al 0%, e su Glitch Stutter aumenta anche la frequenza di una ripetizione di sillaba. Non tocca mai i numeri di pitch o formante, quindi l'identità acustica rimane prevedibile.

L'output è uno script, non un rendering

Ottieni una trascrizione annotata come [pausa 120ms], lo stesso formato di marcatore che converteresti in un tag SSML break o che leggeresti durante una sessione vocale. Nessun audio viene generato e nulla al di là di un contatore di esecuzione anonimo esce dal tuo browser.

Domande dalla sessione

Il tag [pausa Xms] corrisponde alla sintassi SSML <break> che il mio motore TTS si aspetta?
Non direttamente. È un segnaposto di testo semplice che converti a mano: [pausa 120ms] diventa <break time="120ms"/> nella maggior parte dei motori compatibili con SSML, tra cui Amazon Polly, Azure Speech e l'API di AnyVoice. Il testo semplice mantiene la riga facile da incollare in un documento di script o in un foglio di sessione.
Perché Glitch Stutter salta parole brevi come 'il' o 'e'?
Lo stutter si applica solo a parole con 4 o più lettere principali, punteggiatura rimossa prima del controllo. Le parole funzionali sotto 4 lettere suonerebbero come glitch casuali invece di una trasmissione corrotta, quindi sono escluse da progettazione.
Posso eseguire 300 righe di NPC attraverso questo in una volta?
No, questo visualizza un'anteprima di una riga alla volta nel browser. È uno strumento di scoping per scegliere il preset giusto prima di impegnare un batch nella tua pipeline TTS o in una sessione di registrazione completa, non un processore batch.
Spostare lo slider di intensità cambia lo shift di pitch o di formante?
No. I numeri di pitch e formante rimangono fissi per preset, quindi la specifica che leggi dal pannello è accurata indipendentemente dalla posizione dello slider. L'intensità regola solo la frequenza delle pause e, su Glitch Stutter, la frequenza di ripetizione delle sillabe.
Da dove viene la linea di base di 150 wpm per il pacing stimato?
150 parole al minuto è il ritmo di narrazione comunemente citato nelle linee guida di produzione audiobook, con i deliverable in stile ACX che si fermano tra 150 e 160 wpm. Ogni preset applica il suo moltiplicatore di pacing a quella linea di base: Deep Drone gira a 0,6x per una lettura meccanica più lenta.
Viene generato effettivamente un audio qui?
No. Lo strumento emette solo testo, una trascrizione annotata calcolata nel tuo browser. Non c'è rendering TTS, nessun file audio e nessuna chiamata API esterna: l'intero calcolo viene eseguito lato client.
Quale preset legge più vicino a un annuncio PA rispetto a un'unità industriale pesante?
Vocoder Bot (+2 st, formante -30%) legge come una voce PA del canale di comunicazione. Deep Drone (-8 st, formante +10%, pause di 300ms) legge come un'unità industriale lenta e di grandi dimensioni. Monotone Synth si trova tra i due per una lettura tranquilla di computer di bordo.
Lo strumento archivia o invia il testo dello script da qualche parte?
No. La trascrizione viene calcolata interamente nel tuo browser e il testo che digiti non viene mai inviato a un server. L'unica chiamata di rete è un beacon di strumento anonimo che registra una visualizzazione di pagina, non il contenuto stesso.

Stai costruendo più di una singola riga?

Gli strumenti di voice cloning di AnyVoice coprono batch di dialogo NPC completi, narrazione audiobook multi-capitolo e consegna controllata dall'emozione oltre questi cinque preset robotici.