Résumé

Ce générateur de voix robot vous permet de taper une ligne et de la prévisualiser sous forme de transcript marquée avec balises de pause sur cinq présets : Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize et Deep Drone. Chaque préset porte des chiffres fixes de pitch shift et formant shift que vous entreriez dans un moteur TTS ou une chaîne vocoder, tandis que le curseur d'intensité ne change que la densité des pauses et, sur Glitch Stutter, la fréquence des répétitions de syllabes. Conçu pour les développeurs audio de jeux qui bloquent le dialogue NPC et les producteurs d'audiobooks qui vérifient une lecture robotisée avant un rendu complet, sans fichier audio, sans appel API externe, juste le script balisé.

Générateur de voix robot : prévisualisez 5 styles robot

Tapez une ligne, choisissez un préset, et obtenez une transcript marquée avec les chiffres de pitch, formant et pacing derrière, aucun rendu audio requis pour vérifier la lecture.

Générateur de voix robot

Choisissez un préset, tapez une ligne, et ajustez l'intensité. Le résultat est une transcript marquée avec balises, pas un fichier audio. Rien ne quitte votre navigateur sauf une balise de traçage anonyme.

Jusqu'à 600 caractères. C'est la ligne que vous verriez déposer dans un moteur TTS ou une feuille de session de VO.

Ajuste la densité des pauses (et la fréquence de bégaiement sur Glitch Stutter) uniquement. Les chiffres de pitch et formant restent fixes par préset.

Aperçu de la transcript marquée

Comment ça fonctionne

Ce que chaque préset change réellement

Signature acoustique fixe par préset

Chaque préset porte son propre décalage de pitch et décalage de formant. Vocoder Bot s'exécute à +2 demi-tons avec formant coupé de 30%, Deep Drone s'exécute à -8 demi-tons avec formant augmenté de 10%. Ce sont les chiffres de démarrage que vous entreriez dans un plugin vocoder ou dans une balise de pitch du moteur TTS.

L'intensité ajuste uniquement la densité des pauses

Le curseur change la fréquence d'arrivée d'une balise de pause, de tous les 2 mots à 100% à l'intervalle de base du préset à 0%, et sur Glitch Stutter il augmente aussi la fréquence de répétition d'une syllabe. Il ne touche jamais aux chiffres de pitch ou de formant, donc l'identité acoustique reste prévisible.

Le résultat est un script, pas un rendu

Vous obtenez une transcript marquée comme [pause 120ms], le même format de marqueur que vous convertiriez en balise SSML break ou que vous liriez lors d'une session vocale. Aucun audio n'est généré et rien au-delà d'un compteur de traçage anonyme ne quitte votre navigateur.

Questions de la session

La balise [pause Xms] correspond-elle à la syntaxe SSML <break> que mon moteur TTS attend ?
Pas directement. C'est un espace réservé en texte brut que vous convertissez à la main : [pause 120ms] devient <break time="120ms"/> dans la plupart des moteurs compatibles SSML, y compris Amazon Polly, Azure Speech et l'API propre d'AnyVoice. Le texte brut permet à la ligne d'être facilement collée dans un document de script ou une feuille de session.
Pourquoi Glitch Stutter ignore-t-il les mots courts comme « the » ou « and » ?
Le bégaiement ne s'applique qu'aux mots de 4 caractères ou plus du noyau, la ponctuation étant retirée avant la vérification. Les mots fonctionnels de moins de 4 caractères sonneraient comme un bégaiement aléatoire au lieu d'une transmission corrompue, donc ils sont exclus par conception.
Puis-je exécuter 300 lignes NPC à travers ceci en une seule fois ?
Non, cela prévisualise une ligne à la fois dans le navigateur. C'est un outil de portée pour choisir le bon préset avant de valider un lot dans votre pipeline TTS ou une session d'enregistrement complète, pas un processeur par lots.
Le déplacement du curseur d'intensité change-t-il le décalage de pitch ou de formant ?
Non. Les chiffres de pitch et de formant restent fixes par préset, donc la spécification que vous lisez sur le panneau est exacte indépendamment de la position du curseur. L'intensité n'ajuste que la fréquence des pauses et, sur Glitch Stutter, la fréquence de répétition des syllabes.
D'où vient la ligne de base de 150 wpm pour le pacing estimé ?
150 mots par minute est la cadence de narration couramment citée dans les directives de production d'audiobooks, avec les livraisons de style ACX se situant entre 150 et 160 wpm. Chaque préset applique son propre multiplicateur de pacing à cette ligne de base : Deep Drone s'exécute à 0,6x pour une lecture mécanique plus lente.
Y a-t-il réellement un audio généré ici ?
Non. L'outil génère du texte uniquement, une transcript marquée calculée dans votre navigateur. Il n'y a pas de rendu TTS, pas de fichier audio et pas d'appel API externe : le calcul entier s'exécute côté client.
Quel préset se rapproche le plus d'une annonce PA par rapport à une unité industrielle lourde ?
Vocoder Bot (+2 st, formant -30%) se lit comme une voix PA de canal de communication. Deep Drone (-8 st, formant +10%, pauses de 300 ms) se lit comme une unité industrielle lente et surdimensionnée. Monotone Synth se situe entre les deux pour une lecture calme d'ordinateur de bord.
L'outil stocke-t-il ou envoie-t-il mon texte de script quelque part ?
Non. La transcript est calculée entièrement dans votre navigateur et le texte que vous tapez n'est jamais envoyé à un serveur. Le seul appel réseau est une balise de traçage anonyme qui enregistre un affichage de page, pas le contenu lui-même.

Construisez plus qu'une ligne ponctuelle ?

Les outils de clonage vocal d'AnyVoice couvrent les lots de dialogues NPC complets, la narration d'audiobooks multi-chapitres, et la livraison contrôlée par émotion au-delà de ces cinq présets robotisés.