Samenvatting

Deze robotstem generator laat je een tekstlijn intypen en bekijken als een pauze-getagde transcript over vijf voorinstellingen: Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize en Deep Drone. Elke voorinstelling heeft vaste pitch- en formant-verschuivingen die je zou invoeren in een TTS-engine of vocoder-ketting. De intensiteitsschuif wijzigt alleen de pauze-dichtheid en, bij Glitch Stutter, de stutter-frequentie. Gebouwd voor game audio developers die NPC-dialogen blokkeren en audiobook-producers die een robotische karakterlezen controleren voordat ze voluit renderen - geen audiobestand, geen externe API-aanroep, alleen de getagde script.

Robotstem Generator: 5 Stijlen Robotische Uitspraak

Type een tekstlijn, kies een voorinstelling, en krijg een pauze-getagde transcript met de pitch-, formant- en tempo-waarden eraan - geen audio-rendering vereist om het te controleren.

Robotstem generator

Selecteer een voorinstelling, type een tekstlijn, en stel de intensiteit in. De uitvoer is een pauze-getagde transcript, geen audiobestand. Niets verlaat je browser behalve een anoniem run-baken.

Maximaal 600 tekens. Dit is de regel die je in een TTS-engine of VO-sessieblad zou invoegen.

Regelt alleen pauze-dichtheid (en stutter-frequentie bij Glitch Stutter). Pitch- en formant-waarden blijven vast per voorinstelling.

Getagde transcript preview

Hoe het werkt

Wat elke voorinstelling werkelijk verandert

Vaste akoestische karakteristiek per voorinstelling

Elke voorinstelling heeft zijn eigen pitch-verschuiving en formant-verschuiving. Vocoder Bot draait +2 halftonen met formant 30% verlaagd, Deep Drone draait -8 halftonen met formant 10% verhoogd. Dit zijn de startgetallen die je in een vocoder-plugin of TTS-engine's pitch-tag zou invoeren.

Intensiteit regelt alleen pauze-dichtheid

De schuif verandert hoe vaak een pauze-tag landde, van elke 2 woorden bij 100% tot de standaardinterval van de voorinstelling bij 0%, en bij Glitch Stutter verhoogt het ook hoe vaak een lettergreep wordt herhaald. Het raakt nooit de pitch- of formant-nummers aan, dus de akoestische identiteit blijft voorspelbaar.

Uitvoer is een script, geen render

Je krijgt een getagde transcript zoals [pause 120ms], dezelfde markeringsnotatie die je in een SSML break-tag zou omzetten of voorleest in een spraaksessie. Geen audio wordt gegenereerd en niets behalve een anonieme run-teller verlaat je browser.

Vragen van de sessie

Komt de [pause Xms]-tag overeen met de SSML <break>-syntaxis die mijn TTS-engine verwacht?
Niet direct. Het is een platte-tekstholder die je met de hand omzet: [pause 120ms] wordt <break time="120ms"/> in de meeste SSML-compatibele engines, waaronder Amazon Polly, Azure Speech en AnyVoice's eigen API. Platte tekst houdt de regel gemakkelijk om in een scriptdocument of sessieblad te plakken.
Waarom slaat Glitch Stutter korte woorden over zoals 'the' of 'and'?
De stutter geldt alleen voor woorden met 4 of meer kernletters, na het verwijderen van leestekens. Functiewoorden onder de 4 letters zouden klinken als willekeurig glitching in plaats van een versleuterde uitzending, dus ze worden ontwerp als uitgesloten.
Kan ik 300 NPC-regels tegelijk door dit heen lopen?
Nee, dit geeft een voorbeeld van een regel tegelijk in de browser. Het is een bereiktool voor het kiezen van de juiste voorinstelling voordat je een batch aan je TTS-pipeline of een volledige opnamesessie inlevert, geen batchprocessor.
Verandert het verplaatsen van de intensiteitsschuif de pitch- of formant-verschuiving?
Nee. Pitch- en formant-getallen blijven vast per voorinstelling, dus de spec die je van het paneel afliest, is nauwkeurig ongeacht de schuifpositie. Intensiteit past alleen pausefrequentie aan en, bij Glitch Stutter, stutter-herhalingsfrequentie.
Waar komt de 150 wpm-baseline voor geschat tempo vandaan?
150 woorden per minuut is het narratietempo dat veel wordt aangehaald in richtlijnen voor audioboekproductie, met ACX-stijlaflevering tussen 150 en 160 wpm. Elke voorinstelling past zijn eigen tempopleier toe op die baseline: Deep Drone draait 0,6x voor een langzamer mechanisch lezen.
Wordt hier werkelijk audio gegenereerd?
Nee. De tool geeft alleen tekst uit, een getagde transcript berekend in je browser. Er is geen TTS-render, geen audiobestand en geen externe API-aanroep: de hele berekening wordt lokaal uitgevoerd.
Welke voorinstelling klinkt het dichtst bij een PA-aankondiging versus een zware industriële unit?
Vocoder Bot (+2 st, formant -30%) klinkt als een communicatiekanaal PA-stem. Deep Drone (-8 st, formant +10%, 300ms pauzes) klinkt als een langzaam, groot industrieel apparaat. Monotone Synth zit ertussenin voor een kalm boordcomputerlezen.
Slaat de tool mijn scripttekst op of verzendt het ergens heen?
Nee. De transcript wordt volledig in je browser berekend en de tekst die je typt wordt nooit naar een server verzonden. De enige netwerkaanroep is een anoniem tool-run-baken dat een paginaweergave vastlegt, niet de inhoud zelf.

Bouw je meer dan een eenmalige regel?

De voice cloning tools van AnyVoice dekken volledige NPC-dialoogbatches, audioboeken met meerdere hoofdstukken en op emoties gecontroleerde levering buiten deze vijf robotische voorinstellingen.