Summary

Ten generator głosu robota pozwala wpisać tekst i przejrzeć go jako transkrypt oznaczony pausami w pięciu presetach: Vocoder Bot, Synteza Monotonowa, Glitch ze Zakankami, 8-bit Kwantyzacja i Głębokie Drony. Każdy preset ma stałe wartości przesunięcia pitch i formant, które wpisałbyś do silnika TTS lub łańcucha vocoder, podczas gdy suwak intensywności zmienia tylko gęstość pauz oraz na Glitch ze Zakankami częstotliwość zakamków. Stworzone dla deweloperów audio gier opracowujących dialogi NPC i producentów audiobooków sprawdzających robotyczny czyt znaku przed pełnym renderowaniem — bez pliku audio, bez zewnętrznego API, tylko gotowy transkrypt.

Generator Głosu Robota: Sprawdź 5 Stylów Robotycznego Czytania

Wpisz tekst, wybierz preset i uzyskaj transkrypt oznaczony pausami z liczbami pitch, formant i tempa za nim, bez potrzeby generowania audio.

Generator głosu robota

Wybierz preset, wpisz tekst i dostosuj intensywność. Wynik to transkrypt oznaczony pausami, nie plik audio. Poza przeglądarką wychodzi tylko anonimowy sygnał wykonania.

Maksymalnie 600 znaków. To jest linia, którą wrzuciłbyś do silnika TTS lub arkusza sesji dubbingu.

Skaluje tylko gęstość pauz (i częstotliwość zakamków na Glitch ze Zakankami). Liczby pitch i formant pozostają stałe dla każdego presetu.

Podgląd transkryptu oznaczonego

Jak to działa

Co faktycznie zmienia każdy preset

Stała sygnatura akustyczna dla każdego presetu

Każdy preset ma własne przesunięcie pitch i formant. Vocoder Bot pracuje z +2 semitonami i cięciem formant 30%, Głębokie Drony używa -8 semitonów ze wzmocnionym o 10% formantem. To liczby początkowe, które wpisałbyś do pluginu vocoder lub tagu pitch silnika TTS. Te stałe wartości pozostają niezmieniąte niezależnie od suwaka intensywności.

Intensywność skaluje tylko gęstość pauz

Suwak zmienia jak często tag pauzy się pojawia, od co 2 wyrazy przy 100% do bazowego interwału presetu przy 0%, a na Glitch ze Zakankami także podnosi jak często powtarza się sylaba. Nigdy nie zmienia liczb pitch lub formant, więc tożsamość akustyczna pozostaje przewidywalna.

Wynik to skrypt, nie render

Otrzymujesz oznaczony transkrypt taki jak [pause 120ms], ten sam format znacznika jaki konwertujesz na tag SSML break lub czytasz podczas sesji głosowej. Żaden audio nie jest generowany i nic poza anonimowym licznikiem uruchomień nie opuszcza przeglądarki. Transkrypt obliczany jest całkowicie po stronie klienta w przeglądarce.

Pytania z sesji

Czy tag [pause Xms] odpowiada składni SSML <break>, którą oczekuje mój silnik TTS?
Nie bezpośrednio. To zwykły tekst zastępczy, który konwertujesz ręcznie: [pause 120ms] staje się <break time="120ms"/> w większości silników kompatybilnych z SSML, w tym Amazon Polly, Azure Speech i własnego API AnyVoice. Zwykły tekst utrzymuje linię łatwą do wklejenia do dokumentu skryptu lub arkusza sesji.
Dlaczego Glitch ze Zakankami pomija krótkie wyrazy jak 'the' czy 'and'?
Zakamek dotyczy tylko wyrazów z 4 lub więcej głoskami rdzenia, ze znakami interpunkcyjnymi usuniętymi przed sprawdzeniem. Wyrazy funkcyjne poniżej 4 liter brzmiałyby jak losowe glitche zamiast przerwanych transmisji, więc są wyłączone z projektu.
Czy mogę wrzucić 300 linii NPC na raz?
Nie, to tylko przegląda jedną linię na raz w przeglądarce. To narzędzie do wyboru odpowiedniego presetu przed oddaniem partii do potoku TTS lub pełnej sesji nagrania, a nie procesor wsadowy.
Czy przesuwanie suwaka intensywności zmienia przesunięcie pitch lub formant?
Nie. Liczby pitch i formant pozostają stałe dla każdego presetu, więc specyfikacja którą czytasz z panelu jest dokładna niezależnie od położenia suwaka. Intensywność reguluje tylko częstotliwość pauz i na Glitch ze Zakankami częstotliwość powtarzających się sylab.
Skąd pochodzi bazowa linia 150 słów na minutę do szacunkowego tempa?
150 słów na minutę to tempo narracji powszechnie cytowane w wytycznych produkcji audiobook, przy czym dostawy ACX lądują między 150 a 160 słów na minutę. Każdy preset stosuje własny mnożnik tempa do tej linii bazowej: Głębokie Drony biegnie z 0,6x dla wolniejszego mechanicznego czytania.
Czy tutaj generuje się jakiś dźwięk?
Nie. Narzędzie wyświetla tylko tekst, transkrypt oznaczony obliczony w przeglądarce. Nie ma renderowania TTS, nie ma pliku audio i nie ma zewnętrznego połączenia API: całe obliczenie biegnie po stronie klienta.
Który preset czyta najbliżej ogłoszenia PA kontra ciężka jednostka przemysłowa?
Vocoder Bot (+2 st, formant -30%) czyta jak głos PA kanału łączności. Głębokie Drony (-8 st, formant +10%, pauzy 300ms) czyta jak powolna gigantyczna jednostka przemysłowa. Synteza Monotonowa siedzi pomiędzy nimi dla spokojnego czytania pokładowego komputera.
Czy narzędzie gdzieś przechowuje lub wysyła mój tekst skryptu?
Nie. Transkrypt jest obliczany całkowicie w przeglądarce i tekst który wpiszesz nigdy nie jest wysyłany na serwer. Jedyne połączenie sieciowe to anonimowy sygnał uruchomienia narzędzia który rejestruje widok strony, nie zawartość.

Budujesz więcej niż jedną linię?

Narzędzia klonowania głosu AnyVoice obejmują partie dialogów NPC, narrację wielorozdziałowych audiobooków i dostarczanie kontrolowane emocjami poza tymi pięcioma robotycznymi presetami.