Summary

Generator suara robot ini memungkinkan Anda mengetik baris dan melihat pratinjau transkripsi bertanda jeda di lima preset: Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize, dan Deep Drone. Setiap preset membawa pergeseran pitch dan formant tetap yang akan Anda masukkan ke mesin TTS atau rantai vocoder, sementara slider intensitas hanya mengubah kepadatan jeda dan, pada Glitch Stutter, frekuensi pengulangan suku kata. Dibangun untuk developer audio game yang membuat naskah dialog NPC dan produser audiobook yang memeriksa karakter mekanis sebelum render lengkap, tanpa file audio, tanpa panggilan API eksternal, hanya naskah bertanda.

Generator Suara Robot: Pratinjau 5 Gaya Pengucapan Mekanis

Ketik baris, pilih preset, dan dapatkan transkripsi bertanda jeda dengan angka pitch, formant, dan pacing di belakangnya, tidak perlu render audio untuk memeriksa bacaan.

Generator suara robot

Pilih preset, ketik baris, dan sesuaikan intensitas. Output adalah transkripsi bertanda jeda, bukan file audio. Hanya beacon anonim yang meninggalkan browser Anda.

Hingga 600 karakter. Ini adalah baris yang akan Anda masukkan ke mesin TTS atau lembar sesi VO.

Menskalakan kepadatan jeda (dan frekuensi stutter pada Glitch Stutter) saja. Angka pitch dan formant tetap per preset.

Pratinjau transkripsi bertanda

Cara kerjanya

Apa yang sebenarnya berubah di setiap preset

Tanda tangan akustik tetap per preset

Setiap preset membawa pergeseran pitch dan formantnya sendiri. Vocoder Bot berjalan +2 semitone dengan potongan formant 30%, Deep Drone berjalan -8 semitone dengan formant naik 10%. Ini adalah angka awal yang akan Anda ketik ke plugin vocoder atau tag pitch mesin TTS.

Intensitas menskalakan kepadatan jeda saja

Slider mengubah seberapa sering tag jeda mendarat, dari setiap 2 kata pada 100% turun ke interval baseline preset pada 0%, dan pada Glitch Stutter juga menaikkan seberapa sering suku kata berulang. Tidak pernah menyentuh angka pitch atau formant, jadi identitas akustik tetap dapat diprediksi.

Output adalah naskah, bukan render

Anda mendapatkan transkripsi bertanda seperti [jeda 120ms], format penanda yang sama dengan yang akan Anda ubah menjadi tag break SSML atau baca selama sesi suara. Tidak ada audio yang dihasilkan dan tidak ada yang meninggalkan browser Anda kecuali penghitung run anonim.

Pertanyaan dari sesi

Apakah tag [jeda Xms] cocok dengan sintaks SSML <break> yang diharapkan mesin TTS saya?
Tidak langsung. Ini adalah placeholder teks biasa yang Anda ubah dengan tangan: [jeda 120ms] menjadi <break time="120ms"/> di sebagian besar mesin kompatibel SSML, termasuk Amazon Polly, Azure Speech, dan API AnyVoice sendiri. Teks biasa membuat baris mudah ditempel ke dokumen naskah atau lembar sesi.
Mengapa Glitch Stutter melewati kata-kata pendek seperti 'the' atau 'and'?
Stutter hanya berlaku pada kata dengan 4 atau lebih huruf inti, tanda baca yang dilepas sebelum pemeriksaan. Kata fungsi di bawah 4 huruf akan terdengar seperti glitching acak alih-alih transmisi yang rusak, jadi mereka dikecualikan oleh desain.
Bisakah saya menjalankan 300 baris NPC melalui ini sekaligus?
Tidak, ini menampilkan pratinjau satu baris setiap kali di browser. Ini adalah alat penjangkauan untuk memilih preset yang tepat sebelum Anda menyelesaikan batch ke pipeline TTS Anda atau sesi recording penuh, bukan pemroses batch.
Apakah menggerakkan slider intensitas mengubah pergeseran pitch atau formant?
Tidak. Angka pitch dan formant tetap per preset, jadi spek yang Anda baca dari panel akurat terlepas dari posisi slider. Intensitas hanya menyesuaikan frekuensi jeda dan, pada Glitch Stutter, frekuensi pengulangan suku kata.
Dari mana dasar 150 wpm untuk pacing yang diperkirakan berasal?
150 kata per menit adalah pace narasi yang dikutip secara umum dalam panduan produksi audiobook, dengan pengiriman gaya ACX mendarat antara 150 dan 160 wpm. Setiap preset menerapkan pengali pacingnya sendiri ke dasar itu: Deep Drone berjalan pada 0,6x untuk bacaan mekanis yang lebih lambat.
Apakah audio sebenarnya dihasilkan di sini?
Tidak. Alat menampilkan teks saja, transkripsi bertanda yang dihitung di browser Anda. Tidak ada render TTS, tidak ada file audio, dan tidak ada panggilan API eksternal: seluruh perhitungan berjalan sisi klien.
Preset mana yang berbunyi paling dekat dengan pengumuman PA versus unit industri berat?
Vocoder Bot (+2 st, formant -30%) berbunyi seperti suara PA saluran comms. Deep Drone (-8 st, formant +10%, jeda 300ms) berbunyi seperti unit industri besar yang lambat. Monotone Synth duduk di antara keduanya untuk bacaan komputer onboard yang tenang.
Apakah alat menyimpan atau mengirim teks naskah saya ke mana pun?
Tidak. Transkripsi dihitung sepenuhnya di browser Anda dan teks yang Anda ketik tidak pernah dikirim ke server. Satu-satunya panggilan jaringan adalah beacon anonim yang mencatat tampilan halaman, bukan konten itu sendiri.

Membangun lebih dari sekadar satu baris?

Alat kloning suara AnyVoice mencakup batch dialog NPC penuh, narasi audiobook multi-bab, dan pengiriman yang dikendalikan emosi di luar lima preset mekanis ini.