요약

이 로봇 음성 생성기는 텍스트를 입력하고 5가지 프리셋으로 미리보기할 수 있습니다: Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize, Deep Drone. 각 프리셋은 TTS 엔진이나 보코더 체인에 입력할 고정 음성 높낮이와 포먼트 수치를 갖고 있으며, 강도 슬라이더는 일시정지 밀도와 Glitch Stutter의 음절 반복 빈도만 조절합니다. 게임 오디오 개발자가 NPC 대사 100개를 블록하거나 오디오북 제작자가 기계음 캐릭터 읽기를 전체 렌더링 전에 확인할 때 용이하며, 오디오 파일 생성 없음, 외부 API 호출 없음, 오직 태그된 스크립트만 제공합니다.

로봇 음성 생성기: 5가지 기계음 전달 스타일 미리보기

텍스트를 입력하고 프리셋을 선택한 후, 음성 높낮이, 포먼트, 속도 수치가 포함된 일시정지 태그 스크립트를 얻으세요. 읽기를 확인하기 위해 오디오 렌더링이 필요 없습니다.

로봇 음성 생성기

프리셋을 선택하고 텍스트를 입력한 후 강도를 조절하세요. 출력은 일시정지 태그가 포함된 스크립트이며 오디오 파일이 아닙니다. 익명의 실행 비콘만 브라우저를 벗어나갑니다.

최대 600자입니다. 이것이 TTS 엔진이나 음성 세션 시트에 입력할 라인입니다.

일시정지 밀도와 Glitch Stutter의 음절 반복 빈도만 조절합니다. 음성 높낮이와 포먼트 수치는 프리셋당 고정됩니다.

태그된 스크립트 미리보기

작동 원리

각 프리셋이 실제로 변경하는 것

프리셋당 고정 음향 특성

각 프리셋은 자체의 음성 높낮이 이동과 포먼트 이동을 갖습니다. Vocoder Bot은 +2 반음과 30% 포먼트 감소로, Deep Drone은 -8 반음과 10% 포먼트 증가로 실행됩니다. 이것이 보코더 플러그인이나 TTS 엔진에 입력할 시작 수치입니다.

강도는 일시정지 밀도만 조절합니다

슬라이더는 일시정지 태그가 몇 단어마다 표시되는지를 변경하며, 100%에서는 2단어마다, 0%에서는 프리셋의 기본 간격으로 조절됩니다. Glitch Stutter에서는 음절 반복 빈도도 높입니다. 음성 높낮이나 포먼트 수치는 절대 변하지 않아서 음향 정체성이 예측 가능합니다.

출력은 렌더링이 아닌 스크립트입니다

[pause 120ms]와 같은 태그된 스크립트를 받으며, 이것이 SSML break 태그로 변환하거나 음성 세션 중에 읽을 수 있는 마커 형식입니다. 오디오는 생성되지 않으며 익명의 실행 카운터 외에는 브라우저를 벗어나지 않습니다.

세션에서 나온 질문들

[pause Xms] 태그가 TTS 엔진이 예상하는 SSML <break> 문법과 일치합니까?
직접적이지는 않습니다. Amazon Polly, Azure Speech, AnyVoice의 자체 API를 포함한 대부분의 SSML 호환 엔진에서 직접 변환하는 평문 플레이스홀더입니다: [pause 120ms]는 <break time="120ms"/>가 됩니다. 평문은 스크립트 문서나 세션 시트에 붙여넣기 쉽게 합니다.
Glitch Stutter가 'the'나 'and' 같은 짧은 단어를 왜 건너뜁니까?
음절 반복은 4글자 이상의 핵심 글자를 가진 단어에만 적용되며, 검사 전에 구두점이 제거됩니다. 4글자 미만의 기능 단어는 임의의 글리칭처럼 들리지 않고 손상된 전송처럼 들리므로 의도적으로 제외됩니다.
300개의 NPC 라인을 한 번에 이 도구로 처리할 수 있습니까?
아니요, 이것은 브라우저에서 한 번에 한 라인을 미리봅니다. 전체 TTS 파이프라인이나 전체 녹음 세션을 시작하기 전에 올바른 프리셋을 선택하기 위한 스코핑 도구일 뿐, 배치 프로세서가 아닙니다.
강도 슬라이더를 움직이면 음성 높낮이나 포먼트 이동이 변합니까?
아니요. 음성 높낮이와 포먼트 수치는 프리셋당 고정되므로, 슬라이더 위치에 관계없이 패널에서 읽은 스펙은 정확합니다. 강도는 일시정지 빈도와 Glitch Stutter의 음절 반복 빈도만 조절합니다.
예상 속도를 위한 150 wpm 기본값이 어디서 나왔습니까?
분당 150단어는 오디오북 제작 지침에서 일반적으로 인용되는 나레이션 속도이며, ACX 스타일 결과물은 분당 150-160단어 범위에 있습니다. 각 프리셋은 자체의 속도 배수를 해당 기본값에 적용합니다: Deep Drone은 더 느린 기계적 읽기를 위해 0.6배로 실행됩니다.
실제로 여기서 오디오가 생성됩니까?
아니요. 도구는 텍스트만 출력하며, 브라우저에서 계산한 태그된 스크립트입니다. TTS 렌더링 없음, 오디오 파일 없음, 외부 API 호출 없음: 전체 계산은 클라이언트 측에서 실행됩니다.
어느 프리셋이 PA 공지보다는 거대한 산업 장비처럼 들립니까?
Vocoder Bot(+2 st, 포먼트 -30%)은 통신 채널 PA 음성처럼 들립니다. Deep Drone(-8 st, 포먼트 +10%, 300ms 일시정지)은 느리고 거대한 산업 장비처럼 들립니다. Monotone Synth은 위협적이지 않은 함선 컴퓨터 읽기를 위해 그 사이에 있습니다.
도구가 스크립트 텍스트를 어디든 저장하거나 보냅니까?
아니요. 스크립트는 브라우저에서 완전히 계산되며, 입력한 텍스트는 절대로 서버로 전송되지 않습니다. 유일한 네트워크 호출은 익명의 도구 실행 비콘이며, 내용 자체가 아닌 페이지 뷰를 기록합니다.

일회용 라인 이상을 구축합니까?

AnyVoice의 음성 클론 도구는 전체 NPC 대사 배치, 다중 장 오디오북 나레이션, 5가지 기계음 프리셋을 넘어선 감정 제어 전달을 다룹니다.