Zusammenfassung

Dieser Roboterstimme Generator ermöglicht es Ihnen, eine Zeile einzugeben und eine Vorschau davon als pausentaggierte Transkription über fünf Voreinstellungen anzuzeigen: Vocoder Bot, Monotone Synth, Glitch Stutter, 8-bit Quantize und Deep Drone. Jede Voreinstellung hat feste Tonhöhen- und Formantverschiebungswerte, die Sie in ein TTS-System oder eine Vocoder-Kette eingeben würden, während der Intensitätsschieber nur die Pausendichte und beim Glitch Stutter die Silbenwiederholungsfrequenz ändert. Konzipiert für Game-Audio-Entwickler, die NPC-Dialoge planen, und Hörbuchproduzenten, die einen robotischen Charaktereintrag vor einem vollständigen Rendering überprüfen – kein Audio-Dateienerzeugung, keine externe API-Aufrufe, nur das tagierte Skript.

Roboterstimme Generator: Vorschau von 5 robotischen Sprachstilen

Geben Sie eine Zeile ein, wählen Sie eine Voreinstellung und erhalten Sie eine pausentaggierte Transkription mit den Pitch-, Formant- und Sprechgeschwindigkeitswerten dahinter – kein Audio-Rendering erforderlich, um den Vortrag zu überprüfen.

Roboterstimme Generator

Wählen Sie eine Voreinstellung, geben Sie eine Zeile ein und passen Sie die Intensität an. Die Ausgabe ist eine pausentaggierte Transkription, kein Audiofile. Es wird nichts von Ihrem Browser außer einem anonymen Nutzungs-Beacon versendet.

Bis zu 600 Zeichen. Dies ist die Zeile, die Sie in ein TTS-System oder ein Sprech-Sitzungsblatt eingeben würden.

Skaliert nur die Pausendichte (und die Stotterfrequenz beim Glitch Stutter). Pitch- und Formant-Werte bleiben pro Voreinstellung fest.

Transkriptionsvorschau mit Tags

Wie es funktioniert

Was jede Voreinstellung wirklich ändert

Feste akustische Signatur pro Voreinstellung

Jede Voreinstellung hat ihren eigenen Pitch-Versatz und Formant-Versatz. Vocoder Bot läuft mit +2 Halbtönen und 30% Formant-Reduktion, Deep Drone mit -8 Halbtönen und 10% Formant-Anhebung. Dies sind die Startwerte, die Sie in ein Vocoder-Plugin oder die Pitch-Tags eines TTS-Systems eingeben würden.

Intensität skaliert nur die Pausendichte

Der Schieber ändert, wie oft ein Pause-Tag erscheint – von alle 2 Wörter bei 100% bis zum Basis-Intervall der Voreinstellung bei 0% – und beim Glitch Stutter erhöht er auch, wie oft eine Silbe wiederholt wird. Er berührt niemals die Pitch- oder Formant-Werte, daher bleibt die akustische Identität vorhersehbar.

Die Ausgabe ist ein Skript, kein Rendering

Sie erhalten eine tagierte Transkription wie [Pause 120ms], das gleiche Marker-Format, das Sie in ein SSML-Break-Tag umwandeln oder während einer Sprech-Sitzung vorlesen würden. Es wird kein Audio erzeugt und nichts außer einem anonymen Nutzungszähler verlässt Ihren Browser.

Fragen aus der Sitzung

Entspricht das [Pause Xms]-Tag der SSML-<break>-Syntax, die mein TTS-Engine erwartet?
Nicht direkt. Es ist ein einfaches Platzhalter-Tag, das Sie manuell konvertieren: [Pause 120ms] wird zu <break time="120ms"/> in den meisten SSML-kompatiblen Engines, einschließlich Amazon Polly, Azure Speech und der eigenen API von AnyVoice. Einfacher Text ermöglicht es, die Zeile einfach in ein Skript-Dokument oder ein Sitzungsblatt einzufügen.
Warum überspringt Glitch Stutter kurze Wörter wie 'the' oder 'and'?
Das Stottern gilt nur für Wörter mit 4 oder mehr Kernbuchstaben, nach Entfernung der Interpunktion geprüft. Funktionswörter unter 4 Buchstaben würden wie zufälliges Glitching klingen, anstatt eine beschädigte Übertragung zu simulieren, daher sind sie designbedingt ausgeschlossen.
Kann ich 300 NPC-Zeilen auf einmal durch dieses Tool laufen lassen?
Nein, dies zeigt eine Zeile auf einmal im Browser an. Es ist ein Werkzeug zum Definieren des Bereichs für die richtige Voreinstellung, bevor Sie einen Batch in Ihre TTS-Pipeline oder eine vollständige Aufnahmesitzung einbinden – kein Batch-Prozessor.
Ändert das Bewegen des Intensitätsschiebers die Pitch- oder Formant-Verschiebung?
Nein. Pitch- und Formant-Werte bleiben pro Voreinstellung fest, daher ist die Spezifikation, die Sie im Panel lesen, unabhängig von der Schieber-Position genau. Die Intensität passt nur die Pausenfrequenz an und beim Glitch Stutter die Silbenwiederholungsfrequenz.
Woher kommt die 150-wpm-Grundlage für die geschätzte Sprechgeschwindigkeit?
150 Wörter pro Minute ist die Narrations-Geschwindigkeit, die in Hörbuch-Produktions-Richtlinien üblicherweise zitiert wird, mit ACX-Liefervorgaben zwischen 150 und 160 wpm. Jede Voreinstellung wendet ihren eigenen Sprechgeschwindigkeits-Multiplikator auf diese Basis an: Deep Drone läuft bei 0,6x für eine langsamere mechanische Lesart.
Wird hier wirklich Audio erzeugt?
Nein. Das Tool gibt nur Text aus – eine tagierte Transkription, die in Ihrem Browser berechnet wird. Es gibt kein TTS-Rendering, kein Audio-Dateienerzeugung und keinen externen API-Aufruf: die gesamte Berechnung läuft klientseitig.
Welche Voreinstellung klingt am ehesten nach einer PA-Ankündigung versus einer schweren Industrieeinheit?
Vocoder Bot (+2 st, Formant -30%) klingt wie eine Kommunikationskanal-PA-Stimme. Deep Drone (-8 st, Formant +10%, 300-ms-Pausen) klingt wie eine langsame, übergroße Industrieeinheit. Monotone Synth sitzt dazwischen für eine ruhige Bordcomputer-Lesart.
Speichert oder sendet das Tool meinen Skripttext irgendwo?
Nein. Die Transkription wird vollständig in Ihrem Browser berechnet und der Text, den Sie eingeben, wird nie an einen Server gesendet. Der einzige Netzwerk-Aufruf ist ein anonymer Werkzeug-Nutzungs-Beacon, das einen Seitenaufruf erfasst, nicht den Inhalt selbst.

Bauen Sie mehr als nur eine einzelne Zeile?

Die Voice-Cloning-Tools von AnyVoice decken vollständige NPC-Dialog-Batches, mehrkaptelige Hörbuch-Narration und emotiongesteuerte Vortragsweisen jenseits dieser fünf robotischen Voreinstellungen ab.