Zusammenfassung

Dieses kostenlose Spanisch-Text-to-Speech-Tool verwandelt ein einfaches Skript in eine Version mit Pausen- und Betonungstags, bereit für die Erzählung oder eine Sprachengine wie AnyVoice. Wähle einen regionalen Akzent, Kastilisch, Mexikanisch, neutrales Lateinamerikanisch oder Rioplatense, stelle einen Pausenstil ein und höre dir das Ergebnis mit der eingebauten spanischen Stimme deines Browsers an: kein Upload, kein Konto, keine Serveranfrage. Der Formatter schätzt die Sprechdauer anhand von 150 Wörtern pro Minute, skaliert mit deinem Tempo-Regler, und markiert lange Pausen, kurze Pausen und betonte Wörter, damit das Skript direkt in eine SSML-fähige Produktionspipeline passt.

Spanisch Text-to-Speech-Skripte mit regionalen Akzent-Tags formatieren

Füge ein Skript ein, wähle kastilisches, mexikanisches, neutrales lateinamerikanisches oder Rioplatense-Spanisch, und erhalte Pausen- und Betonungstags plus eine kostenlose Browser-Vorschau, bevor du eine kostenpflichtige Sprachengine anfasst.

Spanisch-TTS-Skriptformatierer & Sprachvorschau

Füge dein spanisches Skript ein, wähle einen regionalen Akzent und Pausenstil, und höre es dir mit der im Browser eingebauten Stimme an. Das getaggte Skript unten kannst du direkt in AnyVoice oder jede SSML-fähige Engine einfügen.

So funktioniert's

So funktioniert der Spanisch-TTS-Formatter

Akzentbewusste Phonetik

Wähle kastilisches Spanisch, Mexikanisch, neutrales Lateinamerikanisch oder Rioplatense-Argentinisch. Jede Variante ist einem BCP-47-Tag zugeordnet (es-ES, es-MX, es-419, es-AR), damit die Browser-Vorschau eine passende Systemstimme wählt, sofern eine installiert ist.

Pausen-Tags aus der Zeichensetzung

Kommas, Doppelpunkte und Semikolons erhalten ein kurzes Pausen-Tag, satzschließende Zeichen ein längeres. Die Dauer ändert sich je nach Pausenstil: locker-gesprächig, dramatische Erzählung oder schneller Dialog.

Dauerabschätzung

Die Wortanzahl geteilt durch 150 Wörter pro Minute, skaliert mit deinem Tempo-Regler, ergibt eine Sprechdauer-Schätzung, bevor du Studiozeit für die Aufnahme einplanst. Sie aktualisiert sich bei jedem Tastenanschlag, sodass du ein Skript so lange kürzt, bis es in einen 30-Sekunden-Werbespot oder einen 90-Sekunden-Erklärfilm passt, ohne zu raten.

Akzent-Leitfaden

Den richtigen regionalen Akzent wählen

Kastilisch (es-ES)

Distinción zwischen c/z und s. Der Standard für Firmen-IVR und Inhalte für den spanischen Markt.

Neutrales Lateinamerikanisch (es-419)

Seseo, weicherer Rhythmus. Die sicherste Standardwahl für überregionale Hörbücher und E-Learning-Module.

Rioplatense (es-AR)

Voseo und Sheísmo, der y/ll-Laut verschiebt sich Richtung sch. Nutze diesen Akzent, wenn das Briefing ausdrücklich einen argentinischen oder uruguayischen Sprecher verlangt, oder wenn die regionale Identität eines Spiel-NPCs Teil des Charakterbriefings ist.

Vom Skript zur Vorschau in drei Schritten

  1. 1

    Einfügen und taggen

    Füge dein spanisches Skript in das Feld ein. Satzzeichen werden automatisch zu Pausen-Tags; setze ein Wort in Sternchen oder schreibe es in GROSSBUCHSTABEN, um eine Betonung zu markieren.

  2. 2

    Akzent und Tempo einstellen

    Wähle einen regionalen Akzent und einen Pausenstil, und stelle dann den Tempo-Regler ein. Wortanzahl und Dauerabschätzung aktualisieren sich bei jeder Änderung.

  3. 3

    Vorschau oder Export

    Spiele die Browser-Vorschau ab, um das Timing zu prüfen, und kopiere das getaggte Skript dann in AnyVoice oder deine bevorzugte SSML-fähige Engine. Die Session-Notiz: Browser-Vorschauen nutzen die Systemstimme, die zufällig auf dem Betriebssystem des Besuchers installiert ist, also gilt sie als Timing-Check, nicht als finale Mix-Referenz.

Häufige Fragen

Erzeugt das Tool die tatsächliche KI-Sprachaudiodatei?
Nein. Der Vorschau-Button nutzt die im Browser eingebaute speechSynthesis-API und die installierte spanische Systemstimme, keine geklonte Stimme. Für eine geklonte, emotional steuerbare spanische Stimme führst du das getaggte Skript durch AnyVoice.
Warum hat mein Browser keine spanische Stimmoption?
Die Verfügbarkeit von Stimmen hängt vom Betriebssystem ab, nicht von diesem Tool. Windows und macOS liefern standardmäßig mindestens eine es-ES- oder es-MX-Stimme mit; manche Chrome-OS- und Android-Builds fügen erst eine hinzu, nachdem du das spanische Sprachpaket installiert hast.
Kann ich die Break- und Emphasis-Tags in ElevenLabs oder Amazon Polly einfügen?
Die Tag-Syntax entspricht den break-time- und emphasis-Elementen von SSML, die Polly, Azure und die erweiterte Pipeline von AnyVoice akzeptieren. Manche Engines erwarten die Tags eingebettet in ein vollständiges speak-Envelope, prüfe also vor einem Produktionslauf die Dokumentation deiner Engine.
Wie wird die Dauerabschätzung berechnet?
Die Wortanzahl wird durch 150 Wörter pro Minute geteilt, ein gängiger Richtwert für das Sprechtempo bei neutraler Erzählung, skaliert mit dem Tempo-Regler. Das ist eine Schätzung, keine framegenaue Renderzeit.
Gibt es ein Zeichenlimit?
Es gibt kein hartes Limit, aber die Browser-speechSynthesis gerät bei etwa 30.000 Zeichen in einer einzigen Äußerung ins Stocken, und manche Engines kürzen auch lange Einzel-SSML. Teile lange Kapitel für Vorschau und Produktionspipeline in Szenen auf; Wortanzahl und Dauerabschätzung aktualisieren sich sofort, sodass du jede Szene passend zuschneiden kannst.
Speichert oder sendet das Tool mein Skript irgendwohin?
Nein. Alles läuft in deinem Browser-Tab. Nichts wird hochgeladen, protokolliert oder an einen Server gesendet, abgesehen von einem anonymen Tool-Run-Beacon ohne Textinhalt.
Welchen Akzent sollte ich für IVR im Vergleich zur Hörbuch-Erzählung verwenden?
IVR-Systeme und Firmentelefonzentralen in Spanien setzen standardmäßig auf Kastilisch; überregionale Hörbücher und E-Learning tendieren zu neutralem Lateinamerikanisch (es-419); Spiellokalisierung mit Setting in Argentinien oder Uruguay verlangt Rioplatense. Wenn ein Projekt gleichzeitig ganz Lateinamerika beliefert, bleibt es-419 die sicherste Einzeltrack-Wahl.

Bereit für eine geklonte spanische Stimme statt einer Browser-Vorschau?

AnyVoice klont eine spanische Stimme aus einem 30-Sekunden-Sample und gibt dir 8 Echtzeit-Emotions-Slider, mehr Kontrolle, als eine System-TTS-Stimme bieten kann.