要約

この無料のスペイン語テキスト読み上げツールは、台本をポーズと強調タグ付きのバージョンに変換し、ナレーションやAnyVoiceのような音声エンジンにそのまま使えるようにします。カスティーリャ、メキシコ、中南米ニュートラル、リオプラテンセから地域アクセントを選び、ポーズスタイルを設定すれば、ブラウザ内蔵のスペイン語音声で結果をプレビューできます。アップロードもアカウント登録もサーバーとの通信も不要です。フォーマッターは毎分150語の基準値を速度スライダーで調整して発話時間を予測し、長いポーズ、短いポーズ、強調語にタグを付けるので、台本はそのままSSML対応の制作パイプラインに投入できます。

スペイン語テキスト読み上げ台本に地域アクセントタグを付与

台本を貼り付けて、カスティーリャ、メキシコ、中南米ニュートラル、リオプラテンセのいずれかを選ぶと、ポーズと強調のタグ付けに加え、有料の音声エンジンを使う前にブラウザで無料プレビューできます。

スペイン語TTS台本フォーマッター&音声プレビュー

スペイン語の台本を貼り付け、地域アクセントとポーズスタイルを選んでください。ブラウザ内蔵の音声でプレビューできます。下のタグ付き台本はAnyVoiceや他のSSML対応エンジンにそのまま貼り付けられます。

使い方

スペイン語TTSフォーマッターの仕組み

アクセント対応の音声表現

スペイン本国のカスティーリャ、メキシコ、中南米ニュートラル、アルゼンチンのリオプラテンセから選べます。それぞれBCP-47タグ(es-ES、es-MX、es-419、es-AR)に対応しているため、該当する音声がインストールされていればブラウザプレビューで一致する音声が使われます。

句読点から生成するポーズタグ

カンマ、コロン、セミコロンには短いブレークタグ、文末の句読点には長いブレークタグが付きます。ポーズスタイル(会話調、ドラマチック、早口の会話)によって長さが変わります。

所要時間の予測

語数を毎分150語で割り、再生速度スライダーで調整した値が発話時間の目安になります。1文字入力するたびに更新されるため、30秒のCM尺や90秒の説明尺に収まるよう、勘に頼らずに台本を調整できます。

アクセントガイド

地域アクセントの選び方

カスティーリャ(es-ES)

cとzをsと区別して発音するのが特徴です。スペイン向けの企業IVRやコンテンツではこちらが標準になります。

中南米ニュートラル(es-419)

セセオ(cとzをsと同じ発音)で、リズムも柔らかめです。汎中南米向けのオーディオブックやeラーニング教材では最も安全な既定値になります。

リオプラテンセ(es-AR)

ボセオと、yやllの音がシャ行に近づくシェイスモが特徴です。案件がアルゼンチンやウルグアイのナレーターを明確に求めている場合や、ゲームのNPCの出身地設定がキャラクター性の一部である場合に選びます。

台本からプレビューまでの3ステップ

  1. 1

    貼り付けてタグ付け

    スペイン語の台本をボックスに入力します。句読点は自動的にブレークタグに変換され、単語をアスタリスクで囲むか大文字にすると強調タグが付きます。

  2. 2

    アクセントとペースを設定

    地域アクセントとポーズスタイルを選び、速度スライダーを調整します。語数と所要時間の予測は変更のたびに更新されます。

  3. 3

    プレビューまたは書き出し

    ブラウザプレビューでペーシングを確認した後、タグ付き台本をAnyVoiceや任意のSSML対応エンジンにコピーします。セッションノート:ブラウザプレビューは訪問者のOSに搭載された音声を使うため、最終ミックスの参考ではなくペーシングの確認用として扱ってください。

よくある質問

このツールは実際のAI音声を生成しますか?
いいえ。プレビューボタンはブラウザ内蔵のspeechSynthesis APIとインストール済みのスペイン語システム音声を使うもので、クローン音声ではありません。感情表現までコントロールできるクローン済みのスペイン語音声が必要な場合は、タグ付き台本をAnyVoiceに通してください。
ブラウザにスペイン語の音声選択肢がないのはなぜですか?
音声の有無はこのツールではなくOSに依存します。WindowsとmacOSは標準でes-ESまたはes-MXの音声を少なくとも1つ搭載していますが、Chrome OSやAndroidの一部のビルドではスペイン語の言語パックをインストールして初めて追加されます。
ブレークタグや強調タグをElevenLabsやAmazon Pollyに貼り付けられますか?
このタグ構文はSSMLのbreak timeとemphasis要素に準拠しており、Polly、Azure、AnyVoiceの上位パイプラインで利用できます。エンジンによってはタグをspeech要素で囲む必要がある場合があるため、本番前に各エンジンのドキュメントを確認してください。
所要時間の予測はどのように計算されますか?
語数を毎分150語(ナレーションで一般的に使われる目安値)で割り、速度スライダーの値で調整した値です。あくまで目安であり、フレーム精度の収録時間ではありません。
文字数の上限はありますか?
厳密な上限は設けていませんが、ブラウザのspeechSynthesisは1回の発話がおよそ3万文字を超えるとつまずきやすく、一部の音声エンジンも長すぎる単一のSSMLを切り詰めることがあります。長い章はシーンごとに分割してください。語数と所要時間の予測は即座に更新されるため、各シーンのサイズ調整に使えます。
このツールは台本を保存したり送信したりしますか?
いいえ。すべてブラウザのタブ内で完結します。テキスト内容を含まない匿名の実行ビーコンを除き、何もアップロード、記録、サーバー送信されません。
IVR向けとオーディオブック向けではどちらのアクセントを選ぶべきですか?
スペイン国内のIVRや企業の電話応対では、カスティーリャが標準です。汎中南米向けのオーディオブックやeラーニングでは中南米ニュートラル(es-419)が向いています。アルゼンチンやウルグアイを舞台にしたゲームのローカライズにはリオプラテンセを選びます。中南米全域に一度に展開する案件では、es-419が最も無難な単一トラックです。

ブラウザプレビューではなく、クローン済みのスペイン語音声が必要ですか?

AnyVoiceなら30秒のサンプルからスペイン語の声をクローンでき、システムTTSにはない8つのリアルタイム感情スライダーで細かく制御できます。