本文へ移動

VOICEVOXレイヤー ​

VOICEVOXレイヤーは、タイムライン上の発話キーから読み上げ音声と字幕を作ります。声と本文をキーごとに指定できるので、ナレーションや会話のある映像を作るときに使えます。

利用できる環境 ​

レイヤーの新規追加と音声の生成には、デスクトップ(Electron)版と、接続できるVOICEVOXエンジンが必要です。Web版は新規追加・生成には対応していませんが、プロジェクトに保存された生成済み音声は再生できます。

エンジンへ接続する ​

  1. VOICEVOXエンジンを起動します。
  2. Add Layer → VOICEVOX でレイヤーを追加します。
  3. レイヤーの VOICEVOX → Engine URL に、起動したエンジンのURLを指定します。
  4. Connect を押します。接続するとエンジンのバージョンが表示され、声の選択肢が読み込まれます。

接続に失敗した場合は、エンジンが起動しているか、URLとポートが合っているかを確認してください。

発話キーを作る ​

  1. 話し始める位置へシークします。
  2. Add speech key at playhead を押します。
  3. 発話キーの詳細で、次の項目を設定します。
項目内容
Time発話を始めるシーン上の時刻(ms)
Voice / styleその発話で使う声とスタイル
Subtitle表示する字幕本文。読みを指定しなければ、読み上げにも使う
Subtitle durationFill は次の発話キーまで表示。Specified は表示長さをmsで指定。Match speech duration は発話長に合わせる
Reading (optional)読み上げ専用の文字列。字幕と読み方を分けたい場合に指定する

音声の準備状況は発話キーの詳細に表示されます。生成が完了すると Ready と長さが表示され、Regenerate で生成し直せます。

タイムラインでは、上側の帯に字幕の表示区間とセリフ、下側の細い帯に生成済み音声の再生区間を表示します。字幕帯は音声が未生成でも表示されます。幅に収まらないセリフは省略表示され、全文は発話キーの詳細で確認できます。

字幕帯をクリックすると、その発話キーを選択できます。帯の上をダブルクリックすると、その時刻に新しい発話キーを追加できます。Specified の字幕帯は右端のハンドルをドラッグして長さを調整でき、目盛り・クリップ境界・他のキー・シーク位置・音声の終端へスナップします。Fill と Match speech duration の帯にはハンドルがありません。表示長のモード切り替えは発話キーの設定画面で行います。タイムライン上の操作では切り替わりません。

指定長を 0ms にすると、音声を維持したまま字幕を非表示にできます。クリップや次のキーで字幕帯が打ち切られている場合も、その端にはハンドルがありません。設定画面の Display length で調整してください。新しいキーはFillで作成され、コピー&ペーストでは字幕長の設定も保持します。

Fill から Specified に切り替えると、その発話の生成済み音声の長さを初期値にします(小数msは切り上げ)。未生成の場合は従来のFillの表示区間をもとに初期値を決めます。切り替え後に音声を生成し直しても、指定した字幕長は変わりません。

Match speech duration を選ぶと、字幕を「生成音声の長さ+延長量」で表示します。Extend after speech に延長する長さをmsで指定します。初期値は 0ms で音声と字幕が同時に終了し、例えば 500ms なら音声が終わってから0.5秒字幕が残ります。音声を生成し直すと、このモードの字幕長も新しい音声長に合わせて変わります。未生成の間は次のキー/クリップ終端まで仮表示します。

発話キーとクリップの関係 ​

発話キーは「何をいつ話すか」、クリップは「音声と字幕を有効にする期間」を決めます。最初の発話キーより前は、無音・字幕なしです。

音声は発話キーから再生し、生成音声の終わり・次の発話キー・クリップの終わりのうち、最も早い時点で止まります。字幕もすべてのモードで、次のキーとクリップ終端までに制限して表示します。Specified は指定長、Match speech duration は音声長と延長量がさらに上限になります。延長量を設定しても次のキーやクリップ終端を越えては表示しません。本文を空にした発話キーは、直前の音声と字幕を終了させます。次の字幕が終了しても、以前の字幕が再表示されることはありません。

例えば、0秒に「こんにちは」、3秒に空の本文を置くと、字幕は0〜3秒に表示されます。音声が2秒で終わる場合、最後の1秒は字幕だけが残ります。クリップもこの区間を覆っている必要があります。

クリップを移動すると、区間内の発話キーと、次のクリップの区間内に入らない終端キーも追従します。空本文の終了キーも対象です。トリムではキーを動かさず、区間外のキーや、区間より前から続く発話は追従しません。内容オフセットも発話の時刻には適用されません。

発話キーのドラッグ・開始時刻の入力・クリップへの追従では、動かさない隣の発話キーとの間に100msを残して止まります。開始時から100ms未満なら、その間隔を下限にします。

発話キーを移動すると、指定した字幕長を保ったまま字幕区間も移動します。次のキーやクリップで表示が打ち切られても、指定した長さ自体は保持します。字幕長の変更で音声を生成し直すことはありません。

Fit last clip to speech は、準備済みの音声に合わせて最後のクリップの終端を調整します。長い読み上げが途中で切れる場合は、音声を生成してからこの操作を使うか、クリップを手動で延ばします。

話速・音量・字幕を調整する ​

Speech speed はレイヤー共通の話速で、0.5〜2の範囲で設定できます。声はキーごとの設定です。話速の変更で音声の長さも変わるため、生成後に次のキーやクリップ終端との関係を確認してください。

Audio → Volume は出力音量です。式やキーで音量を変えることもできます。

字幕の設定では、フォント・サイズ・色・位置・整列・最大幅・輪郭・影などを調整できます。フォントはAssetsへ読み込んで選択します。文字サイズはシーン高さ、最大幅はシーン幅、輪郭や影は文字サイズに対する比率です。装飾はレイヤー内で共有し、Compositing で字幕画像全体の変形や不透明度を設定します。

字幕を透明にしても読み上げの音量は変わりません。映像と音声のフェードは、それぞれOpacityとVolumeで設定します。

うまく再生されないとき ​

  • 音声が出ない:エンジン接続、声の選択、生成状況、Volume、クリップが発話の区間を覆っているかを確認します。
  • 途中で切れる:次の発話キーか、クリップ終端に到達していないか確認します。
  • 字幕が残る:消したい時刻に空の本文のキーを置くか、クリップをそこで終了させます。
  • Web版で編集後に音声が出ない:変更した本文・読み・声・話速に対応する生成済み音声が必要です。デスクトップ版で生成して保存します。

声を付けずに文字だけを扱う場合は、テキストレイヤーも使えます。

Glitch Studio User Guide