Gemini API を使用して音声を生成する

次の種類の音声を生成できます。

TTS と Live API の比較

テキスト読み上げ(TTS)モデルと Live API モデルはどちらも、さまざまな応答音声 と言語に対応するように構成できる、低レイテンシの 音声生成モデルです。ただし、ユースケースは大きく異なります。

  • テキスト読み上げ(TTS)の生成 は、 一方向 のリクエスト / レスポンスのやり取り(テキスト入力、音声出力)です。ポッドキャストのナレーション、オーディオブック、記事の読み上げなど、スタイルとサウンドを細かく制御して、提供されたテキストを 正確に読み上げる 必要があるシナリオ向けに調整されています。

  • Live API 生成 は、 双方向 ストリーミングをサポートし、 リアルタイムの音声会話 (音声入力、 音声出力)を実現します。モデルが返す音声を選択する動的な会話コンテキストに優れています。最新の Live API モデルは、動画と画像の入力もサポートしています。