使用 Gemini API 產生音訊

你可以生成下列類型的音訊:

比較 TTS 和 Live API

文字轉語音 (TTS) 模型和 Live API 模型都是低延遲的語音生成模型,可設定不同的回覆聲音和語言。不過,兩者適用於截然不同的用途。

  • 文字轉語音 (TTS) 生成單向的請求/回應互動 (輸入文字,輸出音訊)。這個模型專為需要準確朗讀所提供文字,並精細控制風格和聲音的應用情境而設計,例如 Podcast 旁白、有聲書或朗讀文章。

  • Live API 生成支援雙向串流,可進行即時語音對話 (語音輸入/輸出)。這項模型擅長處理動態對話情境,可決定要傳回的適用語音。請注意,最新模型也支援影片和圖片輸入內容。Live API