Audio mit der Gemini API generieren

Sie können die folgenden Arten von Audio generieren:

Vergleich zwischen TTS und der Live API

Sowohl Sprachausgabemodelle (Text‑to‑Speech, TTS) als auch Live API Modelle sind Modelle mit geringer Latenz, die Sprache generieren und für verschiedene Antwortstimmen und ‑sprachen konfiguriert werden können. Sie dienen jedoch sehr unterschiedlichen Anwendungsfällen.

  • Die Sprachausgabe (Text‑to‑Speech, TTS) ist eine unidirektionale Anfrage-Antwort-Interaktion (Text rein, Audio raus). Sie ist auf Szenarien zugeschnitten, in denen eine genaue Wiedergabe des bereitgestellten Texts mit detaillierter Kontrolle über Stil und Klang erforderlich ist, z. B. Podcast-Erzählungen, Hörbücher oder das Vorlesen von Artikeln.

  • Live API Generierung unterstützt bidirektionales Streaming für Sprachunterhaltungen in Echtzeit (Sprache rein, Sprache raus). Sie eignet sich hervorragend für dynamische Unterhaltungskontexte, in denen das Modell die anzuwendende Sprache für die Rückgabe bestimmt. Die neuesten Live API Modelle unterstützen auch Video- und Bildeingaben.