Generare audio utilizzando l'API Gemini

Puoi generare i seguenti tipi di audio:

Confronto tra TTS e Live API

Sia i modelli di sintesi vocale (TTS) sia i modelli Live API sono modelli a bassa latenza, che generano parlato e possono essere configurati per diverse voci di risposta e lingue. Tuttavia, servono casi d'uso molto diversi.

  • La generazione di sintesi vocale (TTS) è un'interazione unidirezionale di richiesta-risposta (testo in, audio out). È pensata per scenari che richiedono la recitazione esatta del testo fornito con un controllo granulare su stile e suono, come la narrazione di podcast, audiolibri o la lettura di articoli ad alta voce.

  • Live API generazione supporta bidirezionale streaming per conversazioni vocali in tempo reale (voce in, voce out). È ideale in contesti conversazionali dinamici in cui il modello decide il parlato applicabile da restituire. Tieni presente che i modelli più recenti Live API supportano anche l'input di video e immagini.