Membuat audio menggunakan Gemini API

Anda dapat membuat jenis audio berikut:

Perbandingan antara TTS dan Live API

Model text-to-speech (TTS) dan model Live API adalah model pembuatan ucapan dengan latensi rendah yang dapat dikonfigurasi untuk berbagai suara dan bahasa respons. Namun, keduanya melayani kasus penggunaan yang sangat berbeda.

  • Pembuatan text-to-speech (TTS) adalah interaksi permintaan-respons satu arah (teks masuk, audio keluar). Fitur ini dibuat khusus untuk skenario yang memerlukan pembacaan kata demi kata dari teks yang diberikan dengan kontrol terperinci atas gaya dan suara, seperti narasi podcast, buku audio, atau pembacaan artikel.

  • Pembuatan Live API mendukung streaming dua arah untuk percakapan suara real-time (suara masuk, suara keluar). Model ini unggul dalam konteks percakapan dinamis di mana model memutuskan ucapan yang sesuai untuk diberikan. Perhatikan bahwa model Live API terbaru juga mendukung input video dan gambar.