Gerar áudio usando a API Gemini

É possível gerar os seguintes tipos de áudio:

Comparação entre a TTS e a Live API

Os modelos de conversão de texto em voz (TTS) e Live API modelos são modelos de geração de fala de baixa latência, que podem ser configurados para diferentes vozes de resposta e idiomas. No entanto, eles atendem a casos de uso muito diferentes.

  • A geração de conversão de texto em voz (TTS) é uma interação unidirecional de solicitação-resposta (texto na entrada, áudio na saída). Ela é feita para cenários que exigem recitação exata do texto fornecido com controle refinado sobre o estilo e o som, como narração de podcasts, audiolivros ou leitura de artigos em voz alta.

  • Live API geração oferece suporte a streaming bidirecional para conversas de voz em tempo real (voz na entrada, voz na saída). Ela se destaca em contextos conversacionais dinâmicos em que o modelo decide a fala aplicável a ser retornada. Observe que os Live API modelos mais recentes também oferecem suporte a entrada de vídeo e imagem.