Générer de l'audio à l'aide de l'API Gemini

Vous pouvez générer les types de contenus audio suivants :

Comparaison entre la synthèse vocale et l'Live API

Les modèles de synthèse vocale et les modèles Live API sont des modèles de génération de parole à faible latence, qui peuvent être configurés pour différentes voix de réponse et langues. Toutefois, ils répondent à des cas d'utilisation très différents.

  • La génération de synthèse vocale est une interaction unidirectionnelle de type requête-réponse (texte en entrée, audio en sortie). Elle est conçue pour les scénarios qui nécessitent une récitation exacte du texte fourni avec un contrôle précis du style et du son, comme la narration de podcasts, les livres audio ou la lecture d'articles à voix haute.

  • Live API génération est compatible avec le streaming bidirectionnel pour les conversations vocales en temps réel (voix en entrée, voix en sortie). Elle excelle dans les contextes de conversation dynamiques où le modèle décide de la parole applicable à renvoyer. Notez que les derniers Live API modèles sont également compatibles avec les entrées vidéo et image.