Genera audio con la API de Gemini

Puedes generar los siguientes tipos de audio:

Comparación entre TTS y la Live API

Tanto los modelos de texto a voz (TTS) como los modelos Live API son modelos de generación de voz de baja latencia, que se pueden configurar para diferentes voces de respuesta y lenguajes. Sin embargo, sirven para casos de uso muy diferentes.

  • La generación de texto a voz (TTS) es una interacción de solicitud-respuesta unidireccional (texto de entrada y audio de salida). Está diseñada para situaciones que requieren una recitación exacta del texto proporcionado con un control detallado sobre el estilo y el sonido, como la narración de podcasts, los audiolibros o la lectura de artículos en voz alta.

  • Live API generación admite bidireccional streaming para conversaciones de voz en tiempo real (voz de entrada, voz de salida). Se destaca en contextos conversacionales dinámicos en los que el modelo decide el discurso aplicable que se debe mostrar. Ten en cuenta que los modelos más recientes Live API también admiten entradas de video y de imagen.