Создание аудио с помощью Gemini API

Вы можете генерировать следующие типы аудио:

Сравнение TTS и Live API

Как модели преобразования текста в речь (TTS), так и модели Live API представляют собой модели генерации речи с низкой задержкой, которые можно настроить для различных голосовых ответов и языков. Однако они предназначены для совершенно разных сценариев использования.

  • Генерация текста в речь (TTS) — это однонаправленное взаимодействие по принципу «запрос-ответ» (входной текст, выходной аудио). Она разработана для сценариев, требующих точного воспроизведения предоставленного текста с тонкой настройкой стиля и звучания, например, для озвучивания подкастов, аудиокниг или чтения статей вслух.

  • Генерация Live API поддерживает двустороннюю потоковую передачу голосовых сообщений в реальном времени (входящий и исходящий голос). Она особенно эффективна в динамических диалоговых контекстах, где модель сама определяет, какую речь следует вернуть. Следует отметить, что последние модели Live API также поддерживают ввод видео и изображений.