Generowanie dźwięku za pomocą interfejsu Gemini API

Możesz generować te rodzaje dźwięku:

Porównanie TTS i Live API

Zarówno modele zamiany tekstu na mowę (TTS), jak i Live API to modele generujące mowę o niskim poziomie opóźnień, które można skonfigurować pod kątem różnych głosów odpowiedzi i języków. Służą one jednak do bardzo różnych celów.

  • Generowanie tekstu na mowę (TTS) to jednokierunkowa interakcja typu żądanie-odpowiedź (tekst na wejściu, dźwięk na wyjściu). Jest ona dostosowana do scenariuszy, które wymagają dokładnego odczytania podanego tekstu z precyzyjną kontrolą stylu i dźwięku, takich jak narracja w podcaście, audiobooki czy czytanie artykułów na głos.

  • Live API generacji obsługuje dwukierunkowe przesyłanie strumieniowe w przypadku rozmów głosowych w czasie rzeczywistym (głos przychodzący i wychodzący). Sprawdza się w dynamicznych kontekstach konwersacyjnych, w których model decyduje, która odpowiedź głosowa jest odpowiednia. Pamiętaj, że najnowsze modele Live API obsługują też dane wejściowe w postaci filmów i obrazów.