Generowanie dźwięku za pomocą interfejsu Gemini API

Możesz generować te rodzaje dźwięku:

Porównanie zamiany tekstu na mowę i interfejsu Live API

Zarówno modele zamiany tekstu na mowę, jak i modele Live API to modele generujące mowę z niskim opóźnieniem, które można skonfigurować pod kątem różnych głosów odpowiedzi i języków. Służą one jednak do bardzo różnych zastosowań.

  • Generowanie zamiany tekstu na mowę to jednokierunkowa interakcja typu żądanie-odpowiedź (tekst jako dane wejściowe, dźwięk jako dane wyjściowe). Jest ona dostosowana do scenariuszy, które wymagają dokładnego odczytania podanego tekstu z precyzyjną kontrolą stylu i dźwięku, takich jak narracja podcastów, audiobooki czy czytanie artykułów na głos.

  • Live API generowanie obsługuje dwukierunkowe przesyłanie strumieniowe w przypadku rozmów głosowych w czasie rzeczywistym (głos jako dane wejściowe, głos jako dane wyjściowe). Sprawdza się w dynamicznych kontekstach konwersacyjnych, w których model decyduje, jaką mowę ma zwrócić. Pamiętaj, że najnowsze Live API modele obsługują też dane wejściowe w postaci obrazów i filmów.