Limity i specyfikacje interfejsu Live API


Na tej stronie opisujemy różne limity i specyfikacje dotyczące korzystania z Live API i jego modeli.

Ogólne specyfikacje i limity

  • Obsługiwane dane wejściowe i wyjściowe: (szczegółowe informacje znajdziesz w sekcji formaty multimediów poniżej)

    • Dane wejściowe: tekst, obrazy (nie pliki PDF), dźwięk, wideo
    • Dane wyjściowe: tekst (transkrypcja) i dźwięk (strumieniowanie)
  • Obsługiwane narzędzia: wywoływanie funkcji, grounding z Google Search, grounding z Google Maps

  • Granica wiedzy: styczeń 2025 r.

Model Live API nie obsługuje generowania uporządkowanych danych wyjściowych (np. w formacie JSON) ani interfejsu Count Tokens API.

Limity związane z sesjami

W przypadku Live API sesja to stałe połączenie, w ramach którego dane wejściowe i wyjściowe są przesyłane strumieniowo w sposób ciągły.

Jeśli sesja przekroczy którykolwiek z tych limitów, połączenie zostanie zakończone. Pamiętaj jednak, że Live API udostępnia kilka opcji (patrz poniżej), które pozwalają radzić sobie z tymi limitami związanymi z sesjami.

  • Okno kontekstu sesji jest ograniczone do 128 tys. tokenów.

    Ze względu na ten limit okna kontekstu przybliżone maksymalne długości sesji w zależności od trybów wejściowych są następujące:

    • Sesje wejściowe tylko z dźwiękiem są ograniczone do 15 minut.
    • Wejście wideo i audio jest ograniczone do 2 minut.
  • Długość połączenia jest ograniczona do około 10 minut.

    Otrzymasz powiadomienie o wycofaniu na 60 sekund przed zakończeniem połączenia.

Oto kilka opcji radzenia sobie z limitami związanymi z sesjami:

  • Kompresuj okno kontekstu sesji, aby serwer automatycznie utrzymywał rozmiar kontekstu w ramach limitu.

  • Wznów sesję, aby uniknąć utraty kontekstu rozmowy podczas krótkich przerw w połączeniu z siecią lub po otrzymaniu powiadomienia o opuszczeniu.

Dowiedz się więcej o zarządzaniu sesjami.

Ograniczenia liczby żądań

Live API ma limity szybkości zarówno w przypadku sesji równoczesnych na projekt w Firebase, jak i tokenów na minutę (TPM).

  • Gemini Developer API:

    • Limity różnią się w zależności od Gemini Developer API„poziomu wykorzystania” projektu (więcej informacji znajdziesz w dokumentacji limitów szybkości).
  • Agent Platform Gemini API (formerly Vertex AI):

    • 1000 sesji równoczesnych na projekt w Firebase
    • 4 mln tokenów na minutę

Formaty multimediów

Live API obsługuje te typy multimediów:

  • Dane wejściowe: obrazy, dźwięk, wideo
  • Dane wyjściowe: dźwięk

Formaty obrazów

Live API obsługuje te formaty danych wejściowych obrazu:

  • Maksymalna liczba obrazów na prompt: 3000

  • Maksymalny rozmiar pliku (dane wbudowane): 7 MB

  • Obsługiwane typy MIME: image/png, image/jpeg, image/webp, image/heic, image/heif

Formaty audio

Live API obsługuje te formaty audio:

  • Format dźwięku wejściowego: surowy 16-bitowy dźwięk PCM o częstotliwości próbkowania 16 kHz w formacie little-endian
  • Format wyjściowy dźwięku: surowy 16-bitowy dźwięk PCM o częstotliwości próbkowania 24 kHz w formacie little-endian

  • Obsługiwane typy MIME: audio/x-aac, audio/flac, audio/mp3, audio/m4a, audio/mpeg, audio/mpga, audio/mp4, audio/ogg, audio/pcm, audio/wav, audio/webm

Aby przekazać częstotliwość próbkowania wejściowego dźwięku, ustaw typ MIME każdego obiektu Blob zawierającego dźwięk na wartość taką jak audio/pcm;rate=16000.

Formaty wideo

Live API oczekuje sekwencji oddzielnych klatek obrazu i obsługuje klatki wideo z częstotliwością 1 klatki na sekundę.

  • Zalecane dane wejściowe: natywna rozdzielczość 768 x 768 pikseli przy 1 klatce na sekundę.

  • Obsługiwane typy MIME: video/x-flv, video/quicktime, video/mpeg, video/mpegs, video/mpg, video/mp4, video/webm, video/wmv, video/3gpp

Pamiętaj, że ta specyfikacja sprawia, że Live API nie nadaje się do zastosowań, które wymagają analizowania szybko zmieniającego się obrazu, np. w przypadku relacji sportowych z dużą liczbą powtórek.

Głosy odpowiedzi

Live API obsługuje 30 różnych syntetyzowanych głosów HD, z których każdy ma odmienne cechy. Listę opcji głosowych i przykłady każdego głosu możesz wyświetlić, rozwijając sekcję poniżej.

Jeśli nie określisz głosu odpowiedzi, domyślnie używany będzie głos Puck.

Dowiedz się, jak określić głos odpowiedzi.

Języki

Live API obsługuje te języki. Dowiedz się, jak wpływać na język odpowiedzi.

Języki obsługiwane przez wszystkie modele generujące dźwięk
Język Kod BCP-47 Język Kod BCP-47
arabski (egipski), ar-EG niemiecki (Niemcy) de-DE
angielski (USA) en-US hiszpański (USA) es-US
francuski (Francja) fr-FR hindi (Indie) hi-IN
indonezyjski (Indonezja) id-ID włoski (Włochy) it-IT
japoński (Japonia) ja-JP koreański (Korea) ko-KR
portugalski (Brazylia) pt-BR rosyjski (Rosja) ru-RU
niderlandzki (Holandia) nl-NL polski (Polska) pl-PL
tajski (Tajlandia) th-TH turecki (Turcja) tr-TR
wietnamski (Wietnam) vi-VN rumuński (Rumunia) ro-RO
ukraiński (Ukraina) uk-UA bengalski (Bangladesz) bn-BD
angielski (Indie) Pakiet en-IN i hi-IN marathi (Indie) mr-IN
tamilski (Indie) ta-IN telugu (Indie) te-IN
Dodatkowe języki obsługiwane przez modele 3.x generujące dźwięk
Język Kod BCP-47 Język Kod BCP-47
afrikaans af filipiński fil
albański sq fiński fi
amharski am galicyjski gl
ormiański hy gruziński ka
azerski az grecki el
baskijski eu gudżarati gu
białoruski be kreolski haitański ht
bułgarski bg hebrajski he
birmański moje węgierski hu
kataloński urząd certyfikacji islandzki jest
cebuański ceb jawajski jv
chiński (mandaryński), cmn kannada kn
chorwacki godz. konkani kok
czeski cs laotański lo
duński da łaciński la
estoński et łotewski lv
litewski lt luksemburski lb
macedoński mk maithili mai
malgaski mg malajski ms
malajalam ml mongolski mn
nepalski ne norweski (bokmål), nb
norweski (nynorsk), nn orija lub
paszto ps perski fa
pendżabski pa serbski sr
sindhi sd syngaleski si
słowacki sk słoweński sl
suahili sw szwedzki sv
urdu ur