Limits und Spezifikationen der Live API


Auf dieser Seite werden verschiedene Limits und Spezifikationen für die Verwendung der Live API und ihrer Modelle beschrieben.

Allgemeine Spezifikationen und Beschränkungen

  • Unterstützte Ein- und Ausgabe (weitere Informationen finden Sie unten unter Media-Formate):

    • Eingabe: Text, Bilder (keine PDFs), Audio, Video
    • Ausgabe: Text (Transkription) und Audio (Streaming)
  • Unterstützte Tools: Funktionsaufrufe, Fundierung mit Google Search, Fundierung mit Google Maps

  • Wissensstichtag: Januar 2025

Live API unterstützt nicht die Generierung strukturierter Ausgaben (z. B. JSON) oder die Count Tokens API.

Sitzungsbezogene Limits

Bei Live API bezieht sich eine Sitzung auf eine dauerhafte Verbindung, bei der Eingabe und Ausgabe kontinuierlich über eine Verbindung gestreamt werden.

Wenn die Sitzung eines der folgenden Limits überschreitet, wird die Verbindung beendet. Live API bietet jedoch einige Optionen (siehe unten), um diese sitzungsbezogenen Beschränkungen zu umgehen.

  • Das Kontextfenster für Sitzungen ist auf 128.000 Tokens begrenzt.

    Aufgrund dieses Limits für das Kontextfenster ergeben sich die folgenden ungefähren maximalen Sitzungslängen basierend auf den Eingabemodalitäten:

    • Eingabesitzungen, die nur Audio enthalten, sind auf 15 Minuten begrenzt.
    • Video- und Audioeingaben sind auf 2 Minuten begrenzt.
  • Die Verbindungsdauer ist auf etwa 10 Minuten begrenzt.

    Benachrichtigungen über das Ende der Verbindung werden 60 Sekunden vor dem Ende der Verbindung angezeigt.

Hier sind einige Optionen für den Umgang mit sitzungsbezogenen Limits:

  • Sitzungskontextfenster komprimieren: Der Server hält die Kontextgröße automatisch innerhalb des Limits.

  • Sitzung fortsetzen, um den Kontext des Gesprächs bei kurzen Netzwerkunterbrechungen oder nach Erhalt einer Benachrichtigung über das Schließen nicht zu verlieren.

Weitere Informationen zum Verwalten von Sitzungen

Ratenlimits

Für Live API gelten Ratenbegrenzungen sowohl für gleichzeitige Sitzungen pro Firebase-Projekt als auch für Tokens pro Minute (TPM).

  • Gemini Developer API:

  • Agent Platform Gemini API (formerly Vertex AI):

    • 1.000 gleichzeitige Sitzungen pro Firebase-Projekt
    • 4 Millionen Tokens pro Minute

Media-Formate

Live API unterstützt die folgenden Medientypen:

  • Eingabe: Bilder, Audio, Video
  • Ausgabe: Audio

Bildformate

Der Live API unterstützt die folgenden Bild-Eingaben:

  • Maximale Anzahl von Bildern pro Prompt: 3.000

  • Maximale Dateigröße pro Datei (Inline-Daten): 7 MB

  • Unterstützte MIME-Typen: image/png, image/jpeg, image/webp, image/heic, image/heif

Audioformate

Das Live API unterstützt die folgenden Audioformate:

  • Eingabeaudioformat:16-Bit-PCM-Rohaudio mit 16 kHz, Little Endian
  • Audioausgabeformat:Rohe 16‑Bit-PCM-Audiodaten mit 24 kHz, Little Endian

  • Unterstützte MIME-Typen: audio/x-aac, audio/flac, audio/mp3, audio/m4a, audio/mpeg, audio/mpga, audio/mp4, audio/ogg, audio/pcm, audio/wav, audio/webm

Um die Abtastrate des eingegebenen Audiosignals anzugeben, legen Sie den MIME-Typ jedes Audio-Blobs auf einen Wert wie audio/pcm;rate=16000 fest.

Videoformate

Für Live API wird eine Sequenz diskreter Bildframes erwartet. Die Eingabe von Videoframes mit 1 fps (Bild pro Sekunde) wird unterstützt.

  • Empfohlene Eingabe: native Auflösung von 768 × 768 Pixeln bei 1 FPS.

  • Unterstützte MIME-Typen: video/x-flv, video/quicktime, video/mpeg, video/mpegs, video/mpg, video/mp4, video/webm, video/wmv, video/3gpp

Diese Spezifikation macht die Live API für Anwendungsfälle ungeeignet, die eine Analyse von sich schnell ändernden Videos erfordern, z. B. die detaillierte Analyse von Sportarten mit hoher Geschwindigkeit.

Stimmen für Antworten

Die Live API unterstützt 30 verschiedene synthetisierte HD-Stimmen mit jeweils eigenen Merkmalen. Wenn Sie den Abschnitt unten maximieren, sehen Sie eine Liste der Sprachoptionen für Antworten und können sich Demos der einzelnen Stimmen anhören.

Wenn Sie keine Antwortstimme angeben, wird standardmäßig Puck verwendet.

Informationen zum Festlegen der Stimme für Antworten

Sprachen

Live API unterstützt die folgenden Sprachen. Informationen zum Beeinflussen der Antwortsprache

Von allen Modellen zur Audioerstellung unterstützte Sprachen
Sprache BCP-47-Code Sprache BCP-47-Code
Arabisch (Ägypten) ar-EG Deutsch (Deutschland) de-DE
Englisch (USA) en-US Spanisch (USA) es-US
Französisch (Frankreich) fr-FR Hindi (Indien) hi-IN
Indonesisch (Indonesien) id-ID Italienisch (Italien) it-IT
Japanisch (Japan) ja-JP Koreanisch (Korea) ko-KR
Portugiesisch (Brasilien) pt-BR Russisch (Russland) ru-RU
Niederländisch (Niederlande) nl-NL Polnisch (Polen) pl-PL
Thailändisch (Thailand) th-TH Türkisch (Türkei) tr-TR
Vietnamesisch (Vietnam) vi-VN Rumänisch (Rumänien) ro-RO
Ukrainisch (Ukraine) uk-UA Bengalisch (Bangladesch) bn-BD
Englisch (Indien) en-IN- und hi-IN-Bundle Marathi (Indien) mr-IN
Tamil (Indien) ta-IN Telugu (Indien) te-IN
Zusätzliche Sprachen, die von Modellen der Version 3.x zur Audioerstellung unterstützt werden
Sprache BCP-47-Code Sprache BCP-47-Code
Afrikaans af Filipino fil
Albanisch sq Finnisch fi
Amharisch vormittags Galizisch gl
Armenisch hy Georgisch ka
Aserbaidschanisch az Griechisch el
Baskisch eu Gujarati gu
Belarussisch be Haitianisch ht
Bulgarisch bg Hebräisch er
Burmesisch mein Ungarisch hu
Katalanisch Zertifizierungsstelle Isländisch ist
Cebuano ceb Javanisch jv
Chinesisch, Mandarin cmn Kannada kn
Kroatisch Std. Konkani kok
Tschechisch cs Lao lo
Dänisch da Latein la
Estnisch et Lettisch lv
Litauisch lt Luxemburgisch lb
Mazedonisch mk Maithili mai
Malagasy mg Malaiisch ms
Malayalam ml Mongolisch mn
Nepalesisch ne Norwegisch, Bokmål nb
Norwegisch (Nynorsk) nn Oriya oder
Paschtu ps Persisch fa
Punjabi pa Serbisch sr
Sindhi sd Singhalesisch si
Slowakisch sk Slowenisch sl
Swahili sw Schwedisch sv
Urdu ur