Podczas wywoływania Gemini API z aplikacji za pomocą pakietu SDK Firebase AI Logic możesz poprosić model Gemini o wygenerowanie tekstu na podstawie danych wejściowych multimodalnych, takich jak obrazy, filmy, dźwięk i dokumenty (np. pliki PDF).
Musisz używać obsługiwanych typów plików, określać obsługiwany typ MIME oraz dbać o to, aby pliki i żądania multimodalne spełniały wymagania i były zgodne z najlepszymi praktykami.
Ta strona dotyczy korzystania z GenerativeModel i zawiera informacje na te tematy:
Szczegółowe informacje o obsługiwanych typach MIME, sprawdzonych metodach i ograniczeniach dotyczących tych typów plików:
Obrazy | Filmy | Audio | Dokumenty (np. PDF-y).
Opcje przesyłania plików w przypadku żądań multimodalnych
|
Wybierz dostawcę interfejsu Gemini API, aby wyświetlić na tej stronie treści dotyczące tego dostawcy |
W każdym żądaniu multimodalnym musisz zawsze podać te informacje:
Plik
mimeType. Obsługiwane typy MIME każdego pliku wejściowego znajdziesz w odpowiedniej sekcji na tej stronie.plik, Możesz podać plik jako dane wbudowane lub podać go za pomocą adresu URL.
Rozmiar i liczba plików, które możesz podać w prośbie, zależą od typu pliku wejściowego, sposobu jego przesłania i użytego modelu (szczegółowe informacje znajdziesz w sekcji dotyczącej każdego typu pliku wejściowego na tej stronie).
Opcja 1. Podaj plik jako dane wbudowane.
Ważne informacje dotyczące plików podanych jako dane wbudowane:
Jako dane wbudowane można wysyłać tylko małe pliki, ponieważ łączny rozmiar żądania jest ograniczony do 20 MB.
Plik jest kodowany w formacie Base64 podczas przesyłania (co zwiększa jego rozmiar).
Przykład pokazujący, jak dołączyć plik jako dane wbudowane, znajdziesz w artykule Generowanie tekstu na podstawie danych wejściowych w postaci tekstu i pliku (wielomodowych). Pamiętaj, że pakiety SDK na platformy Android i Apple mogą obsługiwać obrazy w tekście w żądaniach bez konieczności określania typu MIME. Więcej informacji
Opcja 2. Podaj plik za pomocą adresu URL
Oto akceptowane typy adresów URL, gdy używasz parametru Gemini Developer API:
Adres URL filmu na YouTube: film na YouTube musi być publiczny lub niepubliczny.
W każdej prośbie możesz podać jeden adres URL filmu na YouTube.
Zdjęcia: wymagania, sprawdzone metody i ograniczenia
Obrazy: wymagania
W tej sekcji znajdziesz informacje o obsługiwanych typach MIME i limitach żądań dotyczących obrazów.
Obsługiwane typy MIME
Gemini Modele multimodalne obsługują te typy MIME obrazów:
- PNG –
image/png - JPEG –
image/jpeg - WebP –
image/webp
Limity na żądanie
Nie ma konkretnego limitu liczby pikseli na obrazie. Większe obrazy są jednak skalowane w dół i uzupełniane, aby dopasować je do maksymalnej rozdzielczości 3072 x 3072 pikseli przy zachowaniu pierwotnego formatu obrazu.
Maksymalna liczba plików w żądaniu: 3000 plików obrazów.
Obrazy: tokenizacja
Oto jak obliczane są tokeny w przypadku obrazów:
- Jeśli oba wymiary obrazu są mniejsze lub równe 384 pikselom, używane jest 258 tokenów.
- Jeśli jeden z wymiarów obrazu przekracza 384 piksele, obraz jest dzielony na kafelki. Domyślny rozmiar każdego kafelka to mniejszy wymiar (szerokość lub wysokość) podzielony przez 1,5. W razie potrzeby każdy kafelek jest dostosowywany tak, aby nie był mniejszy niż 256 pikseli ani większy niż 768 pikseli. Każdy fragment jest następnie zmieniany na rozmiar 768 x 768 pikseli i wykorzystuje 258 tokenów.
Grafika: sprawdzone metody
Aby uzyskać jak najlepsze wyniki, podczas korzystania z obrazów stosuj te sprawdzone metody i informacje:
- Jeśli chcesz wykryć tekst na obrazie, używaj promptów z jednym obrazem, aby uzyskać lepsze wyniki niż w przypadku promptów z wieloma obrazami.
- Jeśli prompt zawiera pojedynczy obraz, umieść go przed promptem tekstowym w żądaniu.
- Jeśli prompt zawiera wiele obrazów i chcesz się do nich odwołać w dalszej części promptu lub chcesz, aby model odwoływał się do nich w odpowiedzi, warto przypisać do każdego obrazu indeks przed obrazem. Użyj
lubabc jako indeksu. Oto przykład użycia obrazów indeksowanych w prompcie:image 1image 2image 3image 1
image 2 image 3 Write a blogpost about my day using image 1 and image 2. Then, give me ideas for tomorrow based on image 3. - Używaj zdjęć o wyższej rozdzielczości, ponieważ dają lepsze wyniki.
- W prompcie podaj kilka przykładów.
- Przed dodaniem obrazów do promptu obróć je do właściwej orientacji.
- Unikaj rozmytych zdjęć.
Obrazy: ograniczenia
Gemini Modele multimodalne są przydatne w wielu przypadkach użycia, ale warto poznać ich ograniczenia:
- Moderowanie treści: modele odmawiają udzielania odpowiedzi na pytania dotyczące obrazów, które naruszają nasze zasady bezpieczeństwa.
- Rozumowanie przestrzenne: modele nie są precyzyjne w lokalizowaniu tekstu ani obiektów na obrazach. Mogą zwracać tylko przybliżone liczby obiektów.
- Zastosowania medyczne: modele nie nadają się do interpretowania obrazów medycznych (np. zdjęć rentgenowskich i tomografii komputerowej) ani do udzielania porad medycznych.
- Rozpoznawanie osób: modele nie są przeznaczone do identyfikowania osób, które nie są celebrytami, na zdjęciach.
- Dokładność: modele mogą halucynować lub popełniać błędy podczas interpretowania obrazów niskiej jakości, obróconych lub o bardzo niskiej rozdzielczości. Modele mogą też halucynować podczas interpretowania odręcznego tekstu w dokumentach z obrazami.
Film: wymagania, sprawdzone metody i ograniczenia
Film: wymagania
W tej sekcji znajdziesz informacje o obsługiwanych typach MIME i limitach dotyczących żądań wideo.
Obsługiwane typy MIME
Gemini Modele multimodalne obsługują te typy MIME filmów:
- FLV -
video/x-flv - MOV -
video/quicktime - MPEG -
video/mpeg - MPEGPS -
video/mpegps - MPG -
video/mpg - MP4 –
video/mp4 - WEBM –
video/webm - WMV –
video/wmv - 3GPP –
video/3gpp
Limity na żądanie
Maksymalna liczba plików w żądaniu: 10 plików wideo
Film: tokenizacja
Oto jak obliczane są tokeny w przypadku filmów:
-
Ścieżka audio jest zakodowana za pomocą klatek wideo. Ścieżka audio jest też dzielona na
1-sekundowe fragmenty , z których każdy zawiera 32 tokeny. Klatki wideo i tokeny audio są przeplatane ze znacznikami czasowymi. Sygnatury czasowe są reprezentowane przez 5 tokenów. -
W przypadku filmów, w których próbkowanie odbywa się z częstotliwością
1 klatka na sekundę lub mniejszą , sygnatury czasowe dla pierwszej godziny filmu są reprezentowane jako 5 tokenów na klatkę filmu. Pozostałe sygnatury czasowe są reprezentowane jako 7 tokenów na klatkę filmu. -
W przypadku filmów, które są próbkowane z częstotliwością powyżej
1 klatki na sekundę (fps) , sygnatury czasowe pierwszej godziny filmu są reprezentowane jako 9 tokenów na klatkę filmu. Pozostałe sygnatury czasowe są reprezentowane jako 11 tokenów na klatkę filmu.
Film: sprawdzone metody
Aby uzyskać najlepsze wyniki, podczas korzystania z filmu stosuj te sprawdzone metody i informacje:
- Jeśli prompt zawiera jeden film, umieść go przed promptem tekstowym.
- Jeśli potrzebujesz lokalizacji sygnatur czasowych w filmie z dźwiękiem, poproś model o wygenerowanie sygnatur czasowych w formacie opisanym w sekcji „Format sygnatury czasowej”.
Film: ograniczenia
Gemini Modele multimodalne są przydatne w wielu przypadkach użycia, ale warto poznać ich ograniczenia:
- Moderowanie treści: modele odmawiają udzielania odpowiedzi na pytania dotyczące filmów, które naruszają nasze zasady bezpieczeństwa.
- Rozpoznawanie dźwięków innych niż mowa: modele obsługujące dźwięk mogą popełniać błędy w rozpoznawaniu dźwięków innych niż mowa.
Audio: wymagania i ograniczenia
Dźwięk: wymagania
W tej sekcji znajdziesz informacje o obsługiwanych typach MIME i limitach dotyczących żądań audio.
Obsługiwane typy MIME
Gemini modele multimodalne obsługują te typy MIME audio:
- AAC -
audio/aac - FLAC –
audio/flac - MP3 –
audio/mp3 - MPA -
audio/m4a - MPEG -
audio/mpeg - MPGA -
audio/mpga - MP4 –
audio/mp4 - OPUS –
audio/opus - PCM -
audio/pcm - WAV –
audio/wav - WEBM –
audio/webm
Limity na żądanie
Maksymalna liczba plików w żądaniu: 1 plik audio
Dźwięk: ograniczenia
Gemini Modele multimodalne są przydatne w wielu przypadkach użycia, ale warto poznać ich ograniczenia:
- Rozpoznawanie dźwięków innych niż mowa: modele obsługujące dźwięk mogą popełniać błędy w rozpoznawaniu dźwięków innych niż mowa.
- Sygnatury czasowe tylko audio: aby dokładnie generować sygnatury czasowe dla plików tylko audio, musisz skonfigurować parametr
audio_timestampwgeneration_config.
Dokumenty (np. pliki PDF): wymagania, sprawdzone metody i ograniczenia
Dokumenty: wymagania
W tej sekcji dowiesz się więcej o obsługiwanych typach MIME i limitach dotyczących dokumentów (np. plików PDF) w przypadku każdego żądania.
Obsługiwane typy MIME
Gemini Modele multimodalne obsługują te typy MIME dokumentów:
- PDF –
application/pdf - Tekst –
text/plain
Limity na żądanie
Pliki PDF są traktowane jako obrazy, więc jedna strona pliku PDF jest traktowana jako 1 obraz. Liczba stron dozwolonych w prompcie jest ograniczona do liczby obrazów, które mogą obsługiwać Geminimodele multimodalne.
- Maksymalna liczba plików w żądaniu: 3000.
- Maksymalna liczba stron w pliku: 1000 stron w pliku.
- Maksymalny rozmiar pliku: 50 MB
Dokumenty: tokenizacja
Tokenizacja plików PDF
Pliki PDF są traktowane jako obrazy, więc każda strona pliku PDF jest tokenizowana w taki sam sposób jak obraz.
Koszt plików PDF jest zgodny z Geminicennikiem obrazów. Jeśli na przykład w wywołaniu interfejsu API Gemini umieścisz dwustronicowy plik PDF, poniesiesz opłatę za przetwarzanie 2 obrazów.
Dokumenty: sprawdzone metody
Aby uzyskać najlepsze wyniki, podczas korzystania z plików PDF stosuj te sprawdzone metody i informacje:
- Jeśli prompt zawiera jeden plik PDF, umieść go przed promptem tekstowym w swojej prośbie.
- Jeśli masz długi dokument, możesz podzielić go na kilka plików PDF, aby go przetworzyć.
- Używaj plików PDF utworzonych z tekstem renderowanym jako tekst, zamiast używać tekstu w zeskanowanych obrazach. Ten format sprawia, że tekst jest w formacie czytelnym dla komputerów, dzięki czemu model może go łatwiej edytować, wyszukiwać i przetwarzać w porównaniu ze zeskanowanymi plikami PDF z obrazami. Ta metoda daje optymalne wyniki w przypadku dokumentów zawierających dużo tekstu, takich jak umowy.
Dokumenty: ograniczenia
Gemini Modele multimodalne są przydatne w wielu przypadkach użycia, ale warto poznać ich ograniczenia:
- Rozumowanie przestrzenne: modele nie są precyzyjne w lokalizowaniu tekstu ani obiektów w plikach PDF. Mogą zwracać tylko przybliżone liczby obiektów.
- Dokładność: modele mogą generować halucynacje podczas interpretowania odręcznego tekstu w dokumentach PDF.