Поддерживаемые входные файлы и требования

При вызове Gemini API из приложения с помощью Firebase AI Logic SDK можно попросить модель Gemini сгенерировать текст на основе мультимодальных входных данных, таких как изображения, видео, аудио и документы (например, PDF-файлы).

Вам нужно использовать поддерживаемые типы файлов, указывать поддерживаемый MIME-тип и убедиться, что ваши файлы и мультимодальные запросы соответствуют требованиям и рекомендациям.

На этой странице рассказывается о том, как использовать GenerativeModel, и описаны следующие темы:

Варианты предоставления файлов в мультимодальных запросах

Выберите поставщика Gemini API, чтобы посмотреть контент, относящийся к нему

В каждом мультимодальном запросе необходимо указывать следующие данные:

Размер и количество файлов, которые можно указать в запросе, зависят от типа входного файла, способа его предоставления и используемой модели (подробную информацию можно найти в разделе, посвященном каждому типу входного файла).

Вариант 1. Укажите файл как встроенные данные

Обратите внимание на следующие особенности файлов, предоставленных в виде встроенных данных:

  • Небольшие файлы можно отправлять как встроенные данные, поскольку максимальный размер запроса составляет 20 МБ.

  • Файл кодируется в base64 при передаче (что увеличивает размер файла).

Пример того, как включить файл в качестве встроенных данных, можно найти в разделе Создание сгенерированного текста на основе текстовых и файловых (мультимодальных) входных данных. Обратите внимание, что SDK для платформ Android и Apple могут обрабатывать встроенные изображения в запросах без указания MIME-типа. Подробнее…

Вариант 2. Укажите URL файла

Ниже перечислены допустимые типы URL при использовании разметки Gemini Developer API:



Изображения: требования, рекомендации и ограничения

Требования к изображениям

В этом разделе рассказывается о поддерживаемых MIME-типах и ограничениях на количество запросов для изображений.

Поддерживаемые MIME-типы

Gemini мультимодальные модели поддерживают следующие MIME-типы изображений:

  • PNG: image/png
  • JPEG – image/jpeg
  • WebP – image/webp

Ограничения на запрос

Ограничений на количество пикселей в изображении нет. Однако более крупные изображения будут уменьшены и дополнены, чтобы соответствовать максимальному разрешению 3072 x 3072, при этом их исходное соотношение сторон сохранится.

Максимальное количество файлов в запросе: 3000 графических файлов.

Изображения: токенизация

Вот как рассчитывается количество токенов для изображений:

  • Если обе стороны изображения не превышают 384 пикселя, используется 258 токенов.
  • Если один из размеров изображения превышает 384 пикселя, оно разбивается на фрагменты. Размер каждого фрагмента по умолчанию равен наименьшему размеру (ширине или высоте), деленному на 1,5. При необходимости размер каждого фрагмента корректируется так, чтобы он был не меньше 256 и не больше 768 пикселей. Затем размер каждого фрагмента изменяется до 768 x 768 пикселей, и для него используется 258 токенов.

Изображения: рекомендации

Чтобы получить наилучшие результаты, следуйте приведенным ниже рекомендациям по использованию изображений.

  • Если вы хотите распознать текст на изображении, используйте запросы с одним изображением. В этом случае результаты будут лучше, чем при использовании запросов с несколькими изображениями.
  • Если в запросе есть только одно изображение, поместите его перед текстовым запросом.
  • Если в запросе несколько изображений и вы хотите ссылаться на них в запросе или чтобы модель ссылалась на них в ответе, добавьте перед каждым изображением его индекс. Используйте a b c или image 1 image 2 image 3 в качестве индекса. Ниже приведен пример использования индексированных изображений в запросе:
    image 1 
    image 2 
    image 3 
    
    Write a blogpost about my day using image 1 and image 2. Then, give me ideas
    for tomorrow based on image 3.
  • Используйте изображения с более высоким разрешением.
  • Добавьте в запрос несколько примеров.
  • Поворачивайте изображения в правильную ориентацию, прежде чем добавлять их в запрос.
  • Не используйте размытые изображения.

Изображения: ограничения

GeminiМультимодальные модели обладают широкими возможностями, но важно понимать их ограничения:

  • Модерация контента. Модели отказываются предоставлять ответы на изображения, которые нарушают наши правила безопасности.
  • Пространственное мышление. Модели неточно определяют местоположение текста или объектов на изображениях. Они могут возвращать только приблизительное количество объектов.
  • Медицинское применение. Модели не подходят для интерпретации медицинских изображений (например, рентгеновских снимков и результатов компьютерной томографии) или предоставления медицинских консультаций.
  • Распознавание людей. Модели не предназначены для идентификации людей, не являющихся знаменитостями, на изображениях.
  • Точность. Модели могут допускать ошибки при интерпретации изображений низкого качества, повернутых или с очень низким разрешением. Модели также могут создавать галлюцинации при интерпретации рукописного текста в документах с изображениями.



Видео: требования, рекомендации и ограничения

Требования к видео

В этом разделе рассказывается о поддерживаемых MIME-типах и ограничениях на запрос для видео.

Поддерживаемые MIME-типы

Gemini мультимодальные модели поддерживают следующие MIME-типы видео:

  • FLV – video/x-flv
  • MOV – video/quicktime
  • MPEG – video/mpeg
  • MPEGPS – video/mpegps
  • MPG: video/mpg
  • MP4 – video/mp4
  • WEBM – video/webm
  • WMV – video/wmv
  • 3GPP: video/3gpp

Ограничения на запрос

Максимальное количество файлов в одном запросе: 10 видеофайлов.

Видео: токенизация

Вот как рассчитываются токены для видео:

  • Звуковая дорожка закодирована вместе с видеокадрами. Аудиодорожка также разбивается на секундные фрагменты, каждый из которых содержит 32 токена. Кадры видео и аудиотокены чередуются с временными метками. Временные метки представлены в виде пяти токенов.
  • Для видео, снятых с частотой 1 кадр в секунду или ниже, временные метки первого часа видео представлены в виде пяти токенов на каждый кадр. Остальные временные метки представлены в виде семи токенов на каждый кадр видео.
  • Для видео, которые записываются со скоростью более одного кадра в секунду, временные метки для первого часа видео представлены в виде девяти токенов на каждый кадр. Остальные временные метки представлены в виде 11 токенов на каждый кадр видео.

Видео: рекомендации

Чтобы получить наилучшие результаты, следуйте приведенным ниже рекомендациям по использованию видео.

  • Если в запросе одно видео, разместите его перед текстовым запросом.
  • Если вам нужна локализация временных меток в видео со звуком, попросите модель сгенерировать временные метки в формате, описанном в разделе "Формат временных меток".

Видео: ограничения

GeminiМультимодальные модели обладают широкими возможностями, но важно понимать их ограничения:

  • Модерация контента. Модели отказываются отвечать на вопросы о видео, которые нарушают наши правила безопасности.
  • Распознавание звуков, не относящихся к речи. Модели, поддерживающие аудио, могут ошибаться при распознавании звуков, не относящихся к речи.



Аудио: требования и ограничения

Аудио: требования

В этом разделе рассказывается о поддерживаемых MIME-типах и ограничениях на запрос для аудио.

Поддерживаемые MIME-типы

Gemini мультимодальные модели поддерживают следующие MIME-типы аудио:

  • AAC – audio/aac
  • FLACaudio/flac
  • MP3 – audio/mp3
  • MPA: audio/m4a
  • MPEG – audio/mpeg
  • MPGA: audio/mpga
  • MP4 – audio/mp4
  • OPUS – audio/opus
  • PCM – audio/pcm
  • WAV – audio/wav
  • WEBM – audio/webm

Ограничения на запрос

Максимальное количество файлов в запросе: 1 аудиофайл.

Аудио: ограничения

GeminiМультимодальные модели обладают широкими возможностями, но важно понимать их ограничения:

  • Распознавание звуков, не относящихся к речи. Модели, поддерживающие аудио, могут ошибаться при распознавании звуков, не относящихся к речи.
  • Временные метки для аудиофайлов. Чтобы точно создавать временные метки для аудиофайлов, необходимо настроить параметр audio_timestamp в generation_config.



Документы (например, PDF-файлы): требования, рекомендации и ограничения

Требования к документам

В этом разделе рассказывается о поддерживаемых MIME-типах и ограничениях на запрос для документов (например, PDF-файлов).

Поддерживаемые MIME-типы

Gemini мультимодальные модели поддерживают следующие MIME-типы документов:

  • PDF-файл: application/pdf
  • Текст – text/plain

Ограничения на запрос

PDF-файлы обрабатываются как изображения, поэтому одна страница PDF-файла считается одним изображением. Количество страниц в запросе ограничено количеством изображений, которые могут обрабатывать мультимодальные модели Gemini.

  • Максимальное количество файлов в запросе: 3000.
  • Максимальное количество страниц в файле: 1000.
  • Максимальный размер файла: 50 МБ.

Документы: токенизация

Токенизация PDF

PDF-файлы обрабатываются как изображения, поэтому каждая страница PDF-документа разбивается на токены так же, как и изображение.

Стоимость PDF-файлов рассчитывается по ценам на изображения Gemini. Например, если вы включите двухстраничный PDF-файл в вызов API Gemini, то заплатите за обработку двух изображений.

Документы: рекомендации

Чтобы получить наилучшие результаты при работе с PDF-файлами, следуйте приведенным ниже рекомендациям.

  • Если в запросе есть только один PDF-файл, поместите его перед текстовым запросом.
  • Если документ длинный, разделите его на несколько PDF-файлов.
  • Используйте PDF-файлы, в которых текст представлен в виде текста, а не отсканированных изображений. Этот формат обеспечивает машиночитаемость текста, поэтому модели проще редактировать, искать и обрабатывать его, чем отсканированные PDF-файлы. Этот способ позволяет получить оптимальные результаты при работе с документами, содержащими много текста, например с договорами.

Документы: ограничения

GeminiМультимодальные модели обладают широкими возможностями, но важно понимать их ограничения:

  • Пространственное мышление. Модели неточно определяют местоположение текста или объектов в PDF-файлах. Они могут возвращать только приблизительное количество объектов.
  • Точность. Модели могут допускать ошибки при интерпретации рукописного текста в PDF-документах.