Firebase is back at Cloud Next on April 9 - 11. Register now.

Halaman ini diterjemahkan oleh Cloud Translation API.

Membuat teks dari perintah multimodal menggunakan Gemini API
bookmark_border Tetap teratur dengan koleksi Simpan dan kategorikan konten berdasarkan preferensi Anda.

Saat memanggil Gemini API dari aplikasi menggunakan Vertex AI in Firebase SDK, Anda dapat meminta model Gemini untuk membuat teks berdasarkan input multimodal. Perintah multimodal dapat mencakup beberapa modalitas (atau jenis input), seperti teks beserta gambar, PDF, file teks biasa, video, dan audio.

Dalam setiap permintaan multimodal, Anda harus selalu memberikan hal berikut:

mimeType file. Pelajari setiap jenis MIME file input yang didukung.
File. Anda dapat memberikan file sebagai data inline (seperti yang ditunjukkan di halaman ini) atau menggunakan URL atau URI-nya.

Untuk menguji dan melakukan iterasi pada perintah multimodal, sebaiknya gunakan Vertex AI Studio.

Opsi lain untuk menggunakan Gemini API

Secara opsional, bereksperimenlah dengan versi "Google AI" alternatif dari Gemini API
Dapatkan akses tanpa biaya (dalam batas dan jika tersedia) menggunakan Google AI Studio dan SDK klien Google AI. SDK ini harus digunakan untuk hanya membuat prototipe di aplikasi seluler dan web.

Setelah Anda memahami cara kerja Gemini API, migrasikan ke Vertex AI in Firebase SDK kami (dokumentasi ini), yang memiliki banyak fitur tambahan yang penting untuk aplikasi seluler dan web, seperti melindungi API dari penyalahgunaan menggunakan Firebase App Check dan dukungan untuk file media berukuran besar dalam permintaan.

Secara opsional, panggil sisi server Vertex AI Gemini API (seperti dengan Python, Node.js, atau Go)
Gunakan SDK Vertex AI sisi server, Genkit, atau Firebase Extensions untuk Gemini API.

Sebelum memulai

Jika Anda belum melakukannya, selesaikan panduan memulai, yang menjelaskan cara menyiapkan project Firebase, menghubungkan aplikasi ke Firebase, menambahkan SDK, menginisialisasi layanan Vertex AI, dan membuat instance GenerativeModel.

Membuat teks dari teks dan satu gambar Membuat teks dari teks dan beberapa gambar Membuat teks dari teks dan video

Contoh file media

Jika belum memiliki file media, Anda dapat menggunakan file berikut yang tersedia secara publik. Karena file ini disimpan di bucket yang tidak ada dalam project Firebase Anda, Anda harus menggunakan format https://storage.googleapis.com/BUCKET_NAME/PATH/TO/FILE untuk URL.

Gambar: https://storage.googleapis.com/cloud-samples-data/generative-ai/image/scones.jpg dengan jenis MIME image/jpeg. Lihat atau download gambar ini.
PDF: https://storage.googleapis.com/cloud-samples-data/generative-ai/pdf/2403.05530.pdf dengan jenis MIME application/pdf. Lihat atau download PDF ini.
Video: https://storage.googleapis.com/cloud-samples-data/video/animals.mp4 dengan jenis MIME video/mp4. Tonton atau download video ini.
Audio: https://storage.googleapis.com/cloud-samples-data/generative-ai/audio/pixel.mp3 dengan jenis MIME audio/mp3. Dengarkan atau download audio ini.

Membuat teks dari teks dan satu gambar

Pastikan Anda telah menyelesaikan bagian Sebelum memulai dalam panduan ini sebelum mencoba contoh ini.

Anda dapat memanggil Gemini API dengan perintah multimodal yang menyertakan teks dan satu file (seperti gambar, seperti yang ditunjukkan dalam contoh ini). Untuk panggilan ini, Anda perlu menggunakan model yang mendukung media dalam perintah (seperti Gemini 2.0 Flash).

Pastikan untuk meninjau persyaratan dan rekomendasi untuk file input.

Pilih apakah Anda ingin melakukan streaming respons (generateContentStream) atau menunggu respons hingga seluruh hasilnya dihasilkan (generateContent).

Streaming Tanpa streaming

Anda dapat mencapai interaksi yang lebih cepat dengan tidak menunggu seluruh hasil dari pembuatan model, dan sebagai gantinya menggunakan streaming untuk menangani hasil sebagian.

Contoh ini menunjukkan cara menggunakan generateContentStream() untuk melakukan streaming teks yang dihasilkan dari permintaan perintah multimodal yang menyertakan teks dan satu gambar:

import FirebaseVertexAI

// Initialize the Vertex AI service
let vertex = VertexAI.vertexAI()

// Create a `GenerativeModel` instance with a model that supports your use case
let model = vertex.generativeModel(modelName: "gemini-2.0-flash")

guard let image = UIImage(systemName: "bicycle") else { fatalError() }

// Provide a text prompt to include with the image
let prompt = "What's in this picture?"

// To stream generated text output, call generateContentStream and pass in the prompt
let contentStream = try model.generateContentStream(image, prompt)
for try await chunk in contentStream {
  if let text = chunk.text {
    print(text)
  }
}

Catatan: Contoh di atas memanfaatkan cara yang disederhanakan untuk menangani jenis gambar native platform (UIImage, NSImage, CIImage, dan CGImage) dalam perintah multi-modal. Jenis gambar ini (terlepas dari format aslinya) dikonversi sisi klien ke JPEG dengan kualitas 80% sebelum dikirim ke server. Artinya, saat memberikan gambar inline seperti pada contoh di atas, Anda tidak perlu menentukan jenis MIME.

Untuk kontrol lebih besar atas format dan konversi gambar, Anda dapat memberikan gambar sebagai InlineDataPart dan menyediakan jenis MIME tertentu. Misalnya: InlineDataPart(data: Data(/* PNG Data */), mimeType: "image/png").

Atau, Anda dapat menunggu seluruh hasil, bukan streaming; hasil hanya ditampilkan setelah model menyelesaikan seluruh proses pembuatan.

Contoh ini menunjukkan cara menggunakan generateContent() untuk membuat teks dari permintaan perintah multimodal yang menyertakan teks dan satu gambar:

import FirebaseVertexAI

// Initialize the Vertex AI service
let vertex = VertexAI.vertexAI()

// Create a `GenerativeModel` instance with a model that supports your use case
let model = vertex.generativeModel(modelName: "gemini-2.0-flash")

guard let image = UIImage(systemName: "bicycle") else { fatalError() }

// Provide a text prompt to include with the image
let prompt = "What's in this picture?"

// To generate text output, call generateContent and pass in the prompt
let response = try await model.generateContent(image, prompt)
print(response.text ?? "No text in response.")

Pelajari cara memilih model dan secara opsional lokasi yang sesuai untuk kasus penggunaan dan aplikasi Anda.

Membuat teks dari teks dan beberapa gambar

Pastikan Anda telah menyelesaikan bagian Sebelum memulai dalam panduan ini sebelum mencoba contoh ini.

Anda dapat memanggil Gemini API dengan perintah multimodal yang menyertakan teks dan beberapa file (seperti gambar, seperti yang ditunjukkan dalam contoh ini). Untuk panggilan ini, Anda perlu menggunakan model yang mendukung media dalam perintah (seperti Gemini 2.0 Flash).

Pastikan untuk meninjau persyaratan dan rekomendasi untuk file input.

Pilih apakah Anda ingin melakukan streaming respons (generateContentStream) atau menunggu respons hingga seluruh hasilnya dihasilkan (generateContent).

Streaming Tanpa streaming

Anda dapat mencapai interaksi yang lebih cepat dengan tidak menunggu seluruh hasil dari pembuatan model, dan sebagai gantinya menggunakan streaming untuk menangani hasil sebagian.

Contoh ini menunjukkan cara menggunakan generateContentStream() untuk melakukan streaming teks yang dihasilkan dari permintaan perintah multimodal yang menyertakan teks dan beberapa gambar:

import FirebaseVertexAI

// Initialize the Vertex AI service
let vertex = VertexAI.vertexAI()

// Create a `GenerativeModel` instance with a model that supports your use case
let model = vertex.generativeModel(modelName: "gemini-2.0-flash")

guard let image1 = UIImage(systemName: "car") else { fatalError() }
guard let image2 = UIImage(systemName: "car.2") else { fatalError() }

// Provide a text prompt to include with the images
let prompt = "What's different between these pictures?"

// To stream generated text output, call generateContentStream and pass in the prompt
let contentStream = try model.generateContentStream(image1, image2, prompt)
for try await chunk in contentStream {
  if let text = chunk.text {
    print(text)
  }
}

Atau, Anda dapat menunggu seluruh hasil, bukan streaming; hasilnya hanya ditampilkan setelah model menyelesaikan seluruh proses pembuatan.

Contoh ini menunjukkan cara menggunakan generateContent() untuk membuat teks dari permintaan perintah multimodal yang menyertakan teks dan beberapa gambar:

import FirebaseVertexAI

// Initialize the Vertex AI service
let vertex = VertexAI.vertexAI()

// Create a `GenerativeModel` instance with a model that supports your use case
let model = vertex.generativeModel(modelName: "gemini-2.0-flash")

guard let image1 = UIImage(systemName: "car") else { fatalError() }
guard let image2 = UIImage(systemName: "car.2") else { fatalError() }

// Provide a text prompt to include with the images
let prompt = "What's different between these pictures?"

// To generate text output, call generateContent and pass in the prompt
let response = try await model.generateContent(image1, image2, prompt)
print(response.text ?? "No text in response.")

Pelajari cara memilih model dan secara opsional lokasi yang sesuai untuk kasus penggunaan dan aplikasi Anda.

Membuat teks dari teks dan video

Pastikan Anda telah menyelesaikan bagian Sebelum memulai dalam panduan ini sebelum mencoba contoh ini.

Anda dapat memanggil Gemini API dengan perintah multimodal yang menyertakan file teks dan video (seperti yang ditunjukkan dalam contoh ini). Untuk panggilan ini, Anda harus menggunakan model yang mendukung media dalam perintah (seperti Gemini 2.0 Flash).

Pastikan untuk meninjau persyaratan dan rekomendasi untuk file input.

Pilih apakah Anda ingin melakukan streaming respons (generateContentStream) atau menunggu respons hingga seluruh hasilnya dihasilkan (generateContent).

Streaming Tanpa streaming

Anda dapat mencapai interaksi yang lebih cepat dengan tidak menunggu seluruh hasil dari pembuatan model, dan sebagai gantinya menggunakan streaming untuk menangani hasil sebagian.

Contoh ini menunjukkan cara menggunakan generateContentStream() untuk melakukan streaming teks yang dihasilkan dari permintaan perintah multimodal yang menyertakan teks dan satu video:

import FirebaseVertexAI

// Initialize the Vertex AI service
let vertex = VertexAI.vertexAI()

// Create a `GenerativeModel` instance with a model that supports your use case
let model = vertex.generativeModel(modelName: "gemini-2.0-flash")

// Provide the video as `Data` with the appropriate MIME type
let video = InlineDataPart(data: try Data(contentsOf: videoURL), mimeType: "video/mp4")

// Provide a text prompt to include with the video
let prompt = "What is in the video?"

// To stream generated text output, call generateContentStream with the text and video
let contentStream = try model.generateContentStream(video, prompt)
for try await chunk in contentStream {
  if let text = chunk.text {
    print(text)
  }
}

Atau, Anda dapat menunggu seluruh hasil, bukan streaming; hasil hanya ditampilkan setelah model menyelesaikan seluruh proses pembuatan.

Contoh ini menunjukkan cara menggunakan generateContent() untuk membuat teks dari permintaan perintah multimodal yang menyertakan teks dan satu video:

import FirebaseVertexAI

// Initialize the Vertex AI service
let vertex = VertexAI.vertexAI()

// Create a `GenerativeModel` instance with a model that supports your use case
let model = vertex.generativeModel(modelName: "gemini-2.0-flash")

// Provide the video as `Data` with the appropriate MIME type.
let video = InlineDataPart(data: try Data(contentsOf: videoURL), mimeType: "video/mp4")

// Provide a text prompt to include with the video
let prompt = "What is in the video?"

// To generate text output, call generateContent with the text and video
let response = try await model.generateContent(video, prompt)
print(response.text ?? "No text in response.")

Pelajari cara memilih model dan secara opsional lokasi yang sesuai untuk kasus penggunaan dan aplikasi Anda.

Persyaratan dan rekomendasi untuk file input

Lihat File input dan persyaratan yang didukung untuk Vertex AI Gemini API untuk mempelajari hal berikut:

Berbagai opsi untuk memberikan file dalam permintaan
Jenis file yang didukung
Jenis MIME yang didukung dan cara menentukannya
Persyaratan dan praktik terbaik untuk file dan permintaan multimodal

Kamu bisa apa lagi?

Pelajari cara menghitung token sebelum mengirim perintah panjang ke model.
Siapkan Cloud Storage for Firebase agar Anda dapat menyertakan file besar dalam permintaan multimodal dan memiliki solusi yang lebih terkelola untuk menyediakan file dalam perintah. File dapat mencakup gambar, PDF, video, dan audio.
Mulailah memikirkan persiapan produksi, termasuk menyiapkan Firebase App Check untuk melindungi Gemini API dari penyalahgunaan oleh klien yang tidak sah. Selain itu, pastikan untuk meninjau checklist produksi.

Mencoba kemampuan lain

Buat percakapan multi-giliran (chat).
Buat teks dari perintah khusus teks.
Buat output terstruktur (seperti JSON) dari prompt teks dan multimodal.
Buat gambar dari perintah teks.
Gunakan panggilan fungsi untuk menghubungkan model generatif ke sistem dan informasi eksternal.

Pelajari cara mengontrol pembuatan konten

Memahami desain perintah, termasuk praktik terbaik, strategi, dan contoh perintah.
Mengonfigurasi parameter model seperti suhu dan token output maksimum (untuk Gemini) atau rasio aspek dan pembuatan orang (untuk Imagen).
Gunakan setelan keamanan untuk menyesuaikan kemungkinan mendapatkan respons yang mungkin dianggap berbahaya.

Anda juga dapat bereksperimen dengan perintah dan konfigurasi model menggunakan Vertex AI Studio.

Pelajari lebih lanjut model yang didukung

Pelajari model yang tersedia untuk berbagai kasus penggunaan serta kuota dan harga-nya.

Berikan masukan tentang pengalaman Anda dengan Vertex AI in Firebase

Membuat teks dari perintah multimodal menggunakan Gemini API bookmark_borderbookmark Tetap teratur dengan koleksi Simpan dan kategorikan konten berdasarkan preferensi Anda.

Sebelum memulai

Contoh file media

Membuat teks dari teks dan satu gambar

Membuat teks dari teks dan beberapa gambar

Membuat teks dari teks dan video

Persyaratan dan rekomendasi untuk file input

Kamu bisa apa lagi?

Mencoba kemampuan lain

Pelajari cara mengontrol pembuatan konten

Pelajari lebih lanjut model yang didukung

Membuat teks dari perintah multimodal menggunakan Gemini API
bookmark_border Tetap teratur dengan koleksi Simpan dan kategorikan konten berdasarkan preferensi Anda.