Gemini โมเดลประมวลผลอินพุตและเอาต์พุตในหน่วยที่เรียกว่า โทเค็น
โทเค็นอาจเป็นอักขระเดียว เช่น z หรือคำทั้งคำ เช่น cat คำยาวๆ จะถูกแบ่งออกเป็นโทเค็นหลายรายการ ชุดโทเค็นทั้งหมดที่โมเดลใช้เรียกว่าคำศัพท์ และกระบวนการแยกข้อความออกเป็นโทเค็นเรียกว่า การทำโทเค็น
สำหรับโมเดล Gemini โทเค็น 1 รายการจะเทียบเท่ากับอักขระประมาณ 4 ตัว โทเค็น 100 รายการจะเท่ากับคำภาษาอังกฤษประมาณ 60-80 คำ
โมเดลแต่ละรายการมี จำนวนโทเค็นสูงสุด ที่จัดการได้ในพรอมต์และการตอบกลับ การทราบจำนวนโทเค็นของพรอมต์จะช่วยให้คุณทราบว่าได้เกินขีดจำกัดนี้หรือไม่ นอกจากนี้ ต้นทุนของคำขอจะพิจารณาจากจำนวนโทเค็นอินพุตและเอาต์พุตด้วยส่วนหนึ่ง ดังนั้นการทราบวิธีนับโทเค็นจึงอาจเป็นประโยชน์
โมเดลที่รองรับ
gemini-3.1-pro-previewgemini-3.6-flash(และgemini-3.5-flashรุ่นเก่ากว่า)gemini-3.5-flash-lite(และgemini-3.1-flash-liteรุ่นเก่ากว่า)gemini-3-pro-image(หรือ "Nano Banana Pro")gemini-3.1-flash-image(หรือ "Nano Banana 2")gemini-3.1-flash-lite-image(หรือ "Nano Banana 2 Lite")gemini-2.5-progemini-2.5-flashgemini-2.5-flash-lite
ตัวเลือกสำหรับการนับโทเค็น
ระบบจะทำโทเค็นอินพุตและเอาต์พุตทั้งหมดสำหรับ Gemini API รวมถึงข้อความ ไฟล์รูปภาพ และโมดัลอื่นๆ ที่ไม่ใช่ข้อความ ตัวเลือกสำหรับการนับโทเค็นมีดังนี้
- ตรวจสอบจำนวนโทเค็นสำหรับ คำขอเท่านั้น (ก่อนส่งคำขอไปยังโมเดล )
- เรียกใช้
countTokensพร้อมอินพุตของ คำขอ ก่อน ส่งคำขอไปยังโมเดล ซึ่งจะแสดงผลข้อมูลต่อไปนี้total_tokens: จำนวนโทเค็นของ อินพุตเท่านั้น
- ตรวจสอบจำนวนโทเค็นสำหรับ ทั้งคำขอและการตอบกลับ
- เข้าถึงแอตทริบิวต์
usageMetadataใน ออบเจ็กต์การตอบกลับ ซึ่งรวมถึงข้อมูลต่อไปนี้prompt_token_count: จำนวนโทเค็นของอินพุตเท่านั้นcandidates_token_count: จำนวนโทเค็นของเอาต์พุตเท่านั้น (ไม่รวมโทเค็นการคิด)thoughts_token_count: จำนวนโทเค็นการคิดที่ใช้ในการสร้างการตอบกลับtotal_token_count: จำนวนโทเค็นทั้งหมดสำหรับ ทั้ง อินพุตและเอาต์พุต (รวมโทเค็นการคิด)
เมื่อสตรีมเอาต์พุต แอตทริบิวต์
usageMetadataจะปรากฏในส่วนสุดท้ายของสตรีมเท่านั้น โดยจะมีค่าเป็นnilสำหรับ ส่วนกลาง
โปรดทราบประเด็นต่อไปนี้เกี่ยวกับตัวเลือกข้างต้น
- ตัวเลือกเหล่านี้จะ ไม่ นับจำนวนรูปภาพอินพุตหรือจำนวนวินาทีในไฟล์วิดีโอหรือไฟล์เสียงอินพุต อย่างไรก็ตาม จำนวนโทเค็นสำหรับโมดัลเหล่านี้แต่ละรายการจะ สัมพันธ์กัน กับค่าเหล่านี้
- จำนวนโทเค็นอินพุตรวมถึงพรอมต์ (ข้อความและไฟล์อินพุต) รวมถึงคำแนะนำและเครื่องมือของระบบ
- จำนวนโทเค็นเอาต์พุตไม่รวมโทเค็นการคิด โดยระบบจะแสดงโทเค็นเหล่านี้ในช่องแยกต่างหาก
- ดูข้อมูลเพิ่มเติมเฉพาะสำหรับคำขอแต่ละประเภทในส่วนต่างๆ ของหน้านี้
- โมเดล Gemini Live API
ไม่ รองรับ
countTokensนอกจากนี้ Firebase AI Logic ยังไม่ รองรับแอตทริบิวต์usageMetadataในการตอบกลับจาก Live API โมเดล แต่จะรองรับเร็วๆ นี้
การกำหนดราคาสำหรับตัวเลือกเหล่านี้
การเรียกใช้
countTokens: ไม่มีค่าใช้จ่ายในการเรียกใช้countTokens(Count Tokens API) โควต้าสูงสุดสำหรับ Count Tokens API คือ 3,000 คำขอต่อนาที (RPM)การใช้แอตทริบิวต์
usageMetadata: ระบบจะแสดงผลแอตทริบิวต์นี้เป็นส่วนหนึ่งของการตอบกลับเสมอ และไม่มีค่าใช้จ่ายโทเค็นหรือค่าใช้จ่ายอื่นๆ
ข้อมูลเพิ่มเติม
ข้อมูลเพิ่มเติมเมื่อใช้คำขอประเภทเฉพาะ
นับโทเค็นอินพุตข้อความ
ไม่มีข้อมูลเพิ่มเติม
นับโทเค็นการสนทนาไปมา (แชท)
โปรดทราบข้อมูลต่อไปนี้สำหรับการเรียกใช้ countTokens เมื่อใช้แชท
- หากคุณเรียกใช้
countTokensพร้อมประวัติการแชท ระบบจะแสดงผลจำนวนโทเค็นทั้งหมดจากทั้ง 2 บทบาทในการแชท (total_tokens) - หากต้องการทราบขนาดของการสนทนารอบถัดไป คุณต้องเพิ่มการสนทนาลงในประวัติเมื่อเรียกใช้
countTokens
นับโทเค็นอินพุตหลายโมดัล
โปรดทราบประเด็นต่อไปนี้เกี่ยวกับการนับโทเค็นด้วยอินพุตหลายโมดัล
- คุณสามารถเรียกใช้
countTokensกับข้อความและไฟล์แยกกันได้ - สำหรับตัวเลือกการนับโทเค็นทั้ง 2 แบบ คุณจะได้รับจำนวนโทเค็นเท่ากันไม่ว่าคุณจะระบุไฟล์เป็นข้อมูลแบบอินไลน์หรือใช้ URL ของไฟล์
ไฟล์อินพุตรูปภาพ
ระบบจะแปลงไฟล์อินพุตรูปภาพเป็นโทเค็นตามขนาดดังนี้
- อินพุตรูปภาพที่มีขนาด ทั้ง 2 ด้าน ไม่เกิน 384 พิกเซล: ระบบจะนับรูปภาพแต่ละรูปเป็น 258 โทเค็น
- อินพุตรูปภาพที่มีขนาดด้านใดด้านหนึ่งหรือทั้ง 2 ด้านใหญ่กว่า 384 พิกเซล: ระบบจะครอบตัดและปรับขนาดรูปภาพแต่ละรูปตามความจำเป็นให้เป็นไทล์ขนาด 768x768 พิกเซล แล้วนับไทล์แต่ละรายการเป็น 258 โทเค็น
ไฟล์อินพุตวิดีโอและเสียง
ระบบจะแปลงไฟล์อินพุตวิดีโอและเสียงเป็นโทเค็นตามอัตราคงที่ต่อไปนี้
- วิดีโอ: 263 โทเค็นต่อวินาที
- เสียง: 32 โทเค็นต่อวินาที
ไฟล์อินพุตเอกสาร (เช่น PDF)
ระบบจะถือว่าไฟล์อินพุต PDF เป็นรูปภาพ ดังนั้นระบบจะทำโทเค็นหน้า PDF แต่ละหน้าในลักษณะเดียวกับรูปภาพ