นับโทเค็นสำหรับโมเดล Gemini

Gemini โมเดลประมวลผลอินพุตและเอาต์พุตในหน่วยที่เรียกว่า โทเค็น

โทเค็นอาจเป็นอักขระเดียว เช่น z หรือคำทั้งคำ เช่น cat คำยาวๆ จะถูกแบ่งออกเป็นโทเค็นหลายรายการ ชุดโทเค็นทั้งหมดที่โมเดลใช้เรียกว่าคำศัพท์ และกระบวนการแยกข้อความออกเป็นโทเค็นเรียกว่า การทำโทเค็น

สำหรับโมเดล Gemini โทเค็น 1 รายการจะเทียบเท่ากับอักขระประมาณ 4 ตัว โทเค็น 100 รายการจะเท่ากับคำภาษาอังกฤษประมาณ 60-80 คำ

โมเดลแต่ละรายการมี จำนวนโทเค็นสูงสุด ที่จัดการได้ในพรอมต์และการตอบกลับ การทราบจำนวนโทเค็นของพรอมต์จะช่วยให้คุณทราบว่าได้เกินขีดจำกัดนี้หรือไม่ นอกจากนี้ ต้นทุนของคำขอจะพิจารณาจากจำนวนโทเค็นอินพุตและเอาต์พุตด้วยส่วนหนึ่ง ดังนั้นการทราบวิธีนับโทเค็นจึงอาจเป็นประโยชน์

โมเดลที่รองรับ

  • gemini-3.1-pro-preview
  • gemini-3.6-flash (และ gemini-3.5-flash รุ่นเก่ากว่า)
  • gemini-3.5-flash-lite (และ gemini-3.1-flash-lite รุ่นเก่ากว่า)
  • gemini-3-pro-image (หรือ "Nano Banana Pro")
  • gemini-3.1-flash-image (หรือ "Nano Banana 2")
  • gemini-3.1-flash-lite-image (หรือ "Nano Banana 2 Lite")
  • gemini-2.5-pro
  • gemini-2.5-flash
  • gemini-2.5-flash-lite

ตัวเลือกสำหรับการนับโทเค็น

ระบบจะทำโทเค็นอินพุตและเอาต์พุตทั้งหมดสำหรับ Gemini API รวมถึงข้อความ ไฟล์รูปภาพ และโมดัลอื่นๆ ที่ไม่ใช่ข้อความ ตัวเลือกสำหรับการนับโทเค็นมีดังนี้

ตรวจสอบจำนวนโทเค็นสำหรับ คำขอเท่านั้น (ก่อนส่งคำขอไปยังโมเดล )
เรียกใช้ countTokens พร้อมอินพุตของ คำขอ ก่อน ส่งคำขอไปยังโมเดล ซึ่งจะแสดงผลข้อมูลต่อไปนี้
  • total_tokens: จำนวนโทเค็นของ อินพุตเท่านั้น
ตรวจสอบจำนวนโทเค็นสำหรับ ทั้งคำขอและการตอบกลับ
เข้าถึงแอตทริบิวต์ usageMetadata ใน ออบเจ็กต์การตอบกลับ ซึ่งรวมถึงข้อมูลต่อไปนี้
  • prompt_token_count: จำนวนโทเค็นของอินพุตเท่านั้น
  • candidates_token_count: จำนวนโทเค็นของเอาต์พุตเท่านั้น (ไม่รวมโทเค็นการคิด)
  • thoughts_token_count: จำนวนโทเค็นการคิดที่ใช้ในการสร้างการตอบกลับ
  • total_token_count: จำนวนโทเค็นทั้งหมดสำหรับ ทั้ง อินพุตและเอาต์พุต (รวมโทเค็นการคิด)

เมื่อสตรีมเอาต์พุต แอตทริบิวต์ usageMetadata จะปรากฏในส่วนสุดท้ายของสตรีมเท่านั้น โดยจะมีค่าเป็น nil สำหรับ ส่วนกลาง

โปรดทราบประเด็นต่อไปนี้เกี่ยวกับตัวเลือกข้างต้น

  • ตัวเลือกเหล่านี้จะ ไม่ นับจำนวนรูปภาพอินพุตหรือจำนวนวินาทีในไฟล์วิดีโอหรือไฟล์เสียงอินพุต อย่างไรก็ตาม จำนวนโทเค็นสำหรับโมดัลเหล่านี้แต่ละรายการจะ สัมพันธ์กัน กับค่าเหล่านี้
  • จำนวนโทเค็นอินพุตรวมถึงพรอมต์ (ข้อความและไฟล์อินพุต) รวมถึงคำแนะนำและเครื่องมือของระบบ
  • จำนวนโทเค็นเอาต์พุตไม่รวมโทเค็นการคิด โดยระบบจะแสดงโทเค็นเหล่านี้ในช่องแยกต่างหาก
  • ดูข้อมูลเพิ่มเติมเฉพาะสำหรับคำขอแต่ละประเภทในส่วนต่างๆ ของหน้านี้
  • โมเดล Gemini Live API ไม่ รองรับ countTokens นอกจากนี้ Firebase AI Logic ยังไม่ รองรับแอตทริบิวต์ usageMetadata ในการตอบกลับจาก Live API โมเดล แต่จะรองรับเร็วๆ นี้

การกำหนดราคาสำหรับตัวเลือกเหล่านี้

  • การเรียกใช้ countTokens: ไม่มีค่าใช้จ่ายในการเรียกใช้ countTokens (Count Tokens API) โควต้าสูงสุดสำหรับ Count Tokens API คือ 3,000 คำขอต่อนาที (RPM)

  • การใช้แอตทริบิวต์ usageMetadata: ระบบจะแสดงผลแอตทริบิวต์นี้เป็นส่วนหนึ่งของการตอบกลับเสมอ และไม่มีค่าใช้จ่ายโทเค็นหรือค่าใช้จ่ายอื่นๆ

ข้อมูลเพิ่มเติม

ข้อมูลเพิ่มเติมเมื่อใช้คำขอประเภทเฉพาะ

นับโทเค็นอินพุตข้อความ

ไม่มีข้อมูลเพิ่มเติม

นับโทเค็นการสนทนาไปมา (แชท)

โปรดทราบข้อมูลต่อไปนี้สำหรับการเรียกใช้ countTokens เมื่อใช้แชท

  • หากคุณเรียกใช้ countTokens พร้อมประวัติการแชท ระบบจะแสดงผลจำนวนโทเค็นทั้งหมดจากทั้ง 2 บทบาทในการแชท (total_tokens)
  • หากต้องการทราบขนาดของการสนทนารอบถัดไป คุณต้องเพิ่มการสนทนาลงในประวัติเมื่อเรียกใช้ countTokens

นับโทเค็นอินพุตหลายโมดัล

โปรดทราบประเด็นต่อไปนี้เกี่ยวกับการนับโทเค็นด้วยอินพุตหลายโมดัล

  • คุณสามารถเรียกใช้ countTokens กับข้อความและไฟล์แยกกันได้
  • สำหรับตัวเลือกการนับโทเค็นทั้ง 2 แบบ คุณจะได้รับจำนวนโทเค็นเท่ากันไม่ว่าคุณจะระบุไฟล์เป็นข้อมูลแบบอินไลน์หรือใช้ URL ของไฟล์

ไฟล์อินพุตรูปภาพ

ระบบจะแปลงไฟล์อินพุตรูปภาพเป็นโทเค็นตามขนาดดังนี้

  • อินพุตรูปภาพที่มีขนาด ทั้ง 2 ด้าน ไม่เกิน 384 พิกเซล: ระบบจะนับรูปภาพแต่ละรูปเป็น 258 โทเค็น
  • อินพุตรูปภาพที่มีขนาดด้านใดด้านหนึ่งหรือทั้ง 2 ด้านใหญ่กว่า 384 พิกเซล: ระบบจะครอบตัดและปรับขนาดรูปภาพแต่ละรูปตามความจำเป็นให้เป็นไทล์ขนาด 768x768 พิกเซล แล้วนับไทล์แต่ละรายการเป็น 258 โทเค็น

ไฟล์อินพุตวิดีโอและเสียง

ระบบจะแปลงไฟล์อินพุตวิดีโอและเสียงเป็นโทเค็นตามอัตราคงที่ต่อไปนี้

  • วิดีโอ: 263 โทเค็นต่อวินาที
  • เสียง: 32 โทเค็นต่อวินาที

ไฟล์อินพุตเอกสาร (เช่น PDF)

ระบบจะถือว่าไฟล์อินพุต PDF เป็นรูปภาพ ดังนั้นระบบจะทำโทเค็นหน้า PDF แต่ละหน้าในลักษณะเดียวกับรูปภาพ