สร้างเสียงโดยใช้ Gemini API

คุณสร้างเสียงประเภทต่อไปนี้ได้

การเปรียบเทียบระหว่าง TTS กับ Live API

ทั้งโมเดลการอ่านออกเสียงข้อความ (TTS) และ Live API โมเดลเป็นโมเดลสร้างคำพูดที่มีเวลาในการตอบสนองต่ำ ซึ่งกำหนดค่าให้ใช้เสียงในการตอบสนองที่แตกต่างกันได้ และภาษา อย่างไรก็ตาม โมเดลทั้งสองนี้เหมาะกับกรณีการใช้งานที่แตกต่างกันมาก

  • การสร้างการอ่านออกเสียงข้อความ (TTS) เป็นการโต้ตอบแบบคำขอ-การตอบสนอง ทิศทางเดียว (ข้อความเข้า เสียงออก) เหมาะสำหรับสถานการณ์ที่ต้อง อ่านออกเสียง ข้อความที่ให้มาอย่างถูกต้องแม่นยำ พร้อมการควบคุมสไตล์และเสียงอย่างละเอียด เช่น การบรรยายพอดแคสต์ หนังสือเสียง หรือการอ่านบทความออกเสียง

  • Live API การสร้าง รองรับ สองทิศทาง การสตรีมสำหรับ การสนทนาด้วยเสียงแบบเรียลไทม์ (เสียงเข้า, เสียงออก) เหมาะอย่างยิ่งสำหรับบริบทการสนทนาแบบไดนามิกที่โมเดลจะตัดสินใจเลือกคำพูดที่เหมาะสมเพื่อส่งกลับ โปรดทราบว่าโมเดล Live API ล่าสุดยังรองรับอินพุตวิดีโอและรูปภาพด้วย