إنشاء محتوى صوتي باستخدام واجهة برمجة التطبيقات Gemini

يمكنك إنشاء الأنواع التالية من المحتوى الصوتي:

مقارنة بين ميزة "تحويل النص إلى كلام" وLive API

إنّ كلاً من نماذج تحويل النص إلى كلام (TTS) ونماذج Live API هي نماذج منخفضة الاستجابة لإنشاء الكلام، ويمكن ضبطها لتوفير أصوات ولغات مختلفة للردود. ومع ذلك، فإنّها تخدم حالات استخدام مختلفة تمامًا.

  • إنشاء محتوى باستخدام ميزة "تحويل النص إلى كلام" هو تفاعل أحادي الاتجاه بين الطلب والاستجابة (نص مُدخَل، صوت مُخرَج). وهي مصمّمة خصيصًا للحالات التي تتطلّب تلاوة دقيقة للنص المقدَّم مع إمكانية التحكّم الدقيق في الأسلوب والصوت، مثل سرد البودكاست أو الكتب المسموعة أو قراءة المقالات بصوت عالٍ.

  • تتيح ميزة Live API إنشاء البث ثنائي الاتجاه للمحادثات الصوتية في الوقت الفعلي (إدخال الصوت وإخراجه). يتفوّق هذا النموذج في سياقات المحادثات الديناميكية حيث يقرّر النموذج النص الصالح الذي يجب إرجاعه. يُرجى العِلم أنّ أحدث Live API النماذج تتيح أيضًا إدخال الفيديو والصور.