إنشاء محتوى صوتي باستخدام واجهة برمجة التطبيقات Gemini

يمكنك إنشاء الأنواع التالية من المحتوى الصوتي:

مقارنة بين تحويل النص إلى كلام وLive API

إنّ كلاً من نماذج تحويل النص إلى كلام (TTS) ونماذج Live API هي نماذج منخفضة وقت الاستجابة، تنشئ كلامًا ويمكن ضبطها لاستخدام أصوات ولغات مختلفة في الردود. ومع ذلك، فإنّ حالات استخدامها مختلفة جدًا.

  • إنّ إنشاء المحتوى باستخدام تحويل النص إلى كلام (TTS) هو تفاعل أحادي الاتجاه بين الطلب والاستجابة (نص مُدخَل، وصوت مُخرَج). وهو مصمّم خصيصًا للسيناريوهات التي تتطلّب تلاوة دقيقة للنص المقدَّم مع تحكّم دقيق في الأسلوب والصوت، مثل سرد القصص في البودكاست أو الكتب الصوتية أو قراءة المقالات بصوت عالٍ.

  • Live API إنشاء المحتوى يتيح إرسال البيانات في اتجاهَين لإجراء محادثات صوتية في الوقت الفعلي (صوت مُدخَل، وصوت مُخرَج). ويتميّز هذا النوع من إنشاء المحتوى في السياقات الحوارية الديناميكية حيث يقرّر النموذج الكلام المناسب الذي يجب إرجاعه. يُرجى العِلم أنّ أحدث Live API نماذج تتيح أيضًا إدخال الفيديو والصور.