יצירת אודיו באמצעות Gemini API

אפשר ליצור אודיו מהסוגים הבאים:

השוואה בין TTS לבין Live API

גם מודלים של המרת טקסט לדיבור (TTS) וגם מודלים של Live API הם מודלים ליצירת דיבור עם זמן אחזור נמוך, שאפשר להגדיר בהם קולות ושפות שונים לתשובות. עם זאת, הם מיועדים לתרחישי שימוש שונים מאוד.

  • יצירת המרת טקסט לדיבור (TTS) היא אינטראקציה של בקשה ותגובה חד-כיוונית (טקסט כקלט, אודיו כפלט). הוא מותאם לתרחישים שבהם נדרשת הקראה מדויקת של הטקסט שסופק, עם שליטה מדויקת בסגנון ובצליל, כמו קריינות לפודקאסטים, ספרי אודיו או הקראת מאמרים.

  • יצירת Live API תומכת בסטרימינג דו-כיווני של שיחות קוליות בזמן אמת (קול נכנס, קול יוצא). הוא מצטיין בהקשרים דינמיים של שיחות, שבהם המודל מחליט איזו תגובה מתאימה להחזיר. שימו לב שהמודלים העדכניים של Live API תומכים גם בהוספת סרטונים ותמונות.