Gemini API ব্যবহার করে অডিও তৈরি করুন৷

আপনি নিম্নলিখিত ধরণের অডিও তৈরি করতে পারেন:

TTS এবং Live API এর মধ্যে তুলনা

টেক্সট-টু-স্পিচ (টিটিএস) মডেল এবং Live API মডেল উভয়ই স্বল্প-বিলম্বের স্পিচ-জেনারেটিং মডেল, যা বিভিন্ন প্রতিক্রিয়াশীল কণ্ঠস্বর এবং ভাষার জন্য কনফিগার করা যায়। তবে, এগুলি খুব ভিন্ন ভিন্ন ব্যবহারের ক্ষেত্রে কাজ করে।

  • টেক্সট-টু-স্পিচ (টিটিএস) তৈরি করা একটি একমুখী , অনুরোধ-প্রতিক্রিয়া প্রক্রিয়া (টেক্সট প্রবেশ করে, অডিও বের হয়)। এটি এমন সব পরিস্থিতির জন্য বিশেষভাবে তৈরি করা হয়েছে যেখানে লেখার ধরণ ও ধ্বনির ওপর সূক্ষ্ম নিয়ন্ত্রণ রেখে প্রদত্ত টেক্সট হুবহু আবৃত্তি করার প্রয়োজন হয়; যেমন পডকাস্টের বর্ণনা, অডিওবুক বা প্রবন্ধ উচ্চস্বরে পড়া।

  • Live API জেনারেশন রিয়েল-টাইম ভয়েস কথোপকথনের জন্য দ্বিমুখী স্ট্রিমিং (ভয়েস ইন, ভয়েস আউট) সমর্থন করে। এটি ডায়নামিক কথোপকথনের প্রেক্ষাপটে বিশেষভাবে কার্যকর, যেখানে মডেলটিই ফেরত দেওয়ার জন্য প্রযোজ্য স্পিচ নির্ধারণ করে। উল্লেখ্য যে, সর্বশেষ Live API মডেলগুলো ভিডিও এবং ইমেজ ইনপুটও সমর্থন করে।