با استفاده از API جمینی صدا تولید کنید

شما می‌توانید انواع صداهای زیر را تولید کنید:

مقایسه بین TTS و Live API

هر دو مدل تبدیل متن به گفتار (TTS) و مدل‌های Live API ، مدل‌های تولید گفتار با تأخیر کم هستند که می‌توانند برای صداها و زبان‌های مختلف پاسخ پیکربندی شوند. با این حال، آنها موارد استفاده بسیار متفاوتی را ارائه می‌دهند.

  • تولید متن به گفتار (TTS) یک تعامل یک‌طرفه و درخواست-پاسخ (ورودی متن، خروجی صدا) است. این فناوری برای سناریوهایی طراحی شده است که نیاز به قرائت دقیق متن ارائه شده با کنترل دقیق بر سبک و صدا دارند، مانند روایت پادکست، کتاب‌های صوتی یا خواندن مقالات با صدای بلند.

  • تولید Live API از جریان دو طرفه برای مکالمات صوتی بلادرنگ (ورودی صدا، خروجی صدا) پشتیبانی می‌کند. این قابلیت در زمینه‌های مکالمه پویا که در آن مدل تصمیم می‌گیرد گفتار مربوطه را برگرداند، عالی عمل می‌کند. توجه داشته باشید که جدیدترین مدل‌های Live API از ورودی ویدیو و تصویر نیز پشتیبانی می‌کنند.