Tạo âm thanh bằng Gemini API

Bạn có thể tạo các loại âm thanh sau:

So sánh giữa TTS và Live API

Cả mô hình chuyển văn bản sang lời nói (TTS) và mô hình Live API đều là mô hình tạo lời nói có độ trễ thấp, có thể được định cấu hình cho nhiều giọng nói và ngôn ngữ phản hồi. Tuy nhiên, chúng phục vụ những trường hợp sử dụng rất khác nhau.

  • Tạo văn bản sang lời nói (TTS) là một hoạt động tương tác một chiều theo yêu cầu-phản hồi (văn bản đầu vào, âm thanh đầu ra). Tính năng này được thiết kế riêng cho những trường hợp cần đọc chính xác văn bản được cung cấp với khả năng kiểm soát chi tiết về phong cách và âm thanh, chẳng hạn như lời dẫn trong podcast, sách nói hoặc đọc to các bài viết.

  • Live API thế hệ hỗ trợ tính năng phát trực tuyến hai chiều cho cuộc trò chuyện bằng giọng nói theo thời gian thực (giọng nói vào, giọng nói ra). Mô hình này vượt trội trong các ngữ cảnh trò chuyện linh động, nơi mô hình quyết định lời nói phù hợp để trả về. Xin lưu ý rằng các mô hình Live API mới nhất cũng hỗ trợ đầu vào là video và hình ảnh.