Gemini API를 사용하여 오디오 생성

다음과 같은 종류의 오디오를 생성할 수 있습니다.

TTS와 Live API 비교

텍스트 음성 변환 (TTS) 모델과 Live API 모델은 모두 지연 시간이 짧은 음성 생성 모델로, 다양한 응답 음성 및 언어로 구성할 수 있습니다. 하지만 매우 다른 사용 사례를 제공합니다.

  • 텍스트 음성 변환 (TTS) 생성단방향 요청-응답 상호작용 (텍스트 입력, 오디오 출력)입니다. 팟캐스트 내레이션, 오디오북, 기사 낭독과 같이 스타일과 사운드를 세밀하게 제어하여 제공된 텍스트를 정확하게 낭독 해야 하는 시나리오에 맞게 조정됩니다.

  • Live API 생성양방향 스트리밍을 위한 실시간 음성 대화 (음성 입력, 음성 출력)을 지원합니다. 모델이 반환할 적용 가능한 음성을 결정하는 동적 대화 컨텍스트에서 뛰어난 성능을 발휘합니다. 최신 Live API 모델은 동영상 및 이미지 입력도 지원합니다.