Skip to main content
AI 음성 합성(TTS)과 음성 클로닝을 제공합니다. 오디오북, 팟캐스트, 영상 더빙 등에 사용하며 40개 이상의 언어를 지원합니다. 동기 API(SyncDubbing)는 클로닝과 단문 합성을 즉시 처리하고, 비동기 API(ProcessMedia)는 장문 합성(TextToSpeech)과 화자 교체(SpeechToSpeech)를 처리합니다.

요청 방법

SyncDubbing은 동기 API로 결과를 즉시 반환합니다. ProcessMedia 기반 모드는 비동기로 TaskId가 발급되며, 결과는 DescribeTaskDetail로 조회하거나 TaskNotifyConfig로 콜백을 받습니다. 모드와 API 대응은 다음과 같습니다.

요청 파라미터

SyncDubbing (clone / tts)

ProcessMedia (async-tts / async-sts)

ExtendedParameter의 dubbing 객체 필드는 다음과 같습니다. 지원 언어 코드(일부): zh / en / ja / ko / de / fr / es / it / ru / pt / ar / hi / th / vi / id / ms / tr / nl / pl / sv / fi / yue / he / fa 등 40개 이상.

응답 파라미터

SyncDubbing

ProcessMedia

호출 예시

응답 예시

주의사항

VoiceId는 반드시 clone 모드가 반환한 전체 암호화 base64 형식(80자 이상, v1_ 접두사)이어야 합니다. 문서 예시처럼 잘린 ID는 decode encrypt voiceId failed 오류를 반환합니다.
async-tts의 InputInfo URL은 내용과 무관한 placeholder이지만 접근 가능해야 합니다. 404를 반환하는 URL이면 태스크가 즉시 실패합니다. OutputDir/로 시작하고 /로 끝나야 하며, 비동기 모드는 출력 COS Bucket 설정이 필수입니다.
모드 선택 기준: VoiceId 발급이 필요하면 clone(오디오 필수), 2000자 이하 단문 합성은 tts(VoiceId 필수), 장문 합성은 async-tts, 기존 오디오/영상의 화자 교체는 async-sts(실제 입력과 voiceId 또는 cloneVideoUrl 필수)입니다. 비동기 전용 파라미터(cloneVideoUrl, OutputDir 등)는 동기 모드에서 사용할 수 없습니다.
Last modified on August 16, 2026