Skip to main content
ByteDance느림높음

LatentSync

ByteDance의 오픈소스 립싱크 모델입니다. 잠재 확산(latent diffusion)으로 영상의 입 모양을 어떤 오디오에든 다시 동기화합니다. 더빙·현지화를 위한 오픈소스 최고 수준의 립싱크 품질입니다.

220 크레딧
실행당 (영상 길이에 따라 처리 시간 증가)
영상 + 오디오 → 립싱크된 영상
오픈소스 최고 수준 립싱크
잠재 확산 기반 입 모양 재생성
가이던스 스케일 제어

지금 바로 실행해보세요

콘솔의 Playground에서 별도 코드 없이 이 모델을 즉시 테스트할 수 있어요

로그인 후 사용해보기

AI 어시스턴트에서 사용하기

이 모델의 사용법을 Claude, ChatGPT 등에 복사

빠른 시작

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "bytedance/latentsync",
  "input": {
    "video": "https://example.com/presenter.mp4",
    "audio": "https://example.com/korean-voiceover.mp3"
  }
}'

파라미터

파라미터타입필수기본값설명
videostringNo-얼굴이 보이는 입력 영상
audiostringNo-입 모양을 맞출 오디오 트랙
guidance_scalenumberNo1생성 가이던스 스케일
seedintegerNo0시드 (0이면 랜덤)

파일 입력 방법

이 모델의 videoaudio 파라미터에 파일을 전달하는 방법은 3가지입니다.

추천

간편 업로드 (Multipart)

POST /v1/predictions/upload에 파일을 직접 첨부합니다. 별도 업로드 과정이 필요 없습니다.

curl -X POST "https://api.core.today/v1/predictions/upload" \
  -H "X-API-Key: cdt_your_api_key" \
  -F "model=bytedance/latentsync" \
  -F 'input={"prompt":"your prompt here"}' \
  -F "file:video=@your_file.png"

이미지 URL 전달

공개 접근 가능한 URL을 직접 전달합니다. Storage API로 업로드한 파일의 file_url도 사용 가능합니다.

{
  "model": "bytedance/latentsync",
  "input": {
    "prompt": "your prompt here",
    "video": "https://example.com/image.jpg"
  }
}
File Upload 문서에서 Presigned URL 방식 등 더 자세한 업로드 방법을 확인하세요.

공통 파라미터

POST /v1/predictions 요청 시 사용되는 공통 파라미터입니다.

파라미터타입필수기본값설명
modelstringYes-모델 식별자
inputobjectYes-위 테이블의 모델별 파라미터를 포함하는 객체
output_folderstringNo-결과물 저장 폴더 경로 (최대 256자, '..' 사용 불가)
webhook_urlstringNo-완료 시 호출할 Webhook URL
is_publicbooleanNofalsetrue 시 결과물을 영구 공개 URL로도 제공

예제

발표 영상 더빙

발표자의 입 모양을 새 한국어 보이스오버에 동기화

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "bytedance/latentsync",
  "input": {
    "video": "https://example.com/presenter.mp4",
    "audio": "https://example.com/korean-voiceover.mp3"
  }
}'

팁 & 모범 사례

1정면을 향한, 조명이 좋은 얼굴에서 가장 잘 동작합니다
2TTS 모델(예: ElevenLabs)과 조합하면 완전한 더빙 파이프라인이 됩니다
3영상이 길수록 처리 시간이 비례해 늘어납니다
4반드시 당사자 동의가 있는 영상만 처리하세요

사용 사례

영상 더빙·현지화
TTS 나레이션 발표 영상 보정
뮤직비디오 립싱크
마케팅 영상 언어 교체