Skip to main content
Core.Today
가격
Model APIs

Audio & TTS

MiniMax Speech, ElevenLabs, Inworld, Chatterbox, NAVER Clova Voice 등 다양한 TTS 모델과 음성 복제 모델을 지원합니다. 음악·효과음 생성과 보컬 분리는 Music Generation 문서에서 다룹니다.

이 페이지를 AI에게 전달하세요 — 전체 모델 스펙을 LLM 친화 텍스트로
llms.txt ↗

모델 비교표

모델크레딧유형특징
chatterbox-multilingual7TTSResemble AI, 빠른 생성
tts-1.5-max24TTSInworld, 빠른 생성
xtts-v226TTSCoqui, 고품질
qwen3-tts47TTSQwen, 빠른 생성
chatterbox59TTSResemble AI, 빠른 생성
chatterbox-turbo59TTSResemble AI, 빠른 생성
realtime-tts-259TTSInworld, 빠른 생성
turbo-v2.5119TTSElevenLabs, 빠른 생성
speech-2.8-turbo142TTSMiniMax, 빠른 생성
speech-2.6-turbo142TTSMiniMax, 빠른 생성
speech-02-turbo142TTSMiniMax, 빠른 생성
tts-premium153TTSNCP Clova, 빠른 생성
bark190TTSSuno, 고품질
speech-2.8-hd237TTSMiniMax, 최고 품질
speech-2.6-hd237TTSMiniMax, 최고 품질
v3237TTSElevenLabs, 최고 품질
v2-multilingual237TTSElevenLabs, 고품질
gemini-3.1-flash-tts299TTSGoogle, 빠른 생성
v1.1/video-to-sound-effects310TTSSonilo, 빠른 생성
voice-cloning6,980TTSMiniMax, 고품질

모델 상세 정보

각 모델의 상세한 파라미터, 예제 코드, 활용 팁을 확인하세요.

20개 모델

Bark

Suno

190 credits

Suno의 텍스트 프롬프트 생성 오디오 모델입니다. [laughs]·[sighs] 같은 비언어 사운드가 포함된 음성은 물론 음악·효과음까지 생성하며, 13개 언어의 100개 이상 화자 프리셋을 제공합니다. 오디오와 함께 음성 연속성을 위한 .npz 히스토리 파일도 반환할 수 있습니다.

느림High
상세 보기

Chatterbox

Resemble AI

59 credits

고유한 감정 과장(exaggeration) 제어와 짧은 레퍼런스 오디오 기반 즉시 음성 복제를 갖춘 Resemble AI의 프로덕션급 오픈소스 TTS입니다. MIT 라이선스로 주요 상용 시스템과 비교 벤치마크된 모델입니다.

빠름High
상세 보기

Chatterbox Multilingual

Resemble AI

7 credits

23개 언어를 지원하는 Chatterbox 오픈소스 TTS입니다. 즉시 음성 복제와 감정 과장 제어를 제공합니다. 요청당 최대 300자.

빠름High
상세 보기

Chatterbox Turbo

Resemble AI

59 credits

품질 저하 없이 가장 빠른 Resemble AI 오픈소스 TTS입니다. 20개 프리셋 음성, [sigh]·[chuckle] 같은 준언어 태그, 5초 이상 레퍼런스 오디오로 즉시 음성 복제를 지원합니다. 요청당 최대 500자.

빠름High
상세 보기

Gemini 3.1 Flash TTS

Google

299 credits

Replicate를 통해 제공되는 Google Gemini 3.1 Flash 네이티브 오디오 TTS입니다. 실제 발화 텍스트와 별도의 스타일 지시문, 30종의 프리셋 음성, 40개 이상의 언어/로케일 코드를 지원하며, [sigh], [whispering], [shouting] 등 인라인 마크업 태그로 감정 표현이 가능합니다.

빠름High
상세 보기

Qwen3 TTS

Qwen

47 credits

3가지 모드를 갖춘 Alibaba의 통합 TTS입니다: 프리셋 화자(custom_voice), 레퍼런스 오디오 기반 즉시 음성 복제(voice_clone), 텍스트 설명만으로 새로운 목소리 생성(voice_design).

빠름High
상세 보기

Inworld Realtime TTS 2

Inworld

59 credits

자연어 스티어링을 지원하는 Inworld의 최고 표현력 TTS입니다. [speak quickly]처럼 대괄호 지시문을 텍스트 앞에 붙여 말투를 제어합니다. 실시간 지연 시간과 15개 이상 언어를 지원합니다.

빠름High
상세 보기

MiniMax Speech 2.8 HD

MiniMax

237 credits

Artificial Analysis Speech Arena 및 Hugging Face TTS Arena 1위. 자동회귀 Transformer + Flow-VAE 디코더 기반 방송 품질 TTS로, 32개 이상 언어, 음성 클론, 자연스러운 감탄사, 감정 제어를 지원합니다.

보통Ultra
상세 보기

MiniMax Speech 2.8 Turbo

MiniMax

142 credits

250ms 미만 지연의 저지연 MiniMax Speech 2.8 Turbo. 40개 이상 언어, 음성 클론, 자연스러운 감탄사, 실시간 과금을 지원합니다. 인터랙티브 및 실시간 애플리케이션에 적합합니다.

빠름High
상세 보기

MiniMax Speech 2.6 HD

MiniMax

237 credits

전문 애플리케이션을 위한 미묘한 운율, 감정 제어, 프리미엄 음성을 갖춘 스튜디오 품질 다국어 텍스트-음성 변환 모델입니다.

보통Ultra
상세 보기

MiniMax Speech 2.6 Turbo

MiniMax

142 credits

감정 제어가 가능한 빠른 다국어 텍스트-음성 변환 모델로, 저지연 실시간 애플리케이션에 최적화되어 있습니다.

빠름High
상세 보기

MiniMax Speech-02-Turbo

MiniMax

142 credits

다국어 지원, 감정 음성 제어, 300개 이상의 목소리 옵션을 갖춘 저지연 텍스트-음성 변환 모델입니다.

빠름High
상세 보기

Inworld TTS 1.5 Max

Inworld

24 credits

200ms 미만 지연의 Inworld 최고 품질 실시간 TTS입니다. SSML break 태그로 일시정지, [happy] 같은 감정 마크업, 15개 언어를 지원합니다.

빠름High
상세 보기

Clova Voice TTS Premium

NCP Clova

153 credits

108개 음성, 6개 언어를 지원하는 네이버 클로바 보이스 프리미엄 TTS. 고품질 한국어 음성 합성, 감정 표현, Pro 음성, 이중 언어 지원.

빠름High
상세 보기

ElevenLabs Turbo v2.5

ElevenLabs

119 credits

고품질·저지연 ElevenLabs 텍스트-음성 변환 모델입니다. v3와 동일한 26개 프리미엄 음성을 절반 가격으로, 32개 언어에서 실시간·대량 처리에 최적화되어 있습니다.

빠름High
상세 보기

ElevenLabs v3

ElevenLabs

237 credits

ElevenLabs의 가장 표현력 있는 텍스트-음성 변환 모델입니다. 26개 프리미엄 음성, [laughs]·[whispers] 같은 인라인 오디오 태그, 정밀한 스타일·안정성 제어, 70개 이상 언어를 지원합니다.

보통Ultra
상세 보기

ElevenLabs v2 Multilingual

ElevenLabs

237 credits

30개 이상 언어를 지원하는 ElevenLabs Multilingual v2 텍스트-음성 변환 모델입니다. 검증된 안정적인 음질과 동일한 프리미엄 음성 라인업, 정밀한 음성 설정을 제공합니다.

보통High
상세 보기

Sonilo v1.1 Video to Sound Effects

Sonilo

310 credits

Fal.AI를 통해 제공되는 Sonilo v1.1 비디오-투-사운드이펙트 모델입니다. 입력 영상에 AI가 생성한 사운드(환경음, 효과음, 폴리)를 추가합니다. 프롬프트가 없으면 장면을 자동으로 캡션 처리하고, 구간별 사운드 설명을 제공하면 더 세밀한 제어가 가능합니다.

빠름High
상세 보기

MiniMax Voice Cloning

MiniMax

6,980 credits

10초~5분 분량의 오디오 샘플로 어떤 목소리든 복제합니다. MiniMax 음성 모델의 voice_id로 바로 사용할 수 있는 커스텀 voice_id와 복제 음성으로 합성한 미리듣기 클립을 반환합니다.

보통High
상세 보기

XTTS-v2

Coqui

26 credits

Coqui XTTS-v2 다국어 음성 복제 TTS입니다. 짧은 오디오 샘플 하나로 음성을 복제해 16개 언어로 말하게 할 수 있는, 가장 널리 쓰이는 오픈소스 음성 복제 모델 중 하나입니다.

보통High
상세 보기
NEW

Clova Voice TTS Premium

108개 음성, 6개 언어를 지원하는 고품질 한국어 특화 TTS.

curl -X POST https://api.core.today/v1/predictions \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
    "model": "ncp-clova/tts-premium",
    "input": {
      "text": "안녕하세요. 코어닷 AI API 게이트웨이의 음성합성 서비스입니다.",
      "speaker": "nara",
      "emotion": 2,
      "speed": 0,
      "format": "mp3"
    }
  }'

주요 파라미터

speaker (108개 음성)
  • nara - 아라 (여, 한국어)
  • nminsang - 민상 (남, 한국어)
  • vara - 아라 Pro (여, 한국어)
  • clara - 클라라 (여, 영어)
emotion / speed / pitch
  • emotion - 0(중립), 1(슬픔), 2(기쁨), 3(분노)
  • speed - -5 ~ 10 (기본 0)
  • pitch - -5 ~ 5 (기본 0)
  • volume - -5 ~ 5 (기본 0)

음성 목록 (언어별)

한국어 (72개 + Pro 9개)
ID이름성별
nara아라
nara_call아라(상담원)
dara_ang아라(화남)
nminsang민상
nminseo민서
njinho진호
nbora보라
ndaeseong대성
ndain다인아동여
ndonghyun동현
neunseo은서
neunwoo은우
neunyoung은영
ngaram가람아동여
ngoeun고은
ngyeongjun경준
nhajun하준아동남
nheera희라
nian이안
nihyun이현
njaewook재욱
njangj드림
njihun지훈
njihwan지환
njiwon지원
njiyun지윤
njonghyeok종혁
njonghyun종현
njooahn주안
njoonyoung준영
nkitae기태
nkyunglee경리
nkyungtae경태
nkyuwon규원
nmammon악마 마몬
nmeow야옹이아동여
nmijin미진
nminjeong민정
nminyoung민영
nmovie최무비
noyj봄달
nraewon래원
nreview박리뷰
nsabina마녀 사비나
nsangdo상도
nseonghoon성훈
nseungpyo승표
nshasha샤샤
nsinu신우
nsiyoon시윤
nsujin수진
nsunhee선희
nsunkyung선경
ntaejin태진
ntiffany기서
nwontak원탁
nwoof멍멍이아동남
nwoosik우식
nyeji예지
nyejin예진
nyounghwa정영화
nyoungil영일
nyoungmi영미
nyujin유진
nyuna유나
jinho진호
mijin미진
napple늘봄
nes_c_hyeri혜리
nes_c_kihyo기효
nes_c_mikyung미경
nes_c_sohyun소현

Pro 음성 (고품질):

vara아라 Pro
vdaeseong대성 Pro
vdain다인 Pro
vdonghyun동현 Pro
vgoeun고은 Pro
vhyeri혜리 Pro
vian이안 Pro
vmikyung미경 Pro
vyuna유나 Pro
일본어 (15개)
ID이름성별
shinji신지
dayumu아유무
ddaiki다이키
deriko에리코
dhajime하지메
dmio미오
dnaomi나오미
dnaomi_formal나오미(뉴스)
dnaomi_joyful나오미(기쁨)
driko리코
dsayuri사유리
dtomoko토모코
nnaomi나오미
nsayuri사유리
ntomoko토모코
영어 (4개)
ID이름성별
clara클라라
danna안나
djoey조이
matt매트
기타 (한국어+영어 2개, 중국어 2개, 스페인어 2개, 대만어 2개)
ID이름언어성별
dara-danna아라&안나한국어+영어
dsinu-matt신우&매트한국어+영어
liangliang량량중국어
meimei메이메이중국어
carmen카르멘스페인어
jose호세스페인어
chiahua차화대만어
kuanlin관린대만어
추천

MiniMax Speech-02-Turbo

실시간 TTS에 최적화된 고속 음성 합성 모델.

curl -X POST https://api.core.today/v1/predictions \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
    "model": "minimax/speech-02-turbo",
    "input": {
      "text": "안녕하세요! Core.Today AI API에 오신 것을 환영합니다.",
      "voice_id": "male-qn-qingse",
      "speed": 1.0
    }
  }'

주요 파라미터

voice_id
  • male-qn-qingse - 남성 (청아한)
  • female-shaonv - 여성 (소녀)
  • male-qn-jingying - 남성 (정영)
  • female-yujie - 여성 (우아한)
speed
  • 0.5 - 느리게
  • 1.0 - 기본 속도
  • 1.5 - 빠르게
  • 2.0 - 매우 빠르게

모델 선택 가이드

한국어 특화 TTS

clova-tts-premium (153크레딧, 108개 음성, 감정 표현)

실시간 TTS

speech-02-turbo (142크레딧, 빠른 응답)

고품질 음성

speech-2.8-hd (237크레딧, HD 품질)

범용 TTS

speech-2.8-turbo (142크레딧, 균형 잡힌 성능)