Audio & TTS
MiniMax Speech, ElevenLabs, Inworld, Chatterbox, NAVER Clova Voice 등 다양한 TTS 모델과 음성 복제 모델을 지원합니다. 음악·효과음 생성과 보컬 분리는 Music Generation 문서에서 다룹니다.
모델 비교표
| 모델 | 크레딧 | 유형 | 특징 |
|---|---|---|---|
| chatterbox-multilingual | 7 | TTS | Resemble AI, 빠른 생성 |
| tts-1.5-max | 24 | TTS | Inworld, 빠른 생성 |
| xtts-v2 | 26 | TTS | Coqui, 고품질 |
| qwen3-tts | 47 | TTS | Qwen, 빠른 생성 |
| chatterbox | 59 | TTS | Resemble AI, 빠른 생성 |
| chatterbox-turbo | 59 | TTS | Resemble AI, 빠른 생성 |
| realtime-tts-2 | 59 | TTS | Inworld, 빠른 생성 |
| turbo-v2.5 | 119 | TTS | ElevenLabs, 빠른 생성 |
| speech-2.8-turbo | 142 | TTS | MiniMax, 빠른 생성 |
| speech-2.6-turbo | 142 | TTS | MiniMax, 빠른 생성 |
| speech-02-turbo | 142 | TTS | MiniMax, 빠른 생성 |
| tts-premium | 153 | TTS | NCP Clova, 빠른 생성 |
| bark | 190 | TTS | Suno, 고품질 |
| speech-2.8-hd | 237 | TTS | MiniMax, 최고 품질 |
| speech-2.6-hd | 237 | TTS | MiniMax, 최고 품질 |
| v3 | 237 | TTS | ElevenLabs, 최고 품질 |
| v2-multilingual | 237 | TTS | ElevenLabs, 고품질 |
| gemini-3.1-flash-tts | 299 | TTS | Google, 빠른 생성 |
| v1.1/video-to-sound-effects | 310 | TTS | Sonilo, 빠른 생성 |
| voice-cloning | 6,980 | TTS | MiniMax, 고품질 |
모델 상세 정보
각 모델의 상세한 파라미터, 예제 코드, 활용 팁을 확인하세요.
Bark
Suno
Suno의 텍스트 프롬프트 생성 오디오 모델입니다. [laughs]·[sighs] 같은 비언어 사운드가 포함된 음성은 물론 음악·효과음까지 생성하며, 13개 언어의 100개 이상 화자 프리셋을 제공합니다. 오디오와 함께 음성 연속성을 위한 .npz 히스토리 파일도 반환할 수 있습니다.
Chatterbox
Resemble AI
고유한 감정 과장(exaggeration) 제어와 짧은 레퍼런스 오디오 기반 즉시 음성 복제를 갖춘 Resemble AI의 프로덕션급 오픈소스 TTS입니다. MIT 라이선스로 주요 상용 시스템과 비교 벤치마크된 모델입니다.
Chatterbox Multilingual
Resemble AI
23개 언어를 지원하는 Chatterbox 오픈소스 TTS입니다. 즉시 음성 복제와 감정 과장 제어를 제공합니다. 요청당 최대 300자.
Chatterbox Turbo
Resemble AI
품질 저하 없이 가장 빠른 Resemble AI 오픈소스 TTS입니다. 20개 프리셋 음성, [sigh]·[chuckle] 같은 준언어 태그, 5초 이상 레퍼런스 오디오로 즉시 음성 복제를 지원합니다. 요청당 최대 500자.
Gemini 3.1 Flash TTS
Replicate를 통해 제공되는 Google Gemini 3.1 Flash 네이티브 오디오 TTS입니다. 실제 발화 텍스트와 별도의 스타일 지시문, 30종의 프리셋 음성, 40개 이상의 언어/로케일 코드를 지원하며, [sigh], [whispering], [shouting] 등 인라인 마크업 태그로 감정 표현이 가능합니다.
Qwen3 TTS
Qwen
3가지 모드를 갖춘 Alibaba의 통합 TTS입니다: 프리셋 화자(custom_voice), 레퍼런스 오디오 기반 즉시 음성 복제(voice_clone), 텍스트 설명만으로 새로운 목소리 생성(voice_design).
Inworld Realtime TTS 2
Inworld
자연어 스티어링을 지원하는 Inworld의 최고 표현력 TTS입니다. [speak quickly]처럼 대괄호 지시문을 텍스트 앞에 붙여 말투를 제어합니다. 실시간 지연 시간과 15개 이상 언어를 지원합니다.
MiniMax Speech 2.8 HD
MiniMax
Artificial Analysis Speech Arena 및 Hugging Face TTS Arena 1위. 자동회귀 Transformer + Flow-VAE 디코더 기반 방송 품질 TTS로, 32개 이상 언어, 음성 클론, 자연스러운 감탄사, 감정 제어를 지원합니다.
MiniMax Speech 2.8 Turbo
MiniMax
250ms 미만 지연의 저지연 MiniMax Speech 2.8 Turbo. 40개 이상 언어, 음성 클론, 자연스러운 감탄사, 실시간 과금을 지원합니다. 인터랙티브 및 실시간 애플리케이션에 적합합니다.
MiniMax Speech 2.6 HD
MiniMax
전문 애플리케이션을 위한 미묘한 운율, 감정 제어, 프리미엄 음성을 갖춘 스튜디오 품질 다국어 텍스트-음성 변환 모델입니다.
MiniMax Speech 2.6 Turbo
MiniMax
감정 제어가 가능한 빠른 다국어 텍스트-음성 변환 모델로, 저지연 실시간 애플리케이션에 최적화되어 있습니다.
MiniMax Speech-02-Turbo
MiniMax
다국어 지원, 감정 음성 제어, 300개 이상의 목소리 옵션을 갖춘 저지연 텍스트-음성 변환 모델입니다.
Inworld TTS 1.5 Max
Inworld
200ms 미만 지연의 Inworld 최고 품질 실시간 TTS입니다. SSML break 태그로 일시정지, [happy] 같은 감정 마크업, 15개 언어를 지원합니다.
Clova Voice TTS Premium
NCP Clova
108개 음성, 6개 언어를 지원하는 네이버 클로바 보이스 프리미엄 TTS. 고품질 한국어 음성 합성, 감정 표현, Pro 음성, 이중 언어 지원.
ElevenLabs Turbo v2.5
ElevenLabs
고품질·저지연 ElevenLabs 텍스트-음성 변환 모델입니다. v3와 동일한 26개 프리미엄 음성을 절반 가격으로, 32개 언어에서 실시간·대량 처리에 최적화되어 있습니다.
ElevenLabs v3
ElevenLabs
ElevenLabs의 가장 표현력 있는 텍스트-음성 변환 모델입니다. 26개 프리미엄 음성, [laughs]·[whispers] 같은 인라인 오디오 태그, 정밀한 스타일·안정성 제어, 70개 이상 언어를 지원합니다.
ElevenLabs v2 Multilingual
ElevenLabs
30개 이상 언어를 지원하는 ElevenLabs Multilingual v2 텍스트-음성 변환 모델입니다. 검증된 안정적인 음질과 동일한 프리미엄 음성 라인업, 정밀한 음성 설정을 제공합니다.
Sonilo v1.1 Video to Sound Effects
Sonilo
Fal.AI를 통해 제공되는 Sonilo v1.1 비디오-투-사운드이펙트 모델입니다. 입력 영상에 AI가 생성한 사운드(환경음, 효과음, 폴리)를 추가합니다. 프롬프트가 없으면 장면을 자동으로 캡션 처리하고, 구간별 사운드 설명을 제공하면 더 세밀한 제어가 가능합니다.
MiniMax Voice Cloning
MiniMax
10초~5분 분량의 오디오 샘플로 어떤 목소리든 복제합니다. MiniMax 음성 모델의 voice_id로 바로 사용할 수 있는 커스텀 voice_id와 복제 음성으로 합성한 미리듣기 클립을 반환합니다.
XTTS-v2
Coqui
Coqui XTTS-v2 다국어 음성 복제 TTS입니다. 짧은 오디오 샘플 하나로 음성을 복제해 16개 언어로 말하게 할 수 있는, 가장 널리 쓰이는 오픈소스 음성 복제 모델 중 하나입니다.
Clova Voice TTS Premium
108개 음성, 6개 언어를 지원하는 고품질 한국어 특화 TTS.
curl -X POST https://api.core.today/v1/predictions \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "ncp-clova/tts-premium",
"input": {
"text": "안녕하세요. 코어닷 AI API 게이트웨이의 음성합성 서비스입니다.",
"speaker": "nara",
"emotion": 2,
"speed": 0,
"format": "mp3"
}
}'주요 파라미터
speaker (108개 음성)
nara- 아라 (여, 한국어)nminsang- 민상 (남, 한국어)vara- 아라 Pro (여, 한국어)clara- 클라라 (여, 영어)
emotion / speed / pitch
emotion- 0(중립), 1(슬픔), 2(기쁨), 3(분노)speed- -5 ~ 10 (기본 0)pitch- -5 ~ 5 (기본 0)volume- -5 ~ 5 (기본 0)
음성 목록 (언어별)
한국어 (72개 + Pro 9개)
| ID | 이름 | 성별 |
|---|---|---|
| nara | 아라 | 여 |
| nara_call | 아라(상담원) | 여 |
| dara_ang | 아라(화남) | 여 |
| nminsang | 민상 | 남 |
| nminseo | 민서 | 여 |
| njinho | 진호 | 남 |
| nbora | 보라 | 여 |
| ndaeseong | 대성 | 남 |
| ndain | 다인 | 아동여 |
| ndonghyun | 동현 | 남 |
| neunseo | 은서 | 여 |
| neunwoo | 은우 | 남 |
| neunyoung | 은영 | 여 |
| ngaram | 가람 | 아동여 |
| ngoeun | 고은 | 여 |
| ngyeongjun | 경준 | 남 |
| nhajun | 하준 | 아동남 |
| nheera | 희라 | 여 |
| nian | 이안 | 남 |
| nihyun | 이현 | 여 |
| njaewook | 재욱 | 남 |
| njangj | 드림 | 여 |
| njihun | 지훈 | 남 |
| njihwan | 지환 | 남 |
| njiwon | 지원 | 여 |
| njiyun | 지윤 | 여 |
| njonghyeok | 종혁 | 남 |
| njonghyun | 종현 | 남 |
| njooahn | 주안 | 남 |
| njoonyoung | 준영 | 남 |
| nkitae | 기태 | 남 |
| nkyunglee | 경리 | 여 |
| nkyungtae | 경태 | 남 |
| nkyuwon | 규원 | 남 |
| nmammon | 악마 마몬 | 남 |
| nmeow | 야옹이 | 아동여 |
| nmijin | 미진 | 여 |
| nminjeong | 민정 | 여 |
| nminyoung | 민영 | 여 |
| nmovie | 최무비 | 남 |
| noyj | 봄달 | 여 |
| nraewon | 래원 | 남 |
| nreview | 박리뷰 | 남 |
| nsabina | 마녀 사비나 | 여 |
| nsangdo | 상도 | 남 |
| nseonghoon | 성훈 | 남 |
| nseungpyo | 승표 | 남 |
| nshasha | 샤샤 | 여 |
| nsinu | 신우 | 남 |
| nsiyoon | 시윤 | 남 |
| nsujin | 수진 | 여 |
| nsunhee | 선희 | 여 |
| nsunkyung | 선경 | 여 |
| ntaejin | 태진 | 남 |
| ntiffany | 기서 | 여 |
| nwontak | 원탁 | 남 |
| nwoof | 멍멍이 | 아동남 |
| nwoosik | 우식 | 남 |
| nyeji | 예지 | 여 |
| nyejin | 예진 | 여 |
| nyounghwa | 정영화 | 여 |
| nyoungil | 영일 | 남 |
| nyoungmi | 영미 | 여 |
| nyujin | 유진 | 여 |
| nyuna | 유나 | 여 |
| jinho | 진호 | 남 |
| mijin | 미진 | 여 |
| napple | 늘봄 | 여 |
| nes_c_hyeri | 혜리 | 여 |
| nes_c_kihyo | 기효 | 남 |
| nes_c_mikyung | 미경 | 여 |
| nes_c_sohyun | 소현 | 여 |
Pro 음성 (고품질):
| vara | 아라 Pro | 여 |
| vdaeseong | 대성 Pro | 남 |
| vdain | 다인 Pro | 여 |
| vdonghyun | 동현 Pro | 남 |
| vgoeun | 고은 Pro | 여 |
| vhyeri | 혜리 Pro | 여 |
| vian | 이안 Pro | 남 |
| vmikyung | 미경 Pro | 여 |
| vyuna | 유나 Pro | 여 |
일본어 (15개)
| ID | 이름 | 성별 |
|---|---|---|
| shinji | 신지 | 남 |
| dayumu | 아유무 | 남 |
| ddaiki | 다이키 | 남 |
| deriko | 에리코 | 여 |
| dhajime | 하지메 | 남 |
| dmio | 미오 | 여 |
| dnaomi | 나오미 | 여 |
| dnaomi_formal | 나오미(뉴스) | 여 |
| dnaomi_joyful | 나오미(기쁨) | 여 |
| driko | 리코 | 여 |
| dsayuri | 사유리 | 여 |
| dtomoko | 토모코 | 여 |
| nnaomi | 나오미 | 여 |
| nsayuri | 사유리 | 여 |
| ntomoko | 토모코 | 여 |
영어 (4개)
| ID | 이름 | 성별 |
|---|---|---|
| clara | 클라라 | 여 |
| danna | 안나 | 여 |
| djoey | 조이 | 여 |
| matt | 매트 | 남 |
기타 (한국어+영어 2개, 중국어 2개, 스페인어 2개, 대만어 2개)
| ID | 이름 | 언어 | 성별 |
|---|---|---|---|
| dara-danna | 아라&안나 | 한국어+영어 | 여 |
| dsinu-matt | 신우&매트 | 한국어+영어 | 남 |
| liangliang | 량량 | 중국어 | 남 |
| meimei | 메이메이 | 중국어 | 여 |
| carmen | 카르멘 | 스페인어 | 여 |
| jose | 호세 | 스페인어 | 남 |
| chiahua | 차화 | 대만어 | 여 |
| kuanlin | 관린 | 대만어 | 남 |
MiniMax Speech-02-Turbo
실시간 TTS에 최적화된 고속 음성 합성 모델.
curl -X POST https://api.core.today/v1/predictions \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "minimax/speech-02-turbo",
"input": {
"text": "안녕하세요! Core.Today AI API에 오신 것을 환영합니다.",
"voice_id": "male-qn-qingse",
"speed": 1.0
}
}'주요 파라미터
voice_id
male-qn-qingse- 남성 (청아한)female-shaonv- 여성 (소녀)male-qn-jingying- 남성 (정영)female-yujie- 여성 (우아한)
speed
0.5- 느리게1.0- 기본 속도1.5- 빠르게2.0- 매우 빠르게
모델 선택 가이드
한국어 특화 TTS
clova-tts-premium (153크레딧, 108개 음성, 감정 표현)
실시간 TTS
speech-02-turbo (142크레딧, 빠른 응답)
고품질 음성
speech-2.8-hd (237크레딧, HD 품질)
범용 TTS
speech-2.8-turbo (142크레딧, 균형 잡힌 성능)