Fish Audio S2 세대 TTS. 80개 이상 언어, 대괄호 자연어 감정·톤 태그, Voice Library 음성. S2.1 Pro 와 동일 요율이며 S2 에 맞춰 둔 파이프라인용. UTF-8 바이트 과금.
콘솔의 Playground에서 별도 코드 없이 이 모델을 즉시 테스트할 수 있어요
이 모델의 사용법을 Claude, ChatGPT 등에 복사
curl -X POST "https://api.core.today/v1/predictions" \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "fishaudio/s2-pro",
"input": {
"text": "안녕하세요, 코어닷투데이입니다. 하나의 API 키로 이미지, 영상, 음성 생성 모델을 모두 연결해 보세요.",
"reference_id": "29da56534ac84ccd81092be4359a1639",
"format": "mp3"
}
}'모든 음성이 같은 문장을 읽습니다. 재생해 음색을 비교하고, ID를 눌러 복사해 reference_id 에 넣으세요.
샘플 문장: “안녕하세요, 코어닷투데이입니다. 하나의 API 키로 이미지, 영상, 음성 생성 모델을 모두 연결해 보세요.”
사람을 복제한 것이 아니라 Fish 가 설계한 음성이라 권리 관계가 가장 단순합니다. 등록 설명이 성별·지역만 빼면 서로 같고 지역 표기도 등록명일 뿐 사투리 억양을 실측한 것은 아니므로, 구분은 재생해서 귀로 하세요.
서울 화자 여성 · 챗봇 응답과 음성 안내
서울 화자 여성 · 챗봇 응답과 음성 안내
서울 화자 여성 · 챗봇 응답과 음성 안내
서울 화자 여성 · 챗봇 응답과 음성 안내
서울 화자 여성 · 챗봇 응답과 음성 안내
부산 화자로 등록된 여성 대화 음성
경주 화자로 등록된 여성 대화 음성
또렷한 젊은 여성 · 제품 안내와 업무용 음성
서울 화자 남성 · 챗봇 응답과 음성 안내
서울 화자 남성 · 챗봇 응답과 음성 안내
서울 화자 남성 · 챗봇 응답과 음성 안내
서울 화자 남성 · 이름이 같은 Doyun 과 다른 음성
서울 화자 남성 · 이름이 같은 Doyoon 과 다른 음성
부산 화자로 등록된 남성 대화 음성
경주 화자로 등록된 남성 대화 음성
Fish 사용자들이 올린 음성으로, 내레이션·쇼츠·광고·인터뷰처럼 용도가 분명할 때 고르면 됩니다. 실존 인물을 복제한 음성은 싣지 않았습니다.
다큐·감성 콘텐츠 낭독
뉴스·교육 콘텐츠 낭독
감동적인 이야기·에세이 낭독
다큐멘터리·정보 전달
설명 영상·교육 안내
대화·스토리텔링
제품 광고·정보 전달
쇼츠·소셜 콘텐츠
팟캐스트·대화형 콘텐츠
광고·홍보 영상
차분한 여성 내레이션
이야기 전달·스토리텔링
예능·엔터테인먼트 대사
인터뷰 진행·교육 콘텐츠
정보 전달 영상·빠른 설명
뷰티·튜토리얼·소셜
교육 콘텐츠·내레이션
따뜻한 대화·ASMR
영어로 등록된 음성이지만 한국어를 실측했습니다. 게이트웨이로 한국어 문장을 합성하고 우리 ASR 로 되받아쓴 뒤 원문과 비교한 값이 정확도입니다(1.0 = 완전 일치). 떨어진 음성은 싣지 않았고, 스페인어로 등록된 로봇 하나는 0.0 으로 한국어가 아예 나오지 않았습니다.
장난기 있는 로봇 캐릭터 · 한국어 정확도 0.97
게임·애니메이션 로봇 캐릭터 · 한국어 정확도 0.97
복고풍 컴퓨터 음성 · 한국어 정확도 0.94
안내 방송·지시 읽기 로봇 · 한국어 정확도 0.85
| 파라미터 | 타입 | 필수 | 기본값 | 설명 |
|---|---|---|---|---|
text | string | Yes | - | 변환할 텍스트 (UTF-8). 과금은 UTF-8 바이트 기준 — 한글 1자 = 3바이트. 감정·톤·효과는 대괄호 자연어 태그로 문장 앞에 둡니다 — 예 [sad] 보고 싶었어요, [shouting], [sighing], [long-break]. |
reference_id | string | No | 2f06c7a428e9431fadd60af4dfe91763 | 음성 ID (Fish Audio Voice Library 의 32자리 hex). 큐레이션한 37종(Fish 공식 한국어 15, 한국어 커뮤니티 18, 로봇·캐릭터 4)은 이 모델의 Core.Today Docs 페이지(docs/models/fishaudio/…) 음성 갤러리에서 미리 듣고 복사할 수 있습니다. 다른 공개/클론 음성 ID 도 그대로 쓸 수 있으며, 그 음성의 사용 권리는 호출자 책임입니다. |
format | string | No | mp3 | 출력 오디오 포맷. mp3wavopus |
mp3_bitrate | integer | No | 128 | MP3 비트레이트 (kbps, mp3 일 때만). 64128192 |
speed | number | No | 1.0 | 말하기 속도 배율, 0.5–2.0 (1.0 = 기본). |
volume | number | No | 0 | 볼륨 조정 (dB, -20~20, 0 = 기본). |
latency | string | No | balanced | balanced = 지연 우선(기본), normal = 안정성 우선. 일괄 생성엔 normal 이 무난합니다. balancednormal |
normalize | boolean | No | true | 숫자·날짜·단위를 읽기 형태로 정규화합니다. |
temperature | number | No | 0.7 | 샘플링 온도, 0.1–1.0. 낮을수록 일관된 억양, 높을수록 표현이 다양해집니다. |
top_p | number | No | 0.7 | nucleus 샘플링 확률 질량, 0.1–1.0. |
chunk_length | integer | No | 200 | 내부 청크 길이 (100–300). 긴 문장의 호흡 단위에 영향을 줍니다. |
POST /v1/predictions 요청 시 사용되는 공통 파라미터입니다.
| 파라미터 | 타입 | 필수 | 기본값 | 설명 |
|---|---|---|---|---|
model | string | Yes | - | 모델 식별자 |
input | object | Yes | - | 위 테이블의 모델별 파라미터를 포함하는 객체 |
output_folder | string | No | - | 결과물 저장 폴더 경로 (최대 256자, '..' 사용 불가) |
webhook_url | string | No | - | 완료 시 호출할 Webhook URL |
is_public | boolean | No | false | true 시 결과물을 영구 공개 URL로도 제공 |
음성 갤러리와 같은 문장을 S2 Pro 로 합성하는 요청입니다.
curl -X POST "https://api.core.today/v1/predictions" \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "fishaudio/s2-pro",
"input": {
"text": "안녕하세요, 코어닷투데이입니다. 하나의 API 키로 이미지, 영상, 음성 생성 모델을 모두 연결해 보세요.",
"reference_id": "29da56534ac84ccd81092be4359a1639",
"format": "mp3"
}
}'S2.1 Pro 와 같은 대괄호 자연어 태그를 씁니다.
curl -X POST "https://api.core.today/v1/predictions" \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "fishaudio/s2-pro",
"input": {
"text": "[calm] 오늘의 사용량 리포트를 읽어 드릴게요. [emphasis] 크레딧이 20% 남았습니다.",
"reference_id": "d74f023d1525420797aed41b5d421c05"
}
}'