Skip to main content
Core.Today
|
Fish Audio빠름울트라

Fish Audio S2.1 Pro

Fish Audio 최신 프로덕션 TTS. 83개 언어, 대괄호 자연어 감정·톤 제어, Voice Library 100만+ 음성과 클로닝. S2 Pro 대비 청취 평가 61% 승률, 업스트림 첫 오디오 ~70ms. UTF-8 바이트 과금.

105 크레딧
한글 1,000자당 (UTF-8 바이트당 0.034875 크레딧, 영문 1,000자 ≈ 35 크레딧)
단일 모델로 83개 언어 (한국어·영어·일본어·중국어 …)
대괄호 자연어 감정·톤 태그: [happy], [whispering], [laughing], [break]
reference_id 로 Voice Library 100만+ 음성과 클론 음성 사용
S2 Pro 대비 청취 평가 61% 승률, 업스트림 첫 오디오 ~70ms
mp3 / wav / opus 출력, 속도·볼륨 프로소디 제어
요청 최소 과금 없는 바이트 정비례 과금

지금 바로 실행해보세요

콘솔의 Playground에서 별도 코드 없이 이 모델을 즉시 테스트할 수 있어요

로그인 후 사용해보기

AI 어시스턴트에서 사용하기

이 모델의 사용법을 Claude, ChatGPT 등에 복사

빠른 시작

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "fishaudio/s2.1-pro",
  "input": {
    "text": "안녕하세요, 코어닷투데이입니다. 하나의 API 키로 이미지, 영상, 음성 생성 모델을 모두 연결해 보세요.",
    "reference_id": "2f06c7a428e9431fadd60af4dfe91763",
    "format": "mp3"
  }
}'

음성 갤러리

37/37개 표시

모든 음성이 같은 문장을 읽습니다. 재생해 음색을 비교하고, ID를 눌러 복사해 reference_id 에 넣으세요.

샘플 문장: “안녕하세요, 코어닷투데이입니다. 하나의 API 키로 이미지, 영상, 음성 생성 모델을 모두 연결해 보세요.

Fish 공식 한국어 (15)

사람을 복제한 것이 아니라 Fish 가 설계한 음성이라 권리 관계가 가장 단순합니다. 등록 설명이 성별·지역만 빼면 서로 같고 지역 표기도 등록명일 뿐 사투리 억양을 실측한 것은 아니므로, 구분은 재생해서 귀로 하세요.

지우

서울 화자 여성 · 챗봇 응답과 음성 안내

대화체자연스러움
혜진

서울 화자 여성 · 챗봇 응답과 음성 안내

대화체자연스러움
서윤

서울 화자 여성 · 챗봇 응답과 음성 안내

대화체자연스러움
서연

서울 화자 여성 · 챗봇 응답과 음성 안내

대화체자연스러움
하은

서울 화자 여성 · 챗봇 응답과 음성 안내

대화체자연스러움
수아

부산 화자로 등록된 여성 대화 음성

대화체지역 표기
예린

경주 화자로 등록된 여성 대화 음성

대화체지역 표기
유나

또렷한 젊은 여성 · 제품 안내와 업무용 음성

전문적또렷함
민준

서울 화자 남성 · 챗봇 응답과 음성 안내

대화체자연스러움
시우

서울 화자 남성 · 챗봇 응답과 음성 안내

대화체자연스러움
준서

서울 화자 남성 · 챗봇 응답과 음성 안내

대화체자연스러움
도윤 (Doyoon)

서울 화자 남성 · 이름이 같은 Doyun 과 다른 음성

대화체자연스러움
도윤 (Doyun)

서울 화자 남성 · 이름이 같은 Doyoon 과 다른 음성

대화체자연스러움
재민

부산 화자로 등록된 남성 대화 음성

대화체지역 표기
태오

경주 화자로 등록된 남성 대화 음성

대화체지역 표기

한국어 커뮤니티 (18)

Fish 사용자들이 올린 음성으로, 내레이션·쇼츠·광고·인터뷰처럼 용도가 분명할 때 고르면 됩니다. 실존 인물을 복제한 음성은 싣지 않았습니다.

차분한 내레이션

다큐·감성 콘텐츠 낭독

차분함또렷함전문적
기본 나레이션 (남)

뉴스·교육 콘텐츠 낭독

안정적일정한 속도권위감
부드러운 내레이터

감동적인 이야기·에세이 낭독

따뜻함부드러움공감
다큐 나레이션

다큐멘터리·정보 전달

차분함전문적또렷함
긍정 아나운서

설명 영상·교육 안내

명료함전문적친근함
따뜻한 여성

대화·스토리텔링

따뜻함편안함표현력
20대 여성 (광고)

제품 광고·정보 전달

매끄러움차분함설득력
나긋나긋 쇼츠

쇼츠·소셜 콘텐츠

밝음활기참친근함
효정 (팟캐스트)

팟캐스트·대화형 콘텐츠

부드러움친근함자연스러움
애덤 (광고)

광고·홍보 영상

활기참자신감설득력
유라

차분한 여성 내레이션

차분함매끄러움전문적
진우

이야기 전달·스토리텔링

차분함매끄러움서사적
보이스1

예능·엔터테인먼트 대사

밝음활기참열정적
30대 남자 인터뷰어

인터뷰 진행·교육 콘텐츠

차분함또렷함친근함
정보성 유튜버 (남)

정보 전달 영상·빠른 설명

활기참빠른 속도자신감
20대 여성 쇼츠

뷰티·튜토리얼·소셜

밝음활기참친근함
호기요

교육 콘텐츠·내레이션

차분함또렷함친근함
성현

따뜻한 대화·ASMR

따뜻함부드러움친밀함

로봇·캐릭터 (4)

영어로 등록된 음성이지만 한국어를 실측했습니다. 게이트웨이로 한국어 문장을 합성하고 우리 ASR 로 되받아쓴 뒤 원문과 비교한 값이 정확도입니다(1.0 = 완전 일치). 떨어진 음성은 싣지 않았고, 스페인어로 등록된 로봇 하나는 0.0 으로 한국어가 아예 나오지 않았습니다.

장난꾸러기 로봇

장난기 있는 로봇 캐릭터 · 한국어 정확도 0.97

높은 톤활기참기계음
활기찬 로봇

게임·애니메이션 로봇 캐릭터 · 한국어 정확도 0.97

표현력활기참높은 톤
레트로 컴퓨터

복고풍 컴퓨터 음성 · 한국어 정확도 0.94

단조로움전자음레트로
안내용 로봇

안내 방송·지시 읽기 로봇 · 한국어 정확도 0.85

단조로움또렷함중립적

파라미터

파라미터타입필수기본값설명
textstringYes-변환할 텍스트 (UTF-8). 과금은 UTF-8 바이트 기준 — 한글 1자 = 3바이트. 감정·톤·효과는 대괄호 자연어 태그로 문장 앞에 둡니다 — 예 [happy] 반갑습니다!, [whispering] …, [laughing], [break].
reference_idstringNo2f06c7a428e9431fadd60af4dfe91763음성 ID (Fish Audio Voice Library 의 32자리 hex). 큐레이션한 37종(Fish 공식 한국어 15, 한국어 커뮤니티 18, 로봇·캐릭터 4)은 이 모델의 Core.Today Docs 페이지(docs/models/fishaudio/…) 음성 갤러리에서 미리 듣고 복사할 수 있습니다. 다른 공개/클론 음성 ID 도 그대로 쓸 수 있으며, 그 음성의 사용 권리는 호출자 책임입니다.
formatstringNomp3출력 오디오 포맷.
mp3wavopus
mp3_bitrateintegerNo128MP3 비트레이트 (kbps, mp3 일 때만).
64128192
speednumberNo1.0말하기 속도 배율, 0.5–2.0 (1.0 = 기본).
volumenumberNo0볼륨 조정 (dB, -20~20, 0 = 기본).
latencystringNobalancedbalanced = 지연 우선(기본), normal = 안정성 우선. 일괄 생성엔 normal 이 무난합니다.
balancednormal
normalizebooleanNotrue숫자·날짜·단위를 읽기 형태로 정규화합니다.
temperaturenumberNo0.7샘플링 온도, 0.1–1.0. 낮을수록 일관된 억양, 높을수록 표현이 다양해집니다.
top_pnumberNo0.7nucleus 샘플링 확률 질량, 0.1–1.0.
chunk_lengthintegerNo200내부 청크 길이 (100–300). 긴 문장의 호흡 단위에 영향을 줍니다.

공통 파라미터

POST /v1/predictions 요청 시 사용되는 공통 파라미터입니다.

파라미터타입필수기본값설명
modelstringYes-모델 식별자
inputobjectYes-위 테이블의 모델별 파라미터를 포함하는 객체
output_folderstringNo-결과물 저장 폴더 경로 (최대 256자, '..' 사용 불가)
webhook_urlstringNo-완료 시 호출할 Webhook URL
is_publicbooleanNofalsetrue 시 결과물을 영구 공개 URL로도 제공

예제

코어닷투데이 소개 (차분한 내레이션 음성)

갤러리의 모든 음성이 읽는 문장을 기본 음성으로 합성한 예시입니다.

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "fishaudio/s2.1-pro",
  "input": {
    "text": "안녕하세요, 코어닷투데이입니다. 하나의 API 키로 이미지, 영상, 음성 생성 모델을 모두 연결해 보세요.",
    "reference_id": "2f06c7a428e9431fadd60af4dfe91763",
    "format": "mp3"
  }
}'

감정 태그

대괄호 자연어 태그가 문장 단위로 톤을 바꿉니다.

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "fishaudio/s2.1-pro",
  "input": {
    "text": "[excited] 드디어 새 모델이 나왔어요! [whispering] 그런데 가격은 그대로예요. [laughing]",
    "reference_id": "4e118bfbb83e401c84699c09b5f08257"
  }
}'

팁 & 모범 사례

1Fish 공식 한국어 15종(지우·민준 등)은 사람을 복제한 것이 아니라 Fish 가 설계한 음성이라 권리 관계가 가장 단순합니다 — 기준점으로 먼저 비교해 보세요
2로봇 음성 4종은 영어로 등록돼 있지만 한국어를 실측했습니다. 게이트웨이로 한국어 문장을 합성하고 우리 ASR 로 되받아쓴 유사도가 0.85~0.97 인 것만 실었고, 떨어진 음성은 갤러리에 없습니다
3특정 작품 캐릭터나 실존 성우를 복제한 음성은 의도적으로 제외했습니다. API 로는 어떤 reference_id 든 넘길 수 있으나, 그 음성의 사용 권리는 호출자가 확인해야 합니다
4감정 태그는 문장 앞에([happy] …), [whispering]·[laughing] 같은 톤·효과 태그는 어디든 둘 수 있습니다
5한글은 글자당 UTF-8 3바이트 — 한글 1,000자는 약 105 크레딧, 영문 1,000자는 약 35 크레딧입니다
6이 docs 페이지 하단 음성 갤러리에서 reference_id 를 복사하세요. 모든 샘플이 같은 코어닷투데이 문장을 읽어 음색만 비교하면 됩니다
7첫 오디오 지연보다 안정성이 중요한 일괄 작업엔 latency=normal 을 쓰세요
8숫자·날짜는 normalize=true 로 두고, 직접 풀어 쓸 때만 끄세요

사용 사례

쇼츠·광고·설명 영상용 한국어 내레이션
한 모델로 만드는 다국어 제품 보이스오버
감정 태그를 활용한 오디오북·스토리텔링
안내방송·ARS 음성
팟캐스트 인트로와 캐릭터 음성