Meta 개발자 API 직결로 제공되는 Meta Muse Voice Transcribe 음성 인식 모델입니다. 한국어를 포함한 25개 언어와 코드 스위칭, 화자 분리, 발화 구간 분할, 키워드·언어 바이어싱을 지원합니다. 오디오 1초당 0.11625 크레딧(분당 약 7 크레딧)으로 과금되며 요청당 최대 10분입니다.
콘솔의 Playground에서 별도 코드 없이 이 모델을 즉시 테스트할 수 있어요
이 모델의 사용법을 Claude, ChatGPT 등에 복사
curl -X POST "https://api.core.today/v1/predictions" \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "meta/muse-voice-transcribe-1.0",
"input": {
"audio": "https://replicate.delivery/mgxm/e5159b1b-508a-4be4-b892-e1eb47850bdc/OSR_uk_000_0050_8k.wav",
"mode": "PUSH_TO_TALK",
"language_bias": [
"English"
]
}
}'| 파라미터 | 타입 | 필수 | 기본값 | 설명 |
|---|---|---|---|---|
audio | string | Yes | - | 오디오 파일 URL입니다 (mp3, m4a, wav, ogg, webm, mp4 오디오 트랙). 업로드 전 24 kHz 모노 16-bit PCM WAV로 정규화됩니다. 요청당 최대 10분입니다. |
mode | string | No | PUSH_TO_TALK | PUSH_TO_TALK은 전체 전사 하나를, ENDPOINTING은 발화 경계로 나눈 turns를, DIARIZATION은 여기에 화자 라벨까지 반환합니다. PUSH_TO_TALKENDPOINTINGDIARIZATION |
keywords | array | No | - | 인식을 유도할 이름·약어·제품명 목록입니다. |
language_bias | array | No | - | 언어 힌트입니다 (인식을 유도할 뿐 강제하지 않음). 생략하면 25개 언어 전체에서 자동 감지합니다. ArabicBengaliDutchEnglishFrenchGermanHebrewHindiIndonesianItalianJapaneseKannadaKoreanMalayMandarin ChineseMarathiPolishPortugueseSpanishTagalogTamilTeluguThaiTurkishVietnamese |
이 모델의 audio 파라미터에 파일을 전달하는 방법은 3가지입니다.
공개 접근 가능한 URL을 직접 전달합니다. Storage API(POST /v1/files/upload-url)로 업로드하면 파일이 S3로 직접 올라가고(파일당 50MB), 반환된 file_url을 그대로 쓰면 됩니다.
{
"model": "meta/muse-voice-transcribe-1.0",
"input": {
"prompt": "your prompt here",
"audio": "https://example.com/image.jpg"
}
}POST /v1/predictions/upload에 파일을 직접 첨부합니다. 별도 업로드 과정이 없는 대신, 파일이 API 서버를 거치므로 요청 전체 10MB 제한이 적용됩니다.
curl -X POST "https://api.core.today/v1/predictions/upload" \
-H "X-API-Key: cdt_your_api_key" \
-F "model=meta/muse-voice-transcribe-1.0" \
-F 'input={"prompt":"your prompt here"}' \
-F "file:audio=@your_file.png"POST /v1/predictions 요청 시 사용되는 공통 파라미터입니다.
| 파라미터 | 타입 | 필수 | 기본값 | 설명 |
|---|---|---|---|---|
model | string | Yes | - | 모델 식별자 |
input | object | Yes | - | 위 테이블의 모델별 파라미터를 포함하는 객체 |
output_folder | string | No | - | 결과물 저장 폴더 경로 (최대 256자, '..' 사용 불가) |
webhook_url | string | No | - | 완료 시 호출할 Webhook URL |
is_public | boolean | No | false | true 시 결과물을 영구 공개 URL로도 제공 |
영어 녹음 파일의 전체 전사를 반환합니다.
curl -X POST "https://api.core.today/v1/predictions" \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "meta/muse-voice-transcribe-1.0",
"input": {
"audio": "https://replicate.delivery/mgxm/e5159b1b-508a-4be4-b892-e1eb47850bdc/OSR_uk_000_0050_8k.wav",
"mode": "PUSH_TO_TALK",
"language_bias": [
"English"
]
}
}'DIARIZATION 모드는 speaker·startMs·endMs가 있는 turns를 반환하며, keywords로 제품명 인식을 유도합니다.
curl -X POST "https://api.core.today/v1/predictions" \
-H "Content-Type: application/json" \
-H "X-API-Key: cdt_your_api_key" \
-d '{
"model": "meta/muse-voice-transcribe-1.0",
"input": {
"audio": "https://example.com/meeting.m4a",
"mode": "DIARIZATION",
"keywords": [
"Core.Today",
"Seedance"
],
"language_bias": [
"Korean",
"English"
]
}
}'