Skip to main content
Core.Today
|
과금 안내 오디오 초 단위 과금입니다. 잡 시작 시 70 크레딧(10분 최대치)을, WAV/MP4처럼 헤더로 길이를 읽을 수 있는 파일은 실제 길이만큼을 예약하고, Meta가 측정한 길이로 정산해 차액을 환불합니다.
Meta빠름높음

Muse Voice Transcribe 1.0

Meta 개발자 API 직결로 제공되는 Meta Muse Voice Transcribe 음성 인식 모델입니다. 한국어를 포함한 25개 언어와 코드 스위칭, 화자 분리, 발화 구간 분할, 키워드·언어 바이어싱을 지원합니다. 오디오 1초당 0.11625 크레딧(분당 약 7 크레딧)으로 과금되며 요청당 최대 10분입니다.

70 크레딧
오디오 1분당 (초당 0.11625, 실측 길이로 정산)
한국어 포함 25개 언어와 코드 스위칭
화자 분리·발화 구간 분할 (화자 라벨과 타임스탬프가 있는 turns)
이름·약어·제품명 인식을 위한 키워드 바이어싱
언어 힌트로 인식 방향을 유도 (강제하지 않음)
mp3/m4a/wav/ogg/webm 입력 — 업로드 전 24 kHz 모노 WAV로 정규화

지금 바로 실행해보세요

콘솔의 Playground에서 별도 코드 없이 이 모델을 즉시 테스트할 수 있어요

로그인 후 사용해보기

AI 어시스턴트에서 사용하기

이 모델의 사용법을 Claude, ChatGPT 등에 복사

빠른 시작

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "meta/muse-voice-transcribe-1.0",
  "input": {
    "audio": "https://replicate.delivery/mgxm/e5159b1b-508a-4be4-b892-e1eb47850bdc/OSR_uk_000_0050_8k.wav",
    "mode": "PUSH_TO_TALK",
    "language_bias": [
      "English"
    ]
  }
}'

파라미터

파라미터타입필수기본값설명
audiostringYes-오디오 파일 URL입니다 (mp3, m4a, wav, ogg, webm, mp4 오디오 트랙). 업로드 전 24 kHz 모노 16-bit PCM WAV로 정규화됩니다. 요청당 최대 10분입니다.
modestringNoPUSH_TO_TALKPUSH_TO_TALK은 전체 전사 하나를, ENDPOINTING은 발화 경계로 나눈 turns를, DIARIZATION은 여기에 화자 라벨까지 반환합니다.
PUSH_TO_TALKENDPOINTINGDIARIZATION
keywordsarrayNo-인식을 유도할 이름·약어·제품명 목록입니다.
language_biasarrayNo-언어 힌트입니다 (인식을 유도할 뿐 강제하지 않음). 생략하면 25개 언어 전체에서 자동 감지합니다.
ArabicBengaliDutchEnglishFrenchGermanHebrewHindiIndonesianItalianJapaneseKannadaKoreanMalayMandarin ChineseMarathiPolishPortugueseSpanishTagalogTamilTeluguThaiTurkishVietnamese

파일 입력 방법

이 모델의 audio 파라미터에 파일을 전달하는 방법은 3가지입니다.

추천

이미지 URL 전달

공개 접근 가능한 URL을 직접 전달합니다. Storage API(POST /v1/files/upload-url)로 업로드하면 파일이 S3로 직접 올라가고(파일당 50MB), 반환된 file_url을 그대로 쓰면 됩니다.

{
  "model": "meta/muse-voice-transcribe-1.0",
  "input": {
    "prompt": "your prompt here",
    "audio": "https://example.com/image.jpg"
  }
}

간편 업로드 (Multipart)

POST /v1/predictions/upload에 파일을 직접 첨부합니다. 별도 업로드 과정이 없는 대신, 파일이 API 서버를 거치므로 요청 전체 10MB 제한이 적용됩니다.

curl -X POST "https://api.core.today/v1/predictions/upload" \
  -H "X-API-Key: cdt_your_api_key" \
  -F "model=meta/muse-voice-transcribe-1.0" \
  -F 'input={"prompt":"your prompt here"}' \
  -F "file:audio=@your_file.png"
File Upload 문서에서 Presigned URL 방식 등 더 자세한 업로드 방법을 확인하세요.

공통 파라미터

POST /v1/predictions 요청 시 사용되는 공통 파라미터입니다.

파라미터타입필수기본값설명
modelstringYes-모델 식별자
inputobjectYes-위 테이블의 모델별 파라미터를 포함하는 객체
output_folderstringNo-결과물 저장 폴더 경로 (최대 256자, '..' 사용 불가)
webhook_urlstringNo-완료 시 호출할 Webhook URL
is_publicbooleanNofalsetrue 시 결과물을 영구 공개 URL로도 제공

예제

녹음 파일 전사

영어 녹음 파일의 전체 전사를 반환합니다.

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "meta/muse-voice-transcribe-1.0",
  "input": {
    "audio": "https://replicate.delivery/mgxm/e5159b1b-508a-4be4-b892-e1eb47850bdc/OSR_uk_000_0050_8k.wav",
    "mode": "PUSH_TO_TALK",
    "language_bias": [
      "English"
    ]
  }
}'

화자 라벨이 있는 회의 전사

DIARIZATION 모드는 speaker·startMs·endMs가 있는 turns를 반환하며, keywords로 제품명 인식을 유도합니다.

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "meta/muse-voice-transcribe-1.0",
  "input": {
    "audio": "https://example.com/meeting.m4a",
    "mode": "DIARIZATION",
    "keywords": [
      "Core.Today",
      "Seedance"
    ],
    "language_bias": [
      "Korean",
      "English"
    ]
  }
}'

팁 & 모범 사례

1결과는 JSON입니다: transcript, audioDurationMs(과금 길이), ENDPOINTING/DIARIZATION 모드에서는 turns 배열
2단어 단위 타임스탬프와 신뢰도 점수는 제공되지 않습니다. 구간 타이밍은 turns를 사용하세요
310분을 넘는 녹음은 나눠서 보내세요 — 더 긴 파일은 거부됩니다
4실시간/스트리밍 전사(realtime WebSocket 엔드포인트)는 이 API로 제공되지 않습니다

사용 사례

화자 라벨이 있는 회의·인터뷰 전사
한·영 혼용 통화 녹음·음성 메모
검색·노트용 팟캐스트·강의 전사