Skip to main content
Core.Today
|
과금 안내 크레딧은 세션 진행 중 5분(300초) 블록 단위로 예약되고, 연결 시간이 아니라 Meta가 실제로 처리했다고 보고한 초 단위로 정산됩니다. 세션 도중 게이트웨이가 재배포되면 연결이 종료되지만, 진행 중이던 블록은 정산·환불되며 유실되지 않습니다.
Meta빠름높음

Muse Voice Transcribe 1.0 (Realtime)

Meta Muse Voice Transcribe를 WebSocket으로 스트리밍합니다. 16-bit PCM(24kHz 또는 16kHz 모노) 오디오를 보내면 말하는 동안 부분·최종 전사를 실시간으로 받으며, 발화 구간 분할과 화자 분리를 지원합니다. Meta가 처리한 오디오 초 단위로 과금되고(초당 0.11625 크레딧, 5분 블록당 35 크레딧), 세션은 최대 20분입니다.

35 크레딧
5분 블록당 (초당 0.11625 크레딧)
발화 도중 부분·최종 전사를 실시간 스트리밍
한국어 포함 25개 언어와 코드 스위칭
DIARIZATION/ENDPOINTING 모드에서 화자 분리와 발화 구간 분할
파일 전사 엔드포인트와 동일한 키워드·언어 바이어싱
세션 최대 20분, 정산은 접속 시간이 아니라 Meta가 실측한 오디오 길이 기준

지금 바로 실행해보세요

콘솔의 Playground에서 별도 코드 없이 이 모델을 즉시 테스트할 수 있어요

로그인 후 사용해보기

AI 어시스턴트에서 사용하기

이 모델의 사용법을 Claude, ChatGPT 등에 복사

빠른 시작

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "meta/muse-voice-transcribe-1.0/realtime",
  "input": {
    "model": "meta/muse-voice-transcribe-1.0/realtime",
    "audioEncoding": "PCM_24KHZ",
    "mode": "ENDPOINTING",
    "partialMode": "CUMULATIVE",
    "emitAudioProgress": false,
    "keywords": [
      "Core.Today"
    ],
    "languageBias": [
      "Korean"
    ],
    "customerId": "member-123"
  }
}'

파라미터

파라미터타입필수기본값설명
audioEncodingstringNoPCM_24KHZ전송하는 바이너리 프레임의 raw PCM 16-bit 모노 샘플레이트입니다.
PCM_24KHZPCM_16KHZ
modestringNoPUSH_TO_TALKPUSH_TO_TALK은 하나의 누적 전사를, ENDPOINTING은 발화 경계로 나눈 turns를, DIARIZATION은 여기에 화자 라벨까지 반환합니다.
PUSH_TO_TALKENDPOINTINGDIARIZATION
partialModestringNoCUMULATIVECUMULATIVE는 이전 부분 전사를 대체하고, DELTA는 새로 추가된 텍스트만 보냅니다.
CUMULATIVEDELTA
emitAudioProgressbooleanNofalseMeta의 약 80ms 간격 audioProgress 이벤트(audioProcessedMs)를 클라이언트로 전달합니다.
keywordsarrayNo-인식을 유도할 이름·약어·제품명 목록입니다.
language_biasarrayNo-언어 힌트입니다 (인식을 유도할 뿐 강제하지 않음). 생략하면 25개 언어 전체에서 자동 감지합니다.
ArabicBengaliDutchEnglishFrenchGermanHebrewHindiIndonesianItalianJapaneseKannadaKoreanMalayMandarin ChineseMarathiPolishPortugueseSpanishTagalogTamilTeluguThaiTurkishVietnamese

공통 파라미터

POST /v1/predictions 요청 시 사용되는 공통 파라미터입니다.

파라미터타입필수기본값설명
modelstringYes-모델 식별자
inputobjectYes-위 테이블의 모델별 파라미터를 포함하는 객체
output_folderstringNo-결과물 저장 폴더 경로 (최대 256자, '..' 사용 불가)
webhook_urlstringNo-완료 시 호출할 Webhook URL
is_publicbooleanNofalsetrue 시 결과물을 영구 공개 URL로도 제공

예제

핸드셰이크 프레임

WebSocket 연결 직후 보내는 첫 텍스트 프레임입니다. ENDPOINTING 모드와 한국어 힌트를 사용합니다. 실제 API 키를 브라우저/클라이언트 코드에 넣지 말고 서버 사이드에서 연결하세요.

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "meta/muse-voice-transcribe-1.0/realtime",
  "input": {
    "model": "meta/muse-voice-transcribe-1.0/realtime",
    "audioEncoding": "PCM_24KHZ",
    "mode": "ENDPOINTING",
    "partialMode": "CUMULATIVE",
    "emitAudioProgress": false,
    "keywords": [
      "Core.Today"
    ],
    "languageBias": [
      "Korean"
    ],
    "customerId": "member-123"
  }
}'

팁 & 모범 사례

1오디오는 실시간 속도로 보내고, 보낼 것이 없을 때는 무음으로 패딩하세요 — Meta는 10초 동안 오디오가 없으면 세션을 닫습니다
2세션은 20분 상한 안에서 사용하고, 더 긴 통화는 하나의 세션에 의존하지 말고 재연결하세요
3실시간 자막에는 ENDPOINTING(다중 화자는 DIARIZATION)을 사용하세요 — PUSH_TO_TALK은 하나의 누적 전사용입니다
4API 키를 브라우저/클라이언트 코드에 넣지 마세요 — 자체 서버에서 연결하고 그곳에서 오디오를 중계하세요

사용 사례

통화·발표의 실시간 자막
사용자가 말하는 동안 전사가 필요한 음성 인터페이스
발화 순서대로 나오는 실시간 회의 전사