Skip to main content
OpenAI보통울트라

Whisper

음성 전사의 표준인 OpenAI Whisper large-v3입니다 (1억 4,400만+ 실행). 약 100개 언어 자동 감지, 영어 번역, plain text/SRT/VTT 출력 형식을 지원합니다.

10 크레딧
실행당 (오디오 길이에 따라 처리 시간 증가)
음성 인식의 표준 (1억 4,400만+ 실행)
한국어 포함 약 100개 언어 자동 감지
어떤 언어든 영어로 번역 전사
plain text·SRT·VTT 자막 형식 출력
JSON 결과에 타임스탬프 세그먼트 포함

지금 바로 실행해보세요

콘솔의 Playground에서 별도 코드 없이 이 모델을 즉시 테스트할 수 있어요

로그인 후 사용해보기

AI 어시스턴트에서 사용하기

이 모델의 사용법을 Claude, ChatGPT 등에 복사

빠른 시작

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "openai/whisper",
  "input": {
    "audio": "https://example.com/meeting.mp3",
    "language": "auto",
    "transcription": "plain text"
  }
}'

파라미터

파라미터타입필수기본값설명
audiostringYes-전사할 오디오 파일 (mp3, wav, m4a 등)
transcriptionstringNoplain text전사 출력 형식
plain textsrtvtt
translatebooleanNofalse전사 결과를 영어로 번역
languagestringNoauto오디오의 언어. 'auto'면 자동 감지 (한국어는 'ko')
autoafamarasazbabebgbnbobrbscacscydadeeleneseteufafifofrglguhahawhehihrhthuhyidisitjajwkakkkmknkolalblnloltlvmgmimkmlmnmrmsmtmynenlnnnoocpaplpsptrorusasdsiskslsnsosqsrsusvswtatetgthtktltrttukuruzviyiyoyuezhAfrikaansAlbanianAmharicArabicArmenianAssameseAzerbaijaniBashkirBasqueBelarusianBengaliBosnianBretonBulgarianBurmeseCantoneseCastilianCatalanChineseCroatianCzechDanishDutchEnglishEstonianFaroeseFinnishFlemishFrenchGalicianGeorgianGermanGreekGujaratiHaitianHaitian CreoleHausaHawaiianHebrewHindiHungarianIcelandicIndonesianItalianJapaneseJavaneseKannadaKazakhKhmerKoreanLaoLatinLatvianLetzeburgeschLingalaLithuanianLuxembourgishMacedonianMalagasyMalayMalayalamMalteseMandarinMaoriMarathiMoldavianMoldovanMongolianMyanmarNepaliNorwegianNynorskOccitanPanjabiPashtoPersianPolishPortuguesePunjabiPushtoRomanianRussianSanskritSerbianShonaSindhiSinhalaSinhaleseSlovakSlovenianSomaliSpanishSundaneseSwahiliSwedishTagalogTajikTamilTatarTeluguThaiTibetanTurkishTurkmenUkrainianUrduUzbekValencianVietnameseWelshYiddishYoruba
temperaturenumberNo0샘플링 온도. 0이면 결정적
patiencenumberNo-빔 디코딩에 사용할 선택적 patience 값 (https://arxiv.org/abs/2204.05424 참고). 기본값(1.0)은 일반 빔 서치와 동일합니다
suppress_tokensstringNo-1샘플링 중 억제할 토큰 ID의 쉼표 구분 목록. '-1'은 일반적인 문장부호를 제외한 대부분의 특수문자를 억제합니다
initial_promptstringNo-고유명사·전문용어 힌트 텍스트 (선택)
condition_on_previous_textbooleanNotrueTrue이면 이전 윈도우의 모델 출력을 다음 윈도우의 프롬프트로 사용합니다. 비활성화하면 윈도우 간 텍스트 일관성이 떨어질 수 있지만 모델이 실패 루프에 빠질 가능성은 줄어듭니다
temperature_increment_on_fallbacknumberNo0.2아래 임계값 중 하나라도 충족하지 못해 폴백할 때 증가시킬 temperature 값
compression_ratio_thresholdnumberNo2.4gzip 압축률이 이 값보다 높으면 디코딩 실패로 처리
logprob_thresholdnumberNo-1평균 로그 확률이 이 값보다 낮으면 디코딩 실패로 처리
no_speech_thresholdnumberNo0.6<|nospeech|> 토큰의 확률이 이 값보다 높고 `logprob_threshold`로 인해 디코딩이 실패한 경우, 해당 구간을 무음으로 간주

파일 입력 방법

이 모델의 audio 파라미터에 파일을 전달하는 방법은 3가지입니다.

추천

간편 업로드 (Multipart)

POST /v1/predictions/upload에 파일을 직접 첨부합니다. 별도 업로드 과정이 필요 없습니다.

curl -X POST "https://api.core.today/v1/predictions/upload" \
  -H "X-API-Key: cdt_your_api_key" \
  -F "model=openai/whisper" \
  -F 'input={"prompt":"your prompt here"}' \
  -F "file:audio=@your_file.png"

이미지 URL 전달

공개 접근 가능한 URL을 직접 전달합니다. Storage API로 업로드한 파일의 file_url도 사용 가능합니다.

{
  "model": "openai/whisper",
  "input": {
    "prompt": "your prompt here",
    "audio": "https://example.com/image.jpg"
  }
}
File Upload 문서에서 Presigned URL 방식 등 더 자세한 업로드 방법을 확인하세요.

공통 파라미터

POST /v1/predictions 요청 시 사용되는 공통 파라미터입니다.

파라미터타입필수기본값설명
modelstringYes-모델 식별자
inputobjectYes-위 테이블의 모델별 파라미터를 포함하는 객체
output_folderstringNo-결과물 저장 폴더 경로 (최대 256자, '..' 사용 불가)
webhook_urlstringNo-완료 시 호출할 Webhook URL
is_publicbooleanNofalsetrue 시 결과물을 영구 공개 URL로도 제공

예제

한국어 회의 전사

자동 감지로 한국어 녹음 전사

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "openai/whisper",
  "input": {
    "audio": "https://example.com/meeting.mp3",
    "language": "auto",
    "transcription": "plain text"
  }
}'

SRT 자막 생성

자막 파일 형식으로 바로 출력

curl -X POST "https://api.core.today/v1/predictions" \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
  "model": "openai/whisper",
  "input": {
    "audio": "https://example.com/video-audio.mp3",
    "transcription": "srt"
  }
}'

팁 & 모범 사례

1transcription을 'srt'/'vtt'로 설정하면 자막 파일로 바로 쓸 수 있습니다
2initial_prompt에 이름·약어·전문용어를 넣으면 인식 정확도가 올라갑니다
3translate: true면 어떤 언어든 영어 텍스트로 받습니다
4JSON 결과의 세그먼트별 타임스탬프로 커스텀 UI를 만들 수 있습니다
5긴 오디오를 빠르게는 incredibly-fast-whisper, 화자 구분은 whisper-diarization을 쓰세요

사용 사례

회의·인터뷰 전사
영상 자막 생성 (SRT/VTT)
팟캐스트 쇼노트
음성 메모 텍스트화
다국어 콘텐츠 전사