Skip to main content
Core.Today
가격
Model APIs

Vision & Utilities

음성 인식(Whisper), OCR·이미지 캡셔닝, 임베딩, 3D 생성, 립싱크·토킹헤드, 비디오 향상까지 — 생성 외의 모든 AI 유틸리티를 하나의 API로 사용하세요.

이 페이지를 AI에게 전달하세요 — 전체 모델 스펙을 LLM 친화 텍스트로
llms.txt ↗

모델 비교표

모델크레딧유형특징
salesforce/blip1OCR/캡션Salesforce, 빠른 처리
andreasjansson/clip-features1임베딩CLIP, 빠른 처리
falcons-ai/nsfw_image_detection1안전 필터Falcons.ai, 빠른 처리
charlesmccarthy/addwatermark1비디오 유틸FullJourney, 빠른 처리
lucataco/florence-2-large2객체 감지Microsoft, 빠른 처리
adirik/grounding-dino2객체 감지Grounding DINO, 빠른 처리
beautyyuyanli/multilingual-e5-large2임베딩E5, 빠른 처리
abiruyt/text-extract-ocr3OCR/캡션OCR, 빠른 처리
lucataco/moondream25OCR/캡션Moondream, 빠른 처리
nicolascoutureau/video-utils5비디오 유틸FFmpeg, 빠른 처리
meta/muse-voice-transcribe-1.07음성 인식(STT)Meta, 빠른 처리
vaibhavs10/incredibly-fast-whisper10음성 인식(STT)Whisper, 빠른 처리
openai/whisper10음성 인식(STT)OpenAI, 최고 품질
zsxkib/mmaudio11비디오 유틸MMAudio, 고품질
thomasmol/whisper-diarization14음성 인식(STT)Whisper, 빠른 처리
chenxwh/cogvlm2-video28비디오 유틸CogVLM, 고품질
meta/muse-voice-transcribe-1.0/realtime35음성 인식(STT)Meta, 빠른 처리
firtoz/trellis773D 생성Microsoft, 고품질
bytedance/latentsync220립싱크/아바타ByteDance, 고품질
cjwbw/sadtalker230립싱크/아바타SadTalker, 고품질
tencent/hunyuan-3d-3.11,1603D 생성Tencent, 최고 품질
lucataco/real-esrgan-video1,280비디오 향상Real-ESRGAN, 고품질
veed/lipsync/v22,440립싱크/아바타Veed, 고품질

오디오·비디오·이미지 파일은 POST /v1/files/upload-url로 업로드한 뒤 해당 URL을 입력으로 사용하세요. 처리 시간이 파일 길이에 비례하는 모델은 상세 문서에 표기되어 있습니다.

모델 상세 정보

각 모델의 상세한 파라미터, 예제, 활용 팁은 개별 문서에서 확인하세요.

23개 모델

Incredibly Fast Whisper

Whisper

10 credits

속도에 최적화된 Whisper large-v3입니다 (3,800만+ 실행). 배치 추론으로 약 150분 분량 오디오를 100초 이내에 전사합니다. 청크/단어 단위 타임스탬프를 지원합니다.

빠름Ultra
상세 보기

Muse Voice Transcribe 1.0

Meta

7 credits

Meta 개발자 API 직결로 제공되는 Meta Muse Voice Transcribe 음성 인식 모델입니다. 한국어를 포함한 25개 언어와 코드 스위칭, 화자 분리, 발화 구간 분할, 키워드·언어 바이어싱을 지원합니다. 오디오 1초당 0.11625 크레딧(분당 약 7 크레딧)으로 과금되며 요청당 최대 10분입니다.

빠름High
상세 보기

Muse Voice Transcribe 1.0 (Realtime)

Meta

35 credits

Meta Muse Voice Transcribe를 WebSocket으로 스트리밍합니다. 16-bit PCM(24kHz 또는 16kHz 모노) 오디오를 보내면 말하는 동안 부분·최종 전사를 실시간으로 받으며, 발화 구간 분할과 화자 분리를 지원합니다. Meta가 처리한 오디오 초 단위로 과금되고(초당 0.11625 크레딧, 5분 블록당 35 크레딧), 세션은 최대 20분입니다.

빠름High
상세 보기

Whisper

OpenAI

10 credits

음성 전사의 표준인 OpenAI Whisper large-v3입니다 (1억 4,400만+ 실행). 약 100개 언어 자동 감지, 영어 번역, plain text/SRT/VTT 출력 형식을 지원합니다.

보통Ultra
상세 보기

Whisper Diarization

Whisper

14 credits

화자 분리(diarization)가 포함된 Whisper 전사입니다 (800만+ 실행). 누가 무엇을 말했는지 세그먼트별 화자 라벨과 타임스탬프로 반환합니다. 회의·인터뷰 전사의 정석입니다.

빠름High
상세 보기

BLIP

Salesforce

1 credits

Salesforce BLIP입니다 (1억 7,300만+ 실행). 이미지 캡셔닝, 시각 질의응답(VQA), 이미지-텍스트 매칭을 하나의 모델로 제공합니다. 이미지당 1크레딧으로 대량 캡셔닝의 클래식 선택지입니다.

빠름High
상세 보기

CLIP Features

CLIP

1 credits

텍스트와 이미지를 모두 임베딩하는 CLIP ViT-L/14입니다 (1억 6,300만+ 실행). 둘을 같은 벡터 공간에 놓아 교차 모달 검색, 이미지 중복 제거, 제로샷 분류에 사용합니다. 실행당 1크레딧.

빠름High
상세 보기

Florence-2 Large

Microsoft

2 credits

Microsoft의 올인원 비전 모델 Florence-2입니다. 캡셔닝, 객체 감지, 구문 그라운딩, OCR, 세그멘테이션을 하나의 API로 제공합니다. 작업을 고르고 필요하면 텍스트 입력만 추가하면 됩니다.

빠름High
상세 보기

Grounding DINO

Grounding DINO

2 credits

자연어 프롬프트 기반 객체 감지입니다 (3,900만+ 실행). 찾고 싶은 것을 말로 설명하면('red car, person wearing a hat') 신뢰도 점수가 붙은 바운딩 박스와 시각화 이미지를 반환합니다.

빠름High
상세 보기

Hunyuan 3D 3.1

Tencent

1,160 credits

Tencent의 플래그십 3D 생성 모델입니다. 텍스트 프롬프트 또는 이미지로 고폴리곤 텍스처 3D 모델을 만들고, PBR(물리 기반 렌더링) 머티리얼 옵션을 지원합니다.

느림Ultra
상세 보기

Moondream2

Moondream

5 credits

작지만 유능한 비전-언어 모델입니다 (1,400만+ 실행). 어떤 이미지든 자유롭게 질문하면 상세한 답변을 받습니다. 태깅·모더레이션 준비·풍부한 대체 텍스트용 고효율 VQA입니다.

빠름High
상세 보기

Multilingual E5 Large

E5

2 credits

다국어 텍스트 임베딩 모델입니다 (7,400만+ 실행). 한국어 포함 100개 언어에서 1024차원 벡터를 생성합니다. Core.Today 고객 데이터베이스의 벡터 검색(knn_vector)과 완벽하게 조합됩니다.

빠름High
상세 보기

NSFW Image Detection

Falcons.ai

1 credits

NSFW 이미지 분류의 표준입니다 (1억 2,700만+ 실행). 어떤 이미지든 'normal' 또는 'nsfw'로 판정합니다. UGC 플랫폼의 필수 모더레이션 게이트로, 이미지당 1크레딧입니다.

빠름High
상세 보기

Text Extract OCR

OCR

3 credits

가장 많이 쓰이는 심플 OCR입니다 (9,100만+ 실행). 이미지 하나를 넣으면 텍스트를 plain text로 반환합니다. 영수증·스크린샷·스캔 문서 처리의 기본 선택지로, 단 1크레딧입니다.

빠름High
상세 보기

TRELLIS

Microsoft

77 credits

Microsoft의 TRELLIS 이미지→3D 모델입니다 (83만+ 실행, Replicate 최다 사용 3D 모델). 이미지 1장 이상으로 텍스처가 입혀진 GLB 3D 에셋을 만들고, 턴테이블 렌더 영상과 Gaussian PLY도 출력할 수 있습니다.

보통High
상세 보기

Add Watermark

FullJourney

1 credits

어떤 영상에든 텍스트 워터마크를 추가합니다. 생성 콘텐츠나 사용자 콘텐츠의 브랜드 보호를 영상당 2크레딧으로 간단하고 빠르게 처리합니다.

빠름High
상세 보기

CogVLM2 Video

CogVLM

28 credits

비디오 이해·캡셔닝 모델입니다. 영상에 대해 자유롭게 질문하면 동작·장면·내용에 대한 상세한 답변을 받습니다. 비디오 검색 인덱싱과 모더레이션 준비에 유용합니다.

보통High
상세 보기

LatentSync

ByteDance

220 credits

ByteDance의 오픈소스 립싱크 모델입니다. 잠재 확산(latent diffusion)으로 영상의 입 모양을 어떤 오디오에든 다시 동기화합니다. 더빙·현지화를 위한 오픈소스 최고 수준의 립싱크 품질입니다.

느림High
상세 보기

MMAudio

MMAudio

11 credits

어떤 영상에든 AI 사운드를 입힙니다 (500만+ 실행). 영상 내용과 텍스트 프롬프트로 동기화된 오디오(앰비언스·효과음·폴리)를 합성합니다. 무음인 AI 생성 클립의 마무리에 완벽합니다.

보통High
상세 보기

Real-ESRGAN Video

Real-ESRGAN

1,280 credits

Real-ESRGAN 기반 비디오 업스케일링입니다. 프레임 단위로 영상을 FHD·2K·4K로 향상합니다. 오래된 영상과 AI 생성 클립을 위한 대표적인 오픈소스 비디오 업스케일러입니다.

느림High
상세 보기

SadTalker

SadTalker

230 credits

사진 한 장과 오디오로 토킹헤드 영상을 만듭니다. 자연스러운 머리 움직임과 눈 깜빡임으로 얼굴을 애니메이션하며, GFPGAN 얼굴 향상 옵션을 제공합니다.

느림High
상세 보기

Veed Lipsync v2

Veed

2,440 credits

Fal.AI를 통해 제공되는 Veed Lipsync v2 모델입니다. 원본 영상의 입 모양을 새로운 오디오 트랙에 맞춰 재구성합니다 — 원본 영상과 새 오디오 트랙만 있으면 입 모양이 자연스럽게 동기화된 결과 영상을 생성합니다.

보통High
상세 보기

Video Utils

FFmpeg

5 credits

FFmpeg 기반 비디오 유틸리티입니다 (2,000만+ 실행). task 파라미터 하나로 mp4/gif 변환, mp3 오디오 추출, 프레임 zip 추출을 처리합니다. 미디어 파이프라인의 맥가이버 칼입니다.

빠름High
상세 보기

빠른 시작 — 음성 인식 (Whisper)

오디오 URL 하나로 100개 언어 자동 감지 전사를 받을 수 있습니다 (13크레딧):

curl -X POST https://api.core.today/v1/predictions \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
    "model": "openai/whisper",
    "input": {
      "audio": "https://example.com/meeting.mp3",
      "language": "auto"
    }
  }'

화자 구분·발화 구간이 필요하면 Meta Muse Voice Transcribe (오디오 1초당 0.11625크레딧, 분당 약 7크레딧, 한국어 포함 25개 언어). 결과는 transcript·audioDurationMs·turns[]가 담긴 JSON입니다:

curl -X POST https://api.core.today/v1/predictions \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
    "model": "meta/muse-voice-transcribe-1.0",
    "input": {
      "audio": "https://example.com/meeting.m4a",
      "mode": "DIARIZATION",
      "language_bias": ["Korean", "English"]
    }
  }'

이미지에서 텍스트 추출(OCR)은 단 1크레딧입니다:

curl -X POST https://api.core.today/v1/predictions \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
    "model": "abiruyt/text-extract-ocr",
    "input": { "image": "https://example.com/receipt.jpg" }
  }'

실시간 스트리밍 (WebSocket)

말하는 동안 부분·최종 전사를 받아야 한다면 POST /predictions가 아니라 WebSocket으로 접속하세요. Meta Muse Voice Transcribe 1.0 (Realtime)만 지원하며, 이 모델은 POST /predictions를 400 realtime_only로 거부합니다. 엔드포인트는 wss://api.core.today/v1/realtime/asr입니다.

인증은 X-API-Key 헤더(접속 전에 검증됨)이거나, 헤더를 설정할 수 없는 런타임을 위해 핸드셰이크 JSON의 apiKey 필드입니다. 리셀러 팀은 X-Customer-Id 헤더(또는 핸드셰이크 customerId)가 필수이고, 키와 같은 소스(헤더↔헤더, JSON↔JSON)여야 합니다. 브라우저에 실제 API 키를 넣지 마세요— 자체 서버에서 접속하고, 그 서버가 브라우저와는 별도 채널로 오디오를 중계해야 합니다.

접속 직후 첫 텍스트 프레임으로 핸드셰이크를 보냅니다(10초 안에 보내지 않으면 4400 handshake_timeout):

{
  "model": "meta/muse-voice-transcribe-1.0/realtime",
  "audioEncoding": "PCM_24KHZ",
  "mode": "ENDPOINTING",
  "partialMode": "CUMULATIVE",
  "emitAudioProgress": false,
  "keywords": ["Core.Today"],
  "languageBias": ["Korean"],
  "apiKey": "cdt_your_api_key",
  "customerId": "member-123"
}

이후 바이너리 프레임으로 raw PCM 16-bit 모노 오디오를 보냅니다(프레임당 최대 64 KiB). 실시간 속도(1x)로 보내고, 보낼 오디오가 없을 때는 무음으로 패딩하세요 — 10초 동안 오디오가 없으면 4408 idle_timeout이고, 실시간보다 5초 이상 앞서 보내면(페이싱 위반) 4400 pacing_violation으로 끊습니다. 전사를 마치려면 텍스트 프레임 {"type":"endStream"}을 보내세요.

우리가 보내는 이벤트: 접속 확정 session, Meta가 그대로 전달하는 transcript·speechStart·speechEnd·speechComplete·speaker(그리고 emitAudioProgress: trueaudioProgress), 마지막으로 정산이 끝난 뒤 보내는 usage입니다:

{"type":"session","sessionId":"rt_..."}
{"type":"transcript","isFinal":false,"text":"..."}
{"type":"usage","sessionId":"rt_...","audioSeconds":73,"credits":9,"reason":"client_end"}

Python 예시 — 24kHz WAV를 80ms 프레임으로 1배속 스트리밍하고 이벤트를 출력합니다:

import asyncio, json, os, wave, websockets

API_KEY = os.environ["AIAPI_API_KEY"]
ENDPOINT = "wss://api.core.today/v1/realtime/asr"

async def main():
    async with websockets.connect(
        ENDPOINT, additional_headers={"X-API-Key": API_KEY}
    ) as ws:
        await ws.send(json.dumps({
            "model": "meta/muse-voice-transcribe-1.0/realtime",
            "audioEncoding": "PCM_24KHZ",
            "mode": "ENDPOINTING",
            "languageBias": ["Korean"],
        }))

        async def send_audio():
            with wave.open("meeting-24khz-mono.wav", "rb") as wav:
                frame_bytes = int(24000 * 2 * 0.08)  # 80ms of 16-bit mono PCM
                while chunk := wav.readframes(frame_bytes // 2):
                    await ws.send(chunk)
                    await asyncio.sleep(0.08)  # pace at 1x — never send ahead
            await ws.send(json.dumps({"type": "endStream"}))

        async def recv_events():
            async for msg in ws:
                if isinstance(msg, str):
                    print(json.loads(msg))

        await asyncio.gather(send_audio(), recv_events())

asyncio.run(main())

close 코드:

코드의미
1000정상 종료 (클라이언트 종료, 20분 상한, 기능 정지)
1011Meta 세션 오류
1012서버 재배포 — 이번 세션은 최종 전사·usage 이벤트 없이 즉시 끊깁니다. 지수 백오프로 재접속하세요
4400핸드셰이크·프레임 오류 또는 페이싱 위반 (invalid_handshake / model_not_found / ambiguous_auth / handshake_timeout / invalid_frame / pacing_violation)
4401API 키 없음/무효 (unauthorized)
4402크레딧/고객 예산 부족 (insufficient_credits / reseller_account_insufficient / customer_wallet_insufficient)
4403리셀러 스코프·허용 모델·키 비활성 (invalid_customer_id / customer_suspended / customer_not_found / model_not_allowed / api_key_disabled)
440810초 이상 오디오 무입력, 또는 이벤트를 충분히 빨리 읽지 않는 느린 클라이언트 (idle_timeout / client_slow)
4413바이너리 프레임이 64 KiB를 초과 (frame_too_large)
4429동시성·속도 제한 (customer_concurrency_exceeded / team_concurrency_exceeded / rate_limit_exceeded / customer_rate_limited / server_busy)
4503기능 정지 또는 업스트림/게이트웨이 장애 (feature_disabled / provider_unavailable / provider_rejected / provider_rate_limited / admission_unavailable)

과금: 초당 0.11625크레딧, 5분(300초) 블록마다 35크레딧씩 예약되고 세션 진행에 따라 즉시 정산됩니다. 최종 청구는 Meta가 실제로 처리했다고 보고한 오디오 초 기준이며(연결 시간이 아님), 마지막 부분 블록은 그 초만큼만 청구됩니다(예: 73초 = 9크레딧, 300초 = 35크레딧). 세션은 최대 20분(1,200초)이고, 그 이상은 재접속해야 합니다. 배포 중 서버가 재시작되면 진행 중 세션은 1012로 즉시 끊기며(최종 전사·usage 이벤트는 받지 못함) 정산은 서버 쪽에서 처리되므로 지수 백오프로 재접속하면 됩니다.

모델 선택 가이드

  • 음성 전사 — openai/whisper (13크레딧, 표준). 긴 오디오를 빠르게는 incredibly-fast-whisper (13크레딧), 회의록처럼 화자 구분이 필요하면 whisper-diarization (9크레딧). 한·영 혼용 회의나 키워드 바이어싱이 필요하면 meta/muse-voice-transcribe-1.0 (초당 과금, 분당 약 7크레딧, 최대 10분/요청)
  • OCR·캡션 — 텍스트 추출은 text-extract-ocr (1크레딧), 이미지 캡션·VQA는 blip (1크레딧), 자유 질문은 moondream2 (7크레딧)
  • 임베딩 — 다국어 텍스트는 multilingual-e5-large (3크레딧, 한국어 지원 + 고객 DB 벡터 검색 조합), 이미지·텍스트 교차 검색은 clip-features (1크레딧)
  • 3D 생성 — 이미지→3D는 trellis (100크레딧, GLB 출력), 프롬프트/이미지 겸용 최고 품질은 hunyuan-3d-3.1 (1,500크레딧, PBR 지원)
  • 립싱크·토킹헤드 — 영상 립싱크는 latentsync (285크레딧), 사진 한 장으로 토킹헤드는 sadtalker (120크레딧)
  • 콘텐츠 모더레이션 — nsfw_image_detection (1크레딧, UGC 필수 게이트)
  • 객체 감지 — 자연어로 찾는 grounding-dino (3크레딧), 감지+캡션+OCR 올인원 florence-2-large (3크레딧)
  • 비디오 업스케일·유틸 — real-esrgan-video (1,650크레딧, FHD/2K/4K), 비디오에 AI 사운드는 mmaudio (15크레딧), 변환·추출은 video-utils (7크레딧), 비디오 내용 질문은 cogvlm2-video (36크레딧)