Skip to main content
Core.Today
가격
Model APIs

Vision & Utilities

음성 인식(Whisper), OCR·이미지 캡셔닝, 임베딩, 3D 생성, 립싱크·토킹헤드, 비디오 향상까지 — 생성 외의 모든 AI 유틸리티를 하나의 API로 사용하세요.

이 페이지를 AI에게 전달하세요 — 전체 모델 스펙을 LLM 친화 텍스트로
llms.txt ↗

모델 비교표

모델크레딧유형특징
salesforce/blip1OCR/캡션Salesforce, 빠른 처리
andreasjansson/clip-features1임베딩CLIP, 빠른 처리
falcons-ai/nsfw_image_detection1안전 필터Falcons.ai, 빠른 처리
abiruyt/text-extract-ocr1OCR/캡션OCR, 빠른 처리
charlesmccarthy/addwatermark1비디오 유틸FullJourney, 빠른 처리
lucataco/florence-2-large2객체 감지Microsoft, 빠른 처리
adirik/grounding-dino2객체 감지Grounding DINO, 빠른 처리
beautyyuyanli/multilingual-e5-large2임베딩E5, 빠른 처리
lucataco/moondream25OCR/캡션Moondream, 빠른 처리
nicolascoutureau/video-utils5비디오 유틸FFmpeg, 빠른 처리
thomasmol/whisper-diarization7음성 인식(STT)Whisper, 빠른 처리
vaibhavs10/incredibly-fast-whisper10음성 인식(STT)Whisper, 빠른 처리
openai/whisper10음성 인식(STT)OpenAI, 최고 품질
zsxkib/mmaudio11비디오 유틸MMAudio, 고품질
chenxwh/cogvlm2-video28비디오 유틸CogVLM, 고품질
firtoz/trellis773D 생성Microsoft, 고품질
cjwbw/sadtalker91립싱크/아바타SadTalker, 고품질
bytedance/latentsync220립싱크/아바타ByteDance, 고품질
tencent/hunyuan-3d-3.11,1603D 생성Tencent, 최고 품질
lucataco/real-esrgan-video1,280비디오 향상Real-ESRGAN, 고품질
veed/lipsync/v22,440립싱크/아바타Veed, 고품질

오디오·비디오·이미지 파일은 POST /v1/files/upload-url로 업로드한 뒤 해당 URL을 입력으로 사용하세요. 처리 시간이 파일 길이에 비례하는 모델은 상세 문서에 표기되어 있습니다.

모델 상세 정보

각 모델의 상세한 파라미터, 예제, 활용 팁은 개별 문서에서 확인하세요.

21개 모델

Incredibly Fast Whisper

Whisper

10 credits

속도에 최적화된 Whisper large-v3입니다 (3,800만+ 실행). 배치 추론으로 약 150분 분량 오디오를 100초 이내에 전사합니다. 청크/단어 단위 타임스탬프를 지원합니다.

빠름Ultra
상세 보기

Whisper

OpenAI

10 credits

음성 전사의 표준인 OpenAI Whisper large-v3입니다 (1억 4,400만+ 실행). 약 100개 언어 자동 감지, 영어 번역, plain text/SRT/VTT 출력 형식을 지원합니다.

보통Ultra
상세 보기

Whisper Diarization

Whisper

7 credits

화자 분리(diarization)가 포함된 Whisper 전사입니다 (800만+ 실행). 누가 무엇을 말했는지 세그먼트별 화자 라벨과 타임스탬프로 반환합니다. 회의·인터뷰 전사의 정석입니다.

빠름High
상세 보기

BLIP

Salesforce

1 credits

Salesforce BLIP입니다 (1억 7,300만+ 실행). 이미지 캡셔닝, 시각 질의응답(VQA), 이미지-텍스트 매칭을 하나의 모델로 제공합니다. 이미지당 1크레딧으로 대량 캡셔닝의 클래식 선택지입니다.

빠름High
상세 보기

CLIP Features

CLIP

1 credits

텍스트와 이미지를 모두 임베딩하는 CLIP ViT-L/14입니다 (1억 6,300만+ 실행). 둘을 같은 벡터 공간에 놓아 교차 모달 검색, 이미지 중복 제거, 제로샷 분류에 사용합니다. 실행당 1크레딧.

빠름High
상세 보기

Florence-2 Large

Microsoft

2 credits

Microsoft의 올인원 비전 모델 Florence-2입니다. 캡셔닝, 객체 감지, 구문 그라운딩, OCR, 세그멘테이션을 하나의 API로 제공합니다. 작업을 고르고 필요하면 텍스트 입력만 추가하면 됩니다.

빠름High
상세 보기

Grounding DINO

Grounding DINO

2 credits

자연어 프롬프트 기반 객체 감지입니다 (3,900만+ 실행). 찾고 싶은 것을 말로 설명하면('red car, person wearing a hat') 신뢰도 점수가 붙은 바운딩 박스와 시각화 이미지를 반환합니다.

빠름High
상세 보기

Hunyuan 3D 3.1

Tencent

1,160 credits

Tencent의 플래그십 3D 생성 모델입니다. 텍스트 프롬프트 또는 이미지로 고폴리곤 텍스처 3D 모델을 만들고, PBR(물리 기반 렌더링) 머티리얼 옵션을 지원합니다.

느림Ultra
상세 보기

Moondream2

Moondream

5 credits

작지만 유능한 비전-언어 모델입니다 (1,400만+ 실행). 어떤 이미지든 자유롭게 질문하면 상세한 답변을 받습니다. 태깅·모더레이션 준비·풍부한 대체 텍스트용 고효율 VQA입니다.

빠름High
상세 보기

Multilingual E5 Large

E5

2 credits

다국어 텍스트 임베딩 모델입니다 (7,400만+ 실행). 한국어 포함 100개 언어에서 1024차원 벡터를 생성합니다. Core.Today 고객 데이터베이스의 벡터 검색(knn_vector)과 완벽하게 조합됩니다.

빠름High
상세 보기

NSFW Image Detection

Falcons.ai

1 credits

NSFW 이미지 분류의 표준입니다 (1억 2,700만+ 실행). 어떤 이미지든 'normal' 또는 'nsfw'로 판정합니다. UGC 플랫폼의 필수 모더레이션 게이트로, 이미지당 1크레딧입니다.

빠름High
상세 보기

Text Extract OCR

OCR

1 credits

가장 많이 쓰이는 심플 OCR입니다 (9,100만+ 실행). 이미지 하나를 넣으면 텍스트를 plain text로 반환합니다. 영수증·스크린샷·스캔 문서 처리의 기본 선택지로, 단 1크레딧입니다.

빠름High
상세 보기

TRELLIS

Microsoft

77 credits

Microsoft의 TRELLIS 이미지→3D 모델입니다 (83만+ 실행, Replicate 최다 사용 3D 모델). 이미지 1장 이상으로 텍스처가 입혀진 GLB 3D 에셋을 만들고, 턴테이블 렌더 영상과 Gaussian PLY도 출력할 수 있습니다.

보통High
상세 보기

Add Watermark

FullJourney

1 credits

어떤 영상에든 텍스트 워터마크를 추가합니다. 생성 콘텐츠나 사용자 콘텐츠의 브랜드 보호를 영상당 2크레딧으로 간단하고 빠르게 처리합니다.

빠름High
상세 보기

CogVLM2 Video

CogVLM

28 credits

비디오 이해·캡셔닝 모델입니다. 영상에 대해 자유롭게 질문하면 동작·장면·내용에 대한 상세한 답변을 받습니다. 비디오 검색 인덱싱과 모더레이션 준비에 유용합니다.

보통High
상세 보기

LatentSync

ByteDance

220 credits

ByteDance의 오픈소스 립싱크 모델입니다. 잠재 확산(latent diffusion)으로 영상의 입 모양을 어떤 오디오에든 다시 동기화합니다. 더빙·현지화를 위한 오픈소스 최고 수준의 립싱크 품질입니다.

느림High
상세 보기

MMAudio

MMAudio

11 credits

어떤 영상에든 AI 사운드를 입힙니다 (500만+ 실행). 영상 내용과 텍스트 프롬프트로 동기화된 오디오(앰비언스·효과음·폴리)를 합성합니다. 무음인 AI 생성 클립의 마무리에 완벽합니다.

보통High
상세 보기

Real-ESRGAN Video

Real-ESRGAN

1,280 credits

Real-ESRGAN 기반 비디오 업스케일링입니다. 프레임 단위로 영상을 FHD·2K·4K로 향상합니다. 오래된 영상과 AI 생성 클립을 위한 대표적인 오픈소스 비디오 업스케일러입니다.

느림High
상세 보기

SadTalker

SadTalker

91 credits

사진 한 장과 오디오로 토킹헤드 영상을 만듭니다. 자연스러운 머리 움직임과 눈 깜빡임으로 얼굴을 애니메이션하며, GFPGAN 얼굴 향상 옵션을 제공합니다.

느림High
상세 보기

Veed Lipsync v2

Veed

2,440 credits

Fal.AI를 통해 제공되는 Veed Lipsync v2 모델입니다. 원본 영상의 입 모양을 새로운 오디오 트랙에 맞춰 재구성합니다 — 원본 영상과 새 오디오 트랙만 있으면 입 모양이 자연스럽게 동기화된 결과 영상을 생성합니다.

보통High
상세 보기

Video Utils

FFmpeg

5 credits

FFmpeg 기반 비디오 유틸리티입니다 (2,000만+ 실행). task 파라미터 하나로 mp4/gif 변환, mp3 오디오 추출, 프레임 zip 추출을 처리합니다. 미디어 파이프라인의 맥가이버 칼입니다.

빠름High
상세 보기

빠른 시작 — 음성 인식 (Whisper)

오디오 URL 하나로 100개 언어 자동 감지 전사를 받을 수 있습니다 (13크레딧):

curl -X POST https://api.core.today/v1/predictions \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
    "model": "openai/whisper",
    "input": {
      "audio": "https://example.com/meeting.mp3",
      "language": "auto"
    }
  }'

이미지에서 텍스트 추출(OCR)은 단 1크레딧입니다:

curl -X POST https://api.core.today/v1/predictions \
  -H "Content-Type: application/json" \
  -H "X-API-Key: cdt_your_api_key" \
  -d '{
    "model": "abiruyt/text-extract-ocr",
    "input": { "image": "https://example.com/receipt.jpg" }
  }'

모델 선택 가이드

  • 음성 전사 — openai/whisper (13크레딧, 표준). 긴 오디오를 빠르게는 incredibly-fast-whisper (13크레딧), 회의록처럼 화자 구분이 필요하면 whisper-diarization (9크레딧)
  • OCR·캡션 — 텍스트 추출은 text-extract-ocr (1크레딧), 이미지 캡션·VQA는 blip (1크레딧), 자유 질문은 moondream2 (7크레딧)
  • 임베딩 — 다국어 텍스트는 multilingual-e5-large (3크레딧, 한국어 지원 + 고객 DB 벡터 검색 조합), 이미지·텍스트 교차 검색은 clip-features (1크레딧)
  • 3D 생성 — 이미지→3D는 trellis (100크레딧, GLB 출력), 프롬프트/이미지 겸용 최고 품질은 hunyuan-3d-3.1 (1,500크레딧, PBR 지원)
  • 립싱크·토킹헤드 — 영상 립싱크는 latentsync (285크레딧), 사진 한 장으로 토킹헤드는 sadtalker (120크레딧)
  • 콘텐츠 모더레이션 — nsfw_image_detection (1크레딧, UGC 필수 게이트)
  • 객체 감지 — 자연어로 찾는 grounding-dino (3크레딧), 감지+캡션+OCR 올인원 florence-2-large (3크레딧)
  • 비디오 업스케일·유틸 — real-esrgan-video (1,650크레딧, FHD/2K/4K), 비디오에 AI 사운드는 mmaudio (15크레딧), 변환·추출은 video-utils (7크레딧), 비디오 내용 질문은 cogvlm2-video (36크레딧)