Skip to main content
Core.Today
가격
50+ AI 모델

모델 카탈로그

이미지, 비디오, 오디오 생성 및 LLM을 위한 다양한 AI 모델을 살펴보세요.

79
이미지 모델
46
비디오 모델
32
오디오 모델
45
LLM 모델

추천 모델

각 카테고리의 추천 모델 - 시작하기에 가장 좋은 모델들

모델 선택 가이드

속도가 중요하다면?

flux-schnell, Gemini Flash

품질이 중요하다면?

FLUX Pro, Kling Pro, Claude

비용 효율적인 선택?

flux-schnell, MiniMax, Gemini

가장 다재다능한 모델?

GPT-4o, Claude, FLUX Dev

이미지 생성 모델

FLUX, Stable Diffusion 등으로 멋진 이미지를 생성하세요

Background Remover

추천

851 Labs

1 크레딧

Replicate에서 가장 많이 사용된 배경 제거 모델입니다 (2,700만+ 실행). 소프트 알파/하드 세그멘테이션 배경 제거, 반전 모드(전경 제거), 커스텀 배경 타입, 투명 PNG 출력을 매우 저렴한 가격에 지원합니다.

Replicate 최다 사용 배경 제거 모델
소프트 알파 매트 또는 하드 세그멘테이션 (threshold)
반전 모드 — 배경 대신 전경 제거
빠름높음
자세히 보기

BiRefNet

BiRefNet

5 크레딧

SOTA 오픈소스 배경 제거 모델입니다. BiRefNet의 고해상도 이분 세그멘테이션이 머리카락, 털, 미세 디테일에서 탁월한 경계 품질을 제공합니다.

SOTA 세그멘테이션 품질
머리카락·털·미세 디테일의 탁월한 경계
처리 해상도 조정 가능
빠름울트라
자세히 보기

BLIP

Salesforce

1 크레딧

Salesforce BLIP입니다 (1억 7,300만+ 실행). 이미지 캡셔닝, 시각 질의응답(VQA), 이미지-텍스트 매칭을 하나의 모델로 제공합니다. 이미지당 1크레딧으로 대량 캡셔닝의 클래식 선택지입니다.

3가지 작업: 캡셔닝, VQA, 이미지-텍스트 매칭
1억 7,300만+ 실행 — 캡셔닝의 클래식
이미지당 1크레딧 — 대량 파이프라인에 최적
빠름표준
자세히 보기

Change Haircut

Black Forest Labs

93 크레딧

FLUX.1 Kontext [pro] 기반으로 사진 한 장에서 헤어스타일과 머리 색을 바꿉니다. 90개 이상의 헤어스타일과 30가지 머리 색 중 선택하거나 'Random'으로 랜덤 변신 — 얼굴은 그대로 유지됩니다.

밥컷·브레이드·업두·페이드·웨이브 등 90개 이상의 헤어스타일 프리셋
자연스러운 색부터 로즈골드·블루·실버까지 30가지 머리 색
얼굴은 그대로, 머리만 바꾸는 정체성 보존 편집
빠름높음
자세히 보기

Clarity Upscaler

Clarity

60 크레딧

유명한 크리에이티브 업스케일러입니다 (3,000만+ 실행). 단순 확대가 아니라 디테일을 재창조하며 업스케일합니다 — creativity/resemblance 제어, 프롬프트 가이드, 고배율을 위한 타일 디퓨전을 지원합니다.

업스케일과 동시에 디테일 재창조
creativity·resemblance 다이얼
프롬프트 기반 향상 가이드
보통울트라
자세히 보기

CLIP Features

CLIP

1 크레딧

텍스트와 이미지를 모두 임베딩하는 CLIP ViT-L/14입니다 (1억 6,300만+ 실행). 둘을 같은 벡터 공간에 놓아 교차 모달 검색, 이미지 중복 제거, 제로샷 분류에 사용합니다. 실행당 1크레딧.

텍스트와 이미지를 같은 공간에 임베딩
1억 6,300만+ 실행 — Replicate의 CLIP 표준
줄바꿈으로 여러 입력 배치 가능
빠름높음
자세히 보기

CodeFormer

CodeFormer

8 크레딧

오래된 사진과 AI 생성 얼굴을 위한 강력한 얼굴 복원 모델입니다 (5,400만+ 실행). 복원 품질과 원본 얼굴 충실도의 균형을 조절하는 fidelity 다이얼이 특징이며, Real-ESRGAN 배경 향상을 내장하고 있습니다.

품질↔충실도 균형 다이얼 (codeformer_fidelity)
심하게 손상된 얼굴에도 강건함
Real-ESRGAN 배경 향상 내장
빠름높음
자세히 보기

ControlNet Scribble

ControlNet

120 크레딧

스케치→이미지의 클래식입니다 (3,800만+ 실행). 낙서나 선화를 프롬프트에 맞는 정교한 이미지로 바꿉니다. 구도는 그림으로, 내용은 텍스트로 지시하세요.

스케치가 구도를, 프롬프트가 내용을 결정
3,800만+ 실행 — 스크리블의 표준
실행당 1장 또는 4장
보통높음
자세히 보기

Nano Banana (Edit)

Google

91 크레딧

Google Gemini 2.5 Flash 기반 Nano Banana의 전용 편집 엔드포인트입니다. 이미지 URL을 입력하면 캐릭터 일관성과 멀티 이미지 융합을 통한 대화형 편집을 수행합니다.

이미지 입력에 최적화된 편집 전용 엔드포인트
캐릭터 일관성 기반 멀티모달 편집
멀티 이미지 융합
빠름높음
자세히 보기

Nano Banana 2 (Edit)

Google

190 크레딧

Gemini 3.1 Flash Image 기반 Nano Banana 2의 편집 엔드포인트입니다. 해상도 제어(1K/2K/4K), Google 검색 연동, 사고 모드를 추가하면서 대화형 편집과 멀티 이미지 융합을 유지합니다.

해상도 제어: 1K, 2K, 4K
선택적 웹 검색 연동
사고 모드 (minimal/high)
보통울트라
자세히 보기

Nano Banana Pro (Edit)

Google

350 크레딧

Gemini 3 Pro 기반 Nano Banana Pro의 편집 엔드포인트입니다. 전문가급 제어, 다국어 텍스트 렌더링, Google 검색 실시간 연동, 최대 2K 편집 해상도를 제공합니다.

Gemini 3 Pro 추론 기반 복잡한 편집
다국어 텍스트 렌더링
웹 검색 연동
보통울트라
자세히 보기

Face to Many

fofr

21 크레딧

얼굴 사진을 6가지 재미있는 스타일로 바꿉니다 (1,500만+ 실행) — 3D, 이모지, 비디오 게임, 픽셀, 클레이, 토이. 수많은 프로필 앱의 원조 바이럴 아바타 생성기입니다.

6가지 스타일: 3D, 이모지, 비디오 게임, 픽셀, 클레이, 토이
InstantID로 얼굴 정체성 유지
브랜드 스타일용 커스텀 LoRA 지원
빠름높음
자세히 보기

Face to Sticker

fofr

22 크레딧

얼굴 사진을 귀여운 다이컷 스티커로 변환합니다 (160만+ 실행). InstantID가 얼굴 유사도를 지키고 IP-Adapter 컨트롤로 충실한 캐리커처부터 자유로운 카툰까지 표현 — 인쇄 품질을 위한 2배 업스케일 옵션도 지원합니다.

얼굴 사진 한 장으로 스티커 스타일 아트워크 생성
instant_id_strength로 조절하는 InstantID 기반 얼굴 유사도
ip_adapter_weight·prompt_strength로 유사도와 스타일 균형 조절
빠름높음
자세히 보기

Florence-2 Large

Microsoft

2 크레딧

Microsoft의 올인원 비전 모델 Florence-2입니다. 캡셔닝, 객체 감지, 구문 그라운딩, OCR, 세그멘테이션을 하나의 API로 제공합니다. 작업을 고르고 필요하면 텍스트 입력만 추가하면 됩니다.

하나의 모델로 다양한 작업 (task_input 선택)
캡션 / 상세 캡션 / 객체 감지
OCR 및 영역 박스 OCR
빠름높음
자세히 보기

FLUX.2 Klein 4B

Black Forest Labs

2 크레딧

매우 빠른 이미지 생성·편집 모델입니다. 4스텝으로 증류되어 프로덕션 및 준실시간 애플리케이션에 적합한 1초 이내 추론 속도를 제공합니다.

4스텝으로 증류된 모델 — 1초 이내의 추론 속도
텍스트-이미지와 이미지-이미지 편집 모두 지원 (최대 5개의 참조 이미지)
0.25MP부터 4MP까지 선택 가능한 출력 해상도
빠름표준
자세히 보기

FLUX 2 Flex

Black Forest Labs

280 크레딧

최대 10개의 참조 이미지와 고급 타이포그래피를 지원하는 최고 품질 FLUX 모델입니다. 복잡한 다중 참조 크리에이티브 프로젝트에 가장 강력한 모델입니다.

최대 10개 참조 이미지 지원
고급 타이포그래피 렌더링
울트라 품질 출력
느림울트라
자세히 보기

FLUX 2 Max

Black Forest Labs

160 크레딧

Black Forest Labs의 최고 충실도 이미지 모델입니다. FLUX.2 라인업 중 최고의 프롬프트 준수율과 가장 일관된 편집 성능을 제공하며, 최대 8장의 레퍼런스 이미지로 색상·조명·얼굴·텍스트·오브젝트를 편집 간에 보존합니다.

FLUX.2 라인업 최고의 편집 일관성 — 정체성·색상·조명·텍스트 보존
짧은 프롬프트와 긴 프롬프트 모두에서 최고 수준의 프롬프트 준수
최대 8장의 입력 이미지를 활용한 멀티 레퍼런스 편집
빠름울트라
자세히 보기

FLUX 2 Pro

Black Forest Labs

70 크레딧

고품질 편집 기능과 최대 8개의 참조 이미지를 지원하는 프로페셔널 FLUX 2 모델입니다. 품질, 속도, 크리에이티브 제어의 뛰어난 균형을 제공합니다.

최대 8개 참조 이미지 지원
고품질 이미지 편집
울트라 품질 생성
보통울트라
자세히 보기

FLUX.2 Dev

Black Forest Labs

28 크레딧

이미지 편집 기능과 참조 이미지 지원이 포함된 FLUX.2 개발 버전입니다. 반복적인 디자인 워크플로우와 실험에 이상적입니다.

이미지 편집 기능
참조 이미지 지원
속도와 품질의 균형
보통높음
자세히 보기

FLUX 1.1 Pro

Black Forest Labs

93 크레딧

FLUX.1 Pro를 업그레이드한 빠르고 고품질 이미지 생성 모델입니다. 속도와 충실도 모두가 필요한 프로덕션 워크로드에 적합합니다.

FLUX.1 Pro보다 빠른 속도
향상된 이미지 품질
울트라 품질 출력
빠름울트라
자세히 보기

FLUX 1.1 Pro Ultra

Black Forest Labs

140 크레딧

FLUX1.1 [pro]의 ultra·raw 모드입니다. FLUX 1.1 Pro 계열 중 최고 해상도인 최대 4메가픽셀 이미지를 생성합니다. 사실적인 결과가 필요하면 raw 모드를 사용하세요.

최대 4메가픽셀의 울트라 해상도 출력
덜 가공된, 더 자연스러운 이미지를 위한 raw 모드
구도 가이드를 위한 Flux Redux image_prompt 지원
보통울트라
자세히 보기

FLUX Dev

Black Forest Labs

58 크레딧

텍스트 설명으로 이미지를 생성하는 120억 파라미터 규모의 rectified flow transformer입니다. 개방적이고 고품질의 실험용으로 튜닝되었습니다.

120억 파라미터 규모의 rectified flow transformer
더 빠른 생성을 위한 선택적 fp8 'go_fast' 모드
image 파라미터를 통한 이미지-이미지 변환 지원
빠름높음
자세히 보기

FLUX Kontext Max

Black Forest Labs

190 크레딧

자연어 프롬프트로 이미지를 변형하는 프리미엄 텍스트 기반 이미지 편집 모델입니다. 최고 수준의 성능과 향상된 타이포그래피 생성 능력을 제공합니다.

FLUX Kontext Pro보다 상위 등급의 편집 성능
편집된 이미지에서 향상된 타이포그래피와 텍스트 렌더링
자연어 지시 기반 편집
보통울트라
자세히 보기

FLUX Kontext Pro

Black Forest Labs

93 크레딧

자연어로 이미지를 변환하는 최첨단 텍스트 기반 이미지 편집 모델입니다. 스타일 전환, 객체 수정, 텍스트 교체, 배경 변경, 캐릭터 일관성 작업에 뛰어납니다.

고품질 텍스트 기반 이미지 편집
스타일 전환 및 변환
객체 및 텍스트 교체
보통울트라
자세히 보기

FLUX.1 Krea [dev]

Krea AI

58 크레딧

'AI 느낌'을 특별히 배제하여 실제 사진과 구별할 수 없는 자연스러운 이미지를 생성하는 포토리얼리스틱 이미지 생성 모델입니다.

AI 아티팩트 없는 포토리얼리스틱 출력
자연스러운 이미지 생성
전형적인 AI 미학적 특징 회피
보통높음
자세히 보기

FLUX PuLID

ByteDance

47 크레딧

FLUX-dev 기반 PuLID 정체성 커스터마이징: 얼굴 사진 한 장으로 특정 인물의 포토리얼 인물 사진을 생성합니다. SDXL 계열 대비 눈에 띄게 높은 얼굴 재현도가 강점이며, id_weight와 start_step으로 유사도와 프롬프트 편집성의 균형을 조절합니다.

포토리얼·고재현도 인물 사진을 위한 FLUX-dev 백본
얼굴 사진 한 장으로 학습 없이 정체성 보존
id_weight(0-3)로 얼굴 보존 강도 제어
보통높음
자세히 보기

FLUX.1 Schnell

Black Forest Labs

7 크레딧

속도에 최적화된 초고속 이미지 생성 모델입니다. 1-2초 만에 고품질 이미지를 생성하며, 실시간 애플리케이션과 빠른 프로토타이핑에 적합합니다.

초고속 생성 (1-2초)
1024x1024 고품질 출력
뛰어난 프롬프트 이해력
빠름높음
자세히 보기

Runway Gen-4 Image

Runway

190 크레딧

레퍼런스를 지원하는 Runway의 Gen-4 Image 모델입니다. 최대 3장의 레퍼런스 이미지를 프롬프트 속 @태그로 지칭해 캐릭터·사물·장소를 어떤 앵글과 장면에서도 일관되게 유지하며, 720p 또는 1080p로 생성합니다.

최대 3장의 레퍼런스 이미지로 캐릭터·사물·장소 일관성 유지
프롬프트 안에서 @태그명으로 각 레퍼런스의 역할을 지정
720p·1080p 해상도 선택과 해상도별 차등 과금
보통울트라
자세히 보기

Runway Gen-4 Image Turbo

Runway

70 크레딧

Gen-4 Image보다 2.5배 빠르고 저렴한 Turbo 버전으로, 레퍼런스 기반 API는 동일합니다. 1~3장의 레퍼런스 이미지를 @태그로 지칭해 캐릭터와 사물의 일관성을 유지하며, 해상도와 무관하게 단일 요금으로 과금됩니다.

Gen-4 Image 대비 2.5배 빠르고 저렴한 생성 속도
720p·1080p 모두 90크레딧 단일 요금
@태그명 프롬프트 지칭이 가능한 1~3장의 레퍼런스 이미지 (최소 1장 필수)
빠름높음
자세히 보기

GFPGAN

Tencent ARC

6 크레딧

Tencent ARC의 얼굴 복원 모델입니다 — 1억 1,500만+ 실행으로 복원 컬렉션 최다 사용. 오래되거나 흐릿한 사진을 복원하고 AI 생성 이미지의 얼굴을 교정합니다.

1억+ 실행 — 얼굴 복원의 표준
오래되고 흐릿하거나 손상된 사진 복원
AI 생성 이미지의 왜곡된 얼굴 교정
빠름높음
자세히 보기

GPT Image 2

OpenAI

300 크레딧

강력한 지시 이해력, 선명한 텍스트 렌더링, 정밀한 편집을 갖춘 OpenAI의 최첨단 이미지 생성/편집 모델입니다. 품질 기반 가격으로 비용-품질 트레이드오프를 선택할 수 있습니다.

뛰어난 프롬프트/지시 이해력
선명한 타이포그래피 및 텍스트 렌더링
input_images로 합성/편집 지원
보통울트라
자세히 보기

GPT Image 1.5

OpenAI

310 크레딧

지시 이행력과 프롬프트 준수도가 향상된 OpenAI의 최신 이미지 생성 모델입니다. 선명한 텍스트 렌더링과 정교한 편집을 지원합니다.

비례 과금이 적용되는 4단계 품질(low/medium/high/auto)
강력한 지시 이행력과 프롬프트 준수도
선명한 이미지 내 텍스트 렌더링
보통울트라
자세히 보기

Grok Imagine Image

xAI

47 크레딧

xAI의 Grok Imagine 모델로 이미지를 생성합니다. Grok Imagine Video와 동일한 Grok Imagine 아키텍처를 공유하는 자매 모델로, 빠른 text-to-image 생성을 제공합니다.

Grok Imagine 아키텍처 기반 text-to-image 생성
기존 이미지와 프롬프트를 함께 전달해 편집하는 이미지 편집 모드
14종의 종횡비 프리셋과 auto 옵션
빠름표준
자세히 보기

Grounding DINO

Grounding DINO

2 크레딧

자연어 프롬프트 기반 객체 감지입니다 (3,900만+ 실행). 찾고 싶은 것을 말로 설명하면('red car, person wearing a hat') 신뢰도 점수가 붙은 바운딩 박스와 시각화 이미지를 반환합니다.

자연어 기반 제로샷 감지
바운딩 박스 + 신뢰도 점수 (JSON)
주석이 그려진 시각화 이미지
빠름높음
자세히 보기

Hunyuan 3D 3.1

Tencent

1160 크레딧

Tencent의 플래그십 3D 생성 모델입니다. 텍스트 프롬프트 또는 이미지로 고폴리곤 텍스처 3D 모델을 만들고, PBR(물리 기반 렌더링) 머티리얼 옵션을 지원합니다.

텍스트→3D와 이미지→3D를 하나의 모델로
최대 50만 페이스 고폴리곤 출력
PBR 머티리얼 생성 옵션
느림울트라
자세히 보기

Ideogram V4 Balanced

Ideogram

140 크레딧

Ideogram v4 패밀리의 중간 티어로, 생성 속도와 출력 품질 사이의 균형을 맞췄습니다. Quality 티어보다 낮은 비용으로 강력한 타이포그래피와 포토리얼리즘을 제공합니다.

Ideogram v4 패밀리 내에서 속도와 품질의 균형을 갖춘 티어
자연어 prompt 사용 시 Magic Prompt 자동 향상
정밀하고 반복 가능한 제어를 위한 구조화된 json_prompt 입력
보통높음
자세히 보기

Ideogram V4 Quality

Ideogram

230 크레딧

Ideogram v4 모델 패밀리 중 가장 높은 충실도의 티어로, 최대한의 디테일과 사실적 표현, 정확한 타이포그래피에 최적화되어 있습니다. 속도보다 품질이 중요한 최종 프로덕션 에셋에 가장 적합합니다.

Ideogram v4 패밀리 내 가장 높은 충실도의 티어
자연어 prompt 사용 시 Magic Prompt 자동 향상
정밀하고 반복 가능한 제어를 위한 구조화된 json_prompt 입력
느림울트라
자세히 보기

Ideogram V4 Turbo

Ideogram

70 크레딧

Ideogram v4 패밀리에서 가장 빠르고 저렴한 모델로, Ideogram 특유의 텍스트 렌더링과 스타일 일관성을 유지하면서 빠른 반복 작업에 최적화되어 있습니다.

Ideogram v4 패밀리 중 가장 빠르고 저렴한 티어
자연어 prompt 사용 시 Magic Prompt 자동 향상
정밀하고 반복 가능한 제어를 위한 구조화된 json_prompt 입력
빠름표준
자세히 보기

Ideogram V3 Turbo

Ideogram

70 크레딧

Ideogram v3 중 가장 빠르고 저렴한 등급입니다. V3는 놀라운 사실감, 창의적인 디자인, 일관된 스타일의 이미지를 생성합니다.

Ideogram v3 중 가장 빠르고 저렴한 등급
종횡비 외에 60개 이상의 고정 해상도 프리셋 제공
image + mask를 통한 인페인팅 지원
빠름높음
자세히 보기

Ideogram Character

Ideogram

350 크레딧

레퍼런스 이미지 한 장으로 일관된 캐릭터를 생성하는 모델입니다. 실사부터 픽션까지 다양한 스타일로 동일 캐릭터를 렌더링하고, 마스크 인페인팅으로 기존 사진에 캐릭터를 삽입할 수 있으며, Ideogram 특유의 강점인 정확한 텍스트 렌더링까지 지원합니다.

레퍼런스 이미지 단 한 장으로 일관된 캐릭터 생성
Auto·Fiction·Realistic 캐릭터 스타일 타입
마스크 인페인팅으로 기존 이미지에 캐릭터 삽입
보통울트라
자세히 보기

MiniMax Image-01

MiniMax

23 크레딧

MiniMax의 첫 이미지 생성 모델로 캐릭터 레퍼런스를 지원합니다. subject_reference에 얼굴 사진 한 장만 넣으면 프롬프트·스타일·화면 비율이 바뀌어도 동일 인물을 일관되게 생성하며, 요청당 최대 9장까지 만들 수 있습니다.

subject_reference 얼굴 사진 한 장으로 캐릭터 일관성 유지
요청당 1~9장 배치 생성
정사각 1:1부터 시네마틱 21:9까지 8가지 화면 비율
빠름높음
자세히 보기

Topaz Image Upscale

Topaz Labs

190 크레딧

사진 향상의 업계 표준 Topaz Labs의 프로페셔널 업스케일러입니다. 5가지 특화 향상 모델, 최대 6배 확대, 피사체 감지, 얼굴 보정 옵션을 제공합니다.

업계 표준 Topaz 향상 품질
5가지 향상 모델: Standard / Low Resolution / CGI / High Fidelity / Text Refine
최대 6배 확대
보통울트라
자세히 보기

Imagen 4

Google

93 크레딧

Google의 플래그십 텍스트-이미지 모델인 Imagen 4입니다.

Google의 플래그십 Imagen 4 품질 등급
1K·2K 출력 해상도를 동일한 고정 요금으로 제공
조절 가능한 안전 필터 강도
보통울트라
자세히 보기

Imagen 4 Fast

Google

46 크레딧

최고 품질보다 속도와 비용이 중요할 때 사용하는 Imagen 4의 고속 버전입니다.

Imagen 4 계열 중 가장 저렴한 등급
빠른 반복 실험에 최적화된 생성 속도
조절 가능한 안전 필터 강도
빠름표준
자세히 보기

Bria Increase Resolution

Bria

93 크레딧

상업적으로 안전한 Bria의 이미지 업스케일러입니다 (13만+ 실행). 라이선스 데이터만으로 학습된 모델로 해상도를 2배 또는 4배 확대하며 알파(투명) 채널을 보존합니다. 법적 책임 보장이 필요한 기업 파이프라인을 위해 설계되었습니다.

라이선스 데이터만으로 학습 — 상업적으로 안전
2배 또는 4배 해상도 확대 (desired_increase)
알파 채널 보존 — 배경 제거 후 사용에 최적
빠름높음
자세히 보기

Krea 2 Large

Krea AI

140 크레딧

포토리얼리스틱한 결과물과 강력한 프롬프트 이행력에 초점을 맞춘 Krea AI의 플래그십 텍스트-투-이미지 모델입니다. 스타일 레퍼런스와 무드보드 기반 생성을 지원하여 일관된 비주얼 디렉션을 유지할 수 있습니다.

강력한 프롬프트 이행력을 갖춘 포토리얼리스틱 출력
최대 10장의 이미지로부터 스타일을 전이하고 강도를 조절 가능
Krea 웹앱 기반 무드보드 연동 생성
보통높음
자세히 보기

Krea 2 Medium

Krea AI

70 크레딧

Krea 2 Large의 저비용 버전으로, 동일한 포토리얼리즘 스타일에 집중하면서 일부 정밀도를 더 빠르고 저렴한 생성과 맞바꾼 모델입니다.

Krea 2 Large와 동일한 포토리얼리즘 스타일에 집중하면서 더 저렴하고 빠른 자매 모델
creativity 슬라이더(raw/low/medium/high)로 모델이 프롬프트에서 얼마나 벗어날지 조절
최대 10장의 스타일 참조 이미지로 결과물에 시각적 스타일 전달
빠름표준
자세히 보기

Microsoft MAI-Image 2.5 Pro

Microsoft

400 크레딧

Fal.AI를 통해 제공되는 Microsoft의 최상급 이미지 생성 모델로, 프로덕션급 텍스트-투-이미지 생성을 위해 설계되었습니다. 히어로 이미지, 정교한 구도, 정확한 텍스트 렌더링, 포토리얼리즘, 스타일화된 일러스트, 상업용 디자인, 비주얼이 풍부한 컨셉 작업에 적합합니다.

프로덕션 및 상업적 활용에 맞춘 고품질 출력
이미지 내 텍스트의 정확한 렌더링
한 번의 호출로 최대 4장까지 이미지 생성
보통울트라
자세히 보기

Moondream2

Moondream

5 크레딧

작지만 유능한 비전-언어 모델입니다 (1,400만+ 실행). 어떤 이미지든 자유롭게 질문하면 상세한 답변을 받습니다. 태깅·모더레이션 준비·풍부한 대체 텍스트용 고효율 VQA입니다.

이미지에 대한 자유 형식 질문
여러 문장의 상세한 답변
작은 모델 — 빠르고 저렴 (7크레딧)
빠름높음
자세히 보기

Multilingual E5 Large

E5

2 크레딧

다국어 텍스트 임베딩 모델입니다 (7,400만+ 실행). 한국어 포함 100개 언어에서 1024차원 벡터를 생성합니다. Core.Today 고객 데이터베이스의 벡터 검색(knn_vector)과 완벽하게 조합됩니다.

한국어 포함 100개 언어 1024차원 임베딩
호출당 여러 텍스트 배치 임베딩
정규화 임베딩 옵션 (코사인 유사도 바로 사용)
빠름높음
자세히 보기

Nano Banana 2 (Gemini 3.1 Flash Image)

Google

190 크레딧

Gemini 3.1 Flash Image 기반의 Google 고속 이미지 생성 모델입니다. Nano Banana Pro의 고효율 버전으로, Pro급 시각 품질을 Flash 속도와 가격으로 제공합니다. 대화형 편집, 다중 이미지 융합, 캐릭터 일관성, 정확한 텍스트 렌더링, Google 검색 연동을 지원합니다. 최대 14장의 참조 이미지와 4K 해상도를 지원합니다.

Gemini 3.1 Flash Image 기반 Pro급 품질 생성
다국어 정확한 텍스트 렌더링
Google 웹 검색 및 이미지 검색 연동
빠름울트라
자세히 보기

Nano Banana 2 Lite

Google

80 크레딧

Gemini 3.1 Flash Image 기반의 가볍고 빠른 Nano Banana 2 변형 모델로, 더 빠르고 저렴한 생성에 최적화되어 있습니다. 대화형 편집, 멀티 이미지 퓨전, 캐릭터 일관성 등 풀 버전 Nano Banana 2의 핵심 기능을 그대로 유지합니다.

풀 버전 Nano Banana 2보다 빠르고 저렴한 변형 모델
Gemini 3.1 Flash Image 기반
대화형 지시 기반 편집
빠름표준
자세히 보기

Nano Banana

Google

91 크레딧

멀티모달 편집 기능을 갖춘 Google Gemini 2.5 Flash 기반 이미지 생성 모델입니다. 생성과 편집 작업 모두에 빠르고 다재다능합니다.

Gemini 2.5 Flash 기반 생성
멀티모달 이미지 편집
빠른 생성 속도
빠름높음
자세히 보기

Nano Banana Pro (Gemini 3 Pro Image)

Google

350 크레딧

Gemini 3 Pro 기반의 Google 최첨단 이미지 생성 및 편집 모델입니다. 다국어 텍스트 렌더링, Google 검색을 통한 실시간 정보 연동, 전문가급 크리에이티브 제어 기능을 제공합니다. 최대 14장의 참조 이미지와 4K 해상도를 지원합니다.

Gemini 3 Pro 기반 고급 추론 생성
다국어 텍스트 렌더링 지원
Google 검색 연동 실시간 데이터 시각화
보통울트라
자세히 보기

NSFW Image Detection

Falcons.ai

1 크레딧

NSFW 이미지 분류의 표준입니다 (1억 2,700만+ 실행). 어떤 이미지든 'normal' 또는 'nsfw'로 판정합니다. UGC 플랫폼의 필수 모더레이션 게이트로, 이미지당 1크레딧입니다.

1억 2,700만+ 실행 — 모더레이션 표준
normal/nsfw 단순 판정 출력
이미지당 1크레딧 — 전체 업로드에 적용 가능
빠름높음
자세히 보기

Pruna P-Image

Pruna AI

12 크레딧

Pruna AI가 경량화(distilled)한 text-to-image 모델로, 매우 낮은 비용과 높은 처리량에 최적화되어 있습니다. 빠른 속도와 저렴한 가격 덕분에 Replicate에서 가장 많이 실행된 커뮤니티 모델 중 하나입니다(1,560만+ 실행).

매우 낮은 비용과 높은 처리량에 맞춰 조정된 경량화(distilled) 아키텍처
Replicate에서 가장 많이 실행된 커뮤니티 모델 중 하나(1,560만+ 실행)
aspect_ratio=custom 모드로 너비/높이를 직접 지정 가능(16의 배수, 최대 1440px)
빠름표준
자세히 보기

Pruna P-Image Upscale

Pruna AI

12 크레딧

최대 1억 2,800만 화소(128MP) 출력을 지원하는 PrunaAI의 하이엔드 이미지 업스케일러입니다 (57만+ 실행). 목표 메가픽셀 또는 배율 기반 제어, 디테일·리얼리즘 강화 옵션을 제공하며, 15크레딧부터 시작하는 메가픽셀 티어 과금을 사용합니다.

최대 128MP 출력 — 포스터·대형 인쇄 영역
두 가지 모드: 목표 메가픽셀(정밀 과금) 또는 배율(1-8배)
enhance_details·enhance_realism 강화 옵션
보통울트라
자세히 보기

PhotoMaker

Tencent ARC

10 크레딧

레퍼런스 사진 1-4장으로 인물의 스타일 사진을 생성합니다 (900만+ 실행). Cinematic, Disney Character, Digital Art 등 10가지 스타일 — 얼굴 정체성은 유지하고 나머지를 바꿉니다.

사진 1-4장으로 정체성을 유지한 생성
10가지 내장 스타일
프롬프트로 장면·의상 제어
보통높음
자세히 보기

PhotoMaker Style

Tencent ARC

15 크레딧

PhotoMaker의 스타일화 특화 버전: 인물 사진 1-4장을 더 강력한 스타일 트랜스퍼로 회화·코믹·3D 아트 등으로 변환합니다. 기본 PhotoMaker와 짝을 이루는 모델로, 사실감보다 스타일이 중요할 때 이 모델을 사용하세요.

기본 PhotoMaker보다 강력한 스타일 트랜스퍼
레퍼런스 사진 1-4장으로 정체성을 유지한 생성
Cinematic, Disney Character, Digital Art, Comic book 등 10가지 스타일 프리셋
보통높음
자세히 보기

Professional Headshot

Black Forest Labs

93 크레딧

FLUX.1 Kontext [pro] 기반으로 사진 한 장을 세련된 비즈니스 프로필 사진으로 변환합니다. 화이트·블랙·그레이·뉴트럴·오피스 배경 중 하나를 고르면 링크드인에 바로 쓸 수 있는 인물 사진이 한 번에 완성됩니다.

사진 한 장으로 스튜디오 없이 전문 프로필 사진 생성
비즈니스 인물 사진에 특화된 FLUX.1 Kontext [pro] 앱
화이트·블랙·뉴트럴·그레이·오피스 5가지 배경 프리셋
빠름높음
자세히 보기

Proteus v0.2

Proteus

35 크레딧

인기 애니메이션 특화 이미지 모델입니다 (1,200만+ 실행). 고품질 애니메·일러스트 스타일과 img2img·인페인팅을 지원합니다. 애니메 아바타·웹툰풍 아트의 대표 선택지입니다.

애니메·일러스트 특화
img2img·마스크 인페인팅
실행당 최대 4장 (이미지당 과금)
보통높음
자세히 보기

PuLID

ByteDance

6 크레딧

ByteDance PuLID: SDXL 기반의 튜닝 없는 정체성 커스터마이징 모델입니다. 얼굴 사진 한 장과 프롬프트만으로 어떤 장면·스타일의 인물 사진도 생성 — 별도 학습 없이 4스텝 고속 샘플링, 두 얼굴 혼합까지 지원합니다. 이미지당 2크레딧의 압도적인 가성비가 강점입니다.

얼굴 사진 한 장으로 학습 없이 정체성 보존
SDXL 기반 4스텝 초고속 샘플링
mix_identities: 서로 다른 두 얼굴을 한 인물로 혼합
빠름높음
자세히 보기

Real-ESRGAN

Real-ESRGAN

5 크레딧

가장 널리 쓰이는 클래식 이미지 업스케일러입니다 (9,400만+ 실행). 최대 10배 Real-ESRGAN 초해상도와 GFPGAN 얼굴 보정 옵션을 제공하는, 사진·AI 이미지 확대의 표준 모델입니다.

검증된 업스케일러 (9,400만+ 실행)
최대 10배 확대
GFPGAN 얼굴 보정 옵션
빠름높음
자세히 보기

Recraft V4

Recraft

93 크레딧

Recraft의 차세대 text-to-image 모델로, V3 대비 타이포그래피 처리, 스타일 범위, 프롬프트 반영도를 개선하여 프로덕션급 브랜드·디자인 에셋 제작에 적합합니다.

Recraft V3 대비 향상된 타이포그래피 처리
더 넓은 스타일 범위와 강화된 프롬프트 반영도
최대 10,000자의 긴 프롬프트 지원
보통높음
자세히 보기

Recraft V4 SVG

Recraft

190 크레딧

Recraft V4를 기반으로 SVG 형식의 벡터 그래픽을 직접 생성합니다. 로고, 아이콘 등 어떤 크기에서도 선명함을 유지해야 하는 확장 가능한 일러스트에 적합합니다.

래스터 이미지가 아닌 진짜 벡터 그래픽으로, SVG를 직접 출력
Recraft V4 기반으로 향상된 타이포그래피와 프롬프트 반영도
어떤 크기로 확대해도 선명함을 유지해야 하는 에셋에 적합
보통높음
자세히 보기

Recraft V3

Recraft

93 크레딧

Recraft V3(코드명 red_panda)는 긴 텍스트 생성이 가능하고 폭넓은 스타일을 지원하는 텍스트-이미지 모델입니다. Artificial Analysis Text-to-Image Benchmark 기준 SOTA 성능을 보유하고 있습니다.

텍스트-이미지 모델 중 벤치마크 최고 수준 성능
길고 정확한 이미지 내 텍스트 렌더링
사실적인 사진부터 디지털 일러스트까지 19가지 큐레이션 스타일
보통높음
자세히 보기

Recraft Crisp Upscale

Recraft

14 크레딧

선명하고 또렷한 결과에 최적화된 Recraft의 빠르고 저렴한 업스케일러입니다. 이미지 하나만 넣으면 튜닝 없이 동작합니다. UI 에셋, 일러스트, 상품 이미지의 기본 선택지로 좋습니다.

선명함에 최적화된 크리스프 업스케일
튜닝 없는 단일 입력 API
빠른 처리 속도
빠름높음
자세히 보기

Remove Background

Bria AI

32 크레딧

AI 기반 이미지 배경 제거 도구입니다. 전문적인 수준의 엣지 감지로 모든 피사체에 대해 깔끔하고 정확한 컷아웃을 제공합니다.

정밀한 엣지 감지
깔끔한 배경 제거
모든 피사체 유형에 적용 가능
빠름높음
자세히 보기

Remove BG

lucataco

1 크레딧

Replicate 최다 실행 배경 제거 모델 중 하나입니다 (1,700만+ 실행). 파라미터 하나로 배경을 제거하고 투명 PNG를 반환하는 초간단 API — 이미지당 1크레딧으로 플랫폼에서 가장 저렴한 누끼입니다.

1,700만+ 실행 — 대규모로 검증된 안정성
파라미터는 이미지 하나뿐
투명 PNG 출력
빠름표준
자세히 보기

Stable Diffusion XL

Stability AI

9 크레딧

Stability AI의 클래식 SDXL입니다 (8,500만+ 실행). img2img, 인페인팅, 리파이너, LoRA를 지원하는 검증된 텍스트-이미지 모델로, 방대한 생태계를 가진 믿을 수 있는 워크호스입니다.

검증된 클래식 (8,500만+ 실행)
img2img·마스크 인페인팅
expert-ensemble 리파이너 지원
보통높음
자세히 보기

SDXL Lightning 4-step

ByteDance

4 크레딧

Replicate 역대 최다 실행 모델인 ByteDance의 4스텝 SDXL Lightning입니다 (10억+ 실행). 1024px 이미지를 거의 즉시, 카탈로그 최저가 수준으로 생성합니다.

10억+ 실행 — Replicate 역대 최다 실행 모델
4스텝 생성으로 거의 즉각적인 결과
최대 1280px 출력, 요청당 최대 4장
빠름표준
자세히 보기

Seedream 5 Lite

ByteDance

82 크레딧

Seedream 5.0 lite는 논리 추론, 예시 기반 편집, 전문 도메인 지식을 갖춘 이미지 생성 모델입니다. 최대 14장의 멀티 레퍼런스 생성과 연속 배치 생성을 지원합니다.

예시 기반 편집 — before/after 쌍을 보여주면 같은 변형을 새 이미지에 적용
공간 관계·물리·과정을 이해하는 논리 추론
건축·과학·의료·디자인 전반의 전문 도메인 지식
빠름높음
자세히 보기

Seedream 5 Pro

ByteDance

210 크레딧

바이트댄스의 플래그십 Seedream 5.0 Pro 이미지 생성 모델로, 내장 추론과 정밀한 지시 이행, 최대 10장의 멀티 레퍼런스 생성을 지원합니다. Seedream 5 Lite보다 높은 충실도의 1K/2K 해상도 출력을 제공합니다.

정밀한 지시 이행을 위한 내장 추론 능력
최대 10장의 입력 이미지를 활용한 멀티 레퍼런스 생성
1K/2K 해상도 출력 지원
보통울트라
자세히 보기

Seedream 4.5

ByteDance

90 크레딧

공간 이해력과 세계 지식이 강화된 ByteDance의 업그레이드 이미지 모델입니다. 단일/다중 참조 이미지 편집과 순차(다중 이미지) 생성을 지원합니다.

강력한 공간 이해력과 세계 지식
다중 참조 이미지-이미지 생성 (최대 14개 입력 이미지)
한 번의 호출로 최대 15개의 연관 이미지를 생성하는 순차 생성 모드
보통울트라
자세히 보기

Seedream 4.0

ByteDance

70 크레딧

뛰어난 프롬프트 이해력과 창의적 능력을 갖춘 ByteDance의 최신 이미지 생성 모델입니다.

고급 언어 이해
창의적 구성
뛰어난 텍스트 렌더링
보통높음
자세히 보기

Text Extract OCR

OCR

1 크레딧

가장 많이 쓰이는 심플 OCR입니다 (9,100만+ 실행). 이미지 하나를 넣으면 텍스트를 plain text로 반환합니다. 영수증·스크린샷·스캔 문서 처리의 기본 선택지로, 단 1크레딧입니다.

입력 하나, plain text 출력
9,100만+ 실행으로 검증됨
이미지당 1크레딧 — 대량 처리에 최적
빠름표준
자세히 보기

TRELLIS

Microsoft

77 크레딧

Microsoft의 TRELLIS 이미지→3D 모델입니다 (83만+ 실행, Replicate 최다 사용 3D 모델). 이미지 1장 이상으로 텍스처가 입혀진 GLB 3D 에셋을 만들고, 턴테이블 렌더 영상과 Gaussian PLY도 출력할 수 있습니다.

Replicate 최다 사용 3D 모델
이미지 1장 또는 여러 장 입력
텍스처 GLB 내보내기 (generate_model)
보통높음
자세히 보기

Google Upscaler

Google

46 크레딧

Google의 이미지 업스케일러입니다 (77만+ 실행). 생성형 AI로 자연스러운 디테일을 유지하며 이미지를 2배 또는 4배 확대하고, 출력 압축 품질을 조절할 수 있습니다. 고정 가격의 간결하고 신뢰할 수 있는 업스케일러입니다.

생성형 디테일 보존과 함께 2배·4배 업스케일
Google 수준의 품질과 일관성
출력 압축 품질 조절 (1-100)
빠름높음
자세히 보기

Z-Image Turbo

Pruna AI

40 크레딧

Pruna의 초고속 Z-Image Turbo입니다 (4,800만+ 실행). 최대 2048x2048까지 메가픽셀 단위로 과금되어 생성한 해상도만큼만 지불합니다. 대량 사용에 뛰어난 가성비를 제공합니다.

8스텝 초고속 터보 생성
메가픽셀 과금 — 생성한 만큼만 지불
최대 2048x2048 출력
빠름높음
자세히 보기

비디오 생성 모델

Kling, MiniMax 등 최신 모델로 AI 비디오를 제작하세요

Add Watermark

추천

FullJourney

1 크레딧

어떤 영상에든 텍스트 워터마크를 추가합니다. 생성 콘텐츠나 사용자 콘텐츠의 브랜드 보호를 영상당 2크레딧으로 간단하고 빠르게 처리합니다.

어떤 영상에든 텍스트 워터마크
크기 조절
영상당 2크레딧
빠름표준
자세히 보기

CogVLM2 Video

CogVLM

28 크레딧

비디오 이해·캡셔닝 모델입니다. 영상에 대해 자유롭게 질문하면 동작·장면·내용에 대한 상세한 답변을 받습니다. 비디오 검색 인덱싱과 모더레이션 준비에 유용합니다.

비디오 내용에 대한 자유 질문
동작·장면 이해
여러 문장의 상세한 답변
보통높음
자세히 보기

Google Gemini Omni Flash

Google

2320 크레딧

Fal.AI를 통해 제공되는 Google Gemini Omni Flash 텍스트-투-비디오 모델입니다. 서술형 텍스트 프롬프트만으로 영상을 생성하며, 페이싱과 오디오(대사, 배경음악)도 프롬프트 안에서 직접 제어합니다. 16:9 또는 9:16 화면비로 3~10초 길이의 영상을 만들 수 있습니다.

단일 서술형 프롬프트만으로 텍스트-투-비디오 생성
대사와 배경음악을 프롬프트 텍스트 안에서 직접 제어 (별도의 오디오 토글 없음)
16:9(가로) 또는 9:16(세로) 화면비 지원
빠름높음
자세히 보기

Gen-4.5

Runway

1400 크레딧

Runway의 Gen-4.5 모델로, 텍스트-비디오 및 이미지-비디오 생성에서 최고 수준의 모션 품질, 프롬프트 반영도, 비주얼 퀄리티를 제공합니다.

최고 수준의 모션 품질과 프롬프트 반영도
화면 비율과 무관한 균일 초당 과금
선택적 첫 프레임 이미지를 활용한 텍스트-비디오·이미지-비디오 지원
보통울트라
자세히 보기

Grok Imagine Video 1.5

xAI

930 크레딧

xAI의 Grok Imagine Video 1.5 프리뷰: 동기화 오디오를 갖춘 이미지-비디오 생성 모델입니다. Grok Imagine Video의 업그레이드 버전으로, 해상도와 무관한 단일 초당 요금이 특징입니다.

동기화 오디오가 포함된 이미지-비디오 애니메이션
xAI Grok Imagine Video의 업그레이드된 1.5 프리뷰
1~15초의 유연한 길이, 초당 과금
보통높음
자세히 보기

Grok Imagine Video

xAI

580 크레딧

xAI의 Grok Imagine Video 모델로 비디오를 생성합니다. 텍스트-비디오, 이미지-비디오 변환, 그리고 기존 짧은 비디오 클립 편집을 지원합니다.

해상도·화면비와 무관한 균일한 초당 과금
텍스트-비디오 및 이미지-비디오 생성 지원
비디오 편집 모드 — 기존 짧은 클립(최대 8.7초)을 프롬프트로 수정
빠름높음
자세히 보기

MiniMax Hailuo 2.3

MiniMax

650 크레딧

고급 캐릭터 일관성과 자연스러운 움직임을 갖춘 사실적인 인물 모션 비디오 생성 모델입니다.

사실적인 인물 모션
고급 캐릭터 일관성
자연스러운 움직임 생성
느림울트라
자세히 보기

MiniMax Hailuo 2.3 Fast

MiniMax

450 크레딧

인물 모션 비디오의 좋은 품질을 유지하면서 더 빠른 생성을 위해 최적화된 Hailuo 2.3의 저지연 버전입니다.

Hailuo 2.3보다 빠른 생성 속도
좋은 인물 모션 품질
캐릭터 일관성
보통높음
자세히 보기

Happy Horse 1.1

Alibaba

2090 크레딧

알리바바의 Happy Horse 1.1은 텍스트로 비디오를 생성하고, 단일 이미지를 애니메이션화하며, 여러 레퍼런스 이미지로부터 비디오를 만들어냅니다. 720p·1080p 해상도, 3~15초 길이, 5가지 화면 비율을 지원합니다.

하나의 모델로 3가지 모드: 텍스트-비디오, 이미지-비디오, 레퍼런스-비디오
최대 9장의 이미지를 활용한 레퍼런스-비디오 — 피사체와 장면의 일관성 유지
720p·1080p 해상도, 3~15초 길이
보통높음
자세히 보기

MiniMax Hailuo-03 (H3) Image to Video

MiniMax

3020 크레딧

Fal.AI를 통해 제공되는 MiniMax Hailuo-03(H3) 이미지-투-비디오 모델입니다. 첫 프레임 이미지를 기반으로 2K 해상도의 5~15초 영상을 생성하며, 네이티브 오디오와 end_image_url을 이용한 첫-마지막 키프레임 제어를 지원합니다.

단일 첫 프레임 이미지로부터 바로 영상 생성
최대 2K 해상도 출력
5~15초 범위에서 길이 조절 가능
보통울트라
자세히 보기

Kling v3 Omni Video

Kuaishou

2610 크레딧

Kling Video 3.0 Omni는 텍스트, 이미지, 레퍼런스 이미지, 기존 비디오로부터 영상을 생성·편집하는 통합 멀티모달 비디오 모델입니다. 텍스트-비디오, 이미지-비디오, 레퍼런스 기반 생성, 비디오 편집을 네이티브 오디오와 멀티샷 제어로 하나의 모델에 통합했습니다.

3단계 품질: standard(720p), pro(1080p, 기본값), 4k
최대 7장의 레퍼런스 이미지로 캐릭터·스타일 일관성 유지한 생성
reference_video + video_reference_type=base로 비디오 편집 모드
느림울트라
자세히 보기

Kling v3 Video

Kuaishou

2610 크레딧

Kling Video 3.0은 최대 15초의 시네마틱 비디오를 생성하는 Kuaishou의 플래그십 텍스트/이미지-비디오 모델입니다. 멀티샷 제어, 네이티브 오디오, 시작/종료 프레임 이미지, 전용 4K 모드를 지원합니다.

최대 15초(3~15초)의 시네마틱 비디오 생성
3단계 품질: standard(720p), pro(1080p, 기본값), 4k
multi_prompt로 한 번의 생성에서 최대 6개의 연속 샷 제어
느림울트라
자세히 보기

Kling v2.6

Kuaishou

1630 크레딧

Kling 2.6 Pro: 시네마틱한 비주얼과 유려한 움직임, 네이티브 오디오 생성을 지원하는 최상위 이미지-비디오 모델입니다. 오디오 생성은 기본적으로 켜져 있습니다.

유려하고 자연스러운 움직임의 시네마틱 비주얼 품질
기본적으로 켜져 있는 네이티브 동기화 오디오 생성
5초 또는 10초 길이 선택
보통울트라
자세히 보기

Kling 2.5 Turbo Pro

Kuaishou

810 크레딧

향상된 모션과 장면 일관성을 갖춘 시네마틱급 비디오 생성 모델입니다. 프로페셔널 출력을 위한 최상위 Kling 모델입니다.

시네마틱급 출력 품질
향상된 모션 일관성
우수한 장면 일관성
보통울트라
자세히 보기

Kling v2.1

Kuaishou

580 크레딧

720p/1080p 지원과 프레임 전환 기능을 갖춘 Kling v2.1로, 부드럽고 고품질의 비디오를 생성합니다.

720p 및 1080p 출력 지원
부드러운 프레임 전환
이미지-비디오 변환 기능
느림울트라
자세히 보기

LatentSync

ByteDance

220 크레딧

ByteDance의 오픈소스 립싱크 모델입니다. 잠재 확산(latent diffusion)으로 영상의 입 모양을 어떤 오디오에든 다시 동기화합니다. 더빙·현지화를 위한 오픈소스 최고 수준의 립싱크 품질입니다.

영상 + 오디오 → 립싱크된 영상
오픈소스 최고 수준 립싱크
잠재 확산 기반 입 모양 재생성
느림높음
자세히 보기

MMAudio

MMAudio

11 크레딧

어떤 영상에든 AI 사운드를 입힙니다 (500만+ 실행). 영상 내용과 텍스트 프롬프트로 동기화된 오디오(앰비언스·효과음·폴리)를 합성합니다. 무음인 AI 생성 클립의 마무리에 완벽합니다.

영상과 동기화된 오디오 합성
사운드 방향을 지시하는 프롬프트 (선택)
네거티브 프롬프트 (기본값은 음악 제외)
보통높음
자세히 보기

Pruna P-Video

Pruna AI

240 크레딧

빠른 시안 작업을 위한 드래프트 모드를 내장한 PrunaAI의 고속 비디오 생성 모델입니다. 텍스트-비디오, 이미지-비디오, 오디오 조건 생성을 단일 엔드포인트로 지원하며, 최대 20초 클립 생성이 가능해 플랫폼에서 가장 긴 길이를 지원하는 모델 중 하나입니다.

내장 드래프트 모드: 표준 가격의 약 4분의 1로 저품질 미리보기 생성
단일 엔드포인트에서 텍스트-비디오와 이미지-비디오 모두 지원 (image 파라미터)
flac/mp3/wav 오디오 입력으로 비디오 생성 조건화 가능
빠름표준
자세히 보기

Pruna P-Video Avatar

Pruna AI

870 크레딧

Pruna AI의 토킹 아바타 비디오 모델입니다 — 하나의 입력 이미지를 애니메이션화하여 제공된 텍스트(voice_script)나 업로드된 오디오 트랙을 말하게 하며, Gemini 계열의 선택형 프리셋 보이스, 언어, 시각적 연출 프롬프트를 지원합니다.

단일 입력 이미지로부터 토킹 아바타 애니메이션 생성
29종의 Gemini 계열 프리셋 보이스를 통한 텍스트-음성 변환, 또는 업로드된 오디오 트랙으로 발화 구동
10개 언어 보이스 선택과 voice_prompt를 통한 전달 방식 조정
보통높음
자세히 보기

PixVerse V6

PixVerse

810 크레딧

PixVerse의 플래그십 비디오 생성 모델입니다. 동기화 오디오, 장면 전환이 있는 멀티샷 시퀀스, 놀라운 물리 표현, 정밀한 카메라 제어를 갖춘 시네마틱 비디오를 최대 1080p로 생성합니다.

동기화 AI 오디오: 배경음악, 효과음, 캐릭터 대사
generate_multi_clip_switch로 장면 전환이 있는 멀티샷 생성
놀랍도록 사실적인 물리 표현과 정밀한 카메라 제어
보통높음
자세히 보기

PixVerse V5

PixVerse

24 크레딧

특수 효과 기능과 애니메이션 최적화 출력을 갖춘 고급 비디오 생성 모델로, 다양한 시각적 스타일을 지원합니다.

특수 효과 기능
애니메이션 최적화 출력
다양한 시각적 스타일 (실사, 애니메, 3D)
느림울트라
자세히 보기

Luma Ray 3.2

Luma

1740 크레딧

Luma의 플래그십 Ray 비디오 모델입니다. 텍스트-비디오 및 키프레임(시작/종료 이미지) 생성을 지원하며, 선택적으로 HDR 인코딩 출력과 전문가용 EXR 익스포트를 제공합니다.

세밀한 프롬프트 제어가 가능한 플래그십 텍스트-비디오 생성
시작/종료 이미지로 첫/마지막 프레임을 고정하는 키프레임 모드
더 넓은 다이내믹 레인지를 위한 HDR 인코딩 MP4 출력
보통울트라
자세히 보기

Luma Ray Flash 2 720p

Luma

700 크레딧

Luma의 Ray Flash 2는 Ray 2보다 빠르고 저렴하게 5초 또는 9초의 720p 비디오를 생성합니다. 시작·종료 이미지를 통한 키프레임 제어, 매끄러운 루프 옵션, 풍부한 카메라 모션 콘셉트 라이브러리를 지원하며, 플랫폼에 처음 추가된 Luma 모델입니다.

720p 출력 기준 Ray 2보다 빠르고 저렴
키프레임 제어: 첫 프레임(start_image)과 마지막 프레임(end_image) 고정 가능
끊김 없이 반복 재생되는 루프 옵션
빠름높음
자세히 보기

Real-ESRGAN Video

Real-ESRGAN

1280 크레딧

Real-ESRGAN 기반 비디오 업스케일링입니다. 프레임 단위로 영상을 FHD·2K·4K로 향상합니다. 오래된 영상과 AI 생성 클립을 위한 대표적인 오픈소스 비디오 업스케일러입니다.

FHD / 2K / 4K 업스케일
애니메이션 특화 포함 3가지 모델 변형
프레임 단위 향상
느림높음
자세히 보기

SadTalker

SadTalker

91 크레딧

사진 한 장과 오디오로 토킹헤드 영상을 만듭니다. 자연스러운 머리 움직임과 눈 깜빡임으로 얼굴을 애니메이션하며, GFPGAN 얼굴 향상 옵션을 제공합니다.

사진 1장 + 오디오 → 토킹헤드 영상
자연스러운 머리 움직임과 눈 깜빡임
미세한 움직임의 still 모드
느림높음
자세히 보기

Seedance 2.0

ByteDance

2090 크레딧

네이티브 동기화 오디오를 갖춘 ByteDance의 차세대 멀티모달 비디오 모델입니다. 최대 9장의 레퍼런스 이미지, 3개의 비디오, 3개의 오디오를 한 번의 생성에 조합하여 캐릭터 일관성과 립싱크를 유지하는 비디오 생성·편집·확장을 지원합니다.

네이티브 오디오 생성 — 대사, 효과음, 배경음악이 영상과 동기화
멀티모달 레퍼런스 입력: 이미지 9장, 비디오 3개, 오디오 3개까지 한 번에
레퍼런스 이미지 기반 샷 간 캐릭터 일관성 유지
보통울트라
자세히 보기

Seedance 2.0 Fast

ByteDance

1750 크레딧

Seedance 2.0의 더 빠르고 저렴한 변형 모델로, 최대 9장의 이미지·3개의 비디오·3개의 오디오 레퍼런스 입력과 네이티브 오디오를 480p 또는 720p로 지원합니다.

Seedance 2.0보다 빠르고 저렴한 대안 (480p/720p만 지원, 1080p/4K 없음)
대사·효과음·배경음악을 포함한 네이티브 오디오 생성
멀티모달 레퍼런스 입력: 이미지 9장, 비디오 3개, 오디오 3개까지
빠름높음
자세히 보기

Seedance 2.0 Mini

ByteDance

1280 크레딧

ByteDance Seedance 2.0의 경량·저비용 버전입니다. 네이티브 오디오, 멀티모달 레퍼런스 입력(이미지/비디오/오디오), 텍스트-비디오 및 이미지-비디오 생성을 지원하며 최대 720p까지 제공합니다(1080p/4K 티어 없음).

대사, 효과음, 배경음악을 포함한 네이티브 동기화 오디오 생성
최대 9개 레퍼런스 이미지, 3개 레퍼런스 비디오, 3개 레퍼런스 오디오를 지원하는 멀티모달 입력
텍스트-비디오 및 이미지-비디오(첫/마지막 프레임) 생성
빠름표준
자세히 보기

Seedance 1 Lite

ByteDance

420 크레딧

ByteDance의 경량 비디오 생성 모델로, 텍스트-비디오 및 이미지-비디오 변환을 4~12초 길이, 480p·720p·1080p 해상도로 지원합니다.

텍스트-비디오와 이미지-비디오 생성을 하나의 모델로 지원
4~12초 길이 범위, 초당 과금
480p / 720p / 1080p 해상도 선택 가능
빠름표준
자세히 보기

Seedance 1 Pro

ByteDance

700 크레딧

Seedance의 프로 버전으로, 2~12초 길이의 텍스트-비디오·이미지-비디오 변환을 480p·720p·1080p 해상도로 지원합니다.

Seedance 1 Lite보다 높은 품질, 최대 1080p 출력 지원
텍스트-비디오와 이미지-비디오 생성을 하나의 모델로 지원
2~12초 길이 범위, 초당 과금
보통울트라
자세히 보기

Seedance 1 Pro Fast

ByteDance

290 크레딧

빠른 생성 속도와 프로페셔널 출력 품질을 갖춘 ByteDance의 시네마틱 비디오 생성 모델입니다.

빠른 생성 속도
프로페셔널 출력 품질
시네마틱 비디오 생성
빠름높음
자세히 보기

OpenAI Sora 2

OpenAI

930 크레딧

사실적인 물리 시뮬레이션과 오디오 생성 기능을 갖춘 OpenAI의 비디오 생성 모델로, 높은 일관성의 비디오를 생성합니다.

사실적인 물리 시뮬레이션
오디오 생성 지원
최대 20초 비디오
느림울트라
자세히 보기

OpenAI Sora 2 Pro

OpenAI

2790 크레딧

OpenAI의 가장 진보한 동기화 오디오 비디오 생성 모델입니다. Sora 2의 프리미엄 등급으로 더 높은 충실도와 최대 1024p 해상도, 레퍼런스 프레임을 통한 이미지-비디오를 지원합니다.

네이티브 동기화 오디오를 갖춘 OpenAI의 가장 진보한 비디오 모델
Sora 2의 프리미엄 등급 — 더 높은 충실도와 디테일
2단계 해상도: standard(720p), high(1024p)
느림울트라
자세히 보기

MiniMax Hailuo-03 (H3) Text to Video

MiniMax

3020 크레딧

Fal.AI를 통해 제공되는 MiniMax Hailuo-03(H3) 텍스트-비디오 모델입니다. 텍스트 프롬프트로부터 최신 수준의 2K 비디오를 생성하며, 5-15초 길이, 네이티브 오디오, 21:9부터 9:16까지 폭넓은 화면 비율을 지원합니다.

최신 수준의 2K 해상도 텍스트-비디오 생성
비디오와 함께 생성되는 네이티브 오디오
5-15초 범위의 조절 가능한 길이
보통울트라
자세히 보기

Veed Lipsync v2

Veed

2440 크레딧

Fal.AI를 통해 제공되는 Veed Lipsync v2 모델입니다. 원본 영상의 입 모양을 새로운 오디오 트랙에 맞춰 재구성합니다 — 원본 영상과 새 오디오 트랙만 있으면 입 모양이 자연스럽게 동기화된 결과 영상을 생성합니다.

원본 영상의 입 모양을 새로운 오디오 트랙에 맞춰 재동기화
임의의 원본 영상 + 오디오 트랙 조합에 사용 가능
출력 영상 길이는 입력 영상/오디오에 자동으로 맞춰짐
보통높음
자세히 보기

Google Veo 3.1

Google

7440 크레딧

내장 오디오 생성 기능을 갖춘 Google의 최첨단 비디오 생성 모델로, 동기화된 사운드와 함께 시네마틱 품질의 비디오를 생성합니다.

내장 오디오 생성
시네마틱 품질 출력
시작 프레임을 활용한 이미지-비디오 변환
느림울트라
자세히 보기

Google Veo 3.1 Fast

Google

2790 크레딧

오디오 생성 기능을 갖춘 Veo 3.1의 고속 버전으로, 높은 품질을 유지하면서 속도에 최적화되었습니다.

Veo 3.1보다 빠른 생성 속도
내장 오디오 생성
고품질 출력
보통높음
자세히 보기

Video Utils

FFmpeg

5 크레딧

FFmpeg 기반 비디오 유틸리티입니다 (2,000만+ 실행). task 파라미터 하나로 mp4/gif 변환, mp3 오디오 추출, 프레임 zip 추출을 처리합니다. 미디어 파이프라인의 맥가이버 칼입니다.

어떤 영상이든 mp4/gif로 변환
오디오를 mp3로 추출
프레임을 zip으로 추출 (fps 제어)
빠름표준
자세히 보기

Wan 2.7 I2V

Alibaba

1740 크레딧

Alibaba Wan 2.7 이미지-비디오 모델입니다. 첫 프레임(및 선택적 마지막 프레임 또는 연속 클립)을 애니메이션화하며 오디오 동기화를 지원하고, 최대 15초까지 720p 또는 1080p로 생성됩니다.

첫 프레임 이미지를 애니메이션화하는 이미지-비디오 생성
선택적 마지막 프레임 지정 또는 기존 비디오 클립 이어가기
음성 및 음악을 위한 오디오 동기화(자동 생성 또는 사용자 제공)
보통높음
자세히 보기

Wan 2.7 T2V

Alibaba

1740 크레딧

Alibaba Wan 2.7 텍스트-비디오 모델입니다. 최대 15초 길이, 음성/음악 오디오 동기화, 다국어 프롬프트, 프롬프트 확장을 지원하며 720p 또는 1080p로 생성됩니다.

최대 15초 길이의 텍스트-비디오 생성
음성 및 음악을 위한 오디오 동기화(자동 생성 또는 사용자 제공)
다국어 프롬프트 지원
보통높음
자세히 보기

Wan 2.5 I2V

Alibaba

1160 크레딧

립싱크 지원이 포함된 이미지-비디오 모델로, 정지 이미지를 자연스러운 모션의 사실적인 비디오로 변환합니다.

이미지-비디오 애니메이션
립싱크 지원
정지 이미지로부터 자연스러운 모션
느림울트라
자세히 보기

Wan 2.5 I2V Fast

Alibaba

790 크레딧

Wan 2.5의 고속 이미지-비디오 변형으로, 정지 이미지로부터 빠르게 애니메이션 비디오를 생성합니다.

Wan 2.5 I2V보다 빠른 생성 속도
이미지-비디오 애니메이션
좋은 모션 품질
보통높음
자세히 보기

Wan 2.5 T2V

Alibaba

2320 크레딧

오디오 동기화 지원이 포함된 텍스트-비디오 모델로, 자연스러운 모션과 함께 텍스트 프롬프트로부터 고품질 비디오를 생성합니다.

고품질 텍스트-비디오 생성
오디오 동기화 지원
자연스러운 모션 합성
느림울트라
자세히 보기

Wan 2.5 T2V Fast

Alibaba

790 크레딧

Wan 2.5의 고속 텍스트-비디오 생성 변형으로, 좋은 품질의 출력을 유지하면서 속도에 최적화되었습니다.

Wan 2.5 T2V보다 빠른 생성 속도
좋은 품질의 텍스트-비디오
오디오 동기화 지원
보통높음
자세히 보기

Wan 2.2 I2V Fast

Alibaba

260 크레딧

Alibaba의 Wan 2.2 A14B 이미지-비디오 모델을 PrunaAI가 최적화해 매우 빠르고 저렴하게 만든 버전입니다. 정지 이미지 한 장과 프롬프트만으로 480p 또는 720p의 짧은 애니메이션 클립을 생성하며, 더 부드러운 움직임을 위한 프레임 보간 옵션도 제공합니다.

PrunaAI 최적화 추론 — 기본 Wan 2.2 대비 빠르고 저렴
마지막 프레임 조건화를 지원하는 이미지-비디오 변환으로 더 자연스러운 전환 가능
ffmpeg 기반 30FPS 프레임 보간 옵션으로 더 매끄러운 움직임 구현
빠름표준
자세히 보기

Wan 2.2 T2V Fast

Alibaba

240 크레딧

Alibaba의 Wan 2.2 A14B 텍스트-비디오 모델을 PrunaAI가 최적화해 매우 빠르고 저렴하게 만든 버전입니다. 텍스트 프롬프트만으로 480p 또는 720p의 짧은 클립을 생성하며, 30FPS 프레임 보간이 기본으로 켜져 있습니다. 이미 플랫폼에 있는 Wan 2.2 I2V Fast의 텍스트-비디오 버전입니다.

PrunaAI 최적화 추론 — 기본 Wan 2.2 대비 빠르고 저렴
참조 이미지 없이 프롬프트만으로 생성하는 순수 텍스트-비디오
ffmpeg 기반 30FPS 프레임 보간이 기본으로 켜져 있어 매끄러운 움직임 구현
빠름표준
자세히 보기

오디오 & TTS 모델

Text-to-Speech, 음성 클론, 오디오 생성

Bark

추천

Suno

190 크레딧

Suno의 텍스트 프롬프트 생성 오디오 모델입니다. [laughs]·[sighs] 같은 비언어 사운드가 포함된 음성은 물론 음악·효과음까지 생성하며, 13개 언어의 100개 이상 화자 프리셋을 제공합니다. 오디오와 함께 음성 연속성을 위한 .npz 히스토리 파일도 반환할 수 있습니다.

비언어 사운드가 있는 음성: [laughs], [sighs], [gasps]
음표(♪)를 활용한 노래·효과음 생성
13개 언어 131개 화자 프리셋
느림표준
자세히 보기

Chatterbox

Resemble AI

59 크레딧

고유한 감정 과장(exaggeration) 제어와 짧은 레퍼런스 오디오 기반 즉시 음성 복제를 갖춘 Resemble AI의 프로덕션급 오픈소스 TTS입니다. MIT 라이선스로 주요 상용 시스템과 비교 벤치마크된 모델입니다.

고유한 감정 과장(exaggeration) 제어
짧은 오디오로 즉시 음성 복제
프로덕션급 오픈소스 품질
빠름높음
자세히 보기

Chatterbox Multilingual

Resemble AI

7 크레딧

23개 언어를 지원하는 Chatterbox 오픈소스 TTS입니다. 즉시 음성 복제와 감정 과장 제어를 제공합니다. 요청당 최대 300자.

한국어 포함 23개 언어 지원
짧은 오디오로 즉시 음성 복제
감정 과장 제어
빠름높음
자세히 보기

Chatterbox Turbo

Resemble AI

59 크레딧

품질 저하 없이 가장 빠른 Resemble AI 오픈소스 TTS입니다. 20개 프리셋 음성, [sigh]·[chuckle] 같은 준언어 태그, 5초 이상 레퍼런스 오디오로 즉시 음성 복제를 지원합니다. 요청당 최대 500자.

오픈소스 최고 속도의 TTS 품질
준언어 태그: [sigh], [chuckle], [cough], [clear throat]
20개 프리셋 음성
빠름높음
자세히 보기

Gemini 3.1 Flash TTS

Google

299 크레딧

Replicate를 통해 제공되는 Google Gemini 3.1 Flash 네이티브 오디오 TTS입니다. 실제 발화 텍스트와 별도의 스타일 지시문, 30종의 프리셋 음성, 40개 이상의 언어/로케일 코드를 지원하며, [sigh], [whispering], [shouting] 등 인라인 마크업 태그로 감정 표현이 가능합니다.

Gemini 3.1 Flash 기반 네이티브 오디오 TTS
실제 발화 텍스트와 분리된 스타일 지시문(prompt) 필드
30종의 프리셋 음성
빠름높음
자세히 보기

Incredibly Fast Whisper

Whisper

10 크레딧

속도에 최적화된 Whisper large-v3입니다 (3,800만+ 실행). 배치 추론으로 약 150분 분량 오디오를 100초 이내에 전사합니다. 청크/단어 단위 타임스탬프를 지원합니다.

약 150분 오디오를 100초 이내 전사
Whisper large-v3 정확도
청크/단어 단위 타임스탬프
빠름울트라
자세히 보기

Suno Music V5.5

Suno

140 크레딧

Suno의 최신 모델로, 최고 음질과 가장 풍부한 편곡을 제공합니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.

1회 생성으로 완성곡 2곡
Suno 라인업 중 최고 음질과 가장 풍부한 편곡
가사·스타일·제목을 직접 지정하는 커스텀 모드
보통울트라
자세히 보기

Suno Music V5

Suno

140 크레딧

향상된 음질과 음악성을 갖춘 Suno V5 음악 생성 모델입니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.

1회 생성으로 완성곡 2곡
V4.5 대비 향상된 음질과 음악성
가사·스타일·제목을 직접 지정하는 커스텀 모드
보통높음
자세히 보기

Suno Music V4.5

Suno

140 크레딧

Suno V4.5 음악 생성 모델입니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.

1회 생성으로 완성곡 2곡
가사·스타일·제목을 직접 지정하는 커스텀 모드
보컬 없는 연주곡(instrumental) 옵션
보통높음
자세히 보기

MiniMax Music 2.6

MiniMax

350 크레딧

텍스트 프롬프트로 최대 6분 길이의 완성곡 또는 연주곡을 생성합니다. 99% 이상 정확한 BPM·조성 제어, 14종 이상의 구조 태그, 가사 자동 생성, 보컬 없는 연주곡 모드를 지원합니다.

최대 6분 길이의 완성곡 (대부분 2-4분)
프롬프트로 99% 이상 정확한 BPM·조성 제어
14종+ 구조 태그: [Intro], [Verse], [Chorus], [Hook], [Drop], [Bridge] 등
보통높음
자세히 보기

MiniMax Music 2.5

MiniMax

350 크레딧

보컬, 가사, 풍부한 악기 구성을 갖춘 최대 5분 길이의 완성곡을 생성합니다. 14종 구조 태그, 장르별 특성을 반영하는 스타일-aware 믹싱, 오케스트라·전통 악기까지 확장된 악기 라이브러리를 지원합니다.

최대 5분 길이의 완성곡 (대부분 2:30-4:30)
14종 구조 태그: [Intro], [Verse], [Chorus], [Hook], [Drop], [Bridge] 등
호흡·피치 전환까지 사실적인 보컬
보통높음
자세히 보기

MiniMax Music Cover

MiniMax

700 크레딧

어떤 곡이든 다른 스타일로 재해석합니다. 입력 오디오에서 멜로디 구조를 추출해 트랙을 재생성합니다 — 멜로디와 곡 길이는 유지되고, 목소리·악기·장르·편곡은 모두 바뀔 수 있습니다.

멜로디와 곡 길이 유지
목소리·악기·장르·편곡 전면 변경 가능
장르 전환: 팝→재즈, 록→보사노바, 발라드→EDM
보통높음
자세히 보기

Qwen3 TTS

Qwen

47 크레딧

3가지 모드를 갖춘 Alibaba의 통합 TTS입니다: 프리셋 화자(custom_voice), 레퍼런스 오디오 기반 즉시 음성 복제(voice_clone), 텍스트 설명만으로 새로운 목소리 생성(voice_design).

3가지 모드: 프리셋 음성, 음성 복제, 음성 디자인
자연어 설명만으로 음성 디자인
한국어(Sohee) 포함 9개 프리셋 화자
빠름높음
자세히 보기

Inworld Realtime TTS 2

Inworld

59 크레딧

자연어 스티어링을 지원하는 Inworld의 최고 표현력 TTS입니다. [speak quickly]처럼 대괄호 지시문을 텍스트 앞에 붙여 말투를 제어합니다. 실시간 지연 시간과 15개 이상 언어를 지원합니다.

대괄호 지시문 기반 자연어 스티어링
실시간 지연 시간
자동 감지 포함 15개 이상 언어 지원
빠름높음
자세히 보기

Suno SFX V5

Suno

29 크레딧

Suno V5 효과음 생성 모델입니다. 텍스트 설명만으로 짧은 효과음 2가지 변형을 생성하며, 루프 모드·템포·조성(key)을 옵션으로 제어할 수 있습니다. UI 사운드, 게임 오디오, 영상 폴리에 적합합니다.

1회 생성으로 효과음 2가지 변형
게임·앰비언트용 무한 루프 모드
템포(BPM)·조성(key) 제어
빠름높음
자세히 보기

MiniMax Speech 2.8 HD

MiniMax

237 크레딧

Artificial Analysis Speech Arena 및 Hugging Face TTS Arena 1위. 자동회귀 Transformer + Flow-VAE 디코더 기반 방송 품질 TTS로, 32개 이상 언어, 음성 클론, 자연스러운 감탄사, 감정 제어를 지원합니다.

주요 TTS 벤치마크 1위
스튜디오급 방송 품질 오디오
자연스러운 감탄사 (웃음, 한숨, 기침 등)
보통울트라
자세히 보기

MiniMax Speech 2.8 Turbo

MiniMax

142 크레딧

250ms 미만 지연의 저지연 MiniMax Speech 2.8 Turbo. 40개 이상 언어, 음성 클론, 자연스러운 감탄사, 실시간 과금을 지원합니다. 인터랙티브 및 실시간 애플리케이션에 적합합니다.

실시간 사용을 위한 250ms 미만 지연
40개 이상 언어 지원
자연스러운 감탄사 (웃음, 한숨, 기침 등)
빠름높음
자세히 보기

MiniMax Speech 2.6 HD

MiniMax

237 크레딧

전문 애플리케이션을 위한 미묘한 운율, 감정 제어, 프리미엄 음성을 갖춘 스튜디오 품질 다국어 텍스트-음성 변환 모델입니다.

스튜디오급 오디오 품질
세밀한 운율 제어
자막 타임스탬프 내보내기
보통울트라
자세히 보기

MiniMax Speech 2.6 Turbo

MiniMax

142 크레딧

감정 제어가 가능한 빠른 다국어 텍스트-음성 변환 모델로, 저지연 실시간 애플리케이션에 최적화되어 있습니다.

초저지연 합성
실시간 스트리밍 지원
300개 이상 음성 프리셋
빠름높음
자세히 보기

MiniMax Speech-02-Turbo

MiniMax

142 크레딧

다국어 지원, 감정 음성 제어, 300개 이상의 목소리 옵션을 갖춘 저지연 텍스트-음성 변환 모델입니다.

저지연 실시간 합성
300개 이상 음성 프리셋
감정 표현 제어
빠름높음
자세히 보기

Sonilo v1.1 Text to Music

Sonilo

520 크레딧

Fal.AI를 통해 제공되는 Sonilo v1.1 텍스트-투-뮤직 모델입니다. 원하는 사운드를 설명하는 텍스트만으로 최대 3개의 서로 다른 음악 트랙(각 최대 600초)을 생성합니다.

텍스트 설명만으로 완전한 음악 트랙 생성
트랙당 최대 600초(10분) 길이 지원
한 번의 호출로 최대 3개의 서로 다른 트랙 변형 생성
빠름표준
자세히 보기

Inworld TTS 1.5 Max

Inworld

24 크레딧

200ms 미만 지연의 Inworld 최고 품질 실시간 TTS입니다. SSML break 태그로 일시정지, [happy] 같은 감정 마크업, 15개 언어를 지원합니다.

200ms 미만 중간값 지연
감정 마크업: [happy], [sad], [angry]
SSML break 태그로 정밀한 일시정지
빠름높음
자세히 보기

Clova Voice TTS Premium

NCP Clova

153 크레딧

108개 음성, 6개 언어를 지원하는 네이버 클로바 보이스 프리미엄 TTS. 고품질 한국어 음성 합성, 감정 표현, Pro 음성, 이중 언어 지원.

6개 언어 108개 음성 옵션
고품질 한국어 음성 합성
감정 제어 (중립, 슬픔, 기쁨, 분노)
빠름높음
자세히 보기

ElevenLabs Turbo v2.5

ElevenLabs

119 크레딧

고품질·저지연 ElevenLabs 텍스트-음성 변환 모델입니다. v3와 동일한 26개 프리미엄 음성을 절반 가격으로, 32개 언어에서 실시간·대량 처리에 최적화되어 있습니다.

실시간 앱에 최적화된 저지연
32개 언어 지원
26개 프리미엄 프리셋 음성
빠름높음
자세히 보기

ElevenLabs v3

ElevenLabs

237 크레딧

ElevenLabs의 가장 표현력 있는 텍스트-음성 변환 모델입니다. 26개 프리미엄 음성, [laughs]·[whispers] 같은 인라인 오디오 태그, 정밀한 스타일·안정성 제어, 70개 이상 언어를 지원합니다.

ElevenLabs 최고 표현력 모델
인라인 오디오 태그: [laughs], [whispers], [sighs], [excited]
26개 프리미엄 프리셋 음성
보통울트라
자세히 보기

ElevenLabs v2 Multilingual

ElevenLabs

237 크레딧

30개 이상 언어를 지원하는 ElevenLabs Multilingual v2 텍스트-음성 변환 모델입니다. 검증된 안정적인 음질과 동일한 프리미엄 음성 라인업, 정밀한 음성 설정을 제공합니다.

30개 이상 언어 지원
프로덕션에서 검증된 안정적 음질
26개 프리미엄 프리셋 음성
보통높음
자세히 보기

Sonilo v1.1 Video to Sound Effects

Sonilo

310 크레딧

Fal.AI를 통해 제공되는 Sonilo v1.1 비디오-투-사운드이펙트 모델입니다. 입력 영상에 AI가 생성한 사운드(환경음, 효과음, 폴리)를 추가합니다. 프롬프트가 없으면 장면을 자동으로 캡션 처리하고, 구간별 사운드 설명을 제공하면 더 세밀한 제어가 가능합니다.

무음이거나 사운드가 부족한 영상에 환경음, 효과음, 폴리 사운드 추가
프롬프트가 없으면 장면을 자동으로 캡션 처리
구간별 사운드 설명으로 더 세밀한 시간대별 제어 가능
빠름표준
자세히 보기

Suno Vocal Separation

Suno

120 크레딧

Suno로 생성한 곡을 보컬과 반주(인스트루멘탈) 스템으로 분리합니다. 이전 Suno 음악 생성 결과의 taskId와 audioId를 입력하면 분리된 vocalUrl/instrumentalUrl 오디오 파일을 반환합니다.

보컬 + 반주 스템 클린 분리
Suno 음악 생성 결과에서 바로 체이닝
두 스템 모두 CDN 미러링된 MP3 제공
빠름높음
자세히 보기

MiniMax Voice Cloning

MiniMax

6980 크레딧

10초~5분 분량의 오디오 샘플로 어떤 목소리든 복제합니다. MiniMax 음성 모델의 voice_id로 바로 사용할 수 있는 커스텀 voice_id와 복제 음성으로 합성한 미리듣기 클립을 반환합니다.

10초 분량의 오디오만으로 음성 복제
복제된 voice_id를 MiniMax 음성 모델에서 바로 사용
결과에 미리듣기 오디오 클립 포함
보통높음
자세히 보기

Whisper

OpenAI

10 크레딧

음성 전사의 표준인 OpenAI Whisper large-v3입니다 (1억 4,400만+ 실행). 약 100개 언어 자동 감지, 영어 번역, plain text/SRT/VTT 출력 형식을 지원합니다.

음성 인식의 표준 (1억 4,400만+ 실행)
한국어 포함 약 100개 언어 자동 감지
어떤 언어든 영어로 번역 전사
보통울트라
자세히 보기

Whisper Diarization

Whisper

7 크레딧

화자 분리(diarization)가 포함된 Whisper 전사입니다 (800만+ 실행). 누가 무엇을 말했는지 세그먼트별 화자 라벨과 타임스탬프로 반환합니다. 회의·인터뷰 전사의 정석입니다.

화자 라벨이 붙는 전사 (누가 무엇을 말했는지)
세그먼트별 타임스탬프
화자 수 자동 감지 (직접 지정도 가능)
빠름높음
자세히 보기

XTTS-v2

Coqui

26 크레딧

Coqui XTTS-v2 다국어 음성 복제 TTS입니다. 짧은 오디오 샘플 하나로 음성을 복제해 16개 언어로 말하게 할 수 있는, 가장 널리 쓰이는 오픈소스 음성 복제 모델 중 하나입니다.

짧은 오디오 샘플 하나로 음성 복제
한국어 포함 16개 언어 지원
언어 교차 복제 (복제 음성으로 어떤 언어든 발화)
보통표준
자세히 보기

LLM 모델

GPT-4o, Claude, Gemini - OpenAI 호환 채팅 API

Claude Haiku 4.5

추천

Anthropic

1 크레딧

일상적인 작업을 위한 빠르고 비용 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 지능, 비용의 훌륭한 균형을 제공합니다.

200K 컨텍스트 윈도우
8K 최대 출력 토큰
비전 기능
빠름높음
자세히 보기

Claude Opus 5

Anthropic

5 크레딧

기본 1M 토큰 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 Opus 모델입니다. Opus 4.5~4.8과 동일한 가격($5/$25 per M 토큰)에 프롬프트 캐싱(read $0.50/M, write $6.25/M)과 웹 검색을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

가장 강력한 Anthropic 모델
기본 1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
보통울트라
자세히 보기

Claude Opus 4.8

Anthropic

5 크레딧

1M 토큰 컨텍스트 윈도우(일부 환경 200K), 128K 최대 출력 토큰, 2026년 1월까지의 학습 기준일을 갖춘 Anthropic 최상위 Opus 모델입니다. Opus 4.7 대비 장기 에이전트형 코딩, 도구 호출 정확도가 향상되었고, 필요한 턴에서만 추론하는 adaptive thinking을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

가장 강력한 Anthropic 모델
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
보통울트라
자세히 보기

Claude Opus 4.7

Anthropic

5 크레딧

2026년 1월까지의 신뢰할 수 있는 학습 기준일과 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 모델입니다. Opus 4.6 대비 추론, 코딩, 지시 따르기 성능이 향상되었으며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

가장 강력한 Anthropic 모델
200K 컨텍스트 윈도우
128K 최대 출력 토큰
보통울트라
자세히 보기

Claude Opus 4.6

Anthropic

5 크레딧

Anthropic의 가장 강력한 모델입니다. 향상된 안전성과 지시 따르기 능력으로 추론, 코딩, 복잡한 분석에서 획기적인 성능을 제공합니다.

가장 강력한 Anthropic 모델
200K 컨텍스트 윈도우
향상된 추론 및 코딩
보통울트라
자세히 보기

Claude Opus 4.5

Anthropic

5 크레딧

매우 복잡한 작업을 위한 Anthropic의 가장 강력한 모델입니다. 깊은 전문성이 필요한 연구, 분석 및 창의적 프로젝트에 탁월합니다.

200K 컨텍스트 윈도우
32K 최대 출력 토큰
비전 기능
보통울트라
자세히 보기

Claude Sonnet 5

Anthropic

4 크레딧

속도, 비용, 지능의 균형에 최적화된 Anthropic의 최신 Sonnet 모델입니다. 1M 토큰 컨텍스트 윈도우, 64K 최대 출력 토큰, 2025년 8월까지의 학습 기준일을 갖췄습니다. 필요한 턴에서만 추론하는 adaptive thinking, 비전, 도구 사용을 지원하며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

속도·비용·지능의 균형
1M 토큰 컨텍스트 윈도우
64K 최대 출력 토큰
빠름울트라
자세히 보기

Claude Sonnet 4.5

Anthropic

4 크레딧

Anthropic의 가장 지능적이고 강력한 Sonnet 모델입니다. 복잡한 추론, 미묘한 이해, 코딩 작업에서 최고 수준이며 뛰어난 지시 따르기 능력을 제공합니다.

200K 컨텍스트 윈도우
16K 최대 출력 토큰
비전 기능
빠름울트라
자세히 보기

Claude Sonnet 4

Anthropic

3 크레딧

효율적인 가격대에서 강력한 추론과 코딩 능력을 제공하는 균형 잡힌 Sonnet 4 모델입니다. 속도와 지능의 적절한 조합이 필요한 일상적인 프로덕션 워크로드에 이상적입니다.

200K 컨텍스트 윈도우
16K 최대 출력 토큰
비전 기능
빠름높음
자세히 보기

Gemini 3.5 Flash

Google

2 크레딧

Google의 최신 Flash 티어 주력 모델입니다. 모든 입력 모달리티(텍스트·이미지·비디오·오디오·PDF)가 백만 토큰당 $1.50/$9의 동일 요율이며 롱 컨텍스트 할증이 없습니다. 1M 토큰 컨텍스트 윈도우와 65,536 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.

모든 입력 모달리티 동일 요율
롱 컨텍스트 할증 없음
1M 토큰 컨텍스트 윈도우
빠름높음
자세히 보기

Gemini 3.1 Flash Image Preview

Google

500 크레딧

네이티브 이미지 생성 기능을 갖춘 Gemini 3.1 Flash입니다. 채팅 응답에서 텍스트와 함께 이미지를 직접 생성할 수 있습니다. 텍스트와 이미지 출력 토큰에 별도의 가격이 적용됩니다.

채팅 내 네이티브 이미지 생성
131,072 토큰 컨텍스트 윈도우
32,768 최대 출력 토큰
빠름높음
자세히 보기

Gemini 3.1 Flash Lite

Google

1 크레딧

초경량 Gemini 3.1 Flash Lite의 정식(stable) 릴리스입니다. 백만 토큰당 $0.25/$1.50로 가장 비용 효율적인 Gemini 모델이며, 캐시 입력(90% 할인), 오디오 입력, 배치(50% 할인)를 지원합니다. 고처리량·저비용 애플리케이션에 적합합니다.

가장 비용 효율적인 Gemini 모델
정식(stable) 모델 ID (preview 접미사 없음)
1,048,576 토큰 컨텍스트 윈도우
빠름표준
자세히 보기

Gemini 3.1 Flash Lite Preview

Google

100 크레딧

Gemini 3.1 Flash의 초경량 변형 모델입니다. 캐시된 입력과 오디오 입력을 지원하는 가장 비용 효율적인 Gemini 모델입니다. 고처리량, 비용 의식적 애플리케이션에 적합합니다.

가장 비용 효율적인 Gemini 모델
1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
빠름표준
자세히 보기

Gemini 3.1 Flash Live Preview

Google

300 크레딧

실시간 상호작용 및 라이브 스트리밍 시나리오에 최적화된 Gemini 3.1 Flash입니다. 전용 가격의 오디오 입력 지원과 함께 저지연 응답을 제공합니다.

Live API 지원 (실시간 양방향)
저지연 스트리밍 응답
131,072 토큰 컨텍스트 윈도우
빠름높음
자세히 보기

Gemini 3.1 Pro Preview

Google

500 크레딧

Google의 최신이자 가장 강력한 Gemini 모델 프리뷰입니다. 컨텍스트 길이에 따라 조정되는 동적 가격 책정이 적용되며, 200K 토큰 이상 입력 시 확장 가격이 적용됩니다.

동적 가격 책정 (표준 / 200K 이상 장문 컨텍스트)
고급 추론 및 분석
1,048,576 토큰 컨텍스트 윈도우
보통울트라
자세히 보기

Gemini 3 Flash

Google

500 크레딧

최첨단 멀티모달 이해력, 박사급 추론 능력, 최고 수준의 코딩 성능을 갖춘 Google의 가장 진보된 추론 모델입니다.

박사급 추론 능력
1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
보통울트라
자세히 보기

Gemini 3 Pro Image Preview

Google

500 크레딧

Gemini 3 Pro 제품군의 프리미엄 이미지 생성 모델입니다. 채팅에서 직접 최고 충실도의 이미지를 생성합니다. 이미지 출력 토큰은 텍스트 출력 토큰의 10배 가격이 적용됩니다.

프리미엄 이미지 생성 품질
65,536 토큰 컨텍스트 윈도우
32,768 최대 출력 토큰
보통울트라
자세히 보기

Gemini 3 Pro Preview

Google

4 크레딧

Google의 가장 강력한 Gemini 모델 프리뷰 버전입니다. 획기적인 추론, 코딩, 멀티모달 기능과 최대 컨텍스트 윈도우를 제공합니다.

1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
멀티모달 입력: 텍스트·이미지·비디오·오디오·PDF
보통울트라
자세히 보기

Gemini 2.5 Flash

Google

1 크레딧

사고 능력이 내장된 Google의 빠르고 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 추론, 비용의 훌륭한 균형을 제공합니다.

1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
멀티모달 입력: 텍스트·이미지·비디오·오디오
빠름높음
자세히 보기

Gemini 2.5 Pro

Google

3 크레딧

최첨단 추론 능력과 1M 토큰 컨텍스트를 갖춘 Google의 가장 강력한 모델입니다. 복잡한 코딩, 수학, 다중 문서 분석에 탁월합니다.

1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
멀티모달 입력: 오디오·이미지·비디오·텍스트·PDF
보통울트라
자세히 보기

Gemini 2.0 Flash

Google

1 크레딧

Google의 가장 빠르고 강력한 모델입니다. 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달 지원 및 실시간 기능을 제공합니다.

1,048,576 토큰 컨텍스트 윈도우
8,192 최대 출력 토큰
네이티브 멀티모달 (텍스트·이미지·오디오·비디오)
빠름높음
자세히 보기

Gemini 2.0 Flash Lite

Google

0.5 크레딧

최대 속도와 최소 비용을 위해 최적화된 Gemini 2.0 Flash의 초경량 버전입니다. 대량의 지연에 민감한 애플리케이션에 적합합니다.

초고속 추론
요청당 최소 비용
1,048,576 토큰 컨텍스트 윈도우
빠름표준
자세히 보기

Gemini Embedding 001

Google

0.1 크레딧

벡터 표현 생성을 위한 Google의 텍스트 임베딩 모델입니다. 의미 검색, 클러스터링, 유사도 작업에 최적화되어 있습니다.

고품질 텍스트 임베딩
요청당 최대 입력 2,048 토큰
출력 차원: 128–3,072 (기본 3,072; 권장 768 / 1,536 / 3,072)
빠름높음
자세히 보기

GPT-5.6 Luna

OpenAI

1 크레딧

OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 고속·저비용 티어입니다. 백만 토큰당 $1/$6의 가격으로 고처리량 워크로드에 최적화되어 있으며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.

GPT-5.6 패밀리의 고속·저비용 티어
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
빠름높음
자세히 보기

GPT-5.6 Sol

OpenAI

5 크레딧

OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 플래그십 티어입니다. 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원하며, 세대 내 최고 수준의 추론·코딩·멀티모달 성능을 제공합니다.

GPT-5.6 패밀리의 플래그십 티어
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
빠름울트라
자세히 보기

GPT-5.6 Terra

OpenAI

3 크레딧

OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 균형 티어입니다. Sol의 절반 가격으로 플래그십에 근접한 품질을 제공하며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.

GPT-5.6 패밀리의 균형 티어
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
빠름높음
자세히 보기

GPT-5.5

OpenAI

5 크레딧

1.05M 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. 캐시 입력 10배 할인을 지원하며 GPT-5.4 시리즈 대비 추론, 코딩, 멀티모달 성능이 향상되었습니다.

1.05M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
캐시 입력 가격 (10배 저렴)
빠름울트라
자세히 보기

GPT-5.4

OpenAI

5 크레딧

1M 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. none부터 xhigh까지 조절 가능한 추론 수준으로 모든 영역에서 최상위 추론 성능을 제공합니다.

1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
조절 가능한 추론 (none/low/medium/high/xhigh)
빠름울트라
자세히 보기

GPT-5.4 Mini

OpenAI

2 크레딧

400K 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 GPT-5.4의 빠르고 비용 효율적인 변형 모델입니다. 일상적인 작업에서 성능과 가성비의 탁월한 균형을 제공합니다.

400K 컨텍스트 윈도우
128K 최대 출력 토큰
빠른 추론 속도
빠름높음
자세히 보기

GPT-5.4 Nano

OpenAI

1 크레딧

400K 컨텍스트와 128K 출력을 갖춘 초경량 최고속 GPT-5.4 변형 모델입니다. 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다. 도구 통합을 위한 MCP를 지원합니다.

400K 컨텍스트 윈도우
128K 최대 출력 토큰
초고속 추론
빠름표준
자세히 보기

GPT-5.2

OpenAI

4 크레딧

OpenAI의 최신이자 가장 진보된 GPT 모델입니다. 향상된 기능으로 추론, 코딩, 창의적 작업 전반에서 최첨단 성능을 제공합니다.

최신 GPT 아키텍처
256K 컨텍스트 윈도우
32K 최대 출력 토큰
빠름울트라
자세히 보기

GPT-5.1 (2025-11-13)

OpenAI

3 크레딧

재현 가능한 결과를 위한 GPT-5.1의 날짜별 스냅샷입니다. 반복 컨텍스트에 대한 캐시된 입력 토큰으로 비용 절감을 지원합니다. 모델 버전 고정이 필요한 프로덕션 배포에 적합합니다.

재현성을 위한 고정 모델 스냅샷
비용 절감을 위한 캐시된 입력 토큰
강력한 추론 및 코딩 성능
빠름높음
자세히 보기

GPT-5

OpenAI

3 크레딧

OpenAI의 최신 플래그십 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 추론, 코딩, 창의적 작업 전반에서 탁월한 성능을 제공합니다. 비전, 함수 호출, JSON 모드를 지원합니다.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
고급 추론 기능
빠름울트라
자세히 보기

GPT-5 Mini

OpenAI

1 크레딧

GPT-5의 빠르고 효율적인 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 GPT-5 대비 훨씬 저렴한 비용으로 추론, 코딩, 창의적 작업 전반에서 우수한 성능을 제공합니다.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
빠른 추론 속도
빠름높음
자세히 보기

GPT-5 Nano

OpenAI

1 크레딧

GPT-5의 초고속 경량 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
초고속 추론
빠름높음
자세히 보기

GPT-4.1

OpenAI

3 크레딧

OpenAI의 코딩 및 지시 따르기에 가장 뛰어난 모델입니다. 1M 토큰 컨텍스트 윈도우, 32K 출력 토큰을 지원하며, 코딩, 복잡한 프롬프트, 긴 컨텍스트 작업에서 크게 향상되었습니다. GPT-4o 대비 출력 비용 20% 절감.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
최고 수준의 코딩 성능
빠름울트라
자세히 보기

GPT-4.1 Mini

OpenAI

1 크레딧

소형 모델 성능의 획기적 도약. GPT-4o와 동등하거나 뛰어난 지능을 갖추면서 지연 시간은 거의 절반, 비용은 83% 절감. 속도, 품질, 경제성의 이상적 균형.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
GPT-4o 지능을 훨씬 낮은 비용으로
빠름높음
자세히 보기

GPT-4.1 Nano

OpenAI

1 크레딧

OpenAI의 가장 빠르고 저렴한 모델. 분류, 자동완성, 저지연 작업에 최적화. $0.10/1M 입력 토큰의 초저가격.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
초저지연
빠름표준
자세히 보기

GPT-4o

OpenAI

3 크레딧

OpenAI의 플래그십 멀티모달 모델입니다. 추론, 코딩, 창의적 작업에서 업계 최고 성능을 제공하며, 네이티브 비전 기능과 구조화된 출력을 지원합니다.

네이티브 멀티모달 (텍스트 + 비전 + 오디오)
128K 컨텍스트 윈도우
16K 최대 출력 토큰
빠름울트라
자세히 보기

GPT-4o Mini

OpenAI

1 크레딧

비용 효율적이고 빠른 모델로 강력한 성능을 제공합니다. 절대적인 성능보다 속도와 비용이 중요한 대량 작업에 최적입니다.

128K 컨텍스트 윈도우
16K 최대 출력 토큰
비전 기능
빠름높음
자세히 보기

GPT Audio Mini

OpenAI

1 크레딧

네이티브 오디오 입출력 기능을 갖춘 경량 멀티모달 모델입니다. 음성 기반 상호작용 및 오디오 처리 작업에 최적화되어 있습니다.

네이티브 오디오 입출력
음성 기반 상호작용
비용 효율적 멀티모달
빠름높음
자세히 보기

MiniMax M2.7

MiniMax

1 크레딧

OpenAI 호환 API로 제공되는 MiniMax의 플래그십 M2 시리즈 언어 모델입니다. 백만 토큰당 $0.30/$1.20의 매우 낮은 가격에 강력한 다국어 성능(특히 중국어·영어)을 제공하며, 프롬프트 캐시 읽기는 $0.06/M입니다.

OpenAI 호환 API (SDK 그대로 사용 가능)
매우 낮은 가격 (백만 토큰당 $0.30/$1.20)
프롬프트 캐시 읽기 할인 ($0.06/M)
빠름높음
자세히 보기

OpenAI o4-mini

OpenAI

2 크레딧

코딩 및 STEM 작업에 최적화된 빠르고 비용 효율적인 추론 모델입니다. 대형 추론 모델 대비 매우 낮은 비용으로 강력한 추론을 제공합니다.

코딩/STEM에 최적화
200K 컨텍스트 윈도우
100K 최대 출력 토큰
빠름울트라
자세히 보기

OpenAI o3-mini

OpenAI

2 크레딧

낮은 비용으로 강력한 성능을 제공하는 효율적인 추론 모델입니다. 대형 모델의 오버헤드 없이 추론이 필요한 작업에 이상적입니다.

효율적인 추론 기능
200K 컨텍스트 윈도우
100K 최대 출력 토큰
빠름높음
자세히 보기

OpenAI o1

OpenAI

15 크레딧

OpenAI의 가장 고급 추론 모델입니다. 확장된 사고 시간을 사용하여 과학, 코딩, 수학의 복잡한 문제를 뛰어난 정확도로 해결합니다.

고급 사고 연쇄 추론
200K 컨텍스트 윈도우
100K 최대 출력 토큰
느림울트라
자세히 보기

가격 비교

모든 모델의 크레딧 비용을 비교하여 최적의 모델을 선택하세요

카테고리모델크레딧단위추천 용도
이미지flux-schnell7이미지당빠른 생성, 실시간 앱
flux-2-max1601 MP 이미지 기준 — 해상도별 차등 (0.5MP 130, 2MP 230, 4MP·match_input 370, custom 390)최고 품질, 상업용
seedream-4.590이미지당 — 순차 생성 모드(auto)에서는 생성된 이미지 수(최대 15장)만큼 비례 과금텍스트 렌더링, 로고
비디오seedance-1-pro-fast290비디오당저비용 빠른 생성
hailuo-2.3650비디오당고품질, 균형 잡힌
veo-3.17,440비디오당최고 품질 비디오
오디오speech-02-turbo1421000자당 (0.135 크레딧/자, 글자 단위 과금)실시간 TTS, 빠른 응답
speech-2.8-hd2371000자당 (0.225 크레딧/자, 글자 단위 과금)고품질 HD 음성
LLMgpt-4o31K 토큰당 (평균)범용, 코드, 멀티모달
claude-sonnet-541K 토큰당 (평균)분석, 장문, 코드
gemini-2.0-flash11K 토큰당 (평균)초고속, 대량 처리

시작할 준비가 되셨나요?

Playground에서 모델을 테스트하거나 빠른 시작 가이드를 따라해보세요