Skip to main content
Core.Today
가격
50+ AI 모델

모델 카탈로그

이미지, 비디오, 오디오 생성 및 LLM을 위한 다양한 AI 모델을 살펴보세요.

92
이미지 모델
58
비디오 모델
37
오디오 모델
87
LLM 모델

추천 모델

각 카테고리의 추천 모델 - 시작하기에 가장 좋은 모델들

모델 선택 가이드

속도가 중요하다면?

flux-schnell, Gemini Flash

품질이 중요하다면?

FLUX Pro, Kling Pro, Claude

비용 효율적인 선택?

flux-schnell, MiniMax, Gemini

가장 다재다능한 모델?

GPT-4o, Claude, FLUX Dev

이미지 생성 모델

FLUX, Stable Diffusion 등으로 멋진 이미지를 생성하세요

Background Remover

추천

851 Labs

1 크레딧

Replicate에서 가장 많이 사용된 배경 제거 모델입니다 (2,700만+ 실행). 소프트 알파/하드 세그멘테이션 배경 제거, 반전 모드(전경 제거), 커스텀 배경 타입, 투명 PNG 출력을 매우 저렴한 가격에 지원합니다.

Replicate 최다 사용 배경 제거 모델
소프트 알파 매트 또는 하드 세그멘테이션 (threshold)
반전 모드 — 배경 대신 전경 제거
빠름높음
자세히 보기

BiRefNet

BiRefNet

7 크레딧

SOTA 오픈소스 배경 제거 모델입니다. BiRefNet의 고해상도 이분 세그멘테이션이 머리카락, 털, 미세 디테일에서 탁월한 경계 품질을 제공합니다.

SOTA 세그멘테이션 품질
머리카락·털·미세 디테일의 탁월한 경계
처리 해상도 조정 가능
빠름울트라
자세히 보기

BLIP

Salesforce

1 크레딧

Salesforce BLIP입니다 (1억 7,300만+ 실행). 이미지 캡셔닝, 시각 질의응답(VQA), 이미지-텍스트 매칭을 하나의 모델로 제공합니다. 이미지당 1크레딧으로 대량 캡셔닝의 클래식 선택지입니다.

3가지 작업: 캡셔닝, VQA, 이미지-텍스트 매칭
1억 7,300만+ 실행 — 캡셔닝의 클래식
이미지당 1크레딧 — 대량 파이프라인에 최적
빠름표준
자세히 보기

Change Haircut

Black Forest Labs

93 크레딧

FLUX.1 Kontext [pro] 기반으로 사진 한 장에서 헤어스타일과 머리 색을 바꿉니다. 90개 이상의 헤어스타일과 30가지 머리 색 중 선택하거나 'Random'으로 랜덤 변신 — 얼굴은 그대로 유지됩니다.

밥컷·브레이드·업두·페이드·웨이브 등 90개 이상의 헤어스타일 프리셋
자연스러운 색부터 로즈골드·블루·실버까지 30가지 머리 색
얼굴은 그대로, 머리만 바꾸는 정체성 보존 편집
빠름높음
자세히 보기

Clarity Upscaler

Clarity

60 크레딧

유명한 크리에이티브 업스케일러입니다 (3,000만+ 실행). 단순 확대가 아니라 디테일을 재창조하며 업스케일합니다 — creativity/resemblance 제어, 프롬프트 가이드, 고배율을 위한 타일 디퓨전을 지원합니다.

업스케일과 동시에 디테일 재창조
creativity·resemblance 다이얼
프롬프트 기반 향상 가이드
보통울트라
자세히 보기

CLIP Features

CLIP

1 크레딧

텍스트와 이미지를 모두 임베딩하는 CLIP ViT-L/14입니다 (1억 6,300만+ 실행). 둘을 같은 벡터 공간에 놓아 교차 모달 검색, 이미지 중복 제거, 제로샷 분류에 사용합니다. 실행당 1크레딧.

텍스트와 이미지를 같은 공간에 임베딩
1억 6,300만+ 실행 — Replicate의 CLIP 표준
줄바꿈으로 여러 입력 배치 가능
빠름높음
자세히 보기

CodeFormer

CodeFormer

8 크레딧

오래된 사진과 AI 생성 얼굴을 위한 강력한 얼굴 복원 모델입니다 (5,400만+ 실행). 복원 품질과 원본 얼굴 충실도의 균형을 조절하는 fidelity 다이얼이 특징이며, Real-ESRGAN 배경 향상을 내장하고 있습니다.

품질↔충실도 균형 다이얼 (codeformer_fidelity)
심하게 손상된 얼굴에도 강건함
Real-ESRGAN 배경 향상 내장
빠름높음
자세히 보기

ControlNet Scribble

ControlNet

120 크레딧

스케치→이미지의 클래식입니다 (3,800만+ 실행). 낙서나 선화를 프롬프트에 맞는 정교한 이미지로 바꿉니다. 구도는 그림으로, 내용은 텍스트로 지시하세요.

스케치가 구도를, 프롬프트가 내용을 결정
3,800만+ 실행 — 스크리블의 표준
실행당 1장 또는 4장
보통높음
자세히 보기

Grok Imagine Image 2.0 Edit

xAI

160 크레딧

xAI Grok Imagine Image 2.0의 전용 편집 엔드포인트입니다. 지시를 정밀하게 따르는 편집이 강점으로, 광고 소재·목업·에셋 보정에 적합합니다.

지시를 정밀하게 따르는 편집 (2.0 계열 강점)
요청당 최대 10개 편집 변형 생성 (장당 과금)
출력 종횡비 제어
빠름높음
자세히 보기

Grok Imagine Image Edit

xAI

51 크레딧

xAI Grok Imagine 이미지 모델의 전용 편집 엔드포인트입니다. 원본 이미지 URL과 변경 내용을 담은 프롬프트를 전달하세요. Grok Imagine 계열에서 가장 빠르고 저렴한 편집 티어입니다.

프롬프트 기반 기존 이미지 편집
요청당 최대 10개 편집 변형 생성 (장당 과금)
출력 종횡비 제어
빠름표준
자세히 보기

Grok Imagine Image Quality Edit

xAI

140 크레딧

xAI Grok Imagine Image Quality의 전용 편집 엔드포인트입니다. 디테일을 보존하는 최고 품질 편집 티어입니다.

Grok Imagine 계열 최고 품질 편집
디테일을 보존하는 보정·복원
요청당 최대 10개 편집 변형 생성 (장당 과금)
보통울트라
자세히 보기

Muse Image 1.0 Edit

Meta

24 크레딧

Meta Muse Image 모델로 기존 이미지를 편집합니다. 원본 이미지 URL과 변경 내용을 설명하는 프롬프트를 전달하세요. 요청당 최대 10개 변형, webp/png/jpeg 출력을 지원합니다.

원본 이미지(png/jpeg/webp)의 프롬프트 기반 편집
요청당 최대 10개 편집 변형 (장당 과금)
WxH 크기 프리셋으로 종횡비 변경 가능
보통높음
자세히 보기

Nano Banana (Edit)

Google

91 크레딧

Google Gemini 2.5 Flash 기반 Nano Banana의 전용 편집 엔드포인트입니다. 이미지 URL을 입력하면 캐릭터 일관성과 멀티 이미지 융합을 통한 대화형 편집을 수행합니다.

이미지 입력에 최적화된 편집 전용 엔드포인트
캐릭터 일관성 기반 멀티모달 편집
멀티 이미지 융합
빠름높음
자세히 보기

Nano Banana 2 (Edit)

Google

190 크레딧

Gemini 3.1 Flash Image 기반 Nano Banana 2의 편집 엔드포인트입니다. 해상도 제어(1K/2K/4K), Google 검색 연동, 사고 모드를 추가하면서 대화형 편집과 멀티 이미지 융합을 유지합니다.

해상도 제어: 1K, 2K, 4K
선택적 웹 검색 연동
사고 모드 (minimal/high)
보통울트라
자세히 보기

Nano Banana Pro (Edit)

Google

350 크레딧

Gemini 3 Pro 기반 Nano Banana Pro의 편집 엔드포인트입니다. 전문가급 제어, 다국어 텍스트 렌더링, Google 검색 실시간 연동, 최대 2K 편집 해상도를 제공합니다.

Gemini 3 Pro 추론 기반 복잡한 편집
다국어 텍스트 렌더링
웹 검색 연동
보통울트라
자세히 보기

Face to Many

fofr

21 크레딧

얼굴 사진을 6가지 재미있는 스타일로 바꿉니다 (1,500만+ 실행) — 3D, 이모지, 비디오 게임, 픽셀, 클레이, 토이. 수많은 프로필 앱의 원조 바이럴 아바타 생성기입니다.

6가지 스타일: 3D, 이모지, 비디오 게임, 픽셀, 클레이, 토이
InstantID로 얼굴 정체성 유지
브랜드 스타일용 커스텀 LoRA 지원
빠름높음
자세히 보기

Face to Sticker

fofr

54 크레딧

얼굴 사진을 귀여운 다이컷 스티커로 변환합니다 (160만+ 실행). InstantID가 얼굴 유사도를 지키고 IP-Adapter 컨트롤로 충실한 캐리커처부터 자유로운 카툰까지 표현 — 인쇄 품질을 위한 2배 업스케일 옵션도 지원합니다.

얼굴 사진 한 장으로 스티커 스타일 아트워크 생성
instant_id_strength로 조절하는 InstantID 기반 얼굴 유사도
ip_adapter_weight·prompt_strength로 유사도와 스타일 균형 조절
빠름높음
자세히 보기

Florence-2 Large

Microsoft

2 크레딧

Microsoft의 올인원 비전 모델 Florence-2입니다. 캡셔닝, 객체 감지, 구문 그라운딩, OCR, 세그멘테이션을 하나의 API로 제공합니다. 작업을 고르고 필요하면 텍스트 입력만 추가하면 됩니다.

하나의 모델로 다양한 작업 (task_input 선택)
캡션 / 상세 캡션 / 객체 감지
OCR 및 영역 박스 OCR
빠름높음
자세히 보기

FLUX.2 Klein 4B

Black Forest Labs

2 크레딧

매우 빠른 이미지 생성·편집 모델입니다. 4스텝으로 증류되어 프로덕션 및 준실시간 애플리케이션에 적합한 1초 이내 추론 속도를 제공합니다.

4스텝으로 증류된 모델 — 1초 이내의 추론 속도
텍스트-이미지와 이미지-이미지 편집 모두 지원 (최대 5개의 참조 이미지)
0.25MP부터 4MP까지 선택 가능한 출력 해상도
빠름표준
자세히 보기

FLUX 2 Flex

Black Forest Labs

140 크레딧

최대 10개의 참조 이미지와 고급 타이포그래피를 지원하는 최고 품질 FLUX 모델입니다. 복잡한 다중 참조 크리에이티브 프로젝트에 가장 강력한 모델입니다.

최대 10개 참조 이미지 지원
고급 타이포그래피 렌더링
울트라 품질 출력
느림울트라
자세히 보기

FLUX 2 Max

Black Forest Labs

160 크레딧

Black Forest Labs의 최고 충실도 이미지 모델입니다. FLUX.2 라인업 중 최고의 프롬프트 준수율과 가장 일관된 편집 성능을 제공하며, 최대 8장의 레퍼런스 이미지로 색상·조명·얼굴·텍스트·오브젝트를 편집 간에 보존합니다.

FLUX.2 라인업 최고의 편집 일관성 — 정체성·색상·조명·텍스트 보존
짧은 프롬프트와 긴 프롬프트 모두에서 최고 수준의 프롬프트 준수
최대 8장의 입력 이미지를 활용한 멀티 레퍼런스 편집
빠름울트라
자세히 보기

FLUX 2 Pro

Black Forest Labs

70 크레딧

고품질 편집 기능과 최대 8개의 참조 이미지를 지원하는 프로페셔널 FLUX 2 모델입니다. 품질, 속도, 크리에이티브 제어의 뛰어난 균형을 제공합니다.

최대 8개 참조 이미지 지원
고품질 이미지 편집
울트라 품질 생성
보통울트라
자세히 보기

FLUX.2 Dev

Black Forest Labs

28 크레딧

이미지 편집 기능과 참조 이미지 지원이 포함된 FLUX.2 개발 버전입니다. 반복적인 디자인 워크플로우와 실험에 이상적입니다.

이미지 편집 기능
참조 이미지 지원
속도와 품질의 균형
보통높음
자세히 보기

FLUX 1.1 Pro

Black Forest Labs

93 크레딧

FLUX.1 Pro를 업그레이드한 빠르고 고품질 이미지 생성 모델입니다. 속도와 충실도 모두가 필요한 프로덕션 워크로드에 적합합니다.

FLUX.1 Pro보다 빠른 속도
향상된 이미지 품질
울트라 품질 출력
빠름울트라
자세히 보기

FLUX 1.1 Pro Ultra

Black Forest Labs

140 크레딧

FLUX1.1 [pro]의 ultra·raw 모드입니다. FLUX 1.1 Pro 계열 중 최고 해상도인 최대 4메가픽셀 이미지를 생성합니다. 사실적인 결과가 필요하면 raw 모드를 사용하세요.

최대 4메가픽셀의 울트라 해상도 출력
덜 가공된, 더 자연스러운 이미지를 위한 raw 모드
구도 가이드를 위한 Flux Redux image_prompt 지원
보통울트라
자세히 보기

FLUX Dev

Black Forest Labs

58 크레딧

텍스트 설명으로 이미지를 생성하는 120억 파라미터 규모의 rectified flow transformer입니다. 개방적이고 고품질의 실험용으로 튜닝되었습니다.

120억 파라미터 규모의 rectified flow transformer
더 빠른 생성을 위한 선택적 fp8 'go_fast' 모드
image 파라미터를 통한 이미지-이미지 변환 지원
빠름높음
자세히 보기

FLUX Kontext Max

Black Forest Labs

190 크레딧

자연어 프롬프트로 이미지를 변형하는 프리미엄 텍스트 기반 이미지 편집 모델입니다. 최고 수준의 성능과 향상된 타이포그래피 생성 능력을 제공합니다.

FLUX Kontext Pro보다 상위 등급의 편집 성능
편집된 이미지에서 향상된 타이포그래피와 텍스트 렌더링
자연어 지시 기반 편집
보통울트라
자세히 보기

FLUX Kontext Pro

Black Forest Labs

93 크레딧

자연어로 이미지를 변환하는 최첨단 텍스트 기반 이미지 편집 모델입니다. 스타일 전환, 객체 수정, 텍스트 교체, 배경 변경, 캐릭터 일관성 작업에 뛰어납니다.

고품질 텍스트 기반 이미지 편집
스타일 전환 및 변환
객체 및 텍스트 교체
보통울트라
자세히 보기

FLUX.1 Krea [dev]

Krea AI

58 크레딧

'AI 느낌'을 특별히 배제하여 실제 사진과 구별할 수 없는 자연스러운 이미지를 생성하는 포토리얼리스틱 이미지 생성 모델입니다.

AI 아티팩트 없는 포토리얼리스틱 출력
자연스러운 이미지 생성
전형적인 AI 미학적 특징 회피
보통높음
자세히 보기

FLUX PuLID

ByteDance

47 크레딧

FLUX-dev 기반 PuLID 정체성 커스터마이징: 얼굴 사진 한 장으로 특정 인물의 포토리얼 인물 사진을 생성합니다. SDXL 계열 대비 눈에 띄게 높은 얼굴 재현도가 강점이며, id_weight와 start_step으로 유사도와 프롬프트 편집성의 균형을 조절합니다.

포토리얼·고재현도 인물 사진을 위한 FLUX-dev 백본
얼굴 사진 한 장으로 학습 없이 정체성 보존
id_weight(0-3)로 얼굴 보존 강도 제어
보통높음
자세히 보기

FLUX.1 Schnell

Black Forest Labs

7 크레딧

속도에 최적화된 초고속 이미지 생성 모델입니다. 1-2초 만에 고품질 이미지를 생성하며, 실시간 애플리케이션과 빠른 프로토타이핑에 적합합니다.

초고속 생성 (1-2초)
1024x1024 고품질 출력
뛰어난 프롬프트 이해력
빠름높음
자세히 보기

Runway Gen-4 Image

Runway

190 크레딧

레퍼런스를 지원하는 Runway의 Gen-4 Image 모델입니다. 최대 3장의 레퍼런스 이미지를 프롬프트 속 @태그로 지칭해 캐릭터·사물·장소를 어떤 앵글과 장면에서도 일관되게 유지하며, 720p 또는 1080p로 생성합니다.

최대 3장의 레퍼런스 이미지로 캐릭터·사물·장소 일관성 유지
프롬프트 안에서 @태그명으로 각 레퍼런스의 역할을 지정
720p·1080p 해상도 선택과 해상도별 차등 과금
보통울트라
자세히 보기

Runway Gen-4 Image Turbo

Runway

70 크레딧

Gen-4 Image보다 2.5배 빠르고 저렴한 Turbo 버전으로, 레퍼런스 기반 API는 동일합니다. 1~3장의 레퍼런스 이미지를 @태그로 지칭해 캐릭터와 사물의 일관성을 유지하며, 해상도와 무관하게 단일 요금으로 과금됩니다.

Gen-4 Image 대비 2.5배 빠르고 저렴한 생성 속도
720p·1080p 모두 90크레딧 단일 요금
@태그명 프롬프트 지칭이 가능한 1~3장의 레퍼런스 이미지 (최소 1장 필수)
빠름높음
자세히 보기

GFPGAN

Tencent ARC

12 크레딧

Tencent ARC의 얼굴 복원 모델입니다 — 1억 1,500만+ 실행으로 복원 컬렉션 최다 사용. 오래되거나 흐릿한 사진을 복원하고 AI 생성 이미지의 얼굴을 교정합니다.

1억+ 실행 — 얼굴 복원의 표준
오래되고 흐릿하거나 손상된 사진 복원
AI 생성 이미지의 왜곡된 얼굴 교정
빠름높음
자세히 보기

GPT Image 2.5 Flare

OpenAI

580 크레딧

고품질 일상 이미지 생성을 위한 OpenAI의 가장 빠른 모델입니다. 텍스트로 이미지를 생성하거나 기존 이미지를 편집할 수 있으며, 지시 이해력과 텍스트 렌더링이 뛰어납니다. 속도가 중요한 대량 작업에 맞춰져 있습니다. 가장 정밀한 편집이 필요하면 GPT Image 2.5 Sunburst를 사용하세요.

GPT Image 2.5 라인업 중 가장 빠른 모델
생성과 편집을 한 모델로 — input_images만 추가하면 편집 모드
인포그래픽·UI 목업·마케팅 카피에 강한 선명한 텍스트 렌더링
빠름높음
자세히 보기

GPT Image 2.5 Sunburst

OpenAI

580 크레딧

편집 정밀도가 가장 중요한 작업을 위한 OpenAI의 최고 성능 이미지 모델입니다. 지시를 충실히 따르며, 요청한 부분만 바꾸고 인물의 정체성·구도·조명은 그대로 유지합니다. 가격은 더 빠른 GPT Image 2.5 Flare와 같습니다.

OpenAI 최고 성능 이미지 모델 — 2.5 라인업 중 편집 정밀도 최상
인물 정체성·구도·조명을 유지하는 부분 편집
생성과 편집을 한 모델로 — input_images만 추가하면 편집 모드
보통울트라
자세히 보기

GPT Image 2

OpenAI

300 크레딧

강력한 지시 이해력, 선명한 텍스트 렌더링, 정밀한 편집을 갖춘 OpenAI의 최첨단 이미지 생성/편집 모델입니다. 품질 기반 가격으로 비용-품질 트레이드오프를 선택할 수 있습니다.

뛰어난 프롬프트/지시 이해력
선명한 타이포그래피 및 텍스트 렌더링
input_images로 합성/편집 지원
보통울트라
자세히 보기

GPT Image 1.5

OpenAI

310 크레딧

지시 이행력과 프롬프트 준수도가 향상된 OpenAI의 최신 이미지 생성 모델입니다. 선명한 텍스트 렌더링과 정교한 편집을 지원합니다.

비례 과금이 적용되는 4단계 품질(low/medium/high/auto)
강력한 지시 이행력과 프롬프트 준수도
선명한 이미지 내 텍스트 렌더링
보통울트라
자세히 보기

GPT Image 1

OpenAI

40 크레딧

LLM 게이트웨이를 통해 OpenAI Images API로 제공되는 OpenAI의 네이티브 멀티모달 이미지 생성 모델입니다. 정확한 이미지 내 텍스트 렌더링, 강력한 지시 이행력, 세밀한 스타일 제어를 제공하며 토큰 단위로 과금됩니다.

네이티브 멀티모달 이미지 생성 (텍스트·이미지 입력, 이미지 출력)
정확한 이미지 내 텍스트 렌더링
강력한 지시 이행력과 스타일 제어
보통울트라
자세히 보기

GPT Image 1 Mini

OpenAI

8 크레딧

LLM 게이트웨이를 통해 OpenAI Images API로 제공되는 GPT Image 1의 저렴하고 빠른 티어입니다. 동일한 토큰 과금 생성 플로우를 훨씬 낮은 비용으로 제공하여 드래프트와 대량 이미지 생성에 적합합니다.

GPT Image 1의 저가·고속 이미지 생성 티어
토큰 기반 과금: 텍스트 입력 토큰(1M당 3,716 크레딧)과 이미지 출력 토큰(1M당 14,864 크레딧)이 별도 과금
네이티브 멀티모달 생성 플로우 (텍스트·이미지 입력, 이미지 출력)
빠름높음
자세히 보기

Grok Imagine Image 2.0

xAI

140 크레딧

xAI의 최신 Grok Imagine 이미지 모델로, xAI 직결 API로 제공됩니다. 인포그래픽, 광고, 게임 에셋, UI/UX 목업, 스토리보드처럼 정밀한 구성이 필요한 작업에 강합니다.

Grok Imagine 계열 최신 이미지 생성 모델
인포그래픽·광고·목업에 적합한 정밀 레이아웃 제어
요청당 최대 10장 생성 (장당 과금)
빠름높음
자세히 보기

Grok Imagine Image

xAI

47 크레딧

xAI 직결 API로 제공되는 Grok Imagine 모델로 이미지를 생성합니다. 빠르고 저렴한 text-to-image 생성이 강점입니다. 기존 이미지 편집은 xai/grok-imagine-image/edit 모델을 사용하세요.

빠르고 저렴한 text-to-image 생성
요청당 최대 10장 생성 (장당 과금)
14종의 종횡비 프리셋과 auto 옵션
빠름표준
자세히 보기

Grok Imagine Image Quality

xAI

120 크레딧

Grok Imagine 계열에서 가장 높은 품질의 이미지 모델로, xAI 직결 API로 제공됩니다. 디테일이 살아 있는 완성도 높은 렌더에 적합합니다.

Grok Imagine 계열 최고 출력 품질
요청당 최대 10장 생성 (장당 과금)
14종 종횡비 프리셋 + auto
보통울트라
자세히 보기

Grounding DINO

Grounding DINO

2 크레딧

자연어 프롬프트 기반 객체 감지입니다 (3,900만+ 실행). 찾고 싶은 것을 말로 설명하면('red car, person wearing a hat') 신뢰도 점수가 붙은 바운딩 박스와 시각화 이미지를 반환합니다.

자연어 기반 제로샷 감지
바운딩 박스 + 신뢰도 점수 (JSON)
주석이 그려진 시각화 이미지
빠름높음
자세히 보기

Hunyuan 3D 3.1

Tencent

1160 크레딧

Tencent의 플래그십 3D 생성 모델입니다. 텍스트 프롬프트 또는 이미지로 고폴리곤 텍스처 3D 모델을 만들고, PBR(물리 기반 렌더링) 머티리얼 옵션을 지원합니다.

텍스트→3D와 이미지→3D를 하나의 모델로
최대 50만 페이스 고폴리곤 출력
PBR 머티리얼 생성 옵션
느림울트라
자세히 보기

Ideogram V4 Balanced

Ideogram

140 크레딧

Ideogram v4 패밀리의 중간 티어로, 생성 속도와 출력 품질 사이의 균형을 맞췄습니다. Quality 티어보다 낮은 비용으로 강력한 타이포그래피와 포토리얼리즘을 제공합니다.

Ideogram v4 패밀리 내에서 속도와 품질의 균형을 갖춘 티어
자연어 prompt 사용 시 Magic Prompt 자동 향상
정밀하고 반복 가능한 제어를 위한 구조화된 json_prompt 입력
보통높음
자세히 보기

Ideogram V4 Quality

Ideogram

230 크레딧

Ideogram v4 모델 패밀리 중 가장 높은 충실도의 티어로, 최대한의 디테일과 사실적 표현, 정확한 타이포그래피에 최적화되어 있습니다. 속도보다 품질이 중요한 최종 프로덕션 에셋에 가장 적합합니다.

Ideogram v4 패밀리 내 가장 높은 충실도의 티어
자연어 prompt 사용 시 Magic Prompt 자동 향상
정밀하고 반복 가능한 제어를 위한 구조화된 json_prompt 입력
느림울트라
자세히 보기

Ideogram V4 Turbo

Ideogram

70 크레딧

Ideogram v4 패밀리에서 가장 빠르고 저렴한 모델로, Ideogram 특유의 텍스트 렌더링과 스타일 일관성을 유지하면서 빠른 반복 작업에 최적화되어 있습니다.

Ideogram v4 패밀리 중 가장 빠르고 저렴한 티어
자연어 prompt 사용 시 Magic Prompt 자동 향상
정밀하고 반복 가능한 제어를 위한 구조화된 json_prompt 입력
빠름표준
자세히 보기

Ideogram V3 Turbo

Ideogram

70 크레딧

Ideogram v3 중 가장 빠르고 저렴한 등급입니다. V3는 놀라운 사실감, 창의적인 디자인, 일관된 스타일의 이미지를 생성합니다.

Ideogram v3 중 가장 빠르고 저렴한 등급
종횡비 외에 60개 이상의 고정 해상도 프리셋 제공
image + mask를 통한 인페인팅 지원
빠름높음
자세히 보기

Ideogram Character

Ideogram

350 크레딧

레퍼런스 이미지 한 장으로 일관된 캐릭터를 생성하는 모델입니다. 실사부터 픽션까지 다양한 스타일로 동일 캐릭터를 렌더링하고, 마스크 인페인팅으로 기존 사진에 캐릭터를 삽입할 수 있으며, Ideogram 특유의 강점인 정확한 텍스트 렌더링까지 지원합니다.

레퍼런스 이미지 단 한 장으로 일관된 캐릭터 생성
Auto·Fiction·Realistic 캐릭터 스타일 타입
마스크 인페인팅으로 기존 이미지에 캐릭터 삽입
보통울트라
자세히 보기

MiniMax Image-01

MiniMax

23 크레딧

MiniMax의 첫 이미지 생성 모델로 캐릭터 레퍼런스를 지원합니다. subject_reference에 얼굴 사진 한 장만 넣으면 프롬프트·스타일·화면 비율이 바뀌어도 동일 인물을 일관되게 생성하며, 요청당 최대 9장까지 만들 수 있습니다.

subject_reference 얼굴 사진 한 장으로 캐릭터 일관성 유지
요청당 1~9장 배치 생성
정사각 1:1부터 시네마틱 21:9까지 8가지 화면 비율
빠름높음
자세히 보기

Topaz Image Upscale

Topaz Labs

190 크레딧

사진 향상의 업계 표준 Topaz Labs의 프로페셔널 업스케일러입니다. 5가지 특화 향상 모델, 최대 6배 확대, 피사체 감지, 얼굴 보정 옵션을 제공합니다.

업계 표준 Topaz 향상 품질
5가지 향상 모델: Standard / Low Resolution / CGI / High Fidelity / Text Refine
최대 6배 확대
보통울트라
자세히 보기

Imagen 4

Google

93 크레딧

Google의 플래그십 텍스트-이미지 모델인 Imagen 4입니다.

Google의 플래그십 Imagen 4 품질 등급
1K·2K 출력 해상도를 동일한 고정 요금으로 제공
조절 가능한 안전 필터 강도
보통울트라
자세히 보기

Imagen 4 Fast

Google

46 크레딧

최고 품질보다 속도와 비용이 중요할 때 사용하는 Imagen 4의 고속 버전입니다.

Imagen 4 계열 중 가장 저렴한 등급
빠른 반복 실험에 최적화된 생성 속도
조절 가능한 안전 필터 강도
빠름표준
자세히 보기

Bria Increase Resolution

Bria

93 크레딧

상업적으로 안전한 Bria의 이미지 업스케일러입니다 (13만+ 실행). 라이선스 데이터만으로 학습된 모델로 해상도를 2배 또는 4배 확대하며 알파(투명) 채널을 보존합니다. 법적 책임 보장이 필요한 기업 파이프라인을 위해 설계되었습니다.

라이선스 데이터만으로 학습 — 상업적으로 안전
2배 또는 4배 해상도 확대 (desired_increase)
알파 채널 보존 — 배경 제거 후 사용에 최적
빠름높음
자세히 보기

Krea 2 Large

Krea AI

140 크레딧

포토리얼리스틱한 결과물과 강력한 프롬프트 이행력에 초점을 맞춘 Krea AI의 플래그십 텍스트-투-이미지 모델입니다. 스타일 레퍼런스와 무드보드 기반 생성을 지원하여 일관된 비주얼 디렉션을 유지할 수 있습니다.

강력한 프롬프트 이행력을 갖춘 포토리얼리스틱 출력
최대 10장의 이미지로부터 스타일을 전이하고 강도를 조절 가능
Krea 웹앱 기반 무드보드 연동 생성
보통높음
자세히 보기

Krea 2 Medium

Krea AI

70 크레딧

Krea 2 Large의 저비용 버전으로, 동일한 포토리얼리즘 스타일에 집중하면서 일부 정밀도를 더 빠르고 저렴한 생성과 맞바꾼 모델입니다.

Krea 2 Large와 동일한 포토리얼리즘 스타일에 집중하면서 더 저렴하고 빠른 자매 모델
creativity 슬라이더(raw/low/medium/high)로 모델이 프롬프트에서 얼마나 벗어날지 조절
최대 10장의 스타일 참조 이미지로 결과물에 시각적 스타일 전달
빠름표준
자세히 보기

Microsoft MAI-Image 2.5 Pro

Microsoft

400 크레딧

Fal.AI를 통해 제공되는 Microsoft의 최상급 이미지 생성 모델로, 프로덕션급 텍스트-투-이미지 생성을 위해 설계되었습니다. 히어로 이미지, 정교한 구도, 정확한 텍스트 렌더링, 포토리얼리즘, 스타일화된 일러스트, 상업용 디자인, 비주얼이 풍부한 컨셉 작업에 적합합니다.

프로덕션 및 상업적 활용에 맞춘 고품질 출력
이미지 내 텍스트의 정확한 렌더링
한 번의 호출로 최대 4장까지 이미지 생성
보통울트라
자세히 보기

Moondream2

Moondream

5 크레딧

작지만 유능한 비전-언어 모델입니다 (1,400만+ 실행). 어떤 이미지든 자유롭게 질문하면 상세한 답변을 받습니다. 태깅·모더레이션 준비·풍부한 대체 텍스트용 고효율 VQA입니다.

이미지에 대한 자유 형식 질문
여러 문장의 상세한 답변
작은 모델 — 빠르고 저렴 (7크레딧)
빠름높음
자세히 보기

Multilingual E5 Large

E5

2 크레딧

다국어 텍스트 임베딩 모델입니다 (7,400만+ 실행). 한국어 포함 100개 언어에서 1024차원 벡터를 생성합니다. Core.Today 고객 데이터베이스의 벡터 검색(knn_vector)과 완벽하게 조합됩니다.

한국어 포함 100개 언어 1024차원 임베딩
호출당 여러 텍스트 배치 임베딩
정규화 임베딩 옵션 (코사인 유사도 바로 사용)
빠름높음
자세히 보기

Muse Image 1.0

Meta

24 크레딧

Meta 개발자 API 직결로 제공되는 Meta Muse Image 모델입니다. 웹·이미지 검색 그라운딩이 내장된 text-to-image 생성으로, 요청당 최대 10장, webp/png/jpeg 출력을 지원합니다. 기존 이미지 편집은 meta/muse-image-1.0/edit 모델을 사용하세요.

추가 비용 없는 웹·이미지 검색 그라운딩 내장
요청당 최대 10장 생성 (장당 과금)
WxH 크기 프리셋으로 종횡비 지정
보통높음
자세히 보기

Nano Banana 2 (Gemini 3.1 Flash Image)

Google

190 크레딧

Gemini 3.1 Flash Image 기반의 Google 고속 이미지 생성 모델입니다. Nano Banana Pro의 고효율 버전으로, Pro급 시각 품질을 Flash 속도와 가격으로 제공합니다. 대화형 편집, 다중 이미지 융합, 캐릭터 일관성, 정확한 텍스트 렌더링, Google 검색 연동을 지원합니다. 최대 14장의 참조 이미지와 4K 해상도를 지원합니다.

Gemini 3.1 Flash Image 기반 Pro급 품질 생성
다국어 정확한 텍스트 렌더링
Google 웹 검색 및 이미지 검색 연동
빠름울트라
자세히 보기

Nano Banana 2 Lite

Google

80 크레딧

Gemini 3.1 Flash Image 기반의 가볍고 빠른 Nano Banana 2 변형 모델로, 더 빠르고 저렴한 생성에 최적화되어 있습니다. 대화형 편집, 멀티 이미지 퓨전, 캐릭터 일관성 등 풀 버전 Nano Banana 2의 핵심 기능을 그대로 유지합니다.

풀 버전 Nano Banana 2보다 빠르고 저렴한 변형 모델
Gemini 3.1 Flash Image 기반
대화형 지시 기반 편집
빠름표준
자세히 보기

Nano Banana

Google

91 크레딧

멀티모달 편집 기능을 갖춘 Google Gemini 2.5 Flash 기반 이미지 생성 모델입니다. 생성과 편집 작업 모두에 빠르고 다재다능합니다.

Gemini 2.5 Flash 기반 생성
멀티모달 이미지 편집
빠른 생성 속도
빠름높음
자세히 보기

Nano Banana Pro (Gemini 3 Pro Image)

Google

350 크레딧

Gemini 3 Pro 기반의 Google 최첨단 이미지 생성 및 편집 모델입니다. 다국어 텍스트 렌더링, Google 검색을 통한 실시간 정보 연동, 전문가급 크리에이티브 제어 기능을 제공합니다. 최대 14장의 참조 이미지와 4K 해상도를 지원합니다.

Gemini 3 Pro 기반 고급 추론 생성
다국어 텍스트 렌더링 지원
Google 검색 연동 실시간 데이터 시각화
보통울트라
자세히 보기

NSFW Image Detection

Falcons.ai

1 크레딧

NSFW 이미지 분류의 표준입니다 (1억 2,700만+ 실행). 어떤 이미지든 'normal' 또는 'nsfw'로 판정합니다. UGC 플랫폼의 필수 모더레이션 게이트로, 이미지당 1크레딧입니다.

1억 2,700만+ 실행 — 모더레이션 표준
normal/nsfw 단순 판정 출력
이미지당 1크레딧 — 전체 업로드에 적용 가능
빠름높음
자세히 보기

Kling O1 Image

Kuaishou

66 크레딧

Kling O1은 강력한 레퍼런스 제어 하에서 정밀한 이미지 편집을 수행합니다. 최대 10개의 참조 이미지와 캐릭터 요소를 넣고 프롬프트에서 @Image1, @Element1처럼 직접 지목하면, 시각적 일관성을 유지한 채 피사체·스타일·세부 요소를 변형합니다.

프롬프트에서 @Image1 / @Element1로 참조를 직접 지목
참조 이미지와 캐릭터 요소 합쳐 최대 10개
정면 이미지 + 추가 참조 뷰로 구성하는 캐릭터 요소
보통울트라
자세히 보기

Pruna P-Image

Pruna AI

12 크레딧

Pruna AI가 경량화(distilled)한 text-to-image 모델로, 매우 낮은 비용과 높은 처리량에 최적화되어 있습니다. 빠른 속도와 저렴한 가격 덕분에 Replicate에서 가장 많이 실행된 커뮤니티 모델 중 하나입니다(1,560만+ 실행).

매우 낮은 비용과 높은 처리량에 맞춰 조정된 경량화(distilled) 아키텍처
Replicate에서 가장 많이 실행된 커뮤니티 모델 중 하나(1,560만+ 실행)
aspect_ratio=custom 모드로 너비/높이를 직접 지정 가능(16의 배수, 최대 1440px)
빠름표준
자세히 보기

Pruna P-Image Upscale

Pruna AI

12 크레딧

최대 1억 2,800만 화소(128MP) 출력을 지원하는 PrunaAI의 하이엔드 이미지 업스케일러입니다 (57만+ 실행). 목표 메가픽셀 또는 배율 기반 제어, 디테일·리얼리즘 강화 옵션을 제공하며, 15크레딧부터 시작하는 메가픽셀 티어 과금을 사용합니다.

최대 128MP 출력 — 포스터·대형 인쇄 영역
두 가지 모드: 목표 메가픽셀(정밀 과금) 또는 배율(1-8배)
enhance_details·enhance_realism 강화 옵션
보통울트라
자세히 보기

PhotoMaker

Tencent ARC

10 크레딧

레퍼런스 사진 1-4장으로 인물의 스타일 사진을 생성합니다 (900만+ 실행). Cinematic, Disney Character, Digital Art 등 10가지 스타일 — 얼굴 정체성은 유지하고 나머지를 바꿉니다.

사진 1-4장으로 정체성을 유지한 생성
10가지 내장 스타일
프롬프트로 장면·의상 제어
보통높음
자세히 보기

PhotoMaker Style

Tencent ARC

15 크레딧

PhotoMaker의 스타일화 특화 버전: 인물 사진 1-4장을 더 강력한 스타일 트랜스퍼로 회화·코믹·3D 아트 등으로 변환합니다. 기본 PhotoMaker와 짝을 이루는 모델로, 사실감보다 스타일이 중요할 때 이 모델을 사용하세요.

기본 PhotoMaker보다 강력한 스타일 트랜스퍼
레퍼런스 사진 1-4장으로 정체성을 유지한 생성
Cinematic, Disney Character, Digital Art, Comic book 등 10가지 스타일 프리셋
보통높음
자세히 보기

Professional Headshot

Black Forest Labs

93 크레딧

FLUX.1 Kontext [pro] 기반으로 사진 한 장을 세련된 비즈니스 프로필 사진으로 변환합니다. 화이트·블랙·그레이·뉴트럴·오피스 배경 중 하나를 고르면 링크드인에 바로 쓸 수 있는 인물 사진이 한 번에 완성됩니다.

사진 한 장으로 스튜디오 없이 전문 프로필 사진 생성
비즈니스 인물 사진에 특화된 FLUX.1 Kontext [pro] 앱
화이트·블랙·뉴트럴·그레이·오피스 5가지 배경 프리셋
빠름높음
자세히 보기

Proteus v0.2

Proteus

49 크레딧

인기 애니메이션 특화 이미지 모델입니다 (1,200만+ 실행). 고품질 애니메·일러스트 스타일과 img2img·인페인팅을 지원합니다. 애니메 아바타·웹툰풍 아트의 대표 선택지입니다.

애니메·일러스트 특화
img2img·마스크 인페인팅
실행당 최대 4장 (이미지당 과금)
보통높음
자세히 보기

PuLID

ByteDance

20 크레딧

ByteDance PuLID: SDXL 기반의 튜닝 없는 정체성 커스터마이징 모델입니다. 얼굴 사진 한 장과 프롬프트만으로 어떤 장면·스타일의 인물 사진도 생성 — 별도 학습 없이 4스텝 고속 샘플링, 두 얼굴 혼합까지 지원합니다. 이미지당 2크레딧의 압도적인 가성비가 강점입니다.

얼굴 사진 한 장으로 학습 없이 정체성 보존
SDXL 기반 4스텝 초고속 샘플링
mix_identities: 서로 다른 두 얼굴을 한 인물로 혼합
빠름높음
자세히 보기

Real-ESRGAN

Real-ESRGAN

5 크레딧

가장 널리 쓰이는 클래식 이미지 업스케일러입니다 (9,400만+ 실행). 최대 10배 Real-ESRGAN 초해상도와 GFPGAN 얼굴 보정 옵션을 제공하는, 사진·AI 이미지 확대의 표준 모델입니다.

검증된 업스케일러 (9,400만+ 실행)
최대 10배 확대
GFPGAN 얼굴 보정 옵션
빠름높음
자세히 보기

Recraft V4

Recraft

93 크레딧

Recraft의 차세대 text-to-image 모델로, V3 대비 타이포그래피 처리, 스타일 범위, 프롬프트 반영도를 개선하여 프로덕션급 브랜드·디자인 에셋 제작에 적합합니다.

Recraft V3 대비 향상된 타이포그래피 처리
더 넓은 스타일 범위와 강화된 프롬프트 반영도
최대 10,000자의 긴 프롬프트 지원
보통높음
자세히 보기

Recraft V4 SVG

Recraft

190 크레딧

Recraft V4를 기반으로 SVG 형식의 벡터 그래픽을 직접 생성합니다. 로고, 아이콘 등 어떤 크기에서도 선명함을 유지해야 하는 확장 가능한 일러스트에 적합합니다.

래스터 이미지가 아닌 진짜 벡터 그래픽으로, SVG를 직접 출력
Recraft V4 기반으로 향상된 타이포그래피와 프롬프트 반영도
어떤 크기로 확대해도 선명함을 유지해야 하는 에셋에 적합
보통높음
자세히 보기

Recraft V3

Recraft

93 크레딧

Recraft V3(코드명 red_panda)는 긴 텍스트 생성이 가능하고 폭넓은 스타일을 지원하는 텍스트-이미지 모델입니다. Artificial Analysis Text-to-Image Benchmark 기준 SOTA 성능을 보유하고 있습니다.

텍스트-이미지 모델 중 벤치마크 최고 수준 성능
길고 정확한 이미지 내 텍스트 렌더링
사실적인 사진부터 디지털 일러스트까지 19가지 큐레이션 스타일
보통높음
자세히 보기

Recraft Crisp Upscale

Recraft

14 크레딧

선명하고 또렷한 결과에 최적화된 Recraft의 빠르고 저렴한 업스케일러입니다. 이미지 하나만 넣으면 튜닝 없이 동작합니다. UI 에셋, 일러스트, 상품 이미지의 기본 선택지로 좋습니다.

선명함에 최적화된 크리스프 업스케일
튜닝 없는 단일 입력 API
빠른 처리 속도
빠름높음
자세히 보기

Remove Background

Bria AI

32 크레딧

AI 기반 이미지 배경 제거 도구입니다. 전문적인 수준의 엣지 감지로 모든 피사체에 대해 깔끔하고 정확한 컷아웃을 제공합니다.

정밀한 엣지 감지
깔끔한 배경 제거
모든 피사체 유형에 적용 가능
빠름높음
자세히 보기

Remove BG

lucataco

1 크레딧

Replicate 최다 실행 배경 제거 모델 중 하나입니다 (1,700만+ 실행). 파라미터 하나로 배경을 제거하고 투명 PNG를 반환하는 초간단 API — 이미지당 1크레딧으로 플랫폼에서 가장 저렴한 누끼입니다.

1,700만+ 실행 — 대규모로 검증된 안정성
파라미터는 이미지 하나뿐
투명 PNG 출력
빠름표준
자세히 보기

Stable Diffusion XL

Stability AI

9 크레딧

Stability AI의 클래식 SDXL입니다 (8,500만+ 실행). img2img, 인페인팅, 리파이너, LoRA를 지원하는 검증된 텍스트-이미지 모델로, 방대한 생태계를 가진 믿을 수 있는 워크호스입니다.

검증된 클래식 (8,500만+ 실행)
img2img·마스크 인페인팅
expert-ensemble 리파이너 지원
보통높음
자세히 보기

SDXL Lightning 4-step

ByteDance

4 크레딧

Replicate 역대 최다 실행 모델인 ByteDance의 4스텝 SDXL Lightning입니다 (10억+ 실행). 1024px 이미지를 거의 즉시, 카탈로그 최저가 수준으로 생성합니다.

10억+ 실행 — Replicate 역대 최다 실행 모델
4스텝 생성으로 거의 즉각적인 결과
최대 1280px 출력, 요청당 최대 4장
빠름표준
자세히 보기

Seedream 5 Lite

ByteDance

82 크레딧

Seedream 5.0 lite는 논리 추론, 예시 기반 편집, 전문 도메인 지식을 갖춘 이미지 생성 모델입니다. 최대 14장의 멀티 레퍼런스 생성과 연속 배치 생성을 지원합니다.

예시 기반 편집 — before/after 쌍을 보여주면 같은 변형을 새 이미지에 적용
공간 관계·물리·과정을 이해하는 논리 추론
건축·과학·의료·디자인 전반의 전문 도메인 지식
빠름높음
자세히 보기

Seedream 5 Pro

ByteDance

210 크레딧

바이트댄스의 플래그십 Seedream 5.0 Pro 이미지 생성 모델로, 내장 추론과 정밀한 지시 이행, 최대 10장의 멀티 레퍼런스 생성을 지원합니다. Seedream 5 Lite보다 높은 충실도의 1K/2K 해상도 출력을 제공합니다.

정밀한 지시 이행을 위한 내장 추론 능력
최대 10장의 입력 이미지를 활용한 멀티 레퍼런스 생성
1K/2K 해상도 출력 지원
보통울트라
자세히 보기

Seedream 4.5

ByteDance

90 크레딧

공간 이해력과 세계 지식이 강화된 ByteDance의 업그레이드 이미지 모델입니다. 단일/다중 참조 이미지 편집과 순차(다중 이미지) 생성을 지원합니다.

강력한 공간 이해력과 세계 지식
다중 참조 이미지-이미지 생성 (최대 14개 입력 이미지)
한 번의 호출로 최대 15개의 연관 이미지를 생성하는 순차 생성 모드
보통울트라
자세히 보기

Seedream 4.0

ByteDance

70 크레딧

뛰어난 프롬프트 이해력과 창의적 능력을 갖춘 ByteDance의 최신 이미지 생성 모델입니다.

고급 언어 이해
창의적 구성
뛰어난 텍스트 렌더링
보통높음
자세히 보기

Text Extract OCR

OCR

3 크레딧

가장 많이 쓰이는 심플 OCR입니다 (9,100만+ 실행). 이미지 하나를 넣으면 텍스트를 plain text로 반환합니다. 영수증·스크린샷·스캔 문서 처리의 기본 선택지로, 단 1크레딧입니다.

입력 하나, plain text 출력
9,100만+ 실행으로 검증됨
이미지당 1크레딧 — 대량 처리에 최적
빠름표준
자세히 보기

TRELLIS

Microsoft

77 크레딧

Microsoft의 TRELLIS 이미지→3D 모델입니다 (83만+ 실행, Replicate 최다 사용 3D 모델). 이미지 1장 이상으로 텍스처가 입혀진 GLB 3D 에셋을 만들고, 턴테이블 렌더 영상과 Gaussian PLY도 출력할 수 있습니다.

Replicate 최다 사용 3D 모델
이미지 1장 또는 여러 장 입력
텍스처 GLB 내보내기 (generate_model)
보통높음
자세히 보기

Z-Image Turbo (fal)

Tongyi-MAI

9 크레딧

Tongyi-MAI의 Z-Image Turbo. 60억 파라미터 텍스트-이미지 모델로 속도에 최적화되어 있어 8스텝만으로 완성된 이미지를 만듭니다. 출력 메가픽셀 단위로 과금되므로 작은 프리셋일수록 비례해서 저렴하고, 대량 생성에 가장 경제적인 선택지 중 하나입니다.

최소 8스텝으로 완성 이미지 생성
메가픽셀 단위 과금 — 작은 프리셋은 비례해 저렴
512x512부터 1024x1024까지 6종 비율 프리셋
빠름높음
자세히 보기

Google Upscaler

Google

46 크레딧

Google의 이미지 업스케일러입니다 (77만+ 실행). 생성형 AI로 자연스러운 디테일을 유지하며 이미지를 2배 또는 4배 확대하고, 출력 압축 품질을 조절할 수 있습니다. 고정 가격의 간결하고 신뢰할 수 있는 업스케일러입니다.

생성형 디테일 보존과 함께 2배·4배 업스케일
Google 수준의 품질과 일관성
출력 압축 품질 조절 (1-100)
빠름높음
자세히 보기

Z-Image Turbo

Pruna AI

40 크레딧

Pruna의 초고속 Z-Image Turbo입니다 (4,800만+ 실행). 최대 2048x2048까지 메가픽셀 단위로 과금되어 생성한 해상도만큼만 지불합니다. 대량 사용에 뛰어난 가성비를 제공합니다.

8스텝 초고속 터보 생성
메가픽셀 과금 — 생성한 만큼만 지불
최대 2048x2048 출력
빠름높음
자세히 보기

비디오 생성 모델

Kling, MiniMax 등 최신 모델로 AI 비디오를 제작하세요

Add Watermark

추천

FullJourney

1 크레딧

어떤 영상에든 텍스트 워터마크를 추가합니다. 생성 콘텐츠나 사용자 콘텐츠의 브랜드 보호를 영상당 2크레딧으로 간단하고 빠르게 처리합니다.

어떤 영상에든 텍스트 워터마크
크기 조절
영상당 2크레딧
빠름표준
자세히 보기

CogVLM2 Video

CogVLM

28 크레딧

비디오 이해·캡셔닝 모델입니다. 영상에 대해 자유롭게 질문하면 동작·장면·내용에 대한 상세한 답변을 받습니다. 비디오 검색 인덱싱과 모더레이션 준비에 유용합니다.

비디오 내용에 대한 자유 질문
동작·장면 이해
여러 문장의 상세한 답변
보통높음
자세히 보기

Grok Imagine Video Edit

xAI

2790 크레딧

xAI Grok Imagine Video 모델로 기존 영상을 편집합니다. 출력은 원본 영상의 길이·해상도(720p 상한)·종횡비를 그대로 상속합니다.

프롬프트 기반 기존 영상 편집
원본의 길이·해상도(720p 상한)·종횡비를 출력이 상속
출력에 동기화된 오디오 포함
보통표준
자세히 보기

Gemini Omni 1.1 Flash

Google

3490 크레딧

구글의 빠른 멀티모달 비디오 생성·편집 모델로, Interactions API 기반에 네이티브 오디오를 지원합니다. 텍스트-비디오, 이미지-비디오, 키프레임 보간, 레퍼런스-비디오, 비디오 편집을 360p부터 4K까지 하나의 모델로 처리합니다.

모든 비디오에 네이티브 동기화 오디오 — 대사, 효과음, 앰비언트 사운드
비디오 편집: 바꿀 부분만 프롬프트로 설명하면 나머지는 그대로 유지
시작·끝 프레임 사이 키프레임 보간 — 카메라 오빗, 줌, 타임랩스, 심리스 루프
빠름높음
자세히 보기

Google Gemini Omni Flash

Google

2320 크레딧

Fal.AI를 통해 제공되는 Google Gemini Omni Flash 텍스트-투-비디오 모델입니다. 서술형 텍스트 프롬프트만으로 영상을 생성하며, 페이싱과 오디오(대사, 배경음악)도 프롬프트 안에서 직접 제어합니다. 16:9 또는 9:16 화면비로 3~10초 길이의 영상을 만들 수 있습니다.

단일 서술형 프롬프트만으로 텍스트-투-비디오 생성
대사와 배경음악을 프롬프트 텍스트 안에서 직접 제어 (별도의 오디오 토글 없음)
16:9(가로) 또는 9:16(세로) 화면비 지원
빠름높음
자세히 보기

Gen-4.5

Runway

1400 크레딧

Runway의 Gen-4.5 모델로, 텍스트-비디오 및 이미지-비디오 생성에서 최고 수준의 모션 품질, 프롬프트 반영도, 비주얼 퀄리티를 제공합니다.

최고 수준의 모션 품질과 프롬프트 반영도
화면 비율과 무관한 균일 초당 과금
선택적 첫 프레임 이미지를 활용한 텍스트-비디오·이미지-비디오 지원
보통울트라
자세히 보기

Bria Green Screen Background Removal

Bria

1740 크레딧

Fal.AI를 통해 제공되는 Bria의 크로마키 배경 제거 모델입니다. 그린스크린으로 촬영된 영상의 배경을 제거하고 그린 스필(초록 번짐)을 자동 억제해, 알파 지원 코덱에서는 투명 배경으로 깔끔하고 전문적인 엣지의 결과물을 출력합니다.

크로마키 배경 제거 — 알파 지원 코덱에서 투명 배경 출력
그린 스필 자동 억제로 피사체 주변 초록 번짐 제거
webm_vp9, mov_proresks, mp4, mkv, gif 등 9가지 출력 컨테이너/코덱
빠름높음
자세히 보기

Grok Imagine Video 1.5

xAI

4650 크레딧

xAI 직결 API로 제공되는 Grok Imagine Video 1.5: 텍스트-비디오와 이미지-비디오를 모두 지원하는 멀티모드 영상 생성 모델입니다. 동기화 오디오와 네이티브 1080p까지 지원합니다.

텍스트-비디오와 이미지-비디오 모두 지원 (이미지는 이제 선택 입력)
네이티브 1080p 출력 옵션
동기화 오디오 포함
보통울트라
자세히 보기

Grok Imagine Video

xAI

1300 크레딧

xAI 직결 API로 제공되는 Grok Imagine Video 모델입니다. 텍스트-비디오, 이미지-비디오 생성과 동기화된 오디오를 지원합니다. 기존 클립 편집은 xai/grok-imagine-video/edit 모델을 사용하세요.

텍스트-비디오 및 이미지-비디오 생성 지원
동기화된 오디오 트랙 포함
480p 또는 720p 출력, 1~15초
빠름높음
자세히 보기

MiniMax H3

MiniMax

1510 크레딧

Replicate를 통해 제공되는 MiniMax H3 멀티모달 비디오 생성 모델입니다. 텍스트-비디오, 첫/마지막 프레임 이미지-비디오, 레퍼런스 기반 생성(이미지·비디오·오디오를 프롬프트에서 인용)을 하나의 엔드포인트로 처리하며, 768P 또는 2K로 4~15초 영상을 생성합니다.

텍스트-비디오·이미지-비디오·레퍼런스 생성을 하나의 엔드포인트로
첫/마지막 프레임 지정으로 시작·끝 구도를 정밀 제어
레퍼런스 이미지 최대 9장, 비디오 3개, 오디오 3개
보통울트라
자세히 보기

MiniMax Hailuo 2.3

MiniMax

650 크레딧

고급 캐릭터 일관성과 자연스러운 움직임을 갖춘 사실적인 인물 모션 비디오 생성 모델입니다.

사실적인 인물 모션
고급 캐릭터 일관성
자연스러운 움직임 생성
느림울트라
자세히 보기

MiniMax Hailuo 2.3 Fast

MiniMax

450 크레딧

인물 모션 비디오의 좋은 품질을 유지하면서 더 빠른 생성을 위해 최적화된 Hailuo 2.3의 저지연 버전입니다.

Hailuo 2.3보다 빠른 생성 속도
좋은 인물 모션 품질
캐릭터 일관성
보통높음
자세히 보기

Happy Horse 1.1

Alibaba

2090 크레딧

알리바바의 Happy Horse 1.1은 텍스트로 비디오를 생성하고, 단일 이미지를 애니메이션화하며, 여러 레퍼런스 이미지로부터 비디오를 만들어냅니다. 720p·1080p 해상도, 3~15초 길이, 5가지 화면 비율을 지원합니다.

하나의 모델로 3가지 모드: 텍스트-비디오, 이미지-비디오, 레퍼런스-비디오
최대 9장의 이미지를 활용한 레퍼런스-비디오 — 피사체와 장면의 일관성 유지
720p·1080p 해상도, 3~15초 길이
보통높음
자세히 보기

Flux 3 Image to Video

Black Forest Labs

1980 크레딧

FLUX.3는 Black Forest Labs의 프런티어 비디오 모델입니다. 이 엔드포인트는 한 장의 스틸 이미지를 720p 또는 1080p, 5~20초의 자연스러운 움직임으로 애니메이션화하며, 영상과 함께 동기화된 오디오를 생성하고 세이프티 허용 수준을 조절할 수 있습니다.

1080p 출력 — 네이티브 오디오를 지원하는 이미지-투-비디오 엔드포인트 중 최고 해상도
5~20초 길이, 초 단위 과금
오디오를 나중에 덧입히는 방식이 아니라 영상과 함께 생성
보통울트라
자세히 보기

MiniMax Hailuo-03 (H3) Image to Video

MiniMax

1510 크레딧

Fal.AI를 통해 제공되는 MiniMax Hailuo-03(H3) 이미지-투-비디오 모델입니다. 첫 프레임 이미지를 기반으로 2K 해상도의 5~15초 영상을 생성하며, 네이티브 오디오와 end_image_url을 이용한 첫-마지막 키프레임 제어를 지원합니다.

단일 첫 프레임 이미지로부터 바로 영상 생성
최대 2K 해상도 출력
5~15초 범위에서 길이 조절 가능
보통울트라
자세히 보기

Seedance 2.5 Image to Video

ByteDance

5500 크레딧

Fal.AI를 통해 제공되는 ByteDance Seedance 2.5 이미지-투-비디오 모델입니다. 한 장의 스틸 이미지를 480p/720p, 최대 30초의 영상으로 애니메이션화하며, 여러 클립을 이어붙일 때 생기는 드리프트가 없습니다. 마지막 프레임 지정과 동기화 오디오 생성도 같은 패스에서 지원합니다.

한 장의 스틸 이미지를 최대 30초 원테이크 영상으로 애니메이션화
end_image_url로 첫 프레임에서 마지막 프레임까지의 전환을 제어 가능
립싱크 음성을 포함한 동기화 오디오를 영상과 함께 생성
보통울트라
자세히 보기

Kling v3 Omni Video

Kuaishou

2610 크레딧

Kling Video 3.0 Omni는 텍스트, 이미지, 레퍼런스 이미지, 기존 비디오로부터 영상을 생성·편집하는 통합 멀티모달 비디오 모델입니다. 텍스트-비디오, 이미지-비디오, 레퍼런스 기반 생성, 비디오 편집을 네이티브 오디오와 멀티샷 제어로 하나의 모델에 통합했습니다.

3단계 품질: standard(720p), pro(1080p, 기본값), 4k
최대 7장의 레퍼런스 이미지로 캐릭터·스타일 일관성 유지한 생성
reference_video + video_reference_type=base로 비디오 편집 모드
느림울트라
자세히 보기

Kling v3 Video

Kuaishou

2610 크레딧

Kling Video 3.0은 최대 15초의 시네마틱 비디오를 생성하는 Kuaishou의 플래그십 텍스트/이미지-비디오 모델입니다. 멀티샷 제어, 네이티브 오디오, 시작/종료 프레임 이미지, 전용 4K 모드를 지원합니다.

최대 15초(3~15초)의 시네마틱 비디오 생성
3단계 품질: standard(720p), pro(1080p, 기본값), 4k
multi_prompt로 한 번의 생성에서 최대 6개의 연속 샷 제어
느림울트라
자세히 보기

Kling v2.6

Kuaishou

1630 크레딧

Kling 2.6 Pro: 시네마틱한 비주얼과 유려한 움직임, 네이티브 오디오 생성을 지원하는 최상위 이미지-비디오 모델입니다. 오디오 생성은 기본적으로 켜져 있습니다.

유려하고 자연스러운 움직임의 시네마틱 비주얼 품질
기본적으로 켜져 있는 네이티브 동기화 오디오 생성
5초 또는 10초 길이 선택
보통울트라
자세히 보기

Kling 2.5 Turbo Pro

Kuaishou

810 크레딧

향상된 모션과 장면 일관성을 갖춘 시네마틱급 비디오 생성 모델입니다. 프로페셔널 출력을 위한 최상위 Kling 모델입니다.

시네마틱급 출력 품질
향상된 모션 일관성
우수한 장면 일관성
보통울트라
자세히 보기

Kling v2.1

Kuaishou

580 크레딧

720p/1080p 지원과 프레임 전환 기능을 갖춘 Kling v2.1로, 부드럽고 고품질의 비디오를 생성합니다.

720p 및 1080p 출력 지원
부드러운 프레임 전환
이미지-비디오 변환 기능
느림울트라
자세히 보기

LatentSync

ByteDance

220 크레딧

ByteDance의 오픈소스 립싱크 모델입니다. 잠재 확산(latent diffusion)으로 영상의 입 모양을 어떤 오디오에든 다시 동기화합니다. 더빙·현지화를 위한 오픈소스 최고 수준의 립싱크 품질입니다.

영상 + 오디오 → 립싱크된 영상
오픈소스 최고 수준 립싱크
잠재 확산 기반 입 모양 재생성
느림높음
자세히 보기

MMAudio

MMAudio

11 크레딧

어떤 영상에든 AI 사운드를 입힙니다 (500만+ 실행). 영상 내용과 텍스트 프롬프트로 동기화된 오디오(앰비언스·효과음·폴리)를 합성합니다. 무음인 AI 생성 클립의 마무리에 완벽합니다.

영상과 동기화된 오디오 합성
사운드 방향을 지시하는 프롬프트 (선택)
네거티브 프롬프트 (기본값은 음악 제외)
보통높음
자세히 보기

Pruna P-Video

Pruna AI

240 크레딧

빠른 시안 작업을 위한 드래프트 모드를 내장한 PrunaAI의 고속 비디오 생성 모델입니다. 텍스트-비디오, 이미지-비디오, 오디오 조건 생성을 단일 엔드포인트로 지원하며, 최대 20초 클립 생성이 가능해 플랫폼에서 가장 긴 길이를 지원하는 모델 중 하나입니다.

내장 드래프트 모드: 표준 가격의 약 4분의 1로 저품질 미리보기 생성
단일 엔드포인트에서 텍스트-비디오와 이미지-비디오 모두 지원 (image 파라미터)
flac/mp3/wav 오디오 입력으로 비디오 생성 조건화 가능
빠름표준
자세히 보기

Pruna P-Video Animate

Pruna AI

1050 크레딧

Pruna AI의 모션 전이 비디오 모델 — 레퍼런스 이미지 속 피사체를 소스 비디오의 모션과 오디오로 애니메이션화합니다. 출력 1초당 약 5.24초 생성으로 속도와 비용에 최적화되어 있습니다.

모션·오디오 전이: 레퍼런스 피사체가 소스 비디오의 움직임을 수행
빠르고 저렴 — 출력 1초당 약 5.24초 생성
720p(약 1MP) 또는 1080p(약 2MP) 출력, 소스 비디오의 화면 비율 유지
빠름표준
자세히 보기

Pruna P-Video Avatar

Pruna AI

870 크레딧

Pruna AI의 토킹 아바타 비디오 모델입니다 — 하나의 입력 이미지를 애니메이션화하여 제공된 텍스트(voice_script)나 업로드된 오디오 트랙을 말하게 하며, Gemini 계열의 선택형 프리셋 보이스, 언어, 시각적 연출 프롬프트를 지원합니다.

단일 입력 이미지로부터 토킹 아바타 애니메이션 생성
29종의 Gemini 계열 프리셋 보이스를 통한 텍스트-음성 변환, 또는 업로드된 오디오 트랙으로 발화 구동
10개 언어 보이스 선택과 voice_prompt를 통한 전달 방식 조정
보통높음
자세히 보기

PixVerse V6

PixVerse

810 크레딧

PixVerse의 플래그십 비디오 생성 모델입니다. 동기화 오디오, 장면 전환이 있는 멀티샷 시퀀스, 놀라운 물리 표현, 정밀한 카메라 제어를 갖춘 시네마틱 비디오를 최대 1080p로 생성합니다.

동기화 AI 오디오: 배경음악, 효과음, 캐릭터 대사
generate_multi_clip_switch로 장면 전환이 있는 멀티샷 생성
놀랍도록 사실적인 물리 표현과 정밀한 카메라 제어
보통높음
자세히 보기

PixVerse V5

PixVerse

700 크레딧

특수 효과 기능과 애니메이션 최적화 출력을 갖춘 고급 비디오 생성 모델로, 다양한 시각적 스타일을 지원합니다.

특수 효과 기능
애니메이션 최적화 출력
다양한 시각적 스타일 (실사, 애니메, 3D)
느림울트라
자세히 보기

Luma Ray 3.2

Luma

1740 크레딧

Luma의 플래그십 Ray 비디오 모델입니다. 텍스트-비디오 및 키프레임(시작/종료 이미지) 생성을 지원하며, 선택적으로 HDR 인코딩 출력과 전문가용 EXR 익스포트를 제공합니다.

세밀한 프롬프트 제어가 가능한 플래그십 텍스트-비디오 생성
시작/종료 이미지로 첫/마지막 프레임을 고정하는 키프레임 모드
더 넓은 다이내믹 레인지를 위한 HDR 인코딩 MP4 출력
보통울트라
자세히 보기

Luma Ray Flash 2 720p

Luma

700 크레딧

Luma의 Ray Flash 2는 Ray 2보다 빠르고 저렴하게 5초 또는 9초의 720p 비디오를 생성합니다. 시작·종료 이미지를 통한 키프레임 제어, 매끄러운 루프 옵션, 풍부한 카메라 모션 콘셉트 라이브러리를 지원하며, 플랫폼에 처음 추가된 Luma 모델입니다.

720p 출력 기준 Ray 2보다 빠르고 저렴
키프레임 제어: 첫 프레임(start_image)과 마지막 프레임(end_image) 고정 가능
끊김 없이 반복 재생되는 루프 옵션
빠름높음
자세히 보기

Real-ESRGAN Video

Real-ESRGAN

1280 크레딧

Real-ESRGAN 기반 비디오 업스케일링입니다. 프레임 단위로 영상을 FHD·2K·4K로 향상합니다. 오래된 영상과 AI 생성 클립을 위한 대표적인 오픈소스 비디오 업스케일러입니다.

FHD / 2K / 4K 업스케일
애니메이션 특화 포함 3가지 모델 변형
프레임 단위 향상
느림높음
자세히 보기

MiniMax Hailuo-03 (H3) Reference to Video

MiniMax

1510 크레딧

Fal.AI를 통해 제공되는 MiniMax Hailuo-03(H3) 레퍼런스-비디오 모델입니다. 피사체·스타일 이미지, 모션 비디오 클립, 오디오 클립을 프롬프트에서 순서로 인용하는 멀티모달 레퍼런스로 비디오를 생성하며, 피사체 일관성을 유지하면서 참조한 모션과 오디오를 따릅니다.

피사체·스타일 이미지 + 모션 비디오 + 오디오를 한 요청에 담는 멀티모달 레퍼런스
프롬프트에서 순서로 인용 — Image 1, Video 1, Audio 1
생성된 테이크 전반의 피사체 일관성 유지
보통울트라
자세히 보기

Seedance 2.5 Reference to Video

ByteDance

5500 크레딧

Fal.AI를 통해 제공되는 ByteDance Seedance 2.5 레퍼런스-투-비디오 모델입니다. 이미지 30장, 비디오 10개, 오디오 10개까지 총 50개의 멀티모달 레퍼런스를 받아 캐릭터·세트·색감을 최대 30초 전체에 걸쳐 고정합니다. 프롬프트에서 @Image1, @Video1, @Audio1로 각 입력을 지칭하며 모션 트랜스퍼, 편집, 확장, 립싱크에 사용합니다.

한 번의 요청에 최대 50개 레퍼런스 파일 — 이미지 30장, 비디오 10개, 오디오 10개
프롬프트에서 @Image1, @Video1, @Audio1로 지칭해 레퍼런스별 역할을 명시
최대 30초 전체에 걸쳐 캐릭터·의상·색감 일관성 유지
보통울트라
자세히 보기

SadTalker

SadTalker

230 크레딧

사진 한 장과 오디오로 토킹헤드 영상을 만듭니다. 자연스러운 머리 움직임과 눈 깜빡임으로 얼굴을 애니메이션하며, GFPGAN 얼굴 향상 옵션을 제공합니다.

사진 1장 + 오디오 → 토킹헤드 영상
자연스러운 머리 움직임과 눈 깜빡임
미세한 움직임의 still 모드
느림높음
자세히 보기

Seedance 2.5

ByteDance

5500 크레딧

ByteDance의 플래그십 멀티모달 비디오 모델입니다. 네이티브 오디오와 최대 30초 단일 패스 생성을 지원하며, 이미지 30장·비디오 10개·오디오 10개까지의 대규모 레퍼런스 세트를 받습니다. 텍스트-투-비디오, 이미지-투-비디오, 첫/마지막 프레임 제어, 영상 편집·확장, 립싱크를 모두 한 모델에서 처리합니다.

이어붙이기 없이 한 번의 생성으로 최대 30초 네이티브 영상 제작
오디오와 영상을 함께 생성해 대사·효과음·배경음악이 처음부터 화면과 동기화
대규모 레퍼런스 세트 지원 — 이미지 30장, 비디오 10개, 오디오 10개를 프롬프트에서 [Image1], [Video1], [Audio1]로 지칭
보통울트라
자세히 보기

Seedance 2.0

ByteDance

1780 크레딧

네이티브 동기화 오디오를 갖춘 ByteDance의 차세대 멀티모달 비디오 모델입니다. 최대 9장의 레퍼런스 이미지, 3개의 비디오, 3개의 오디오를 한 번의 생성에 조합하여 캐릭터 일관성과 립싱크를 유지하는 비디오 생성·편집·확장을 지원합니다.

네이티브 오디오 생성 — 대사, 효과음, 배경음악이 영상과 동기화
멀티모달 레퍼런스 입력: 이미지 9장, 비디오 3개, 오디오 3개까지 한 번에
레퍼런스 이미지 기반 샷 간 캐릭터 일관성 유지
보통울트라
자세히 보기

Seedance 2.0 Fast

ByteDance

1430 크레딧

Seedance 2.0의 더 빠르고 저렴한 변형 모델로, 최대 9장의 이미지·3개의 비디오·3개의 오디오 레퍼런스 입력과 네이티브 오디오를 480p 또는 720p로 지원합니다.

Seedance 2.0보다 빠르고 저렴한 대안 (480p/720p만 지원, 1080p/4K 없음)
대사·효과음·배경음악을 포함한 네이티브 오디오 생성
멀티모달 레퍼런스 입력: 이미지 9장, 비디오 3개, 오디오 3개까지
빠름높음
자세히 보기

Seedance 2.0 Mini

ByteDance

890 크레딧

ByteDance Seedance 2.0의 경량·저비용 버전입니다. 네이티브 오디오, 멀티모달 레퍼런스 입력(이미지/비디오/오디오), 텍스트-비디오 및 이미지-비디오 생성을 지원하며 최대 720p까지 제공합니다(1080p/4K 티어 없음).

대사, 효과음, 배경음악을 포함한 네이티브 동기화 오디오 생성
최대 9개 레퍼런스 이미지, 3개 레퍼런스 비디오, 3개 레퍼런스 오디오를 지원하는 멀티모달 입력
텍스트-비디오 및 이미지-비디오(첫/마지막 프레임) 생성
빠름표준
자세히 보기

Seedance 1 Lite

ByteDance

420 크레딧

ByteDance의 경량 비디오 생성 모델로, 텍스트-비디오 및 이미지-비디오 변환을 4~12초 길이, 480p·720p·1080p 해상도로 지원합니다.

텍스트-비디오와 이미지-비디오 생성을 하나의 모델로 지원
4~12초 길이 범위, 초당 과금
480p / 720p / 1080p 해상도 선택 가능
빠름표준
자세히 보기

Seedance 1 Pro

ByteDance

1740 크레딧

Seedance의 프로 버전으로, 2~12초 길이의 텍스트-비디오·이미지-비디오 변환을 480p·720p·1080p 해상도로 지원합니다.

Seedance 1 Lite보다 높은 품질, 최대 1080p 출력 지원
텍스트-비디오와 이미지-비디오 생성을 하나의 모델로 지원
2~12초 길이 범위, 초당 과금
보통울트라
자세히 보기

Seedance 1 Pro Fast

ByteDance

690 크레딧

빠른 생성 속도와 프로페셔널 출력 품질을 갖춘 ByteDance의 시네마틱 비디오 생성 모델입니다.

빠른 생성 속도
프로페셔널 출력 품질
시네마틱 비디오 생성
빠름높음
자세히 보기

OpenAI Sora 2

OpenAI

930 크레딧

사실적인 물리 시뮬레이션과 오디오 생성 기능을 갖춘 OpenAI의 비디오 생성 모델로, 높은 일관성의 비디오를 생성합니다.

사실적인 물리 시뮬레이션
오디오 생성 지원
최대 20초 비디오
느림울트라
자세히 보기

OpenAI Sora 2 Pro

OpenAI

2790 크레딧

OpenAI의 가장 진보한 동기화 오디오 비디오 생성 모델입니다. Sora 2의 프리미엄 등급으로 더 높은 충실도와 최대 1024p 해상도, 레퍼런스 프레임을 통한 이미지-비디오를 지원합니다.

네이티브 동기화 오디오를 갖춘 OpenAI의 가장 진보한 비디오 모델
Sora 2의 프리미엄 등급 — 더 높은 충실도와 디테일
2단계 해상도: standard(720p), high(1024p)
느림울트라
자세히 보기

MiniMax Hailuo-03 (H3) Text to Video

MiniMax

1510 크레딧

Fal.AI를 통해 제공되는 MiniMax Hailuo-03(H3) 텍스트-비디오 모델입니다. 텍스트 프롬프트로부터 최신 수준의 2K 비디오를 생성하며, 5-15초 길이, 네이티브 오디오, 21:9부터 9:16까지 폭넓은 화면 비율을 지원합니다.

최신 수준의 2K 해상도 텍스트-비디오 생성
비디오와 함께 생성되는 네이티브 오디오
5-15초 범위의 조절 가능한 길이
보통울트라
자세히 보기

Seedance 2.5 Text to Video

ByteDance

5500 크레딧

Fal.AI를 통해 제공되는 ByteDance Seedance 2.5 텍스트-투-비디오 모델입니다. 텍스트 프롬프트만으로 480p/720p, 최대 30초의 원테이크 영상을 생성하며, 샷 전체를 한 번에 추론하기 때문에 첫 프레임부터 마지막 프레임까지 모션·조명·인물 동일성이 유지됩니다. 대사·효과음·음악을 포함한 동기화 오디오도 같은 패스에서 생성됩니다.

클립 이어붙이기 없이 최대 30초 원테이크 생성
립싱크된 대사를 포함해 영상과 동기화된 오디오 생성
480p·720p 두 가지 출력 등급, 초 단위 과금
보통울트라
자세히 보기

Veed Lipsync v2

Veed

2440 크레딧

Fal.AI를 통해 제공되는 Veed Lipsync v2 모델입니다. 원본 영상의 입 모양을 새로운 오디오 트랙에 맞춰 재구성합니다 — 원본 영상과 새 오디오 트랙만 있으면 입 모양이 자연스럽게 동기화된 결과 영상을 생성합니다.

원본 영상의 입 모양을 새로운 오디오 트랙에 맞춰 재동기화
임의의 원본 영상 + 오디오 트랙 조합에 사용 가능
출력 영상 길이는 입력 영상/오디오에 자동으로 맞춰짐
보통높음
자세히 보기

Google Veo 3.1

Google

7440 크레딧

내장 오디오 생성 기능을 갖춘 Google의 최첨단 비디오 생성 모델로, 동기화된 사운드와 함께 시네마틱 품질의 비디오를 생성합니다.

내장 오디오 생성
시네마틱 품질 출력
시작 프레임을 활용한 이미지-비디오 변환
느림울트라
자세히 보기

Google Veo 3.1 Fast

Google

2790 크레딧

오디오 생성 기능을 갖춘 Veo 3.1의 고속 버전으로, 높은 품질을 유지하면서 속도에 최적화되었습니다.

Veo 3.1보다 빠른 생성 속도
내장 오디오 생성
고품질 출력
보통높음
자세히 보기

Video Utils

FFmpeg

5 크레딧

FFmpeg 기반 비디오 유틸리티입니다 (2,000만+ 실행). task 파라미터 하나로 mp4/gif 변환, mp3 오디오 추출, 프레임 zip 추출을 처리합니다. 미디어 파이프라인의 맥가이버 칼입니다.

어떤 영상이든 mp4/gif로 변환
오디오를 mp3로 추출
프레임을 zip으로 추출 (fps 제어)
빠름표준
자세히 보기

Wan 3.0

Alibaba

2330 크레딧

알리바바의 Wan 3.0은 텍스트 프롬프트 또는 시작 이미지로부터 시네마틱한 카메라 움직임의 비디오를 생성합니다. 480p·720p·1080p 해상도와 최대 30초 길이를 지원합니다.

텍스트-비디오와 이미지-비디오를 하나의 모델로
한 번의 생성으로 2~30초의 긴 클립 지원
3가지 해상도: 480p, 720p, 1080p
보통높음
자세히 보기

Wan 2.7 I2V

Alibaba

1740 크레딧

Alibaba Wan 2.7 이미지-비디오 모델입니다. 첫 프레임(및 선택적 마지막 프레임 또는 연속 클립)을 애니메이션화하며 오디오 동기화를 지원하고, 최대 15초까지 720p 또는 1080p로 생성됩니다.

첫 프레임 이미지를 애니메이션화하는 이미지-비디오 생성
선택적 마지막 프레임 지정 또는 기존 비디오 클립 이어가기
음성 및 음악을 위한 오디오 동기화(자동 생성 또는 사용자 제공)
보통높음
자세히 보기

Wan 2.7 T2V

Alibaba

1740 크레딧

Alibaba Wan 2.7 텍스트-비디오 모델입니다. 최대 15초 길이, 음성/음악 오디오 동기화, 다국어 프롬프트, 프롬프트 확장을 지원하며 720p 또는 1080p로 생성됩니다.

최대 15초 길이의 텍스트-비디오 생성
음성 및 음악을 위한 오디오 동기화(자동 생성 또는 사용자 제공)
다국어 프롬프트 지원
보통높음
자세히 보기

Wan 2.5 I2V

Alibaba

1160 크레딧

립싱크 지원이 포함된 이미지-비디오 모델로, 정지 이미지를 자연스러운 모션의 사실적인 비디오로 변환합니다.

이미지-비디오 애니메이션
립싱크 지원
정지 이미지로부터 자연스러운 모션
느림울트라
자세히 보기

Wan 2.5 I2V Fast

Alibaba

790 크레딧

Wan 2.5의 고속 이미지-비디오 변형으로, 정지 이미지로부터 빠르게 애니메이션 비디오를 생성합니다.

Wan 2.5 I2V보다 빠른 생성 속도
이미지-비디오 애니메이션
좋은 모션 품질
보통높음
자세히 보기

Wan 2.5 T2V

Alibaba

1160 크레딧

오디오 동기화 지원이 포함된 텍스트-비디오 모델로, 자연스러운 모션과 함께 텍스트 프롬프트로부터 고품질 비디오를 생성합니다.

고품질 텍스트-비디오 생성
오디오 동기화 지원
자연스러운 모션 합성
느림울트라
자세히 보기

Wan 2.5 T2V Fast

Alibaba

790 크레딧

Wan 2.5의 고속 텍스트-비디오 생성 변형으로, 좋은 품질의 출력을 유지하면서 속도에 최적화되었습니다.

Wan 2.5 T2V보다 빠른 생성 속도
좋은 품질의 텍스트-비디오
오디오 동기화 지원
보통높음
자세히 보기

Wan 2.2 I2V Fast

Alibaba

120 크레딧

Alibaba의 Wan 2.2 A14B 이미지-비디오 모델을 PrunaAI가 최적화해 매우 빠르고 저렴하게 만든 버전입니다. 정지 이미지 한 장과 프롬프트만으로 480p 또는 720p의 짧은 애니메이션 클립을 생성하며, 더 부드러운 움직임을 위한 프레임 보간 옵션도 제공합니다.

PrunaAI 최적화 추론 — 기본 Wan 2.2 대비 빠르고 저렴
마지막 프레임 조건화를 지원하는 이미지-비디오 변환으로 더 자연스러운 전환 가능
ffmpeg 기반 30FPS 프레임 보간 옵션으로 더 매끄러운 움직임 구현
빠름표준
자세히 보기

Wan 2.2 T2V Fast

Alibaba

120 크레딧

Alibaba의 Wan 2.2 A14B 텍스트-비디오 모델을 PrunaAI가 최적화해 매우 빠르고 저렴하게 만든 버전입니다. 텍스트 프롬프트만으로 480p 또는 720p의 짧은 클립을 생성하며, 30FPS 프레임 보간이 기본으로 켜져 있습니다. 이미 플랫폼에 있는 Wan 2.2 I2V Fast의 텍스트-비디오 버전입니다.

PrunaAI 최적화 추론 — 기본 Wan 2.2 대비 빠르고 저렴
참조 이미지 없이 프롬프트만으로 생성하는 순수 텍스트-비디오
ffmpeg 기반 30FPS 프레임 보간이 기본으로 켜져 있어 매끄러운 움직임 구현
빠름표준
자세히 보기

오디오 & TTS 모델

Text-to-Speech, 음성 클론, 오디오 생성

Bark

추천

Suno

190 크레딧

Suno의 텍스트 프롬프트 생성 오디오 모델입니다. [laughs]·[sighs] 같은 비언어 사운드가 포함된 음성은 물론 음악·효과음까지 생성하며, 13개 언어의 100개 이상 화자 프리셋을 제공합니다. 오디오와 함께 음성 연속성을 위한 .npz 히스토리 파일도 반환할 수 있습니다.

비언어 사운드가 있는 음성: [laughs], [sighs], [gasps]
음표(♪)를 활용한 노래·효과음 생성
13개 언어 131개 화자 프리셋
느림표준
자세히 보기

Chatterbox

Resemble AI

59 크레딧

고유한 감정 과장(exaggeration) 제어와 짧은 레퍼런스 오디오 기반 즉시 음성 복제를 갖춘 Resemble AI의 프로덕션급 오픈소스 TTS입니다. MIT 라이선스로 주요 상용 시스템과 비교 벤치마크된 모델입니다.

고유한 감정 과장(exaggeration) 제어
짧은 오디오로 즉시 음성 복제
프로덕션급 오픈소스 품질
빠름높음
자세히 보기

Chatterbox Multilingual

Resemble AI

17 크레딧

23개 언어를 지원하는 Chatterbox 오픈소스 TTS입니다. 즉시 음성 복제와 감정 과장 제어를 제공합니다. 요청당 최대 300자.

한국어 포함 23개 언어 지원
짧은 오디오로 즉시 음성 복제
감정 과장 제어
빠름높음
자세히 보기

Chatterbox Turbo

Resemble AI

59 크레딧

품질 저하 없이 가장 빠른 Resemble AI 오픈소스 TTS입니다. 20개 프리셋 음성, [sigh]·[chuckle] 같은 준언어 태그, 5초 이상 레퍼런스 오디오로 즉시 음성 복제를 지원합니다. 요청당 최대 500자.

오픈소스 최고 속도의 TTS 품질
준언어 태그: [sigh], [chuckle], [cough], [clear throat]
20개 프리셋 음성
빠름높음
자세히 보기

Gemini 3.1 Flash TTS

Google

299 크레딧

Replicate를 통해 제공되는 Google Gemini 3.1 Flash 네이티브 오디오 TTS입니다. 실제 발화 텍스트와 별도의 스타일 지시문, 30종의 프리셋 음성, 40개 이상의 언어/로케일 코드를 지원하며, [sigh], [whispering], [shouting] 등 인라인 마크업 태그로 감정 표현이 가능합니다.

Gemini 3.1 Flash 기반 네이티브 오디오 TTS
실제 발화 텍스트와 분리된 스타일 지시문(prompt) 필드
30종의 프리셋 음성
빠름높음
자세히 보기

Incredibly Fast Whisper

Whisper

10 크레딧

속도에 최적화된 Whisper large-v3입니다 (3,800만+ 실행). 배치 추론으로 약 150분 분량 오디오를 100초 이내에 전사합니다. 청크/단어 단위 타임스탬프를 지원합니다.

약 150분 오디오를 100초 이내 전사
Whisper large-v3 정확도
청크/단어 단위 타임스탬프
빠름울트라
자세히 보기

Muse Voice Transcribe 1.0

Meta

7 크레딧

Meta 개발자 API 직결로 제공되는 Meta Muse Voice Transcribe 음성 인식 모델입니다. 한국어를 포함한 25개 언어와 코드 스위칭, 화자 분리, 발화 구간 분할, 키워드·언어 바이어싱을 지원합니다. 오디오 1초당 0.11625 크레딧(분당 약 7 크레딧)으로 과금되며 요청당 최대 10분입니다.

한국어 포함 25개 언어와 코드 스위칭
화자 분리·발화 구간 분할 (화자 라벨과 타임스탬프가 있는 turns)
이름·약어·제품명 인식을 위한 키워드 바이어싱
빠름높음
자세히 보기

Suno Music V5.5

Suno

140 크레딧

Suno의 최신 모델로, 최고 음질과 가장 풍부한 편곡을 제공합니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.

1회 생성으로 완성곡 2곡
Suno 라인업 중 최고 음질과 가장 풍부한 편곡
가사·스타일·제목을 직접 지정하는 커스텀 모드
보통울트라
자세히 보기

Suno Music V5

Suno

140 크레딧

향상된 음질과 음악성을 갖춘 Suno V5 음악 생성 모델입니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.

1회 생성으로 완성곡 2곡
V4.5 대비 향상된 음질과 음악성
가사·스타일·제목을 직접 지정하는 커스텀 모드
보통높음
자세히 보기

Suno Music V4.5

Suno

140 크레딧

Suno V4.5 음악 생성 모델입니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.

1회 생성으로 완성곡 2곡
가사·스타일·제목을 직접 지정하는 커스텀 모드
보컬 없는 연주곡(instrumental) 옵션
보통높음
자세히 보기

MiniMax Music 2.6

MiniMax

350 크레딧

텍스트 프롬프트로 최대 6분 길이의 완성곡 또는 연주곡을 생성합니다. 99% 이상 정확한 BPM·조성 제어, 14종 이상의 구조 태그, 가사 자동 생성, 보컬 없는 연주곡 모드를 지원합니다.

최대 6분 길이의 완성곡 (대부분 2-4분)
프롬프트로 99% 이상 정확한 BPM·조성 제어
14종+ 구조 태그: [Intro], [Verse], [Chorus], [Hook], [Drop], [Bridge] 등
보통높음
자세히 보기

MiniMax Music 2.5

MiniMax

350 크레딧

보컬, 가사, 풍부한 악기 구성을 갖춘 최대 5분 길이의 완성곡을 생성합니다. 14종 구조 태그, 장르별 특성을 반영하는 스타일-aware 믹싱, 오케스트라·전통 악기까지 확장된 악기 라이브러리를 지원합니다.

최대 5분 길이의 완성곡 (대부분 2:30-4:30)
14종 구조 태그: [Intro], [Verse], [Chorus], [Hook], [Drop], [Bridge] 등
호흡·피치 전환까지 사실적인 보컬
보통높음
자세히 보기

MiniMax Music Cover

MiniMax

700 크레딧

어떤 곡이든 다른 스타일로 재해석합니다. 입력 오디오에서 멜로디 구조를 추출해 트랙을 재생성합니다 — 멜로디와 곡 길이는 유지되고, 목소리·악기·장르·편곡은 모두 바뀔 수 있습니다.

멜로디와 곡 길이 유지
목소리·악기·장르·편곡 전면 변경 가능
장르 전환: 팝→재즈, 록→보사노바, 발라드→EDM
보통높음
자세히 보기

Qwen3 TTS

Qwen

47 크레딧

3가지 모드를 갖춘 Alibaba의 통합 TTS입니다: 프리셋 화자(custom_voice), 레퍼런스 오디오 기반 즉시 음성 복제(voice_clone), 텍스트 설명만으로 새로운 목소리 생성(voice_design).

3가지 모드: 프리셋 음성, 음성 복제, 음성 디자인
자연어 설명만으로 음성 디자인
한국어(Sohee) 포함 9개 프리셋 화자
빠름높음
자세히 보기

Muse Voice Transcribe 1.0 (Realtime)

Meta

35 크레딧

Meta Muse Voice Transcribe를 WebSocket으로 스트리밍합니다. 16-bit PCM(24kHz 또는 16kHz 모노) 오디오를 보내면 말하는 동안 부분·최종 전사를 실시간으로 받으며, 발화 구간 분할과 화자 분리를 지원합니다. Meta가 처리한 오디오 초 단위로 과금되고(초당 0.11625 크레딧, 5분 블록당 35 크레딧), 세션은 최대 20분입니다.

발화 도중 부분·최종 전사를 실시간 스트리밍
한국어 포함 25개 언어와 코드 스위칭
DIARIZATION/ENDPOINTING 모드에서 화자 분리와 발화 구간 분할
빠름높음
자세히 보기

Inworld Realtime TTS 2

Inworld

59 크레딧

자연어 스티어링을 지원하는 Inworld의 최고 표현력 TTS입니다. [speak quickly]처럼 대괄호 지시문을 텍스트 앞에 붙여 말투를 제어합니다. 실시간 지연 시간과 15개 이상 언어를 지원합니다.

대괄호 지시문 기반 자연어 스티어링
실시간 지연 시간
자동 감지 포함 15개 이상 언어 지원
빠름높음
자세히 보기

Fish Audio S2.1 Pro

Fish Audio

105 크레딧

Fish Audio 최신 프로덕션 TTS. 83개 언어, 대괄호 자연어 감정·톤 제어, Voice Library 100만+ 음성과 클로닝. S2 Pro 대비 청취 평가 61% 승률, 업스트림 첫 오디오 ~70ms. UTF-8 바이트 과금.

단일 모델로 83개 언어 (한국어·영어·일본어·중국어 …)
대괄호 자연어 감정·톤 태그: [happy], [whispering], [laughing], [break]
reference_id 로 Voice Library 100만+ 음성과 클론 음성 사용
빠름울트라
자세히 보기

Fish Audio S2 Pro

Fish Audio

105 크레딧

Fish Audio S2 세대 TTS. 80개 이상 언어, 대괄호 자연어 감정·톤 태그, Voice Library 음성. S2.1 Pro 와 동일 요율이며 S2 에 맞춰 둔 파이프라인용. UTF-8 바이트 과금.

단일 모델로 80개 이상 언어
대괄호 자연어 감정·톤 태그 ([sad], [shouting], [sighing])
reference_id 로 Voice Library 음성과 클론 음성 사용
빠름높음
자세히 보기

Fish Audio S1

Fish Audio

105 크레딧

Fish Audio S1 (레거시) TTS. 소괄호 고정 감정 태그 — (happy), (sad), (whispering) — 와 Voice Library 음성. S2 계열과 동일 요율이며 S1 기준 프롬프트용. UTF-8 바이트 과금.

소괄호 고정 감정 태그를 쓰는 레거시 S1 세대: (happy), (sad), (whispering)
reference_id 로 Voice Library 음성과 클론 음성 사용
S2 계열과 동일 요율 — S1 기준으로 작성한 프롬프트용
빠름높음
자세히 보기

Suno SFX V5

Suno

29 크레딧

Suno V5 효과음 생성 모델입니다. 텍스트 설명만으로 짧은 효과음 2가지 변형을 생성하며, 루프 모드·템포·조성(key)을 옵션으로 제어할 수 있습니다. UI 사운드, 게임 오디오, 영상 폴리에 적합합니다.

1회 생성으로 효과음 2가지 변형
게임·앰비언트용 무한 루프 모드
템포(BPM)·조성(key) 제어
빠름높음
자세히 보기

MiniMax Speech 2.8 HD

MiniMax

237 크레딧

Artificial Analysis Speech Arena 및 Hugging Face TTS Arena 1위. 자동회귀 Transformer + Flow-VAE 디코더 기반 방송 품질 TTS로, 32개 이상 언어, 음성 클론, 자연스러운 감탄사, 감정 제어를 지원합니다.

주요 TTS 벤치마크 1위
스튜디오급 방송 품질 오디오
자연스러운 감탄사 (웃음, 한숨, 기침 등)
보통울트라
자세히 보기

MiniMax Speech 2.8 Turbo

MiniMax

142 크레딧

250ms 미만 지연의 저지연 MiniMax Speech 2.8 Turbo. 40개 이상 언어, 음성 클론, 자연스러운 감탄사, 실시간 과금을 지원합니다. 인터랙티브 및 실시간 애플리케이션에 적합합니다.

실시간 사용을 위한 250ms 미만 지연
40개 이상 언어 지원
자연스러운 감탄사 (웃음, 한숨, 기침 등)
빠름높음
자세히 보기

MiniMax Speech 2.6 HD

MiniMax

237 크레딧

전문 애플리케이션을 위한 미묘한 운율, 감정 제어, 프리미엄 음성을 갖춘 스튜디오 품질 다국어 텍스트-음성 변환 모델입니다.

스튜디오급 오디오 품질
세밀한 운율 제어
자막 타임스탬프 내보내기
보통울트라
자세히 보기

MiniMax Speech 2.6 Turbo

MiniMax

142 크레딧

감정 제어가 가능한 빠른 다국어 텍스트-음성 변환 모델로, 저지연 실시간 애플리케이션에 최적화되어 있습니다.

초저지연 합성
실시간 스트리밍 지원
300개 이상 음성 프리셋
빠름높음
자세히 보기

MiniMax Speech-02-Turbo

MiniMax

142 크레딧

다국어 지원, 감정 음성 제어, 300개 이상의 목소리 옵션을 갖춘 저지연 텍스트-음성 변환 모델입니다.

저지연 실시간 합성
300개 이상 음성 프리셋
감정 표현 제어
빠름높음
자세히 보기

Sonilo v1.1 Text to Music

Sonilo

520 크레딧

Fal.AI를 통해 제공되는 Sonilo v1.1 텍스트-투-뮤직 모델입니다. 원하는 사운드를 설명하는 텍스트만으로 최대 3개의 서로 다른 음악 트랙(각 최대 600초)을 생성합니다.

텍스트 설명만으로 완전한 음악 트랙 생성
트랙당 최대 600초(10분) 길이 지원
한 번의 호출로 최대 3개의 서로 다른 트랙 변형 생성
빠름표준
자세히 보기

Inworld TTS 1.5 Max

Inworld

24 크레딧

200ms 미만 지연의 Inworld 최고 품질 실시간 TTS입니다. SSML break 태그로 일시정지, [happy] 같은 감정 마크업, 15개 언어를 지원합니다.

200ms 미만 중간값 지연
감정 마크업: [happy], [sad], [angry]
SSML break 태그로 정밀한 일시정지
빠름높음
자세히 보기

Clova Voice TTS Premium

NCP Clova

153 크레딧

108개 음성, 6개 언어를 지원하는 네이버 클로바 보이스 프리미엄 TTS. 고품질 한국어 음성 합성, 감정 표현, Pro 음성, 이중 언어 지원.

6개 언어 108개 음성 옵션
고품질 한국어 음성 합성
감정 제어 (중립, 슬픔, 기쁨, 분노)
빠름높음
자세히 보기

ElevenLabs Turbo v2.5

ElevenLabs

119 크레딧

고품질·저지연 ElevenLabs 텍스트-음성 변환 모델입니다. v3와 동일한 26개 프리미엄 음성을 절반 가격으로, 32개 언어에서 실시간·대량 처리에 최적화되어 있습니다.

실시간 앱에 최적화된 저지연
32개 언어 지원
26개 프리미엄 프리셋 음성
빠름높음
자세히 보기

ElevenLabs v3

ElevenLabs

237 크레딧

ElevenLabs의 가장 표현력 있는 텍스트-음성 변환 모델입니다. 26개 프리미엄 음성, [laughs]·[whispers] 같은 인라인 오디오 태그, 정밀한 스타일·안정성 제어, 70개 이상 언어를 지원합니다.

ElevenLabs 최고 표현력 모델
인라인 오디오 태그: [laughs], [whispers], [sighs], [excited]
26개 프리미엄 프리셋 음성
보통울트라
자세히 보기

ElevenLabs v2 Multilingual

ElevenLabs

237 크레딧

30개 이상 언어를 지원하는 ElevenLabs Multilingual v2 텍스트-음성 변환 모델입니다. 검증된 안정적인 음질과 동일한 프리미엄 음성 라인업, 정밀한 음성 설정을 제공합니다.

30개 이상 언어 지원
프로덕션에서 검증된 안정적 음질
26개 프리미엄 프리셋 음성
보통높음
자세히 보기

Sonilo v1.1 Video to Sound Effects

Sonilo

310 크레딧

Fal.AI를 통해 제공되는 Sonilo v1.1 비디오-투-사운드이펙트 모델입니다. 입력 영상에 AI가 생성한 사운드(환경음, 효과음, 폴리)를 추가합니다. 프롬프트가 없으면 장면을 자동으로 캡션 처리하고, 구간별 사운드 설명을 제공하면 더 세밀한 제어가 가능합니다.

무음이거나 사운드가 부족한 영상에 환경음, 효과음, 폴리 사운드 추가
프롬프트가 없으면 장면을 자동으로 캡션 처리
구간별 사운드 설명으로 더 세밀한 시간대별 제어 가능
빠름표준
자세히 보기

Suno Vocal Separation

Suno

120 크레딧

Suno로 생성한 곡을 보컬과 반주(인스트루멘탈) 스템으로 분리합니다. 이전 Suno 음악 생성 결과의 taskId와 audioId를 입력하면 분리된 vocalUrl/instrumentalUrl 오디오 파일을 반환합니다.

보컬 + 반주 스템 클린 분리
Suno 음악 생성 결과에서 바로 체이닝
두 스템 모두 CDN 미러링된 MP3 제공
빠름높음
자세히 보기

MiniMax Voice Cloning

MiniMax

6980 크레딧

10초~5분 분량의 오디오 샘플로 어떤 목소리든 복제합니다. MiniMax 음성 모델의 voice_id로 바로 사용할 수 있는 커스텀 voice_id와 복제 음성으로 합성한 미리듣기 클립을 반환합니다.

10초 분량의 오디오만으로 음성 복제
복제된 voice_id를 MiniMax 음성 모델에서 바로 사용
결과에 미리듣기 오디오 클립 포함
보통높음
자세히 보기

Whisper

OpenAI

10 크레딧

음성 전사의 표준인 OpenAI Whisper large-v3입니다 (1억 4,400만+ 실행). 약 100개 언어 자동 감지, 영어 번역, plain text/SRT/VTT 출력 형식을 지원합니다.

음성 인식의 표준 (1억 4,400만+ 실행)
한국어 포함 약 100개 언어 자동 감지
어떤 언어든 영어로 번역 전사
보통울트라
자세히 보기

Whisper Diarization

Whisper

14 크레딧

화자 분리(diarization)가 포함된 Whisper 전사입니다 (800만+ 실행). 누가 무엇을 말했는지 세그먼트별 화자 라벨과 타임스탬프로 반환합니다. 회의·인터뷰 전사의 정석입니다.

화자 라벨이 붙는 전사 (누가 무엇을 말했는지)
세그먼트별 타임스탬프
화자 수 자동 감지 (직접 지정도 가능)
빠름높음
자세히 보기

XTTS-v2

Coqui

26 크레딧

Coqui XTTS-v2 다국어 음성 복제 TTS입니다. 짧은 오디오 샘플 하나로 음성을 복제해 16개 언어로 말하게 할 수 있는, 가장 널리 쓰이는 오픈소스 음성 복제 모델 중 하나입니다.

짧은 오디오 샘플 하나로 음성 복제
한국어 포함 16개 언어 지원
언어 교차 복제 (복제 음성으로 어떤 언어든 발화)
보통표준
자세히 보기

LLM 모델

GPT-4o, Claude, Gemini - OpenAI 호환 채팅 API

Claude Haiku 4.5

추천

Anthropic

1 크레딧

일상적인 작업을 위한 빠르고 비용 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 지능, 비용의 훌륭한 균형을 제공합니다.

200K 컨텍스트 윈도우
8K 최대 출력 토큰
비전 기능
빠름높음
자세히 보기

Claude Opus 5

Anthropic

5 크레딧

기본 1M 토큰 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 Opus 모델입니다. Opus 4.5~4.8과 동일한 가격($5/$25 per M 토큰)에 프롬프트 캐싱(read $0.50/M, write $6.25/M)과 웹 검색을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

가장 강력한 Anthropic 모델
기본 1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
보통울트라
자세히 보기

Claude Opus 4.8

Anthropic

5 크레딧

1M 토큰 컨텍스트 윈도우(일부 환경 200K), 128K 최대 출력 토큰, 2026년 1월까지의 학습 기준일을 갖춘 Anthropic 최상위 Opus 모델입니다. Opus 4.7 대비 장기 에이전트형 코딩, 도구 호출 정확도가 향상되었고, 필요한 턴에서만 추론하는 adaptive thinking을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

가장 강력한 Anthropic 모델
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
보통울트라
자세히 보기

Claude Opus 4.7

Anthropic

5 크레딧

2026년 1월까지의 신뢰할 수 있는 학습 기준일과 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 모델입니다. Opus 4.6 대비 추론, 코딩, 지시 따르기 성능이 향상되었으며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

가장 강력한 Anthropic 모델
200K 컨텍스트 윈도우
128K 최대 출력 토큰
보통울트라
자세히 보기

Claude Opus 4.6

Anthropic

5 크레딧

Anthropic의 가장 강력한 모델입니다. 향상된 안전성과 지시 따르기 능력으로 추론, 코딩, 복잡한 분석에서 획기적인 성능을 제공합니다.

가장 강력한 Anthropic 모델
200K 컨텍스트 윈도우
향상된 추론 및 코딩
보통울트라
자세히 보기

Claude Opus 4.5

Anthropic

5 크레딧

매우 복잡한 작업을 위한 Anthropic의 가장 강력한 모델입니다. 깊은 전문성이 필요한 연구, 분석 및 창의적 프로젝트에 탁월합니다.

200K 컨텍스트 윈도우
32K 최대 출력 토큰
비전 기능
보통울트라
자세히 보기

Claude Sonnet 5

Anthropic

4 크레딧

속도, 비용, 지능의 균형에 최적화된 Anthropic의 최신 Sonnet 모델입니다. 1M 토큰 컨텍스트 윈도우, 64K 최대 출력 토큰, 2025년 8월까지의 학습 기준일을 갖췄습니다. 필요한 턴에서만 추론하는 adaptive thinking, 비전, 도구 사용을 지원하며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.

속도·비용·지능의 균형
1M 토큰 컨텍스트 윈도우
64K 최대 출력 토큰
빠름울트라
자세히 보기

Claude Sonnet 4.6

Anthropic

17 크레딧

Claude Sonnet 4.5의 후속 모델입니다. 복잡한 추론, 미묘한 이해, 코딩 작업에서 최고 수준의 성능과 탁월한 지시 따르기 능력을 제공하는 Anthropic의 프론티어 Sonnet 등급 모델이며, 토큰 가격은 Sonnet 4.5와 동일합니다.

200K 컨텍스트 윈도우
16K 최대 출력 토큰
비전 기능
빠름울트라
자세히 보기

Claude Sonnet 4.5

Anthropic

4 크레딧

Anthropic의 가장 지능적이고 강력한 Sonnet 모델입니다. 복잡한 추론, 미묘한 이해, 코딩 작업에서 최고 수준이며 뛰어난 지시 따르기 능력을 제공합니다.

200K 컨텍스트 윈도우
16K 최대 출력 토큰
비전 기능
빠름울트라
자세히 보기

DeepSeek V4 Flash

DeepSeek

0.4 크레딧

DeepSeek의 빠르고 저렴한 V4 모델입니다 (체크포인트 V4-Flash-0731). thinking 모드가 기본이며 1M 토큰 컨텍스트와 대폭 할인된 캐시 읽기를 지원합니다. retire된 deepseek-chat / deepseek-reasoner의 대체 모델입니다.

최고 수준의 가격 대비 성능
1M 컨텍스트 윈도우, 최대 384K 출력 토큰
thinking 모드 기본 활성 (요청 파라미터로 전환 가능)
빠름높음
자세히 보기

DeepSeek V4 Pro

DeepSeek

1.2 크레딧

DeepSeek의 최상위 V4 모델입니다 (체크포인트 V4-Pro-0813). thinking 모드가 기본인 고급 추론 모델로, 1M 토큰 컨텍스트와 캐시 읽기 할인을 지원하면서도 동급 프론티어 모델 대비 훨씬 저렴합니다.

DeepSeek 계열 최고 추론 성능
1M 컨텍스트 윈도우, 최대 384K 출력 토큰
thinking 모드 기본 활성 (요청 파라미터로 전환 가능)
보통울트라
자세히 보기

Gemini 3.5 Flash

Google

2 크레딧

Google의 최신 Flash 티어 주력 모델입니다. 모든 입력 모달리티(텍스트·이미지·비디오·오디오·PDF)가 백만 토큰당 $1.50/$9의 동일 요율이며 롱 컨텍스트 할증이 없습니다. 1M 토큰 컨텍스트 윈도우와 65,536 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.

모든 입력 모달리티 동일 요율
롱 컨텍스트 할증 없음
1M 토큰 컨텍스트 윈도우
빠름높음
자세히 보기

Gemini 3.1 Flash Image Preview

Google

500 크레딧

네이티브 이미지 생성 기능을 갖춘 Gemini 3.1 Flash입니다. 채팅 응답에서 텍스트와 함께 이미지를 직접 생성할 수 있습니다. 텍스트와 이미지 출력 토큰에 별도의 가격이 적용됩니다.

채팅 내 네이티브 이미지 생성
131,072 토큰 컨텍스트 윈도우
32,768 최대 출력 토큰
빠름높음
자세히 보기

Gemini 3.1 Flash Lite

Google

1 크레딧

초경량 Gemini 3.1 Flash Lite의 정식(stable) 릴리스입니다. 백만 토큰당 $0.25/$1.50로 가장 비용 효율적인 Gemini 모델이며, 캐시 입력(90% 할인), 오디오 입력, 배치(50% 할인)를 지원합니다. 고처리량·저비용 애플리케이션에 적합합니다.

가장 비용 효율적인 Gemini 모델
정식(stable) 모델 ID (preview 접미사 없음)
1,048,576 토큰 컨텍스트 윈도우
빠름표준
자세히 보기

Gemini 3.1 Flash Lite Preview

Google

100 크레딧

Gemini 3.1 Flash의 초경량 변형 모델입니다. 캐시된 입력과 오디오 입력을 지원하는 가장 비용 효율적인 Gemini 모델입니다. 고처리량, 비용 의식적 애플리케이션에 적합합니다.

가장 비용 효율적인 Gemini 모델
1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
빠름표준
자세히 보기

Gemini 3.1 Pro Preview

Google

500 크레딧

Google의 최신이자 가장 강력한 Gemini 모델 프리뷰입니다. 컨텍스트 길이에 따라 조정되는 동적 가격 책정이 적용되며, 200K 토큰 이상 입력 시 확장 가격이 적용됩니다.

동적 가격 책정 (표준 / 200K 이상 장문 컨텍스트)
고급 추론 및 분석
1,048,576 토큰 컨텍스트 윈도우
보통울트라
자세히 보기

Gemini 3 Flash Preview

Google

500 크레딧

최첨단 멀티모달 이해력, 박사급 추론 능력, 최고 수준의 코딩 성능을 갖춘 Google의 가장 진보된 추론 모델입니다.

박사급 추론 능력
1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
보통울트라
자세히 보기

Gemini 3 Pro Image Preview

Google

500 크레딧

Gemini 3 Pro 제품군의 프리미엄 이미지 생성 모델입니다. 채팅에서 직접 최고 충실도의 이미지를 생성합니다. 이미지 출력 토큰은 텍스트 출력 토큰의 10배 가격이 적용됩니다.

프리미엄 이미지 생성 품질
65,536 토큰 컨텍스트 윈도우
32,768 최대 출력 토큰
보통울트라
자세히 보기

Gemini 3 Pro Preview

Google

4 크레딧

Google의 가장 강력한 Gemini 모델 프리뷰 버전입니다. 획기적인 추론, 코딩, 멀티모달 기능과 최대 컨텍스트 윈도우를 제공합니다.

1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
멀티모달 입력: 텍스트·이미지·비디오·오디오·PDF
보통울트라
자세히 보기

Gemini 2.5 Flash

Google

1 크레딧

사고 능력이 내장된 Google의 빠르고 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 추론, 비용의 훌륭한 균형을 제공합니다.

1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
멀티모달 입력: 텍스트·이미지·비디오·오디오
빠름높음
자세히 보기

Gemini 2.5 Flash Lite

Google

0.5 크레딧

Gemini 2.5 제품군에서 가장 저렴한 티어로, 대량·지연 민감 워크로드에 최적화되어 있습니다. 2.5 세대 품질을 훨씬 낮은 비용으로 제공하며, 대규모 분류·추출·실시간 챗에 적합합니다.

Gemini 2.5 제품군 중 최저가 티어
대량·지연 민감 워크로드에 최적화
1,048,576 토큰 컨텍스트 윈도우
빠름높음
자세히 보기

Gemini 2.5 Pro

Google

3 크레딧

최첨단 추론 능력과 1M 토큰 컨텍스트를 갖춘 Google의 가장 강력한 모델입니다. 복잡한 코딩, 수학, 다중 문서 분석에 탁월합니다.

1,048,576 토큰 컨텍스트 윈도우
65,536 최대 출력 토큰
멀티모달 입력: 오디오·이미지·비디오·텍스트·PDF
보통울트라
자세히 보기

Gemini 2.0 Flash

Google

1 크레딧

Google의 가장 빠르고 강력한 모델입니다. 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달 지원 및 실시간 기능을 제공합니다.

1,048,576 토큰 컨텍스트 윈도우
8,192 최대 출력 토큰
네이티브 멀티모달 (텍스트·이미지·오디오·비디오)
빠름높음
자세히 보기

Gemini 2.0 Flash Lite

Google

0.5 크레딧

최대 속도와 최소 비용을 위해 최적화된 Gemini 2.0 Flash의 초경량 버전입니다. 대량의 지연에 민감한 애플리케이션에 적합합니다.

초고속 추론
요청당 최소 비용
1,048,576 토큰 컨텍스트 윈도우
빠름표준
자세히 보기

Gemini Embedding 001

Google

0.1 크레딧

벡터 표현 생성을 위한 Google의 텍스트 임베딩 모델입니다. 의미 검색, 클러스터링, 유사도 작업에 최적화되어 있습니다.

고품질 텍스트 임베딩
요청당 최대 입력 2,048 토큰
출력 차원: 128–3,072 (기본 3,072; 권장 768 / 1,536 / 3,072)
빠름높음
자세히 보기

GLM 5.2

Z.ai

1.8 크레딧

OpenRouter 애그리게이터를 경유하는 Z.ai GLM 5.2입니다. 1M 토큰 컨텍스트 윈도우를 갖춘 대규모 텍스트 추론 모델로, 장기 에이전트 워크플로와 프로젝트 단위 소프트웨어 엔지니어링에 적합합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

1M 토큰 컨텍스트 윈도우, 최대 128K 출력 토큰
대규모 추론 모델 (reasoning_effort·병렬 도구 호출 지원)
텍스트 전용 입력·출력
보통울트라
자세히 보기

GLM 4.7

Z.ai

2 크레딧

OpenRouter 애그리게이터를 경유하는 Z.ai GLM 4.7입니다. 프로그래밍 능력과 다단계 추론·실행 안정성이 강화된 플래그십 텍스트 모델로, 복잡한 에이전트 작업에서 뚜렷한 개선을 보입니다. 200K 컨텍스트를 지원하며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

200K 토큰 컨텍스트 윈도우, 최대 128K 출력 토큰
강화된 프로그래밍 능력과 안정적인 다단계 추론·실행
텍스트 전용 입력·출력, 추론(reasoning) 모드 지원
빠름높음
자세히 보기

GPT-6 Astra

OpenAI

5 크레딧

OpenAI의 최상위 모델(GPT-6 세대, 2026년 9월)입니다. 복잡한 추론·코딩·컴퓨터 사용·리서치·문서 작성 같은 가장 어려운 엔드투엔드 작업용으로, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인 캐시 입력을 지원합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.

OpenAI 최상위 모델 (GPT-6 세대)
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
빠름울트라
자세히 보기

GPT-5.6 Luna

OpenAI

1 크레딧

OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 고속·저비용 티어입니다. 백만 토큰당 $0.20/$1.20의 가격으로 고처리량 워크로드에 최적화되어 있으며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.

GPT-5.6 패밀리의 고속·저비용 티어
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
빠름높음
자세히 보기

GPT-5.6 Sol

OpenAI

5 크레딧

OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 플래그십 티어입니다. 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원하며, 세대 내 최고 수준의 추론·코딩·멀티모달 성능을 제공합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.

GPT-5.6 패밀리의 플래그십 티어
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
빠름울트라
자세히 보기

GPT-5.6 Terra

OpenAI

3 크레딧

OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 균형 티어입니다. 백만 토큰당 $2/$12(Sol의 40%)로 플래그십에 근접한 품질을 제공하며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.

GPT-5.6 패밀리의 균형 티어
1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
빠름높음
자세히 보기

GPT-5.5

OpenAI

5 크레딧

1.05M 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. 캐시 입력 10배 할인을 지원하며 GPT-5.4 시리즈 대비 추론, 코딩, 멀티모달 성능이 향상되었습니다.

1.05M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
캐시 입력 가격 (10배 저렴)
빠름울트라
자세히 보기

GPT-5.4

OpenAI

5 크레딧

1M 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. none부터 xhigh까지 조절 가능한 추론 수준으로 모든 영역에서 최상위 추론 성능을 제공합니다.

1M 토큰 컨텍스트 윈도우
128K 최대 출력 토큰
조절 가능한 추론 (none/low/medium/high/xhigh)
빠름울트라
자세히 보기

GPT-5.4 Mini

OpenAI

2 크레딧

400K 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 GPT-5.4의 빠르고 비용 효율적인 변형 모델입니다. 일상적인 작업에서 성능과 가성비의 탁월한 균형을 제공합니다.

400K 컨텍스트 윈도우
128K 최대 출력 토큰
빠른 추론 속도
빠름높음
자세히 보기

GPT-5.4 Nano

OpenAI

1 크레딧

400K 컨텍스트와 128K 출력을 갖춘 초경량 최고속 GPT-5.4 변형 모델입니다. 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다. 도구 통합을 위한 MCP를 지원합니다.

400K 컨텍스트 윈도우
128K 최대 출력 토큰
초고속 추론
빠름표준
자세히 보기

GPT-5.2 Pro

OpenAI

176 크레딧

GPT-5.2 계열의 최고 성능 티어입니다 (날짜 고정 스냅샷). 더 많은 컴퓨트로 더 오래 사고하여 가장 어려운 추론·코딩 작업에서 가장 신뢰할 수 있는 답변을 제공합니다.

GPT-5.2 계열 최고 성능 티어
256K 컨텍스트 윈도우
32K 최대 출력 토큰
느림울트라
자세히 보기

GPT-5.2

OpenAI

4 크레딧

OpenAI의 최신이자 가장 진보된 GPT 모델입니다. 향상된 기능으로 추론, 코딩, 창의적 작업 전반에서 최첨단 성능을 제공합니다.

최신 GPT 아키텍처
256K 컨텍스트 윈도우
32K 최대 출력 토큰
빠름울트라
자세히 보기

GPT-5.2 Codex

OpenAI

15 크레딧

GPT-5.2 베이스 위에 구축된 최신 Codex 세대입니다. GPT-5.2의 강화된 추론 능력을 에이전틱 코딩 하네스에 제공하며 OpenAI Responses API로 제공됩니다.

GPT-5.2 베이스의 최신 Codex 세대
에이전틱 코딩 하네스(Codex 스타일)에 최적화
Responses API로 제공 - 이 게이트웨이는 Codex 모델을 chat completions가 아닌 /v1/responses로 라우팅
보통울트라
자세히 보기

GPT-5.1 (2025-11-13)

OpenAI

3 크레딧

재현 가능한 결과를 위한 GPT-5.1의 날짜별 스냅샷입니다. 반복 컨텍스트에 대한 캐시된 입력 토큰으로 비용 절감을 지원합니다. 모델 버전 고정이 필요한 프로덕션 배포에 적합합니다.

재현성을 위한 고정 모델 스냅샷
비용 절감을 위한 캐시된 입력 토큰
강력한 추론 및 코딩 성능
빠름높음
자세히 보기

GPT-5.1 Codex

OpenAI

10 크레딧

Codex 스타일 하네스에서의 에이전틱 코딩에 최적화된 GPT-5.1 변형 모델입니다. 긴 도구 호출 루프, 코드 편집, 리포지토리 규모 작업에 튜닝되었으며 OpenAI Responses API로 제공됩니다.

에이전틱 코딩 하네스(Codex 스타일)에 최적화
Responses API로 제공 - 이 게이트웨이는 Codex 모델을 chat completions가 아닌 /v1/responses로 라우팅
400K 컨텍스트 윈도우
보통높음
자세히 보기

GPT-5.1 Codex Max

OpenAI

10 크레딧

GPT-5.1 Codex 계열의 롱-호라이즌 에이전틱 코딩 플래그십 모델입니다. 컴팩션(compaction)으로 매우 긴 코딩 세션을 컨텍스트 안에 유지하며 OpenAI Responses API로 제공됩니다.

롱-호라이즌 에이전틱 코딩 플래그십
컴팩션 지원으로 원시 컨텍스트 윈도우를 넘는 초장기 세션 처리
Responses API로 제공 - 이 게이트웨이는 Codex 모델을 chat completions가 아닌 /v1/responses로 라우팅
보통울트라
자세히 보기

GPT-5.1 Codex Mini

OpenAI

2 크레딧

가벼운 코딩 작업을 위한 GPT-5.1 Codex 계열의 저렴하고 빠른 모델입니다. 에이전틱 코딩 튜닝과 Responses API 인터페이스를 유지하면서 Codex 대비 약 1/5 가격으로 제공됩니다.

가벼운 코딩 작업용 저가·고속 Codex 티어
Responses API로 제공 - 이 게이트웨이는 Codex 모델을 chat completions가 아닌 /v1/responses로 라우팅
400K 컨텍스트 윈도우
빠름높음
자세히 보기

GPT-5

OpenAI

3 크레딧

OpenAI의 최신 플래그십 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 추론, 코딩, 창의적 작업 전반에서 탁월한 성능을 제공합니다. 비전, 함수 호출, JSON 모드를 지원합니다.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
고급 추론 기능
빠름울트라
자세히 보기

GPT-5 Mini

OpenAI

1 크레딧

GPT-5의 빠르고 효율적인 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 GPT-5 대비 훨씬 저렴한 비용으로 추론, 코딩, 창의적 작업 전반에서 우수한 성능을 제공합니다.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
빠른 추론 속도
빠름높음
자세히 보기

GPT-5 Nano

OpenAI

1 크레딧

GPT-5의 초고속 경량 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
초고속 추론
빠름높음
자세히 보기

GPT-5 Pro

OpenAI

125 크레딧

OpenAI GPT-5 계열의 최고 성능 티어입니다. 더 많은 컴퓨트로 더 오래 사고하여 가장 어려운 추론, 코딩, 분석 작업에서 가장 신뢰할 수 있는 답변을 제공합니다.

GPT-5 계열 최고 성능 티어
400K 컨텍스트 윈도우
272K 최대 출력 토큰
느림울트라
자세히 보기

GPT-4.1

OpenAI

3 크레딧

OpenAI의 코딩 및 지시 따르기에 가장 뛰어난 모델입니다. 1M 토큰 컨텍스트 윈도우, 32K 출력 토큰을 지원하며, 코딩, 복잡한 프롬프트, 긴 컨텍스트 작업에서 크게 향상되었습니다. GPT-4o 대비 출력 비용 20% 절감.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
최고 수준의 코딩 성능
빠름울트라
자세히 보기

GPT-4.1 Mini

OpenAI

1 크레딧

소형 모델 성능의 획기적 도약. GPT-4o와 동등하거나 뛰어난 지능을 갖추면서 지연 시간은 거의 절반, 비용은 83% 절감. 속도, 품질, 경제성의 이상적 균형.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
GPT-4o 지능을 훨씬 낮은 비용으로
빠름높음
자세히 보기

GPT-4.1 Nano

OpenAI

1 크레딧

OpenAI의 가장 빠르고 저렴한 모델. 분류, 자동완성, 저지연 작업에 최적화. $0.10/1M 입력 토큰의 초저가격.

1M 토큰 컨텍스트 윈도우
32K 최대 출력 토큰
초저지연
빠름표준
자세히 보기

GPT-4o

OpenAI

3 크레딧

OpenAI의 플래그십 멀티모달 모델입니다. 추론, 코딩, 창의적 작업에서 업계 최고 성능을 제공하며, 네이티브 비전 기능과 구조화된 출력을 지원합니다.

네이티브 멀티모달 (텍스트 + 비전 + 오디오)
128K 컨텍스트 윈도우
16K 최대 출력 토큰
빠름울트라
자세히 보기

GPT-4o Mini

OpenAI

1 크레딧

비용 효율적이고 빠른 모델로 강력한 성능을 제공합니다. 절대적인 성능보다 속도와 비용이 중요한 대량 작업에 최적입니다.

128K 컨텍스트 윈도우
16K 최대 출력 토큰
비전 기능
빠름높음
자세히 보기

GPT Audio

OpenAI

12 크레딧

챗 컴플리션으로 네이티브 오디오 입출력을 지원하는 풀사이즈 멀티모달 모델입니다. 강력한 범용 지능을 바탕으로 음성 입력과 음성 출력을 처리합니다.

네이티브 오디오 입출력
음성 작업에 풀사이즈 모델 품질
챗 컴플리션 기반 음성 입력/출력
보통울트라
자세히 보기

GPT Audio Mini

OpenAI

1 크레딧

네이티브 오디오 입출력 기능을 갖춘 경량 멀티모달 모델입니다. 음성 기반 상호작용 및 오디오 처리 작업에 최적화되어 있습니다.

네이티브 오디오 입출력
음성 기반 상호작용
비용 효율적 멀티모달
빠름높음
자세히 보기

GPT-OSS 120B

OpenAI

0.2 크레딧

OpenAI의 오픈 웨이트 모델 gpt-oss-120b입니다. 117B 파라미터 Mixture-of-Experts 구조(포워드 패스당 5.1B 활성)로 고난도 추론·에이전트·범용 프로덕션 용도에 맞춰 설계되었습니다. 직접 연동 OpenAI API에서는 제공되지 않는 OpenRouter 전용 모델이며, 131K 토큰 컨텍스트를 지원하고 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

131K 토큰 컨텍스트 윈도우
오픈 웨이트 117B MoE (5.1B 활성), 추론 강도 조절 가능
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
빠름높음
자세히 보기

Grok 4.6

xAI

7 크레딧

xAI의 플래그십 Grok 모델입니다. Grok 계열에서 가장 강한 추론·범용 성능을 제공하며 500K 토큰 컨텍스트를 지원합니다.

플래그십급 추론·코딩 성능
500K 컨텍스트 윈도우
OpenAI 호환 API (chat completions)
보통울트라
자세히 보기

Grok 4.5

xAI

7 크레딧

코딩에 강점을 둔 xAI Grok 모델입니다. 500K 토큰 컨텍스트를 지원하며, Grok 4.6과 동일 단가에 캐시 읽기가 더 저렴합니다.

코딩 워크로드에 최적화
500K 컨텍스트 윈도우
OpenAI 호환 API (chat completions)
보통울트라
자세히 보기

Grok 4.3

xAI

3 크레딧

1M 토큰 컨텍스트를 지원하는 가성비형 Grok 모델입니다. 4.5/4.6 티어의 절반 이하 단가입니다.

1M 토큰 컨텍스트 윈도우
1M 컨텍스트 윈도우
OpenAI 호환 API (chat completions)
빠름높음
자세히 보기

Grok 4.3 (OpenRouter)

xAI

3 크레딧

OpenRouter 애그리게이터를 경유하는 xAI Grok 4.3입니다. 1M 토큰 컨텍스트와 이미지 입력을 지원하며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다. OpenRouter 경로가 꼭 필요한 경우가 아니면 직접 연동 grok-4.3을 권장합니다.

1M 토큰 컨텍스트 윈도우
이미지·파일 입력(비전) 지원
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
빠름높음
자세히 보기

Grok 4.20 Multi-Agent

xAI

3 크레딧

Grok 4.20 Multi-Agent 베타(0309 스냅샷)입니다. 1M 토큰 컨텍스트에서 딥 리서치형 멀티에이전트 오케스트레이션을 수행합니다. Responses API 전용입니다.

멀티에이전트 딥 리서치 (베타) - 서브에이전트 토큰도 청구
1M 컨텍스트 윈도우
Responses API 전용 (/v1/responses) - Chat Completions는 400 거부
느림울트라
자세히 보기

Grok 4.20 Non-Reasoning

xAI

3 크레딧

Grok 4.20의 비추론 변형(0309 스냅샷)입니다. 추론 변형과 동일 단가로 1M 토큰 컨텍스트에서 빠른 응답을 제공합니다.

낮은 지연의 빠른 응답
1M 컨텍스트 윈도우
OpenAI 호환 API (chat completions)
빠름높음
자세히 보기

Grok 4.20 Reasoning

xAI

3 크레딧

Grok 4.20의 추론(reasoning) 변형(0309 스냅샷)입니다. 1M 토큰 컨텍스트에서 사고 사슬 추론을 수행하며, 추론 토큰은 완성 토큰과 별도로 가산 과금됩니다.

추론 토큰 가산 과금 (정확한 미터링)
1M 컨텍스트 윈도우
OpenAI 호환 API (chat completions)
보통울트라
자세히 보기

Grok Build 0.1

xAI

3 크레딧

에이전틱 코딩용 xAI Grok 모델입니다. 256K 토큰 컨텍스트를 지원하며 Grok 계열 최저 단가입니다.

에이전틱 코딩 워크플로우
256K 컨텍스트 윈도우
OpenAI 호환 API (chat completions)
빠름높음
자세히 보기

Kimi K3

Moonshot AI

17 크레딧

OpenRouter 애그리게이터를 경유하는 Moonshot AI Kimi K3입니다. 2.8T 파라미터의 오픈 웨이트 멀티모달 추론 모델로, 1M 토큰 컨텍스트와 이미지·영상 입력을 지원하며 복잡한 코딩, 지식 작업, 장기 에이전트 워크플로에 적합합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

1M 토큰 컨텍스트 윈도우
이미지·영상 입력(멀티모달), 텍스트 출력
2.8T 파라미터 오픈 웨이트 추론 모델 (reasoning_effort 지원)
보통울트라
자세히 보기

Kimi K2.7 Code

Moonshot AI

4 크레딧

OpenRouter 애그리게이터를 경유하는 Moonshot AI Kimi K2.7 Code입니다. Kimi K2 계열의 코딩 특화 모델로, 긴 컨텍스트에서 엔드투엔드 프로그래밍 작업을 안정적으로 완수하도록 설계되었으며 네이티브 멀티모달 MoE 아키텍처, 256K 컨텍스트, 이미지 입력을 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

256K 토큰 컨텍스트 윈도우, 최대 256K 출력 토큰
코딩 특화 — 긴 컨텍스트에서 엔드투엔드 프로그래밍 작업 수행
네이티브 멀티모달 MoE (스크린샷·다이어그램 등 이미지 입력)
빠름높음
자세히 보기

Llama 3.3 70B Instruct

Meta

0.4 크레딧

OpenRouter를 경유하는 Meta Llama 3.3 70B 인스트럭션 튜닝 다국어 모델입니다. 텍스트 입출력 전용이며 131K 토큰 컨텍스트를 지원하는 범용 오픈 웨이트 챗 모델입니다. 폐기된 직접 연동 llama-3.3-70b-versatile 경로를 대체하는 id이며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

131K 토큰 컨텍스트 윈도우
다국어 인스트럭션 튜닝 오픈 웨이트 모델 (텍스트 전용)
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
보통높음
자세히 보기

Llama 3.1 8B Instruct

Meta

0.1 크레딧

OpenRouter를 경유하는 Meta Llama 3.1 8B 인스트럭션 튜닝 모델입니다. 빠르고 효율적인 소형 오픈 웨이트 모델로 131K 토큰 컨텍스트를 지원하며, 대량·저비용 워크로드에 적합합니다. 폐기된 직접 연동 llama-3.1-8b-instant 경로를 대체하는 id이며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

131K 토큰 컨텍스트 윈도우
빠르고 효율적인 8B 오픈 웨이트 모델, 매우 낮은 토큰 단가
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
빠름표준
자세히 보기

MiniMax M3

MiniMax

1.4 크레딧

OpenRouter를 경유하는 MiniMax M3 멀티모달 파운데이션 모델입니다. 텍스트·이미지·비디오 입력과 1M 토큰 컨텍스트, 최대 512K 출력 토큰을 지원하며 장기 에이전트 작업과 코딩에 적합합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

1M 토큰 컨텍스트 윈도우, 최대 512K 출력 토큰
멀티모달 입력 (텍스트·이미지·비디오)
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
보통높음
자세히 보기

MiniMax M2.7 (OpenRouter)

MiniMax

1.4 크레딧

OpenRouter를 경유하는 MiniMax M2.7입니다. 자율적인 실무 생산성을 목표로 설계된 에이전트형 대규모 언어 모델로, 204K 토큰 컨텍스트와 멀티 에이전트 툴 사용을 지원합니다. 폐기된 직접 연동 MiniMax-M2.7 경로를 대체하는 id이며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

204K 토큰 컨텍스트 윈도우, 최대 131K 출력 토큰
멀티 에이전트 툴 사용·추론 등 에이전트 기능
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
빠름높음
자세히 보기

MiniMax M2.7

MiniMax

1 크레딧

OpenAI 호환 API로 제공되는 MiniMax의 플래그십 M2 시리즈 언어 모델입니다. 백만 토큰당 $0.30/$1.20의 매우 낮은 가격에 강력한 다국어 성능(특히 중국어·영어)을 제공하며, 프롬프트 캐시 읽기는 $0.06/M입니다.

OpenAI 호환 API (SDK 그대로 사용 가능)
매우 낮은 가격 (백만 토큰당 $0.30/$1.20)
프롬프트 캐시 읽기 할인 ($0.06/M)
빠름높음
자세히 보기

Mistral Large 3 (2512)

Mistral AI

1.9 크레딧

OpenRouter 애그리게이터를 경유하는 Mistral Large 3 (2512)입니다. Mistral의 역대 최고 성능 모델로, 41B 활성 파라미터(총 675B)의 희소 MoE 아키텍처를 Apache 2.0 라이선스로 공개했으며 256K 컨텍스트와 이미지·파일 입력을 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

256K 토큰 컨텍스트 윈도우
이미지·파일(PDF) 입력(비전) 지원
희소 MoE — 41B 활성 / 675B 총 파라미터, Apache 2.0 오픈 웨이트
보통높음
자세히 보기

Muse Spark 1.3

Meta

5 크레딧

Meta API 직결로 제공되는 Meta Muse Spark 1.3입니다. 에이전트 작업용 멀티모달 추론 모델로 텍스트·이미지·영상·오디오·PDF를 입력받아 텍스트를 반환하며, 1M 토큰 컨텍스트와 캐시 입력 할인을 지원합니다. 답변이 reasoning 토큰 뒤에 생성되므로 max_tokens를 2,048 이상으로 두세요.

1M 토큰 컨텍스트 윈도우
멀티모달 입력 — 텍스트·이미지·영상·오디오·PDF
에이전트 작업용 추론 모델
보통울트라
자세히 보기

Muse Spark 1.3 Contributor

Meta

0.3 크레딧

Meta Muse Spark 1.3의 할인 Contributor 티어입니다. 같은 모델을 표준 대비 약 1/12 가격으로 제공하되, 프롬프트와 응답이 Meta 모델 학습에 사용될 수 있다는 조건이 붙습니다. 개인정보·기밀·고객 데이터는 보내지 마세요. 업스트림 한도 분당 100 요청 / 3M 토큰을 공유합니다.

동일한 Muse Spark 1.3 모델을 표준 대비 약 1/12 가격으로
프롬프트·응답이 Meta 학습에 사용될 수 있음 (할인 조건)
1M 토큰 컨텍스트, 멀티모달 입력 (텍스트·이미지·영상·오디오·PDF)
보통울트라
자세히 보기

Muse Spark 1.1

Meta

5 크레딧

OpenRouter 애그리게이터를 경유하는 Meta Muse Spark 1.1입니다. 에이전트 작업을 위해 설계된 멀티모달 추론 모델로, 텍스트·이미지·영상·오디오·PDF 문서를 입력받아 텍스트를 반환하며 1M 토큰 컨텍스트를 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

1M 토큰 컨텍스트 윈도우
멀티모달 입력 — 텍스트·이미지·영상·오디오·파일(PDF)
에이전트 작업용 추론 모델 (reasoning_effort 지원)
보통울트라
자세히 보기

OpenAI o4-mini

OpenAI

2 크레딧

코딩 및 STEM 작업에 최적화된 빠르고 비용 효율적인 추론 모델입니다. 대형 추론 모델 대비 매우 낮은 비용으로 강력한 추론을 제공합니다.

코딩/STEM에 최적화
200K 컨텍스트 윈도우
100K 최대 출력 토큰
빠름울트라
자세히 보기

o3

OpenAI

9 크레딧

OpenAI의 프론티어 추론 모델입니다. 확장된 사고 연쇄를 사용하여 과학, 코딩, 수학의 복잡한 문제를 경쟁력 있는 가격에 높은 정확도로 해결합니다.

프론티어 사고 연쇄 추론
200K 컨텍스트 윈도우
100K 최대 출력 토큰
보통울트라
자세히 보기

o3 Pro

OpenAI

93 크레딧

o3의 최고 강도 버전입니다. 더 많은 컴퓨트로 더 오래 사고하여 가장 어려운 과학, 수학, 코딩 문제에서 가장 신뢰할 수 있는 답변을 제공합니다.

최고 강도 o3 추론
200K 컨텍스트 윈도우
100K 최대 출력 토큰
느림울트라
자세히 보기

OpenAI o3-mini

OpenAI

2 크레딧

낮은 비용으로 강력한 성능을 제공하는 효율적인 추론 모델입니다. 대형 모델의 오버헤드 없이 추론이 필요한 작업에 이상적입니다.

효율적인 추론 기능
200K 컨텍스트 윈도우
100K 최대 출력 토큰
빠름높음
자세히 보기

o1 Pro

OpenAI

697 크레딧

레거시 프로 티어 추론 모델입니다. o1보다 더 많은 컴퓨트를 사용하여 어려운 문제에서 가장 신뢰할 수 있는 답변을 제공합니다. o3-pro의 전신이며, o3-pro가 더 나은 가성비를 제공합니다.

프로 티어 사고 연쇄 추론
200K 컨텍스트 윈도우
100K 최대 출력 토큰
느림울트라
자세히 보기

OpenAI o1

OpenAI

15 크레딧

OpenAI의 가장 고급 추론 모델입니다. 확장된 사고 시간을 사용하여 과학, 코딩, 수학의 복잡한 문제를 뛰어난 정확도로 해결합니다.

고급 사고 연쇄 추론
200K 컨텍스트 윈도우
100K 최대 출력 토큰
느림울트라
자세히 보기

Qwen3.8 27B

Alibaba Qwen

3 크레딧

OpenRouter 애그리게이터를 경유하는 Qwen3.8 27B입니다. 코딩·전문 업무·리서치·멀티모달 상호작용·장기 에이전트 작업에 적합한 오픈 웨이트 밀집(dense) 비전-언어 모델로, 유연한 사고(thinking) 모드와 256K 토큰 컨텍스트를 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

오픈 웨이트 27B 밀집 비전-언어 모델
256K 토큰 컨텍스트 윈도우, 최대 131K 출력 토큰
멀티모달 입력(텍스트·이미지·비디오) 및 유연한 사고 모드
빠름높음
자세히 보기

Qwen3.8 2.4T-A95B

Alibaba Qwen

7 크레딧

OpenRouter 애그리게이터를 경유하는 Qwen3.8 2.4T-A95B입니다. Qwen3.8 Max의 오픈 웨이트 희소 MoE(Mixture-of-Experts) 버전으로, 총 2.4조 파라미터 중 950억 개가 활성화됩니다. 1M 토큰 컨텍스트와 최대 262K 출력 토큰을 지원하는 텍스트 전용 추론 모델이며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

오픈 웨이트 희소 MoE — 활성 95B / 총 2.4T 파라미터
1M 토큰 컨텍스트 윈도우, 최대 262K 출력 토큰
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
보통울트라
자세히 보기

Qwen3.8 Max

Alibaba Qwen

7 크레딧

OpenRouter 애그리게이터를 경유하는 Alibaba Qwen3.8 Max입니다. Qwen3.8 시리즈의 플래그십이자 Qwen3.8 Max Preview의 정식(GA) 후속 모델로, 복잡한 추론·시각 이해·에이전트 작업을 위한 멀티모달 추론 모델입니다. 1M 토큰 컨텍스트를 지원하며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

1M 토큰 컨텍스트 윈도우, 최대 131K 출력 토큰
멀티모달 입력(텍스트·이미지·비디오) 및 추론 모드
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
보통울트라
자세히 보기

Qwen3.7 Flash

Alibaba Qwen

0.1 크레딧

OpenRouter 애그리게이터를 경유하는 Alibaba Qwen3.7 Flash입니다. 멀티모달 에이전트·비주얼 코딩·검색·컴퓨터 상호작용에 적합한 저비용 비전-언어 추론 모델로, 객체 인식과 공간 이해에 강점이 있습니다. 1M 토큰 컨텍스트를 지원하며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

매우 낮은 비용 — 보급형 입력·출력 단가
1M 토큰 컨텍스트 윈도우, 멀티모달 입력(텍스트·이미지·비디오)
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
빠름높음
자세히 보기

Qwen3 Max

Alibaba Qwen

4 크레딧

OpenRouter 애그리게이터를 경유하는 Alibaba Qwen3 Max입니다. Qwen3 시리즈 기반의 업데이트 릴리스로, 추론·지시 이행·다국어 지원·롱테일 지식 커버리지가 크게 개선되었습니다. 256K 토큰 컨텍스트의 텍스트 전용 모델이며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

256K 토큰 컨텍스트 윈도우, 최대 64K 출력 토큰
강력한 지시 이행·다국어 지원
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
보통울트라
자세히 보기

Solar Pro 4

Upstage

0.1 크레딧

OpenRouter 애그리게이터를 경유하는 Upstage Solar Pro 4입니다. 524K 토큰 컨텍스트 윈도우를 갖춘 비용 효율적인 LLM으로, 장기 작업과 에이전트 워크플로를 위해 설계되었으며 사무 생산성·문서 집약형 업무에 강점이 있습니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.

524K 토큰 컨텍스트 윈도우, 최대 131K 출력 토큰
매우 낮은 비용 — 보급형 입력·출력 단가
OpenAI 호환 API (chat completions) — /llm/openrouter/v1
빠름높음
자세히 보기

Text Embedding 3 Large

OpenAI

0.24 크레딧

OpenAI의 가장 강력한 텍스트 임베딩 모델입니다. 검색 정확도가 중요한 의미 검색, 클러스터링, 유사도 작업을 위한 고품질 벡터 표현을 생성합니다.

OpenAI 최고 품질 텍스트 임베딩
항목당 최대 입력 8,191 토큰
기본 출력 차원: 3,072
빠름높음
자세히 보기

Text Embedding 3 Small

OpenAI

0.04 크레딧

OpenAI의 비용 효율적인 텍스트 임베딩 모델입니다. 의미 검색, 클러스터링, 유사도 작업을 위한 벡터 표현을 매우 낮은 비용으로 생성합니다.

비용 효율적인 텍스트 임베딩
항목당 최대 입력 8,191 토큰
기본 출력 차원: 1,536
빠름높음
자세히 보기

가격 비교

모든 모델의 크레딧 비용을 비교하여 최적의 모델을 선택하세요

카테고리모델크레딧단위추천 용도
이미지flux-schnell7이미지당 (num_outputs에 비례)빠른 생성, 실시간 앱
flux-2-max1601 MP 이미지 기준 — 해상도별 차등 (0.5MP 130, 2MP 230, 4MP·match_input 370, custom 390)최고 품질, 상업용
seedream-4.590이미지당 — 순차 생성 모드(auto)에서는 생성된 이미지 수(최대 15장)만큼 비례 과금텍스트 렌더링, 로고
비디오seedance-1-pro-fast690초당 과금 — 해상도별 차등 (480p 35, 720p 58, 1080p 138 크레딧/초; duration 2~12초, resolution 기본값은 1080p, 1080p 5초 ≈ 690)저비용 빠른 생성
hailuo-2.3650비디오당고품질, 균형 잡힌
veo-3.17,440비디오당최고 품질 비디오
오디오speech-02-turbo1421000자당 (0.135 크레딧/자, 글자 단위 과금)실시간 TTS, 빠른 응답
speech-2.8-hd2371000자당 (0.225 크레딧/자, 글자 단위 과금)고품질 HD 음성
LLMgpt-4o31K 토큰당 (평균)범용, 코드, 멀티모달
claude-sonnet-541K 토큰당 (평균)분석, 장문, 코드
gemini-2.0-flash11K 토큰당 (평균)초고속, 대량 처리

시작할 준비가 되셨나요?

Playground에서 모델을 테스트하거나 빠른 시작 가이드를 따라해보세요