모델 카탈로그
이미지, 비디오, 오디오 생성 및 LLM을 위한 다양한 AI 모델을 살펴보세요.
추천 모델
각 카테고리의 추천 모델 - 시작하기에 가장 좋은 모델들
FLUX.1 Schnell
Black Forest Labs
속도에 최적화된 초고속 이미지 생성 모델입니다. 1-2초 만에 고품질 이미지를 생성하며, 실시간 애플리케이션과 빠른 프로토타이핑에 적합합니다.
MiniMax Hailuo 2.3
MiniMax
고급 캐릭터 일관성과 자연스러운 움직임을 갖춘 사실적인 인물 모션 비디오 생성 모델입니다.
MiniMax Speech-02-Turbo
MiniMax
다국어 지원, 감정 음성 제어, 300개 이상의 목소리 옵션을 갖춘 저지연 텍스트-음성 변환 모델입니다.
GPT-4o
OpenAI
OpenAI의 플래그십 멀티모달 모델입니다. 추론, 코딩, 창의적 작업에서 업계 최고 성능을 제공하며, 네이티브 비전 기능과 구조화된 출력을 지원합니다.
모델 선택 가이드
속도가 중요하다면?
flux-schnell, Gemini Flash
품질이 중요하다면?
FLUX Pro, Kling Pro, Claude
비용 효율적인 선택?
flux-schnell, MiniMax, Gemini
가장 다재다능한 모델?
GPT-4o, Claude, FLUX Dev
이미지 생성 모델
FLUX, Stable Diffusion 등으로 멋진 이미지를 생성하세요
Background Remover
추천851 Labs
Replicate에서 가장 많이 사용된 배경 제거 모델입니다 (2,700만+ 실행). 소프트 알파/하드 세그멘테이션 배경 제거, 반전 모드(전경 제거), 커스텀 배경 타입, 투명 PNG 출력을 매우 저렴한 가격에 지원합니다.
BiRefNet
BiRefNet
SOTA 오픈소스 배경 제거 모델입니다. BiRefNet의 고해상도 이분 세그멘테이션이 머리카락, 털, 미세 디테일에서 탁월한 경계 품질을 제공합니다.
BLIP
Salesforce
Salesforce BLIP입니다 (1억 7,300만+ 실행). 이미지 캡셔닝, 시각 질의응답(VQA), 이미지-텍스트 매칭을 하나의 모델로 제공합니다. 이미지당 1크레딧으로 대량 캡셔닝의 클래식 선택지입니다.
Change Haircut
Black Forest Labs
FLUX.1 Kontext [pro] 기반으로 사진 한 장에서 헤어스타일과 머리 색을 바꿉니다. 90개 이상의 헤어스타일과 30가지 머리 색 중 선택하거나 'Random'으로 랜덤 변신 — 얼굴은 그대로 유지됩니다.
Clarity Upscaler
Clarity
유명한 크리에이티브 업스케일러입니다 (3,000만+ 실행). 단순 확대가 아니라 디테일을 재창조하며 업스케일합니다 — creativity/resemblance 제어, 프롬프트 가이드, 고배율을 위한 타일 디퓨전을 지원합니다.
CLIP Features
CLIP
텍스트와 이미지를 모두 임베딩하는 CLIP ViT-L/14입니다 (1억 6,300만+ 실행). 둘을 같은 벡터 공간에 놓아 교차 모달 검색, 이미지 중복 제거, 제로샷 분류에 사용합니다. 실행당 1크레딧.
CodeFormer
CodeFormer
오래된 사진과 AI 생성 얼굴을 위한 강력한 얼굴 복원 모델입니다 (5,400만+ 실행). 복원 품질과 원본 얼굴 충실도의 균형을 조절하는 fidelity 다이얼이 특징이며, Real-ESRGAN 배경 향상을 내장하고 있습니다.
ControlNet Scribble
ControlNet
스케치→이미지의 클래식입니다 (3,800만+ 실행). 낙서나 선화를 프롬프트에 맞는 정교한 이미지로 바꿉니다. 구도는 그림으로, 내용은 텍스트로 지시하세요.
Nano Banana (Edit)
Google Gemini 2.5 Flash 기반 Nano Banana의 전용 편집 엔드포인트입니다. 이미지 URL을 입력하면 캐릭터 일관성과 멀티 이미지 융합을 통한 대화형 편집을 수행합니다.
Nano Banana 2 (Edit)
Gemini 3.1 Flash Image 기반 Nano Banana 2의 편집 엔드포인트입니다. 해상도 제어(1K/2K/4K), Google 검색 연동, 사고 모드를 추가하면서 대화형 편집과 멀티 이미지 융합을 유지합니다.
Nano Banana Pro (Edit)
Gemini 3 Pro 기반 Nano Banana Pro의 편집 엔드포인트입니다. 전문가급 제어, 다국어 텍스트 렌더링, Google 검색 실시간 연동, 최대 2K 편집 해상도를 제공합니다.
Face to Many
fofr
얼굴 사진을 6가지 재미있는 스타일로 바꿉니다 (1,500만+ 실행) — 3D, 이모지, 비디오 게임, 픽셀, 클레이, 토이. 수많은 프로필 앱의 원조 바이럴 아바타 생성기입니다.
Face to Sticker
fofr
얼굴 사진을 귀여운 다이컷 스티커로 변환합니다 (160만+ 실행). InstantID가 얼굴 유사도를 지키고 IP-Adapter 컨트롤로 충실한 캐리커처부터 자유로운 카툰까지 표현 — 인쇄 품질을 위한 2배 업스케일 옵션도 지원합니다.
Florence-2 Large
Microsoft
Microsoft의 올인원 비전 모델 Florence-2입니다. 캡셔닝, 객체 감지, 구문 그라운딩, OCR, 세그멘테이션을 하나의 API로 제공합니다. 작업을 고르고 필요하면 텍스트 입력만 추가하면 됩니다.
FLUX.2 Klein 4B
Black Forest Labs
매우 빠른 이미지 생성·편집 모델입니다. 4스텝으로 증류되어 프로덕션 및 준실시간 애플리케이션에 적합한 1초 이내 추론 속도를 제공합니다.
FLUX 2 Flex
Black Forest Labs
최대 10개의 참조 이미지와 고급 타이포그래피를 지원하는 최고 품질 FLUX 모델입니다. 복잡한 다중 참조 크리에이티브 프로젝트에 가장 강력한 모델입니다.
FLUX 2 Max
Black Forest Labs
Black Forest Labs의 최고 충실도 이미지 모델입니다. FLUX.2 라인업 중 최고의 프롬프트 준수율과 가장 일관된 편집 성능을 제공하며, 최대 8장의 레퍼런스 이미지로 색상·조명·얼굴·텍스트·오브젝트를 편집 간에 보존합니다.
FLUX 2 Pro
Black Forest Labs
고품질 편집 기능과 최대 8개의 참조 이미지를 지원하는 프로페셔널 FLUX 2 모델입니다. 품질, 속도, 크리에이티브 제어의 뛰어난 균형을 제공합니다.
FLUX.2 Dev
Black Forest Labs
이미지 편집 기능과 참조 이미지 지원이 포함된 FLUX.2 개발 버전입니다. 반복적인 디자인 워크플로우와 실험에 이상적입니다.
FLUX 1.1 Pro
Black Forest Labs
FLUX.1 Pro를 업그레이드한 빠르고 고품질 이미지 생성 모델입니다. 속도와 충실도 모두가 필요한 프로덕션 워크로드에 적합합니다.
FLUX 1.1 Pro Ultra
Black Forest Labs
FLUX1.1 [pro]의 ultra·raw 모드입니다. FLUX 1.1 Pro 계열 중 최고 해상도인 최대 4메가픽셀 이미지를 생성합니다. 사실적인 결과가 필요하면 raw 모드를 사용하세요.
FLUX Dev
Black Forest Labs
텍스트 설명으로 이미지를 생성하는 120억 파라미터 규모의 rectified flow transformer입니다. 개방적이고 고품질의 실험용으로 튜닝되었습니다.
FLUX Kontext Max
Black Forest Labs
자연어 프롬프트로 이미지를 변형하는 프리미엄 텍스트 기반 이미지 편집 모델입니다. 최고 수준의 성능과 향상된 타이포그래피 생성 능력을 제공합니다.
FLUX Kontext Pro
Black Forest Labs
자연어로 이미지를 변환하는 최첨단 텍스트 기반 이미지 편집 모델입니다. 스타일 전환, 객체 수정, 텍스트 교체, 배경 변경, 캐릭터 일관성 작업에 뛰어납니다.
FLUX.1 Krea [dev]
Krea AI
'AI 느낌'을 특별히 배제하여 실제 사진과 구별할 수 없는 자연스러운 이미지를 생성하는 포토리얼리스틱 이미지 생성 모델입니다.
FLUX PuLID
ByteDance
FLUX-dev 기반 PuLID 정체성 커스터마이징: 얼굴 사진 한 장으로 특정 인물의 포토리얼 인물 사진을 생성합니다. SDXL 계열 대비 눈에 띄게 높은 얼굴 재현도가 강점이며, id_weight와 start_step으로 유사도와 프롬프트 편집성의 균형을 조절합니다.
FLUX.1 Schnell
Black Forest Labs
속도에 최적화된 초고속 이미지 생성 모델입니다. 1-2초 만에 고품질 이미지를 생성하며, 실시간 애플리케이션과 빠른 프로토타이핑에 적합합니다.
Runway Gen-4 Image
Runway
레퍼런스를 지원하는 Runway의 Gen-4 Image 모델입니다. 최대 3장의 레퍼런스 이미지를 프롬프트 속 @태그로 지칭해 캐릭터·사물·장소를 어떤 앵글과 장면에서도 일관되게 유지하며, 720p 또는 1080p로 생성합니다.
Runway Gen-4 Image Turbo
Runway
Gen-4 Image보다 2.5배 빠르고 저렴한 Turbo 버전으로, 레퍼런스 기반 API는 동일합니다. 1~3장의 레퍼런스 이미지를 @태그로 지칭해 캐릭터와 사물의 일관성을 유지하며, 해상도와 무관하게 단일 요금으로 과금됩니다.
GFPGAN
Tencent ARC
Tencent ARC의 얼굴 복원 모델입니다 — 1억 1,500만+ 실행으로 복원 컬렉션 최다 사용. 오래되거나 흐릿한 사진을 복원하고 AI 생성 이미지의 얼굴을 교정합니다.
GPT Image 2
OpenAI
강력한 지시 이해력, 선명한 텍스트 렌더링, 정밀한 편집을 갖춘 OpenAI의 최첨단 이미지 생성/편집 모델입니다. 품질 기반 가격으로 비용-품질 트레이드오프를 선택할 수 있습니다.
GPT Image 1.5
OpenAI
지시 이행력과 프롬프트 준수도가 향상된 OpenAI의 최신 이미지 생성 모델입니다. 선명한 텍스트 렌더링과 정교한 편집을 지원합니다.
Grok Imagine Image
xAI
xAI의 Grok Imagine 모델로 이미지를 생성합니다. Grok Imagine Video와 동일한 Grok Imagine 아키텍처를 공유하는 자매 모델로, 빠른 text-to-image 생성을 제공합니다.
Grounding DINO
Grounding DINO
자연어 프롬프트 기반 객체 감지입니다 (3,900만+ 실행). 찾고 싶은 것을 말로 설명하면('red car, person wearing a hat') 신뢰도 점수가 붙은 바운딩 박스와 시각화 이미지를 반환합니다.
Hunyuan 3D 3.1
Tencent
Tencent의 플래그십 3D 생성 모델입니다. 텍스트 프롬프트 또는 이미지로 고폴리곤 텍스처 3D 모델을 만들고, PBR(물리 기반 렌더링) 머티리얼 옵션을 지원합니다.
Ideogram V4 Balanced
Ideogram
Ideogram v4 패밀리의 중간 티어로, 생성 속도와 출력 품질 사이의 균형을 맞췄습니다. Quality 티어보다 낮은 비용으로 강력한 타이포그래피와 포토리얼리즘을 제공합니다.
Ideogram V4 Quality
Ideogram
Ideogram v4 모델 패밀리 중 가장 높은 충실도의 티어로, 최대한의 디테일과 사실적 표현, 정확한 타이포그래피에 최적화되어 있습니다. 속도보다 품질이 중요한 최종 프로덕션 에셋에 가장 적합합니다.
Ideogram V4 Turbo
Ideogram
Ideogram v4 패밀리에서 가장 빠르고 저렴한 모델로, Ideogram 특유의 텍스트 렌더링과 스타일 일관성을 유지하면서 빠른 반복 작업에 최적화되어 있습니다.
Ideogram V3 Turbo
Ideogram
Ideogram v3 중 가장 빠르고 저렴한 등급입니다. V3는 놀라운 사실감, 창의적인 디자인, 일관된 스타일의 이미지를 생성합니다.
Ideogram Character
Ideogram
레퍼런스 이미지 한 장으로 일관된 캐릭터를 생성하는 모델입니다. 실사부터 픽션까지 다양한 스타일로 동일 캐릭터를 렌더링하고, 마스크 인페인팅으로 기존 사진에 캐릭터를 삽입할 수 있으며, Ideogram 특유의 강점인 정확한 텍스트 렌더링까지 지원합니다.
MiniMax Image-01
MiniMax
MiniMax의 첫 이미지 생성 모델로 캐릭터 레퍼런스를 지원합니다. subject_reference에 얼굴 사진 한 장만 넣으면 프롬프트·스타일·화면 비율이 바뀌어도 동일 인물을 일관되게 생성하며, 요청당 최대 9장까지 만들 수 있습니다.
Topaz Image Upscale
Topaz Labs
사진 향상의 업계 표준 Topaz Labs의 프로페셔널 업스케일러입니다. 5가지 특화 향상 모델, 최대 6배 확대, 피사체 감지, 얼굴 보정 옵션을 제공합니다.
Imagen 4
Google의 플래그십 텍스트-이미지 모델인 Imagen 4입니다.
Imagen 4 Fast
최고 품질보다 속도와 비용이 중요할 때 사용하는 Imagen 4의 고속 버전입니다.
Bria Increase Resolution
Bria
상업적으로 안전한 Bria의 이미지 업스케일러입니다 (13만+ 실행). 라이선스 데이터만으로 학습된 모델로 해상도를 2배 또는 4배 확대하며 알파(투명) 채널을 보존합니다. 법적 책임 보장이 필요한 기업 파이프라인을 위해 설계되었습니다.
Krea 2 Large
Krea AI
포토리얼리스틱한 결과물과 강력한 프롬프트 이행력에 초점을 맞춘 Krea AI의 플래그십 텍스트-투-이미지 모델입니다. 스타일 레퍼런스와 무드보드 기반 생성을 지원하여 일관된 비주얼 디렉션을 유지할 수 있습니다.
Krea 2 Medium
Krea AI
Krea 2 Large의 저비용 버전으로, 동일한 포토리얼리즘 스타일에 집중하면서 일부 정밀도를 더 빠르고 저렴한 생성과 맞바꾼 모델입니다.
Microsoft MAI-Image 2.5 Pro
Microsoft
Fal.AI를 통해 제공되는 Microsoft의 최상급 이미지 생성 모델로, 프로덕션급 텍스트-투-이미지 생성을 위해 설계되었습니다. 히어로 이미지, 정교한 구도, 정확한 텍스트 렌더링, 포토리얼리즘, 스타일화된 일러스트, 상업용 디자인, 비주얼이 풍부한 컨셉 작업에 적합합니다.
Moondream2
Moondream
작지만 유능한 비전-언어 모델입니다 (1,400만+ 실행). 어떤 이미지든 자유롭게 질문하면 상세한 답변을 받습니다. 태깅·모더레이션 준비·풍부한 대체 텍스트용 고효율 VQA입니다.
Multilingual E5 Large
E5
다국어 텍스트 임베딩 모델입니다 (7,400만+ 실행). 한국어 포함 100개 언어에서 1024차원 벡터를 생성합니다. Core.Today 고객 데이터베이스의 벡터 검색(knn_vector)과 완벽하게 조합됩니다.
Nano Banana 2 (Gemini 3.1 Flash Image)
Gemini 3.1 Flash Image 기반의 Google 고속 이미지 생성 모델입니다. Nano Banana Pro의 고효율 버전으로, Pro급 시각 품질을 Flash 속도와 가격으로 제공합니다. 대화형 편집, 다중 이미지 융합, 캐릭터 일관성, 정확한 텍스트 렌더링, Google 검색 연동을 지원합니다. 최대 14장의 참조 이미지와 4K 해상도를 지원합니다.
Nano Banana 2 Lite
Gemini 3.1 Flash Image 기반의 가볍고 빠른 Nano Banana 2 변형 모델로, 더 빠르고 저렴한 생성에 최적화되어 있습니다. 대화형 편집, 멀티 이미지 퓨전, 캐릭터 일관성 등 풀 버전 Nano Banana 2의 핵심 기능을 그대로 유지합니다.
Nano Banana
멀티모달 편집 기능을 갖춘 Google Gemini 2.5 Flash 기반 이미지 생성 모델입니다. 생성과 편집 작업 모두에 빠르고 다재다능합니다.
Nano Banana Pro (Gemini 3 Pro Image)
Gemini 3 Pro 기반의 Google 최첨단 이미지 생성 및 편집 모델입니다. 다국어 텍스트 렌더링, Google 검색을 통한 실시간 정보 연동, 전문가급 크리에이티브 제어 기능을 제공합니다. 최대 14장의 참조 이미지와 4K 해상도를 지원합니다.
NSFW Image Detection
Falcons.ai
NSFW 이미지 분류의 표준입니다 (1억 2,700만+ 실행). 어떤 이미지든 'normal' 또는 'nsfw'로 판정합니다. UGC 플랫폼의 필수 모더레이션 게이트로, 이미지당 1크레딧입니다.
Pruna P-Image
Pruna AI
Pruna AI가 경량화(distilled)한 text-to-image 모델로, 매우 낮은 비용과 높은 처리량에 최적화되어 있습니다. 빠른 속도와 저렴한 가격 덕분에 Replicate에서 가장 많이 실행된 커뮤니티 모델 중 하나입니다(1,560만+ 실행).
Pruna P-Image Upscale
Pruna AI
최대 1억 2,800만 화소(128MP) 출력을 지원하는 PrunaAI의 하이엔드 이미지 업스케일러입니다 (57만+ 실행). 목표 메가픽셀 또는 배율 기반 제어, 디테일·리얼리즘 강화 옵션을 제공하며, 15크레딧부터 시작하는 메가픽셀 티어 과금을 사용합니다.
PhotoMaker
Tencent ARC
레퍼런스 사진 1-4장으로 인물의 스타일 사진을 생성합니다 (900만+ 실행). Cinematic, Disney Character, Digital Art 등 10가지 스타일 — 얼굴 정체성은 유지하고 나머지를 바꿉니다.
PhotoMaker Style
Tencent ARC
PhotoMaker의 스타일화 특화 버전: 인물 사진 1-4장을 더 강력한 스타일 트랜스퍼로 회화·코믹·3D 아트 등으로 변환합니다. 기본 PhotoMaker와 짝을 이루는 모델로, 사실감보다 스타일이 중요할 때 이 모델을 사용하세요.
Professional Headshot
Black Forest Labs
FLUX.1 Kontext [pro] 기반으로 사진 한 장을 세련된 비즈니스 프로필 사진으로 변환합니다. 화이트·블랙·그레이·뉴트럴·오피스 배경 중 하나를 고르면 링크드인에 바로 쓸 수 있는 인물 사진이 한 번에 완성됩니다.
Proteus v0.2
Proteus
인기 애니메이션 특화 이미지 모델입니다 (1,200만+ 실행). 고품질 애니메·일러스트 스타일과 img2img·인페인팅을 지원합니다. 애니메 아바타·웹툰풍 아트의 대표 선택지입니다.
PuLID
ByteDance
ByteDance PuLID: SDXL 기반의 튜닝 없는 정체성 커스터마이징 모델입니다. 얼굴 사진 한 장과 프롬프트만으로 어떤 장면·스타일의 인물 사진도 생성 — 별도 학습 없이 4스텝 고속 샘플링, 두 얼굴 혼합까지 지원합니다. 이미지당 2크레딧의 압도적인 가성비가 강점입니다.
Real-ESRGAN
Real-ESRGAN
가장 널리 쓰이는 클래식 이미지 업스케일러입니다 (9,400만+ 실행). 최대 10배 Real-ESRGAN 초해상도와 GFPGAN 얼굴 보정 옵션을 제공하는, 사진·AI 이미지 확대의 표준 모델입니다.
Recraft V4
Recraft
Recraft의 차세대 text-to-image 모델로, V3 대비 타이포그래피 처리, 스타일 범위, 프롬프트 반영도를 개선하여 프로덕션급 브랜드·디자인 에셋 제작에 적합합니다.
Recraft V4 SVG
Recraft
Recraft V4를 기반으로 SVG 형식의 벡터 그래픽을 직접 생성합니다. 로고, 아이콘 등 어떤 크기에서도 선명함을 유지해야 하는 확장 가능한 일러스트에 적합합니다.
Recraft V3
Recraft
Recraft V3(코드명 red_panda)는 긴 텍스트 생성이 가능하고 폭넓은 스타일을 지원하는 텍스트-이미지 모델입니다. Artificial Analysis Text-to-Image Benchmark 기준 SOTA 성능을 보유하고 있습니다.
Recraft Crisp Upscale
Recraft
선명하고 또렷한 결과에 최적화된 Recraft의 빠르고 저렴한 업스케일러입니다. 이미지 하나만 넣으면 튜닝 없이 동작합니다. UI 에셋, 일러스트, 상품 이미지의 기본 선택지로 좋습니다.
Remove Background
Bria AI
AI 기반 이미지 배경 제거 도구입니다. 전문적인 수준의 엣지 감지로 모든 피사체에 대해 깔끔하고 정확한 컷아웃을 제공합니다.
Remove BG
lucataco
Replicate 최다 실행 배경 제거 모델 중 하나입니다 (1,700만+ 실행). 파라미터 하나로 배경을 제거하고 투명 PNG를 반환하는 초간단 API — 이미지당 1크레딧으로 플랫폼에서 가장 저렴한 누끼입니다.
Stable Diffusion XL
Stability AI
Stability AI의 클래식 SDXL입니다 (8,500만+ 실행). img2img, 인페인팅, 리파이너, LoRA를 지원하는 검증된 텍스트-이미지 모델로, 방대한 생태계를 가진 믿을 수 있는 워크호스입니다.
SDXL Lightning 4-step
ByteDance
Replicate 역대 최다 실행 모델인 ByteDance의 4스텝 SDXL Lightning입니다 (10억+ 실행). 1024px 이미지를 거의 즉시, 카탈로그 최저가 수준으로 생성합니다.
Seedream 5 Lite
ByteDance
Seedream 5.0 lite는 논리 추론, 예시 기반 편집, 전문 도메인 지식을 갖춘 이미지 생성 모델입니다. 최대 14장의 멀티 레퍼런스 생성과 연속 배치 생성을 지원합니다.
Seedream 5 Pro
ByteDance
바이트댄스의 플래그십 Seedream 5.0 Pro 이미지 생성 모델로, 내장 추론과 정밀한 지시 이행, 최대 10장의 멀티 레퍼런스 생성을 지원합니다. Seedream 5 Lite보다 높은 충실도의 1K/2K 해상도 출력을 제공합니다.
Seedream 4.5
ByteDance
공간 이해력과 세계 지식이 강화된 ByteDance의 업그레이드 이미지 모델입니다. 단일/다중 참조 이미지 편집과 순차(다중 이미지) 생성을 지원합니다.
Seedream 4.0
ByteDance
뛰어난 프롬프트 이해력과 창의적 능력을 갖춘 ByteDance의 최신 이미지 생성 모델입니다.
Text Extract OCR
OCR
가장 많이 쓰이는 심플 OCR입니다 (9,100만+ 실행). 이미지 하나를 넣으면 텍스트를 plain text로 반환합니다. 영수증·스크린샷·스캔 문서 처리의 기본 선택지로, 단 1크레딧입니다.
TRELLIS
Microsoft
Microsoft의 TRELLIS 이미지→3D 모델입니다 (83만+ 실행, Replicate 최다 사용 3D 모델). 이미지 1장 이상으로 텍스처가 입혀진 GLB 3D 에셋을 만들고, 턴테이블 렌더 영상과 Gaussian PLY도 출력할 수 있습니다.
Google Upscaler
Google의 이미지 업스케일러입니다 (77만+ 실행). 생성형 AI로 자연스러운 디테일을 유지하며 이미지를 2배 또는 4배 확대하고, 출력 압축 품질을 조절할 수 있습니다. 고정 가격의 간결하고 신뢰할 수 있는 업스케일러입니다.
Z-Image Turbo
Pruna AI
Pruna의 초고속 Z-Image Turbo입니다 (4,800만+ 실행). 최대 2048x2048까지 메가픽셀 단위로 과금되어 생성한 해상도만큼만 지불합니다. 대량 사용에 뛰어난 가성비를 제공합니다.
비디오 생성 모델
Kling, MiniMax 등 최신 모델로 AI 비디오를 제작하세요
Add Watermark
추천FullJourney
어떤 영상에든 텍스트 워터마크를 추가합니다. 생성 콘텐츠나 사용자 콘텐츠의 브랜드 보호를 영상당 2크레딧으로 간단하고 빠르게 처리합니다.
CogVLM2 Video
CogVLM
비디오 이해·캡셔닝 모델입니다. 영상에 대해 자유롭게 질문하면 동작·장면·내용에 대한 상세한 답변을 받습니다. 비디오 검색 인덱싱과 모더레이션 준비에 유용합니다.
Google Gemini Omni Flash
Fal.AI를 통해 제공되는 Google Gemini Omni Flash 텍스트-투-비디오 모델입니다. 서술형 텍스트 프롬프트만으로 영상을 생성하며, 페이싱과 오디오(대사, 배경음악)도 프롬프트 안에서 직접 제어합니다. 16:9 또는 9:16 화면비로 3~10초 길이의 영상을 만들 수 있습니다.
Gen-4.5
Runway
Runway의 Gen-4.5 모델로, 텍스트-비디오 및 이미지-비디오 생성에서 최고 수준의 모션 품질, 프롬프트 반영도, 비주얼 퀄리티를 제공합니다.
Grok Imagine Video 1.5
xAI
xAI의 Grok Imagine Video 1.5 프리뷰: 동기화 오디오를 갖춘 이미지-비디오 생성 모델입니다. Grok Imagine Video의 업그레이드 버전으로, 해상도와 무관한 단일 초당 요금이 특징입니다.
Grok Imagine Video
xAI
xAI의 Grok Imagine Video 모델로 비디오를 생성합니다. 텍스트-비디오, 이미지-비디오 변환, 그리고 기존 짧은 비디오 클립 편집을 지원합니다.
MiniMax Hailuo 2.3
MiniMax
고급 캐릭터 일관성과 자연스러운 움직임을 갖춘 사실적인 인물 모션 비디오 생성 모델입니다.
MiniMax Hailuo 2.3 Fast
MiniMax
인물 모션 비디오의 좋은 품질을 유지하면서 더 빠른 생성을 위해 최적화된 Hailuo 2.3의 저지연 버전입니다.
Happy Horse 1.1
Alibaba
알리바바의 Happy Horse 1.1은 텍스트로 비디오를 생성하고, 단일 이미지를 애니메이션화하며, 여러 레퍼런스 이미지로부터 비디오를 만들어냅니다. 720p·1080p 해상도, 3~15초 길이, 5가지 화면 비율을 지원합니다.
MiniMax Hailuo-03 (H3) Image to Video
MiniMax
Fal.AI를 통해 제공되는 MiniMax Hailuo-03(H3) 이미지-투-비디오 모델입니다. 첫 프레임 이미지를 기반으로 2K 해상도의 5~15초 영상을 생성하며, 네이티브 오디오와 end_image_url을 이용한 첫-마지막 키프레임 제어를 지원합니다.
Kling v3 Omni Video
Kuaishou
Kling Video 3.0 Omni는 텍스트, 이미지, 레퍼런스 이미지, 기존 비디오로부터 영상을 생성·편집하는 통합 멀티모달 비디오 모델입니다. 텍스트-비디오, 이미지-비디오, 레퍼런스 기반 생성, 비디오 편집을 네이티브 오디오와 멀티샷 제어로 하나의 모델에 통합했습니다.
Kling v3 Video
Kuaishou
Kling Video 3.0은 최대 15초의 시네마틱 비디오를 생성하는 Kuaishou의 플래그십 텍스트/이미지-비디오 모델입니다. 멀티샷 제어, 네이티브 오디오, 시작/종료 프레임 이미지, 전용 4K 모드를 지원합니다.
Kling v2.6
Kuaishou
Kling 2.6 Pro: 시네마틱한 비주얼과 유려한 움직임, 네이티브 오디오 생성을 지원하는 최상위 이미지-비디오 모델입니다. 오디오 생성은 기본적으로 켜져 있습니다.
Kling 2.5 Turbo Pro
Kuaishou
향상된 모션과 장면 일관성을 갖춘 시네마틱급 비디오 생성 모델입니다. 프로페셔널 출력을 위한 최상위 Kling 모델입니다.
Kling v2.1
Kuaishou
720p/1080p 지원과 프레임 전환 기능을 갖춘 Kling v2.1로, 부드럽고 고품질의 비디오를 생성합니다.
LatentSync
ByteDance
ByteDance의 오픈소스 립싱크 모델입니다. 잠재 확산(latent diffusion)으로 영상의 입 모양을 어떤 오디오에든 다시 동기화합니다. 더빙·현지화를 위한 오픈소스 최고 수준의 립싱크 품질입니다.
MMAudio
MMAudio
어떤 영상에든 AI 사운드를 입힙니다 (500만+ 실행). 영상 내용과 텍스트 프롬프트로 동기화된 오디오(앰비언스·효과음·폴리)를 합성합니다. 무음인 AI 생성 클립의 마무리에 완벽합니다.
Pruna P-Video
Pruna AI
빠른 시안 작업을 위한 드래프트 모드를 내장한 PrunaAI의 고속 비디오 생성 모델입니다. 텍스트-비디오, 이미지-비디오, 오디오 조건 생성을 단일 엔드포인트로 지원하며, 최대 20초 클립 생성이 가능해 플랫폼에서 가장 긴 길이를 지원하는 모델 중 하나입니다.
Pruna P-Video Avatar
Pruna AI
Pruna AI의 토킹 아바타 비디오 모델입니다 — 하나의 입력 이미지를 애니메이션화하여 제공된 텍스트(voice_script)나 업로드된 오디오 트랙을 말하게 하며, Gemini 계열의 선택형 프리셋 보이스, 언어, 시각적 연출 프롬프트를 지원합니다.
PixVerse V6
PixVerse
PixVerse의 플래그십 비디오 생성 모델입니다. 동기화 오디오, 장면 전환이 있는 멀티샷 시퀀스, 놀라운 물리 표현, 정밀한 카메라 제어를 갖춘 시네마틱 비디오를 최대 1080p로 생성합니다.
PixVerse V5
PixVerse
특수 효과 기능과 애니메이션 최적화 출력을 갖춘 고급 비디오 생성 모델로, 다양한 시각적 스타일을 지원합니다.
Luma Ray 3.2
Luma
Luma의 플래그십 Ray 비디오 모델입니다. 텍스트-비디오 및 키프레임(시작/종료 이미지) 생성을 지원하며, 선택적으로 HDR 인코딩 출력과 전문가용 EXR 익스포트를 제공합니다.
Luma Ray Flash 2 720p
Luma
Luma의 Ray Flash 2는 Ray 2보다 빠르고 저렴하게 5초 또는 9초의 720p 비디오를 생성합니다. 시작·종료 이미지를 통한 키프레임 제어, 매끄러운 루프 옵션, 풍부한 카메라 모션 콘셉트 라이브러리를 지원하며, 플랫폼에 처음 추가된 Luma 모델입니다.
Real-ESRGAN Video
Real-ESRGAN
Real-ESRGAN 기반 비디오 업스케일링입니다. 프레임 단위로 영상을 FHD·2K·4K로 향상합니다. 오래된 영상과 AI 생성 클립을 위한 대표적인 오픈소스 비디오 업스케일러입니다.
SadTalker
SadTalker
사진 한 장과 오디오로 토킹헤드 영상을 만듭니다. 자연스러운 머리 움직임과 눈 깜빡임으로 얼굴을 애니메이션하며, GFPGAN 얼굴 향상 옵션을 제공합니다.
Seedance 2.0
ByteDance
네이티브 동기화 오디오를 갖춘 ByteDance의 차세대 멀티모달 비디오 모델입니다. 최대 9장의 레퍼런스 이미지, 3개의 비디오, 3개의 오디오를 한 번의 생성에 조합하여 캐릭터 일관성과 립싱크를 유지하는 비디오 생성·편집·확장을 지원합니다.
Seedance 2.0 Fast
ByteDance
Seedance 2.0의 더 빠르고 저렴한 변형 모델로, 최대 9장의 이미지·3개의 비디오·3개의 오디오 레퍼런스 입력과 네이티브 오디오를 480p 또는 720p로 지원합니다.
Seedance 2.0 Mini
ByteDance
ByteDance Seedance 2.0의 경량·저비용 버전입니다. 네이티브 오디오, 멀티모달 레퍼런스 입력(이미지/비디오/오디오), 텍스트-비디오 및 이미지-비디오 생성을 지원하며 최대 720p까지 제공합니다(1080p/4K 티어 없음).
Seedance 1 Lite
ByteDance
ByteDance의 경량 비디오 생성 모델로, 텍스트-비디오 및 이미지-비디오 변환을 4~12초 길이, 480p·720p·1080p 해상도로 지원합니다.
Seedance 1 Pro
ByteDance
Seedance의 프로 버전으로, 2~12초 길이의 텍스트-비디오·이미지-비디오 변환을 480p·720p·1080p 해상도로 지원합니다.
Seedance 1 Pro Fast
ByteDance
빠른 생성 속도와 프로페셔널 출력 품질을 갖춘 ByteDance의 시네마틱 비디오 생성 모델입니다.
OpenAI Sora 2
OpenAI
사실적인 물리 시뮬레이션과 오디오 생성 기능을 갖춘 OpenAI의 비디오 생성 모델로, 높은 일관성의 비디오를 생성합니다.
OpenAI Sora 2 Pro
OpenAI
OpenAI의 가장 진보한 동기화 오디오 비디오 생성 모델입니다. Sora 2의 프리미엄 등급으로 더 높은 충실도와 최대 1024p 해상도, 레퍼런스 프레임을 통한 이미지-비디오를 지원합니다.
MiniMax Hailuo-03 (H3) Text to Video
MiniMax
Fal.AI를 통해 제공되는 MiniMax Hailuo-03(H3) 텍스트-비디오 모델입니다. 텍스트 프롬프트로부터 최신 수준의 2K 비디오를 생성하며, 5-15초 길이, 네이티브 오디오, 21:9부터 9:16까지 폭넓은 화면 비율을 지원합니다.
Veed Lipsync v2
Veed
Fal.AI를 통해 제공되는 Veed Lipsync v2 모델입니다. 원본 영상의 입 모양을 새로운 오디오 트랙에 맞춰 재구성합니다 — 원본 영상과 새 오디오 트랙만 있으면 입 모양이 자연스럽게 동기화된 결과 영상을 생성합니다.
Google Veo 3.1
내장 오디오 생성 기능을 갖춘 Google의 최첨단 비디오 생성 모델로, 동기화된 사운드와 함께 시네마틱 품질의 비디오를 생성합니다.
Google Veo 3.1 Fast
오디오 생성 기능을 갖춘 Veo 3.1의 고속 버전으로, 높은 품질을 유지하면서 속도에 최적화되었습니다.
Video Utils
FFmpeg
FFmpeg 기반 비디오 유틸리티입니다 (2,000만+ 실행). task 파라미터 하나로 mp4/gif 변환, mp3 오디오 추출, 프레임 zip 추출을 처리합니다. 미디어 파이프라인의 맥가이버 칼입니다.
Wan 2.7 I2V
Alibaba
Alibaba Wan 2.7 이미지-비디오 모델입니다. 첫 프레임(및 선택적 마지막 프레임 또는 연속 클립)을 애니메이션화하며 오디오 동기화를 지원하고, 최대 15초까지 720p 또는 1080p로 생성됩니다.
Wan 2.7 T2V
Alibaba
Alibaba Wan 2.7 텍스트-비디오 모델입니다. 최대 15초 길이, 음성/음악 오디오 동기화, 다국어 프롬프트, 프롬프트 확장을 지원하며 720p 또는 1080p로 생성됩니다.
Wan 2.5 I2V
Alibaba
립싱크 지원이 포함된 이미지-비디오 모델로, 정지 이미지를 자연스러운 모션의 사실적인 비디오로 변환합니다.
Wan 2.5 I2V Fast
Alibaba
Wan 2.5의 고속 이미지-비디오 변형으로, 정지 이미지로부터 빠르게 애니메이션 비디오를 생성합니다.
Wan 2.5 T2V
Alibaba
오디오 동기화 지원이 포함된 텍스트-비디오 모델로, 자연스러운 모션과 함께 텍스트 프롬프트로부터 고품질 비디오를 생성합니다.
Wan 2.5 T2V Fast
Alibaba
Wan 2.5의 고속 텍스트-비디오 생성 변형으로, 좋은 품질의 출력을 유지하면서 속도에 최적화되었습니다.
Wan 2.2 I2V Fast
Alibaba
Alibaba의 Wan 2.2 A14B 이미지-비디오 모델을 PrunaAI가 최적화해 매우 빠르고 저렴하게 만든 버전입니다. 정지 이미지 한 장과 프롬프트만으로 480p 또는 720p의 짧은 애니메이션 클립을 생성하며, 더 부드러운 움직임을 위한 프레임 보간 옵션도 제공합니다.
Wan 2.2 T2V Fast
Alibaba
Alibaba의 Wan 2.2 A14B 텍스트-비디오 모델을 PrunaAI가 최적화해 매우 빠르고 저렴하게 만든 버전입니다. 텍스트 프롬프트만으로 480p 또는 720p의 짧은 클립을 생성하며, 30FPS 프레임 보간이 기본으로 켜져 있습니다. 이미 플랫폼에 있는 Wan 2.2 I2V Fast의 텍스트-비디오 버전입니다.
오디오 & TTS 모델
Text-to-Speech, 음성 클론, 오디오 생성
Bark
추천Suno
Suno의 텍스트 프롬프트 생성 오디오 모델입니다. [laughs]·[sighs] 같은 비언어 사운드가 포함된 음성은 물론 음악·효과음까지 생성하며, 13개 언어의 100개 이상 화자 프리셋을 제공합니다. 오디오와 함께 음성 연속성을 위한 .npz 히스토리 파일도 반환할 수 있습니다.
Chatterbox
Resemble AI
고유한 감정 과장(exaggeration) 제어와 짧은 레퍼런스 오디오 기반 즉시 음성 복제를 갖춘 Resemble AI의 프로덕션급 오픈소스 TTS입니다. MIT 라이선스로 주요 상용 시스템과 비교 벤치마크된 모델입니다.
Chatterbox Multilingual
Resemble AI
23개 언어를 지원하는 Chatterbox 오픈소스 TTS입니다. 즉시 음성 복제와 감정 과장 제어를 제공합니다. 요청당 최대 300자.
Chatterbox Turbo
Resemble AI
품질 저하 없이 가장 빠른 Resemble AI 오픈소스 TTS입니다. 20개 프리셋 음성, [sigh]·[chuckle] 같은 준언어 태그, 5초 이상 레퍼런스 오디오로 즉시 음성 복제를 지원합니다. 요청당 최대 500자.
Gemini 3.1 Flash TTS
Replicate를 통해 제공되는 Google Gemini 3.1 Flash 네이티브 오디오 TTS입니다. 실제 발화 텍스트와 별도의 스타일 지시문, 30종의 프리셋 음성, 40개 이상의 언어/로케일 코드를 지원하며, [sigh], [whispering], [shouting] 등 인라인 마크업 태그로 감정 표현이 가능합니다.
Incredibly Fast Whisper
Whisper
속도에 최적화된 Whisper large-v3입니다 (3,800만+ 실행). 배치 추론으로 약 150분 분량 오디오를 100초 이내에 전사합니다. 청크/단어 단위 타임스탬프를 지원합니다.
Suno Music V5.5
Suno
Suno의 최신 모델로, 최고 음질과 가장 풍부한 편곡을 제공합니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.
Suno Music V5
Suno
향상된 음질과 음악성을 갖춘 Suno V5 음악 생성 모델입니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.
Suno Music V4.5
Suno
Suno V4.5 음악 생성 모델입니다. 텍스트 설명만으로, 또는 커스텀 모드에서 가사·스타일·제목을 직접 지정해 완성곡 2곡을 생성합니다. 각 트랙의 오디오, 커버 이미지, 메타데이터를 반환합니다.
MiniMax Music 2.6
MiniMax
텍스트 프롬프트로 최대 6분 길이의 완성곡 또는 연주곡을 생성합니다. 99% 이상 정확한 BPM·조성 제어, 14종 이상의 구조 태그, 가사 자동 생성, 보컬 없는 연주곡 모드를 지원합니다.
MiniMax Music 2.5
MiniMax
보컬, 가사, 풍부한 악기 구성을 갖춘 최대 5분 길이의 완성곡을 생성합니다. 14종 구조 태그, 장르별 특성을 반영하는 스타일-aware 믹싱, 오케스트라·전통 악기까지 확장된 악기 라이브러리를 지원합니다.
MiniMax Music Cover
MiniMax
어떤 곡이든 다른 스타일로 재해석합니다. 입력 오디오에서 멜로디 구조를 추출해 트랙을 재생성합니다 — 멜로디와 곡 길이는 유지되고, 목소리·악기·장르·편곡은 모두 바뀔 수 있습니다.
Qwen3 TTS
Qwen
3가지 모드를 갖춘 Alibaba의 통합 TTS입니다: 프리셋 화자(custom_voice), 레퍼런스 오디오 기반 즉시 음성 복제(voice_clone), 텍스트 설명만으로 새로운 목소리 생성(voice_design).
Inworld Realtime TTS 2
Inworld
자연어 스티어링을 지원하는 Inworld의 최고 표현력 TTS입니다. [speak quickly]처럼 대괄호 지시문을 텍스트 앞에 붙여 말투를 제어합니다. 실시간 지연 시간과 15개 이상 언어를 지원합니다.
Suno SFX V5
Suno
Suno V5 효과음 생성 모델입니다. 텍스트 설명만으로 짧은 효과음 2가지 변형을 생성하며, 루프 모드·템포·조성(key)을 옵션으로 제어할 수 있습니다. UI 사운드, 게임 오디오, 영상 폴리에 적합합니다.
MiniMax Speech 2.8 HD
MiniMax
Artificial Analysis Speech Arena 및 Hugging Face TTS Arena 1위. 자동회귀 Transformer + Flow-VAE 디코더 기반 방송 품질 TTS로, 32개 이상 언어, 음성 클론, 자연스러운 감탄사, 감정 제어를 지원합니다.
MiniMax Speech 2.8 Turbo
MiniMax
250ms 미만 지연의 저지연 MiniMax Speech 2.8 Turbo. 40개 이상 언어, 음성 클론, 자연스러운 감탄사, 실시간 과금을 지원합니다. 인터랙티브 및 실시간 애플리케이션에 적합합니다.
MiniMax Speech 2.6 HD
MiniMax
전문 애플리케이션을 위한 미묘한 운율, 감정 제어, 프리미엄 음성을 갖춘 스튜디오 품질 다국어 텍스트-음성 변환 모델입니다.
MiniMax Speech 2.6 Turbo
MiniMax
감정 제어가 가능한 빠른 다국어 텍스트-음성 변환 모델로, 저지연 실시간 애플리케이션에 최적화되어 있습니다.
MiniMax Speech-02-Turbo
MiniMax
다국어 지원, 감정 음성 제어, 300개 이상의 목소리 옵션을 갖춘 저지연 텍스트-음성 변환 모델입니다.
Sonilo v1.1 Text to Music
Sonilo
Fal.AI를 통해 제공되는 Sonilo v1.1 텍스트-투-뮤직 모델입니다. 원하는 사운드를 설명하는 텍스트만으로 최대 3개의 서로 다른 음악 트랙(각 최대 600초)을 생성합니다.
Inworld TTS 1.5 Max
Inworld
200ms 미만 지연의 Inworld 최고 품질 실시간 TTS입니다. SSML break 태그로 일시정지, [happy] 같은 감정 마크업, 15개 언어를 지원합니다.
Clova Voice TTS Premium
NCP Clova
108개 음성, 6개 언어를 지원하는 네이버 클로바 보이스 프리미엄 TTS. 고품질 한국어 음성 합성, 감정 표현, Pro 음성, 이중 언어 지원.
ElevenLabs Turbo v2.5
ElevenLabs
고품질·저지연 ElevenLabs 텍스트-음성 변환 모델입니다. v3와 동일한 26개 프리미엄 음성을 절반 가격으로, 32개 언어에서 실시간·대량 처리에 최적화되어 있습니다.
ElevenLabs v3
ElevenLabs
ElevenLabs의 가장 표현력 있는 텍스트-음성 변환 모델입니다. 26개 프리미엄 음성, [laughs]·[whispers] 같은 인라인 오디오 태그, 정밀한 스타일·안정성 제어, 70개 이상 언어를 지원합니다.
ElevenLabs v2 Multilingual
ElevenLabs
30개 이상 언어를 지원하는 ElevenLabs Multilingual v2 텍스트-음성 변환 모델입니다. 검증된 안정적인 음질과 동일한 프리미엄 음성 라인업, 정밀한 음성 설정을 제공합니다.
Sonilo v1.1 Video to Sound Effects
Sonilo
Fal.AI를 통해 제공되는 Sonilo v1.1 비디오-투-사운드이펙트 모델입니다. 입력 영상에 AI가 생성한 사운드(환경음, 효과음, 폴리)를 추가합니다. 프롬프트가 없으면 장면을 자동으로 캡션 처리하고, 구간별 사운드 설명을 제공하면 더 세밀한 제어가 가능합니다.
Suno Vocal Separation
Suno
Suno로 생성한 곡을 보컬과 반주(인스트루멘탈) 스템으로 분리합니다. 이전 Suno 음악 생성 결과의 taskId와 audioId를 입력하면 분리된 vocalUrl/instrumentalUrl 오디오 파일을 반환합니다.
MiniMax Voice Cloning
MiniMax
10초~5분 분량의 오디오 샘플로 어떤 목소리든 복제합니다. MiniMax 음성 모델의 voice_id로 바로 사용할 수 있는 커스텀 voice_id와 복제 음성으로 합성한 미리듣기 클립을 반환합니다.
Whisper
OpenAI
음성 전사의 표준인 OpenAI Whisper large-v3입니다 (1억 4,400만+ 실행). 약 100개 언어 자동 감지, 영어 번역, plain text/SRT/VTT 출력 형식을 지원합니다.
Whisper Diarization
Whisper
화자 분리(diarization)가 포함된 Whisper 전사입니다 (800만+ 실행). 누가 무엇을 말했는지 세그먼트별 화자 라벨과 타임스탬프로 반환합니다. 회의·인터뷰 전사의 정석입니다.
XTTS-v2
Coqui
Coqui XTTS-v2 다국어 음성 복제 TTS입니다. 짧은 오디오 샘플 하나로 음성을 복제해 16개 언어로 말하게 할 수 있는, 가장 널리 쓰이는 오픈소스 음성 복제 모델 중 하나입니다.
LLM 모델
GPT-4o, Claude, Gemini - OpenAI 호환 채팅 API
Claude Haiku 4.5
추천Anthropic
일상적인 작업을 위한 빠르고 비용 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 지능, 비용의 훌륭한 균형을 제공합니다.
Claude Opus 5
Anthropic
기본 1M 토큰 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 Opus 모델입니다. Opus 4.5~4.8과 동일한 가격($5/$25 per M 토큰)에 프롬프트 캐싱(read $0.50/M, write $6.25/M)과 웹 검색을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Opus 4.8
Anthropic
1M 토큰 컨텍스트 윈도우(일부 환경 200K), 128K 최대 출력 토큰, 2026년 1월까지의 학습 기준일을 갖춘 Anthropic 최상위 Opus 모델입니다. Opus 4.7 대비 장기 에이전트형 코딩, 도구 호출 정확도가 향상되었고, 필요한 턴에서만 추론하는 adaptive thinking을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Opus 4.7
Anthropic
2026년 1월까지의 신뢰할 수 있는 학습 기준일과 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 모델입니다. Opus 4.6 대비 추론, 코딩, 지시 따르기 성능이 향상되었으며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Opus 4.6
Anthropic
Anthropic의 가장 강력한 모델입니다. 향상된 안전성과 지시 따르기 능력으로 추론, 코딩, 복잡한 분석에서 획기적인 성능을 제공합니다.
Claude Opus 4.5
Anthropic
매우 복잡한 작업을 위한 Anthropic의 가장 강력한 모델입니다. 깊은 전문성이 필요한 연구, 분석 및 창의적 프로젝트에 탁월합니다.
Claude Sonnet 5
Anthropic
속도, 비용, 지능의 균형에 최적화된 Anthropic의 최신 Sonnet 모델입니다. 1M 토큰 컨텍스트 윈도우, 64K 최대 출력 토큰, 2025년 8월까지의 학습 기준일을 갖췄습니다. 필요한 턴에서만 추론하는 adaptive thinking, 비전, 도구 사용을 지원하며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Sonnet 4.5
Anthropic
Anthropic의 가장 지능적이고 강력한 Sonnet 모델입니다. 복잡한 추론, 미묘한 이해, 코딩 작업에서 최고 수준이며 뛰어난 지시 따르기 능력을 제공합니다.
Claude Sonnet 4
Anthropic
효율적인 가격대에서 강력한 추론과 코딩 능력을 제공하는 균형 잡힌 Sonnet 4 모델입니다. 속도와 지능의 적절한 조합이 필요한 일상적인 프로덕션 워크로드에 이상적입니다.
Gemini 3.5 Flash
Google의 최신 Flash 티어 주력 모델입니다. 모든 입력 모달리티(텍스트·이미지·비디오·오디오·PDF)가 백만 토큰당 $1.50/$9의 동일 요율이며 롱 컨텍스트 할증이 없습니다. 1M 토큰 컨텍스트 윈도우와 65,536 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.
Gemini 3.1 Flash Image Preview
네이티브 이미지 생성 기능을 갖춘 Gemini 3.1 Flash입니다. 채팅 응답에서 텍스트와 함께 이미지를 직접 생성할 수 있습니다. 텍스트와 이미지 출력 토큰에 별도의 가격이 적용됩니다.
Gemini 3.1 Flash Lite
초경량 Gemini 3.1 Flash Lite의 정식(stable) 릴리스입니다. 백만 토큰당 $0.25/$1.50로 가장 비용 효율적인 Gemini 모델이며, 캐시 입력(90% 할인), 오디오 입력, 배치(50% 할인)를 지원합니다. 고처리량·저비용 애플리케이션에 적합합니다.
Gemini 3.1 Flash Lite Preview
Gemini 3.1 Flash의 초경량 변형 모델입니다. 캐시된 입력과 오디오 입력을 지원하는 가장 비용 효율적인 Gemini 모델입니다. 고처리량, 비용 의식적 애플리케이션에 적합합니다.
Gemini 3.1 Flash Live Preview
실시간 상호작용 및 라이브 스트리밍 시나리오에 최적화된 Gemini 3.1 Flash입니다. 전용 가격의 오디오 입력 지원과 함께 저지연 응답을 제공합니다.
Gemini 3.1 Pro Preview
Google의 최신이자 가장 강력한 Gemini 모델 프리뷰입니다. 컨텍스트 길이에 따라 조정되는 동적 가격 책정이 적용되며, 200K 토큰 이상 입력 시 확장 가격이 적용됩니다.
Gemini 3 Flash
최첨단 멀티모달 이해력, 박사급 추론 능력, 최고 수준의 코딩 성능을 갖춘 Google의 가장 진보된 추론 모델입니다.
Gemini 3 Pro Image Preview
Gemini 3 Pro 제품군의 프리미엄 이미지 생성 모델입니다. 채팅에서 직접 최고 충실도의 이미지를 생성합니다. 이미지 출력 토큰은 텍스트 출력 토큰의 10배 가격이 적용됩니다.
Gemini 3 Pro Preview
Google의 가장 강력한 Gemini 모델 프리뷰 버전입니다. 획기적인 추론, 코딩, 멀티모달 기능과 최대 컨텍스트 윈도우를 제공합니다.
Gemini 2.5 Flash
사고 능력이 내장된 Google의 빠르고 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 추론, 비용의 훌륭한 균형을 제공합니다.
Gemini 2.5 Pro
최첨단 추론 능력과 1M 토큰 컨텍스트를 갖춘 Google의 가장 강력한 모델입니다. 복잡한 코딩, 수학, 다중 문서 분석에 탁월합니다.
Gemini 2.0 Flash
Google의 가장 빠르고 강력한 모델입니다. 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달 지원 및 실시간 기능을 제공합니다.
Gemini 2.0 Flash Lite
최대 속도와 최소 비용을 위해 최적화된 Gemini 2.0 Flash의 초경량 버전입니다. 대량의 지연에 민감한 애플리케이션에 적합합니다.
Gemini Embedding 001
벡터 표현 생성을 위한 Google의 텍스트 임베딩 모델입니다. 의미 검색, 클러스터링, 유사도 작업에 최적화되어 있습니다.
GPT-5.6 Luna
OpenAI
OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 고속·저비용 티어입니다. 백만 토큰당 $1/$6의 가격으로 고처리량 워크로드에 최적화되어 있으며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.
GPT-5.6 Sol
OpenAI
OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 플래그십 티어입니다. 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원하며, 세대 내 최고 수준의 추론·코딩·멀티모달 성능을 제공합니다.
GPT-5.6 Terra
OpenAI
OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 균형 티어입니다. Sol의 절반 가격으로 플래그십에 근접한 품질을 제공하며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.
GPT-5.5
OpenAI
1.05M 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. 캐시 입력 10배 할인을 지원하며 GPT-5.4 시리즈 대비 추론, 코딩, 멀티모달 성능이 향상되었습니다.
GPT-5.4
OpenAI
1M 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. none부터 xhigh까지 조절 가능한 추론 수준으로 모든 영역에서 최상위 추론 성능을 제공합니다.
GPT-5.4 Mini
OpenAI
400K 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 GPT-5.4의 빠르고 비용 효율적인 변형 모델입니다. 일상적인 작업에서 성능과 가성비의 탁월한 균형을 제공합니다.
GPT-5.4 Nano
OpenAI
400K 컨텍스트와 128K 출력을 갖춘 초경량 최고속 GPT-5.4 변형 모델입니다. 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다. 도구 통합을 위한 MCP를 지원합니다.
GPT-5.2
OpenAI
OpenAI의 최신이자 가장 진보된 GPT 모델입니다. 향상된 기능으로 추론, 코딩, 창의적 작업 전반에서 최첨단 성능을 제공합니다.
GPT-5.1 (2025-11-13)
OpenAI
재현 가능한 결과를 위한 GPT-5.1의 날짜별 스냅샷입니다. 반복 컨텍스트에 대한 캐시된 입력 토큰으로 비용 절감을 지원합니다. 모델 버전 고정이 필요한 프로덕션 배포에 적합합니다.
GPT-5
OpenAI
OpenAI의 최신 플래그십 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 추론, 코딩, 창의적 작업 전반에서 탁월한 성능을 제공합니다. 비전, 함수 호출, JSON 모드를 지원합니다.
GPT-5 Mini
OpenAI
GPT-5의 빠르고 효율적인 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 GPT-5 대비 훨씬 저렴한 비용으로 추론, 코딩, 창의적 작업 전반에서 우수한 성능을 제공합니다.
GPT-5 Nano
OpenAI
GPT-5의 초고속 경량 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다.
GPT-4.1
OpenAI
OpenAI의 코딩 및 지시 따르기에 가장 뛰어난 모델입니다. 1M 토큰 컨텍스트 윈도우, 32K 출력 토큰을 지원하며, 코딩, 복잡한 프롬프트, 긴 컨텍스트 작업에서 크게 향상되었습니다. GPT-4o 대비 출력 비용 20% 절감.
GPT-4.1 Mini
OpenAI
소형 모델 성능의 획기적 도약. GPT-4o와 동등하거나 뛰어난 지능을 갖추면서 지연 시간은 거의 절반, 비용은 83% 절감. 속도, 품질, 경제성의 이상적 균형.
GPT-4.1 Nano
OpenAI
OpenAI의 가장 빠르고 저렴한 모델. 분류, 자동완성, 저지연 작업에 최적화. $0.10/1M 입력 토큰의 초저가격.
GPT-4o
OpenAI
OpenAI의 플래그십 멀티모달 모델입니다. 추론, 코딩, 창의적 작업에서 업계 최고 성능을 제공하며, 네이티브 비전 기능과 구조화된 출력을 지원합니다.
GPT-4o Mini
OpenAI
비용 효율적이고 빠른 모델로 강력한 성능을 제공합니다. 절대적인 성능보다 속도와 비용이 중요한 대량 작업에 최적입니다.
GPT Audio Mini
OpenAI
네이티브 오디오 입출력 기능을 갖춘 경량 멀티모달 모델입니다. 음성 기반 상호작용 및 오디오 처리 작업에 최적화되어 있습니다.
MiniMax M2.7
MiniMax
OpenAI 호환 API로 제공되는 MiniMax의 플래그십 M2 시리즈 언어 모델입니다. 백만 토큰당 $0.30/$1.20의 매우 낮은 가격에 강력한 다국어 성능(특히 중국어·영어)을 제공하며, 프롬프트 캐시 읽기는 $0.06/M입니다.
OpenAI o4-mini
OpenAI
코딩 및 STEM 작업에 최적화된 빠르고 비용 효율적인 추론 모델입니다. 대형 추론 모델 대비 매우 낮은 비용으로 강력한 추론을 제공합니다.
OpenAI o3-mini
OpenAI
낮은 비용으로 강력한 성능을 제공하는 효율적인 추론 모델입니다. 대형 모델의 오버헤드 없이 추론이 필요한 작업에 이상적입니다.
OpenAI o1
OpenAI
OpenAI의 가장 고급 추론 모델입니다. 확장된 사고 시간을 사용하여 과학, 코딩, 수학의 복잡한 문제를 뛰어난 정확도로 해결합니다.
가격 비교
모든 모델의 크레딧 비용을 비교하여 최적의 모델을 선택하세요
| 카테고리 | 모델 | 크레딧 | 단위 | 추천 용도 |
|---|---|---|---|---|
| 이미지 | flux-schnell | 7 | 이미지당 | 빠른 생성, 실시간 앱 |
| flux-2-max | 160 | 1 MP 이미지 기준 — 해상도별 차등 (0.5MP 130, 2MP 230, 4MP·match_input 370, custom 390) | 최고 품질, 상업용 | |
| seedream-4.5 | 90 | 이미지당 — 순차 생성 모드(auto)에서는 생성된 이미지 수(최대 15장)만큼 비례 과금 | 텍스트 렌더링, 로고 | |
| 비디오 | seedance-1-pro-fast | 290 | 비디오당 | 저비용 빠른 생성 |
| hailuo-2.3 | 650 | 비디오당 | 고품질, 균형 잡힌 | |
| veo-3.1 | 7,440 | 비디오당 | 최고 품질 비디오 | |
| 오디오 | speech-02-turbo | 142 | 1000자당 (0.135 크레딧/자, 글자 단위 과금) | 실시간 TTS, 빠른 응답 |
| speech-2.8-hd | 237 | 1000자당 (0.225 크레딧/자, 글자 단위 과금) | 고품질 HD 음성 | |
| LLM | gpt-4o | 3 | 1K 토큰당 (평균) | 범용, 코드, 멀티모달 |
| claude-sonnet-5 | 4 | 1K 토큰당 (평균) | 분석, 장문, 코드 | |
| gemini-2.0-flash | 1 | 1K 토큰당 (평균) | 초고속, 대량 처리 |
시작할 준비가 되셨나요?
Playground에서 모델을 테스트하거나 빠른 시작 가이드를 따라해보세요