LLM API
OpenAI, Anthropic, Google, xAI Grok, DeepSeek, Meta와 OpenRouter 경유 오픈 모델(Qwen, Kimi, GLM, Llama 등)을 동일한 API 키로 사용합니다. 기존 OpenAI SDK와 100% 호환됩니다.
주요 모델 상세 정보
각 모델의 상세한 파라미터, 예제 코드, 활용 팁을 확인하세요.
Claude Haiku 4.5
Anthropic
일상적인 작업을 위한 빠르고 비용 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 지능, 비용의 훌륭한 균형을 제공합니다.
Claude Opus 5
Anthropic
기본 1M 토큰 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 Opus 모델입니다. Opus 4.5~4.8과 동일한 가격($5/$25 per M 토큰)에 프롬프트 캐싱(read $0.50/M, write $6.25/M)과 웹 검색을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Opus 4.8
Anthropic
1M 토큰 컨텍스트 윈도우(일부 환경 200K), 128K 최대 출력 토큰, 2026년 1월까지의 학습 기준일을 갖춘 Anthropic 최상위 Opus 모델입니다. Opus 4.7 대비 장기 에이전트형 코딩, 도구 호출 정확도가 향상되었고, 필요한 턴에서만 추론하는 adaptive thinking을 지원합니다. Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Opus 4.7
Anthropic
2026년 1월까지의 신뢰할 수 있는 학습 기준일과 128K 최대 출력 토큰을 갖춘 Anthropic의 최신 플래그십 모델입니다. Opus 4.6 대비 추론, 코딩, 지시 따르기 성능이 향상되었으며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Opus 4.6
Anthropic
Anthropic의 가장 강력한 모델입니다. 향상된 안전성과 지시 따르기 능력으로 추론, 코딩, 복잡한 분석에서 획기적인 성능을 제공합니다.
Claude Opus 4.5
Anthropic
매우 복잡한 작업을 위한 Anthropic의 가장 강력한 모델입니다. 깊은 전문성이 필요한 연구, 분석 및 창의적 프로젝트에 탁월합니다.
Claude Sonnet 5
Anthropic
속도, 비용, 지능의 균형에 최적화된 Anthropic의 최신 Sonnet 모델입니다. 1M 토큰 컨텍스트 윈도우, 64K 최대 출력 토큰, 2025년 8월까지의 학습 기준일을 갖췄습니다. 필요한 턴에서만 추론하는 adaptive thinking, 비전, 도구 사용을 지원하며 Anthropic Messages 및 OpenAI Chat Completions 형식과 호환됩니다.
Claude Sonnet 4.6
Anthropic
Claude Sonnet 4.5의 후속 모델입니다. 복잡한 추론, 미묘한 이해, 코딩 작업에서 최고 수준의 성능과 탁월한 지시 따르기 능력을 제공하는 Anthropic의 프론티어 Sonnet 등급 모델이며, 토큰 가격은 Sonnet 4.5와 동일합니다.
Claude Sonnet 4.5
Anthropic
Anthropic의 가장 지능적이고 강력한 Sonnet 모델입니다. 복잡한 추론, 미묘한 이해, 코딩 작업에서 최고 수준이며 뛰어난 지시 따르기 능력을 제공합니다.
DeepSeek V4 Flash
DeepSeek
DeepSeek의 빠르고 저렴한 V4 모델입니다 (체크포인트 V4-Flash-0731). thinking 모드가 기본이며 1M 토큰 컨텍스트와 대폭 할인된 캐시 읽기를 지원합니다. retire된 deepseek-chat / deepseek-reasoner의 대체 모델입니다.
DeepSeek V4 Pro
DeepSeek
DeepSeek의 최상위 V4 모델입니다 (체크포인트 V4-Pro-0813). thinking 모드가 기본인 고급 추론 모델로, 1M 토큰 컨텍스트와 캐시 읽기 할인을 지원하면서도 동급 프론티어 모델 대비 훨씬 저렴합니다.
Gemini 3.5 Flash
Google의 최신 Flash 티어 주력 모델입니다. 모든 입력 모달리티(텍스트·이미지·비디오·오디오·PDF)가 백만 토큰당 $1.50/$9의 동일 요율이며 롱 컨텍스트 할증이 없습니다. 1M 토큰 컨텍스트 윈도우와 65,536 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다.
Gemini 3.1 Flash Image Preview
네이티브 이미지 생성 기능을 갖춘 Gemini 3.1 Flash입니다. 채팅 응답에서 텍스트와 함께 이미지를 직접 생성할 수 있습니다. 텍스트와 이미지 출력 토큰에 별도의 가격이 적용됩니다.
Gemini 3.1 Flash Lite
초경량 Gemini 3.1 Flash Lite의 정식(stable) 릴리스입니다. 백만 토큰당 $0.25/$1.50로 가장 비용 효율적인 Gemini 모델이며, 캐시 입력(90% 할인), 오디오 입력, 배치(50% 할인)를 지원합니다. 고처리량·저비용 애플리케이션에 적합합니다.
Gemini 3.1 Flash Lite Preview
Gemini 3.1 Flash의 초경량 변형 모델입니다. 캐시된 입력과 오디오 입력을 지원하는 가장 비용 효율적인 Gemini 모델입니다. 고처리량, 비용 의식적 애플리케이션에 적합합니다.
Gemini 3.1 Pro Preview
Google의 최신이자 가장 강력한 Gemini 모델 프리뷰입니다. 컨텍스트 길이에 따라 조정되는 동적 가격 책정이 적용되며, 200K 토큰 이상 입력 시 확장 가격이 적용됩니다.
Gemini 3 Flash Preview
최첨단 멀티모달 이해력, 박사급 추론 능력, 최고 수준의 코딩 성능을 갖춘 Google의 가장 진보된 추론 모델입니다.
Gemini 3 Pro Image Preview
Gemini 3 Pro 제품군의 프리미엄 이미지 생성 모델입니다. 채팅에서 직접 최고 충실도의 이미지를 생성합니다. 이미지 출력 토큰은 텍스트 출력 토큰의 10배 가격이 적용됩니다.
Gemini 3 Pro Preview
Google의 가장 강력한 Gemini 모델 프리뷰 버전입니다. 획기적인 추론, 코딩, 멀티모달 기능과 최대 컨텍스트 윈도우를 제공합니다.
Gemini 2.5 Flash
사고 능력이 내장된 Google의 빠르고 효율적인 모델입니다. 대용량 애플리케이션을 위한 속도, 추론, 비용의 훌륭한 균형을 제공합니다.
Gemini 2.5 Flash Lite
Gemini 2.5 제품군에서 가장 저렴한 티어로, 대량·지연 민감 워크로드에 최적화되어 있습니다. 2.5 세대 품질을 훨씬 낮은 비용으로 제공하며, 대규모 분류·추출·실시간 챗에 적합합니다.
Gemini 2.5 Pro
최첨단 추론 능력과 1M 토큰 컨텍스트를 갖춘 Google의 가장 강력한 모델입니다. 복잡한 코딩, 수학, 다중 문서 분석에 탁월합니다.
Gemini 2.0 Flash
Google의 가장 빠르고 강력한 모델입니다. 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달 지원 및 실시간 기능을 제공합니다.
Gemini 2.0 Flash Lite
최대 속도와 최소 비용을 위해 최적화된 Gemini 2.0 Flash의 초경량 버전입니다. 대량의 지연에 민감한 애플리케이션에 적합합니다.
Gemini Embedding 001
벡터 표현 생성을 위한 Google의 텍스트 임베딩 모델입니다. 의미 검색, 클러스터링, 유사도 작업에 최적화되어 있습니다.
GLM 5.2
Z.ai
OpenRouter 애그리게이터를 경유하는 Z.ai GLM 5.2입니다. 1M 토큰 컨텍스트 윈도우를 갖춘 대규모 텍스트 추론 모델로, 장기 에이전트 워크플로와 프로젝트 단위 소프트웨어 엔지니어링에 적합합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
GLM 4.7
Z.ai
OpenRouter 애그리게이터를 경유하는 Z.ai GLM 4.7입니다. 프로그래밍 능력과 다단계 추론·실행 안정성이 강화된 플래그십 텍스트 모델로, 복잡한 에이전트 작업에서 뚜렷한 개선을 보입니다. 200K 컨텍스트를 지원하며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
GPT-6 Astra
OpenAI
OpenAI의 최상위 모델(GPT-6 세대, 2026년 9월)입니다. 복잡한 추론·코딩·컴퓨터 사용·리서치·문서 작성 같은 가장 어려운 엔드투엔드 작업용으로, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인 캐시 입력을 지원합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.
GPT-5.6 Luna
OpenAI
OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 고속·저비용 티어입니다. 백만 토큰당 $0.20/$1.20의 가격으로 고처리량 워크로드에 최적화되어 있으며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.
GPT-5.6 Sol
OpenAI
OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 플래그십 티어입니다. 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원하며, 세대 내 최고 수준의 추론·코딩·멀티모달 성능을 제공합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.
GPT-5.6 Terra
OpenAI
OpenAI GPT-5.6 패밀리(2026년 7월 GA)의 균형 티어입니다. 백만 토큰당 $2/$12(Sol의 40%)로 플래그십에 근접한 품질을 제공하며, 1M 토큰 컨텍스트 윈도우, 128K 최대 출력 토큰, 90% 할인된 캐시 입력을 지원합니다. 입력 272K 토큰 초과 시 요청 전체가 입력 2배·출력 1.5배로 과금됩니다.
GPT-5.5
OpenAI
1.05M 컨텍스트 윈도우와 128K 최대 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. 캐시 입력 10배 할인을 지원하며 GPT-5.4 시리즈 대비 추론, 코딩, 멀티모달 성능이 향상되었습니다.
GPT-5.4
OpenAI
1M 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 OpenAI의 최신 플래그십 모델입니다. none부터 xhigh까지 조절 가능한 추론 수준으로 모든 영역에서 최상위 추론 성능을 제공합니다.
GPT-5.4 Mini
OpenAI
400K 컨텍스트 윈도우와 128K 출력 토큰을 갖춘 GPT-5.4의 빠르고 비용 효율적인 변형 모델입니다. 일상적인 작업에서 성능과 가성비의 탁월한 균형을 제공합니다.
GPT-5.4 Nano
OpenAI
400K 컨텍스트와 128K 출력을 갖춘 초경량 최고속 GPT-5.4 변형 모델입니다. 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다. 도구 통합을 위한 MCP를 지원합니다.
GPT-5.2 Pro
OpenAI
GPT-5.2 계열의 최고 성능 티어입니다 (날짜 고정 스냅샷). 더 많은 컴퓨트로 더 오래 사고하여 가장 어려운 추론·코딩 작업에서 가장 신뢰할 수 있는 답변을 제공합니다.
GPT-5.2
OpenAI
OpenAI의 최신이자 가장 진보된 GPT 모델입니다. 향상된 기능으로 추론, 코딩, 창의적 작업 전반에서 최첨단 성능을 제공합니다.
GPT-5.2 Codex
OpenAI
GPT-5.2 베이스 위에 구축된 최신 Codex 세대입니다. GPT-5.2의 강화된 추론 능력을 에이전틱 코딩 하네스에 제공하며 OpenAI Responses API로 제공됩니다.
GPT-5.1 (2025-11-13)
OpenAI
재현 가능한 결과를 위한 GPT-5.1의 날짜별 스냅샷입니다. 반복 컨텍스트에 대한 캐시된 입력 토큰으로 비용 절감을 지원합니다. 모델 버전 고정이 필요한 프로덕션 배포에 적합합니다.
GPT-5.1 Codex
OpenAI
Codex 스타일 하네스에서의 에이전틱 코딩에 최적화된 GPT-5.1 변형 모델입니다. 긴 도구 호출 루프, 코드 편집, 리포지토리 규모 작업에 튜닝되었으며 OpenAI Responses API로 제공됩니다.
GPT-5.1 Codex Max
OpenAI
GPT-5.1 Codex 계열의 롱-호라이즌 에이전틱 코딩 플래그십 모델입니다. 컴팩션(compaction)으로 매우 긴 코딩 세션을 컨텍스트 안에 유지하며 OpenAI Responses API로 제공됩니다.
GPT-5.1 Codex Mini
OpenAI
가벼운 코딩 작업을 위한 GPT-5.1 Codex 계열의 저렴하고 빠른 모델입니다. 에이전틱 코딩 튜닝과 Responses API 인터페이스를 유지하면서 Codex 대비 약 1/5 가격으로 제공됩니다.
GPT-5
OpenAI
OpenAI의 최신 플래그십 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 추론, 코딩, 창의적 작업 전반에서 탁월한 성능을 제공합니다. 비전, 함수 호출, JSON 모드를 지원합니다.
GPT-5 Mini
OpenAI
GPT-5의 빠르고 효율적인 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 GPT-5 대비 훨씬 저렴한 비용으로 추론, 코딩, 창의적 작업 전반에서 우수한 성능을 제공합니다.
GPT-5 Nano
OpenAI
GPT-5의 초고속 경량 변형 모델입니다. 1M 토큰 컨텍스트 윈도우와 32K 출력 토큰을 갖추고 최소 비용으로 고처리량, 저지연 애플리케이션을 위해 설계되었습니다.
GPT-5 Pro
OpenAI
OpenAI GPT-5 계열의 최고 성능 티어입니다. 더 많은 컴퓨트로 더 오래 사고하여 가장 어려운 추론, 코딩, 분석 작업에서 가장 신뢰할 수 있는 답변을 제공합니다.
GPT-4.1
OpenAI
OpenAI의 코딩 및 지시 따르기에 가장 뛰어난 모델입니다. 1M 토큰 컨텍스트 윈도우, 32K 출력 토큰을 지원하며, 코딩, 복잡한 프롬프트, 긴 컨텍스트 작업에서 크게 향상되었습니다. GPT-4o 대비 출력 비용 20% 절감.
GPT-4.1 Mini
OpenAI
소형 모델 성능의 획기적 도약. GPT-4o와 동등하거나 뛰어난 지능을 갖추면서 지연 시간은 거의 절반, 비용은 83% 절감. 속도, 품질, 경제성의 이상적 균형.
GPT-4.1 Nano
OpenAI
OpenAI의 가장 빠르고 저렴한 모델. 분류, 자동완성, 저지연 작업에 최적화. $0.10/1M 입력 토큰의 초저가격.
GPT-4o
OpenAI
OpenAI의 플래그십 멀티모달 모델입니다. 추론, 코딩, 창의적 작업에서 업계 최고 성능을 제공하며, 네이티브 비전 기능과 구조화된 출력을 지원합니다.
GPT-4o Mini
OpenAI
비용 효율적이고 빠른 모델로 강력한 성능을 제공합니다. 절대적인 성능보다 속도와 비용이 중요한 대량 작업에 최적입니다.
GPT Audio
OpenAI
챗 컴플리션으로 네이티브 오디오 입출력을 지원하는 풀사이즈 멀티모달 모델입니다. 강력한 범용 지능을 바탕으로 음성 입력과 음성 출력을 처리합니다.
GPT Audio Mini
OpenAI
네이티브 오디오 입출력 기능을 갖춘 경량 멀티모달 모델입니다. 음성 기반 상호작용 및 오디오 처리 작업에 최적화되어 있습니다.
GPT-OSS 120B
OpenAI
OpenAI의 오픈 웨이트 모델 gpt-oss-120b입니다. 117B 파라미터 Mixture-of-Experts 구조(포워드 패스당 5.1B 활성)로 고난도 추론·에이전트·범용 프로덕션 용도에 맞춰 설계되었습니다. 직접 연동 OpenAI API에서는 제공되지 않는 OpenRouter 전용 모델이며, 131K 토큰 컨텍스트를 지원하고 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Grok 4.6
xAI
xAI의 플래그십 Grok 모델입니다. Grok 계열에서 가장 강한 추론·범용 성능을 제공하며 500K 토큰 컨텍스트를 지원합니다.
Grok 4.5
xAI
코딩에 강점을 둔 xAI Grok 모델입니다. 500K 토큰 컨텍스트를 지원하며, Grok 4.6과 동일 단가에 캐시 읽기가 더 저렴합니다.
Grok 4.3
xAI
1M 토큰 컨텍스트를 지원하는 가성비형 Grok 모델입니다. 4.5/4.6 티어의 절반 이하 단가입니다.
Grok 4.3 (OpenRouter)
xAI
OpenRouter 애그리게이터를 경유하는 xAI Grok 4.3입니다. 1M 토큰 컨텍스트와 이미지 입력을 지원하며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다. OpenRouter 경로가 꼭 필요한 경우가 아니면 직접 연동 grok-4.3을 권장합니다.
Grok 4.20 Multi-Agent
xAI
Grok 4.20 Multi-Agent 베타(0309 스냅샷)입니다. 1M 토큰 컨텍스트에서 딥 리서치형 멀티에이전트 오케스트레이션을 수행합니다. Responses API 전용입니다.
Grok 4.20 Non-Reasoning
xAI
Grok 4.20의 비추론 변형(0309 스냅샷)입니다. 추론 변형과 동일 단가로 1M 토큰 컨텍스트에서 빠른 응답을 제공합니다.
Grok 4.20 Reasoning
xAI
Grok 4.20의 추론(reasoning) 변형(0309 스냅샷)입니다. 1M 토큰 컨텍스트에서 사고 사슬 추론을 수행하며, 추론 토큰은 완성 토큰과 별도로 가산 과금됩니다.
Grok Build 0.1
xAI
에이전틱 코딩용 xAI Grok 모델입니다. 256K 토큰 컨텍스트를 지원하며 Grok 계열 최저 단가입니다.
Kimi K3
Moonshot AI
OpenRouter 애그리게이터를 경유하는 Moonshot AI Kimi K3입니다. 2.8T 파라미터의 오픈 웨이트 멀티모달 추론 모델로, 1M 토큰 컨텍스트와 이미지·영상 입력을 지원하며 복잡한 코딩, 지식 작업, 장기 에이전트 워크플로에 적합합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Kimi K2.7 Code
Moonshot AI
OpenRouter 애그리게이터를 경유하는 Moonshot AI Kimi K2.7 Code입니다. Kimi K2 계열의 코딩 특화 모델로, 긴 컨텍스트에서 엔드투엔드 프로그래밍 작업을 안정적으로 완수하도록 설계되었으며 네이티브 멀티모달 MoE 아키텍처, 256K 컨텍스트, 이미지 입력을 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Llama 3.3 70B Instruct
Meta
OpenRouter를 경유하는 Meta Llama 3.3 70B 인스트럭션 튜닝 다국어 모델입니다. 텍스트 입출력 전용이며 131K 토큰 컨텍스트를 지원하는 범용 오픈 웨이트 챗 모델입니다. 폐기된 직접 연동 llama-3.3-70b-versatile 경로를 대체하는 id이며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Llama 3.1 8B Instruct
Meta
OpenRouter를 경유하는 Meta Llama 3.1 8B 인스트럭션 튜닝 모델입니다. 빠르고 효율적인 소형 오픈 웨이트 모델로 131K 토큰 컨텍스트를 지원하며, 대량·저비용 워크로드에 적합합니다. 폐기된 직접 연동 llama-3.1-8b-instant 경로를 대체하는 id이며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
MiniMax M3
MiniMax
OpenRouter를 경유하는 MiniMax M3 멀티모달 파운데이션 모델입니다. 텍스트·이미지·비디오 입력과 1M 토큰 컨텍스트, 최대 512K 출력 토큰을 지원하며 장기 에이전트 작업과 코딩에 적합합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
MiniMax M2.7 (OpenRouter)
MiniMax
OpenRouter를 경유하는 MiniMax M2.7입니다. 자율적인 실무 생산성을 목표로 설계된 에이전트형 대규모 언어 모델로, 204K 토큰 컨텍스트와 멀티 에이전트 툴 사용을 지원합니다. 폐기된 직접 연동 MiniMax-M2.7 경로를 대체하는 id이며, OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
MiniMax M2.7
MiniMax
OpenAI 호환 API로 제공되는 MiniMax의 플래그십 M2 시리즈 언어 모델입니다. 백만 토큰당 $0.30/$1.20의 매우 낮은 가격에 강력한 다국어 성능(특히 중국어·영어)을 제공하며, 프롬프트 캐시 읽기는 $0.06/M입니다.
Mistral Large 3 (2512)
Mistral AI
OpenRouter 애그리게이터를 경유하는 Mistral Large 3 (2512)입니다. Mistral의 역대 최고 성능 모델로, 41B 활성 파라미터(총 675B)의 희소 MoE 아키텍처를 Apache 2.0 라이선스로 공개했으며 256K 컨텍스트와 이미지·파일 입력을 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Muse Spark 1.3
Meta
Meta API 직결로 제공되는 Meta Muse Spark 1.3입니다. 에이전트 작업용 멀티모달 추론 모델로 텍스트·이미지·영상·오디오·PDF를 입력받아 텍스트를 반환하며, 1M 토큰 컨텍스트와 캐시 입력 할인을 지원합니다. 답변이 reasoning 토큰 뒤에 생성되므로 max_tokens를 2,048 이상으로 두세요.
Muse Spark 1.3 Contributor
Meta
Meta Muse Spark 1.3의 할인 Contributor 티어입니다. 같은 모델을 표준 대비 약 1/12 가격으로 제공하되, 프롬프트와 응답이 Meta 모델 학습에 사용될 수 있다는 조건이 붙습니다. 개인정보·기밀·고객 데이터는 보내지 마세요. 업스트림 한도 분당 100 요청 / 3M 토큰을 공유합니다.
Muse Spark 1.1
Meta
OpenRouter 애그리게이터를 경유하는 Meta Muse Spark 1.1입니다. 에이전트 작업을 위해 설계된 멀티모달 추론 모델로, 텍스트·이미지·영상·오디오·PDF 문서를 입력받아 텍스트를 반환하며 1M 토큰 컨텍스트를 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
OpenAI o4-mini
OpenAI
코딩 및 STEM 작업에 최적화된 빠르고 비용 효율적인 추론 모델입니다. 대형 추론 모델 대비 매우 낮은 비용으로 강력한 추론을 제공합니다.
o3
OpenAI
OpenAI의 프론티어 추론 모델입니다. 확장된 사고 연쇄를 사용하여 과학, 코딩, 수학의 복잡한 문제를 경쟁력 있는 가격에 높은 정확도로 해결합니다.
o3 Pro
OpenAI
o3의 최고 강도 버전입니다. 더 많은 컴퓨트로 더 오래 사고하여 가장 어려운 과학, 수학, 코딩 문제에서 가장 신뢰할 수 있는 답변을 제공합니다.
OpenAI o3-mini
OpenAI
낮은 비용으로 강력한 성능을 제공하는 효율적인 추론 모델입니다. 대형 모델의 오버헤드 없이 추론이 필요한 작업에 이상적입니다.
o1 Pro
OpenAI
레거시 프로 티어 추론 모델입니다. o1보다 더 많은 컴퓨트를 사용하여 어려운 문제에서 가장 신뢰할 수 있는 답변을 제공합니다. o3-pro의 전신이며, o3-pro가 더 나은 가성비를 제공합니다.
OpenAI o1
OpenAI
OpenAI의 가장 고급 추론 모델입니다. 확장된 사고 시간을 사용하여 과학, 코딩, 수학의 복잡한 문제를 뛰어난 정확도로 해결합니다.
Qwen3.8 27B
Alibaba Qwen
OpenRouter 애그리게이터를 경유하는 Qwen3.8 27B입니다. 코딩·전문 업무·리서치·멀티모달 상호작용·장기 에이전트 작업에 적합한 오픈 웨이트 밀집(dense) 비전-언어 모델로, 유연한 사고(thinking) 모드와 256K 토큰 컨텍스트를 지원합니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Qwen3.8 2.4T-A95B
Alibaba Qwen
OpenRouter 애그리게이터를 경유하는 Qwen3.8 2.4T-A95B입니다. Qwen3.8 Max의 오픈 웨이트 희소 MoE(Mixture-of-Experts) 버전으로, 총 2.4조 파라미터 중 950억 개가 활성화됩니다. 1M 토큰 컨텍스트와 최대 262K 출력 토큰을 지원하는 텍스트 전용 추론 모델이며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Qwen3.8 Max
Alibaba Qwen
OpenRouter 애그리게이터를 경유하는 Alibaba Qwen3.8 Max입니다. Qwen3.8 시리즈의 플래그십이자 Qwen3.8 Max Preview의 정식(GA) 후속 모델로, 복잡한 추론·시각 이해·에이전트 작업을 위한 멀티모달 추론 모델입니다. 1M 토큰 컨텍스트를 지원하며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Qwen3.7 Flash
Alibaba Qwen
OpenRouter 애그리게이터를 경유하는 Alibaba Qwen3.7 Flash입니다. 멀티모달 에이전트·비주얼 코딩·검색·컴퓨터 상호작용에 적합한 저비용 비전-언어 추론 모델로, 객체 인식과 공간 이해에 강점이 있습니다. 1M 토큰 컨텍스트를 지원하며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Qwen3 Max
Alibaba Qwen
OpenRouter 애그리게이터를 경유하는 Alibaba Qwen3 Max입니다. Qwen3 시리즈 기반의 업데이트 릴리스로, 추론·지시 이행·다국어 지원·롱테일 지식 커버리지가 크게 개선되었습니다. 256K 토큰 컨텍스트의 텍스트 전용 모델이며 OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Solar Pro 4
Upstage
OpenRouter 애그리게이터를 경유하는 Upstage Solar Pro 4입니다. 524K 토큰 컨텍스트 윈도우를 갖춘 비용 효율적인 LLM으로, 장기 작업과 에이전트 워크플로를 위해 설계되었으며 사무 생산성·문서 집약형 업무에 강점이 있습니다. OpenRouter 실사용 비용 기준으로 실비 정산됩니다.
Text Embedding 3 Large
OpenAI
OpenAI의 가장 강력한 텍스트 임베딩 모델입니다. 검색 정확도가 중요한 의미 검색, 클러스터링, 유사도 작업을 위한 고품질 벡터 표현을 생성합니다.
Text Embedding 3 Small
OpenAI
OpenAI의 비용 효율적인 텍스트 임베딩 모델입니다. 의미 검색, 클러스터링, 유사도 작업을 위한 벡터 표현을 매우 낮은 비용으로 생성합니다.
가격 단위: 크레딧/토큰 기준입니다. 예: 1,000 토큰 입력, 500 토큰 출력 시 gpt-4o-mini는 0.3 + 0.6 = 0.9 크레딧
GPT-5 / GPT-5.2 / O-Series 주의사항
GPT-5, GPT-5.2, o1, o3 등 추론(Reasoning) 모델은 일반 모델과 파라미터가 다릅니다:
max_tokens→max_completion_tokens사용temperature,top_p지원 안 함- 새 파라미터:
reasoning_effort(minimal/low/medium/high)
OpenAI (GPT)
GPT-4o / GPT-4.1 (일반 모델)
curl -X POST https://api.core.today/llm/openai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer cdt_your_api_key" \
-d '{
"model": "gpt-4o",
"messages": [{"role": "user", "content": "Hello!"}],
"max_tokens": 1000,
"temperature": 0.7
}'GPT-5 / O-Series (추론 모델)
curl -X POST https://api.core.today/llm/openai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer cdt_your_api_key" \
-d '{
"model": "gpt-5",
"messages": [{"role": "user", "content": "Explain quantum computing"}],
"max_completion_tokens": 16000,
"reasoning_effort": "medium"
}'GPT-5 전용 파라미터
max_completion_tokens- 최대 출력 토큰 (max_tokens 대신 사용)reasoning_effort- 추론 수준: minimal, low, medium, high
Codex 모델 (코드 특화)
Codex 모델은 Responses API 전용입니다
gpt-5.1-codex, gpt-5.1-codex-mini 등 Codex 모델은 /v1/chat/completions를 지원하지 않습니다. 대신 /v1/responses 엔드포인트를 사용해야 합니다.
게이트웨이는 경로를 그대로 프록시하므로, 클라이언트에서 엔드포인트 경로만 변경하면 됩니다: /llm/openai/v1/responses → OpenAI /v1/responses
# Codex 모델: /v1/responses 엔드포인트 사용
curl -X POST https://api.core.today/llm/openai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer cdt_your_api_key" \
-d '{
"model": "gpt-5.1-codex",
"instructions": "You are a helpful coding assistant.",
"input": "Write a Python function to merge two sorted lists",
"max_output_tokens": 16000
}'messages→input(문자열 또는 메시지 배열)- 시스템 프롬프트:
instructions파라미터 사용 - 출력 토큰 제한:
max_output_tokens사용 - 스트리밍 시 이벤트 형식:
response.output_text.delta
gpt-5.1-codex, gpt-5.1-codex-mini, gpt-5.2-codex 등 모델 이름에 "codex"가 포함된 모델| 모델 | Input | Output |
|---|---|---|
| 모델 | Input | Output |
|---|---|---|
| 모델 | Input | Output |
|---|---|---|
| 모델 | Input | Output |
|---|---|---|
Anthropic (Claude)
curl -X POST https://api.core.today/llm/anthropic/v1/messages \
-H "Content-Type: application/json" \
-H "Authorization: Bearer cdt_your_api_key" \
-d '{
"model": "claude-sonnet-4",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Explain quantum computing simply."}
]
}'Claude Opus 4.7 주의사항
claude-opus-4-7은 temperature 파라미터가 deprecated 되었습니다. 요청 바디에 포함하면 Anthropic이 400: `temperature` is deprecated for this model 으로 거절합니다 — 이 모델 호출 시 temperature 필드를 제거하세요.
| 모델 | Input | Output |
|---|---|---|
| 모델 | Input | Output |
|---|---|---|
| 모델 | Input | Output |
|---|---|---|
Google (Gemini)
curl -X POST "https://api.core.today/llm/gemini/v1beta/models/gemini-2.5-pro:generateContent" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer cdt_your_api_key" \
-d '{
"contents": [
{
"parts": [{"text": "Write a haiku about programming"}]
}
]
}'| 모델 | Input | Output |
|---|---|---|
gemini-embedding-001 (임베딩 전용, Input 0.0003) | gemini-3-pro-preview-longcontext (Input 0.0080, Output 0.0360)추가 프로바이더 (OpenAI 호환) — xAI Grok · DeepSeek · Meta · OpenRouter
요청·응답 형식은 OpenAI chat completions와 동일하고 게이트웨이 경로 프리픽스만 다릅니다. OpenAI SDK의 base_url을 아래 주소로 바꾸면 그대로 동작합니다.
| 프로바이더 | base_url | 모델 ID 예시 |
|---|---|---|
| xAI Grok | https://api.core.today/llm/grok/v1 | grok-4.6, grok-4.3, grok-build-0.1 |
| DeepSeek | https://api.core.today/llm/deepseek/v1 | deepseek-v4-flash, deepseek-v4-pro |
| Meta | https://api.core.today/llm/meta/v1 | muse-spark-1.3, muse-spark-1.3-contributor |
| OpenRouter | https://api.core.today/llm/openrouter/v1 | qwen/qwen3.8-max, moonshotai/kimi-k3, openai/gpt-oss-120b |
curl -X POST https://api.core.today/llm/openrouter/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer cdt_your_api_key" \
-d '{
"model": "qwen/qwen3.8-max",
"messages": [{"role": "user", "content": "Explain MoE routing in two sentences"}]
}'| 모델 | Input | Output |
|---|---|---|
| 모델 | Input | Output |
|---|---|---|
| 모델 | Input | Output |
|---|---|---|
muse-spark-1.3-contributor는 프롬프트와 응답이 Meta 모델 학습에 제공되는 조건의 할인 티어입니다 (표준 대비 약 1/12 단가). 개인정보·기밀·고객 데이터가 포함된 요청에는 표준 muse-spark-1.3을 쓰세요. 두 모델 모두 추론 모델이라 답변이 reasoning 토큰 뒤에 생성됩니다 — 실측으로 "세 단어로 인사"에도 약 700 completion 토큰(그중 reasoning 687)이 쓰였고, max_tokens 400에서는 content: null로 끝났습니다. max_tokens는 2,048 이상을 권장하고, reasoning 토큰도 출력 단가로 과금됩니다. 컨텍스트 1M, 이미지·영상·오디오·PDF 입력 지원, 캐시 입력 할인.vendor/model 형식이며 허용 목록(allowlist) 18종만 호출 가능합니다. 위 표의 단가는 표시·예약 추정용이고, 실제 청구는 OpenRouter 응답의 usage.cost(확정 USD) × 1,858 크레딧/USD 실비 정산입니다 — OpenRouter 측 가격이 바뀌어도 청구는 항상 실비 기준입니다. Claude/GPT/Gemini는 직접 라우트(/llm/anthropic 등)가 애그리게이터 수수료 없이 더 저렴합니다.-longcontext ID를 직접 호출하면 400으로 거부됩니다. grok-4.20-multi-agent-0309는 Responses API 전용(/llm/grok/v1/responses, chat/completions는 400)이며 서브에이전트 토큰까지 합산 청구되어 한 마디 질문에도 회당 약 4K 토큰(≈9크레딧)이 정산됩니다 — 짧은 대화용이 아니라 리서치급 질문에 쓰세요. DeepSeek은 시간대와 무관하게 표준(피크) 단가로 과금됩니다. Groq/MiniMax 직접 연동(llama-3.3-70b-versatile, MiniMax-M2.7)은 제공하지 않으며 같은 모델을 OpenRouter ID(meta-llama/llama-3.3-70b-instruct, minimax/minimax-m2.7)로 사용하세요.스트리밍 응답
실시간으로 응답을 받으려면 stream: true를 추가하세요:
curl -X POST https://api.core.today/llm/openai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer cdt_your_api_key" \
-d '{
"model": "gpt-5",
"messages": [{"role": "user", "content": "Tell me a long story"}],
"stream": true
}'프롬프트 캐싱 (Claude 자동 비용 절감)
Claude 모델을 호출할 때 매번 똑같이 반복되는 앞부분(시스템 프롬프트·대화 히스토리)을 게이트웨이가 자동으로 캐시합니다. 두 번째 요청부터 그 부분은 다시 계산되지 않고 캐시에서 읽혀, 입력 토큰가의 10% 가격으로 청구됩니다. 별도 설정이나 코드 변경은 필요 없습니다.
| 캐시되는 부분 | 조건 |
|---|---|
시스템 프롬프트 (system) | 항상 — 같은 시스템 프롬프트를 쓰는 모든 요청 |
| 대화 히스토리 (직전 답변까지) | 멀티턴 대화일 때 — 이전 assistant 답변이 포함된 요청 |
| 새로 보낸 마지막 질문 | 캐시하지 않음 — 매번 바뀌므로 정상 가격 |
같은 시스템 프롬프트를 재사용하거나 대화를 계속 이어가면 캐시가 잘 적중합니다:
1번째 요청: [긴 시스템 프롬프트] + "질문 A" → 시스템 프롬프트를 캐시에 저장
2번째 요청: [긴 시스템 프롬프트] + "질문 B" → 캐시에서 읽음 (10% 가격)
3번째 요청: [긴 시스템 프롬프트] + "질문 C" → 캐시에서 읽음usage.cache_read_input_tokens가 0보다 크면 캐시가 적중한 것입니다. (cache_creation_input_tokens는 캐시에 새로 저장된 토큰)- Claude(Anthropic) 요청에만 적용됩니다. OpenAI는 서버가 자동 캐싱, Gemini는 별도 방식입니다.
- 앞부분이 최소 캐시 길이(대략 1,024토큰)에 못 미치면 캐시가 적용되지 않습니다 — 이때는 추가 비용도 없습니다.
- 캐시는 마지막 사용 후 약 5분간 유지되며, 그 안에 다시 쓰이면 자동 연장됩니다.
- 요청에 직접
cache_control을 넣은 경우, 그 설정을 그대로 사용합니다(게이트웨이가 손대지 않음).
비용 계산 예시
1,000 토큰 입력, 500 토큰 출력 기준:
| 모델 | 계산 | 총 비용 |
|---|---|---|
| gpt-4o-mini | 0.3 + 0.6 | 0.9 크레딧 |
| gpt-5 | 2.5 + 10.0 | 12.5 크레딧 |
| claude-3-haiku | 0.5 + 1.25 | 1.75 크레딧 |
| claude-sonnet-4 | 6.0 + 15.0 | 21.0 크레딧 |
| gemini-2.0-flash | 0.2 + 0.4 | 0.6 크레딧 |