AIREITER

Claude API 가격 2026: 모든 모델과 비용을 줄이는 방법

마지막 업데이트: 2026-06-30 08:51:39

Claude API 가격은 2026년 7월 기준 백만 토큰당 $1(Haiku 4.5 입력)부터 백만 토큰당 $50(Fable 5 출력)까지이며, 현재의 모든 모델에서 공통으로 적용되는 규칙은 출력 토큰이 입력 토큰보다 5배 비싸다는 것입니다. 하지만 표시 가격은 쉬운 부분에 불과합니다. 새로운 토크나이저, 미국 전용 라우팅, fast mode, 그리고 대부분의 사람들이 전혀 눈치채지 못하는 청구 함정이 모두 요금표와 실제 청구서 사이에 자리하고 있으며, 동일한 모델을 정가의 일부만 내고 구매할 수 있는 방법도 있습니다.

아래의 모든 수치는 Anthropic의 공식 가격 페이지에 있는 내용입니다. 모델 요금은 변동될 수 있으므로 예산을 확정하기 전에 확인하세요.

2026년 Claude API 가격: 모든 모델

다음은 현재 백만 토큰당 요금이며, Anthropic의 2026년 7월 요금과 대조하여 확인했습니다(공식 출처). Opus 4.8은 2026년 5월 28일에 4.7과 동일한 요금으로 출시되었습니다.

모델

입력 / 1M

출력 / 1M

컨텍스트

Claude Fable 5

$10.00

$50.00

1M

Claude Opus 4.8

$5.00

$25.00

1M

Claude Opus 4.7

$5.00

$25.00

1M

Claude Opus 4.6

$5.00

$25.00

1M

Claude Sonnet 4.6

$3.00

$15.00

1M

Claude Haiku 4.5

$1.00

$5.00

200K

많은 오래된 가이드가 잘못 알고 있는 두 가지. Anthropic의 가장 강력한 모델인 Fable 5는 $10/$50로 Opus 티어보다 위에 있으며, 전체 Opus 4.x 라인(4.6, 4.7, 4.8)은 $5/$25를 유지한다. 그 $5 자체도 하나의 이야기다: Opus 4.1은 $15/$75였고, 4.6 출시 때 $5/$25로 내려간 것은 이후 세 번의 릴리스 동안 유지된 플래그십에 대한 67% 인하였다.

레거시 및 예산 옵션

최신 모델이 필요하지 않다면, 이전 모델도 여전히 사용할 수 있습니다: Sonnet 4.5 ($3/$15), Opus 4.5 ($5/$25, 200K context), Haiku 3.5 ($0.80/$4), 그리고 가장 비용에 민감한 대량 작업을 위한 Haiku 3 ($0.25/$1.25)입니다.

과소평가된 한 가지 세부사항: Opus 4.6/4.7/4.8, Sonnet 4.6, 그리고 Fable 5는 모두 표준 가격으로 전체 1M-token 컨텍스트 윈도우를 포함합니다 — 장문 컨텍스트 추가 요금이 없습니다. 900K-token 요청은 9K 요청과 토큰당 요금이 동일하며, 여러 경쟁사는 길이 기준을 넘어서면 프리미엄을 부과합니다.

가격표에 없는 비용

요금표는 대부분의 가격 관련 글이 멈추는 지점이자, 놀라움이 시작되는 지점입니다. 여러 요소가 토큰당 가격을 바꾸지 않으면서도 실제 청구 금액을 움직이기 때문입니다.

조용히 토큰을 추가하는 토크나이저

Opus 4.7(및 토크나이저를 공유하는 Opus 4.8)은 텍스트가 토큰으로 분할되는 방식을 변경했습니다. 동일한 입력이 Opus 4.6보다 최대 약 35% 더 많은 토큰을 생성할 수 있습니다 — 토큰당 요금은 동일합니다. 코드, 구조화된 데이터(JSON/XML), 그리고 영어가 아닌 텍스트가 가장 큰 영향을 받는데, 요금은 변하지 않았지만 토큰 수가 달라졌기 때문입니다. 35%를 그대로 믿지 마세요: 기존 예산을 신뢰하기 전에, 실제 프롬프트를 새 모델의 token-counting endpoint에 다시 실행해 비교하세요.

사고, 빠른 모드, 그리고 미국 전용 라우팅

Anthropic의 가격 문서에 따르면:

  • 확장된 사고 토큰은 출력으로 청구됩니다, 화면에 표시하지 않더라도 마찬가지입니다. 추론이 많은 요청은 조용히 청구서의 출력 항목을 늘립니다.

  • Fast mode(Opus 4.8/4.7만 해당)는 동일한 모델을 최대 2.5배 더 빠르게 실행하며, 표준 요금의 2배가 적용됩니다.

  • 미국 전용 추론(데이터 거주성)은 입력과 출력에 1.1배 배수를 추가하며, AWS Bedrock 또는 Vertex 지역 엔드포인트는 그 위에 대략 추가 10%를 더합니다.

서버 측 도구

Anthropic 측에서 실행되는 도구는 동일한 가격 문서에 따라 별도로 청구됩니다: 웹 검색은 검색 1,000회당 $10이며, 결과를 처리하기 위한 토큰 비용이 추가되고, 코드 실행은 월별 할당량까지는 무료이며 그 이후에는 컨테이너당 시간당 약 $0.05입니다. (현재 수치는 가격 페이지에서 확인하세요 — 서버 도구 요금은 변경될 수 있습니다.)

Claude Code 사용자를 함정에 빠뜨리는 청구 문제

이 항목은 어떤 가격표에도 없습니다. 셸에 ANTHROPIC_API_KEY가 설정되어 있으면, Claude Code는 구독 대신 토큰당 과금 API를 통해 청구됩니다. 월 $20–$200의 정액제를 기대하던 사람들은 바로 이 이유로 사용량 기반 요금에 당황하곤 했습니다. 긴 세션을 시작하기 전에 환경을 확인하세요.

Claude는 실제로 얼마가 들까요?

요금은 워크로드에 대응시켜 보기 전까지는 큰 의미가 없습니다. 현재 가격 기준의 세 가지 예시를 들면, 모두 하루 10,000건의 요청(각각 입력 2,000토큰 + 출력 500토큰 — 하루 총 2,000만 입력 토큰 + 500만 출력 토큰)입니다:

  • Haiku 4.5의 지원 챗봇 ($1/$5): 20M × $1 + 5M × $5 = $45/일, 약 $1,350/월.

  • Sonnet 4.6의 코딩 에이전트 ($3/$15): $60 + $75 = $135/일, 최적화 전에는 약 $4,050/월.

  • Opus 4.8의 고컨텍스트 RAG 앱 ($5/$25)에서, 검색된 문서가 입력을 훨씬 더 높게 밀어 올리기 때문에 입력량이 지배적이어서 월 수만 달러 후반대에서 오만 달러대까지 올라갑니다.

같은 볼륨, 세 가지 모델 — 모델 선택만으로도 Haiku와 Sonnet 사이에서 비용이 약 3배 차이 납니다.

이것들은 가상의 상한선이 아닙니다. 하나의 r/ClaudeAI 스레드는 API 요금 기준으로는 약 월 $80,000가 들었을 31명의 Claude Code 사용자를 추적했으며, 최상위 사용자는 혼자서 거의 $18,000에 달했습니다 — 이는 구독 사용량이 계량된 API에서 청구될 금액에 대한 추정치일 뿐, 실제 청구서는 아닙니다. 무거운 자율 워크로드에서 청구 금액이 실제로 커지며, 바로 그 지점에서 아래의 최적화가 효과를 발휘합니다.

요금 한도 및 사용 등급

가격만이 유일한 제약은 아닙니다 — 얼마나 빠르게 사용할 수 있는지도 단계별로 제한됩니다. 새로운 API 계정은 보수적인 분당 요청 수(RPM) 및 분당 토큰 수(TPM) 한도로 시작하며, 계정이 오래될수록 그리고 누적 지출이 늘어날수록 자동으로 한도가 상승합니다(Tier 1 → 4). 새 계정에는 결제 카드 없이도 테스트할 수 있도록 무료 크레딧 $5가 제공됩니다. 처리량 외에도 Anthropic은 가용성과 가격 사이의 균형을 고려한 서비스 티어를 제공합니다: 표준 티어(기본값), 가용성 보장이 있는 우선 티어, 그리고 아래의 50% 비동기 할인에 해당하는 배치 티어가 있습니다. 규모에 맞게 설계하기 전에 본인 티어의 정확한 수치를 확인하려면 rate-limits docs를 확인하세요 — 시범 트래픽에는 충분했던 할당량도 프로덕션에서는 티어 상향이 필요할 수 있습니다.

Claude 구독 vs API: 어느 쪽이 더 저렴한가?

가장 흔한 현실 세계의 질문이며, 답은 판정이 아니라 임계값입니다.

  • Claude Pro는 월 $20입니다; Max는 월 $100 또는 $200입니다. 여기에는 사용량 한도 내에서 Claude 앱과 Claude Code가 포함되며, 토큰당 과금은 없습니다.

  • The API는 순수한 종량제이며, 월 최소 사용료도 없고 사용량 상한도 없습니다.

전환점은 월 수백만 개의 토큰, 즉 중간급 모델(Sonnet) 기준 대략 3–4M 수준에 있습니다. 이는 입력/출력 비중이 균형적이고, 그렇지 않았다면 Pro의 사용 한도 안에 머물렀을 경우를 가정한 것입니다. Haiku에서는 더 올라가고 Opus에서는 내려가므로, 고정된 선이 아니라 범위로 보아야 합니다. 이 용량 이하에서는 보통 구독이 더 저렴하고 간단합니다. 그 이상, 특히 프로덕션 트래픽이나 대규모 agentic coding의 경우에는 API의 토큰당 요금이 더 유리하며, 플랜에서는 제공되지 않는 제어 기능(속도 제한, 모니터링, 다중 키 청구)도 얻을 수 있습니다. 특히 하루 종일 코딩하는 경우, 개발자들은 Max 플랜이 Opus에서 같은 작업을 토큰 단위로 과금하는 것보다 훨씬 저렴할 수 있다고 추정합니다.

실용적인 규칙: 프로토타입과 개인 사용 → 구독; 대규모 제품 트래픽 → API. 그리고 위의 ANTHROPIC_API_KEY 함정도 주의하세요. 그렇지 않으면 두 가지 방식으로 모두 비용을 치르게 될 수 있습니다.

Claude API를 더 저렴하게 사용하는 방법

세 가지 레버를 사용하면 모델을 변경하지 않고도 표준 요금을 줄일 수 있습니다.

1. 프롬프트 캐싱(반복되는 컨텍스트 최대 90% 할인)

긴 시스템 프롬프트, 검색된 문서, few-shot 예시 같은 안정적인 접두어를 캐시하면 캐시 읽기 비용은 입력 요금의 0.1배로, 90% 할인됩니다. 핵심은 쓰기입니다. 5분 캐시 쓰기는 1.25배가 들고 한 번 읽으면 본전을 뽑으며, 1시간 쓰기는 2배가 들고 두 번 읽으면 이득입니다. 큰 고정 프리앰블을 반복해서 사용하는 경우라면, 이것이 가장 큰 단일 레버입니다. (Caching docs.)

2. 배치 API (50% 할인, 양방향)

실시간 응답이 필요하지 않은 경우, Batch API는 입력과 출력을 50% 할인하며 24시간 이내에 결과를 반환합니다. Sonnet 4.6은 $1.50/$7.50로, Haiku 4.5는 $0.50/$2.50로 내려갑니다. 캐싱과 배칭은 함께 적용되어, 실질 비용을 표시 가격의 절반보다 훨씬 낮게 만듭니다.

3. 모델 라우팅 및 출력 제한

모든 요청을 Opus에서 실행하지 마세요. 분류, 요약, 라우팅 로직은 Haiku로 보내고, 중간 단계에는 Sonnet을 사용하며, 작업에 꼭 필요할 때만 Opus를 호출하세요. 이것만으로도 흔히 40~60%를 절감할 수 있습니다. 그리고 출력은 입력보다 5배 비싸기 때문에, 상한을 설정하는 것 max_tokens는 가장 효과가 큰 조절 요소 중 하나입니다. 백만 건의 호출에서 평균 출력이 800 토큰에서 500 토큰으로 줄어들면 매달 실제로 큰 비용을 절약할 수 있습니다.

공식 API vs 릴레이 플랫폼: 더 적게 지불할 수 있을까요?

공식 문서에는 언급되지 않은 네 번째 경로가 있습니다: 릴레이를 통해 동일한 Claude 모델을 구매하는 것입니다. API 릴레이(또는 애그리게이터)는 당신과 Anthropic 사이에 위치하며, Anthropic 호환 엔드포인트를 노출하고 자체 요금을 부과합니다.

릴레이는 왜 더 저렴할 수 있을까요? 주된 이유는 세 가지입니다. 릴레이는 약정 사용량 규모로 구매해 개별 계정으로는 도달할 수 없는 할인을 받습니다. 또한 지역과 공급자 전반에 걸쳐 효율적으로 라우팅하며, 많은 곳이 개발자를 유치하기 위해 얇은 마진으로 운영되거나 손해를 감수하는 미끼 상품 전략을 사용합니다. 하지만 그렇게 큰 할인은 어딘가에서 나와야 합니다. 플랫폼에 의존하기 전에 그 모델을 이해하세요.

할인은 매우 다양합니다. 동일한 Claude 모델에 대해 세 가지 옵션을 비교하면 다음과 같습니다:

플랫폼

Anthropic 정가 대비 할인

모델 지원 범위

참고

공식 Anthropic API

— (기준)

모든 모델, Fable 5 / Opus 4.8 포함

캐싱, 배치, 모든 기능

OpenRouter

≈ 정가 (제공업체 가격을 그대로 전달)

다수의 모델, 멀티 제공업체

집계기; 절감보다 편의성 중심

EvoLink

~10% 할인

Opus 4.7까지

OpenAI 호환 엔드포인트

AIReiter

~80% 할인

Opus 4.6까지

Anthropic 호환; 캐싱 전달

AIReiter는 가장 공격적인 구간에 위치합니다. 다음은 헤드라인 약 80%가 모델별로 어떻게 계산되는지입니다:

모델

공식 (입력 / 출력)

AIReiter (입력 / 출력)

절약

Claude Haiku 4.5

$1 / $5

$0.20 / $1.00

80%

Claude Sonnet 4.6

$3 / $15

$0.60 / $3.00

80%

Claude Opus 4.6

$5 / $25

$1.00 / $5.00

80%

통합은 바로 적용할 수 있습니다: AIReiter의 엔드포인트는 Anthropic Messages API와 호환됩니다. 따라서 공식 anthropic SDK는 두 줄만 변경하면 작동합니다 — base_url을 https://aireiter.com/api로 지정하고 키를 바꾸세요:

client = anthropic.Anthropic(
    api_key="YOUR_AIREITER_KEY",
    base_url="https://aireiter.com/api",
)

스트리밍, 멀티턴, 비전, 그리고 cache_control은 모두 그대로 통과하므로, 위의 90% 캐싱 할인은 더 낮은 기본 요금에 추가로 적용됩니다.

자주 묻는 질문

왜 Claude API는 그렇게 비싼가요?

종종 문제는 토큰당 요금이 아니라 워크플로 설계입니다. 가장 큰 비용 요인은 Haiku나 Sonnet으로 충분한데도 모든 작업을 Opus로 돌리는 것, 캐시되지 않은 반복 컨텍스트, 제한 없는 출력, 그리고 비용은 청구되지만 보이지는 않는 reasoning tokens입니다. 이런 부분을 바로잡는 것이 보통 표면적인 가격보다 더 중요합니다.

Claude API에 무료 요금제가 있나요?

영구적인 무료 프로덕션 티어는 없지만, 새 계정은 테스트용으로 무료 크레딧 $5를 받습니다(카드 불필요). 그 이후에는 사용한 만큼 지불하는 방식입니다.

Claude API vs ChatGPT 가격 — 어느 쪽이 더 저렴한가요?

비교하는 티어에 따라 다릅니다. 대략적으로, 백만 토큰당(입력/출력):

Claude

비교 가능한 OpenAI

Haiku 4.5 — $1 / $5

GPT mini tier — 낮은 한 자릿수

Sonnet 4.6 — $3 / $15

중간 tier — 비교 가능

Opus 4.8 — $5 / $25

GPT-5.5 — ~$5 / $30

월간 Claude API 요금을 어떻게 계산하나요?

(requests × avg input tokens ÷ 1,000,000 × input rate) + (requests × avg output tokens ÷ 1,000,000 × output rate)로 추정하세요. 실제 프롬프트에서 정확한 수치를 얻으려면 token-counting endpoint를 사용하세요 — 일반적인 tokenizer는 Claude에서 15–35% 정도 오차가 있을 수 있습니다.

핵심 요약

대부분의 팀에게는 세 가지로 나뉩니다: 프로토타이핑 또는 개인 사용 → Pro 또는 Max 구독(월 ~3–4M tokens 이하에서는 더 단순하고 더 저렴함); 최신 플래그십에서의 프로덕션(Opus 4.8, Fable 5) → 캐싱, 배칭, 라우팅을 켠 공식 API; Sonnet 4.6 또는 Opus 4.6이면 충분한 프로덕션 → AIReiter 같은 평판 좋은 릴레이를 사용하면 SDK를 바로 교체하는 것만으로 동일한 비용을 최대 80%까지 줄일 수 있습니다.

어떤 것을 선택하든 대부분의 팀은 잘못된 요금제를 선택해서가 아니라 최적화를 건너뛰어서 과도하게 지불합니다. 그러니 요금표를 걱정하기 전에 먼저 조정할 수 있는 항목들을 활성화하세요.