AIREITER

LLM API는 왜 이렇게 비쌀까? 요금표보다 중요한 건 사용량이다

마지막 업데이트: 2026-10-01 01:54:27

Claude Code 사용자가 Max 플랜에서 한 달 동안 처리한 작업을 API 정가로 환산해 보니 200달러 청구서가 무려 7,470달러가 됐다. 그렇다고 토큰 단가 자체가 비정상적으로 높은 것은 아니다. 구독형 서비스가 조용히 제공하던 사용량 상한이 사라지고, 사람이 채팅창에 직접 입력할 때보다 에이전트가 훨씬 많은 토큰을 반복해서 보내면서 비용이 폭증한 것이다.

개발자들이 말하는 가격 차이

사용자들이 공유하는 차이는 크지만 패턴은 꽤 일정하다. r/ClaudeAI 스레드에서는 Claude Code 세션 로그를 재구성해 Max 플랜의 한 달 사용량을 API 정가 기준 약 7,470달러로 계산했다. 구독료는 200달러였다. 또 다른 구독과 API 비교 스레드에서는 200달러 플랜 사용자가 같은 작업을 API로 처리하면 한 달에 5,000~20,000달러가 든다고 추산했다.

물론 두 사례 모두 공식 감사가 이뤄진 수치는 아니다. 다만 토큰을 가장 많이 잡아먹는 상황은 동일하다. 에이전트가 저장소 전체를 반복해서 훑는 작업이다.

"회사에서 Claude Code를 엔터프라이즈 API 플랜으로 사용하고 있는데, 규모가 큰 프로젝트에서 평소처럼 코딩만 해도 세션당 API 비용으로 100~200달러를 쉽게 쓸 수 있다고 직접 말할 수 있습니다." — u/andywidjaja, r/ClaudeAI

유료 플랜과 API 키는 애초에 다른 상품이다

Anthropic도 이 차이를 명확히 설명한다. 2026년 3월 16일 업데이트된 고객센터 문서는 Claude 플랜과 Claude Console을 “서로 다른 목적을 위해 설계된 별도 상품”이라고 규정하며, 유료 구독에는 “Claude API나 Console 이용 권한이 포함되지 않는다”고 안내한다. OpenAI 역시 같은 구조다. ChatGPT와 API 플랫폼의 결제 시스템을 분리해 운영한다.

둘의 차이를 이해하려면 무엇을 판매하는지 비교하는 편이 가장 쉽다.

유료 채팅 플랜API 키
판매 단위사람 한 명의 좌석토큰 처리량
사용량 제한5시간 단위의 롤링 윈도와 주간 한도번들 할당량 없음. 속도 및 지출 제한은 적용
사용 방식웹, 데스크톱, 모바일 앱직접 작성한 코드
가격 구조월 고정 요금토큰당 변동 요금
자체 제품 구동그 용도로 판매되는 상품이 아님바로 그 목적을 위한 상품

Claude 요금 페이지에 따르면 Pro는 월 결제 시 월 20달러, 연간 결제 시 월 17달러(선결제 200달러)다. Max는 5시간 세션마다 Pro 사용량의 5배 또는 20배를 제공하며 월 100달러부터 시작한다. 다만 Anthropic은 이 요금제들의 메시지 수를 공개하지 않는다. 대화 길이, 모델, 기능에 따라 소비량이 달라지기 때문이다. 결국 이 비교는 측정된 수치와 측정되지 않은 수치를 맞대는 셈이다.

Free, Pro, Max 등급을 보여주는 Claude 플랜 요금 페이지

같은 페이지에는 또 하나 눈여겨볼 대목이 있다. Claude Enterprise는 좌석당 월 20달러를 받으면서도 사용량은 API 요금으로 별도 과금한다. 사용량이 많은 고객은 결국 미터기 위로 돌아오는 구조다.

구독료 1달러로 API에서 살 수 있는 토큰

플랜 요금을 토큰으로 환산하면 차이가 훨씬 선명해진다. 아래는 Claude 플랫폼 요금 문서와 OpenAI API 요금 페이지에서 확인한 100만 토큰(MTok)당 공식 요금이며, 2026년 10월 1일 기준이다.

Claude와 OpenAI 모델별 100만 토큰당 입력 및 출력 정가 비교
모델입력출력캐시 읽기배치 (입력/출력)
Claude Fable 5.1$10$50$0.25$5 / $25
Claude Opus 5.5$4$20$0.20$2 / $10
Claude Sonnet 5.5$2$10$0.20$1 / $5
Claude Haiku 4.5$1$5$0.10$0.50 / $2.50
GPT-6 Astra$10$50$1.00$5 / $25
GPT-6.1 Sol$2$10$0.10$1 / $5
GPT-6 Luna$0.10$0.50$0.01$0.05 / $0.25
모델별 API 크레딧 20달러로 구매할 수 있는 출력 토큰 수

대화형 작업을 가정해 보자. 수천 단어의 컨텍스트를 입력하고 수백 단어를 출력하는 정도라면 Sonnet 5.5 크레딧 20달러로 입력 토큰 약 1,000만 개 또는 출력 토큰 200만 개를 처리할 수 있다. 정확한 비용은 API 응답의 네 가지 필드로 계산한다. (fresh input × input rate) + (cached input × cache-read rate) + (cache writes × write rate) + (output × output rate) 여기에 긴 컨텍스트, 배치, 리전별 가중치가 추가된다. 엔드포인트별로 이 네 값을 일주일만 기록하면 좌석형 플랜과 비교할 수 있는 월간 비용이 나온다.

토큰은 실제로 어디에서 불어날까

요금표만 봐서는 놓치기 쉬운 토큰 비용의 원인은 크게 네 가지다. 마지막 세 항목은 LLM Cost Lab의 숨은 비용 분석에 자세히 정리돼 있다.

  1. 매 턴 다시 전송되는 대화 기록. 요청 기반 채팅 연동에서는 클라이언트가 대화 기록을 매번 다시 보낸다. 그래서 20번째 턴에는 1~19번째 턴의 내용이 모두 포함된다. 매 턴 비슷한 양의 컨텍스트가 추가되면 입력량은 대화 길이의 제곱에 가깝게 늘어난다. 해당 분석에서 20턴 세션 비용을 독립적인 호출 기준 0.063달러로 예상했지만 실제 계산은 0.163달러, 즉 2.6배로 나온 이유다.
  2. 호출마다 반복되는 시스템 프롬프트. 2,000토큰짜리 시스템 프롬프트를 100만 번 보내면 사용자가 아무것도 입력하기 전부터 입력 토큰이 20억 개 쌓인다.
  3. 눈에 보이지 않는 추론 토큰. 내부 사고 과정까지 출력 토큰으로 과금하는 모델에서는 숨겨진 토큰이 눈에 보이는 답변보다 몇 배 길어질 수 있다. 반환된 문자 수만 기준으로 사용량을 추정하면 실제 청구액을 과소평가하게 된다.
  4. 도구 결과, 재시도, 버려진 생성 결과. 모델이 생성했다면 비용을 낸다. JSON 검증에서 거부된 응답이나, 더 빠른 결과를 얻으려고 병렬 호출했다가 버린 응답도 예외가 아니다.

토큰 단가가 저렴해도 전체 청구액을 지배할 수 있다. 사용량 대시보드를 직접 확인한 사람들이 자주 혼란스러워하는 지점이다. 7,470달러 사례의 스레드에서는 한 댓글 작성자가 캐시 읽기가 전체 비용의 48%를 차지했다는 점을 지적했다. 캐시 읽기는 요금표상 가장 저렴한 토큰 유형인데도 말이다.

“API에서 이미 가장 저렴한 토큰 유형인데도 정가 기준으로 전체 비용의 대부분을 차지한다면, 실제 워크로드는 매 턴 컨텍스트를 대부분 다시 읽는 구조라는 뜻입니다.” — u/YoanEdwin, r/ClaudeAI

150k 토큰의 저장소 컨텍스트를 실은 에이전트 턴에 Opus 5.5 요금을 적용하면 구조가 바로 드러난다.

Opus 5.5, 60턴 세션, 턴마다 150k 컨텍스트 + 2k 출력비용
턴당 신규 입력, 캐시 적중 없음 (150k @ $4)$0.60
신규 입력 대신 턴당 캐시 읽기 (150k @ $0.20)$0.03
턴당 출력 (2k @ $20)$0.04
세션당 1시간 캐시 기록 1회 (150k @ $8)$1.20
세션 총액, 캐시 없음$38.40
세션 총액, 캐시 사용$5.40

하루에 캐시를 사용한 세션을 두 번 실행하고 월 22일 근무한다고 가정하면 약 238달러다. 이미 200달러 플랜을 넘어선다. 캐시를 사용하지 않으면 같은 달에 1,600달러를 넘는다. 요금 단가는 그대로였지만 토큰 수가 달라졌을 뿐이다.

선택지는 둘이 아니라 세 단계다

대부분의 비교는 플랜과 API 사이에서 끝난다. 하지만 세 번째 단계가 있다. 구독 상품 안에서 제공량을 모두 소진한 뒤에야 접하게 되는 추가 사용량 크레딧이다.

r/codex에 올라온 사례를 보면 이 단계의 가격은 순수 API 정가보다 높았다. 한 Pro 사용자는 구매한 크레딧으로 약 1,600만 토큰을 처리하는 데 약 40달러를 썼고, 같은 물량을 API 정가로 처리하면 약 12달러였을 것으로 추산했다.

“크레딧 가격은 거의 약탈적이라고 봅니다. API로는 2달러 정도면 될 작업에 랜딩 페이지 하나 만들고 50달러를 내는 건 터무니없죠.” — u/AbjectBug5885, r/codex

이 수치는 사용자 추정치일 뿐 보편적인 요금은 아니다. 추가 충전 가격은 업체와 플랜에 따라 달라진다. 다만 위 Codex 사례에서는 추가 충전 단계가 동일한 API 정가 사용량보다 대략 3배 비쌌다. 크레딧을 두 번째 주에도 구매하기 전에 자신의 사용량으로 API 키와 비교해 볼 만한 이유다.

청구액을 바꾸는 다섯 가지 방법

각 방법에는 공식 요금이 적용되므로, 먼저 벤더의 요금 페이지를 기준으로 계산을 검증할 수 있다.

  1. 캐시 기록 비용까지 포함해 프롬프트 캐싱하기. Anthropic의 요금 문서에 따르면 5분 캐시 기록은 기본 입력 요금의 1.25배, 1시간 기록은 2배다. 캐시 읽기는 기본 요금의 0.1배이며 Opus 5.5에서는 0.05배, Fable 5.1에서는 0.025배다. 5분 캐시는 한 번 읽으면 손익분기점을 넘고, 1시간 캐시는 두 번 읽으면 본전을 찾는다. 한 번 기록한 뒤 다시 읽지 않는다면 캐시를 쓰지 않는 것보다 오히려 비싸다. 활성화 여부만큼 중요한 것은 순서다. 변하지 않는 콘텐츠를 앞에, 사용자별 변동 내용을 뒤에 배치해야 한다. 그렇지 않으면 접두부가 일치하지 않는다. 적중률을 확인하는 방법은 프롬프트 캐싱 가이드에 정리돼 있다.
  2. 기다릴 수 있는 작업은 배치로 처리하기. 두 벤더 모두 비동기 처리에 대해 정가를 50% 낮춘다. Opus 5.5는 $2/$10, Sonnet 5.5는 $1/$5가 된다. 다만 모든 모델이 같은 조건을 제공하는 것은 아니다. LLM Cost Lab이 추적한 83개 모델 중 할인된 배치 등급을 제공하는 모델은 26개뿐이다. 이를 전제로 설계하기 전에 사용 중인 모델을 먼저 확인해야 한다. 구체적인 작동 방식은 배치 API 요금 가이드에서 확인할 수 있다.
  3. 작업에 맞춰 모델을 나누기. 분류, 라우팅, 검색 결과 선택 같은 작업에는 최상위 모델이 필요하지 않은 경우가 많다. Haiku 4.5는 $1/$5, Fable 5.1은 $10/$50이므로, 출력 토큰 10개를 내는 단계에서도 10배 차이가 난다.
  4. max_tokens만이 아니라 출력 자체를 제한하기. 위 표의 거의 모든 모델에서 출력 단가는 입력의 5배다. 서두를 금지하는 스키마를 사용하면 약간의 구조적 오버헤드로 불필요한 서술 비용을 줄일 수 있다. max_tokens는 서식 제어보다는 안전 상한으로 사용하는 편이 낫다. 답변이 중간에 잘리면 유료 요청을 한 번 더 보내야 할 수 있기 때문이다.
  5. 추가 가중치를 확인하기. OpenAI의 긴 컨텍스트 등급은 짧은 컨텍스트 입력 요금을 두 배로 높이며, Fast 모드는 표준 요금을 다시 두 배로 올린다. Anthropic은 미국 리전 고정 추론에 1.1배를 부과한다. 또한 요금 문서에 따르면 Claude 4.7 이후 모델은 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성하는 새로운 토크나이저를 사용한다. 프롬프트는 바뀌지 않았지만 미터기가 바뀐 셈이다.

이 목록과 별개로 고려할 구조적 선택지도 있다. 벤더마다 별도의 결제 관계를 맺는 대신 프로그램 트래픽을 하나의 종량제 엔드포인트로 보내는 방식이다. AIReiter의 Claude API 엔드포인트가 바로 이 용도를 위한 것이다. 정가 기준으로 Sonnet급 입력 토큰 4,000만 개와 출력 토큰 800만 개를 한 달 동안 사용하면 $80 + $80이므로, 두 번째 좌석을 추가하는 편이 나은지 비교하는 데는 1분이면 충분하다.

무엇을 사야 할까

사용 상황선택이유
앱에서 채팅, 리서치, 가끔 하는 코딩유료 플랜만지출 상한이 있고 앱이 번들로 제공되며 플랜 한도보다 사용량이 적음
혼자 에이전트 코딩을 하고 한 대의 장비만 사용하는 경우먼저 플랜을 사고, 초과분은 종량제 키로 처리대부분의 사용량은 플랜이 흡수하고, 키가 주간 초기화를 기다리는 문제를 해결
다른 사람이 사용하는 제품을 출시하는 경우API만좌석은 한 사람을 위한 것이며, 사용자는 각자의 처리량이 필요함
평가, 백필, 분류 등 주기적인 대량 작업배치 등급을 지원하는 API정가 대비 50% 저렴하고 지연 시간이 중요하지 않음
대부분의 주에 추가 충전 크레딧을 구매하는 경우초과 사용량을 API 키와 비교사례상 크레딧 가격이 API 정가보다 높았음

FAQ

유료 ChatGPT 또는 Claude 플랜에 API 크레딧이 포함되나요?

아니다. Anthropic 고객센터는 유료 Claude 플랜에 “Claude API나 Console 이용 권한이 포함되지 않는다”고 명시한다. OpenAI 역시 ChatGPT와 API 플랫폼을 별도 시스템으로 과금한다. 둘 다 사용하면 청구 항목도 두 개다.

보이지 않는 추론 토큰에도 비용을 내나요?

사고 과정이나 확장 추론을 제공하는 모델이라면 그렇다. 이 토큰은 응답 본문에 표시되지 않지만 출력 요금으로 과금된다. 따라서 usage 객체를 확인해야 한다.

매 턴마다 전체 대화에 대한 비용을 내나요?

캐시 적중으로 반복되는 접두부를 처리하지 않는 한 그렇다. 서버 측 상태 기능이 없다면 클라이언트는 모델에 보여줄 대화 기록을 매번 다시 보낸다. 이 기록은 모델 요금에 따른 신규 입력으로 과금되거나, 접두부가 일치할 경우 캐시 읽기 요금으로 과금된다.

실패하거나 재시도한 요청에도 비용이 발생하나요?

LLM Cost Lab의 과금 분석에 따르면 모델에 도달해 응답이 반환된 요청은 스키마 오류나 클라이언트 타임아웃으로 애플리케이션이 결과를 버리더라도 과금된다. 생성이 시작되기 전에 거부된 요청은 예외다.

아직 해결되지 않은 선택의 문제

플랜은 지출을 제한하는 대신 접근량을 배분하고, 종량제 키는 그 반대다. 플랜에 포함된 사용량의 토큰 환산값이 공개되지 않은 상황에서 “나에게는 어느 쪽이 더 저렴한가”를 답하려면 직접 트래픽을 일주일 동안 계측하고 위 표의 요금으로 계산해야 한다.

함께 읽을 글: 2026년 가장 저렴한 LLM API · Claude API 요금 가이드