GPT-5.6 Luna는 이제 입력 100만 토큰당 $0.20, 출력 100만 토큰당 $1.20이다. OpenAI가 2026년 7월 30일 Luna 가격을 80%, Terra 가격을 20% 내린 결과다. 다만 Sol의 일반 요금은 그대로이며, 여러 턴에 걸친 에이전트를 운영한다면 캐시 쓰기 과금이 인하분 대부분을 청구서에서 상쇄할 수도 있다.
2026년 7월 30일에 바뀐 가격
이번 가격 인하는 2026년 7월 30일부터 적용됐으며, 기존 모델 ID를 그대로 사용한다. OpenAI는 해당 모델을 제공하는 시스템의 효율을 개선한 뒤 두 모델의 가격을 인하했다고 밝혔고, GPT-5.6 Sol의 일반 요금은 유지했다.
| 모델 | 모델 ID | 기존 입력 | 현재 입력 | 기존 출력 | 현재 출력 |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
가격은 짧은 컨텍스트 기준 일반 티어의 토큰 100만 개당 요금이다. OpenAI API 가격 문서를 기준으로 2026-07-31에 확인했다.
그래서 ‘GPT-5.6 시리즈가 전반적으로 저렴해졌다’는 말은 3분의 2만 맞다. OpenAI는 인하와 함께 Sol에 Fast mode도 추가했다. 입력 $10.00, 출력 $60.00으로 일반 요금의 두 배지만, 기반 모델은 바꾸지 않은 채 최대 2.5× 처리량을 제공한다. 가격 문서에 따르면 Fast mode는 기존 priority processing의 새 이름이다. 즉, 저가형 두 티어는 내려갔지만 플래그십 티어에는 같은 날 더 비싼 선택지가 생겼다.
모델을 지정할 때는 시리즈 이름만 쓰지 말고 명시적인 모델 ID를 적는 편이 안전하다. OpenAI의 모델 카탈로그는 gpt-5.6을 gpt-5.6-sol의 별칭으로 표기한다. 저렴한 티어를 기대하고 짧은 이름으로 라우팅하면 플래그십 요금이 청구된다. 리셀러가 이 별칭을 아예 제공하지 않을 수도 있다. AIReiter 엔드포인트에서는 gpt-5.6이 Model 'gpt-5.6' not found를 반환했다(2026-07-31 테스트).
개발자들 사이에서는 인하 폭 자체보다 이 가격이 지속될지에 관심이 쏠렸다.
OpenAI의 5.6 모델을 실제로 돌리는 비용이 정말 이렇게 낮을 리가 없다 — r/Anthropic 스레드 제목
Luna가 GPT-5.4 nano보다 저렴해진 지금, 어떤 티어를 써야 할까
GPT-5.6 Luna는 입력 $0.20, 출력 $1.20이다. 출력 토큰 기준으로도 이제 gpt-5.4-nano($0.20 / $1.25)보다 저렴하고, gpt-5.4-mini($0.75 / $4.50)와는 격차가 크다. 비용만 보고 기존 nano나 mini 호출을 유지했다면, 그 근거는 사라졌다.
저가 티어의 실력을 확인하기 위해 2026-07-31에 AIReiter의 OpenAI 호환 엔드포인트에서 GPT-5.6 세 모델을 대상으로 두 가지 작업을 실행했다. 하나는 엄격한 스키마를 적용한 지원 티켓→JSON 추출, 다른 하나는 정답이 하나인 토큰 과금 산수 문제($23.71)였다. 각 작업은 모델별로 두 번 실행했고, max_tokens: 4000, 재시도 없음 조건에서 기대 출력에 대한 통과/실패로 판정했다.
| 작업 | 모델 | 입력 토큰 | 출력 토큰 | 지연 시간(1회차 / 2회차) | 정답 여부 |
|---|---|---|---|---|---|
| 티켓 → JSON | Luna | 135 | 77–78 | 4.0초 / 3.5초 | 예 |
| Terra | 135 | 46 | 2.1초 / 2.1초 | 예 | |
| Sol | 135 | 46 | 2.3초 / 2.2초 | 예 | |
| 과금 산수 | Luna | 119 | 111–122 | 3.1초 / 4.3초 | 예 |
| Terra | 119 | 87–89 | 3.8초 / 2.8초 | 예 | |
| Sol | 4,488 | 84–87 | 3.5초 / 3.2초 | 예 |
여기서 눈여겨볼 결과는 두 가지다.
추출 작업에서 Luna는 세 모델 가운데 가장 빨랐던 것이 아니라 가장 느렸다. Luna는 3.5–4.0초가 걸렸고 Terra는 2.1초였다. 저렴한 티어가 곧 저지연 티어라는 뜻은 아니다.
Terra와 Luna가 모두 119 토큰으로 계산한 프롬프트에서 Sol은 입력 4,488 토큰을 보고했다. 이 중 3,840 토큰은 cached_tokens로 표시됐으며, 두 번의 실행에서 정확히 재현됐다. 반면 단순 프롬프트인 ‘Reply with only the word OK.’에서는 세 모델이 모두 똑같이 24 토큰을 보고했다. 토큰 수 증가는 모델보다 프롬프트를 따라간다. 토큰 수는 확인할 수 있지만 원인은 알 수 없다. 문서화된 모델 특성이 아니라, 하나의 엔드포인트에서 관측된 과금 동작으로 봐야 한다.
동일한 정답을 공식 일반 요금으로 환산하면 비용은 다음과 같았다.
1,000회 기준 Luna는 $0.16, Terra는 $1.29, Sol은 $7.73이었다. Sol은 같은 세 자리 숫자를 반환하는 데 Terra의 약 6배, Luna의 약 47배를 청구했다.
물론 이는 쉬운 작업 두 개를 각각 두 번 실행한 작은 표본일 뿐, 벤치마크도 아니고 추론 품질을 측정한 결과도 아니다. 다만 운영 원칙 하나는 뒷받침한다. 우선 Luna에서 시작하고, 실제 트래픽에서 측정된 실패가 있을 때만 상위 티어로 올리는 방식이다. 이번 실행에서는 Terra가 이미 정답을 낸 작업에서 Sol에 더 지불해도 얻는 것이 없었다. 워크로드별 전체 구분은 글 마지막 표에 정리했다.
80% 인하가 청구서 80% 절감으로 이어지지 않는 이유
헤드라인 요금은 새 입력 토큰과 출력 토큰에 적용된다. 하지만 여러 턴으로 이어지는 에이전트 트래픽에서는 세 번째 항목인 캐시 쓰기 비용이 지배적일 수 있다. GPT-5.6의 세 티어 모두 캐시 쓰기는 캐시 읽기보다 12.5× 비싸다.
| 모델 | 캐시된 입력(읽기) | 캐시 쓰기 | 비율 |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
2026-07-11에 OpenAI 개발자 커뮤니티에 게시된 통제 테스트는 이 차이가 얼마나 큰지 보여준다. previous_response_id로 연결한 6회의 순차 Responses API 턴에서 Luna는 gpt-5.4-mini보다 입력 토큰을 3% 적게, 출력 토큰을 29% 적게 썼다. 그런데 대화당 비용은 $0.0332 대비 $0.0651로 96% 더 높았다. Luna 입력의 약 70%가 캐시 쓰기로 과금됐기 때문이다. 이 수치는 가격 인하 전 결과지만, 작동 방식은 바뀌지 않았다.
유용한 점은 그 구현의 원인을 고칠 수 있었다는 것이다. GPT-5.6 캐시는 부분 일치를 인정하지 않으므로 캐시된 접두사가 조금이라도 바뀌면 전체를 다시 써야 한다. 작성자는 증가하는 대화 스냅샷을 instructions 안에서 매 턴 재구성했고, 그 때문에 매번 접두사 캐시가 무효화됐다.
진단 결과는 명확했다. 고정된 instructions는 이후 사용자 턴 15회 중 15회에서 캐시를 적중했고, 가변적인 instructions는 15회 중 0회였다. 이 컨텍스트를 developer input item으로 옮기자 Luna의 추가 비용은 96%에서 16.7%로 떨어졌다. 이후 Luna는 작성자의 블라인드 리뷰에서 mini보다 더 빠르고 더 높은 점수를 기록했다. prompt_cache_key와 명시적인 캐시 브레이크포인트는 어느 쪽도 도움이 되지 않았다.
할인 효과가 실제 청구서에 반영됐다고 보기 전에 다음 두 가지를 확인하자.
- 캐시 접두사에서 가변 요소를 모두 빼낸다. 시스템 텍스트, 도구 정의, 페르소나는 맨 앞에 두고 바이트 단위로 동일하게 유지한다. 대화 상태는 input item에 넣는다.
- API 응답의 분리를 직접 확인한다. 호출마다
usage.prompt_tokens_details.cached_tokens와usage.prompt_tokens를 비교하면 캐시 읽기 비율을 알 수 있다. 오래 실행되는 에이전트에서 이 비율이 낮다면, 이 시리즈에서 가장 큰 비용 절감 여지가 있는 버그일 가능성이 높다.
서로 다른 GPT-5.6 가격이 보이는 이유: 내게 적용되는 요금 찾기
GPT-5.6 Luna 가격을 검색하면 적어도 세 가지 수치가 나온다. 각각은 특정 티어에서는 현재 또는 과거에 맞는 가격이다. 인용된 가격이 어느 티어 기준인지 확인하면 대부분의 혼란은 정리된다.
| 확인한 가격 | Luna 입력 / 출력 | 의미 |
|---|---|---|
| $0.20 / $1.20 | 일반 티어, 짧은 컨텍스트 | 일반적인 API 호출에 적용되는 기본 요금 |
| $0.10 / $0.60 | Batch 및 Flex 티어 | 비동기·낮은 우선순위 작업용으로 일반 요금의 정확히 절반 |
| $0.40 / $2.40 | Fast mode | 일반 요금의 두 배 |
| $1.00 / $6.00 | 7월 30일 이전 일반 요금 | 가격 인하 전까지는 정확했던 요금 |
같은 가격 문서에 나온 추가 조건도 두 가지 있다. 긴 컨텍스트는 짧은 컨텍스트 입력 요금의 2×, 출력 요금의 1.5×로 청구된다. 따라서 Luna의 긴 컨텍스트 요금은 $0.40 / $1.80이며 $0.40 / $2.40이 아니다. 또 문서는 2026-03-05 이후 출시된 모델의 대상 데이터 레지던시 엔드포인트에 10% 할증이 붙는다고 명시하는데, GPT-5.6 전체가 이에 해당한다.
가격 페이지와 청구서가 다를 때는 두 가지를 확인하면 된다. 먼저 페이지의 검증 날짜를 보고, 실제로 호출하는 특정 티어를 기준으로 공식 가격 문서와 대조한다. 애그리게이터와 리셀러는 별도 요금을 공개하기도 한다. 이는 오래된 가격이라서가 아니라 또 다른 가격 체계이기 때문이다.
AIReiter에서는 GPT-5.6 세 티어를 OpenAI 정가의 50%로 제공하며, 이 요금도 7월 30일 인하를 반영했다. GPT-5.6 Luna는 $0.10 / $0.60, Terra는 $1.00 / $6.00, Sol은 $2.50 / $15.00이다. 캐시된 입력과 캐시 쓰기에도 같은 절반 요율이 적용된다.
예를 들어 하루에 입력 100만 토큰, 출력 20만 토큰을 처리하는 Terra 에이전트라면 정가에서는 하루 $4.40, AIReiter에서는 $2.20이다. 호출 내용과 모델 ID는 동일하다.
Luna가 전체 시장에서 어느 위치에 있는지는 별개의 문제다. VentureBeat이 7월 30일 비교한 30개 모델에서 Luna의 입력·출력 합산 요금 $1.40은 Gemini 3.5 Flash-Lite($2.80), Gemini 3.1 Flash-Lite($1.75)보다 낮지만 DeepSeek v4-flash($0.42)보다는 높다. 비용만 기준이라면 가장 저렴한 LLM API는 OpenAI 제품이 아니다.
FAQ
GPT-5.6 Sol도 가격이 내려갔나?
아니다. Sol의 일반 요금은 토큰 100만 개당 입력 $5.00, 출력 $30.00으로 변함없다. 대신 최대 2.5× 처리량을 제공하는 Fast mode가 일반 요금의 두 배 가격으로 추가됐다.
GPT-5.6 Luna가 이제 가장 저렴한 API 모델인가?
아니다. 입력·출력 합산 토큰 100만 개당 $1.40으로 프론티어 시리즈 모델 중 저렴한 편에는 속하지만, VentureBeat의 7월 30일 표에서는 DeepSeek v4-flash($0.42), Xiaomi의 MiMo-V2.5 Flash($0.40), DeepSeek v4-pro($1.305)가 더 낮다.
일부 페이지에서 GPT-5.6 Luna가 $1 / $6로 표시되는 이유는?
이는 2026년 7월 30일 이전의 일반 요금이다. 페이지에 적힌 검증 날짜를 확인한 뒤, 호출하는 티어 기준의 공식 가격 문서와 대조해야 한다.
가격 인하는 Batch와 Flex에도 적용되나?
그렇다. Batch와 Flex는 일반 요금의 절반으로 책정되므로 해당 티어에서 Luna는 $0.10 / $0.60, Terra는 $1.00 / $6.00이다. 캐시된 입력과 캐시 쓰기도 포함된다.
새 가격을 적용받으려면 코드를 수정해야 하나?
아니다. 기존 gpt-5.6-luna 및 gpt-5.6-terra 모델 ID에 마이그레이션 없이 인하가 적용된다. 다만 한 가지 점검할 만한 부분은 캐시 읽기 비율이다. 할인 효과가 가장 흔히 사라지는 지점이기 때문이다.
워크로드별 권장 GPT-5.6 티어
| 워크로드 | 티어 | 이유 |
|---|---|---|
| 대량 추출, 태깅, 요약 | Luna | 두 테스트 작업을 모두 통과했고, 100만 토큰당 합산 $1.40으로 이제 gpt-5.4-nano보다 저렴 |
| 지연 시간에 민감한 사용자 대면 호출 | Terra | 추출 작업에서 Luna보다 실측 속도가 빨랐음(2.1초 vs 3.5–4.0초) |
| Luna가 품질 기준을 충족하지 못했을 때의 첫 상향 | Terra | 합산 $14로 Sol의 $35보다 낮음 |
| 자체 트래픽에서 Terra의 성능 저하가 측정되는 작업 | Sol | Terra 대비 6×의 실측 작업당 비용을 정당화할 수 있는 유일한 경우 |
| 모든 티어의 여러 턴 에이전트 | 캐싱부터 수정 | 캐시 쓰기는 읽기의 12.5×이며, 잘못된 접두사가 티어 선택보다 더 큰 영향을 줌 |