AIREITER

GPT-5.6 Sol 토큰 사용량: GPT-5.5보다 비용이 2배 넘는 이유

마지막 업데이트: 2026-08-05 19:02:51

GPT-5.6 Sol을 쓰고 청구서가 유난히 크게 나왔다면, 단순한 느낌만은 아닐 수 있습니다. Codex 세션 1,715건에서 Sol은 세션당 평균 1,645만 토큰을 소비했으며, 이는 비슷한 기간의 1,667세션에서 GPT-5.5가 기록한 평균 730만 토큰의 2.25배입니다. 토큰당 가격은 같은데 사용량은 두 배를 훌쩍 넘는 셈입니다. 게다가 Responses API에는 Sol의 청구 대상 output_tokens를 6배 이상 부풀릴 수 있는 보고된 결함도 있습니다. GPT-5.6 청구액이 이상해 보인다면 실제로 문제가 있을 가능성이 큽니다.

GPT-5.6 Sol, 세션당 토큰은 얼마나 늘었나

개발자 Vincent Schmalbach는 Codex 사용 기록을 두 개의 14일 구간으로 나눠 추적했습니다. 세션 수가 거의 같은 조건에서 GPT-5.5 xhigh와 GPT-5.6 Sol xhigh를 비교한 결과입니다.

항목GPT-5.5 xhighGPT-5.6 Sol xhigh
세션 수1,6671,715
총 토큰 수12.17B28.22B
세션당 토큰 수7.30M16.45M

세션 수는 2.9% 늘어나는 데 그쳤지만, 세션당 토큰은 125% 증가했습니다. 비슷한 작업량에서 전체 소비량은 121.7억 토큰에서 282.2억 토큰으로 뛰었고, 이는 2.32배 증가한 수치입니다.

GPT-5.5와 GPT-5.6 Sol의 세션당 토큰 사용량 비교

OpenAI 가격 페이지에 따르면 GPT-5.6 Sol의 가격은 입력 100만 토큰당 $5, 출력 100만 토큰당 $30으로 GPT-5.5와 같습니다. 같은 단가에서 토큰을 2.25배 사용하면 작업당 비용도 대략 2.25배가 됩니다. GPT-5.6 Sol에는 GPT-5.5에 없던 캐시 쓰기 추가 요금도 새로 도입됐습니다. 입력 단가의 1.25배입니다.

"GPT 5.6 Sol은 토큰을 태워 버리는 모델이다. medium이나 high의 Sol조차 토큰을 마구 먹는 듯하다. 5.6은 복잡한 계획 수립이나 까다로운 버그에만 쓰게 될 것이다." — r/codex 사용자

Schmalbach이 사용하던 세 개의 구독은 예전에는 고강도 작업을 일주일 동안 버텼지만, 이제는 중간 수준의 사용량에서도 약 하루 만에 소진됩니다.

Sol이 토큰을 더 많이 쓰는 이유

Sol은 벤치마크 점수당 효율만 보면 경쟁 모델보다 나은 편입니다. Artificial Analysis Coding Agent Index에서는 동등한 점수 기준으로 Claude Fable 5보다 출력 토큰을 적게 사용합니다. 하지만 실제 세션에서는 더 공격적으로 추론합니다. 계획을 세우고, 되돌아가며, 검증하고, 대안을 탐색합니다. 토큰 하나가 수행하는 유효 작업은 많아도, 작업 하나를 끝내는 데 드는 토큰 총량은 커지는 구조입니다.

출력 토큰을 부풀리는 것으로 보고된 과금 결함

실제 사용량 증가와 별개로, Responses API의 회계 결함 보고도 주목할 필요가 있습니다. 이 문제는 output_tokens 필드를 부풀리는 것으로 보이며, 과금은 이 값을 기준으로 계산됩니다. OpenAI는 조사 중이지만 근본 원인을 공개적으로 확인하지는 않았습니다.

한 개발자는 GPT-5.6 호출 710건과 전체 추론 호출 22,922건을 분석해 이 문제를 기록했습니다. GPT-5.6은 응답 하나에 여러 개의 reasoning 항목을 내보내는 첫 모델 계열입니다. Sol의 중앙값은 k=9, Terra는 k=4입니다. API의 누산기가 생성 과정에서 각 reasoning 항목마다 누적 추론 총량을 한 번씩 더하고, 마지막의 정상 집계값까지 더하는 방식이라는 설명입니다.

계산식은 다음과 같습니다.

output_tokens ≈ R × (k + 3) / 2

여기서 R은 실제 추론 토큰 수, k는 reasoning 항목 수입니다. Sol의 중앙값 k=9를 대입하면 청구 토큰 수는 약 6배로 부풀어 오릅니다. Terra는 k=4일 때 약 3.6배입니다.

실제 청구서에서 나타난 사례

문서화된 사례 중 가장 극단적인 경우는 네 글자짜리 답변 d1d4를 반환한 GPT-5.6 Terra 호출 한 건입니다. 실제 추론 토큰은 21,064개였지만, 출력 토큰 466,818개가 청구됐습니다.

API 보고 값수치
output_tokens (청구 기준)466,818
reasoning_tokens (실제)21,064
표시된 출력d1d4 (4글자)
Reasoning 항목 수 (k)41

k=41이면 계산식의 예측값은 R × (41+3)/2 = 21,064 × 22 = 463,408입니다. 청구 금액 기준 토큰 수와의 차이는 0.7% 이내입니다. 보고자는 청구 대시보드로도 이를 검증했습니다. API의 output_tokens를 합산하고 공개 단가를 적용하자, 대시보드 청구액이 0.1센트 단위까지 재현됐습니다. 해당 사용자의 GPT-5.6 호출 전체에서는 약 $320 청구액 중 약 $284가 과다 청구였습니다.

이 문제는 GPT-5.6 이전부터 있었다

k=1, 즉 GPT-5.6 이전 모델이 내보내던 단일 reasoning 항목 조건에서는 식이 R × 4/2 = 2R로 단순화됩니다. 일률적으로 2배 과다 청구되는 셈입니다. 보고자는 2026년 5월 OpenAI 자체 사용량 내보내기 데이터에서도 이를 확인했습니다.

모델청구된 출력 토큰실제 수치비율
o3-mini25,408,97312,376,1322.02x
gpt-5.4-nano11,718,6105,844,1402.00x
o1778,989335,9442.01x
o4-mini (대조군)12,054,6809,160,5671.01x

즉, 결함 자체는 GPT-5.6에서 새로 생긴 것이 아닙니다. GPT-5.6은 추론을 여러 항목으로 쪼개는 첫 모델이라, 눈에 잘 띄지 않던 2배 문제가 훨씬 큰 배수로 확대된 것입니다. 추론은 약 512토큰 단위로 출력되므로 k ≈ ceil(R/512)입니다. 이를 식에 대입하면 output_tokens ≈ R²/1024 + 3R/2가 됩니다. 추론 길이가 길어질수록 과다 청구는 제곱에 비례해 커진다는 뜻입니다. 생각하는 양이 두 배가 되면 청구액은 대략 네 배가 됩니다.

작성 시점인 2026년 8월 기준으로 OpenAI 직원은 버그 보고에 응답해 추가 데이터를 요청했습니다. 다만 수정이나 청구액 조정은 아직 공개적으로 확정되지 않았습니다.

7월 30일 인하 이후 GPT-5.6 가격표

2026년 7월 30일, OpenAI는 Luna 가격을 80%, Terra 가격을 20% 인하했습니다. Sol 가격은 변동이 없었습니다. OpenAI 가격 페이지 기준 현재 요금은 다음과 같습니다.

모델입력 (짧은 컨텍스트)캐시된 입력캐시 쓰기출력 (짧은 컨텍스트)출력 (긴 컨텍스트)
GPT-5.6 Sol$5.00$0.50$6.25$30.00$45.00
GPT-5.6 Terra$2.00$0.20$2.50$12.00$18.00
GPT-5.6 Luna$0.20$0.02$0.25$1.20$1.80
GPT-5.5$5.00$0.50—$30.00$45.00
GPT-5.6 제품군의 출력 가격 비교

Sol의 토큰당 가격은 GPT-5.5와 같다. 다만 작업당 토큰 사용량이 2.25배이므로, 실질적인 작업당 비용은 대략 두 배 이상으로 올라갑니다.

캐시 쓰기 비용이 새로 추가됐다. GPT-5.6은 캐시 쓰기에 입력 단가의 1.25배를 청구합니다. Sol 기준 100만 토큰당 $6.25입니다. GPT-5.5에는 캐시 쓰기 수수료가 없었습니다. 캐시 적중률이 낮은 워크로드라면, 기존에 없던 입력 비용의 25% 할증이 추가됩니다.

Luna는 이제 GPT-5.4 nano보다도 저렴하다. 인하 후 Luna는 $0.20/$1.20이며, nano의 $0.20/$1.25보다 낮습니다. OpenAI 라인업에서 가장 저렴한 모델입니다.

GPT-5.6 토큰 비용 줄이는 세 가지 방법

일상적인 작업은 Terra로 낮추기

Terra의 출력 단가는 100만 토큰당 $12로, Sol의 $30보다 60% 낮습니다. Artificial Analysis Coding Agent Index에서 Terra는 Claude Fable 5를 근소하게 앞섭니다. 7월의 20% 가격 인하 이후 Terra는 입력 $2.00, 출력 $12.00으로 이전 GPT-5.5 요금보다도 저렴해졌습니다.

그렇다면 Sol은 언제 쓸 만할까요? 여러 단계를 거치는 디버깅, 대규모 코드베이스 전반의 아키텍처 계획, 보안 분석 같은 작업입니다. 이런 업무는 긴 추론 체인의 이점이 큽니다. 일반적인 코딩, 분석, 콘텐츠 생성이라면 Terra가 토큰 소모의 일부만으로 비슷한 결과를 제공할 수 있습니다.

추론 노력 설정 낮추기

reasoning.effort 파라미터는 모델이 생성하는 추론 토큰 수를 제어합니다. 보고된 과금 결함도 reasoning 항목 수(k)에 정비례해 커집니다. Sol은 xhigh보다 medium에서 reasoning 항목을 적게 내보내므로, 청구 토큰 부풀림도 비례해 줄어듭니다.

"Terra Ultra를 쓰는데, 토큰 사용량은 오히려 GPT 5.5보다 훨씬 효율적인 것 같다." — r/codex 사용자

토큰을 과도하게 태우는 현상은 높은 노력 설정의 Sol에 집중됩니다. xhigh나 max 대신 reasoning.effort를 medium 또는 high로 설정하는 것이 가장 효과가 큰 단일 변경입니다.

캐시 적중률 최대화하기

GPT-5.6에는 명시적 캐시 브레이크포인트와 최소 30분의 캐시 유지 시간이 도입됐습니다. 캐시 읽기에는 90% 할인이 적용돼 Sol의 입력 비용은 100만 토큰당 $5.00에서 $0.50으로 떨어집니다. 반면 캐시 쓰기는 입력 단가의 1.25배이며, Sol 기준 100만 토큰당 $6.25입니다.

시스템 메시지와 고정 컨텍스트가 캐시 브레이크포인트 앞에 놓이도록 프롬프트를 구성하세요. 손익분기점은 워크로드마다 다릅니다. 캐시 쓰기 할증은 입력 단가의 25%지만, 캐시 읽기 절감폭은 90%이므로 읽기 절감액이 쓰기 할증을 넘는 적중률이 필요합니다. 대부분의 요청이 긴 시스템 프롬프트를 공유하는 워크로드라면 빠르게 이득 구간에 들어섭니다.

FAQ

OpenAI는 과금 결함을 인정했나?

OpenAI 직원 Mark G.는 2026년 7월 12일 커뮤니티 포럼의 보고 글에 답변하며 조사에 필요한 요청 ID와 타임스탬프를 요청했습니다. 2026년 8월 기준으로 수정이나 소급 청구 조정은 공개적으로 확인되지 않았습니다.

내 계정도 과금 결함의 영향을 받는지 어떻게 확인하나?

reasoning 항목이 여러 개인 응답이라면 usage.output_tokens_details.reasoning_tokens와 화면에 표시된 완료 토큰을 더해 보세요. usage.output_tokens가 그 합계보다 몇 퍼센트를 넘어 크게 높다면, 포럼 보고서에 기록된 누적 재합산 현상이 청구액에 영향을 주고 있을 가능성이 큽니다. OpenAI 대시보드에서 사용량 CSV를 내려받아 모델별로 확인하면 됩니다.

Sol에서 Terra로 바꿔야 할까?

대부분의 API 워크로드에서는 Terra가 더 저렴하면서 코딩 벤치마크에서도 경쟁력 있는 점수를 냅니다. Sol의 강점은 가장 어려운 작업에서 드러납니다. OpenAI 자체 벤치마크에서도 Sol은 긴 사고 시간이 특히 큰 가치를 내는 다단계 추론과 보안 연구에서 Terra를 가장 크게 앞섭니다.