AIREITER

GPT-5.6 Sol vs GPT-5.5: 가격표는 같지만 실제 청구액은 다르다 (테스트)

마지막 업데이트: 2026-07-29 12:49:11

r/codex에서 반복해서 나오는 질문이 있다. “GPT-5.5 extra-high를 쓰고 있었는데, Sol과 Terra 중 어느 쪽이 대응 모델인가요?” 결론부터 말하면 GPT-5.6 Sol의 API 정가는 GPT-5.5와 정확히 같고 에이전트 벤치마크에서는 더 앞선다. 오래 실행되는 에이전트 작업이나 브라우징 업무라면 업그레이드 비용은 사실상 거의 들지 않는다.

다만 ‘가격이 같다’는 말만으로는 부족하다. Sol에는 GPT-5.5에 없던 캐시 쓰기 비용이 있고, 더 오래 생각하는 만큼 작업당 지출도 커질 수 있다. 요금표는 그대로여도 실제 청구액은 몇 배가 될 수 있다.

정가는 같아도 실제 비용은 달라진다

GPT-5.6 Sol과 GPT-5.5의 기본 API 가격은 동일하다. 입력 토큰 100만 개당 $5.00, 출력 토큰 100만 개당 $30.00, 캐시된 입력은 $0.50이다. 2026년 7월 29일 OpenAI 가격 페이지에서 두 항목을 직접 확인했다.

gpt-5.6-sol과 gpt-5.5가 입력 $5, 출력 $30으로 동일하게 표시된 OpenAI API 가격표

하지만 표의 세 항목에서 두 모델의 차이가 드러난다.

항목GPT-5.6 SolGPT-5.5
입력 / 출력(토큰 100만 개당)$5.00 / $30.00$5.00 / $30.00
캐시된 입력$0.50$0.50
캐시 쓰기$6.25과금 없음
긴 컨텍스트(>272K) 입력 / 출력$10.00 / $45.00$10.00 / $45.00

마이그레이션에서 가장 체감되는 항목은 캐시 쓰기다. GPT-5.6은 최소 30분 유지되는 명시적 캐시 브레이크포인트를 도입했다(작동 방식은 Vellum의 분석에 잘 정리돼 있다). 캐시를 쓸 때는 캐시되지 않은 입력 요금의 1.25배를 내지만, 읽기는 90% 할인된다. 위 표 기준으로 캐시 세그먼트는 쓰기 비용 $6.25에 읽기당 $0.50이 든다. 캐시 없이 매번 다시 보내면 $5.00이다. 따라서 두 번째 재사용부터 캐싱이 이득이지만, 읽는 횟수보다 쓰는 횟수가 많은 파이프라인이라면 GPT-5.5에는 없던 비용이 생긴다.

두 번째 비용은 시간, 정확히는 추론 시간에 따라 달라진다. Sol은 답을 내기 전에 더 길게 추론하며, 추론 토큰도 출력 토큰으로 과금된다. Codex로 이전한 사용자들은 이 차이를 직접 보고했다.

“5.6 sol médium은 5.5-xhigh보다 세 배 비싸지만, 코드 품질은 같다(적어도 5.5 출시 시점 기준으로).” — r/codex, “GPT 5.5 and 5.6 conversion table”

요금표는 같아도, 답에 도달하기까지 세 배 많은 토큰을 쓰면 작업당 비용도 세 배가 된다. 반면 OpenAI의 GPT-5.6 발표는 내부 비교에서 GPT-5.5보다 입력 토큰은 22%, 출력 토큰은 23% 적게 썼다고 밝힌다. 두 주장 모두 성립할 수 있다. 추론 단위당 효율은 좋아졌지만, 높은 effort 설정에서는 훨씬 오래 생각할 수 있기 때문이다. 결국 체감 비용은 선택한 effort 수준에 달려 있다.

스펙과 벤치마크에서 달라진 점

독립 평가에서 GPT-5.6 Sol과 GPT-5.5의 순수 지능 점수 차이는 크지 않다. Artificial Analysis의 Intelligence Index v4.1에서는 Sol(medium)이 54점, GPT-5.5(high)가 53점이며, 혼합 비용도 토큰 100만 개당 동일하게 $4.35다. 눈에 띄는 개선점은 다른 곳에 있다.

  • 첫 토큰 응답 지연: Sol은 4.13초, GPT-5.5(high)는 16.67초다. 약 4배 차이다. 대화형 도구나 수십 번의 순차 호출을 수행하는 에이전트 루프에서는 일상적으로 가장 크게 느껴질 개선이다.
  • 에이전트 벤치마크: Sol은 Terminal-Bench 2.1에서 88.8%, BrowseComp에서 92.2%를 기록했다. 이번 릴리스의 가장 큰 향상은 장기 도구 사용 작업에 집중돼 있다.
  • 컨텍스트: Sol은 1M 토큰으로 GPT-5.5의 922K보다 길다. 또한 앞서 링크한 Vellum 분석에 따르면 대화 턴 사이에도 추론이 유지된다.
  • 출력 속도: 유일한 후퇴다. Sol은 초당 65토큰으로 스트리밍하며, GPT-5.5의 77.3토큰보다 느리다. 대량 생성 작업은 빨라지는 것이 아니라 느려진다.

CodeRabbit의 장기 코딩 스위트는 5개 언어, 100개 이상의 작업에서 Sol의 통과율을 63.7%로 기록했다. 코드 리뷰 벤치마크에서는 기본 통합 대비 7.4%포인트 높은 성과를 냈다. 다만 Sol의 리뷰 정밀도는 31.6%였다. 실제 문제를 더 많이 찾아내지만, 그만큼 잡음도 늘어난다는 뜻이다. 같은 테스터들은 단순한 변경 작업에서 Sol이 잘못된 경로에 빠진 뒤 8라운드를 소비한 사례도 기록했다. 마라톤 작업에 강하다고 해서 막다른 길에 빠지지 않는 것은 아니다.

같은 프롬프트 세 개로 직접 비교했다

벤치마크는 장기 작업에 유리하지만, 대부분의 API 호출은 짧다. 그래서 2026년 7월 29일 gpt-5.6-sol과 gpt-5.5에 같은 세 가지 프롬프트를 보냈다. Python 날짜 처리 버그 수정, 유효한 답이 정확히 두 개인 제약 논리 퍼즐, 그리고 함정이 있는 엄격한 JSON 추출이다. 마지막 작업에는 연도가 없는 날짜가 포함됐고, 규칙상 추측하지 말고 null로 처리해야 했다. 각 작업은 API를 한 번만 호출했고 기본 reasoning effort를 사용했으며, 도구 사용과 재시도는 하지 않았다. 표본이 작은 테스트이지 벤치마크는 아니다.

두 모델 모두 세 문제를 전부 맞혔다. GPT-5.5는 calendar.monthrange로 12월 크래시 버그를 고쳤고, Sol은 올바른 윤년 표를 직접 구현했다. 둘 다 유효한 배포 순서 두 가지를 정확히 찾았고, 추출 작업에서는 바이트 단위까지 동일한 JSON을 반환했다. “the 14th of July”에 연도를 멋대로 넣지도 않았다.

토큰 사용량과 속도에서는 차이가 났다.

작업별 완료 토큰 수: GPT-5.6 Sol은 625/143/96토큰, GPT-5.5는 513/334/160토큰 사용 작업별 종단 간 지연 시간: Sol은 19.8초/5.6초/5.7초, GPT-5.5는 13.8초/9.3초/5.5초

Sol의 전체 완료 토큰 수는 864개로 GPT-5.5의 1,007개보다 적었다. 다만 코드 작업에서는 더 느리고 말이 많았다. Sol은 19.8초에 625토큰을 썼고, GPT-5.5는 13.8초에 513토큰을 썼다. 논리 퍼즐에서는 반대였다. Sol은 143토큰으로 5.6초 만에 답했고, GPT-5.5는 334토큰과 9.3초가 걸렸다. 두 모델을 지켜본 뒤의 판단은 이렇다. 짧고 요구사항이 명확한 작업에서는 사실상 대체 가능하며, 이 테스트만으로 마이그레이션을 정당화할 근거는 없다. 업그레이드의 이유는 전적으로 앞서 살펴본 에이전트 및 긴 컨텍스트 작업의 성과에 있다.

GPT-5.5 effort를 5.6에서 어떻게 맞출까

앞서 링크한 Vellum 분석에 따르면, 별칭인 gpt-5.6 모델 ID는 기본적으로 gpt-5.6-sol로 연결된다. 별칭만 바꿔 업그레이드하면 티어를 따로 고르지 않아도 플래그십 모델과 그에 따른 비용을 쓰게 된다. 의도적으로 이전하려면 다음 세 가지를 기준점으로 삼을 만하다.

  1. GPT-5.5 xhigh → Sol medium: 커뮤니티에서 통용되는 대응 관계다. 앞서 인용한 r/codex 보고서는 5.5와 비슷한 품질에서 출시 무렵 작업당 비용이 약 3배라고 측정했다. 보장된 등식이 아니라, 자신의 프롬프트에서 검증할 출발 가설로 봐야 한다. 비용에 민감한 워크로드가 5.5 high를 사용했다면 Sol 정가의 절반인 $2.50/$15의 GPT-5.6 Terra가 더 가깝다.
  2. 최상위 설정에서는 추론 시간이 크게 늘어난다. ChatGPT Pro 사용자 보고에 따르면 GPT-5.6은 5.5 Pro가 5~10분 쓰던 작업에 20~50분을 쓰기도 한다. 이는 ChatGPT에서의 관찰이지만, 동일한 추론 스택은 API에서도 출력 토큰으로 과금된다. reasoning.mode: "pro" 설정은 세 가지 5.6 티어 모두에서 사용할 수 있으므로, 최고 수준의 추론은 선택 사항이다.
  3. 기존 프롬프트가 새 모델의 발목을 잡을 수 있다. Every.to의 테스트 팀은 구형 모델을 위해 작성했던 방어적 지시문을 삭제한 뒤에야 Sol의 출력이 크게 좋아졌다고 밝혔다. “항상 X를 재확인하라” 같은 규칙은 Sol이 지나치게 검증하고 과도하게 구현하게 만들었다. 모델만 옮기지 말고 시스템 프롬프트도 다시 점검해야 한다. GPT-5.5에 필요했던 과도한 안전장치는 이제 비용이 될 수 있다.

Sol로 옮겨야 할 경우와 GPT-5.5에 남을 경우

다단계 도구 사용, 브라우징 리서치, 저장소 규모의 코딩 세션처럼 에이전트형 워크로드라면 GPT-5.6 Sol로 옮기는 편이 좋다. Terminal-Bench 88.8%, BrowseComp 92.2%라는 성과가 나온 영역이며, 첫 토큰 지연 시간이 4배 줄어드는 효과는 루프를 돌 때마다 누적된다. $5/$30으로 같은 요금표에서 성능이 올라가니, 추가 추론 토큰과 캐시 쓰기 비용이 그 차익을 먹어치우지 않는다면 기능 향상에 별도 비용은 없다. 1M 컨텍스트와 턴 간 추론 유지 덕분에 5.5 파이프라인이 별도로 만들던 두 가지 우회책도 사라진다.

짧고 요구사항이 명확한 호출, 즉 추출·분류·단발성 코드 수정·대량 생성이 주된 트래픽이라면 당분간 GPT-5.5에 남는 편이 낫다. 세 프롬프트 테스트에서 바로 이 유형의 작업은 동률이었고, Sol의 느린 스트리밍 속도(65 vs 77.3토큰/초)는 대량 작업에 명백한 단점이다. 캐시 쓰기가 많은 파이프라인은 이전 전에 $6.25 항목부터 계산해야 한다. 비슷한 품질에서 비용을 낮추는 것이 목적이라면 답은 Sol이 아니라 Terra다.

이번 비교 테스트는 AIReiter에서 진행했다. 하나의 API 키로 gpt-5.6-sol과 gpt-5.5를 모두 사용할 수 있어, 모델 문자열만 바꾸면 A/B 테스트를 할 수 있다. 실제 트래픽에서 작업 성공률, 종단 간 지연 시간, 작업당 완료 토큰을 비교해 보면 된다.

FAQ

GPT-5.6 Sol이 GPT-5.5보다 더 좋은가?

에이전트 작업에서는 분명히 그렇다. Terminal-Bench 2.1 88.8%, BrowseComp 92.2%, 그리고 첫 토큰 지연 시간은 4배 낮다. 반면 짧은 단발성 작업에서는 독립 평가 점수가 54 대 53으로 1점 차이에 불과하며, 동일 프롬프트 테스트에서도 정확도 차이는 없었다.

GPT-5.6 Sol은 GPT-5.5보다 비싼가?

정가는 동일하다. 토큰 100만 개당 입력 $5, 출력 $30이다. 다만 Sol에는 GPT-5.5에 없던 $6.25의 캐시 쓰기 비용이 추가되며, 높은 effort 설정에서는 작업당 추론 토큰도 더 많이 쓴다. r/codex 사용자들은 5.5 xhigh와 비슷한 품질에서 작업당 비용이 약 3배라고 측정했다.

GPT-5.5 xhigh에 대응하는 GPT-5.6 설정은 무엇인가?

medium effort의 Sol이 비슷한 코드 품질을 제공하지만, 작업당 비용은 약 세 배다. 성능 상한보다 비용 동등성이 중요하다면 Terra가 경제적으로 더 가까운 선택지다.

업그레이드 후에도 GPT-5.5를 계속 사용할 수 있나?

그렇다. GPT-5.5는 OpenAI 가격 페이지에 여전히 같은 요금으로 표시돼 있다. 2026년 7월 29일 확인했으며, 위 스크린샷에서도 볼 수 있다. 아직 마이그레이션을 강제하는 요소는 없다.

한 표로 보는 선택 기준

워크로드추천 모델판단 근거
다단계 에이전트, 브라우징, 저장소 규모 코딩GPT-5.6 SolTerminal-Bench 88.8%, 첫 토큰 지연 4배 감소, 같은 요금표
짧은 추출 / 분류 / 단발성 수정GPT-5.5 (당분간)동일 프롬프트 테스트에서 동률, 5.5의 스트리밍 속도가 19% 더 빠름
프롬프트 캐시 쓰기가 많음GPT-5.5 또는 먼저 아키텍처 재설계Sol에는 새로 $6.25/1M 캐시 쓰기 비용이 붙음
같은 품질에 더 낮은 비용GPT-5.6 Terra$2.50/$15로 Sol 가격의 절반, 위의 Terra vs 5.5 비교 참고
최대 수준의 추론 깊이reasoning.mode: "pro"의 Sol5.5가 5~10분 쓰던 작업에서 20~50분 추론