2026년 7월 29일, Claude Opus 5와 GPT-5.6 Sol·Terra·Luna에 똑같은 네 가지 작업을 맡겼다. 총 16개의 응답은 모두 정답이었다. 적어도 이번의 작은 검증 세트에서는 정확도만으로 모델을 고를 근거가 없었다.
대신 비용에 직접 영향을 주는 두 가지 차이가 뚜렷했다. Opus 5는 Sol이 480개 출력 토큰을 청구한 작업들에서 1,642개를 청구했다. 또한 입력 토큰이 272,000개를 넘으면 GPT-5.6은 더 높은 요금표를 적용하는 반면, Claude Opus 5는 전체 1M 컨텍스트 윈도우에 동일한 요금을 적용한다. 입력 200K, 출력 20K 요청 기준으로 두 플래그십의 정가 차이는 7% 이내지만, 출력량이 늘어나거나 272K 경계를 넘으면 격차가 커진다. 결국 선택은 요청 형태와 모델의 작업 방식에 달려 있다.
네 모델에 동일한 네 가지 작업을 실행했다
각 모델에는 기계적으로 정답을 검증할 수 있는 네 가지 동일한 사용자 프롬프트를 제공했다. 버그가 있는 Python median 함수 수정, 고정 문자열의 문자 출현 횟수 세기, 3시 15분일 때 시계 바늘이 만드는 7.5도 각도 계산, 그리고 동작은 바꾸지 않은 채 의도적으로 난잡하게 작성한 JavaScript 함수 리팩터링이다. 코드 응답은 눈으로 훑어보는 대신 엣지 케이스를 포함해 직접 실행하며 검증했다.
네 모델은 모든 검사를 통과했다. Python 수정안은 모두 짝수 길이 리스트를 올바르게 처리했고, 문자 개수와 시계 각도에 대한 답도 전부 9와 7.5로 정확했다. 네 리팩터링 결과 역시 falsy 필드와 null 카테고리 필터를 포함한 동작 차이 테스트를 통과했다.
이 수치를 인용하기 전 세 가지 전제는 짚고 넘어가야 한다. 모델과 작업당 한 번만 실행한 스모크 테스트이지 벤치마크가 아니다. 호출에는 자체 시스템 프롬프트를 주입하는 게이트웨이를 사용했고, 요청별 입력 토큰이 35에서 4,415까지 크게 달라져 입력 토큰은 분석에서 완전히 제외했다. 또 두 벤더 모두 숨겨진 추론 토큰을 출력으로 과금한다. 따라서 여기서 말하는 ‘출력 토큰’은 화면에서 읽은 분량이 아니라 실제 청구되는 토큰이다.
동률 속에서도 질적인 차이는 하나 남았다. 네 결과 중 Opus 5의 리팩터링이 가장 좋았다. 원래 코드의 두 루프를 한 번의 순회로 합쳤고, 1.2 배수를 이름 붙인 상수로 추출했으며, 동작 보존을 위해 느슨한 동등 비교를 의도적으로 유지했다는 설명도 남겼다. Sol, Terra, Luna도 모두 정답이었지만 원래 구조를 더 충실히 따라간 두 루프 방식의 변환이었다.
정확도보다 토큰과 응답 시간이 갈랐다
16회 실행에서 정확도는 같았으므로, 실질적인 비교 기준은 각 답변에 든 비용이다. Opus 5는 네 작업을 합쳐 32.4초 만에 끝냈고 완료 토큰 1,642개가 청구됐다. Sol은 19.7초와 480개, Terra는 11.7초와 308개, Luna는 15.3초와 537개였다.
| 2026년 7월 29일 단일 실행 | 정답 | 출력 토큰 | 총 시간 | 출력 기준 비용 |
|---|---|---|---|---|
| Claude Opus 5 | 4/4 | 1,642 | 32.4초 | $0.0411 |
| GPT-5.6 Sol | 4/4 | 480 | 19.7초 | $0.0144 |
| GPT-5.6 Terra | 4/4 | 308 | 11.7초 | $0.0046 |
| GPT-5.6 Luna | 4/4 | 537 | 15.3초 | $0.0032 |
차이는 최종 답변 길이가 아니라 추론량에 있다. Opus 5는 최종 답변이 492바이트인 리팩터링에 1,308토큰을 청구했고, Sol이 7토큰으로 “7.5”라고 답한 문제에는 64토큰을 썼다. Anthropic 문서에 따르면 Opus 5 API의 기본 설정은 high effort다. 따라서 이는 고정된 모델 특성만이 아니라 기본 설정의 영향도 있다. 이번 측정은 최소 사용량이 아닌 기본 동작을 본 결과다.
커뮤니티 데이터도 비슷한 양상을 보인다. 7월 29일 이 쿼리에서 Google 첫 결과로 확인된 r/Anthropic의 차트 게시물은 코딩 점수에서 두 모델이 거의 비슷하지만, Opus는 더 오래 걸리고 훨씬 많은 토큰을 쓴다고 보여준다. 한 r/ClaudeCode 사용자는 이를 좀 더 직설적으로 표현했다.
GPT 5.6 Sol은 요청한 일을 바로 처리한다. Opus 5는 12권짜리 「전쟁과 평화」를 쓴 뒤에야 요청한 일을 처리한다.
다만 effort 설정에 따라 비용 구조는 달라질 수 있다. Artificial Analysis 데이터를 읽은 한 Hacker News 댓글 작성자는 high effort의 Opus 5가 지능 지수 실행당 약 $1.06, max 설정의 Sol이 $1.04 수준이었다고 지적했다. 두 모델 모두 강하게 추론하게 하면 비용은 거의 비슷해진다는 의미다.
GPT-5.6은 하나의 모델이 아니다: Sol, Terra, Luna
GPT-5.6은 단일 모델명이 아니다. OpenAI는 세 가지 SKU를 제공하며, 접미사 없는 gpt-5.6은 gpt-5.6-sol의 별칭으로 문서화돼 있다. 즉 세 모델 중 가장 비싼 Sol을 가리킨다. 설정에 gpt-5.6만 적으면 이 제품군의 최고 요금이 적용되므로, 비용을 비교하기 전에 확인할 부분이다.
OpenAI 모델 레퍼런스는 Sol을 “복잡한 전문 업무를 위한 프런티어 모델”, Terra를 “지능과 비용의 균형을 맞춘 티어”, Luna를 “비용 민감형 워크로드에 최적화된 모델”로 설명한다. 세 모델은 모두 1.05M 토큰 컨텍스트 윈도우, 최대 128K 출력, 2026년 2월 16일 지식 컷오프를 공유하며, none부터 max까지 여섯 가지 추론 강도를 선택할 수 있다.
| 사양, 2026년 7월 29일 확인 | Claude Opus 5 | GPT-5.6(세 모델 공통) |
|---|---|---|
| 컨텍스트 윈도우 | 1M 토큰 | 1.05M 토큰 |
| 최대 출력 | 128K(Batch API 베타에서는 300K) | 128K |
| 신뢰 가능한 지식 컷오프 | 2026년 5월 | 2026년 2월 16일 |
| 추론 제어 | 적응형 사고, effort 기본값은 high | none / low / medium / high / xhigh / max |
| API ID | claude-opus-5 | gpt-5.6-sol / -terra / -luna |
이 가운데 실제 선택에 큰 영향을 주는 항목은 두 가지다. Opus 5의 지식 컷오프는 2026년 5월로 GPT-5.6 제품군 전체보다 약 3개월 최신이다. 2026년 봄 출시 제품을 다루는 작업이라면 중요한 차이다. 추론 제어도 단순히 단계 수만 다른 것이 아니다. GPT-5.6은 none으로 추론을 완전히 끌 수 있지만, Opus 5는 사고 예산을 적응적으로 관리하고 그 위에 effort 수준을 제공한다.
가격 구조의 핵심: 1M 구간 정액과 272K 요금 경계
두 회사 모두 깔끔한 토큰당 요금을 공개한다. 입력이 272K 토큰 미만일 때 플래그십 간 가격 차이는 크지 않다. 입력 100만 토큰당 $5로 같고, 출력은 Opus 5가 $25, Sol이 $30이다. 캐시 입력 요금은 모두 $0.50이며, 배치 할인은 양쪽 모두 50%다. 이 요금으로 입력 200K, 출력 20K 요청을 계산하면 Opus 5는 $1.50, Sol은 $1.60이다.
| 100만 토큰당 정가, 2026년 7월 29일 | 입력 | 캐시 입력 | 출력 | 배치 |
|---|---|---|---|---|
| Claude Opus 5 | $5.00 | $0.50 | $25.00 | $2.50 / $12.50 |
| GPT-5.6 Sol | $5.00 | $0.50 | $30.00 | $2.50 / $15.00 |
| GPT-5.6 Terra | $2.50 | $0.25 | $15.00 | $1.25 / $7.50 |
| GPT-5.6 Luna | $1.00 | $0.10 | $6.00 | $0.50 / $3.00 |
구조적 차이는 입력 272K 토큰 지점에서 발생한다. OpenAI 가격 페이지는 GPT-5.6 전체 요금을 단문 컨텍스트와 장문 컨텍스트 열로 나눈다. 입력이 272K를 넘으면 입력 요금은 2배, 출력 요금은 1.5배가 되어 Sol은 각각 $10과 $45가 된다. 반대로 Anthropic 가격 문서는 “900k 토큰 요청도 9k 토큰 요청과 토큰당 동일한 요금으로 청구된다”고 명시한다.
출력을 각 구간에서 20K로 두고 달러 기준으로 계산하면, 입력 300K 요청은 Opus 5가 $2.00, Sol이 $3.90이다. 입력 500K에서는 $3.00 대 $5.90, 900K에서는 $5.00 대 $9.90이 된다. 이 경계를 넘으면 같은 요청 형태에서 Opus 5는 Sol의 약 절반 가격으로 작동한다.
다만 이 그래프에는 Anthropic의 완승으로 보기 어려운 한 가지 변수가 있다. 272K 이상에서 Terra의 두 배 입력 요금은 $5로 Opus 5와 같고, 장문 컨텍스트 출력 요금 $22.50은 Opus 5의 $25보다 낮다. 출력 20K 기준으로 Terra는 입력 300K, 500K, 700K, 900K 모두에서 요청당 정확히 5센트 저렴하다. 이 5센트 차이는 입력 크기가 아니라 출력량에 비례하며, 출력 100만 토큰당 차이는 $2.50이다.
예산 계획을 위한 세 가지 참고 사항도 있다. Anthropic은 Opus 5의 fast mode를 연구 프리뷰로 제공하며, 요금은 입력 $10·출력 $50이다. OpenAI는 단문 컨텍스트에 한해 표준 요금의 2배인 priority 티어를 판매한다. 미국 리전 데이터 레지던시는 양쪽 모두 약 10%를 추가한다. 또한 Anthropic의 자체 안내에 따르면 Claude의 현 토크나이저는 같은 텍스트에서도 4.7 이전 모델보다 약 30% 더 많은 토큰을 생성한다. 요금표를 곱하기 전에 대표 프롬프트 하나를 두 토크나이저에 직접 넣어보는 것이 가장 정직한 최종 확인법이다.
워크로드별 추천 모델
정확도가 동률이므로 라우팅은 요청 형태와 작업 스타일에 따라 결정된다. r/ClaudeCode의 개발자들은 Sol을 high effort로 설정해 리뷰어와 QA 에이전트로 활용한다. 꼼꼼하고 브라우저 사용 능력이 좋다는 이유다. 반면 r/codex에서는 대부분의 작업을 medium 추론의 저렴한 GPT 티어로 보내는 편이 비용 대비 성능이 가장 좋았다는 의견도 나온다.
| 요청 형태 | 추천 호출 | 이유 |
|---|---|---|
| 입력 272K 미만, 출력 비중이 큰 에이전트 루프 | Claude Opus 5 | 출력 $25 대 $30, 이번 테스트에서 가장 나은 리팩터링 판단 |
| 272K 미만, 지연 시간에 민감하거나 대량 처리 | GPT-5.6 Terra | 테스트를 통과한 모델 중 가장 빠르고 저렴함 |
| 입력 272K 초과 | Claude Opus 5 또는 Terra | Sol의 장문 컨텍스트 요금은 두 배가 되며, Terra는 Opus 5보다 5센트 저렴함 |
| 리뷰, QA, 브라우저 기반 검증 | GPT-5.6 Sol | 리뷰 깊이를 조절할 수 있는 여섯 단계 effort, 자체 QA 세트로 검증 필요 |
| 일회성 분류와 추출 | GPT-5.6 Luna | $1/$6 요금으로 네 가지 검사를 모두 통과 |
Sol이 QA 역할에 적합하다는 데 모두가 동의하는 것은 아니다. 한 r/codex 스레드는 Sol을 GPT-5.5보다 퇴보한 모델이라고 평가하는 한편, Opus 5는 계획당 더 많은 작업을 완료한다고 봤다. 기본값은 테스트 비용이 낮다. 네 모델 모두 AIReiter 카탈로그에 있으므로(Opus 5, Sol) 자체 작업을 나란히 재실행해 볼 수 있다.
이번 비교에서 기억할 숫자는 하나다. 입력 272,000토큰. 그 아래에서는 동작 특성, 지연 시간, 출력 요금 $5 차이를 기준으로 고르면 된다. 그 위에서는 Sol과 비교한 가격 논리는 Anthropic 쪽에 유리하다. 다만 Terra는 Opus 5보다 5센트 저렴하고, Luna는 둘보다 훨씬 낮은 가격대에 있다.
FAQ
gpt-5.6은 GPT-5.6 Sol과 같은 모델인가요?
그렇다. OpenAI 모델 레퍼런스는 접미사 없는 gpt-5.6을 gpt-5.6-sol로 해석되는 별칭으로 안내한다. 따라서 272K 입력 미만에서는 입력 100만 토큰당 $5, 출력 100만 토큰당 $30인 Sol 요금이 적용되며, 그 이상에서는 $10과 $45가 적용된다.
Claude Opus 5는 장문 컨텍스트 요청에 더 많은 요금을 부과하나요?
아니다. Anthropic은 일반 API에서 전체 1M 윈도우에 표준 요금을 적용하며, 900K 토큰 요청과 9K 토큰 요청의 토큰당 비용이 같다고 밝힌다. 프리미엄은 입력 $10, 출력 $50인 선택형 fast mode에만 적용된다.
Claude Opus 5와 GPT-5.6 중 어느 쪽이 더 저렴한가요?
티어에 따라 다르다. 입력 272K 미만에서는 Opus 5가 출력 100만 토큰당 Sol보다 $5 저렴하고, 나머지 요금은 동일하다. Terra와 Luna는 둘보다 훨씬 저렴하다. 272K를 넘으면 Opus 5는 요청당 Sol의 약 절반 수준이며, Terra는 Opus 5보다 근소하게 저렴하게 유지된다.
코딩에는 Claude Opus 5가 GPT-5.6보다 더 좋은가요?
2026년 7월 29일 실행에서는 두 모델 모두 수정, 계산, 리팩터링을 정확히 수행했다. 같은 날 이 쿼리로 Google 상단에 노출된 r/Anthropic 차트 게시물도 두 모델의 코딩 점수가 거의 비슷하다고 보여준다. Opus 5는 가장 좋은 리팩터링 판단을 보였지만, 기본 설정에서 Sol보다 3.4배 많은 출력 토큰을 청구했다. 따라서 코딩 모델 선택은 경제성과 응답의 장황함을 함께 고려할 문제다.
Opus 5와 GPT-5.6의 지식 컷오프는 언제인가요?
Anthropic은 Claude Opus 5의 신뢰 가능한 지식 컷오프를 2026년 5월로 제시한다. GPT-5.6 세 모델은 모두 2026년 2월 16일을 공유하며, 약 3개월 더 이르다.