이번 주 에이전트에 연결할 모델은 claude-opus-5일까, 아니면 gpt-5.6일까? 먼저 짚을 점이 있다. 후자는 단일 모델명이 아니라, 서로 다른 가격표를 쓰는 세 가지 SKU 가운데 하나를 가리키는 별칭이다.
결론부터 말하면 입력 토큰 272,000개 이하에서는 두 플래그십의 가격 차이가 7% 안팎에 그친다. 하지만 이 선을 넘으면 Claude Opus 5는 GPT-5.6 Sol의 약 절반 비용이다. 2026년 7월 24일, 네 모델에 동일한 4가지 검사를 돌리고 양사 문서를 기준으로 가격까지 대조했다.
Sol·Terra·Luna: 한 세대에서 나온 세 가지 크기
OpenAI는 2026년 7월 9일 세 모델을 함께 출시했다. 모델 레퍼런스에서는 Sol을 "이전 GPT-5 계열의 접미사 없는 티어", Terra를 "mini 모델 티어", Luna를 "nano 모델 티어"에 대응시킨다. 서로 다른 세대 세 개가 아니라, 한 세대의 SKU 세 개다.
gpt-5.6만 적은 문자열은 별칭이다. OpenAI 변경 로그는 이를 gpt-5.6-sol로 연결하므로, 설정에 gpt-5.6을 쓰면 이 제품군의 최고 요금이 적용된다.
| 변형 | 모델 ID | 대응 티어 | 입력 / 출력 1M당(≤272K) | 추론 등급 |
|---|---|---|---|---|
| Sol | gpt-5.6-sol (별칭 gpt-5.6) | 접미사 없음 | $5.00 / $30.00 | 최고 |
| Terra | gpt-5.6-terra | mini | $2.50 / $15.00 | 더 높음 |
| Luna | gpt-5.6-luna | nano | $1.00 / $6.00 | 높음 |
차이보다 공통점이 더 중요하다. 세 모델 페이지에 똑같이 명시된 사양은 다음과 같다.
- 컨텍스트 윈도우 1,050,000토큰, 최대 출력 128,000토큰
- 지식 컷오프 2026년 2월 16일
- 텍스트·이미지 입력, 텍스트 출력, 파인튜닝 미지원, 날짜가 붙은 스냅샷 없음
- 동일한 effort 단계와 동일한 "Fast" 속도 등급
문서상 차이는 가격과 추론 등급뿐이다. 각 티어의 페이지에는 모두 "Default" 태그가 붙어 있으므로, Terra 페이지에서 이를 봤다고 해서 Terra가 제품군 전체의 기본 모델이라는 뜻은 아니다.
반대편에서 Anthropic은 SKU 하나를 제공한다. Claude Opus 5는 2026년 7월 24일 claude-opus-5로 출시됐다. 날짜 접미사 없이 고정된 스냅샷이며, 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 책정됐다. 1M 윈도우는 기본값이면서 최대값이다.
코딩 테스트: 기계적 검사 4개, 모두 통과
모든 모델에 같은 사용자 프롬프트를 넣고, OpenAI 호환 게이트웨이 하나를 통해 통과 여부를 기계적으로 판별할 수 있는 네 가지 과제를 보냈다.
- 버그 수정: 제자리
sort()로 호출자 리스트를 변경하고 인덱스도 하나 어긋난kth_smallest고치기 - 엄격한 JSON: 고정된 키 순서, 일관된 개수와 체크섬 충족
- 추론: 7개 묶음과 12개 묶음만으로 만들 수 없는 가장 큰 합계 구하기. 프로베니우스 수로, 7×12−7−12 = 65
- 리팩터링: 함수 시그니처는 바꾸지 않고 검증 로직 추가하기
네 모델은 모두 4/4를 기록했다. sorted() 또는 복사본을 사용하고 인덱스를 k-1로 옮겼으며, 요구한 키 순서의 파싱 가능한 JSON을 반환했고, 답은 65였고, 리팩터링도 깔끔했다. 모델·과제 조합마다 한 번씩만 실행한 결과이지 벤치마크는 아니다. 이 정도 규모에서는 정답률이 모델을 가르지 못했다.
더 넓은 범위의 주장은 벤더가 제시한 수치에 의존하며, 독립적으로 재현한 것은 아니다. Anthropic 출시 자료는 최대 effort에서 Opus 5가 Fable 5의 CursorBench 3.2 최고 점수와 0.5% 이내 차이를 보이면서 과제당 비용은 절반이라고 설명한다. 이는 벤더가 직접 실행한 상대 수치다. OpenAI의 GPT-5.6 출시 페이지는 자동 요청에 403을 반환하므로, Sol의 코딩 점수는 이를 공개한 쪽의 자료로 봐야 한다.
| 서드파티 벤치마크 | Sol | Terra | Luna |
|---|---|---|---|
| Vellum, Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% |
| Artificial Analysis, Coding Agent Index | Codex 사용 시 80 | 77 | 75 |
실사용 평가는 점수표와 엇갈린다. 두 모델을 High effort로 비교한 한 개발자는 7월 24일 게시물에서 "GPT 5.6 Sol High is still better at coding than Claude Opus 5 High."라고 썼다.
Anthropic의 마이그레이션 가이드에는 실제로 반영할 만한 내용도 있다. Opus 5는 스스로 작업을 검증하므로, 기존 프롬프트 끝에 검증 단계를 덧붙이는 방식은 이제 과도한 검증을 유도한다. 그런 지시는 제거하는 편이 좋다.
지시 이행: 출력 형식에서 드러난 차이
두 과제는 사실상 지시 이행 테스트였다. JSON 과제는 items를 소문자 알파벳순으로 정렬하고 체크섬을 14로 맞추며 추가 키를 넣지 않아야 했다. 리팩터링 과제는 ValueError를 발생시키되 주석과 독스트링은 모두 없어야 했다. 모델은 작업 내용을 문서화하려다 이 조건을 자주 어긴다. 네 모델은 두 과제를 모두 통과했다.
다만 출력 형태는 갈렸다. Sol과 Luna는 답을 LaTex로 감싸 \boxed{65}를 반환했고, Opus 5와 Terra는 숫자만 반환했다. 마지막 정수를 추출하는 정규식이라면 어느 형식이든 처리할 수 있다. 반면 순수 숫자나 JSON 필드만 기대하는 파서는 실패한다. claude-opus-5에서 gpt-5.6으로 바꾸면서 다른 설정을 건드리지 않으면, 그대로 물려받는 것이 바로 이런 기본 출력 특성이다.
토큰 효율: Opus 5 1,182토큰, Sol 464토큰
아래 격차는 품질보다 두 가지 기본 설정의 영향으로 보는 편이 타당하다. Opus 5는 thinking이 켜진 상태로 제공되고 API와 Claude Code의 기본 effort도 high다. 별도 설정 없는 요청도 이미 추론 요청인 셈이다. GPT-5.6의 기본값은 medium이다.
네 과제에서 보인 완료 토큰 수와 공식 출력 요율 기준 비용이다. 조합마다 요청은 한 번, 재시도 없이 기본 설정으로 실행했다.
| 모델 | 출력 토큰 | 리팩터링 과제 | 출력 비용만 |
|---|---|---|---|
| Claude Opus 5 | 1,182 | 600 tok / 8.3s | $0.0296 |
| GPT-5.6 Sol | 464 | 321 tok / 12.0s | $0.0139 |
| GPT-5.6 Terra | 737 | 603 tok / 11.8s | $0.0111 |
| GPT-5.6 Luna | 612 | 380 tok / 8.7s | $0.0037 |
이 비용은 두 가지 한계를 감안해 읽어야 한다. 같은 사용자 프롬프트에도 게이트웨이가 보고한 GPT 모델의 프롬프트 토큰 수는 62~4,471개였고 Claude는 592~640개였다. 실제 전송된 요청이 동일하지 않았다는 뜻이다. 따라서 입력 비용 수치는 의미가 없으며, 이 격차의 원인도 깔끔하게 귀속할 수 없다.
OpenAI의 추론 가이드는 옵트인하지 않으면 추론 요약을 제공하지 않는다. GPT-5.6은 이렇게 숨겨진 토큰도 출력 토큰으로 과금하므로, GPT 세 모델의 비용은 실제 청구액보다 낮게 보인다. 여기서 비교 가능한 신호는 정답률이고, 토큰 수와 지연 시간은 방향성 정도로만 봐야 한다.
차트에는 같은 실행에서 얻은 Claude 측 기준선인 Opus 4.8과 Sonnet 5도 포함했다. 네 과제 합계 24.6초로 Opus 5가 여섯 모델 중 가장 느렸다. Sol은 20.3초, Terra는 22.7초, Luna는 18.4초였다. Opus 4.8은 thinking이 기본적으로 꺼져 있고 11.8초에 끝났다. 이 차이가 역량보다 설정의 영향으로 보이는 이유다.
Artificial Analysis는 출시 당일 Opus 5를 평가하면서 effort 설정을 설명한 글에서 다른 연구소 모델보다 더 넓은 토큰 사용 범위를 가진다고 했다. 요금표만 봐서는 알기 어려울 만큼 비용 조절 폭이 넓다는 의미다.
가격: 달러로 계산한 272K 경계
Claude Opus 5와 GPT-5.6의 가격 비교는 공개 문서의 한 문장으로 갈린다. 표면 요금만 보면 플래그십 간 차이는 반올림 오차처럼 작다. Opus 5는 100만 토큰당 $5/$25, Sol은 입력 $5·출력 $30이다. 따라서 Opus 5는 출력에서 17% 저렴하고 입력은 같다. 단, 이는 입력 272,000토큰까지의 이야기다.
GPT-5.6 세 모델의 페이지에는 모두 같은 문구가 있다. "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." 즉, 경계선 위 토큰에만 붙는 요금이 아니라 요청 전체에 적용된다. 272K를 단 한 토큰만 넘어도 Sol은 전체 호출에 $10/$45를 청구한다. 반면 Opus 5의 1M 윈도우는 처음부터 끝까지 $5/$25를 유지한다.
출력 토큰 20,000개를 쓰는 에이전트 요청 하나를 가정하고 입력량을 바꿔 보자. 가격은 OpenAI 공개 요율과 Anthropic 표준 요율을 사용했으며, 모두 2026년 7월 25일에 확인했다.
| 입력 토큰 | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|
| 200,000 | $1.50 | $1.60 | $0.80 |
| 400,000 | $2.50 | $4.90 | $2.45 |
| 900,000 | $5.00 | $9.90 | $4.95 |
경계 아래에서는 플래그십 간 차이가 7%다. 하지만 경계 위에서는 400K 입력 기준 Sol이 Opus 5의 1.96배, 900K에서는 1.98배다. 따라서 400K 형태의 요청을 100번 실행하면 $250 대 $490이 된다.
주목할 형태는 Terra다. 272K를 넘으면 입력 요율이 Opus 5와 같은 $5가 된다. 따라서 둘 사이의 전체 차이는 출력 100만 토큰당 $2.50뿐이다. 이 20k 출력 요청에서는 300K와 900K 모두 5센트 차이이며, 입력이 아니라 출력량에 따라 커진다. 이 경계는 균등 간격 축에서 보이는 완만한 기울기가 아니라 요금표의 이산적인 계단이다.
배치 요금, 토크나이저, 구매 경로
할인 티어에서도 이 400K 요청의 비율은 유지된다.
- Anthropic Batch API: Opus 5는 $2.50/$12.50이며, 요청 비용은 $1.25가 된다
- OpenAI Batch 및 Flex: 표준 요금에서 50% 할인되므로 Sol의 긴 컨텍스트 요율은 $5/$22.50, 같은 호출은 $2.45다
벤더가 다르면 토큰당 요율을 그대로 비교할 수 없다. Anthropic 가격 문서는 Opus 5를 포함한 Claude 4.7 이후 모델이 새 토크나이저를 사용하며, 같은 텍스트에서 토큰이 약 30% 더 많이 나올 수 있다고 설명한다. 비율은 콘텐츠와 언어에 따라 달라진다. GPT-5.6 기준 400,000토큰인 문서는 Opus 5에서 약 520,000토큰이 될 수 있어, 해당 행의 입력 비용은 $2.00에서 $2.60으로 올라간다. 그래도 Sol의 $4.00보다는 낮지만, 도입 전에 실제 프롬프트를 직접 토큰화해야 한다.
어디서 구매하느냐도 중요하다. AIReiter는 Claude를 정가보다 낮게 재판매하며, Opus 4.8은 입력/출력 100만 토큰당 $1.56/$7.76으로 공식 요금보다 약 69% 낮다. 다만 카탈로그는 Fable 5와 Opus 4.8까지라 Opus 5는 아직 호출할 수 없다. Anthropic 자체 라인업에서는 Fable 5 $10/$50와 Opus 5 $5/$25의 비교가 손익분기 판단의 핵심이다.
컨텍스트: 둘 다 1M이지만, 정액 적용 방식은 다르다
Opus 5의 윈도우는 1,000,000토큰이다. 기본값과 최대값이 같아서 실수로 더 작은 컨텍스트 변형을 고를 일이 없다. GPT-5.6 세 변형은 모두 1,050,000토큰으로 5% 더 크다. 최대 출력은 양쪽 모두 128,000토큰이지만, Anthropic Batch API에서는 output-300k-2026-03-24 베타 헤더를 사용하면 Opus 5의 한도가 300,000토큰으로 올라간다.
Sol은 900K 토큰 프롬프트를 받아들이지만, 요청 전체에 긴 컨텍스트 요율을 적용한다. 광고한 윈도우의 약 74%가 저렴한 요율 바깥에 있는 셈이다. 긴 입력에서의 성능은 별개 문제다. Vellum 분석에 따르면 MRCR에서 Luna는 41.3%, Sol은 91.5%, Terra는 89.6%를 기록했다. 비용과 무관하게 nano 티어를 긴 컨텍스트 작업에서 제외할 이유다. 또한 Anthropic은 Opus 5의 지식 컷오프를 2026년 5월로 제시하는 반면, GPT-5.6 세 모델 페이지는 모두 2026년 2월 16일이라고 적고 있다.
추론 제어: 같은 단계표, 다른 제어 방식
Opus 5는 어떤 effort 수준에서도 베타 헤더가 필요 없으며, thinking이 기본 활성화돼 있다. 끄는 데에는 명확한 제한이 있다. thinking: {"type": "disabled"}는 effort가 high 이하일 때만 허용된다. xhigh나 max에서는 400을 반환하며, Anthropic은 이를 이전 모델에서의 호환성을 깨는 변경으로 표시한다.
| 제어 항목 | Claude Opus 5 | GPT-5.6 |
|---|---|---|
| effort 단계 | low → medium → high → xhigh → max | none → low → medium → high → xhigh → max |
| 기본 effort | API와 Claude Code에서 high | medium |
| 두 번째 제어값 | 없음 | reasoning.mode: standard (기본) 또는 pro |
| 추론 끄기 | high effort 초과에서는 불가 | effort: none |
OpenAI의 추론 가이드가 문서화한 mode 값은 이 두 개뿐이다. API에는 ultra 값이 없으며 Pro mode의 작동 방식도 설명되지 않는다. 7월 9일 변경 로그는 이 제품군과 함께 persisted reasoning, max effort, Pro mode가 추가됐다고 밝힌다.
실무상 비대칭은 이렇다. GPT-5.6은 지연 시간이 중요한 호출에서 추론을 완전히 끌 수 있지만, Opus 5는 high보다 높은 effort에서 그렇게 할 수 없다. 반대로 Opus 5는 추론 안에서 더 넓은 동적 범위를 제공한다. 두 제품군을 추적한 한 개발자는 공통 단계표를 이렇게 정리했다. Luna high, Sol medium, 그다음 Opus medium·high·xhigh다.
지원 환경, 레이트 리밋, 파인튜닝
Opus 5는 Claude API, Amazon Bedrock의 anthropic.claude-opus-5, Google Cloud, Microsoft Foundry, claude.ai, Claude Code, Claude Cowork에서 호출할 수 있으며 Claude Max의 새 기본값이다. 약 2.5배 처리량을 제공하는 Anthropic fast mode는 $10/$50이며 Claude API에서만 쓸 수 있다.
GPT-5.6 세 변형은 모두 OpenAI API 제품이며, 무료 API 티어에서는 Sol과 Terra를 제공하지 않는다. 문서상 Sol의 한도는 Tier 1의 500 RPM에서 Tier 5의 15,000 RPM까지 올라가며 Terra도 같은 상한을 공유한다. 세 모델 모두 파인튜닝을 지원하지 않고 날짜가 붙은 스냅샷도 제공하지 않는다. 따라서 버전을 고정한다는 것은 일반 ID를 고정한 채 인플레이스 업데이트를 받아들이는 일이다.
어떤 작업에 어떤 모델을 쓸까
가장 먼저 볼 것은 입력 크기다. 공개된 불연속 구간이 있는 유일한 축이기 때문이다. 이후 캐싱, 배치 적용 가능 여부, 출력량이 총비용을 바꾼다.
272K 미만에서는 플래그십 가격이 충분히 비슷하므로 다른 조건으로 고르면 된다. 반면 그 이상에서는 정가 기준으로 Opus 5가 Sol보다 약 2배 유리하다. 다만 이 이점이 GPT-5.6 제품군 전체에 적용되는 것은 아니다. 경계 위에서 Terra는 같은 요청에 $2.45, Opus 5는 $2.50이므로 긴 컨텍스트 절감은 Sol과의 비교이지 GPT-5.6 전체와의 비교가 아니다.
- Claude Opus 5: 큰 프롬프트, 1M 윈도우 전체에 걸친 단일 요금, 2026년 5월까지의 지식, 또는 Bedrock·Google Cloud·Foundry에서 실행해야 하는 추론에 적합하다.
- GPT-5.6 Terra: 구간 양쪽에서 Opus 5보다 저렴하므로, 대량 처리의 기본 선택지다.
- GPT-5.6 Sol: 필요한 것이
promode나noneeffort일 때 선택할 모델이다. 측정 가능한 정답률 우위가 아니라 제어 기능이 프리미엄의 근거다. - GPT-5.6 Luna: 얕고 대량인 작업용이며, 긴 컨텍스트 작업에서는 제외하는 편이 좋다.
Claude Opus 5와 GPT-5.6의 선택은 입력 크기 구간별 결정으로 정리된다. 두 벤더 모두 그 경계가 어디인지 공개하고 있다.
FAQ
코딩에는 Claude Opus 5가 GPT-5.6보다 더 좋은가?
기계적으로 판별 가능한 네 과제에서는 Opus 5, Sol, Terra, Luna가 모두 4/4를 기록했다. 이 규모에서는 정답률로 구분되지 않았고, High effort에서 두 모델을 함께 써 본 개발자들의 의견도 갈린다. 비용은 더 명확하다. 입력 토큰 272K를 넘으면 Opus 5는 Sol의 약 절반 비용이다.
GPT-5.6 Sol, Terra, Luna의 차이는 무엇인가?
가격과 정성적 추론 등급이다. OpenAI 문서는 Sol을 기존 접미사 없는 티어, Terra를 mini, Luna를 nano에 매핑한다. 입력 272K 이하에서 100만 토큰당 요금은 각각 $5/$30, $2.50/$15, $1/$6이다. 컨텍스트 윈도우, 최대 출력, 지식 컷오프, 입출력 모달리티, effort 단계는 세 모델 모두 같다.
GPT와 Claude 중 어느 AI가 더 좋은가?
축에 따라 답이 갈린다. 그리고 양사가 전면에 내세우지 않는 항목에서 가장 큰 공개 격차가 나타난다. benchlm.ai는 AA-Omniscience 환각률을 Claude Opus 4.8 35.9%, GPT-5.6 Sol 88.8%로 기록하는 한편, 수학·지식·에이전트 범주에서는 Sol을 앞세운다. 이는 현재 공개된 비교 중 가장 가까운 조합이며, 아직 어떤 집계 사이트도 Opus 5나 Terra 데이터를 싣지 않았다. 틀린 답의 비용이 답을 놓치는 비용보다 크다면, 이 순위가 어떤 코딩 점수보다 중요하다.
Sol 대신 GPT-5.6 Terra를 써야 할까?
대부분의 물량 처리에는 그렇다. r/codex에서 작업 난이도에 따라 라우팅한 실무자들은 작업의 약 75%를 Terra, 15%를 Luna, 10%를 Sol에 배정하게 됐다고 말한다. Artificial Analysis는 중간 티어가 지배당할 수 있다고 본다. Luna나 Sol의 일부 설정이 같거나 더 낮은 비용으로 이를 대체하는 경우가 있기 때문이다. 중간 티어가 안전한 선택이라고 가정하기 전에 양쪽 이웃 모델과 Terra를 비교해 봐야 한다.
GPT-5.6에 ultra 추론 모드가 있나?
API는 reasoning.mode에 문서화된 두 값, standard와 pro를 제공하며, reasoning.effort는 none부터 max까지 설정할 수 있다. Pro mode는 2026년 7월 9일 변경 로그에 추가됐다. OpenAI의 추론 가이드와 모델 페이지 어디에도 ultra 값은 없다.
