Claude Opus 5 vs Opus 4.8: 전환 시 달라지는 점과 깨지는 부분

마지막 업데이트: 2026-07-25 05:18:35

같은 프롬프트로 작은 코딩·추론 작업 4개를 각각 한 번씩 돌렸다. 두 모델 모두 네 작업을 전부 맞혔다. 하지만 Opus 5의 출력 토큰은 81, 94, 407, 600개였고, Opus 4.8은 36, 35, 103, 206개에 그쳤다. 출력 토큰 100만 개당 $25라는 가격은 같은데도 말이다. Claude Opus 5 vs Opus 4.8 마이그레이션의 핵심은 여기 있다. 모델 문자열 변경은 한 줄이지만, 청구서와 모델의 동작은 한 줄로 끝나지 않는다.

원인은 성능 차이로 단정할 수 없다. Opus 5는 thinking이 기본으로 켜져 있고, 4.8에서는 기본적으로 꺼져 있었다. 즉, 똑같은 요청이라도 이전에는 내지 않던 추론 비용을 이제는 낼 수 있다. 비용을 움직이는 핵심 설정도 모델 선택 자체가 아니라 effort다. 이미 운영 환경에서 claude-opus-4-8을 쓰고 있다면, 요약은 다음과 같다.

  • 명확한 API 호환성 문제는 하나다. thinking: {"type": "disabled"}xhigh 또는 max effort를 함께 보내면 Opus 5는 400을 반환한다. Opus 4.8에서는 이 조합이 허용된다.
  • 가격 자체는 변수가 아니다. 두 모델 모두 입력 100만 토큰당 $5, 출력 100만 토큰당 $25이므로 지출은 오직 토큰 사용량에 따라 달라진다.
  • thinking은 기본 활성화다. max_tokens는 여전히 thinking과 화면에 보이는 응답을 합친 전체 출력의 상한이다. 4.8 기준으로 잡아 둔 한도라면 이제 답변이 중간에 잘릴 수 있다.
  • 코드보다 프롬프트가 더 큰 위험 요인일 수 있다. 4.8에 결과를 재검토하라고 지시하던 프롬프트는 Opus 5에서 과도한 검증을 유발할 수 있다.
  • 어느 모델도 아직 deprecated 상태가 아니다. 둘 다 Active로 표시된다. 다음 릴리스 주기까지 4.8을 유지하는 선택도 충분히 타당하다.
단일 실행 기준 작업별 출력 토큰을 비교한 그룹 막대 차트. 버그 수정, 엄격한 JSON, 추론, 리팩터링 작업에서 Claude Opus 5는 각각 81, 94, 407, 600토큰, Claude Opus 4.8은 36, 35, 103, 206토큰을 사용했다

모델 ID만 바꿨을 때 실제로 점검할 것

Anthropic의 마이그레이션 가이드는 Opus 5를 “동일한 가격의 Claude Opus 4.8 드롭인 업그레이드”라고 설명한다. API 표면도 거의 달라지지 않았다. claude-opus-5는 날짜 접미사가 없는 고정 모델 ID이며, claude-opus-4-8과 같은 방식으로 쓴다. 그래도 운영 라우트 전환 전에는 다음 다섯 가지를 확인해야 한다.

1. thinking: {"type": "disabled"}xhigh 또는 max effort를 함께 쓰면 400이 반환된다. 공식 동작 변경 문서는 이를 4.8 대비 호환성 변경으로 명시한다. 4.8에서는 thinking 비활성화 여부와 effort가 독립적이었다. 검증은 요청마다 수행되므로, 이전 대화 턴이 통과했더라도 대화 중간에 effort를 올리면 거절된다. 2. max_tokens에는 이제 thinking 분량까지 포함해야 한다. 이 값은 thinking과 최종 응답을 합친 전체 출력의 하드 리밋이다. 따라서 4.8에서 thinking을 끈 채 max_tokens: 4096으로 동작하던 작업은, 같은 한도 안에서 추론 토큰까지 소비하게 된다. Anthropic은 xhighmax에서는 64k부터 시작할 것을 권한다. 3. 검증 지시는 역효과를 낼 수 있다. Opus 5는 별도 지시가 없어도 스스로 결과를 검토한다. 프롬프팅 가이드에 따르면 “마지막 검증 단계를 포함하라” 같은 지시는 과도한 검증을 일으키며, 이를 제거하면 “품질 저하 없이 낭비되는 토큰을 줄일 수 있다.” 얼리 액세스 사용자 Allie K. Miller도 effort 측면에서 비슷한 경험을 공유했다. “평소 'high' 추론 effort를 기본으로 쓰는데… medium으로 낮춰야 했다.” 4. 스킬과 에이전트 스캐폴딩은 API 오류 없이 달라질 수 있다. Anthropic은 Opus 5가 “기존 Claude Opus 4.8 프롬프트에서 별도 조정 없이도 잘 동작한다”고 말한다. 하지만 다른 사례도 있다. Every의 Dan Shipper는 출시 당일 “하위 호환성을 깨뜨린다… 종종 너무 일찍 멈추거나 지시를 놓친다”며 스킬을 처음부터 다시 만들었다고 썼다. 한 팀의 경험일 뿐이지만, 평가를 다시 돌려야 할 이유로는 충분하다. 로그에 경고가 남지 않기 때문이다. 5. Anthropic은 Opus 5의 지식 컷오프를 2026년 5월로 명시했다. 4.8은 2026년 1월이다. 시스템 프롬프트에 “지식은 2026년 1월에 끝나며, 검색된 컨텍스트를 우선하라”라고 고정해 두었다면 이제 잘못된 모델 설명이 된다. 그 문자열을 기준으로 한 날짜 계산도 함께 달라진다.

첫 번째 항목에는 한 가지 함정이 있다. thinking을 껐을 때 Opus 5는 가끔 tool_use 블록 대신 눈에 보이는 텍스트에 도구 호출을 작성하거나, 내부 XML 태그를 노출할 수 있다. 에이전트 루프에서는 그 텍스트가 대화 이력에 남아 이후 턴까지 오염시킨다. Anthropic의 완화책은 thinking을 켠 상태로 유지하고, 비용 제어에는 낮은 effort를 쓰는 것이다.

공식 Claude Platform Docs의 What's new in Claude Opus 5 페이지 스크린샷. Behavior changes 섹션에서 Thinking on by default와 Disabling thinking requires effort high or below 항목이 보인다

400 오류를 만드는 요청과 해결 방법 두 가지

아래는 그대로 요청 본문과 비교해 볼 수 있는 실패 조합과 수정안이다.

# Rejected on claude-opus-5 with HTTP 400. Accepted on claude-opus-4-8.
  {
    "model": "claude-opus-5",
    "max_tokens": 16000,
    "thinking": { "type": "disabled" },
    "output_config": { "effort": "xhigh" }
  }

# Fix A - keep xhigh effort, let thinking run. Raise max_tokens, thinking counts against it.
  {
    "model": "claude-opus-5",
-   "max_tokens": 16000,
+   "max_tokens": 65536,
-   "thinking": { "type": "disabled" },
    "output_config": { "effort": "xhigh" }
  }

# Fix B - keep thinking off, cap effort at high or below.
  {
    "model": "claude-opus-5",
    "max_tokens": 16000,
    "thinking": { "type": "disabled" },
-   "output_config": { "effort": "xhigh" }
+   "output_config": { "effort": "high" }
  }

에이전트형 작업, 여러 파일을 다루는 작업, 도구 사용이 많은 작업이라면 수정안 A가 맞다. 이 경우 텍스트에 새어 나온 도구 호출이 더 비싼 실패가 될 수 있다. 지연 시간이 중요한 엔드포인트나 엄격한 형식의 추출 작업이라면 수정안 B가 낫다. 이런 작업에서는 xhigh에서 high로 effort를 낮춰도 손해가 크지 않은 경우가 많다.

Opus 5로 바꾸면 얻는 것

Opus 5는 2026-07-24에 출시됐다. Claude Opus 5 vs Opus 4.8 비교에서 먼저 확인하게 되는 두 수치, 즉 $5/$25 가격과 100만 토큰 컨텍스트 윈도우는 4.8과 동일하다. 출시와 가격의 전체 내용은 Claude Opus 5 출시 및 가격 상세에서 다뤘다. 마이그레이션에 직접 영향을 주는 차이는 그보다 좁다.

2026년 7월 25일 확인한 사양은 다음과 같다.

Claude Opus 4.8Claude Opus 5전환 시 달라지는 점
API 모델 IDclaude-opus-4-8claude-opus-5한 줄 수정
MTok당 가격$5 / $25$5 / $25변화 없음
컨텍스트1M기본값과 최대값 모두 1M별도 티어 선택 불필요
Effort 단계최대 xhigh, 기본값 highlow부터 max, 기본값 higheffort 조합을 다시 테스트
Thinking 기본값요청하지 않으면 꺼짐켜짐, 적응형max_tokens 재검토 필요
Thinking 비활성화모든 effort에서 가능effort high 이하에서만 가능high 초과면 400
캐시 가능한 최소 프롬프트1,024토큰512토큰짧은 프롬프트도 캐시 가능
지식 컷오프2026년 1월2026년 5월컷오프 문구 수정 필요

표 밖에서 달라지는 점은 두 가지이며, 벤치마크에 해당하는 것은 하나뿐이다.

  • 짧은 프롬프트도 캐시할 수 있다. 최소 기준이 1,024토큰에서 512토큰으로 낮아졌다. 따라서 4.8에서는 캐시할 수 없던 600토큰 시스템 프리픽스도 이제 캐시 히트 시 100만 토큰당 $5의 일반 입력 가격 대신 $0.50이 청구된다. 5분 엔트리 기준 캐시 쓰기 비용은 100만 토큰당 $6.25이므로, 이득을 보려면 프리픽스가 반복 사용돼야 한다.
  • 성능 우위는 공급사 발표 수치에 한정된다. Anthropic의 발표는 독립 재현 없이 상대 수치만 제시한다. Frontier-Bench v0.1에서는 더 낮은 작업당 비용으로 Opus 4.8의 “두 배 이상”을 기록했고, CursorBench 3.2에서는 Fable 5의 최고점과 0.5% 이내이면서 비용은 절반이라고 한다. 더 유용한 정보는 공개된 약점이다. 사이버보안과 생물학에서는 Mythos 5에 뒤처진다.

우리의 네 작업은 그 성능 상한에 관해서는 아무 말도 해주지 못한다. 두 모델 모두 네 작업을 통과했기 때문이다. 이 정도 규모의 작업에서는 성능 향상이 보이지 않았지만 토큰 증가는 분명했다.

비용은 토큰량이 결정한다

두 모델의 출력 가격은 100만 토큰당 $25로 같다. 따라서 리스트 가격 기준 하나의 채널에서 Claude Opus 5 vs Opus 4.8 비용을 가르는 것은 같은 작업에 각 모델이 얼마나 많은 토큰을 내보내는가뿐이다. 네 작업 합계는 Opus 5가 1,182토큰, Opus 4.8이 380토큰이었다. 3.1배 차이이며, 금액으로는 약 3.0센트와 0.95센트다.

다만 이 수치에는 세 가지 한계가 있다.

  • 모델별·작업별 실행은 2026-07-24에 단 한 번씩만 했다. 벤치마크가 아니라 스모크 테스트다.
  • 양쪽 모두 기본 설정을 썼다. effort 값도, thinking 필드도, 시스템 프롬프트도 없었다.
  • 일부 모델군에서 게이트웨이가 프롬프트 토큰 수를 매우 일관성 없이 보고했기 때문에 출력 토큰만 집계했다. 절대 금액은 작고, 확장되는 것은 비율뿐이다.

방향도 일관되지는 않다. 게이트웨이 대신 Claude Code의 퍼스트파티 채널에서 두 작업을 다시 실행한 결과는 다음과 같다.

실행Opus 5Opus 4.8
리팩터링, 퍼스트파티429 tok220 tok
버그 수정, 퍼스트파티36 tok63 tok
버그 수정, 게이트웨이(위 차트)81 tok36 tok

세 번 중 한 번에서는 Opus 5가 더 적은 토큰을 썼다. Anthropic은 최고 effort 단계에서는 반대 방향의 사례를 제시한다. 법률 업계 파트너가 최대 추론 설정에서 평균 26% 적은 토큰을 사용했다는 내용이지만, 방법론은 공개되지 않았다.

두 패턴은 동시에 성립할 수 있다. thinking이 기본 실행되고 Opus 5 응답도 길어지기 때문에, 추론이 순수한 오버헤드인 작업에서는 출력이 늘어난다. 반면 여러 파일을 다루는 작업에서는 그 추론이 재시도 루프를 대신할 수 있다. 호출당 토큰은 늘어도 완료된 작업당 토큰은 줄어들 수 있다는 뜻이다. 어느 데이터셋도 이를 직접 측정하지는 않았다. 예산은 자체 환경의 승인된 작업당 비용으로 잡고, 모델보다 effort를 조절 레버로 봐야 한다.

  • 가장 먼저 effort를 낮춰라. Anthropic은 Opus 5의 lowmedium이 이전 Opus 모델의 같은 설정보다 훨씬 적은 토큰으로 더 좋은 결과를 낸다고 안내한다. 코딩과 에이전트 작업에서는 여전히 xhigh가 권장 시작점이다.
  • 기존 기본값을 점검하라. 분류 엔드포인트에 그대로 남은 xhigh는 품질 이득 없이 청구서에서 가장 비싼 항목이 될 수 있다.
  • 그래도 비용이 높다면 티어를 의심하라. 같은 예산이라면 Sonnet 5와 비교한 Opus 5가 더 저렴한 선택지다.

이번 분기에는 Opus 4.8을 유지해야 하는 경우

다음 네 상황에서는 이번 분기 기준으로 4.8이 더 낫다.

  • Priority Tier 약정이 있다. 마이그레이션 가이드에 따르면 Priority Tier는 Claude Opus 5에서 지원되지 않지만 Opus 4.8에서는 계속 지원된다. 지연 시간 보장을 위해 예약 용량을 구매했다면, 전환은 그 혜택을 포기하는 일이다. 엔지니어링보다 조달의 문제에 가깝다.
  • thinking을 끈 상태에서 high 초과 effort를 써야 하는 연동이 있다. 평가상 xhigh 추론과 thinking 없는 출력이 모두 필요하다면, 현재 두 조건을 동시에 충족하는 모델은 4.8뿐이다.
  • 이번 주기에 재검증할 수 없는 고도로 튜닝된 스킬이 있다. 다른 모델용으로 작성된 프롬프트를 절반만 이식한 Opus 5 레인보다, 고정된 4.8 레인이 낫다.
  • 비용 압박이 있고 릴레이를 쓴다. 서드파티 OpenAI 호환 게이트웨이는 이전 모델을 크게 할인하기도 한다. AIReiter의 Anthropic 모델 목록은 Opus 4.8을 100만 토큰당 $1.56/$7.76에 제공하며, 이는 리스트 가격보다 약 69% 낮다. 아직 claude-opus-5은 추가되지 않았다. 접근 채널이 달라지면 가격 동등성은 깨진다. 이미 4.8이 작업을 통과한다면 가장 저렴하게 정답을 내는 모델이 이긴다. 코딩용 Claude 모델 비교에서는 전체 라인업을 작업별로 비교한다.

임박한 종료에 대한 우려는 유지 이유가 아니다. Anthropic의 모델 지원 종료 페이지는 2026년 7월 25일 기준 두 모델을 모두 Deprecated가 아닌 Active로 표시했다. 즉, 예정된 종료일은 없으며, 잠정적인 가장 빠른 종료 가능일은 4.8이 2027년 5월 28일, Opus 5가 2027년 7월 24일이다.

되돌릴 수 있게 전환하는 순서

1. 먼저 4.8 기준선을 고정한다. 실제 요청 20~50건에서 출력 토큰, 지연 시간, 통과율을 기준값으로 기록한다. 분산이 큰 에이전트 작업은 더 많이 포함하고, 4.8이 현재 실패하는 요청도 넣는다. 이 기록이 없으면 회귀와 단순한 차이를 구분할 수 없다. 2. 배포 전에 검색한다. effort 근처의 "disabled", 16k 미만의 max_tokens 값, 시스템 프롬프트의 "verify", "double-check", "January 2026" 문자열을 검색한다. 이 네 가지 검색으로 호환성 변경 하나와 조용히 발생하는 변경 세 가지를 포착할 수 있다. 3. 전체 전환 대신 하나의 레인만 운영한다. 모델 ID를 코드 곳곳이 아니라 설정에 두고, 트래픽 일부만 claude-opus-5으로 라우팅한다. 되돌릴 때 배포가 아니라 설정 변경만 하면 된다. 4. 레인을 열기 전에 수치 기반 승격 기준을 정한다. 통과율은 4.8 기준선 이상, 스키마 유효성과 도구 호출 준수율도 그 이상, 승인된 작업당 비용은 사전에 정한 상한 이하, p95 지연 시간은 SLO 이내, 400 오류율은 0이어야 한다. 하나라도 놓치면 설정을 claude-opus-4-8으로 되돌린다. 5. 요청 모델과 실제 반환 모델을 따로 기록한다. Opus 5의 사이버보안 분류기는 서버 측 폴백을 활성화한 뒤 거부된 요청을 Opus 4.8로 라우팅할 수 있다. 따라서 대시보드에서 Opus 5로 보이는 실행이 실제로는 4.8에서 처리됐을 수 있다.

대부분의 팀에 Claude Opus 5 vs Opus 4.8 결정은 다음과 같이 정리된다. 한 릴리스 주기 안에 위 순서대로 마이그레이션하되, 자체 4.8 기준선 대비 4단계의 기준을 통과한 항목만 승격한다. Anthropic의 가이드가 권하듯 첫날부터 기존 검증 프롬프트를 걷어내는 것이 좋다. 토큰 증가가 실제 청구서로 이어지는 지점이 바로 여기다.

FAQ

Claude Opus 5는 Opus 4.8의 드롭인 대체 모델인가?

Anthropic의 마이그레이션 가이드는 동일한 가격의 드롭인 업그레이드라고 부른다. API 관점에서는 대체로 맞다. 컨텍스트 윈도우와 128k 출력 상한이 같고, 점검할 호환성 변경도 하나다. 하지만 프롬프트 계층에서는 그렇지 않다. 검증 지시, effort 기본값, max_tokens 제한, 4.8용으로 튜닝한 스킬 정의는 모두 검토해야 한다. 이 문제들은 오류를 내고 자신을 드러내지 않는다.

Opus 5 요청에서 400 오류가 나는 이유는 무엇인가?

가장 가능성 높은 원인은 thinking: {"type": "disabled"}xhigh 또는 max effort를 함께 보낸 경우다. Opus 5는 이 조합을 모든 요청에서 거절한다. effort 수준을 유지하려면 thinking 필드를 제거하고, thinking을 꺼야 한다면 effort를 high 이하로 낮춰야 한다. 기본값이 아닌 temperature, top_p, top_k 값도 4.7 이후의 모든 Claude 모델에서 요청마다 400을 반환한다.

Claude Opus 4.8은 서비스 종료되나?

아니다. Anthropic의 지원 종료 페이지는 claude-opus-4-8을 Active로 표시하며, 잠정적인 가장 빠른 종료일은 2027년 5월 28일이다. 공개 출시 모델에는 최소 60일 전에 알린다는 정책도 있다. 또한 Opus 5의 사이버 카테고리 거부 요청을 위한 폴백 대상이며, Opus 5에 없는 Priority Tier 지원도 유지한다.

지금 가장 좋은 Claude Opus 모델은 무엇인가?

Anthropic이 발표한 공급사 수치와 초기 개발자 보고를 기준으로 하면 Claude Opus 5다. 특히 에이전트형 코딩과 장기 작업에서 개선 폭이 가장 뚜렷하다. 다만 Priority Tier 워크로드, high를 넘는 effort에서 thinking을 꺼야 하는 연동, 아직 기준선을 다시 잡을 수 없는 프롬프트 스택에는 Opus 4.8이 더 적합하다.

Claude Code와 Claude 앱에서 Opus 5로 어떻게 전환하나?

Opus 5는 Claude Max의 새 기본 모델이며 Claude Pro에서 가장 강력한 모델이다. Claude Code, Claude Cowork, claude.ai에서 선택할 수 있고, Amazon Bedrock에서는 anthropic.claude-opus-5로, Google Cloud와 Microsoft Foundry에서도 제공된다.

Claude Code의 기본 effort는 high이며, 이제 수동 extended-thinking 토글이 아니라 effort로 추론 깊이를 설정한다. 이 환경들에서는 Opus 4.8도 계속 선택할 수 있으므로 API 코드를 건드리지 않고도 롤백할 수 있다.

Claude Opus 5는 Opus 4.8보다 비싼가?

토큰당 가격은 아니다. 두 모델 모두 입력 100만 토큰당 $5, 출력 100만 토큰당 $25이며, Batch API에서는 $2.50/$12.50, 캐시 히트에서는 100만 토큰당 $0.50이다. 다만 작업당 비용은 다를 수 있다. 단일 실행 테스트에서는 Opus 5가 출력 토큰을 약 3배 더 생성했으므로, 리스트 가격이 같아도 실제 청구 금액은 커질 수 있다. 약 2.5배 속도의 Fast mode는 $10/$50이며 Claude API에서만 제공된다.