Claude Sonnet 5.5는 입력 토큰 100만 개당 $2라는 가격과 공개된 Terminal-Bench 4.0 점수 70.6%를 앞세운 모델입니다. 다만 에이전트가 높은 추론 수준으로 실행되면 실제 변경 사항 하나를 승인하는 데 드는 비용은 크게 올라갈 수 있습니다. 프로덕션 코딩 모델을 고르는 팀이라면 Sonnet 5.5를 우선 파일럿할 기본 선택지로 보는 것이 좋지만, Opus 5.5를 무조건 대체할 모델로 판단해서는 안 됩니다.
프로덕션 결론: 기본 코딩 경로로 Sonnet 5.5를 먼저 검증하라
범위가 명확한 버그 수정, 리팩터링, 테스트 생성, 도구를 사용하는 저장소 작업부터 Claude Sonnet 5.5를 파일럿으로 적용해 보세요. Anthropic이 공개한 Terminal-Bench 4.0 결과에서 Sonnet 5.5는 70.6%를 기록했습니다. 같은 비교에서 Claude Opus 5.5는 66.4%, Claude Sonnet 5는 10.3%였습니다.
다만 한 가지 안전장치는 반드시 두어야 합니다. 추론 수준과 출력 한도를 명시적으로 설정하세요. 독립적인 비용 분석에 따르면 Sonnet 5.5는 표시 가격이 더 저렴한데도 최대 추론 수준으로 실행하면 벤치마크 작업 하나당 Opus 5.5보다 비용이 많이 들 수 있습니다.
API 팀이 Claude Sonnet 5.5에서 확인해야 할 변화
Claude Sonnet 5.5는 2026년 9월 28일 출시됐습니다. 공식 모델 문서에 따르면 모델 ID는 claude-sonnet-5-5이며, 컨텍스트 윈도는 100만 토큰, 일반 최대 출력은 128,000토큰입니다. 적응형 추론을 지원하고 API 기본 추론 수준은 high입니다.
| 프로덕션 관련 항목 | Claude Sonnet 5.5 |
|---|---|
| 출시일 | 2026년 9월 28일 |
| 모델 ID | claude-sonnet-5-5 |
| 컨텍스트 윈도 | 1M 토큰 |
| 일반 최대 출력 | 128K 토큰 |
| 배치 최대 출력 | 문서에 명시된 베타 헤더 사용 시 300K 토큰 |
| API 기본 추론 수준 | high |
Anthropic 문서에는 이 모델을 2027년 9월 28일 이전에는 종료하지 않겠다는 내용이 담겨 있습니다. 다만 이는 최소 지원 기간일 뿐, 최종 종료일을 보장하는 약속은 아닙니다.
코딩 비용에 영향을 주는 API 기본값
적응형 추론은 기본적으로 활성화돼 있습니다. Sonnet 5에서 마이그레이션하는 팀이 사전 추론을 끄고 싶다면 between_tools 동작을 테스트해야 합니다. 공식 문서에 따르면 이제 강제 도구 사용은 오류를 반환하며, 기본값이 아닌 temperature, top_p, top_k 값도 HTTP 400 오류를 반환합니다.
도구 호출 사이에 생성된 텍스트가 thinking 블록으로 전달될 수 있다는 점도 중요합니다. 중간 메시지를 항상 일반 텍스트 블록으로 처리하는 스트리밍 클라이언트는 마이그레이션 후 응답이 멈춘 것처럼 보일 수 있습니다. 기존 코딩 에이전트에 Sonnet 5.5를 연결하기 전에 파서를 수정하세요.
Terminal-Bench 성능: 기본 경로로 삼기에 충분한 수준
이번 비교에서 가장 눈에 띄는 코딩 에이전트 벤치마크는 여러 단계의 커맨드라인 작업을 평가하는 Terminal-Bench 4.0입니다. Anthropic이 공개한 결과에서 Sonnet 5.5는 70.6%를 기록했으며, Opus 5.5는 66.4%, Sonnet 5는 10.3%였습니다.
| 모델 | Terminal-Bench 4.0 | GDPval-AA Elo | CursorBench 4.0 |
|---|---|---|---|
| Claude Sonnet 5.5 | 70.6% | 1844 | 55.5% |
| Claude Opus 5.5 | 66.4% | 1846 | 57.8% |
| Claude Sonnet 5 | 10.3% | 1449 | 34.1% |
위 벤치마크 수치는 Anthropic의 출시 자료를 바탕으로 평가 결과를 정리한 DataCamp 벤치마크 요약에 소개된 내용입니다. 터미널 코딩 비교에서는 Sonnet 5.5가 앞서지만, CursorBench와 일부 종합 추론·지식 작업 평가에서는 Opus 5.5가 여전히 우세합니다.
단순히 diff만 확인하지 말고, 테스트 통과 여부와 도구 호출 횟수, 실제로 승인된 변경 사항을 기준으로 저장소 리플레이를 검증하세요.
실제 워크로드에서 보는 Claude Sonnet 5.5 API 가격
Anthropic 요금표 자체는 단순합니다. 하지만 코딩 에이전트가 비용을 지불하는 대상은 눈에 보이는 프롬프트만이 아닙니다. 추론 토큰은 출력 토큰으로 과금되며, 여러 턴에 걸쳐 반복되는 저장소 컨텍스트는 캐시 읽기로 누적될 수 있습니다.
| API 항목 | Claude Sonnet 5.5 가격 |
|---|---|
| 입력 | 토큰 100만 개당 $2 |
| 출력 및 추론 토큰 | 토큰 100만 개당 $10 |
| 5분 캐시 쓰기 | 토큰 100만 개당 $2.50 |
| 1시간 캐시 쓰기 | 토큰 100만 개당 $4 |
| 캐시 읽기 | 토큰 100만 개당 $0.20 |
| 배치 입력 | 50% 할인, 토큰 100만 개당 $1에 해당 |
| 배치 출력 | 50% 할인, 토큰 100만 개당 $5에 해당 |
공식 문서에는 캐시 가능한 프롬프트의 최소 크기가 512토큰이며, Sonnet 5.5가 적응형 추론을 사용한다고 나와 있습니다. eesel의 독립적인 가격 분석에 따르면 Sonnet 5.5는 Sonnet 5와 동일한 토크나이저를 사용합니다. 따라서 모델을 바꾼다고 토큰 수가 자동으로 줄어들지는 않습니다.
입력 4,000토큰과 출력 700토큰이 포함된 요청 하나의 비용은 다른 요금을 제외하면 약 $0.015입니다. 입력 비용 $0.008에 출력 비용 $0.007을 더한 금액입니다. 코딩 에이전트가 20턴 동안 매번 새로운 입력 3,000토큰과 출력 2,000토큰을 사용한다면, 캐시 읽기·쓰기와 도구 호출, 재시도 비용을 제외하고도 새로운 입력에 약 $0.12, 출력에 $0.40이 듭니다. 이는 워크로드를 이해하기 위한 예시일 뿐, 모든 작업에 적용되는 고정 가격은 아닙니다.
비용을 좌우하는 것은 추론 수준이다
Artificial Analysis Intelligence Index 측정치를 바탕으로 한 TokenCost의 추론 수준 분석에서는 Sonnet 5.5에 대해 다음과 같은 결과를 보고했습니다.
| 추론 수준 | 점수 | 전체 지수 기준 비용 |
|---|---|---|
| Low | 35.8 | $544 |
| Medium | 40.7 | $701 |
| High | 46.7 | $1,176 |
| Xhigh | 51.9 | $2,738 |
| Max | 56.0 | $8,977 |
경고 신호는 Max 결과입니다. 같은 분석에서 Opus 5.5의 Max는 $8,708 비용으로 57.6을 기록했고, Xhigh는 $4,057 비용으로 56.0을 기록했습니다. 해당 테스트에서 Sonnet 5.5 Max는 작업 하나당 약 193,000개의 출력 토큰을 사용했습니다.
처음에는 Medium 또는 High로 시작하고 출력 토큰을 제한하세요. 실패했거나 위험도가 높은 작업만 더 비싼 경로로 승격하는 방식이 적절합니다. 기존 Sonnet 5의 Max 설정을 Sonnet 5.5에 그대로 적용하기 전에 비용과 품질을 다시 평가해야 합니다.
프로덕션 코딩 모델 마이그레이션 체크리스트
- 별칭을 전역에서 바꾸지 말고 스테이징 환경에서
claude-sonnet-5-5를 고정해 테스트하세요. - 실제 저장소에서 대표적인 버그 수정, 리팩터링, 테스트 작성, 다중 파일 변경 작업을 리플레이하세요.
- 추론 수준을 명시하고 출력 토큰, 캐시 읽기, 도구 호출 횟수, 전체 소요 시간, 승인된 변경 비율을 기록하세요.
- 필요한 경우
thinking: disabled를 지원되는between_tools동작으로 교체하세요. - 강제 도구 사용을 전제로 한 로직을 제거하고 새로운 도구 선택 동작을 테스트하세요.
- 도구 호출 사이에 들어오는
thinking블록을 스트리밍 코드가 처리할 수 있도록 수정하세요. - 기본값이 아닌 샘플링 파라미터를 다시 확인하세요. 공식 문서에는 기본값이 아닌
temperature,top_p,top_k사용 시 400 오류가 발생한다고 나와 있습니다. - 출력이 폭주하거나 도구 호출이 반복될 때를 대비해 지출 상한과 중단 조건을 추가하세요.
- 요청 하나당 비용이 아니라 승인된 변경 하나당 비용을 비교하세요.
- 트래픽의 일부에만 먼저 적용하세요. 합의한 허용 범위 안에서 기존 모델의 승인된 변경 비율을 유지하면서 승인된 변경당 비용을 낮출 때만 Sonnet의 비중을 늘리세요.
Anthropic 직원 @cjav_dev는 thinking: {"type":"disabled"}를 사용한 요청이 400 오류를 반환하기 시작했으며, 대신 between_tools로 옮겨야 한다고 밝혔습니다(X 게시물).
Sonnet 5.5, Opus 5.5, 더 저렴한 모델 중 무엇을 선택할까
| 워크로드 | 우선 추천 | 이유 |
|---|---|---|
| 범위가 정해진 버그 수정과 리팩터링 | Medium/High 설정의 Sonnet 5.5 | 터미널 성능은 강하고 토큰 단가는 더 낮음 |
| 대량 코드 분류 또는 단순 편집 | Low/Medium 설정의 Sonnet 5.5 또는 더 저렴한 모델 | 불필요한 추론 비용을 피할 수 있음 |
| 장시간 실행되는 저장소 에이전트 | 캐싱과 엄격한 예산 제한을 적용한 Sonnet 5.5 | 실제 비용은 캐시와 턴 수가 결정함 |
| 모호한 아키텍처 작업 또는 최종 검토 | Opus 5.5 | 가장 낮은 요금보다 폭넓은 판단력이 중요함 |
| 오프라인 비긴급 코드 분석 | Sonnet 5.5 Batch API | 입력과 출력 모두 50% 할인 제공 |
| 최대 추론 수준의 터미널 실험 | 내부 벤치마크를 마친 뒤에만 Sonnet 5.5 | Terminal-Bench는 강점이지만 Max 설정은 비쌀 수 있음 |
요구 사항이 명확하고 측정 가능한 작업에는 Sonnet을 사용하고, 아키텍처 판단이 필요한 모호한 작업은 Opus로 올리세요.
Claude Sonnet 5.5 API FAQ
Claude Sonnet 5.5 API 가격은 얼마인가?
기본 요금은 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $10입니다. 캐시 읽기는 토큰 100만 개당 $0.20이며, 캐시 쓰기는 5분 기준 $2.50, 1시간 기준 $4입니다. Batch API를 사용하면 입력과 출력 모두 50% 할인됩니다.
코딩에서는 Sonnet 5.5가 Opus 5.5보다 나은가?
공개된 Terminal-Bench 4.0 비교에서 Sonnet 5.5는 70.6%로 Opus 5.5의 66.4%를 앞섰습니다. 하지만 다른 여러 평가에서는 Opus가 우세하므로, 이 코딩 결과만으로 전체적인 우열을 정하기보다 작업 유형에 따라 라우팅해야 합니다.
Sonnet 5.5의 모델 ID는 무엇인가?
Claude API에서는 claude-sonnet-5-5를 사용하세요. 공급자별 식별자는 Anthropic 모델 문서에 정리돼 있습니다.
Sonnet 5.5는 100만 토큰 컨텍스트 윈도를 지원하는가?
지원합니다. Anthropic은 100만 토큰 컨텍스트 윈도와 128,000토큰의 일반 최대 출력을 제공합니다. Message Batches API 베타에서는 문서에 명시된 베타 헤더를 사용하면 300,000토큰 출력도 지원할 수 있습니다.
Sonnet 5에서 마이그레이션할 때 무엇이 바뀌었나?
적응형 추론과 응답 블록 동작이 바뀌었고, 강제 도구 사용은 오류를 일으킬 수 있습니다. 기본값이 아닌 샘플링 파라미터는 400 오류를 반환할 수 있으며, thinking: disabled도 지원되는 동작으로 바꿔야 합니다. 프로덕션에 배포하기 전에 에이전트와 스트리밍 테스트를 다시 실행하세요.
일주일 동안 Medium/High 추론 수준으로 리플레이 파일럿을 진행하면서 승인된 변경당 비용을 측정하고, 실패한 사례는 Opus로 올려 처리하세요.