눈에 보이는 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러만 보고 예산을 잡으면 안 됩니다. 입력 토큰이 272,000개를 초과하는 요청은 요청 전체에 더 높은 요금이 적용되며, GPT-6 Astra 액세스도 아직 순차적으로 확대되는 중입니다. 문서에 모델이 올라와 있다고 해서 모든 계정에서 바로 호출할 수 있는 것은 아닙니다.
GPT-6 Astra API 가격 한눈에 보기
아래 요금표는 OpenAI 공식 모델 페이지 기준입니다. 프롬프트 캐시, 긴 컨텍스트, Fast 모드를 사용하면 실제 비용은 크게 달라질 수 있습니다.
| 항목 | 현재 세부 내용 |
|---|---|
| API 모델 ID | gpt-6-astra |
| 일반 입력 | 100만 토큰당 10.00달러 |
| 캐시 입력 | 100만 토큰당 1.00달러 |
| 캐시 기록 | 100만 토큰당 12.50달러 |
| 일반 출력 | 100만 토큰당 50.00달러 |
| 컨텍스트 윈도 | 1,050,000토큰 |
| 최대 출력 | 128,000토큰 |
| 지식 기준일 | 2026년 4월 30일 |
| 입력/출력 | 텍스트 및 이미지 입력, 텍스트 출력 |
| 무료 API 요금제 | 지원하지 않음 |
| 현재 제공 현황 | Trusted Access 기업 고객을 대상으로 순차 제공 중이며, 더 넓은 API 및 유료 요금제 액세스는 수일 내 제공 예정 |
이 수치는 출시 전 추정치가 아니라 GPT-6 Astra 모델 페이지에 게시된 공식 요금입니다. OpenAI의 모델 가이드에 따르면 도구 호출에는 Responses API가 필요합니다.
청구액을 바꾸는 세 가지 가격 규칙
GPT-6 Astra에는 네 가지 토큰 요금 구분과 서비스 모드별 규칙이 있습니다. 단순히 입력 10달러 / 출력 50달러인 API로 생각하면 캐시 생성, 긴 프롬프트, 저지연 처리에 드는 비용을 실제보다 낮게 잡게 됩니다.
일반 입력, 캐시 입력, 캐시 기록의 차이
일반 입력은 100만 토큰당 10달러, 캐시 입력은 100만 토큰당 1달러, 캐시 기록은 100만 토큰당 12.50달러입니다. 처음 캐시를 기록하는 비용은 들지만, 이후 반복 사용에서는 비용을 크게 줄일 수 있습니다.
| 토큰 구분 | 일반 요금 | 의미 |
|---|---|---|
| 캐시되지 않은 입력 | 100만 토큰당 10.00달러 | 모델이 새로 처리하는 입력 |
| 캐시 입력 | 100만 토큰당 1.00달러 | 기존에 처리된 입력을 캐시에서 다시 제공 |
| 캐시 기록 | 100만 토큰당 12.50달러 | 프롬프트 캐시에 추가되는 입력 |
| 출력 | 100만 토큰당 50.00달러 | 모델이 생성한 응답 토큰 |
컨텍스트 윈도 전체에 입력 요금을 곱해서 계산하면 안 됩니다. 105만 토큰 컨텍스트 윈도는 처리 가능한 용량의 한도일 뿐, 모든 토큰에 기본 요금이 적용된다는 뜻이 아닙니다.
272K 입력 기준은 요청 전체에 적용된다
요청에 입력 토큰이 272,000개를 초과하면 OpenAI는 요청 전체에 대해 입력 및 캐시 요금 2배, 출력 요금 1.5배를 적용한다고 안내합니다. 따라서 긴 컨텍스트 요금은 캐시되지 않은 입력 100만 토큰당 20달러, 캐시 입력 100만 토큰당 2달러, 캐시 기록 100만 토큰당 25달러, 출력 100만 토큰당 75달러가 됩니다.
| 요청 구간 | 입력 | 캐시 입력 | 캐시 기록 | 출력 |
|---|---|---|---|---|
| 입력 272K 이하 | 10달러 | 1달러 | 12.50달러 | 50달러 |
| 입력 272K 초과 | 20달러 | 2달러 | 25달러 | 75달러 |
입력 300K인 요청이라면 관련된 입력, 캐시, 출력 토큰 전체에 높은 긴 컨텍스트 요금이 적용됩니다. 처음 272K까지 일반 요금으로 계산되지 않습니다.
Batch, Flex, Fast와 리전 배포 선택지
OpenAI는 Batch와 Flex에 해당 요금의 50%를 부과합니다. 모델 가이드에 따르면 Fast 모드는 해당 요금의 2배이며 지연 시간 SLA가 없습니다. 또한 EU 데이터 레지던시에서는 Fast 모드를 사용할 수 없고, Priority 처리도 지원되지 않습니다.
| 모드 | 일반 입력 | 일반 출력 | 실무적인 해석 |
|---|---|---|---|
| Standard | 100만 토큰당 10달러 | 100만 토큰당 50달러 | 기본 직접 API 구간 |
| Batch 또는 Flex | 100만 토큰당 5달러 | 100만 토큰당 25달러 | 해당 Standard 요금의 절반 |
| Fast | 100만 토큰당 20달러 | 100만 토큰당 100달러 | 해당 Standard 요금의 2배 |
| 긴 컨텍스트 Standard | 100만 토큰당 20달러 | 100만 토큰당 75달러 | 입력 272K 초과 시 적용 |
| 긴 컨텍스트 Fast | 100만 토큰당 40달러 | 100만 토큰당 150달러 | 긴 컨텍스트 요금의 2배 |
위 표는 캐시되지 않은 입력과 출력만 보여줍니다. 캐시 읽기와 캐시 기록 요금에도 해당 서비스 모드의 배수가 적용됩니다.
Microsoft Foundry는 별도의 배포 요금표를 공개하고 있습니다. GPT-6 Astra 발표문에 따르면 Global Standard 단기 컨텍스트 요금은 입력 10달러, 캐시 입력 1달러, 캐시 기록 12.50달러, 출력 50달러입니다. U.S. Data Zone Standard는 각각 11달러, 1.10달러, 13.75달러, 55달러입니다. 긴 컨텍스트 요금표에서는 Global이 20달러/2달러/25달러/75달러, U.S. Data Zone이 22달러/2.20달러/27.50달러/82.50달러입니다. OpenAI 직접 API 요금표를 Azure 예산에 그대로 적용해서는 안 됩니다.
실제 Astra 요청 비용은 얼마일까
아래 예시는 OpenAI 직접 API의 Standard 요금을 기준으로 하며, 도구 호출과 재시도 비용은 제외했습니다. 각 토큰은 표시된 대로 캐시되지 않은 토큰 또는 캐시 토큰으로 계산합니다.
| 예시 요청 | 계산식 | 예상 토큰 비용 |
|---|---|---|
| 캐시되지 않은 입력 100K + 출력 10K | 0.1 × $10 + 0.01 × $50 | 1.50달러 |
| 캐시 입력 200K + 출력 20K | 0.2 × $1 + 0.02 × $50 | 1.20달러 |
| 캐시되지 않은 입력 300K + 출력 30K | 0.3 × $20 + 0.03 × $75 | 8.25달러 |
긴 컨텍스트 워크플로를 도입하기 전에 272K 기준을 반드시 테스트하세요. 검색 증강이나 컨텍스트 압축으로 모델 비용을 낮출 수 있지만, 애플리케이션 측 작업은 늘어날 수 있습니다.
토큰 200K를 캐시에 기록하는 데는 2.50달러가 들지만, 이후 200K 캐시 적중 비용은 0.20달러입니다. 캐싱의 손익분기점은 재사용 빈도에 따라 달라집니다.
Microsoft Foundry에서는 Global 단기 컨텍스트 요금표 기준으로 입력 100K와 출력 10K인 요청도 도구 호출이나 재시도 전에는 1.50달러입니다. U.S. Data Zone에서는 1.65달러입니다. 계산식은 0.1 × $11 + 0.01 × $55입니다.
OpenAI 가이드는 Astra가 이전 모델보다 완료된 작업 하나당 예상 비용을 낮출 수 있다고 설명하지만, 이는 독립적인 실제 운영 비용 벤치마크는 아닙니다. 입력 토큰, 캐시 적중, 출력 토큰, 도구 호출, 재시도, 사람의 수정 작업을 직접 로그로 남겨 측정하세요.
액세스, 쿼터, ChatGPT와 API의 차이
GPT-6 Astra는 현재 Trusted Access Program에 참여한 기업을 대상으로 순차 제공되고 있으며, API와 Plus·Pro·Business·Enterprise 액세스는 수일 내 제공될 예정입니다. OpenClaw OpenAI 프로바이더 문서도 계정 카탈로그 검색 결과에 따라 Astra 사용 가능 여부가 결정된다고 설명합니다. 설정에 모델 이름을 추가하는 것만으로는 액세스가 부여되지 않습니다.
한 사용자는 출시 지연 상황을 다음과 같이 표현했습니다.
“거의 새벽 2시라서 화난 채로 자러 갑니다. 하루 종일 Astra를 기다렸는데… 결국 알게 된 건 이거예요. 난 아예 사용할 수도 없습니다.” — @buildwithrajath, X
모델 페이지에 공개된 API 사용량 등급별 한도는 다음과 같습니다.
| 등급 | RPM | TPM | Batch 큐 한도 |
|---|---|---|---|
| Free | 지원하지 않음 | 지원하지 않음 | 지원하지 않음 |
| Tier 1 | 500 | 500,000 | 1,500,000 |
| Tier 2 | 5,000 | 1,000,000 | 3,000,000 |
| Tier 3 | 5,000 | 2,000,000 | 100,000,000 |
| Tier 4 | 10,000 | 4,000,000 | 200,000,000 |
| Tier 5 | 15,000 | 40,000,000 | 15,000,000,000 |
Astra 요금표는 API 전용입니다. 인용된 문서에는 ChatGPT 요금제에 API 크레딧이 포함된다는 내용이 없으므로, Platform API 사용 비용은 별도로 예산을 잡아야 합니다.
기존 에이전트 마이그레이션 전 확인할 항목
OpenAI의 모델 가이드는 다음 세 가지 마이그레이션 점검 항목을 제시합니다.
- 모델과 API:
model을gpt-6-astra로 설정하고, 계정 카탈로그에 해당 모델이 노출되는지 확인하세요. 도구 호출에는 Responses API를 사용해야 합니다. - 요청 파라미터:
low,medium,high,xhigh,max중 하나를 선택하세요. Astra는none을 지원하지 않습니다. 지원되지 않는 샘플링 및 로그 확률 파라미터도 제거해야 합니다. - 캐싱과 리전: OpenAI의 구형 모델 마이그레이션 가이드를 따를 때는
prompt_cache_retention을prompt_cache_options.ttl: "30m"으로 바꾸고, EU 데이터 레지던시 환경에서 Fast 및 Priority 설정을 다시 확인하세요.
예산을 정할 때는 토큰 가격보다 실제 작업 기록을 보자
GPT-6 Astra는 긴 입력을 처리하거나, 도구를 많이 사용하거나, 실패 비용이 크거나, 깔끔한 API를 제공하지 않는 소프트웨어를 다뤄야 할 때 도입 타당성이 높습니다. 반대로 짧고 반복적인 프롬프트에서는 출력 100만 토큰당 50달러가 재시도 감소나 작업 완료 품질 향상으로 이어지지 않는다면 기본 모델로 쓰기 어렵습니다.
- 먼저 Astra로 테스트할 작업: 긴 컨텍스트 연구, 컴퓨터 사용, 복잡한 코딩, 여러 애플리케이션을 오가는 워크플로처럼 실패 시 검토나 재작업 비용이 큰 업무
- 저렴한 모델을 기본값으로 유지할 작업: 짧은 분류, 추출, 단순 초안 작성, 결과가 예측 가능한 변환
- Batch 또는 Flex를 사용할 때: 지연 시간이 중요하지 않고 50% 요금으로 처리해도 되는 작업
- Fast를 기본값으로 피할 이유: 긴 컨텍스트 배수가 적용되기 전에도 입력 100만 토큰당 20달러, 출력 100만 토큰당 100달러이므로 측정 가능한 처리량 개선이 있어야 합니다.
- 272K 기준을 강제하기: 기준을 넘으면 요청 전체에 할증이 적용되므로, 요청이 임계치를 넘기기 전에 알림을 설정하세요.
토큰 가격만 보지 말고 자체 trace 로그에서 승인된 작업 하나당 비용을 계산해야 합니다. 인접한 예산을 검토할 때는 GPT-5.6 가격 가이드와 OpenRouter 가격 가이드의 전제도 비교해 보세요. 다만 해당 서비스의 요금표 규칙을 Astra에 그대로 옮겨 적용해서는 안 됩니다.
GPT-6 Astra API 가격 FAQ
GPT-6 Astra는 토큰 100만 개당 얼마인가요?
일반 요금은 캐시되지 않은 입력 100만 토큰당 10달러, 캐시 입력 100만 토큰당 1달러, 캐시 기록 100만 토큰당 12.50달러, 출력 토큰 100만 개당 50달러입니다.
입력 토큰이 272K를 넘으면 어떻게 되나요?
입력 및 캐시 요금은 2배가 되고 출력 요금은 50% 올라갑니다. 요청 전체에 입력 20달러, 캐시 입력 2달러, 캐시 기록 25달러, 출력 75달러(각 100만 토큰 기준)가 적용됩니다.
캐시 입력과 캐시 기록은 같은 것인가요?
아닙니다. 캐시 입력은 Standard 구간에서 100만 토큰당 1달러로 청구되는 캐시 적중입니다. 캐시 기록은 캐시된 프롬프트 접두부를 새로 만들거나 업데이트하는 작업이며 100만 토큰당 12.50달러입니다.
Batch나 Flex를 사용하면 GPT-6 Astra 요금이 절반으로 줄어드나요?
OpenAI는 Batch와 Flex에 해당 Standard 요금의 50%를 적용한다고 안내합니다. 긴 컨텍스트 기준을 넘는 경우에는 해당 긴 컨텍스트 요금에도 같은 규칙이 적용됩니다.
Fast 모드는 추가 비용을 낼 가치가 있나요?
Fast 모드는 해당 요금의 2배이고 지연 시간 SLA도 없습니다. 따라서 실제 trace에서 처리량이나 사용자 가치가 충분히 개선되어 추가 비용을 상쇄하는지 확인될 때만 사용하는 편이 좋습니다.
지금 API에서 GPT-6 Astra를 사용할 수 있나요?
현재 모든 계정에 개방된 상태가 아니라 순차적으로 제공되고 있습니다. OpenAI는 초기 Trusted Access 기업 고객 제공을 명시했으며, 더 넓은 API 액세스는 수일 내 제공 예정이라고 안내합니다. 최종적으로는 계정 카탈로그에서 사용 가능 여부를 확인해야 합니다.
ChatGPT Plus에 GPT-6 Astra API 크레딧이 포함되나요?
모델 문서에는 ChatGPT 요금제에 API 크레딧이 포함된다는 보장이 없습니다. 계정의 명시적인 결제 조건에서 달리 안내하지 않는 한, 유료 요금제의 모델 액세스와 사용량 기반 Platform API 청구는 별개로 봐야 합니다.
GPT-6 Astra를 사용하려면 어떤 API 변경이 필요한가요?
model을 gpt-6-astra로 설정하고, 도구 호출에는 Responses API를 사용해야 합니다. 지원되는 reasoning effort를 선택하고, 지원되지 않는 샘플링 및 로그 확률 파라미터를 제거하세요. 캐시 TTL과 리전별 Fast 모드 규칙도 검토해야 합니다. Astra를 기본 모델로 전환하기 전, 대표적인 작업 한 건을 대상으로 토큰, 캐시 동작, 도구 호출, 재시도, 사람의 수정 작업을 기록해 보세요.