AIREITER

OpenAI Ultrafast Mode: GPT-5.6 Sol 최대 14배 속도, 가격은 아직 미공개

마지막 업데이트: 2026-08-17 00:36:31

OpenAI에는 이제 이름에 ‘fast’나 ‘ultra’가 들어간 기능이 세 가지다. 하지만 초당 750토큰에 도달하는 것은 하나뿐이다. 2026년 8월 13일 발표된 OpenAI Ultrafast mode는 Cerebras의 웨이퍼 스케일 칩에서 GPT-5.6 Sol을 구동하는 새로운 API 서비스 티어로, Standard 대비 최대 14배 빠른 속도를 내세운다. 다만 현재는 초대받은 고객만 쓸 수 있고 가격도 공개되지 않았다. 오늘 바로 구매 가능한 최고 속도 티어는 여전히 100만 토큰당 입력 $10, 출력 $60의 Fast mode다.

ultra와 Fast mode, Ultrafast mode는 서로 다르다

GPT-5.6 Sol을 쓰려는 개발자라면 속도와 관련된 이름 세 가지를 마주하게 된다. 이름은 비슷하지만 역할은 완전히 다르다.

이름무엇인가사용 방법Sol 가격(100만 토큰당)표기된 속도
ultra 추론 설정하나의 작업에 서브에이전트와 추가 컴퓨팅을 투입하는 추론·작업 모드별도 구매 API 티어가 아닌 Codex 설정독립 요금 없음, 사용 한도를 빠르게 소진의도적으로 더 느림
Fast modeAPI 처리 티어, 2026년 7월 30일 Priority에서 이름 변경API 요청에 service_tier="fast" 지정입력 $10 / 출력 $60(짧은 컨텍스트)Standard 대비 최대 2.5배
Ultrafast modeGPT-5.6 Sol용 Cerebras 기반 API 티어, 2026년 8월 13일 프리뷰 공개일부 고객 대상 제한적 프리뷰미공개Standard 대비 최대 14배

방향도 서로 반대다. ultra는 속도보다 완성도를 택하는 서브에이전트 작업 모드다. 반면 Ultrafast mode는 같은 모델의 토큰 생성 자체를 빠르게 만드는 기능이다. 그 중간에 있는 Fast mode는 비용을 내고 지연 시간을 줄일 수 있는 API 티어이며, OpenAI의 Fast mode 안내 페이지에서 별도로 문서화되어 있다.

8월 13일 프리뷰에서 실제로 공개된 것

GPT-5.6 Sol 속도 프리뷰가 담긴 OpenAI Ultrafast mode 발표 페이지

공식 발표에서 확인할 수 있는 핵심은 다섯 가지다. Ultrafast는 OpenAI API에서 먼저 제공되며, GPT-5.6 Sol만 지원한다. Standard 처리 속도 대비 최대 14배, 출력 기준 초당 최대 750토큰을 제공하고 Cerebras가 이를 뒷받침한다. Jane Street, Podium, Basis, Rogo를 포함한 일부 고객에게 제한적 프리뷰 형태로 제공된다.

구매자가 궁금해할 정보 중에는 빠진 것도 네 가지다. 토큰당 가격, 모델 ID, 레이트 리밋, 지연 시간 SLA가 공개되지 않았다. 특정 벤치마크 결과도 제시되지 않았다.

OpenAI가 제시한 근거는 하나의 프롬프트로 3D 창고 시뮬레이터를 만드는 Ultrafast와 Standard Sol의 나란히 비교한 데모다. Rogo의 Alex Wang은 이를 이렇게 요약했다. “Ultrafast는 복잡한 금융 리서치를 실시간 상호작용처럼 느끼게 합니다.”

최대 2.5배와 14배의 차이는 얼마나 클까

GPT-5.6 Sol의 Standard, Fast mode, Ultrafast 표기 속도 배수를 비교한 막대그래프

먼저 지표를 구분할 필요가 있다. 초당 750토큰은 출력 처리량으로 홍보된 수치인 반면, Fast mode의 수치는 SLA 하한이다. 서로 연관은 있지만 같은 측정값은 아니다. 750을 14로 나누면 Standard Sol의 디코딩 속도는 초당 약 54토큰으로 추정된다. 이를 기준으로 10,000토큰 생성은 Standard에서 약 186초, Fast mode의 Enterprise SLA 하한인 초당 80토큰에서는 최대 125초, Ultrafast에서는 약 13초가 걸린다.

작업량Standard(약 54 tok/s, 추정치)Fast mode(SLA ≥80 tok/s)Ultrafast(광고 수치 750 tok/s)
10,000토큰 생성약 186초최대 125초약 13초
턴당 1,000토큰, 5턴 에이전트 루프약 93초최대 63초약 7초

r/AIToolsPerformance에 공유된 수치는 Artificial Analysis와 Cerebras를 출처로 든다. 이에 따르면 Ultrafast는 Claude Fable 5보다 11배 빠르고, Fast mode의 Opus 4.8보다 5배 빠르다. Humanity's Last Exam 2,500문항 전체 실행 시간도 Fable 5의 78시간 27분과 비교해 11시간 11분이었다. 다만 모두 공급업체가 보고한 결과이며, 아직 독립적인 재현 검증은 없다.

프리뷰 밖에서는 알 수 없는 Ultrafast 가격

API 고객을 위한 OpenAI Fast mode 요금표 페이지

Ultrafast의 공개 가격표는 없다. 발표문에도 요금이 없으며, 커뮤니티 역시 즉시 이 공백에 주목했다. r/AIToolsPerformance의 한 게시물은 “블로그에서 말하지 않는 것은 가격이다. 프리뷰 밖의 누구도 비용을 알지 못한다”고 표현했다.

현재 확인 가능한 GPT-5.6 Sol의 가격 기준점은 모두 100만 토큰당 다음과 같다.

티어입력(짧은 컨텍스트)출력(짧은 컨텍스트)입력(긴 컨텍스트 >272k)출력(긴 컨텍스트)캐시 입력
Standard$5.00$30.00$10.00$45.00$0.50
Fast mode$10.00$60.00$20.00$90.00$1.00
Ultrafast미공개미공개미공개미공개미공개
GPT-5.6 Sol Standard와 Fast mode의 100만 토큰당 요금을 비교한 그룹형 막대그래프

Fast mode는 Sol 기준으로 Standard의 정확히 2배를 청구한다. 하지만 이 배수만으로 Ultrafast 가격을 추정할 근거는 없다. 가격은 어느 방향으로든 달라질 수 있으며, OpenAI는 7월 30일 Terra와 Luna 가격을 인하한 바 있다. 지연 시간 예산을 관리한다면 Fast mode의 세부 조건도 중요하다. 분당 100만 토큰을 넘긴 뒤 15분 이내에 트래픽을 50% 이상 늘리면, 초과 요청은 별도 안내 없이 Standard로 다운그레이드된다. 이때 service_tier="Default"가 반환되고 Standard 요금이 적용된다.

현재 접근 방식: 공개 대기열이 아닌 초대 방식

Ultrafast는 공개 대기자 명단이 아니라 초대를 통해 접근한다. OpenAI는 용량이 늘어나는 대로 프리뷰를 확대하겠다고 밝혔고, 발표 페이지에서 접근 업데이트 신청도 받고 있다. 7월 보도에 따르면 초기 Sol 액세스 권한을 가진 조직은 약 20곳에 불과했다.

기반 인프라는 갑자기 등장한 것은 아니다. OpenAI와 Cerebras의 파트너십은 2026년 1월 14일로 거슬러 올라가며, 750MW 규모의 웨이퍼 스케일 용량을 확보했다. 같은 하드웨어에서 GPT-5.3-Codex-Spark는 이미 초당 1,000토큰을 넘겼다.

초대장을 기다리는 동안 빠른 출력을 쓰는 방법

Fast mode는 현재 모든 API 고객이 사용할 수 있으며, 요청 파라미터 하나만 추가하면 된다.

  1. /v1/responses 또는 /v1/chat/completions 요청에 service_tier="fast"를 추가한다.
  2. 기존 service_tier="priority" 값도 계속 작동한다. 기존 모델은 사용량 대시보드에서 여전히 priority로 표시되며, GPT-5.6 이후 모델은 fast로 표시된다.
  3. 프로젝트 전체의 기본값을 바꾸려면 Project settings -> Default Service Tier -> Fast로 설정한다.
Fast mode 모델100만 토큰당 가격(입력 / 출력)지연 시간 SLA
GPT-5.6 Sol$10 / $60>80 tok/s
GPT-5.6 Terra$4 / $24>70 tok/s
GPT-5.6 Luna$0.40 / $2.40>100 tok/s

세 모델 가운데 SLA 하한이 가장 높은 것은 Luna다. 캐시 읽기를 사용하면 입력 비용을 90% 줄일 수 있으며, Standard Sol에서는 약 30분 TTL 기준 $0.50/M이다. 따라서 어느 티어에서든 새 요청을 반복하기보다 오래 유지되는 세션이 유리하다. 실제 트래픽으로 티어를 시험하려면 GPT-5.6 API endpoint에서 세 모델을 하나의 인터페이스로 이용할 수 있다.

FAQ

Ultrafast mode는 ChatGPT나 Codex에서도 쓸 수 있나?

아니다. Ultrafast는 OpenAI API에서 먼저 출시되며, 발표문에는 ChatGPT 또는 Codex 지원 일정이 언급되지 않았다.

Cerebras에서 GPT-5.6 Sol을 실행하면 출력 품질이 달라지나?

OpenAI는 Ultrafast를 다른 모델이 아니라, 동일한 GPT-5.6 Sol을 더 빠르게 제공하는 방식으로 설명한다. 현재 품질 관련 주장은 Cerebras가 보고한 품질 저하 없는 GDP-Val 5.6배 속도 향상이 유일하며, 이를 독립 벤치마크로 재현한 사례는 없다.

Ultrafast mode에도 지연 시간 SLA가 있나?

공개된 SLA는 없다. Fast mode는 Enterprise 고객에게 >80 tokens/sec p50 SLA와 99.9% 가동률을 제공하지만, Ultrafast는 프리뷰 기간 중 SLA를 밝히지 않았다.

어떤 모델이 Ultrafast mode를 지원하나?

GPT-5.6 Sol만 지원한다. Terra와 Luna는 Fast mode를 지원하지만 Ultrafast 프리뷰 대상은 아니다.

Ultrafast mode의 가격은 얼마인가?

공식 가격은 없다. 현재 참고할 수 있는 유일한 기준은 Fast mode가 Standard Sol 대비 2배의 프리미엄을 붙인다는 점이다.