AIREITER

Grok 4.6 API: 가격, 벤치마크, 달라진 점

마지막 업데이트: 2026-08-13 02:30:06

Grok 4.6는 2026년 8월 12일 공개됐다. Elon Musk가 말한 ‘2주 후’ 일정에서 닷새 늦은 시점이다. 가격표만 보면 Grok 4.5와 완전히 같다. 100만 토큰당 입력 $2.00, 출력 $6.00, 컨텍스트 500K다. 하지만 실제 청구 비용까지 같지는 않다. 캐시 입력 가격은 4.5보다 67% 올랐고, 독립 측정에서는 같은 작업을 마치는 데 더 많은 토큰을 쓰는 것으로 나타났다.

8월 12일에 출시된 Grok 4.6 사양

모델 ID는 grok-4.6이며, SpaceXAI의 릴리스 노트에는 API 제공 시작일이 2026년 8월 12일로 기록돼 있다. 문서상 사양은 다음과 같다.

항목Grok 4.6
모델 IDgrok-4.6
컨텍스트500K 토큰
입력텍스트 및 이미지
출력텍스트 전용, 명시된 출력 한도 없음
추론 수준low, medium, high(기본값), xhigh
지식 컷오프2026년 2월 1일
2026년 8월 12일자 SpaceXAI 릴리스 노트. xAI API의 Grok 4.6 출시와 컨텍스트 윈도우, 가격을 안내한다

여기서 새로 추가된 것은 두 가지다. xhigh는 Grok 4.5에 없던 네 번째 추론 단계다. 4.5는 high가 최고 수준이다. 또한 문서에 2026년 2월 1일이라는 지식 컷오프가 명시됐다. 날짜에 민감한 질문을 모델의 지식 공백에 맞춰 우회 라우팅하던 경우라면 특히 중요한 정보다.

모델 카탈로그는 Grok 4.6를 코드와 채팅을 위한 플래그십 모델로 소개하며, 사이드바에는 Latest 태그가 붙어 있다. 페이지 날짜는 2026년 8월 12일이다. Grok 4.5가 퇴장한 것은 아니다. 가격 페이지에는 여전히 별도 요금으로 표시된다.

Grok 4.6를 New로 표시한 SpaceXAI 개발자 문서. 500K 컨텍스트와 입력 $2.00, 출력 $6.00 가격이 보인다

출시 첫날부터 배포 범위도 넓었다. SpaceXAI의 발표문에는 Cursor와 Grok Build가 포함됐고, 두 서비스에서는 첫 주 동안 포함 사용량을 2배로 제공한다고 적혀 있다. API와 함께 OpenRouter, Vercel, Cloudflare 등 파트너도 언급됐다. 발표문은 가격이 2배인 고속 변형 모델도 언급하지만, 아직 공개 가격 페이지에는 해당 모델 행이 없다. 따라서 2배라는 수치는 공시된 요금이 아니라 발표문에 적힌 수치로 봐야 한다.

Grok 4.6 가격: 기본 요금은 같지만 캐시는 인상

입력과 출력 단가는 Grok 4.5에서 그대로 이어졌다. 달라진 것은 캐시 입력 요금이다.

100만 토큰당 요금Grok 4.5Grok 4.6
입력(200K 미만)$2.00$2.00
캐시 입력(200K 미만)$0.30$0.50
출력(200K 미만)$6.00$6.00
입력 / 캐시 / 출력(200K 이상)$4.00 / $0.60 / $12.00$4.00 / $1.00 / $12.00
200K 미만 컨텍스트에서 Grok 4.5와 Grok 4.6의 입력, 캐시 입력, 출력 요금을 비교한 그룹 막대 차트

캐시 입력 할인율은 85%에서 75%로 낮아졌다. 100만 토큰당 20센트 인상인데, 작업 수보다 에이전트 단계 수에 비례해 늘어나는 항목이라는 점이 문제다. 하루 50M 캐시 토큰을 재사용하는 하니스라면 4.5에서는 $9.00, 4.6에서는 $15.00를 낸다.

긴 컨텍스트 요청에 적용되는 규칙은 그대로이며, 여전히 헷갈리기 쉽다. 프롬프트가 200K 토큰에 도달하면 해당 요청의 모든 토큰이 상위 요금제로 청구된다. 예를 들어 210K 토큰 요청은 일부만 나눠 계산하는 방식이 아니라, 요청 전체 입력에 100만 토큰당 $4.00가 적용된다. OpenRouter의 공개 모델 목록도 동일한 요금과 200K 기준 전환을 표시한다. 서드파티 경로를 택해도 계산 방식은 달라지지 않는다.

공식 평가에서 본 Grok 4.6의 강점과 약점

SpaceXAI는 Grok 4.5, GPT-5.6 Sol Max, Fable 5 Max를 상대로 한 10개 항목 비교를 공개했다. Grok 4.6가 최고 점수를 기록한 항목은 GDPVal-AA v2(1753), AA-Briefcase(1577), Harvey LAB(15.8%)의 세 가지다. 나머지 일곱 항목에서는 선두가 아니다. 라우팅 판단에 특히 관련 있는 8개 항목은 아래와 같다.

Grok 4.6와 Grok 4.5, GPT-5.6 Sol, Fable 5를 10개 벤치마크에서 비교한 공식 SpaceXAI 평가표
평가Grok 4.6Grok 4.5GPT-5.6 SolFable 5
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.161.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
AA-Briefcase1577131315021574

두 번 살펴볼 만한 격차는 Terminal-Bench다. Grok 4.6는 26%인데 GPT-5.6 Sol은 34.6%, Fable 5는 34.1%다. 셸을 조작하는 에이전트와 가장 비슷한 이 평가에서 8포인트 차이의 3위다. DeepSWE도 숫자만 다를 뿐 같은 흐름을 보여 준다. Grok 4.6는 65.9%, Sol은 73%다. 터미널 기반 에이전트가 핵심 워크로드라면, 벤더 자체 표만으로도 이 모델이 선두가 아니라는 결론이 나온다.

그렇다고 Grok 4.5 대비 개선이 없었던 것은 아니다. 모든 항목이 올랐고, APEX-Agents는 47.1%에서 57.5%로, Terminal-Bench는 15.7%에서 26%로 10포인트 이상 상승했다. SpaceXAI는 더 긴 보조 학습, 재생성한 SFT 궤적, 코딩 및 지식 업무 환경 전반의 에이전틱 RL을 원인으로 꼽는다. 다만 발표문에는 파라미터 수가 없다. 이 모델에 붙은 2조라는 숫자는 릴리스 자료가 아니라 Musk의 발언에서 나왔다.

지능 향상에 실제로 든 비용

벤더 평가표는 점수를 보여 주지만, 그 점수를 얻는 데 든 비용은 말해 주지 않는다. Artificial Analysis는 둘 다 공개하며, 8월 13일 측정 결과에서 Grok 4.6의 실제 트레이드오프가 드러난다.

동일 지수 기준 측정Grok 4.5 (high)Grok 4.6 (high)
Intelligence Index56 (184개 중 #16)61 (184개 중 #6)
출력 속도56.9 토큰/s (#102)67.6 토큰/s (#74)
생성된 출력 토큰60M72M
전체 평가 비용$579.21$1,068.47
Artificial Analysis Intelligence Index를 Grok 4.5와 Grok 4.6에서 실행했을 때의 비용을 비교한 막대 차트

지능 5포인트 향상에 비용은 1.8배가 들었다. 표면 요금은 같지만, 동일 벤치마크 스위트에서 $489가 더 청구됐다. 출력이 60M에서 72M으로 늘어난 영향과 앞서 본 캐시 가격 인상이 함께 작용한 결과다. Artificial Analysis는 실행 비용의 항목별 내역을 공개하지 않았으므로, 1.8배는 다시 계산해 낼 수 있는 공식이 아니라 관측된 총비용이다.

속도는 개선됐다. 4.5의 초당 출력 56.9토큰에서 67.6토큰으로 올라, 해당 분류의 184개 모델 가운데 하위권에서 대략 중간 수준으로 이동했다.

Musk의 발언과 실제 출시 내용

Grok 4.6라는 이름은 세 단어짜리 답변으로 처음 확인됐다. 7월 18일 Musk는 @minchoi의 글에 답하며 이렇게 썼다. “Our 2T model, which is better than our 1.5T in every way, will finish initial training next week. It might be able to exceed Kimi, but with speed and token efficiency close to our 1.5T (aka Grok 4.5).” Andrew Curran이 이것이 Grok 4.6인지 묻자 그는 “Yeah, Grok 4.6.”라고 답했다.

1.5T Grok 4.5보다 모든 면에서 낫다는 2T 모델을 설명한 Elon Musk의 X 스레드와, 그 이름이 Grok 4.6임을 확인한 세 단어 답변

7월 24일에는 일정도 언급했다. “Grok 4.6 in 2 weeks and Grok 4.7 in 4 weeks.” 이 날짜에서 2주 뒤는 8월 7일 무렵이지만, 실제 출시는 8월 12일로 닷새 늦었다.

FrontierCode 파레토 프런티어 차트에 답하며 Grok 4.6는 2주 후, Grok 4.7은 4주 후라고 쓴 Elon Musk의 X 게시물

당시 게시물의 세 가지 주장은 출시 후에도 그대로 확인되지는 않았다.

  • 2조 파라미터는 여전히 확인되지 않았다. SpaceXAI의 발표문, 모델 문서, 릴리스 노트 어디에도 Grok 4.6의 파라미터 수는 없다.
  • “Grok 4.5에 가까운 토큰 효율”이라는 말은 Artificial Analysis 측정과 맞지 않는다. 같은 평가에서 출력 토큰은 60M이 아니라 72M이었다.
  • “Kimi를 넘어설 수도 있다”는 주장은 아직 검증되지 않았다. SpaceXAI 표에는 Moonshot의 K3가 없고, GPT-5.6 Sol과 Fable 5만 비교 대상으로 들어 있다.

Grok 4.5에서 Grok 4.6로 옮겨야 할까

Grok 4.5에서 넘어오는 경우라면, 에이전틱 작업과 지식 업무에는 옮기는 편이 낫다. 다만 마이그레이션 시점이 아니라 일주일 뒤의 토큰 청구서를 확인해야 한다. Grok 4.5는 기존 요금으로 계속 제공되므로 전환은 되돌릴 수 있다. 가정하기보다 직접 측정할 가치가 있다.

장기 실행 에이전트나 지식 작업이 중심이라면 지금 옮겨도 된다. APEX-Agents는 10.4포인트, GDPVal-AA는 227 올랐고, 더 빠른 생성 속도는 여러 단계를 거치는 실행에서 누적 효과를 낸다. 반대로 캐시 사용량이 많고 가격에 민감하다면 4.5에 머무는 편이 낫다. 캐시 읽기 비용의 67% 인상은 분명한 후퇴이며, 4.6 출시로 4.5의 점수가 떨어진 것도 아니다. 터미널 에이전트만 놓고 보면 다른 모델을 찾아보는 편이 낫다. SpaceXAI 자체 표에서 Grok 4.6는 GPT-5.6 Sol과 Fable 5에 8포인트 뒤진다.

프로덕션 라우팅을 바꾸기 전에는 다음 세 가지를 확인하자.

  1. 두 ID 모두 별칭이라는 점. SpaceXAI의 별칭 규칙에 따르면 grok-4.6는 최신 안정 빌드, grok-4.6-latest는 가장 최신 빌드를 가리킨다. 날짜가 붙은 <modelname>-<date> ID만 고정되는데, 모델 카탈로그와 OpenRouter 어디에도 날짜가 붙은 4.6 변형은 없다. 현재로서는 재현 가능한 워크플로를 위한 고정 버전이 없다.
  2. 추론 수준을 다시 테스트할 것.xhigh 단계는 무료 업그레이드가 아니다. 이미 전작보다 더 많은 출력을 생성하는 것으로 측정된 모델에서 토큰을 더 쓴다. 4.5와 동등 비교를 하려면 기본값인 high를 기준으로 삼아야 한다.
  3. 사용 중인 제공업체의 지원 여부 확인. SpaceXAI에서 첫날 제공됐다고 해서 모든 곳에서 바로 사용할 수 있는 것은 아니다. 8월 13일 /v1/models를 조회했을 때 공식 API와 OpenRouter는 모두 grok-4.6를 반환했다. 반면 테스트한 OpenAI 호환 리셀러 엔드포인트는 여전히 grok-4.5까지만 제공했고, 새 ID에는 model_not_found를 반환했다. 트래픽을 보내기 전에 직접 사용하는 키로 정확한 ID가 응답하는지 확인해야 한다.

FAQ

Grok 4.6 API 가격은 얼마인가?

200K 컨텍스트 미만에서는 100만 입력 토큰당 $2.00, 출력 토큰당 $6.00이며 캐시 입력은 $0.50다. 프롬프트 토큰이 200K를 넘으면 요청 전체에 입력 $4.00, 캐시 $1.00, 출력 $12.00가 적용된다. 발표문에는 가격이 2배인 고속 변형 모델도 언급됐지만, 공개 가격 페이지에는 아직 올라와 있지 않다.

Grok 4.6는 Grok 4.5보다 나은가?

SpaceXAI가 공개한 모든 벤치마크에서는 그렇다. AA Intelligence Index는 56에서 61로 올랐고, 특히 에이전틱 평가에서 상승 폭이 컸다. 다만 독립 측정에는 조건이 붙는다. 동일한 평가에서 Grok 4.5의 60M 대비 72M 출력 토큰을 생성했으므로, 같은 작업의 비용은 더 높다.

Grok 4.6의 파라미터 수는 몇 개인가?

공개되지 않았다. Musk는 2026년 7월 18일 2조 파라미터 모델을 언급하고 그 이름이 Grok 4.6라고 확인했지만, SpaceXAI의 릴리스 자료에는 파라미터 수, 아키텍처 세부 사항, 토큰당 활성화 파라미터 수에 관한 설명이 없다.

Grok 4.6의 컨텍스트 윈도우와 지식 컷오프는?

컨텍스트는 500K 토큰이며, 텍스트와 이미지를 입력으로 받고 텍스트만 출력한다. 문서상 지식 컷오프는 2026년 2월 1일이다. 서버 측 Web Search 또는 X Search를 활성화하지 않으면 그 이후 사건에는 접근할 수 없다.

Grok은 xAI가 만들었나, SpaceXAI가 만들었나?

두 이름은 같은 회사를 가리킨다. 개발자 문서 제목은 “SpaceXAI Docs”이고, 2026년 SpaceX 산하로 이동한 뒤에도 발표문 푸터에는 X.AI LLC라고 표기된다. x.ai 도메인과 grok-* 모델 ID는 이름이 바뀌지 않았다.

Grok 4.7은 언제 출시되나?

발표된 날짜는 없다. Musk의 7월 24일 게시물은 Grok 4.7이 약 4주 뒤, 즉 2026년 8월 21일 무렵임을 시사했지만, Grok 4.6도 자체 예상일보다 닷새 늦게 출시됐다.

함께 읽을 글

가격, 모델 ID, 벤치마크 수치는 2026년 8월 13일 기준 SpaceXAI 문서, Grok 4.6 발표문, Artificial Analysis를 대조해 확인했다.