AIREITER

Grok 4.6 vs DeepSeek V4 Pro: 5.7배 비용 차이, 7개 과제로 검증

마지막 업데이트: 2026-08-13 03:12:30

비용이 우선이라면 DeepSeek V4 Pro, 응답 시간이 중요하다면 Grok을 고르는 쪽이 맞다. 두 API로 7개 과제를 돌려본 결과도 이 구도를 뒷받침했다. 다만 DeepSeek는 자체 가격 페이지에서 큰 폭의 인상을 예고하고 있다. 지금의 가격 우위는 이 변경이 현실화되면 대부분 사라질 수 있다.

2026년 8월, 실제로 비교하는 대상

이번 비교 직전 한 주 사이 두 모델 모두 사실상 정체성이 바뀌었다. Grok 4.6은 xAI 모델 문서의 Latest 자리를 차지했으며, 코딩을 비롯한 모든 작업을 위한 플래그십으로 소개된다. DeepSeek V4 Pro는 현재 DeepSeek-V4-Pro-0813 스냅샷으로 제공된다. 하지만 이 변화는 어느 쪽도 API 모델 ID에는 드러나지 않는다.

500K 컨텍스트, 입력 100만 토큰당 2.00달러, 출력 6.00달러와 함께 Latest 항목에 표시된 Grok 4.6의 xAI 문서

DeepSeek의 버전 문자열은 가격 페이지의 MODEL VERSION 행에서만 확인할 수 있다. API에는 날짜 접미사 없이 여전히 deepseek-v4-pro만 사용한다. 즉 오늘 보낸 요청과 7월에 보낸 요청은 로그상 똑같아 보이지만, 실제로는 서로 다른 가중치를 호출했을 가능성이 있다.

deepseek-v4-pro 엔드포인트의 MODEL VERSION이 DeepSeek-V4-Pro-0813으로 표시된 DeepSeek API 가격 페이지

아래는 2026년 8월 13일 xAI 가격 페이지와 DeepSeek 가격 페이지에서 확인한 전체 사양 및 가격 비교다.

Grok 4.6DeepSeek V4 Pro (0813)
컨텍스트 윈도우500K1M
최대 출력미공개384K
입력 / 100만$2.00$0.435
캐시 입력 / 100만$0.50$0.003625
출력 / 100만$6.00$0.87
장문 컨텍스트 요금프롬프트 200K 이상 시 모든 요금 2배없음
이미지 입력지원미지원
도구 호출지원지원
추론설정 가능Thinking / non-thinking
지식 컷오프2026년 2월 1일미공개

Grok 4.6의 기본 입력·출력 요금은 Grok 4.5와 같은 $2.00, $6.00이다. 달라진 것은 캐시 입력 요금이다. 동일한 xAI 표에서 Grok 4.5는 $0.30, Grok 4.6은 $0.50으로 표시된다. 새 모델에서 캐시 재사용 비용이 67% 오른 셈이다.

서드파티 게이트웨이에서는 아직 Grok 4.5가 잡힌다

xAI 문서에 모델이 등록됐다고 해서 토큰을 구매하는 모든 곳에서 바로 쓸 수 있는 것은 아니다. 이번 테스트에 사용한 게이트웨이에서는 grok-4.6이 model_not_found 오류를 반환했다. grok-latest와 grok 별칭은 모두 grok-4.5-build로 해석됐다. 리셀러를 통해 Grok을 쓴다면 xAI 자체 API가 아닌 이상, 버전을 단정하기 전에 별칭이 실제로 어디를 가리키는지 확인해야 한다.

아래 측정이 Grok 4.6이 아니라 grok-4.5로 진행된 이유도 이 때문이다. 두 버전의 입력·출력 가격은 같으므로 비용 결론은 그대로 적용된다. 다만 과제별 정확도 결과는 4.5의 결과다.

실제 차이는 지시사항 준수에서 났다

기계적으로 채점할 수 있는 7개 과제 가운데 6개는 동률이었다. 승부가 명확히 갈린 것은 하나였다. 정확히 4줄로 답하고, 각 줄은 정확히 5단어로 된 설명으로 끝내라는 과제였다. DeepSeek V4 Pro는 5회 모두 통과했고, Grok은 5회 모두 실패했다.

Grok의 실패는 같은 오류가 반복된 것이 아니었다. 두 번은 답변 대신 원시 web_search 도구 호출을 본문으로 출력했다. 그중 한 번의 전체 응답은 다음과 같았다. "I need accurate information on the four stages of canary deployment. Let me search for that." 두 번은 4줄 형식은 맞췄지만 설명의 단어 수가 각각 4개와 6개였다. 한 번은 130초와 출력 10,357토큰을 소비한 끝에 331줄을 반환했다.

도구 호출이 새어 나온 문제는 모델 자체보다는 게이트웨이 탓일 가능성이 크다. 6토큰짜리 프롬프트가 보고상 201 입력 토큰으로 부풀려졌는데, xAI 서버 측 도구를 선언하는 사전 프롬프트가 주입됐다는 신호다. 반면 단어 수를 틀린 사례는 별개다. 해당 실행에서는 정상적으로 답했지만 제약을 놓쳤다.

방법: 기본 설정에서 동일한 OpenAI 호환 게이트웨이를 통해 deepseek-v4-pro와 grok-4.5를 호출했다. 형식 과제만 각 모델당 5회 실행했고, 나머지 과제는 한 번씩 실행했다. 모든 과제에는 기계적으로 검증 가능한 정답이 있어 채점 모델은 사용하지 않았다. 동률이었던 6개 과제의 이름은 아래 비용 표에서 확인할 수 있다.

잘못된 전제도 두 모델 모두 그대로 받아들였다

일곱 번째 과제에는 의도적으로 두 가지 오류를 심었다. DeepSeek V4 Pro의 컨텍스트 윈도우가 128K라는 것, Grok 4.6이 2026년 1월에 2M 컨텍스트로 출시됐다는 것이다. 이후 900,000토큰 코퍼스에는 어느 모델을 써야 하는지 물었다. 두 모델 모두 어느 수치도 바로잡지 않았다. 틀린 숫자를 기반으로 논리를 전개한 뒤, 확신에 찬 Grok 추천을 내놨다.

오래된 사양을 프롬프트에 붙여 넣고 추천을 요청하면, 두 모델 모두 입력을 교정하는 대신 그럴듯하게 논증된 오답을 내놓을 수 있다.

출력 토큰은 적었지만 Grok 비용은 5.7배였다

두 모델이 모두 완료한 6개 과제에서 Grok의 출력은 5,275토큰, DeepSeek의 출력은 6,331토큰이었다. Grok이 17% 적게 썼다. 그러나 각 모델의 공식 출력 요금을 적용하면 같은 응답의 비용은 Grok $0.0317, DeepSeek $0.0055다. 토큰 효율과 반대로 비용은 Grok이 5.7배 더 들었다.

6개 과제에서 DeepSeek V4 Pro와 Grok의 과제별 출력 비용을 미국 센트 단위로 비교한 그룹 막대 차트
과제DeepSeek 토큰Grok 토큰DeepSeek 비용Grok 비용
엄격한 JSON1472190.013¢0.131¢
범위 병합3844160.033¢0.250¢
56K 니들1811740.016¢0.104¢
가격 산술5206470.045¢0.388¢
기간 파서4,0872,6110.356¢1.567¢
SQL 집계1,0121,2080.088¢0.725¢
합계6,3315,2750.551¢3.165¢

토큰 효율이 의미 없다는 말은 아니다. Grok은 기간 파서에서 4,087토큰 대신 2,611토큰으로 더 간결한 답을 냈다. 그래도 그 답변 비용은 4배였다.

한 달 단위로 환산해도 계산은 간단하다. 요청 1,000건마다 캐시되지 않은 입력 50,000토큰과 출력 3,000토큰을 사용한다고 하면 총 입력은 50M, 출력은 3M이다. Grok 4.6에서는 $100.00에 $18.00을 더해 $118.00이다. DeepSeek V4 Pro에서는 $21.75와 $2.61을 합쳐 $24.36이다.

Grok은 6개 과제 모두에서 더 빨랐고, 과제가 길수록 차이도 커졌다. 기간 파서는 83.3초 대비 48.8초였고, JSON 과제는 5.4초 대비 3.7초였다. 공유 게이트웨이에서 단일 실행으로 측정한 결과이므로 작은 차이는 잡음으로 보고, 큰 차이만 방향성 정도로 해석하는 편이 좋다.

6개 과제에서 DeepSeek V4 Pro와 Grok 4.5의 측정된 종단 간 지연 시간을 초 단위로 비교한 그룹 막대 차트

사양표에 없는, 청구서를 좌우하는 두 가지

실제 청구 금액은 헤드라인 요금보다 아래 두 가격 정책에 더 크게 좌우된다. 하지만 어느 쪽도 사양표의 열 하나로는 드러나지 않는다.

xAI의 장문 컨텍스트 기준선은 완만한 구간이 아니라 절벽이다. 프롬프트가 200,000토큰에 도달하는 요청은 기준선을 넘긴 토큰만이 아니라 요청 내 모든 토큰에 2배 요금이 적용된다. 199,000토큰 프롬프트의 입력 비용은 $0.398이지만, 201,000토큰 프롬프트는 $0.804다. 1%를 넘겼을 뿐인데 청구액은 두 배가 된다.

DeepSeek의 캐시 비용은 사실상 무료에 가깝다. 캐시 히트는 입력 100만 토큰당 $0.003625로, Grok 4.6의 $0.50보다 약 138배 저렴하다. 안정적인 코드베이스를 반복적으로 다루는 작업이라면 이 수치가 청구서를 결정한다. Hacker News의 한 개발자는 다음과 같이 전했다.

같은 코드베이스에서 긴 세션을 이어 가며 계속 사용하면 DeepSeek 공식 API의 캐시 히트율은 99%를 넘는다. 그래서 프런티어 모델보다 훨씬 저렴하다. claude code에서 2억 토큰 세션 사례도 있다.

문제는 DeepSeek 요금이 명시적으로 한시적이라는 점이다. 가격 페이지 각주에는 "We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected."라고 적혀 있다. Hacker News 분석에서는 DeepSeek의 프로모션 이전 요금을 입력 $1.74, 출력 $3.48로 추정한다. $0.435와 $0.87은 정확히 그 수치의 4분의 1이므로 계산은 일관된다. 다만 DeepSeek는 프로모션 조건을 공개하지 않았다.

인상이 그 수준에서 이뤄진다면 위 월간 시나리오의 DeepSeek 비용은 $24.36에서 $97.44로 올라가며, Grok의 $118.00에 가까워진다. 출력 가격 격차도 6.9배에서 약 1.7배로 줄어든다. 가격만으로 내리는 선택은 더 이상 명확하지 않다.

어느 모델을 선택할까

대량 처리, 비용 민감 작업, 반복 컨텍스트 작업에는 DeepSeek V4 Pro가 맞다: 배치 처리, 하나의 리포지토리를 길게 다루는 에이전틱 코딩 세션, 그리고 프롬프트당 약 200K토큰을 넘어 Grok의 기준선이 요금을 두 배로 만드는 모든 작업이 해당된다. 1M 컨텍스트 윈도우와 거의 무료에 가까운 캐시가 함께 유리하게 작용하며, 정확한 형식 제약도 5회 모두 지켰다. DeepSeek V4 Pro API 페이지에서 직접 실행할 수 있다.

지연 시간이 중요하거나 멀티모달 입력이 필요하다면 Grok 4.6을 선택하자. Grok은 모든 과제에서 더 빨랐다. 다만 속도와 형식 준수 결과는 4.6이 아니라 4.5에서 측정한 값이다. DeepSeek와 달리 이미지 입력을 받을 수 있으며, 2026년 2월 1일이라는 지식 컷오프도 공개돼 있다. 게이트웨이를 거친다면 4.6이 아니라 4.5를 받고 있지 않은지 확인해야 한다. AIReiter의 Grok을 포함한 모든 리셀러는 업스트림에 연결된 버전을 그대로 제공한다.

발표된 가격만 보고 어느 쪽도 선택하지는 말자. DeepSeek 자체 각주가 현재의 가격 우위를 유동적인 값으로 만들고 있으며, Grok의 캐시 입력 요금도 4.5에서 4.6으로 오며 이미 67% 상승했다. 워크로드를 확정하기 전에 위 계산을 현재 가격 페이지 기준으로 다시 돌려봐야 한다.

FAQ

Grok 4.6은 실제로 출시됐나?

그렇다. 2026년 8월 13일 기준으로 Grok 4.6은 xAI 모델 문서의 Latest 위치에 표시되며, 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $6.00, 500K 컨텍스트 윈도우가 공개돼 있다. 다만 서드파티 게이트웨이는 여전히 grok-latest를 Grok 4.5로 라우팅할 수 있다.

DeepSeek-V4-Pro-0813은 무엇인가?

DeepSeek가 현재 deepseek-v4-pro API 엔드포인트 뒤에서 제공하는 모델 버전 문자열이다. 공식 가격 페이지의 MODEL VERSION 행에 표시된다. API ID에는 날짜 접미사가 없으므로, 요청 자체가 바뀌지 않아도 뒤의 스냅샷은 변경될 수 있다.

컨텍스트 윈도우가 더 큰 모델은?

DeepSeek V4 Pro다. Grok 4.6의 500K보다 큰 1M토큰을 지원한다. DeepSeek는 최대 출력 384K도 공개했지만, xAI는 Grok 4.6의 최대 출력 수치를 공개하지 않았다.

DeepSeek V4 Pro는 Grok 4.6보다 저렴한가?

2026년 8월 13일 기준 정가로는 그렇다. 입력은 4.6배, 출력은 6.9배 저렴하다. 다만 DeepSeek 가격 페이지는 큰 폭의 인상을 예고하고 있으며, 개발자들이 파악한 프로모션 이전 요금이 적용되면 출력 가격 격차는 약 1.7배까지 줄어든다.

지시사항 준수는 어느 모델이 더 안정적인가?

두 모델의 차이가 난 유일한 테스트에서 DeepSeek V4 Pro는 정확한 형식 제약을 5회 중 5회 지켰고, Grok은 5회 중 0회 지켰다. 다만 프롬프트에 심어둔 잘못된 사양을 지적하지 못한 것은 두 모델 모두 같았다.


함께 읽기: GPT-5.6 Luna vs DeepSeek V4 Pro