Artificial Analysis Intelligence Index에서 Grok 4.6은 약 61점, GPT-5.6 Sol은 58.9점을 기록하며 사실상 비슷한 수준에 올랐다. 하지만 출력 토큰 가격은 Sol이 5배 비싸다. 다만 Sol은 컨텍스트 윈도우가 2배 이상 크고 에이전트 효율 관련 점수도 더 높아, 단순 단가만으로 가치를 판단하기는 어렵다.
지능 점수는 비슷하지만, 그 점수만으로는 부족하다
Artificial Analysis Intelligence Index v4.1은 추론·코딩·지식 과제를 하나의 점수로 합산한다. OpenAI 발표에 따르면 GPT-5.6 Sol의 점수는 58.9다. Grok 4.6은 Artificial Analysis 아레나 데이터를 인용한 커뮤니티 보고에서 약 61점을 기록한 것으로 알려졌다. 이 수치는 독립적으로 검증되지는 않았지만, Artificial Analysis가 Grok 4.6을 Sol과 동급으로 표시한 흐름과는 대체로 일치한다.
복합 점수 하나로는 컨텍스트 윈도우, 에이전트 효율, 개별 벤치마크 편차를 드러내기 어렵다. 아래에서 각각 살펴보겠다. OpenAI가 공개한 결과 기준으로 Sol은 Terminal-Bench 2.1에서 88.8%, DeepSWE v1.1에서 72.7%를 기록하며 에이전트 중심 평가에서 강세를 보였다. Grok 4.6의 해당 세부 점수는 아직 독립적으로 공개되지 않았다. Intelligence Index에서는 두 모델이 일반 지능 면에서 비슷해 보이지만, 에이전트 벤치마크에서는 결론이 달라질 수 있다.
| 항목 | Grok 4.6 | GPT-5.6 Sol |
|---|---|---|
| 개발사 | xAI | OpenAI |
| 컨텍스트 윈도우 | 500K 토큰 (x.ai/api) | 약 1,050,000 토큰 (openai.com) |
| API 입력 비용(100만 토큰당) | $2.00 (x.ai/api) | $5.00 (openai.com) |
| API 출력 비용(100만 토큰당) | $6.00 (x.ai/api) | $30.00 (openai.com) |
| Intelligence Index v4.1 | 약 61(커뮤니티 보고) | 58.9 (공식) |
| 클라우드 제공 | Azure AI Foundry, Oracle OCI, Google Vertex (x.ai/api) | Azure, AWS Bedrock (openai.com) |
API 단가: 입력은 2.5배, 출력은 5배 저렴
xAI의 API 페이지는 Grok 4.6 가격을 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $6.00로 안내한다. OpenAI의 GPT-5.6 페이지에서 Sol은 입력 $5.00, 출력 $30.00로 책정돼 있다.
월간 입력 50M 토큰과 출력 10M 토큰을 쓰는 워크로드라면 Grok 4.6 비용은 $160이다. Sol은 $550이 든다. Sol의 추론 모드가 작업당 더 많은 토큰을 소비할 수 있다는 점을 제외하고도 3.4배 차이다.
OpenAI에는 더 저렴한 티어도 있다. GPT-5.6 Terra는 $2.50/$15.00, GPT-5.6 Luna는 $1.00/$6.00다. Luna 가격은 2026년 7월 30일에 80% 인하됐다. Luna는 출력 단가가 Grok 4.6과 같고 입력 단가는 더 낮지만, 더 작은 모델이라 전반적인 벤치마크 점수도 낮다. 지능 성능이 비슷한 모델끼리 비교한다면 Grok 4.6과 Sol이 맞는 상대이며, 이 기준에서는 Grok의 비용 우위가 크다.
컨텍스트 윈도우: 500K와 1M 토큰의 차이
xAI API 페이지 기준 Grok 4.6의 컨텍스트 윈도우는 500K 토큰이다. Sol은 OpenAI 문서 기준 약 105만 토큰을 제공한다. 500K 토큰이면 일반적인 컴포넌트·모듈 단위 작업과 대부분의 서비스 수준 코딩 업무를 처리할 수 있다. 반면 전체 모노레포, 여러 대형 문서, 긴 대화 이력을 프롬프트 하나에 모두 넣어야 한다면 Sol의 1M 윈도우가 의미를 갖는다. 한 번에 800K 토큰 규모의 코드베이스 컨텍스트를 분석해야 하는 에이전트 워크플로라면 Sol은 가능하지만 Grok 4.6은 불가능하다.
긴 컨텍스트에서는 검색 신뢰성도 따져야 한다. OpenAI 발표에 따르면 Sol은 1M 토큰 조건의 GraphWalks BFS에서 77.1%를 기록했다. Grok은 이에 상응하는 장문 컨텍스트 검색 점수를 공개하지 않았다. 사용 사례가 ‘600K 토큰 코드베이스에서 버그를 찾아라’라면 Sol의 큰 윈도우는 단순히 더 많이 담는 문제가 아니다. 그 깊이에 있는 정보를 실제로 찾아낼 수 있는지가 핵심이다.
코딩·에이전트 벤치마크에서 드러나는 차이
Intelligence Index에서의 근접한 점수가 코딩 특화 벤치마크 전반에 그대로 이어지는 것은 아니다. 아래 표는 GPT-5.6 Sol의 OpenAI 공식 점수와, 비교 기준으로 활용한 Grok 4.5의 Fritz.ai 보고 점수를 함께 정리한 것이다. Grok 4.6 전용 코딩 벤치마크는 아직 독립적으로 공개되지 않았으므로, Grok 열은 4.6의 직접 비교가 아니라 이전 모델 참고치로 봐야 한다.
| 벤치마크 | GPT-5.6 Sol(공식) | Grok 4.5(참고치) | 차이 |
|---|---|---|---|
| Artificial Analysis Intelligence Index v4.1 | 58.9 | - | Grok 4.6: 약 61(거의 동률) |
| Coding Agent Index v1.1 | 80.0 | - | Grok 4.6 데이터 없음 |
| Terminal-Bench 2.1 | 88.8% | 83.3% | Sol +5.5점 |
| DeepSWE v1.1 | 72.7% | 53.0% | Sol +19.7점 |
| SWE-Bench Pro | 64.6% | 64.7% | 사실상 동률 |
| GPQA Diamond | 94.6% | 93.1% | Sol +1.5점 |
특히 Terminal-Bench와 DeepSWE에서의 Sol 우위가 눈에 띈다. Terminal-Bench는 패키지 설치, 테스트 실행, 실패 원인 디버깅처럼 실제 터미널 작업을 끝낼 수 있는 에이전트 역량을 측정한다. DeepSWE는 실제 GitHub 이슈를 기반으로 엔드투엔드 소프트웨어 엔지니어링 능력을 평가한다. Grok 4.5 대비 DeepSWE에서 19.7점 앞선 Sol은 계획 수립, 실행, 오류 복구를 반복해야 하는 복잡한 다단계 코딩 작업에서 상당히 뛰어날 가능성을 시사한다. Grok 4.6의 사후 학습 개선이 이 격차를 줄였는지는 아직 확인할 수 없다.
벤치마크는 방향을 보여주는 지표일 뿐 결정적인 판정은 아니다. 에이전트 하니스, 도구, 프롬프트, 실행 환경에 따라 결과가 달라지므로, 한 하니스에서 낮은 점수를 받은 모델이 다른 환경에서는 더 높은 성과를 낼 수 있다.
토큰 단가보다 중요한 것은 작업당 비용
요금표만 보면 Grok 4.6의 낮은 토큰 단가가 압도적으로 보인다. 하지만 에이전트가 사는 것은 토큰이 아니라 완료된 작업이다. Sol이 코딩 작업을 출력 3,000토큰으로 끝내고 Grok 4.6은 같은 작업에 6,000토큰을 쓴다면, 즉 재시도가 늘고 추론 체인이 길어지며 도구 사용 효율이 낮다면 비용 격차는 줄어든다.
현 가격을 적용한 민감도 분석으로 범위를 살펴보자. Sol은 입력 10K·출력 4K 토큰, Grok 4.6은 입력 12K·출력 8K 토큰이 필요한 코딩 작업을 가정했다. 이는 Sol이 토큰 효율에서 2배 우위인 조건이다.
| 비용 항목 | GPT-5.6 Sol | Grok 4.6 |
|---|---|---|
| 입력 비용 | $0.05 | $0.024 |
| 출력 비용 | $0.12 | $0.048 |
| 작업당 총비용 | $0.17 | $0.072 |
Sol이 토큰 효율에서 2배 앞서는 이 조건에서도 Grok 4.6은 작업당 2.4배 저렴하다. Artificial Analysis를 인용한 Reddit 사용자들은 Grok 4.6의 Intelligence Index 작업당 비용을 약 $0.86으로 추정했다. 실제 워크로드에서 Sol 수준의 토큰 효율을 적용해도 Grok이 비용 우위를 지킬지는 작업 복잡도와 에이전트 하니스에 달려 있다.
진짜 위험은 토큰 경제성이 아니라 작업 완료율이다. Sol의 높은 Terminal-Bench와 DeepSWE 점수는 Grok이 아예 실패해 재시도나 사람의 개입이 필요한 복잡한 에이전트 작업에서 Sol이 성공할 가능성이 더 높다는 뜻이다. 어떤 가격이든 실패한 작업은 성공한 작업보다 비싸다.
접근성 및 생태계
두 모델 모두 이제 단일 제공업체 API에만 묶이지 않는다. 아래 내용의 주요 출처는 xAI API 페이지와 OpenAI 문서다.
| 접근 채널 | Grok 4.6 | GPT-5.6 Sol |
|---|---|---|
| Azure | AI Foundry (x.ai) | Azure OpenAI (openai.com) |
| AWS | 목록에 없음 | Bedrock (openai.com) |
| Google Cloud | Vertex Model Garden (x.ai) | 목록에 없음 |
| Oracle | OCI Generative AI (x.ai) | 목록에 없음 |
| IDE 통합 | Cursor, Devin | Cursor, Codex |
| SDK 호환성 | OpenAI + Anthropic SDKs (x.ai) | OpenAI SDK |
| 소비자용 채팅 | SuperGrok ($30/mo), X Premium+ | ChatGPT Plus ($20/mo) (fritz.ai) |
| 소비자 데이터 학습 | 기본 옵트인, 옵트아웃 필요 | API/Business 데이터는 기본적으로 제외 |
xAI 문서에 따르면 Grok은 OpenAI와 Anthropic SDK를 모두 지원한다. 따라서 마이그레이션에는 API 키와 엔드포인트 변경만 필요하다. 민감하거나 독점적인 코드를 다룬다면 API 및 Business 데이터를 기본적으로 학습에 쓰지 않는 OpenAI 정책이 조달 측면에서 장점이다. Grok 소비자 사용자는 학습 제외를 직접 설정해야 하며, 이는 Fritz.ai의 개인정보 분석에서도 언급된다.
어떤 모델을 선택해야 할까?
| 워크로드 | 추천 | 이유 |
|---|---|---|
| 대량 코딩 에이전트 | Grok 4.6 | 규모가 커질수록 토큰 비용이 2.5~5배 낮음 |
| 복잡한 다단계 에이전트 작업 | GPT-5.6 Sol (잠정) | 에이전트 벤치마크 우위는 Grok 4.6이 아닌 4.5 대비 결과임 |
| 대규모 코드베이스 분석 (>500K 토큰) | GPT-5.6 Sol | 컨텍스트 윈도우가 2배 더 큼 |
| 비용에 민감한 배치 처리 | Grok 4.6 | 지능 성능은 비슷하면서 토큰당 비용이 낮음 |
| 실시간 소셜·웹 리서치 | Grok 4.6 | 네이티브 X 및 웹 검색 지원 (x.ai) |
| 민감한 / 독점 코드 | GPT-5.6 Sol | API 데이터는 기본적으로 학습에 사용하지 않음 |
| 엔터프라이즈 Azure 배포 | 둘 다 가능 | 두 모델 모두 Azure AI Foundry에서 제공 |
가장 확실한 선택 방법은 실제 작업을 대표하는 샘플을 두 API로 모두 실행해 보는 것이다. 성공 완료율, 성공 작업당 중앙값 비용, 재시도 횟수, 지연 시간을 비교하라.
FAQ
Grok 4.6은 Sol 대신 GPT-5.6 Terra와 비교해야 하나요?
Terra($2.50/$15.00)는 Grok 4.6과 가격대가 더 가깝지만, 공개된 모든 벤치마크에서 Sol보다 점수가 낮다. Intelligence Index는 55.0, Coding Agent Index는 77.4, Terminal-Bench는 87.4%다(OpenAI 기준). 지능 성능을 맞춰 비교한다면 Grok 4.6과 Sol의 대결이 공정하다. 가격을 맞추는 비교라면 Grok 4.6과 Terra에서는 비용과 벤치마크 점수 모두 Grok 쪽이 유리하다. Luna($1.00/$6.00)는 둘보다 저렴하지만 품질에서 상당한 절충이 필요하다.
Grok 4.6의 사양과 기능을 더 자세히 보려면 Grok 4.6 가이드를 참고하면 된다. GPT-5.6을 이전 Grok 버전과 비교하려면 GPT-5.6 Sol vs. Grok 4.5 분석에서 이전 세대 모델 간 비교를 다뤘다.