AIREITER

Grok 4.6 vs Fable 5: Empate em código, metade do contexto e 6x mais barato

Última Atualização: 2026-08-13 11:13:14

Quando duas IAs entregam praticamente o mesmo resultado em programação, o custo para chegar lá passa a importar muito. No CursorBench, o Grok 4.6 Extra High atingiu 70,8% por US$ 2,81 por tarefa concluída, enquanto o Fable 5 Max marcou 70,5% a um custo de US$ 17,32. É, na prática, um empate no benchmark de agentes de código — com uma diferença de preço de 6x por tarefa. O Fable 5 ainda preserva duas vantagens relevantes: lidera o índice mais amplo de inteligência da Artificial Analysis e tem o dobro da janela de contexto.

Como o Grok 4.6 encostou no Fable 5

Há dois meses, esta comparação tinha um vencedor mais claro. Em julho de 2026, a Artificial Analysis deu 56 pontos ao Grok 4.5 no Intelligence Index, contra 62 do Fable 5 — uma distância de seis pontos. Lançado em agosto de 2026, o Grok 4.6 ganhou cerca de cinco pontos, chegando a ~59 e praticamente empatando com o GPT-5.6 Sol, segundo deltas de benchmark reportados. Com isso, a vantagem do Fable 5 caiu para aproximadamente três pontos.

Entre agentes de programação, a distância encolheu ainda mais. Quando o Fable 5 chegou ao Cursor, em junho de 2026, estabeleceu um novo recorde de 72,9% no CursorBench (r/accelerate), 8 pontos acima do melhor resultado anterior. No confronto publicado no r/cursor em agosto, após o lançamento do Grok 4.6, o Grok 4.6 Extra High fez 70,8%, contra 70,5% do Fable 5 Max. Com o mesmo harness de agente, o resultado é efetivamente um empate. Ainda assim, vale considerar a ressalva de um usuário do Cursor que rodou a comparação:

"O Grok 4.6 me fez pensar: quanto do CursorBench vem do modelo e quanto vem do harness?" - thread no r/cursor, agosto de 2026

As pontuações de benchmark medem toda a pilha do agente — estrutura de prompts, ferramentas e tentativas adicionais —, não apenas o modelo-base. Além disso, os 72,9% obtidos pelo Fable 5 no lançamento e os 70,5% de agosto vieram de configurações diferentes. Portanto, os dois números devem ser vistos como indicativos.

É no custo por tarefa que o Grok 4.6 dispara

Os números por tarefa da comparação de agosto contam a história principal:

Métrica (CursorBench)Grok 4.6 Extra HighFable 5 Max
Pontuação70,8%70,5%
Custo por tarefaUS$ 2,81US$ 17,32
Etapas por tarefa4672

O Fable 5 precisou de 57% mais etapas de agente para alcançar a mesma pontuação. Essas etapas extras, junto dos tokens de raciocínio que carregam, ajudam a explicar a diferença de custo. Por isso, desenvolvedores que alternaram entre os dois começaram a questionar a utilidade de comparar agentes só pelo preço de tabela:

"US$/token está se tornando a forma errada de comparar agentes de IA." - título de thread no r/grok, agosto de 2026

Pontuação no CursorBench versus custo por tarefa: Grok 4.6 com 70,8% e US$ 2,81; Fable 5 com 70,5% e US$ 17,32

Os preços por token explicam parte dessa diferença. O Fable 5 custa US$ 10 de entrada e US$ 50 de saída por milhão de tokens na API da Anthropic. A tarifa publicada da API da xAI para o Grok 4.5 era de US$ 2 / US$ 6 por milhão de tokens em prompts abaixo de 200K tokens. A xAI não divulgou uma tabela separada para o 4.6, e a comunidade do r/grok relata que o 4.6 entrega "desempenho de nível Sol por uma fração do preço da API". Para consultar a tabela completa do Fable 5 em todas as faixas, veja o detalhamento de preços da API do Fable 5.

Na prática, dois fatores reduzem essa vantagem. O preço do Grok praticamente dobra acima de prompts de 200K tokens — US$ 4 / US$ 12 por milhão nessa faixa, segundo as tarifas publicadas da xAI — e, se o seu fluxo já depende bastante do Fable 5, há formas estruturais de reduzir os custos de tokens do Fable 5 antes de trocar de modelo.

Onde o Fable 5 ainda leva vantagem

ÁreaEvidênciaImpacto na prática
Índice de inteligênciaO Fable 5 segue em 1º lugar no AA Intelligence Index: 62 contra aproximadamente 59 do Grok 4.6Três pontos da antiga vantagem de seis pontos sobreviveram ao salto do 4.6
Janela de contextoO Fable 5 oferece 1.000.000 de tokens de contexto; o Grok fica em 500.000Um repositório grande com o histórico da tarefa cabe de uma vez, e a vantagem de preço do Grok diminui na faixa acima de 200K
Confiabilidade nas tarefas mais difíceisNo teste de criação da TryAI, o Fable 5 renderizou o Cubo de Rubik 3D na primeira tentativa e produziu o melhor SVG; o Grok 4.5 precisou de uma nova execução. O Goldie Bench colocou o Fable 5 à frente por 20 a 17 em 47 tarefas one-shot, vencendo criações de shaders e física de GPU por 0,8 a 1,6 pontoQuando a tarefa é ambígua e há apenas uma chance, o teto de raciocínio do Fable 5 aparece

Velocidade, latência e vazão

Números medidos pela TryAI, com o mesmo roteamento de provedor, limite de 400 tokens e três execuções por tipo de prompt:

MétricaGrok 4.5Fable 5
Tempo até o primeiro token0,44 s3,47 s
Vazão110 tok/s28 tok/s
Custo por respostaUS$ 0,00002US$ 0,00009
Taxa de sucesso100%100%

O Grok gerou 110 tok/s — aproximadamente o dobro do GPT-5.5 e do Opus 4.8, e cerca de quatro vezes os 28 tok/s do Fable 5. A Artificial Analysis traz um número ainda mais severo para o Fable 5 no raciocínio de esforço máximo: 113,68 segundos até o primeiro token da resposta, contra 8,68 do Grok. Depois que o streaming começa, porém, o Fable 5 decodifica um pouco mais rápido, com 63,1 contra 58,9 tok/s. Na prática, o Grok parece ágil em ciclos interativos; o Fable 5 concentra um longo período de raciocínio no início e paga por isso no tempo total.

Acesso, assinaturas e ferramentas de agente

Fable 5 está disponível pela API da Anthropic, pelo Claude Code e pelo Cursor, enquanto as assinaturas de valor fixo do Claude Pro cobrem a maior parte do uso fora da API. O ecossistema do Claude Code — CLAUDE.md, plugins, skills e servidores MCP — tem anos de maturidade.

Grok 4.6 está disponível pela API da xAI e pela CLI Grok Build (curl -fsSL https://x.ai/cli/install.sh | bash), com acesso ao chat incluído no X Premium. Segundo a ClockedCode, o Grok Build lê arquivos CLAUDE.md, plugins do Claude Code, skills, servidores MCP, agentes e hooks existentes sem qualquer configuração. Ele também funciona em modo headless com a flag -p para CI e expõe um Agent Client Protocol para integração embarcada. O ecossistema é mais novo, mas essa compatibilidade com o Claude Code deixa o custo de migração próximo de zero em configurações compatíveis.

Há uma questão de cobrança válida para os dois: assinantes do Claude Pro e do X Premium pagam valores fixos. Assim, os limites de uso sob a sua carga de trabalho real importam mais do que a tabela de preços.

Qual escolher em cada cenário

Sua situaçãoEscolhaMotivo
Tarefas de programação bem definidas e em alto volumeGrok 4.6US$ 2,81 por tarefa contra US$ 17,32 com pontuações empatadas no CursorBench
Trabalho crítico para a correção em um repositório grandeFable 5Janela de contexto de 1M, 1º lugar no índice de inteligência e melhor confiabilidade na primeira tentativa
Sessões interativas com agentes e iteração rápidaGrok 4.60,44 s até o primeiro token, 110 tok/s
Criações one-shot ambíguas e raciocínio mais exigenteFable 5Venceu a tarefa mais difícil da TryAI e os confrontos diretos do Goldie Bench
Orçamento limitado para gastos com APIGrok 4.6Tokens de saída custam aproximadamente um oitavo do preço do Fable 5

Minha leitura: use o Grok 4.6 como padrão em trabalhos delimitados e repetitivos, e deixe o Fable 5 para tarefas em que uma resposta errada custa mais do que os tokens. Equipes com volume real deveriam operar os dois e rotear as solicitações pelo tamanho representativo das tarefas, taxa de novas tentativas e custo por tarefa concluída — uma alternativa mais barata do que se comprometer exclusivamente com um deles.

Perguntas frequentes

O Grok 4.6 é melhor que o Fable 5 para programação?

No CursorBench, eles empataram: 70,8% para o Grok 4.6 Extra High contra 70,5% para o Fable 5 Max na comparação de agosto. O Fable 5 ainda lidera o índice mais amplo de inteligência da Artificial Analysis, com 62 contra ~59, e vence as tarefas one-shot mais difíceis. Portanto, o "melhor" depende de o seu gargalo ser custo por tarefa ou teto de correção.

O Grok 4.6 é mais barato que o Fable 5?

Sim, por aproximadamente 6x por tarefa concluída no CursorBench: US$ 2,81 contra US$ 17,32. A comparação por token usa a tarifa publicada do Grok 4.5 — US$ 6 de saída contra US$ 50 do Fable 5 por milhão — porque a xAI ainda não divulgou uma tabela específica para o 4.6. Essa diferença diminui acima de 200K tokens, faixa em que o preço do Grok praticamente dobra.

Qual modelo tem a maior janela de contexto?

O Fable 5, com 1.000.000 de tokens, contra 500.000 do Grok. Em cargas de trabalho que mantêm uma base de código inteira no contexto, essa diferença pode superar a vantagem de preço do Grok.

O Grok Build pode usar minha configuração do Claude Code?

Sim. O Grok Build lê automaticamente CLAUDE.md, plugins do Claude Code, skills, servidores MCP, agentes e hooks sem necessidade de portabilidade, além de incluir seu próprio diretório .grok/ para configurações específicas do Grok.

Os benchmarks do Grok 4.5 são uma boa referência para o Grok 4.6?

Não para capacidade. O Grok 4.6 ganhou cerca de cinco pontos no Intelligence Index em relação ao 4.5, transformando uma desvantagem de seis pontos para o Fable 5 em aproximadamente três, e empatou com o Fable 5 Max no CursorBench, onde o 4.5 ficava claramente atrás. Os números de velocidade e preço por token deste artigo são medições do Grok 4.5, pois ainda não há dados equivalentes publicados para o Grok 4.6.

O dilema que os benchmarks não resolvem

Nenhum benchmark desta comparação determina se a vantagem de custo se mantém quando o repositório tem 50.000 linhas, o ticket é ambíguo e uma tentativa frustrada custa uma hora de depuração. É exatamente para esse cenário que existem o contexto de 1M do Fable 5 e seu teto de inteligência mais alto: a certeza cara do Fable 5 contra as etapas baratas do Grok 4.6. A diferença é grande o suficiente para que a maioria das equipes mantenha os dois ativos.

Leituras relacionadas: Grok 4.6 vs GPT-5.6 · Grok 4.6 vs Opus 5 · Claude Sonnet 5 vs Fable 5