AIREITER

Muse Glimmer vs Qwen 3.6 27B: comparação de benchmarks para programação

Última Atualização: 2026-08-11 00:51:43

Para quem roda modelos localmente, a escolha entre Muse Glimmer 30B e Qwen3.6-27B depende tanto da GPU quanto da capacidade de programar. O Qwen3.6-27B chegou em abril de 2026 com uma tabela completa de benchmarks em seu model card no Hugging Face. O Muse Glimmer 30B veio depois, em agosto de 2026, como um lançamento de pesos abertos da Meta, e a comunidade de LLMs locais logo colocou os dois frente a frente. Nos números principais, o Qwen sai na frente: 60,7 contra 51,7 no TerminalBench 2.1 e 77,2 no SWE-bench Verified oficial. Mas o Glimmer tem uma vantagem de VRAM que muda bastante o que é possível rodar em uma GPU só.

TerminalBench 2.1: vantagem de 9 pontos para o Qwen

O TerminalBench mede a confiabilidade de agentes que trabalham em terminal ao longo de várias etapas, incluindo uso de ferramentas e manutenção de contexto em sessões extensas. Nas discussões da comunidade vinculadas abaixo, o TerminalBench 2.1 aparece com frequência como o resultado disponível para comparar os dois em tarefas de agentes de programação.

Pontuações do TerminalBench 2.1 relatadas pela comunidade, reunidas em discussões no r/LocalLLaMA entre 10 e 11 de agosto de 2026:

ModeloTerminalBench 2.1Tipo de fonte
Qwen3.6-27B60.7Relatado pela comunidade
Muse Glimmer 30B51.7Relatado pela comunidade
Gemma 4 31B43.4Relatado pela comunidade

Há uma ressalva importante: o TerminalBench avalia o conjunto formado pelo modelo e pelo harness, não apenas o modelo-base. O card oficial do Qwen3.6-27B especifica um harness Harbor/Terminus-2 com timeout de 3 horas, 32 CPUs, 48 GB de RAM, saída máxima de 80K, contexto de 256K e média de cinco execuções. A nota do Glimmer pode refletir uma configuração diferente ou menos otimizada do harness. Por isso, a diferença de 9 pontos pode diminuir ou aumentar conforme a configuração do seu agente.

Benchmarks publicados de código: o Qwen tem dados, o Glimmer ainda não

O Qwen3.6-27B tem resultados oficiais de benchmark publicados no model card. Nas fontes consultadas para esta comparação, não foram encontrados resultados oficiais de SWE-bench, LiveCodeBench ou benchmark comparável de programação com agentes para o Muse Glimmer até agosto de 2026. Na prática, o Qwen tem uma base de evidências publicadas mais sólida, mas ainda não existe um confronto oficial diretamente comparável.

Benchmarks oficiais de programação do Qwen:

BenchmarkQwen3.6-27B (oficial)
SWE-bench Verified77.2
SWE-bench Pro53.5
SWE-bench Multilingual71.3
Terminal-Bench 2.059.3
LiveCodeBench v683.9

São resultados publicados pelo fornecedor. O model card informa que as avaliações do SWE-bench usam o scaffold interno de bash e edição de arquivos do Qwen, com temperatura 1.0, top-p de 0.95 e janela de contexto de 200K. Os resultados do SWE-bench Pro foram calculados sobre um conjunto refinado de tarefas, no qual o Qwen corrigiu itens problemáticos; portanto, a comparação direta com valores de rankings públicos pode não ser equivalente. A análise de terceiros da morphllm observa que esses resultados dependem do scaffold de agente do próprio Qwen e têm reprodução independente limitada.

Pontuações de benchmarks de programação: Qwen3.6-27B vs Muse Glimmer 30B no TerminalBench, SWE-bench Verified, SWE-bench Pro e LiveCodeBench v6

Testes locais de programação: o que os usuários encontraram

Teste com OpenCode em um M5 Pro

Um desenvolvedor executou o Muse Glimmer em quantização Q4, na build da Unsloth, em um M5 Pro com 48 GB de RAM via OpenCode. O modelo usou aproximadamente 20 GB de RAM e gerou 17 tokens por segundo. A conclusão foi:

"No geral, fica abaixo do Qwen3.6 27B" - u/curiousily_

As respostas para programação de frontend e backend foram avaliadas como inferiores às do Qwen. Por outro lado, o autor destacou um ponto positivo: o Muse Glimmer não falhou em nenhuma chamada de ferramenta durante o teste. Não foram configurados loops de raciocínio nem pensamento estendido, o que pode ter limitado o desempenho do Glimmer.

A armadilha do max_tokens

Outro usuário, no r/LocalLLM, descobriu que o Muse Glimmer pode parecer muito pior do que realmente é quando o orçamento de tokens de saída é pequeno demais. O modelo consome esse orçamento no raciocínio antes de gerar uma resposta visível, levando a respostas vazias ou truncadas. Ao aumentar max_tokens, o usuário elevou o resultado de seu harness de teste de 6/13 para 11/13 tarefas aprovadas, quase dobrando a taxa de aprovação sem mudar o modelo. Se você testar o Glimmer com limites padrão de saída, talvez esteja medindo sua configuração, não o modelo.

Loops no terminal com Hermes

Outro usuário relatou que o Muse Glimmer ficou preso em comandos excessivos de terminal ao ser usado com o framework de agentes Hermes, comportamento que ele não havia encontrado com o Qwen3.6-27B na mesma configuração. O relato anedótico segue a mesma direção da diferença observada no TerminalBench, embora não permita separar o efeito do modelo da configuração do Hermes.

Eficiência de tokens: uma vantagem ainda qualitativa

Uma publicação com galeria de benchmarks feita por u/NoFaithlessness951 levantou, no Reddit, uma questão de eficiência:

"Um pouco menos inteligente que o Qwen, mas usa muito menos tokens por tarefa." - u/NoFaithlessness951

Essa é uma observação qualitativa da comunidade, não uma medição controlada de tokens por tarefa concluída com sucesso. Nenhum estudo frente a frente quantificou a vantagem de tokens do Glimmer sobre o Qwen usando tarefas, taxas de sucesso e dados de latência equivalentes. Vale tratar essa alegação como um indício promissor, não como um fato estabelecido.

VRAM e contexto: onde o Glimmer leva clara vantagem

É neste ponto que o Muse Glimmer se destaca de forma decisiva. Um usuário no r/LocalLLaMA demonstrou que o Muse Glimmer 30B em Q4_K_XL, com decodificação especulativa DFlash, projetor multimodal e cache KV completo em F16, cabe em aproximadamente 22-23 GB de uma única RTX 3090, com uma janela de contexto configurada para 262.144 tokens.

Na mesma RTX 3090 e com a mesma quantização Q4_K_XL:

ModeloContexto KV em F16Contexto KV em Q8VRAM usada
Muse Glimmer 30B262,144N/A~22-23 GB
Qwen3.6-27B70,000125,000Cabe em 24 GB
Gemma 4 31B52,00081,000Cabe em 24 GB

O autor classificou o contexto F16 de 70K do Qwen como "no limite do inutilizável" para fluxos de trabalho que carregam no prompt o contexto de repositórios grandes.

Desempenho relatado do Muse Glimmer nessa RTX 3090:

  • Geração: 64-124 tokens por segundo, variando entre código e prosa
  • Processamento de prompt: ~1.400 tokens por segundo
  • Recuperação em contexto longo: passou em um teste haystack de duas agulhas com ~150K tokens na primeira tentativa

Na mesma máquina, o Qwen3.6-27B exige compressão do cache KV em Q8, sacrificando fidelidade de saída em troca de mais contexto, ou offload para uma máquina mais potente. O usuário relatou mover o Qwen para seu DGX Spark quando precisava do contexto completo, um equipamento significativamente mais caro.

Em hardware mais avançado, uma build NVFP4 do Qwen3.6-27B em um DGX Spark chegou a 28-33 tokens por segundo em sessão única, em contextos de até 128K, segundo a análise de benchmarks da kie.ai. Já uma build Unsloth Muse Glimmer Q5_K_M em uma RTX 5090 teria alcançado 220-253 tokens por segundo ao gerar patches de código, por meio de um caminho DFlash corrigido do llama.cpp.

Qual modelo faz mais sentido para você?

Seu cenárioEscolhaMotivo
Programação isolada, geração em uma única tentativaQwen3.6-27BEvidências mais fortes em benchmarks publicados de programação; lidera na comparação comunitária disponível do TerminalBench 2.1
Programação com agentes e contexto grande em uma única GPU de 24 GBMuse Glimmer 30B262K de contexto F16 contra 70K do Qwen no mesmo hardware, usando a configuração Q4_K_XL/DFlash
Tarefas longas de terminalQwen3.6-27B60.7 contra 51.7 no TerminalBench 2.1; há relato comunitário de loop em framework de agentes com o Glimmer
Alto volume com sensibilidade a custoMuse Glimmer 30B (possivelmente)Um relato da comunidade sugere menos tokens por tarefa; não há comparação equivalente de custo por sucesso
Programação em nível de repositório com contexto grandeMuse Glimmer 30B (se a VRAM for limitada)Para contexto grande em 24 GB, o Qwen precisa de compressão KV em Q8 ou de múltiplas GPUs
Máxima precisão em programação, sem limite de hardwareQwen3.6-27BBenchmarks publicados mais fortes e pontuações oficiais

Perguntas frequentes

O Muse Glimmer tem uma pontuação oficial no SWE-bench?

Não. Nas fontes consultadas para esta comparação, não foi encontrada nenhuma pontuação oficial de SWE-bench, LiveCodeBench ou TerminalBench para o Muse Glimmer 30B até agosto de 2026. A pontuação de 51.7 no TerminalBench 2.1 vem de testes da comunidade em tópicos do Reddit, não de uma avaliação oficial da Meta.

Os dois modelos rodam em uma única RTX 3090?

Sim. O Muse Glimmer 30B em Q4_K_XL cabe com contexto de 262K e cache KV completo em F16 usando ~22-23 GB. O Qwen3.6-27B em Q4_K_XL também cabe, mas fica limitado a 70K de contexto F16 ou 125K com compressão de cache KV em Q8 na mesma GPU.

O Muse Glimmer é censurado em tarefas de programação?

Um usuário relatou que o Muse Glimmer se recusou a ajudar a depurar código Python de controle de mouse, tratando-o como uma possível preocupação de segurança. Trata-se de um único relato anedótico, com prompt de sistema e configuração não especificados. Isso não é suficiente para determinar se o comportamento vem do próprio modelo ou do ambiente de inferência.

Qual é melhor para fluxos de programação com agentes?

O Qwen3.6-27B é mais confiável para tarefas longas de agentes no terminal, com base nas pontuações do TerminalBench e em relatos da comunidade. O Muse Glimmer 30B é mais viável em hardware limitado graças à eficiência de VRAM e pode usar menos tokens por tarefa, o que talvez reduza custo e latência em loops de agentes de alto volume. Ainda assim, nenhuma comparação controlada quantificou isso.

Que valor de max_tokens devo usar para programar com o Muse Glimmer?

Defina um orçamento generoso de saída. Um usuário observou que limites apertados de max_tokens faziam o Glimmer esgotar seu orçamento no raciocínio antes de produzir uma resposta visível, resultando em respostas vazias ou truncadas que pareciam falhas. Ao elevar o limite, ele melhorou seu harness de teste de 6/13 para 11/13 tarefas aprovadas. O model card do Qwen3.6-27B recomenda 32,768 tokens para consultas gerais e 81,920 para tarefas difíceis de benchmark; usar o mesmo orçamento de saída é um ponto de partida razoável para o Glimmer até que a Meta publique sua própria orientação.