AIREITER

Qwen3.8-Flash-Next: guia do preview da arquitetura Qwen4

Última Atualização: 2026-08-28 03:58:47

Em 25 de agosto de 2026, o ModelScope, da Alibaba, publicou uma página de contagem regressiva para o Qwen3.8-Flash-Next — um modelo que apresenta uma nova arquitetura antes mesmo de existir a família de produtos para a qual ela foi criada. Até o momento desta publicação, os pesos estavam previstos para chegar em 26 de agosto, às 23h no fuso UTC+8. A ideia é dar tempo para o ecossistema de inferência open source preparar kernels, quantizações e suporte de serving antes da chegada do Qwen4.

O que o Qwen3.8-Flash-Next é — e o que ele não é

O Qwen3.8-Flash-Next é um modelo multimodal de Mixture-of-Experts (MoE), baseado na arquitetura planejada para a futura família Qwen4. Ele não é o Qwen4. Na prática, funciona como um demonstrador de tecnologia: um modelo operacional que expõe os novos mecanismos de atenção, a estrutura de camadas e os padrões de esparsidade para que os frameworks de inferência possam adicionar suporte antes do lançamento completo do Qwen4.

A página da equipe Qwen no Hugging Face o identifica como um "Upcoming release" e "A Preview of the Qwen4 Architecture." Já a página de contagem regressiva no ModelScope trazia o slogan "Onward to the Next-Gen — Lightning-Fast." Os dois são canais oficiais da Qwen, portanto o lançamento está confirmado — apenas ainda não estava concluído no momento desta publicação.

Qwen3.8-Flash-Next Hugging Face listing

Veja o que já foi confirmado e o que continua sendo especulação da comunidade:

Confirmado pelos canais oficiaisAinda não confirmado
Lançamento com pesos abertos no ModelScope e no Hugging FaceContagem final de parâmetros (125B/6B/51B)
Multimodal (visão + texto)Licença (provavelmente Apache 2.0, com base no histórico)
Arquitetura híbrida com GDN e Qwen Sparse AttentionQualquer pontuação de benchmark
Variante FP8 (Qwen/Qwen3.8-Flash-Next-FP8)Preço ou disponibilidade da API
Preview da arquitetura Qwen4Comprimento de contexto (especulado em 256K nativos, expansível até 1M)

Os números que todo mundo está citando — 125B no total, 6B ativos por token e 51B em embeddings de n-gramas — foram capturados de um card do ModelScope que apareceu brevemente e depois foi reduzido pela equipe Qwen. Eles são plausíveis e consistentes entre vários observadores independentes, mas não constituem documentação oficial definitiva. Como resumiu ghosty, fundador da SaaSCity:

"Anyone posting a benchmark chart for this model today made it up."

Uma arquitetura que muda o trabalho dos frameworks de inferência

Três componentes arquitetônicos fazem o Qwen3.8-Flash-Next se diferenciar de tudo o que existe hoje na linha Qwen. Cada um exige novos kernels nos frameworks de inferência — não apenas uma mudança de configuração.

Camadas GDN: estado recorrente de tamanho fixo e menos memória em contextos longos

A Gated Delta Network (GDN) substitui a atenção tradicional na maioria das camadas. Em um transformer convencional, o cache KV cresce conforme a sequência aumenta. A GDN trabalha com um estado recorrente de tamanho fixo: nas camadas GDN, o uso de memória permanece constante independentemente do comprimento do contexto, enquanto o custo computacional cresce de forma linear, em vez de quadrática. As camadas de atenção completa da arquitetura híbrida continuam usando cache KV para recuperar informações com precisão.

Na prática, isso barateia bastante as tarefas com contexto longo. Uma conversa de 100K tokens não precisa reservar memória de cache KV equivalente a 100K tokens. Segundo a composição de camadas atribuída à arquitetura Qwen3.8, são 69 camadas GDN para 23 camadas de atenção completa — uma proporção aproximada de 3:1 — com base na análise da comunidade sobre o card que ficou brevemente visível no ModelScope. As camadas de atenção completa preservam a qualidade da recuperação global, enquanto as camadas GDN processam a maior parte da sequência.

A ideia não é totalmente inédita na Qwen. O Qwen3-Next (setembro de 2025) introduziu a Gated DeltaNet com 80B de parâmetros totais e 3B ativos, e a família Qwen3.5/3.6/3.7 teria mantido um padrão híbrido semelhante. A novidade do Flash-Next está na escala — 125B de parâmetros totais usando essa arquitetura — e na adição dos dois componentes seguintes.

QSA: atenção esparsa, mas ainda sem explicação técnica

A Qwen Sparse Attention (QSA) aparece nomeada no card, mas não foi explicada. O consenso da comunidade é que ela substitui a atenção densa por um padrão esparso: cada token presta atenção apenas a um subconjunto dos demais, em vez de consultar a sequência inteira. Ainda não se sabe se a QSA usa esparsidade aprendida, blocos esparsos, janelas deslizantes ou uma combinação dessas técnicas. O relatório técnico, quando for publicado, dirá se a QSA é apenas uma melhoria incremental ou um mecanismo de atenção realmente novo.

A tabela de n-gramas de 51B: decoding especulativo sem modelo auxiliar

O recurso mais incomum é uma tabela de embeddings de n-gramas com 51B de parâmetros. A hipótese mais aceita na comunidade é que ela funcione como um mecanismo rápido de consulta de tokens — na prática, um modelo auxiliar integrado para decoding especulativo. Em vez de executar um modelo pequeno separado para prever os próximos tokens e depois validá-los com o modelo principal, a tabela de n-gramas forneceria candidatos baratos para os tokens seguintes.

As dúvidas são importantes: a tabela precisa ficar na VRAM ou pode ser mapeada na memória? Como ela se comporta após a quantização? Está incluída nos 125B ou é contabilizada à parte? Até que o relatório técnico ou os primeiros benchmarks da comunidade respondam a essas perguntas, trate os 51B como uma variável de planejamento de deployment, não como um custo fixo.

Onde o Flash-Next entra na árvore genealógica da Qwen

O Flash-Next é uma linha paralela, não o próximo degrau de uma evolução linear:

ModeloLançamentoParâmetros totaisParâmetros ativosFunção
Qwen3-NextSet. 202580B3BPrimeiro teste da arquitetura GDN
Qwen3.8-27BAgo. 202627B (denso)27BModelo denso intermediário para uso geral
Qwen3.8-MaxAgo. 2026~2.4T~95BFlagship com pesos abertos
Qwen3.8-Flash-Next26 de ago. de 2026~125B~6BPreview da arquitetura Qwen4
Qwen4A definir (meses)DesconhecidoDesconhecidoFamília completa de próxima geração

A conta que a comunidade vem usando é: sqrt(125B x 6B) = 27B. Se essa relação se confirmar, o Flash-Next pode entregar uma qualidade próxima à de um modelo denso de 27B, mas com um custo de inferência mais parecido com o de um modelo de 6B. Como observou Lucas Souza, da Beer And Code, trata-se de uma regra prática, não de um teorema — a qualidade do roteamento, dos dados e a contribuição da tabela de n-gramas ainda não foram medidas.

A estratégia — descrita em várias análises da comunidade como uma "platform play, not a benchmark play" — é permitir que frameworks como llama.cpp, vLLM e SGLang adicionem suporte aos kernels antes do lançamento do Qwen4. A Unsloth anunciou que está trabalhando para oferecer suporte desde o primeiro dia.

Dá para rodar? O choque de realidade do hardware

FormatoMemória aproximada para os pesos
BF16 / FP16~250 GB
FP8~125 GB
Q4 / 4-bit~65–70 GB

Esses valores consideram apenas os pesos, sem incluir contexto, cache KV ou o overhead do runtime. Um modelo quantizado em Q4 precisaria de aproximadamente 65–70 GB apenas para os pesos principais, além do espaço exigido pela tabela de n-gramas de 51B. Se a tabela precisar ficar na VRAM, o total ultrapassará a capacidade da maioria das configurações com uma única máquina. Caso ela possa ser mapeada na RAM do sistema, uma máquina com 128GB ou mais de memória unificada — Mac Studio (M2 Ultra / M3 Ultra no máximo), AMD Strix Halo ou NVIDIA DGX Spark — pode ser viável. Uma única RTX 4090 ou 5090 não dá conta.

No Reddit, u/KURD_1_STAN contestou a ideia de que o modelo seria "local-friendly": "Ram prices this high, how can u call this local friendly?" A diferença entre o marketing dos "6B ativos" e a exigência de 250GB de memória é concreta. No X, @Dicklong1999 observou que o padrão de ativação esparsa pode resultar em uma velocidade de geração razoável para quem tiver o hardware necessário, mas que "125B, ordinary people can basically forget about running it locally."

O que esperar de disponibilidade e preço da API

O preço e a disponibilidade da API do Qwen3.8-Flash-Next não haviam sido anunciados até a publicação. O Qwen3.8-Max custa US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, conforme a página oficial de preços da Qwen; com 6B de parâmetros ativos, o Flash-Next deve ser consideravelmente mais barato. A variante FP8 reduz pela metade a memória ocupada pelos pesos em comparação com BF16, tornando-se um formato natural para servir o modelo via API. A disponibilidade dependerá do suporte dos frameworks de inferência — confira os catálogos dos provedores depois que os pesos forem publicados.

O que fazer antes da liberação dos pesos

Se você é desenvolvedor ou pesquisador e quer avaliar a importância do Qwen3.8-Flash-Next para a sua stack, vale seguir este checklist:

1. Confira o hardware. Se pretende rodar o modelo localmente, confirme se tem 128GB ou mais de memória unificada ou uma configuração com várias GPUs. Caso contrário, planeje usar a API.

2. Acompanhe o repositório no Hugging Face. O model card será a primeira fonte confiável sobre as especificações reais, a licença e o comprimento de contexto. Salve nos favoritos huggingface.co/Qwen/Qwen3.8-Flash-Next.

3. Deixe o pipeline de avaliação pronto. Prepare os prompts dos seus benchmarks e os scripts de avaliação antes da chegada dos pesos. As primeiras 24 horas de benchmarks da comunidade dirão mais do que qualquer número oficial.

4. Não migre cargas de produção. Ainda não existem benchmarks independentes. A arquitetura é nova, o suporte de runtime ainda é imaturo e a licença não foi confirmada. Use o modelo para avaliação, não em nada cuja falha possa gerar prejuízo.

5. Se você mantém ferramentas de inferência, comece agora. A combinação GDN + QSA exige trabalho de kernel, não apenas alterações de configuração. Quanto antes você entender a arquitetura, mais rápido poderá lançar o suporte.

Perguntas frequentes

Quando os pesos estarão disponíveis?

A contagem regressiva do ModelScope apontava para 26 de agosto de 2026, aproximadamente às 23h no fuso UTC+8. Os mirrors do Hugging Face normalmente aparecem poucas horas depois de um lançamento no ModelScope. A equipe Qwen confirmou o horário por canais oficiais — @Alibaba_Qwen provocou a comunidade perguntando "what surprise we're dropping tonight" e @QwenDevs citou diretamente o nome do modelo.

Este é o Qwen4?

Não. Trata-se de um preview da arquitetura Qwen4 usando a convenção de nomes Qwen3.8. O Qwen4 em si é esperado para daqui a meses, não semanas. O Flash-Next existe para que o ecossistema prepare o suporte de runtime antes da chegada da família completa.

Qual licença ele usa?

Ainda não foi confirmado. Lançamentos recentes da Qwen com pesos abertos, como Qwen3.8-27B e Qwen3.8-Max, usaram Apache 2.0, que é o cenário mais provável. Confirme no model card quando os pesos estiverem disponíveis.

Posso rodá-lo em uma RTX 4090?

Não. Mesmo com quantização Q4, apenas os pesos principais exigem cerca de 65–70 GB. Uma única RTX 4090 tem 24 GB. Você precisará de um sistema com 128GB ou mais de memória unificada, como um Mac Studio ou Strix Halo, ou de várias GPUs com muita VRAM.

Ele supera o Qwen3.8-27B?

Não se sabe. Ainda não há benchmarks. A heurística sqrt(125B x 6B) = 27B sugere uma qualidade comparável à de um modelo denso de 27B, mas isso é uma estimativa, não uma medição. Espere avaliações independentes voltadas ao seu caso de uso.

Qual será a velocidade?

A contagem de 6B de parâmetros ativos por token sugere uma velocidade de geração mais próxima à de um modelo pequeno do que à de um gigante de 125B. Mas o padrão de acesso à memória da tabela de n-gramas e a eficiência do kernel GDN ainda são variáveis desconhecidas. Os primeiros benchmarks da comunidade devem responder a essa questão.

Ele estará disponível em plataformas de API?

Quase certamente. A variante FP8 foi criada justamente pensando em serving via API. A AIReiter e outras plataformas normalmente adicionam modelos Qwen poucos dias depois do lançamento dos pesos. O gargalo está no suporte dos frameworks aos novos mecanismos de atenção.

O que aconteceu com o Qwen3-Next do ano passado?

O Qwen3-Next foi lançado em setembro de 2025 com 80B de parâmetros totais e 3B ativos, introduzindo a Gated DeltaNet. Foi um teste arquitetônico em menor escala que mostrou que a abordagem híbrida com GDN funcionava. O Flash-Next é a sequência ampliada desse experimento. Um usuário do X, @LufzzLiz, observou que a série Next do ano passado "was a letdown" — justamente por isso vale esperar pelos benchmarks desta vez.