Um modelo Qwen rápido para programação e tarefas longas
O Qwen3.8 Flash é a versão focada em velocidade do Qwen3.8 da Alibaba. Ele foi desenvolvido para programação, agentes que usam ferramentas e documentos que não cabem em um chat curto.
Modelo grande, custo baixo
125 bilhões de parâmetros no total, com cerca de 6 bilhões usados em cada token. É por isso que ele se mantém rápido e acessível para trabalhos de alto volume.
1 milhão de tokens de contexto
Coloque uma especificação extensa, vários arquivos ou um rastreamento longo de agente em uma única requisição. Uma única resposta pode ter até 131.072 tokens.
Lê imagens e texto
O modelo compreende capturas de tela, gráficos e documentos, não apenas texto simples. Use-o quando a tarefa começar a partir de algo na tela.
Cerca de $0,057 / $0,193
Por milhão de tokens, a entrada custa cerca de $0,057 e a saída cerca de $0,193, aproximadamente metade da tabela oficial. A entrada em cache é mais barata. A barra de preços acima mostra a taxa em tempo real.
Onde o Qwen3.8 Flash se destaca
O próprio model card do Qwen, publicado com o lançamento de agosto de 2026, classifica o Flash com a pontuação mais alta em programação e uso de ferramentas entre os modelos comparados.
Trabalho em repositórios
SWE-bench Pro 62.5. SWE-bench Multilingual 81.0. Use-o para encontrar um bug, editar vários arquivos e verificar o resultado.
Agentes que chamam ferramentas
DeepSWE 58.7. Toolathlon 73.5. Ele sustenta um loop de várias etapas: lê a falha, chama uma ferramenta e tenta novamente.
Código e perguntas complexas
LiveCodeBench v6 é 91.9. GPQA Diamond é 91.7. Programação competitiva e questões científicas estão ao seu alcance.
Análise visual de tela
Pontuação parcial no OSWorld: 52.3. MathVision: 90.6, ou 95.7 quando pode executar código. Capturas de tela e gráficos podem ser enviados com a pergunta.
Flash ou Max
Escolha o Flash
Agentes de programação, loops de teste e correção, documentos longos e qualquer carga de trabalho em que você se preocupe com a fatura. A janela de 1M cobre um rastreamento longo sem dividi-lo.
Escolha o Max
O Qwen3.8 Max é o carro-chefe de 2,4 trilhões de parâmetros. Use-o quando quiser o Qwen mais poderoso e o preço do token for secundário. Acesse em /chat/qwen3-8-max.
Mesmo formato de requisição
Ambos os modelos aceitam uma requisição de chat completion padrão. Para o Flash, defina o modelo como qwen3.8-flash. Aumente max tokens quando a resposta exigir um rastreamento longo. O padrão é 8.192 e o limite máximo é 131.072.
Perguntas
Contexto, preço, imagens e como ele se compara ao Max.
/ 01Para que serve o Qwen3.8 Flash?
Codificação rápida, agentes que utilizam ferramentas e documentos longos. É a versão mais barata e rápida do Qwen3.8, e não uma cópia reduzida do Max.
/ 02Qual é o tamanho do contexto?
1 milhão de tokens. Uma única resposta pode ter até 131.072 tokens.
/ 03Quanto custa?
Cerca de US$ 0,057 de entrada e US$ 0,193 de saída por milhão de tokens, cerca de metade da tabela oficial. A leitura a partir do cache custa menos. Não há taxa extra por chamada de ferramenta. A barra de preços exibe a tarifa em tempo real.
/ 04Ele consegue ler imagens?
Sim. Capturas de tela, gráficos e imagens de documentos são suportados pelo modelo, juntamente com texto.
/ 05Quando devo usar o Qwen3.8 Max?
Quando você quiser o modelo topo de linha e puder pagar mais por token. O Max é o modelo de 2.4T. O Flash é o indicado para volume.