AIREITER
QwenText Chat

Qwen3.8 Flash

O Qwen3.8 Flash é um modelo rápido para programação, agentes e documentos longos. 1M de contexto. Cerca de $0,057 de entrada e $0,193 de saída por milhão de tokens.

EntradaOficial $0.1143 por 1 milhao de tokensAIReiter $0.0571 por 1 milhao de tokensSaídaOficial $0.3857 por 1 milhao de tokensAIReiter $0.1929 por 1 milhao de tokensLeitura de cacheOficial $0.0143 por 1 milhao de tokensAIReiter $0.0071 por 1 milhao de tokensCriação de cacheOficial $0.1429 por 1 milhao de tokensAIReiter $0.0714 por 1 milhao de tokens
Executar com API

ENTRADA

SAÍDA

Example
Generated in
42.7 seconds
Token de entrada
134
Token de saída
2354
Tokens per second
55.13 tokens / second
Time to first token
-

Detalhes do modelo

Use a mesma chave de modelo no Playground, nas solicitações da API e nos fluxos de trabalho internos.

ID do modelo
qwen3.8-flash
Provedor
Qwen
Protocolo
OpenAI Chat Completions
Janela de contexto
1,000,000 tokens
Saída máxima
131,072 tokens
Token de entrada
5.7143 créditos / 1 mi de tokens
Token de saída
19.2857 créditos / 1 mi de tokens
Leitura de cache
0.7143 créditos / 1 mi de tokens
Gravação de cache
7.1429 créditos / 1 mi de tokens

Um modelo Qwen rápido para programação e tarefas longas

O Qwen3.8 Flash é a versão focada em velocidade do Qwen3.8 da Alibaba. Ele foi desenvolvido para programação, agentes que usam ferramentas e documentos que não cabem em um chat curto.

Modelo grande, custo baixo

125 bilhões de parâmetros no total, com cerca de 6 bilhões usados em cada token. É por isso que ele se mantém rápido e acessível para trabalhos de alto volume.

1 milhão de tokens de contexto

Coloque uma especificação extensa, vários arquivos ou um rastreamento longo de agente em uma única requisição. Uma única resposta pode ter até 131.072 tokens.

Lê imagens e texto

O modelo compreende capturas de tela, gráficos e documentos, não apenas texto simples. Use-o quando a tarefa começar a partir de algo na tela.

Cerca de $0,057 / $0,193

Por milhão de tokens, a entrada custa cerca de $0,057 e a saída cerca de $0,193, aproximadamente metade da tabela oficial. A entrada em cache é mais barata. A barra de preços acima mostra a taxa em tempo real.

Onde o Qwen3.8 Flash se destaca

O próprio model card do Qwen, publicado com o lançamento de agosto de 2026, classifica o Flash com a pontuação mais alta em programação e uso de ferramentas entre os modelos comparados.

Trabalho em repositórios

SWE-bench Pro 62.5. SWE-bench Multilingual 81.0. Use-o para encontrar um bug, editar vários arquivos e verificar o resultado.

Agentes que chamam ferramentas

DeepSWE 58.7. Toolathlon 73.5. Ele sustenta um loop de várias etapas: lê a falha, chama uma ferramenta e tenta novamente.

Código e perguntas complexas

LiveCodeBench v6 é 91.9. GPQA Diamond é 91.7. Programação competitiva e questões científicas estão ao seu alcance.

Análise visual de tela

Pontuação parcial no OSWorld: 52.3. MathVision: 90.6, ou 95.7 quando pode executar código. Capturas de tela e gráficos podem ser enviados com a pergunta.

Flash ou Max

O Flash é o modelo para deixar rodando o dia todo. O Max é o carro-chefe para quando a complexidade do trabalho supera o orçamento.
01

Escolha o Flash

Agentes de programação, loops de teste e correção, documentos longos e qualquer carga de trabalho em que você se preocupe com a fatura. A janela de 1M cobre um rastreamento longo sem dividi-lo.

02

Escolha o Max

O Qwen3.8 Max é o carro-chefe de 2,4 trilhões de parâmetros. Use-o quando quiser o Qwen mais poderoso e o preço do token for secundário. Acesse em /chat/qwen3-8-max.

03

Mesmo formato de requisição

Ambos os modelos aceitam uma requisição de chat completion padrão. Para o Flash, defina o modelo como qwen3.8-flash. Aumente max tokens quando a resposta exigir um rastreamento longo. O padrão é 8.192 e o limite máximo é 131.072.

Perguntas

Contexto, preço, imagens e como ele se compara ao Max.

/ 01

Para que serve o Qwen3.8 Flash?

Codificação rápida, agentes que utilizam ferramentas e documentos longos. É a versão mais barata e rápida do Qwen3.8, e não uma cópia reduzida do Max.

/ 02

Qual é o tamanho do contexto?

1 milhão de tokens. Uma única resposta pode ter até 131.072 tokens.

/ 03

Quanto custa?

Cerca de US$ 0,057 de entrada e US$ 0,193 de saída por milhão de tokens, cerca de metade da tabela oficial. A leitura a partir do cache custa menos. Não há taxa extra por chamada de ferramenta. A barra de preços exibe a tarifa em tempo real.

/ 04

Ele consegue ler imagens?

Sim. Capturas de tela, gráficos e imagens de documentos são suportados pelo modelo, juntamente com texto.

/ 05

Quando devo usar o Qwen3.8 Max?

Quando você quiser o modelo topo de linha e puder pagar mais por token. O Max é o modelo de 2.4T. O Flash é o indicado para volume.