AIREITER
DeepseekText Chat

DeepSeek V4.1 Flash

API DeepSeek V4.1 Flash abaixo da tabela da DeepSeek, sem acréscimo de horário de pico. Contexto de 1M, entrada nativa de imagens, pontuações máximas em programação agêntica. Experimente ou chame a API.

EntradaOficial $0.15 por 1 milhao de tokensAIReiter $0.1127 por 1 milhao de tokensSaídaOficial $0.60 por 1 milhao de tokensAIReiter $0.4507 por 1 milhao de tokensLeitura de cacheOficial $0.003 por 1 milhao de tokensAIReiter $0.0022 por 1 milhao de tokens
Executar com API

ENTRADA

SAÍDA

Example
Generated in
9.3 seconds
Token de entrada
184
Token de saída
1471
Tokens per second
158.17 tokens / second
Time to first token
-

Detalhes do modelo

Use a mesma chave de modelo no Playground, nas solicitações da API e nos fluxos de trabalho internos.

ID do modelo
deepseek-v4-1-flash
Provedor
Deepseek
Protocolo
OpenAI Chat Completions · Anthropic Messages
Janela de contexto
1,000,000 tokens
Saída máxima
384,000 tokens
Token de entrada
11.27 créditos / 1 mi de tokens
Token de saída
45.07 créditos / 1 mi de tokens
Leitura de cache
0.225 créditos / 1 mi de tokens
Gravação de cache
-

O que mudou no DeepSeek V4.1 Flash

O V4.1 Flash é uma nova família de modelos, não um reajuste do V4 Flash. A DeepSeek reconstruiu a arquitetura e a treinou do zero com 45 trilhões de tokens multimodais, e o nível Flash agora supera o V4 Pro na maioria dos benchmarks de agentes.

MoE causal encoder-decoder

Uma mistura de especialistas (MoE) de 552B dividida em um encoder de 20 camadas e um decoder de 20 camadas. Apenas 8B de parâmetros ficam ativos durante a leitura do prompt e 16B durante a escrita da resposta, razão pela qual um modelo desse porte permanece na faixa de preço Flash.

Programação agêntica superior ao V4 Pro

A DeepSeek reporta 90,6 no Terminal-Bench 2.1 contra 82,7 do V4 Flash e 87,9 do V4 Pro, 74,2 no DeepSWE contra 54,4 e 62,7, e 3471 no Codeforces. No Terminal-Bench 3.0, o salto vai de 7,6 para 30,0.

Visão integrada desde o treino, não adaptada

Um novo encoder DeepSeek-ViT foi treinado em conjunto com o modelo de texto desde a primeira etapa de pré-treinamento. O V4 Flash era apenas texto e sua variante de visão era experimental. Capturas de tela, gráficos e fotos entram na mesma requisição que o prompt.

Cache KV com um quarto do tamanho para contexto de 1M

Atenção esparsa comprimida e armazenamento de KV em FP4 reduzem o cache global para cerca de 890 bytes por token, aproximadamente um quarto do V4 Flash. É isso que permite que uma janela de 1M de tokens rode a custo de Flash e a 214 tokens por segundo em testes independentes.

DeepSeek V4.1 Flash vs. V4 Flash

Na DeepSeek, a migração já ocorreu automaticamente: o id oficial agora é deepseek-flash, e requisições que ainda especificam deepseek-v4-flash são atendidas pelo V4.1. Na AIReiter, os dois continuam como modelos separados para que você possa fixar qualquer um deles.

Menos parâmetros ativos, pontuações mais altas

O V4 Flash ativa 13B de parâmetros a cada token. O V4.1 Flash ativa 8B no prefill e 16B no decode e ainda assim o supera em todos os benchmarks de agentes publicados pela DeepSeek. Não encare o número menor no prefill como um downgrade.

O pensamento agora está sempre ativado

O V4 Flash oferecia modos de pensamento discretos. O V4.1 Flash usa um esforço contínuo de raciocínio e adota o nível alto por padrão. Nesta rota, uma requisição enviada com o pensamento desativado ainda retornará raciocínio; planeje o max_tokens adequadamente.

A entrada de imagens faz parte do modelo base

Se você direcionava capturas de tela para um endpoint de visão separado junto com o V4 Flash, o V4.1 Flash processa ambos em uma única chamada. Envie imagens como data URIs em base64 no array de conteúdo padrão; esta rota não busca URLs remotas de imagens.

O preço de tabela de saída dobrou, o de cache não

A saída oficial passou de US$ 0,28 para US$ 0,60 por milhão de tokens. A entrada com cache-hit permanece em torno de US$ 0,003. Cargas de trabalho com um prefixo longo e estável e respostas curtas custam praticamente o mesmo que antes; gerações prolixas custam mais.

Mantenha o V4 Flash quando

Uma suíte de avaliação fixada, um cliente que não lida com reasoning_content em loops de ferramentas ou um orçamento rigoroso de saída por token ainda não permitirem a migração. Caso contrário, inicie novos projetos no V4.1 Flash.

Preços da API do DeepSeek V4.1 Flash

A DeepSeek lista US$ 0,15 de entrada, US$ 0,60 de saída e US$ 0,003 de entrada com cache-hit por milhão de tokens fora do horário de pico, e dobra os três valores nos dias úteis das 01:00 às 04:00 e das 06:00 às 10:00 UTC. A AIReiter cobra uma taxa fixa 24 horas por dia: cerca de 25% abaixo da tabela fora de pico e 62% abaixo da tabela de pico.
01

Tarifa única o dia todo

As três linhas de tokens são faturadas a cerca de três quartos da tarifa fora de pico da DeepSeek. Não há janela de pico nesta rota, portanto, uma tarefa executada durante o horário comercial de Pequim custa o mesmo que uma executada à noite. Os valores em tempo real estão localizados acima do playground.

02

De onde vem a economia real

Em comparação com a tarifa de pico oficial, o preço da AIReiter é de cerca de 38%. Em relação à tarifa fora de pico, é de cerca de 75%. Se o seu tráfego for majoritariamente durante o dia na Europa ou nos EUA, que coincide com o pico da DeepSeek, a diferença é ainda maior do que parece no título.

03

Tokens de raciocínio são cobrados como saída

O modo de pensamento não pode ser desativado nesta rota e o V4.1 Flash é prolixo sob esforço alto. Testes independentes registraram cerca do dobro de tokens de saída em relação a modelos comparáveis no mesmo conjunto de tarefas. Configure max_tokens considerando o raciocínio somado à resposta.

04

Cache hits são a linha mais barata

Um token de entrada com cache-hit custa cerca de 2% de um token com cache-miss. Para loops de agentes que reenviam o mesmo system prompt e tool schema a cada turno, as leituras em cache dominam a fatura e é onde o V4.1 Flash é mais econômico.

Quando usar o DeepSeek V4.1 Flash — e quando não usar

A DeepSeek agora posiciona o Flash à frente do V4 Pro em qualidade, custo e velocidade. Os motivos restantes para escolher outra opção dizem respeito à recuperação de conhecimento e compatibilidade de clientes, não à capacidade bruta.
01

Use para codificação e agentes de terminal

Edições em múltiplos arquivos, loops de teste e correção, triagem de logs de CI e tarefas de computer-use são onde os ganhos divulgados em relação ao V4 Flash e V4 Pro são maiores. Longos traces de ferramentas cabem na janela de 1M sem necessidade de chunking.

02

Use para capturas de tela e gráficos

OCR a partir de capturas de tela de UI, leitura de gráficos ou verificação de páginas renderizadas podem ser enviados diretamente na mesma requisição da pergunta de código. Sem um segundo modelo, sem cobrança adicional.

03

Use o V4 Pro apenas por compatibilidade

A DeepSeek manteve o V4 Pro disponível após o lançamento do V4.1 Flash porque os clientes pediram, não por ele ter uma pontuação melhor. Continue no Pro caso um contrato ou uma avaliação congelada exija.

04

Não use como uma enciclopédia

O modelo base fica atrás do V4 Pro no SimpleQA-Verified por cerca de 13 pontos. Para consulta de fatos sem retrieval, dê contexto ao modelo com seus próprios documentos ou escolha um modelo ajustado para recall.

05

Compare com o GLM-5.3 Flash no preço

O GLM-5.3 Flash é o outro modelo flash multimodal na AIReiter e custa menos na saída. Escolha o V4.1 Flash quando a tarefa for um loop de agentes ou trabalho em repositório; escolha o GLM-5.3 Flash para extração e classificação em alto volume.

Chame a API do DeepSeek V4.1 Flash

O playground nesta página e a API compartilham o mesmo id de modelo. A única regra de integração que quebra clientes é como o raciocínio é tratado dentro de loops de ferramentas.

01

Envie uma tarefa real de agente no playground

Cole um log de erro com o diff e uma pergunta. Acompanhe os tokens de saída, que incluem o raciocínio (reasoning), e confirme a qualidade da resposta antes de integrar. A entrada de imagem está disponível via API.

02

POST /api/v1/chat/completions

Use o modelo "deepseek-v4-1-flash", uma chave de API da AIReiter e o payload padrão de Chat Completions. O streaming funciona normalmente. O mesmo id também é aceito em /api/v1/messages caso sua stack utilize Anthropic Messages.

03

Mantenha o round-trip de reasoning_content quando houver ferramentas

Sempre que a requisição incluir um array de tools, cada turno anterior do assistente deve carregar seu reasoning_content de volta, incluindo turnos que não fizeram chamadas de ferramentas. Omiti-lo retorna HTTP 400. Essa é a regra que quebrou vários frameworks de agentes no V4 e ainda se aplica.

04

Anexe imagens no array de content (API)

Use uma parte image_url com URI de dados em base64. PNG, JPEG, GIF e WebP são aceitos. URLs remotas de imagens não são buscadas nesta rota, portanto envie os bytes inline. Mantenha a parte em texto primeiro quando a imagem for apenas o contexto para uma pergunta, e não o assunto principal.

Perguntas sobre a API do DeepSeek V4.1 Flash

Model id, preços, a migração para o V4 Flash, entrada de imagens e a regra de raciocínio que gera erros.

/ 01

Qual é o model id da API do DeepSeek V4.1 Flash?

Na AIReiter, use deepseek-v4-1-flash. A chave interna é chat-deepseek-v4-1-flash. Diretamente na DeepSeek, o id oficial é deepseek-flash, e o id anterior deepseek-v4-flash agora também é atendido pelo V4.1 Flash.

/ 02

Como é calculado o preço do DeepSeek V4.1 Flash?

A DeepSeek lista US$ 0,15 de entrada, US$ 0,60 de saída e US$ 0,003 de entrada com cache-hit por milhão de tokens fora de pico, com os três dobrando durante o horário de pico nos dias úteis. A AIReiter cobra uma taxa fixa a qualquer hora, cerca de 25% abaixo da tabela fora de pico e 62% abaixo da tabela de pico. Os preços atuais das rotas são exibidos acima do playground.

/ 03

O V4.1 Flash é melhor que o V4 Pro?

Nos benchmarks de agentes e programação publicados pela DeepSeek, sim: o Terminal-Bench 2.1 é 90,6 contra 87,9 e o DeepSWE é 74,2 contra 62,7. O V4 Pro ainda lidera no GPQA Diamond e na recuperação de conhecimento. A própria DeepSeek agora direciona novos usuários para o Flash.

/ 04

O que há de diferente em relação ao V4 Flash?

Uma nova arquitetura encoder-decoder com 8B a 16B de parâmetros ativos em vez de 13B, entrada de imagem nativa, raciocínio sempre ativo, um cache KV de um quarto do tamanho para a janela de 1M e grandes ganhos em todos os benchmarks de agentes. O preço de tabela oficial de saída também aumentou de $0.28 para $0.60.

/ 05

Posso desativar o raciocínio?

Não nesta rota. Requisições que enviam o raciocínio desativado ainda retornam reasoning_content, e o reasoning_effort não é encaminhado. Em vez disso, controle os custos com max_tokens e um prompt mais conciso.

/ 06

Ele aceita imagens?

Sim, por meio da API. O recurso de visão é nativo no V4.1 Flash e foi verificado nesta rota. Envie PNG, JPEG, GIF ou WebP como um data URI em base64 em uma parte image_url; URLs remotas não são buscadas. O playground nesta página aceita apenas texto por enquanto.

/ 07

Por que meu loop de tool-calling retorna HTTP 400?

Você removeu o reasoning_content de uma mensagem anterior do assistente. Quando um array tools está presente, o DeepSeek exige o campo de raciocínio em cada turno anterior do assistente, mesmo em turnos sem uma chamada de ferramenta. Armazene-o e envie-o de volta inalterado.

/ 08

Quais limites de contexto e saída se aplicam?

A DeepSeek documenta uma janela de contexto de 1M de tokens e saída máxima de 384K. O playground tem como padrão 8192 tokens de saída; aumente esse valor para execuções longas de agentes e lembre-se de que os tokens de raciocínio contam para esse limite.

/ 09

Qual endpoint devo chamar?

POST https://aireiter.com/api/v1/chat/completions é o contrato principal para este modelo. POST https://aireiter.com/api/v1/messages também funciona com o mesmo id para clientes no estilo da Anthropic.

/ 10

Posso testar antes de integrar?

Sim. O playground nesta página executa o mesmo model id e rota da API, portanto, a contagem de tokens e o comportamento vistos aqui são exatamente o que a API retorna.