Modelos com 124 bilhões de parâmetros costumam ser lentos e caros de servir. O Ling 3.0 Flash foge dessa regra: ele ativa cerca de 5,1B de parâmetros por token e, neste momento, pode ser usado gratuitamente.
A inclusionAI o lançou em 23 de julho de 2026 como um modelo Mixture-of-Experts (MoE) com raciocínio híbrido, voltado a agentes que programam, chamam ferramentas, fazem pesquisas e executam tarefas longas.
O que é o Ling 3.0 Flash
O Ling 3.0 Flash vem da inclusionAI, grupo de pesquisa responsável pelas famílias de modelos Ling e Ring da Ant Group. A Ant Group é a empresa de fintech por trás do Alipay. O nome “Flash” identifica a linha rápida e mais eficiente em custo, abaixo dos modelos flagship bem maiores do grupo.
Trata-se de um modelo Mixture-of-Experts: dos seus 124B de parâmetros totais, apenas ~5,1B entram em ação para cada token. Na prática, isso o aproxima de um modelo pequeno em velocidade e custo de execução.
Ele também usa raciocínio híbrido: responde diretamente a pedidos simples e muda para um modo de reflexão mais longo quando a tarefa exige mais. A inclusionAI o posiciona para “agentes em escala de produção” — cargas de trabalho que usam ferramentas, navegam, escrevem e executam código, além de manter estado ao longo de várias etapas.
O ganho de eficiência por trás do modelo
Comparado ao antecessor Ling 2.6 Flash, o total de parâmetros cresceu de 104B para 124B. Ao mesmo tempo, os parâmetros ativos caíram de 7,4B para 5,1B.
Mais parâmetros totais significam mais espaço para armazenar conhecimento. Menos parâmetros ativos reduzem o custo de gerar cada token. Na prática, você paga algo próximo ao custo de inferência de um modelo de ~5B, mas acessa uma capacidade de 124B.
Isso faz ainda mais diferença em agentes. Quando uma tarefa consome milhares de tokens em várias chamadas de ferramentas, o custo por token pesa mais na conta. Nesse cenário, reduzir os parâmetros ativos vale mais do que exibir um número total maior.
Por baixo dos panos, há uma pilha híbrida de atenção linear. A inclusionAI descreve um bloco recorrente de cinco camadas KDA, de atenção linear, para uma camada de atenção completa MLA. A atenção linear mantém o custo de entradas longas sob controle; a camada periódica de atenção completa preserva a recuperação precisa de informações que modelos puramente lineares perdem. É isso que permite ao Flash trabalhar com contexto nativo de 256K, com margem para chegar a 1M. Nos routers, isso aparece como 262K, a contagem exata de 262.144 tokens.
Para quais tarefas ele foi feito
O Flash é ajustado para trabalho agentivo, não para conversa aberta sem foco. O anúncio da inclusionAI cita maior precisão em chamadas de ferramentas, desempenho mais estável em tarefas de longo horizonte e melhor compatibilidade com frameworks comuns de “harness” para agentes. As demonstrações de lançamento seguem essa linha: uma cidade 3D no Blender, pesquisa com múltiplos agentes, tarefas do Office via MCP e aplicações de navegador.
Em programação, a inclusionAI o posiciona para raciocínio espacial e estrutural — como grades de cena e posições relativas — além da geração de código convencional.
Há uma ressalva importante sobre benchmarks: o modelo tem poucos dias de vida, portanto os números disponíveis vêm das próprias alegações da inclusionAI e de testes iniciais da comunidade, não de avaliações independentes. A inclusionAI afirma que o Flash iguala ou supera seu flagship de ~1 trilhão de parâmetros em várias tarefas, usando uma fração dos parâmetros ativos, e sua tabela de resultados aponta 56,63 no SWE-Bench Pro em modo de reflexão. Até haver confirmação de terceiros, trate esses dados como números do fornecedor.
Como testar o Ling 3.0 Flash grátis agora
O caminho mais rápido é o OpenRouter. O modelo aparece como inclusionai/ling-3.0-flash, com preço de lançamento de US$ 0 para entrada e US$ 0 para saída, gratuito até 3 de agosto de 2026 (preço verificado em 24 de julho de 2026). Ele também está grátis no ZenMux. Os dois oferecem API compatível com OpenAI.
Uma chamada mínima:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
Qualquer cliente que já converse com chat/completions funciona depois de trocar a URL-base, a chave e a string do modelo. Um model router também permite comparar o Ling 3.0 Flash com seu modelo atual nos mesmos prompts, sem reescrever nada.
Há dois pontos para considerar no orçamento. A janela gratuita é promocional, então espere cobrança por uso depois do início de agosto. Como referência, o antecessor Ling 2.6 Flash custa cerca de US$ 0,01 para entrada e US$ 0,03 para saída por milhão de tokens. Além disso, no lançamento apenas um provedor servia o modelo, então vazão e disponibilidade dependem desse único backend.
Dá para baixar os pesos?
É aqui que buscas por “Ling 3.0 flash download” e “Ling 3.0 flash github” não levam a lugar algum. No lançamento, os pesos não foram disponibilizados. Por enquanto, o Flash é exclusivo via API.
Isso muda o cenário em relação ao modelo anterior: o Ling 2.6 Flash foi lançado com pesos abertos no Hugging Face, então já pode ser executado localmente. O Flash 3.0, não.
Se você quer hospedar o modelo por conta própria ou quantizá-lo para seu hardware, acompanhe a página da inclusionAI no Hugging Face: os pesos da versão 2.6 estão lá, e uma versão 3.0 provavelmente apareceria ali caso o grupo repita o padrão. Até lá, os routers de API acima são a única porta de entrada.
Ling 3.0 Flash vs. Ling 2.6 Flash
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| Lançamento | 23 de jul. de 2026 | 21 de abr. de 2026 |
| Parâmetros totais | 124B | 104B |
| Ativos por token | ~5,1B | ~7,4B |
| Janela de contexto | 256K nativo (262K nos routers) | 256K (262K nos routers) |
| Pesos abertos | Não no lançamento | Sim (Hugging Face) |
| Preço de lançamento | Grátis até 3 de agosto de 2026 | ~US$ 0,01 de entrada / US$ 0,03 de saída por 1M |
| Foco | Agentes com raciocínio híbrido, uso de ferramentas e programação | Modelo instruct rápido para agentes |
Em resumo: o 3.0 Flash troca uma parcela do processamento ativo por mais capacidade e um modo de raciocínio híbrido, além de adotar uma distribuição voltada primeiro à API. Se você precisa especificamente de pesos locais e offline, o 2.6 Flash continua sendo a opção que pode baixar.
Perguntas frequentes
O Ling 3.0 Flash é grátis?
Sim, por enquanto. Ele está grátis no OpenRouter até 3 de agosto de 2026 e também no ZenMux. Espere preços por uso quando essa janela acabar.
O Ling 3.0 Flash é open source? Posso baixá-lo ou encontrá-lo no GitHub?
Não no lançamento. Nenhum peso foi publicado, portanto ele só está disponível por API, sem download ou repositório. Use o OpenRouter (inclusionai/ling-3.0-flash) ou o ZenMux. O Ling 2.6 Flash mais antigo está aberto no Hugging Face, então eventuais pesos do 3.0 provavelmente apareceriam lá também.
O Ling 3.0 Flash é um modelo chinês?
Sim. Ele foi criado pela inclusionAI, grupo de pesquisa em IA ligado à Ant Group, a empresa chinesa de fintech por trás do Alipay.
Qual é o tamanho do Ling 3.0 Flash?
São 124B de parâmetros totais, com ~5,1B ativos por token graças ao design MoE, e contexto nativo de 256K que, segundo a inclusionAI, pode escalar para 1M.
Ling 3.0 Flash vs. Ling 2.6 Flash: qual devo usar?
Escolha o 3.0 Flash para trabalho com agentes de raciocínio híbrido e menor custo por token via API. Escolha o 2.6 Flash se precisa baixar os pesos e rodar localmente, pois o 3.0 ainda não é aberto.
