Thinking Machines Inkling é um modelo de pesos abertos com 975 bilhões de parâmetros, lançado em 15 de julho de 2026, construído como uma mistura esparsa de especialistas que ativa apenas 41B parâmetros por token e aceita entrada de texto, imagem e áudio. Ele é distribuído sob Apache-2.0, então você pode baixar os pesos completos e ajustá-los comercialmente. O porém: até mesmo uma quantização de 4 bits precisa de aproximadamente 600 GB de VRAM, então este é um modelo que equipes avaliam em um cluster, não algo que você executa em uma GPU para jogos.
As especificações e o que as manchetes interpretaram errado
Aqui está o que o cartão do modelo no Hugging Face e a página oficial do Inkling informam (acessado em 16 de julho de 2026).
| Especificação | Inkling |
|---|---|
| Total de parâmetros | 975B |
| Parâmetros ativos | 41B por token |
| Arquitetura | decoder-only de 66 camadas, sparse MoE (256 experts, 6 routed + 2 shared) |
| Modalidades | Texto, imagem, áudio de entrada; texto de saída (UTF-8) |
| Dados de treinamento | 45 trilhões de tokens |
| Licença | Apache-2.0 |
| Download | Hugging Face (thinkingmachines/inkling) |
Três coisas circulando na cobertura de lançamento precisam de correção:
- Janela de contexto. Vários artigos citaram uma janela de 1M de tokens. A página oficial do Inkling lista 64K como padrão e 256K quando executado pela plataforma Tinker; o cartão do Hugging Face não informa nenhum número. Considere 64K/256K como os valores que você pode verificar e 1M como não confirmado.
- Licença. Está confirmado que é Apache-2.0, uma das licenças mais permissivas disponíveis, e permite uso comercial. A Thinking Machines realmente transfere para você a responsabilidade pela segurança do fine-tuning.
- "Inkling-Small." Uma variante menor com ~12B parâmetros ativos apareceu em alguns relatos, mas não está सूचीada no cartão do modelo no Hugging Face. Até que ela apareça lá, não planeje com base nela.
O que "975B parameters" realmente significa aqui
Inkling roteia cada token para 6 de 256 experts, mais 2 experts compartilhados, então apenas cerca de 41B parâmetros são ativados por vez, embora o conjunto completo seja de 975B. É por isso que a Thinking Machines afirma que ele iguala o Nemotron 3 Ultra da Nvidia em programação enquanto gasta aproximadamente um terço menos tokens para chegar lá: você obtém a amplitude de um modelo grande com o custo de inferência de um modelo de médio porte.
O Inkling também oferece um ajuste de "thinking effort". Aumente-o para problemas mais difíceis e aceite respostas mais lentas e deliberadas, ou diminua-o para ganhar velocidade. Ele foi treinado para sinalizar incerteza em vez de adivinhar, o que é mais importante para uma base de fine-tuning do que para um chatbot de consumo.
Você realmente consegue executar o Inkling?
É aqui que o rótulo "open weights" fica complicado, porque aberto não significa leve. Aqui está, em linhas gerais, o que é necessário para servir o modelo completo de 975B, com base no model card e nas estimativas iniciais da comunidade (estes são valores aproximados, não garantias):
- BF16 (precisão total): ~2TB de VRAM apenas para os pesos, então 16+ GPUs classe H200, ou um nó B300 com 8 GPUs, antes de adicionar a sobrecarga de serving.
- NVFP4 / 4 bits: ~600GB, ainda no território de servidor multi-GPU (cerca de 4× H200 ou 8× placas de 80GB).
- GGUF de 1-2 bits (llama.cpp / quants do Unsloth): ~280-350GB de RAM+VRAM combinados, viável em uma workstation de alto nível ou em um Mac Studio Ultra totalmente equipado, e mais lento quando você avança para contextos longos porque o KV cache cresce.
A leitura honesta: uma equipe bem financiada pode avaliar e fazer o fine-tuning do Inkling, mas hoje não há um caminho viável em GPU de consumo para executá-lo localmente. Se você é um desenvolvedor solo esperando carregá-lo em uma única placa de 24 GB, este não é o seu modelo. Você o baixa do Hugging Face em thinkingmachines/inkling, ou faz fine-tuning por meio da plataforma Tinker da Thinking Machines, que também libera o contexto de 256K.
Onde o Inkling se posiciona em relação a outros modelos
A Thinking Machines afirma abertamente que o Inkling não é o modelo mais forte disponível, e os benchmarks do model card confirmam isso: o Inkling tem um bom desempenho, mas fica atrás da fronteira fechada em raciocínio e programação.
| Benchmark | Inkling | Melhor rival citado |
|---|---|---|
| AIME 2026 | 97.1% | GPT 5.6 Sol, 99.9% |
| SWE-bench Verified | 77.6% | Claude Fable 5, 95.0% |
| MMMU Pro | 73.3% | Claude Fable 5, 84.2% |
| VoiceBench | 91.4% | Gemini 3.1 Pro, 94.3% |
*Fonte: card do modelo Inkling e página oficial de benchmark, acessados em 16 de julho de 2026.*
O gráfico radar oficial conta a mesma história visualmente. Inkling se mantém competitivo em raciocínio e tarefas multimodais, mas fica atrás de GPT 5.6 Sol e Claude Fable 5 em codificação agentiva (SWE-bench Pro, Terminal Bench).
Onde ele se destaca é na amplitude: compreensão nativa de áudio e imagem em um único modelo aberto, com uma lacuna em programação que você pode reduzir por meio de fine-tuning. Se você precisa de coding agentic de primeira linha já pronto para uso, um modelo fechado de ponta ainda vence. Se você precisa de uma base multimodal aberta que você possui, Inkling é a opção mais interessante.
Para quem a Inkling é realmente destinada
Inkling é uma base sobre a qual construir, não um assistente acabado. A Thinking Machines ganha dinheiro com o Tinker, sua plataforma de fine-tuning, e não com chamadas de API medidas, então o modelo em si é gratuito e a proposta é "pegue isto e especialize-o."
O ponto de prova mais claro é a Bridgewater Associates: segundo a Thinking Machines, uma versão do modelo ajustada para finanças obteve 84,7% no teste de raciocínio da empresa, a cerca de um décimo quarto do custo de um modelo proprietário. Esse é o uso pretendido: um generalista capaz que uma equipe adapta para um domínio específico.
Então, faz sentido se você tiver a infraestrutura e a expertise em fine-tuning para especializar um modelo aberto e ser dono do resultado, e se puder assumir a responsabilidade pelo safety tuning. Ignore isso se você quiser um chatbot pronto para uso ou estiver trabalhando com hardware de consumo, porque os modelos fechados de uso geral são mais baratos de alcançar e mais fortes desde o primeiro dia. Um detalhe importante: o post-training da Inkling usou dados gerados por outros modelos abertos, incluindo o Kimi K2.5 da Moonshot, e a Thinking Machines diz que sua próxima geração será totalmente treinada por conta própria.
Perguntas frequentes sobre Inkling
O Inkling é gratuito para uso comercial?
Sim. Ele é distribuído sob a licença Apache-2.0, que permite uso comercial e modificação. Você é responsável por qualquer ajuste fino de segurança antes de implantá-lo.
Onde posso baixar o Inkling?
Os pesos completos estão no Hugging Face em thinkingmachines/inkling. Builds GGUF quantizados da comunidade também aparecem lá.
O Inkling realmente tem uma janela de contexto de 1 milhão de tokens?
A página oficial lista 64K por padrão e 256K através da plataforma Tinker. O valor de 1M em algumas coberturas não está confirmado no model card, então planeje em torno de 64K/256K.
Inkling vs DeepSeek ou Qwen, qual é melhor?
Depende da tarefa, não de uma única pontuação. A vantagem do Inkling é a entrada multimodal nativa (texto, imagem, áudio) em um único modelo Apache-2.0, além do caminho de fine-tuning do Tinker; os principais modelos abertos chineses continuam sendo opções fortes para uso geral e codificação. Avalie-os no seu próprio caso de uso antes de decidir.
O que é o Tinker e eu preciso dele?
Tinker é a plataforma de fine-tuning hospedada da Thinking Machines. Você não precisa dela para executar os open weights, mas é o caminho oficial para personalizar o Inkling e amplia a janela de contexto para 256K.
---
Leitura relacionada
