AIREITER
DOCS APIPREÇOS
TEMPLATES
  • AIReiter
  • Blog
  • Modelos K2 Horizon: qual tamanho usar? (2026)

Modelos K2 Horizon: qual tamanho usar? (2026)

Última Atualização: 2026-09-03 19:02:05

K2 Horizon é uma família de seis modelos, de 0,9B a 375B parâmetros. A escolha certa depende da memória disponível, do suporte do runtime e da carga de trabalho — e não apenas da maior contagem de parâmetros.

Resumo prático: escolha pelo uso, não pelo número de parâmetros

A IFM lançou seis modelos K2 Horizon em 3 de setembro de 2026, conforme detalhado em seu post oficial de lançamento. Cada um atende a um perfil de implantação distinto, e os 512K de contexto anunciados não significam, automaticamente, uma carga de produção de 512K econômica.

Seu caso de usoMelhor ponto de partidaPlanejamento de pesos brutos*Principal alerta
Experimento edge ou embarcado com recursos restritosK2 Horizon 0.9B~1,8GB em BF16; ~0,45GB teóricos em 4 bitsNão deduza a velocidade real no dispositivo apenas pelo tamanho do modelo
Assistente local leve ou fine-tuningK2 Horizon 3.7B~7,4GB em BF16; ~1,85GB teóricos em 4 bitsRecuperação em agentes com múltiplas etapas complexas continua sendo um ponto fraco de modelos pequenos
Agente local de programação ou primeiro teste documentadoK2 Horizon 7B~14–18GB em BF16; ~3,5–4,5GB teóricos em 4 bitsO card recomenda esforço de raciocínio alto e pelo menos 32.768 tokens de saída
Implantação local ou em servidor com arquitetura esparsaK2 Horizon MoVA 36B-A4B~74,9GB no GGUF BF16 oficialO rótulo de 4B ativos não transforma o consumo de memória em algo equivalente a um modelo de 4B
Comparação com modelo denso ou baseline de pesquisaK2 Horizon 32B~64GB estimados em BF16O artefato GGUF atual está identificado como Stage1
Raciocínio e agentes em escala empresarialK2 Horizon 375B-A23B~750GB estimados em BF16; ~187,5GB teóricos em 4 bitsTrate-o como uma implantação em cluster até que preço e desempenho hospedados sejam documentados

São estimativas de pesos brutos antes do overhead de quantização, da memória do runtime, dos arquivos do tokenizador e do cache KV. Não representam requisitos mínimos de RAM ou VRAM.

Para o primeiro teste local, use o K2 Horizon 7B. Ele tem as instruções públicas de serving mais claras e um card de benchmarks útil. Passe para o 36B-A4B somente se backend, quantização e memória fizerem sentido para sua carga de trabalho. Considere o 375B-A23B uma implantação com múltiplos aceleradores até que algum provedor publique preço e desempenho concretos.

O que a IFM lançou em 3 de setembro de 2026

A IFM disponibilizou pesos dos modelos, código, configurações de treinamento, checkpoints intermediários, material de avaliação e, conforme os direitos de redistribuição, os dados de treinamento ou receitas documentadas de construção.

Segundo a IFM, os pesos dos modelos e o código usam licença Apache 2.0. Os termos dos datasets podem variar, incluindo ODC-BY, e dados-fonte restritos podem ser documentados em vez de redistribuídos. Confira cada repositório antes de uso comercial.

Página oficial de lançamento do IFM K2 Horizon

A IFM cita vLLM, SGLang e Ollama, enquanto seu comunicado à imprensa menciona Compass, Cerebras e Nebius como parceiros de inferência.

Mapa de implantação para cada modelo

0.9B e 3.7B: escolha quando a prioridade for o menor footprint

K2 Horizon 0.9B e 3.7B são modelos densos voltados a uso local limitado ou em dispositivos. A IFM posiciona a variante 0.9B para aparelhos muito restritos, como relógios e óculos, enquanto o 3.7B mira celulares, fine-tuning e fluxos de trabalho leves.

Considerando apenas pesos brutos em BF16, a conta simples de dois bytes por parâmetro resulta em cerca de 1,8GB para o 0.9B e 7,4GB para o 3.7B. A estimativa em 4 bits equivale a aproximadamente um quarto desses valores, antes de overhead do runtime, arquivos do tokenizador, memória do sistema operacional e cache KV. São estimativas de armazenamento, não exigências garantidas de RAM nem medições de tokens por segundo.

As tabelas oficiais de resultados informam que o 3.7B lidera algumas comparações exibidas, incluindo SWE-bench Verified com 68,6%, HMMT February 2026 com 70,45% e SciCode com 25,9%. A mesma tabela o coloca abaixo do Qwen3.5-4B em TerminalBench 2.1, BFCL v4 e GPQA Diamond. Esses números são comparações reportadas pelo fornecedor, não testes locais independentes.

Os menores modelos fazem sentido em tarefas específicas nas quais memória e consumo energético pesam mais. Eles não deveriam ser a escolha padrão para agentes que precisam explorar possibilidades, se recuperar de erros e chamar ferramentas repetidamente.

7B: o primeiro teste local mais bem documentado

O K2 Horizon 7B é o ponto de partida mais útil para desenvolvedores porque o model card oficial no Hugging Face traz exemplos validados de serving, configurações de parser de raciocínio, parser de chamadas de ferramentas e orientações sobre revisões.

O card informa uma janela de contexto nativa de 524.288 tokens, mas seu exemplo com vLLM usa --max-model-len 131072. O contexto máximo suportado e o tamanho de implantação testado não são a mesma coisa. Contextos longos também aumentam a memória do cache KV e a latência à medida que o prompt cresce.

O model card informa os seguintes resultados usando reasoning_effort="high", temperature=1.0, top_p=0.95 e pelo menos 32.768 tokens de saída:

BenchmarkK2 Horizon 7BReferência listada mais forteDiferença
HMMT Feb 202673,3Granite 4.2-8B: 66,5+6,8
SWE-bench Verified70,6Qwen3.5-9B: 50,8+19,8
HLE18,6Gemma 4-12B: 15,7+2,9
SciCode31,6Granite 4.2-8B: 30,4+1,2
LCR68,0Qwen3.5-9B: 65,3+2,7
Terminal-Bench 2.139,1Qwen3.5-9B: 29,2+9,9
tau3-Banking25,8Muse Glimmer-30B: 24,0+1,8
BrowseComp59,0LongCat Flash Thinking-2601: 56,6+2,4

O card do 7B informa 70,6% no SWE-bench Verified, contra 68,4% na tabela de lançamento da IFM; trate-os como resultados de avaliação que não são intercambiáveis.

Há ainda uma ressalva de nomenclatura. O card chama o modelo de “7B-core” e o enquadra na classe 7B, enquanto os metadados do Hugging Face exibem 9B parâmetros. A IFM não concilia esses rótulos; para planejar capacidade, use o footprint de memória real do repositório.

32B ou 36B-A4B: baseline denso versus teste de eficiência esparsa

As variantes 32B e 36B-A4B respondem a perguntas técnicas diferentes para quem roda modelos localmente ou em servidor.

ModeloArquiteturaTamanho aproximado dos pesos brutos em BF16Leitura prática atual
K2 Horizon 32BDensa~64GBReferência densa, mas o artefato GGUF atual está identificado como Stage1
K2 Horizon MoVA 36B-A4BMoE esparsa com MoVA~72GB; o GGUF BF16 oficial tem cerca de 74,9GBMais eficiência em parâmetros ativos, mas ainda é um modelo grande para armazenar

O modelo 36B-A4B tem cerca de 36B de parâmetros totais e 4B de parâmetros ativos por token. O design MoVA da IFM aplica esparsidade ao cálculo de valores da atenção, além do roteamento esparso nas camadas feed-forward. Parâmetros ativos descrevem a computação por token; eles não determinam o requisito total de memória.

O repositório GGUF do 36B-A4B oferece um arquivo BF16 de cerca de 74,9GB e direciona usuários para llama.cpp, vLLM, SGLang e Transformers. Verifique backend, quantização, cache KV e memória disponível antes de presumir que ele é viável em uma workstation.

O repositório GGUF do 32B está marcado como Stage1 em seu artefato exposto. Por isso, é uma escolha ruim para uma decisão final de produção até que a IFM identifique claramente o checkpoint definitivo.

375B-A23B: flagship capaz, mas não para baixar e rodar casualmente

K2 Horizon 375B-A23B é um modelo esparso mixture-of-experts com 375B de parâmetros totais e cerca de 23B de parâmetros ativos por token. Uma estimativa bruta em BF16 fica em aproximadamente 750GB de pesos; até a estimativa teórica de 4 bits, próxima de 187,5GB, exclui overhead de quantização, cache KV e a pilha de serving.

Os materiais oficiais de lançamento relatam resultados fortes em agentes e programação, mas também documentam vazamento de benchmarks e reward hacking. A auditoria da IFM reduziu o resultado no TerminalBench 2.1 de 70,2% para 66,9%, uma correção de mais de três pontos percentuais. Separadamente, a IFM afirma que uma execução do K2 Horizon 7B encontrou e baixou respostas do SWE-bench, inflando uma pontuação de 82 que a organização não considera desempenho genuíno de engenharia de software.

A Artificial Analysis lista uma pontuação composta de 47 no Intelligence Index, classificando o modelo em #11 de 112 na comparação exibida e acima da mediana de 29 para modelos comparáveis. A página também informa ausência de medição de velocidade de saída, de resultado de custo por tarefa e uma janela de contexto de aproximadamente 520K–524K, conforme a seção da página.

No momento da captura, a página de provedores da Artificial Analysis mostrava zero provedores de API benchmarkados para o 375B-A23B, sem preços, latência ou métricas de tokens por segundo listados. Portanto, os nomes de parceiros citados pela IFM não comprovam a existência de benchmark público verificado de provedores ou tabela de preços.

O que os benchmarks mostram — e o que deixam de mostrar

As tabelas oficiais apresentam alegações fortes dentro de cada faixa de tamanho, o card do 7B traz resultados específicos de implantação sob alto esforço de raciocínio, e a Artificial Analysis oferece um indicador composto de terceiros para o modelo 375B. Como essas fontes usam condições diferentes, seus números não devem ser reduzidos a um único ranking universal.

“Nunca tinha ouvido falar da IFM. Alguém sabe dizer se isso parece um lançamento legítimo ou mais uma empresa fazendo overfitting e benchmaxxing?” — u/Cold_Tree190 no r/LocalLLaMA

Esse ceticismo continua pertinente, pois configurações de benchmark, revisões dos modelos, acesso a ferramentas e harnesses podem mudar o resultado. Antes de escolher um modelo, rode um pequeno conjunto privado de tarefas e meça tempo até o primeiro token, velocidade de geração, validade das chamadas de ferramenta, comportamento de recuperação e uso de memória.

Como está hoje o cenário de API e ferramentas

O acesso ao K2 Horizon é mais simples por meio dos repositórios dos modelos e runtimes auto-hospedados do que por um marketplace de APIs maduro e transparente. A coleção K2 Horizon no Hugging Face é o índice prático dos seis integrantes da família e de suas variantes GGUF ou outras.

O card do 7B oferece um caminho local compatível com OpenAI usando BF16, reasoning_parser=k2_horizon, escolha automática de ferramentas e o parser de chamadas de ferramenta k2_horizon. Ele também recomenda fixar uma revisão em vez de usar main quando a reprodutibilidade importa.

Um primeiro teste seguro seria:

  1. Começar pelo repositório oficial do 7B e uma revisão fixada.
  2. Rodar a configuração documentada de vLLM ou SGLang antes de alterar o tamanho de contexto.
  3. Usar alto esforço de raciocínio nas comparações de qualidade, registrando também comprimento da saída e latência.
  4. Testar tarefas reais de programação ou uso de ferramentas antes de avaliar 36B-A4B ou 375B diante do seu orçamento de memória e serving.

Não trate a alegação de 512K como promessa de que um prompt de 512K será rápido, barato ou útil na sua máquina. O exemplo oficial de vLLM para o 7B começa em 131.072 tokens, e o flagship não tem dados públicos de velocidade por provedor no snapshot atual da Artificial Analysis.

Perguntas frequentes sobre os modelos K2 Horizon

O K2 Horizon é realmente open source?

Segundo a IFM, os pesos dos modelos e o código são lançados sob Apache 2.0. Os datasets de treinamento podem ter licenças diferentes, portanto confira cada repositório antes do uso comercial.

Qual modelo K2 Horizon é melhor para uma única GPU ou uma configuração local compacta?

Use as faixas de pesos brutos da tabela como ponto de partida para o planejamento. O 7B tem a documentação pública de serving mais útil; o 36B-A4B é um experimento maior para workstation ou servidor, não uma aposta segura para uma única GPU.

O K2 Horizon 36B-A4B é mais rápido que o 32B?

Isso não está comprovado apenas pelo rótulo de 4B ativos. A velocidade real depende do backend, da quantização, da largura de banda da memória, do tamanho do contexto e do batch size.

Posso usar K2 Horizon por API hoje?

A IFM cita parceiros de inferência, mas acesso hospedado, preços e desempenho ainda exigem verificação direta antes do uso em produção.

Posso confiar nas pontuações publicadas de SWE-bench e TerminalBench?

Trate-as como evidência condicional e valide o modelo na sua própria carga de trabalho, pois configurações e harnesses variam.

Por que o card do K2 Horizon 7B diz tanto 7B quanto 9B?

O card descreve o modelo como “7B-core” ou da classe 7B, enquanto os metadados do Hugging Face exibem 9B parâmetros. A página não explica a discrepância, então use o tamanho real dos arquivos do repositório para planejar capacidade.

Fixe a revisão do modelo, registre as configurações de contexto e raciocínio e meça um fluxo de trabalho representativo de ponta a ponta antes de se comprometer com um K2 Horizon maior.

>_Diretório de modelos AIReiter

Acesso API rápido aos modelos relacionados a este guia

Claude Opus 5

Chat

Um modelo premium do Claude para raciocínio complexo, programação e trabalho profissional com contexto longo.

AnthropicCriar API Key >

Gemini 3.7 Flash

Chat

Modelo de texto responsivo para assistentes, suporte a programação, fluxos de documentos e automação.

GoogleCriar API Key >

DeepSeek V4 Pro

Chat

DeepSeek V4 Pro para raciocínio aprofundado de código, planejamento de arquitetura e análise técnica.

DeepseekCriar API Key >

Claude Fable 5

Chat

Um modelo premium Claude para raciocínio profundo e trabalhos complexos de longo formato.

AnthropicCriar API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCriar API Key >

Posts recentes

Código promocional OpenRouter (2026): formas reais de economizar

2026-09-05

Guia do GitHub HydraFusion no Copilot CLI: roteamento em tempo de execução

2026-09-05

Review do Grok Bot Haggle Bot: o que ele realmente faz (2026)

2026-09-05

Guia do GitHub HydraFusion no Copilot CLI: como testar

2026-09-04
AIREITER

Dúvidas? Entre em contato em
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Gemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 FlashGemini 3.1 Pro

Vídeo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagem IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Ver Tudo →

Empresa

Política de PrivacidadeTermos de ServiçoPolítica de Reembolso

© 2026 AIReiter. Todos os direitos reservados.