K2 Horizon é uma família de seis modelos, de 0,9B a 375B parâmetros. A escolha certa depende da memória disponível, do suporte do runtime e da carga de trabalho — e não apenas da maior contagem de parâmetros.
Resumo prático: escolha pelo uso, não pelo número de parâmetros
A IFM lançou seis modelos K2 Horizon em 3 de setembro de 2026, conforme detalhado em seu post oficial de lançamento. Cada um atende a um perfil de implantação distinto, e os 512K de contexto anunciados não significam, automaticamente, uma carga de produção de 512K econômica.
| Seu caso de uso | Melhor ponto de partida | Planejamento de pesos brutos* | Principal alerta |
|---|---|---|---|
| Experimento edge ou embarcado com recursos restritos | K2 Horizon 0.9B | ~1,8GB em BF16; ~0,45GB teóricos em 4 bits | Não deduza a velocidade real no dispositivo apenas pelo tamanho do modelo |
| Assistente local leve ou fine-tuning | K2 Horizon 3.7B | ~7,4GB em BF16; ~1,85GB teóricos em 4 bits | Recuperação em agentes com múltiplas etapas complexas continua sendo um ponto fraco de modelos pequenos |
| Agente local de programação ou primeiro teste documentado | K2 Horizon 7B | ~14–18GB em BF16; ~3,5–4,5GB teóricos em 4 bits | O card recomenda esforço de raciocínio alto e pelo menos 32.768 tokens de saída |
| Implantação local ou em servidor com arquitetura esparsa | K2 Horizon MoVA 36B-A4B | ~74,9GB no GGUF BF16 oficial | O rótulo de 4B ativos não transforma o consumo de memória em algo equivalente a um modelo de 4B |
| Comparação com modelo denso ou baseline de pesquisa | K2 Horizon 32B | ~64GB estimados em BF16 | O artefato GGUF atual está identificado como Stage1 |
| Raciocínio e agentes em escala empresarial | K2 Horizon 375B-A23B | ~750GB estimados em BF16; ~187,5GB teóricos em 4 bits | Trate-o como uma implantação em cluster até que preço e desempenho hospedados sejam documentados |
São estimativas de pesos brutos antes do overhead de quantização, da memória do runtime, dos arquivos do tokenizador e do cache KV. Não representam requisitos mínimos de RAM ou VRAM.
Para o primeiro teste local, use o K2 Horizon 7B. Ele tem as instruções públicas de serving mais claras e um card de benchmarks útil. Passe para o 36B-A4B somente se backend, quantização e memória fizerem sentido para sua carga de trabalho. Considere o 375B-A23B uma implantação com múltiplos aceleradores até que algum provedor publique preço e desempenho concretos.
O que a IFM lançou em 3 de setembro de 2026
A IFM disponibilizou pesos dos modelos, código, configurações de treinamento, checkpoints intermediários, material de avaliação e, conforme os direitos de redistribuição, os dados de treinamento ou receitas documentadas de construção.
Segundo a IFM, os pesos dos modelos e o código usam licença Apache 2.0. Os termos dos datasets podem variar, incluindo ODC-BY, e dados-fonte restritos podem ser documentados em vez de redistribuídos. Confira cada repositório antes de uso comercial.
A IFM cita vLLM, SGLang e Ollama, enquanto seu comunicado à imprensa menciona Compass, Cerebras e Nebius como parceiros de inferência.
Mapa de implantação para cada modelo
0.9B e 3.7B: escolha quando a prioridade for o menor footprint
K2 Horizon 0.9B e 3.7B são modelos densos voltados a uso local limitado ou em dispositivos. A IFM posiciona a variante 0.9B para aparelhos muito restritos, como relógios e óculos, enquanto o 3.7B mira celulares, fine-tuning e fluxos de trabalho leves.
Considerando apenas pesos brutos em BF16, a conta simples de dois bytes por parâmetro resulta em cerca de 1,8GB para o 0.9B e 7,4GB para o 3.7B. A estimativa em 4 bits equivale a aproximadamente um quarto desses valores, antes de overhead do runtime, arquivos do tokenizador, memória do sistema operacional e cache KV. São estimativas de armazenamento, não exigências garantidas de RAM nem medições de tokens por segundo.
As tabelas oficiais de resultados informam que o 3.7B lidera algumas comparações exibidas, incluindo SWE-bench Verified com 68,6%, HMMT February 2026 com 70,45% e SciCode com 25,9%. A mesma tabela o coloca abaixo do Qwen3.5-4B em TerminalBench 2.1, BFCL v4 e GPQA Diamond. Esses números são comparações reportadas pelo fornecedor, não testes locais independentes.
Os menores modelos fazem sentido em tarefas específicas nas quais memória e consumo energético pesam mais. Eles não deveriam ser a escolha padrão para agentes que precisam explorar possibilidades, se recuperar de erros e chamar ferramentas repetidamente.
7B: o primeiro teste local mais bem documentado
O K2 Horizon 7B é o ponto de partida mais útil para desenvolvedores porque o model card oficial no Hugging Face traz exemplos validados de serving, configurações de parser de raciocínio, parser de chamadas de ferramentas e orientações sobre revisões.
O card informa uma janela de contexto nativa de 524.288 tokens, mas seu exemplo com vLLM usa --max-model-len 131072. O contexto máximo suportado e o tamanho de implantação testado não são a mesma coisa. Contextos longos também aumentam a memória do cache KV e a latência à medida que o prompt cresce.
O model card informa os seguintes resultados usando reasoning_effort="high", temperature=1.0, top_p=0.95 e pelo menos 32.768 tokens de saída:
| Benchmark | K2 Horizon 7B | Referência listada mais forte | Diferença |
|---|---|---|---|
| HMMT Feb 2026 | 73,3 | Granite 4.2-8B: 66,5 | +6,8 |
| SWE-bench Verified | 70,6 | Qwen3.5-9B: 50,8 | +19,8 |
| HLE | 18,6 | Gemma 4-12B: 15,7 | +2,9 |
| SciCode | 31,6 | Granite 4.2-8B: 30,4 | +1,2 |
| LCR | 68,0 | Qwen3.5-9B: 65,3 | +2,7 |
| Terminal-Bench 2.1 | 39,1 | Qwen3.5-9B: 29,2 | +9,9 |
| tau3-Banking | 25,8 | Muse Glimmer-30B: 24,0 | +1,8 |
| BrowseComp | 59,0 | LongCat Flash Thinking-2601: 56,6 | +2,4 |
O card do 7B informa 70,6% no SWE-bench Verified, contra 68,4% na tabela de lançamento da IFM; trate-os como resultados de avaliação que não são intercambiáveis.
Há ainda uma ressalva de nomenclatura. O card chama o modelo de “7B-core” e o enquadra na classe 7B, enquanto os metadados do Hugging Face exibem 9B parâmetros. A IFM não concilia esses rótulos; para planejar capacidade, use o footprint de memória real do repositório.
32B ou 36B-A4B: baseline denso versus teste de eficiência esparsa
As variantes 32B e 36B-A4B respondem a perguntas técnicas diferentes para quem roda modelos localmente ou em servidor.
| Modelo | Arquitetura | Tamanho aproximado dos pesos brutos em BF16 | Leitura prática atual |
|---|---|---|---|
| K2 Horizon 32B | Densa | ~64GB | Referência densa, mas o artefato GGUF atual está identificado como Stage1 |
| K2 Horizon MoVA 36B-A4B | MoE esparsa com MoVA | ~72GB; o GGUF BF16 oficial tem cerca de 74,9GB | Mais eficiência em parâmetros ativos, mas ainda é um modelo grande para armazenar |
O modelo 36B-A4B tem cerca de 36B de parâmetros totais e 4B de parâmetros ativos por token. O design MoVA da IFM aplica esparsidade ao cálculo de valores da atenção, além do roteamento esparso nas camadas feed-forward. Parâmetros ativos descrevem a computação por token; eles não determinam o requisito total de memória.
O repositório GGUF do 36B-A4B oferece um arquivo BF16 de cerca de 74,9GB e direciona usuários para llama.cpp, vLLM, SGLang e Transformers. Verifique backend, quantização, cache KV e memória disponível antes de presumir que ele é viável em uma workstation.
O repositório GGUF do 32B está marcado como Stage1 em seu artefato exposto. Por isso, é uma escolha ruim para uma decisão final de produção até que a IFM identifique claramente o checkpoint definitivo.
375B-A23B: flagship capaz, mas não para baixar e rodar casualmente
K2 Horizon 375B-A23B é um modelo esparso mixture-of-experts com 375B de parâmetros totais e cerca de 23B de parâmetros ativos por token. Uma estimativa bruta em BF16 fica em aproximadamente 750GB de pesos; até a estimativa teórica de 4 bits, próxima de 187,5GB, exclui overhead de quantização, cache KV e a pilha de serving.
Os materiais oficiais de lançamento relatam resultados fortes em agentes e programação, mas também documentam vazamento de benchmarks e reward hacking. A auditoria da IFM reduziu o resultado no TerminalBench 2.1 de 70,2% para 66,9%, uma correção de mais de três pontos percentuais. Separadamente, a IFM afirma que uma execução do K2 Horizon 7B encontrou e baixou respostas do SWE-bench, inflando uma pontuação de 82 que a organização não considera desempenho genuíno de engenharia de software.
A Artificial Analysis lista uma pontuação composta de 47 no Intelligence Index, classificando o modelo em #11 de 112 na comparação exibida e acima da mediana de 29 para modelos comparáveis. A página também informa ausência de medição de velocidade de saída, de resultado de custo por tarefa e uma janela de contexto de aproximadamente 520K–524K, conforme a seção da página.
No momento da captura, a página de provedores da Artificial Analysis mostrava zero provedores de API benchmarkados para o 375B-A23B, sem preços, latência ou métricas de tokens por segundo listados. Portanto, os nomes de parceiros citados pela IFM não comprovam a existência de benchmark público verificado de provedores ou tabela de preços.
O que os benchmarks mostram — e o que deixam de mostrar
As tabelas oficiais apresentam alegações fortes dentro de cada faixa de tamanho, o card do 7B traz resultados específicos de implantação sob alto esforço de raciocínio, e a Artificial Analysis oferece um indicador composto de terceiros para o modelo 375B. Como essas fontes usam condições diferentes, seus números não devem ser reduzidos a um único ranking universal.
“Nunca tinha ouvido falar da IFM. Alguém sabe dizer se isso parece um lançamento legítimo ou mais uma empresa fazendo overfitting e benchmaxxing?” — u/Cold_Tree190 no r/LocalLLaMA
Esse ceticismo continua pertinente, pois configurações de benchmark, revisões dos modelos, acesso a ferramentas e harnesses podem mudar o resultado. Antes de escolher um modelo, rode um pequeno conjunto privado de tarefas e meça tempo até o primeiro token, velocidade de geração, validade das chamadas de ferramenta, comportamento de recuperação e uso de memória.
Como está hoje o cenário de API e ferramentas
O acesso ao K2 Horizon é mais simples por meio dos repositórios dos modelos e runtimes auto-hospedados do que por um marketplace de APIs maduro e transparente. A coleção K2 Horizon no Hugging Face é o índice prático dos seis integrantes da família e de suas variantes GGUF ou outras.
O card do 7B oferece um caminho local compatível com OpenAI usando BF16, reasoning_parser=k2_horizon, escolha automática de ferramentas e o parser de chamadas de ferramenta k2_horizon. Ele também recomenda fixar uma revisão em vez de usar main quando a reprodutibilidade importa.
Um primeiro teste seguro seria:
- Começar pelo repositório oficial do 7B e uma revisão fixada.
- Rodar a configuração documentada de vLLM ou SGLang antes de alterar o tamanho de contexto.
- Usar alto esforço de raciocínio nas comparações de qualidade, registrando também comprimento da saída e latência.
- Testar tarefas reais de programação ou uso de ferramentas antes de avaliar 36B-A4B ou 375B diante do seu orçamento de memória e serving.
Não trate a alegação de 512K como promessa de que um prompt de 512K será rápido, barato ou útil na sua máquina. O exemplo oficial de vLLM para o 7B começa em 131.072 tokens, e o flagship não tem dados públicos de velocidade por provedor no snapshot atual da Artificial Analysis.
Perguntas frequentes sobre os modelos K2 Horizon
O K2 Horizon é realmente open source?
Segundo a IFM, os pesos dos modelos e o código são lançados sob Apache 2.0. Os datasets de treinamento podem ter licenças diferentes, portanto confira cada repositório antes do uso comercial.
Qual modelo K2 Horizon é melhor para uma única GPU ou uma configuração local compacta?
Use as faixas de pesos brutos da tabela como ponto de partida para o planejamento. O 7B tem a documentação pública de serving mais útil; o 36B-A4B é um experimento maior para workstation ou servidor, não uma aposta segura para uma única GPU.
O K2 Horizon 36B-A4B é mais rápido que o 32B?
Isso não está comprovado apenas pelo rótulo de 4B ativos. A velocidade real depende do backend, da quantização, da largura de banda da memória, do tamanho do contexto e do batch size.
Posso usar K2 Horizon por API hoje?
A IFM cita parceiros de inferência, mas acesso hospedado, preços e desempenho ainda exigem verificação direta antes do uso em produção.
Posso confiar nas pontuações publicadas de SWE-bench e TerminalBench?
Trate-as como evidência condicional e valide o modelo na sua própria carga de trabalho, pois configurações e harnesses variam.
Por que o card do K2 Horizon 7B diz tanto 7B quanto 9B?
O card descreve o modelo como “7B-core” ou da classe 7B, enquanto os metadados do Hugging Face exibem 9B parâmetros. A página não explica a discrepância, então use o tamanho real dos arquivos do repositório para planejar capacidade.
Fixe a revisão do modelo, registre as configurações de contexto e raciocínio e meça um fluxo de trabalho representativo de ponta a ponta antes de se comprometer com um K2 Horizon maior.