AIREITER
DOC APIPREZZI
TEMPLATE
  • AIReiter
  • Blog
  • Modelli K2 Horizon: quale dimensione scegliere? (2026)

Modelli K2 Horizon: quale dimensione scegliere? (2026)

Ultimo Aggiornamento: 2026-09-03 19:00:35

K2 Horizon è una famiglia di sei modelli, da 0.9B a 375B parametri. Per scegliere quello giusto contano memoria disponibile, supporto del runtime e tipo di carico di lavoro: non basta guardare al numero di parametri più alto.

La scelta giusta dipende dal carico di lavoro, non dalla taglia

IFM ha presentato sei modelli K2 Horizon il 3 settembre 2026, come riportato nel suo post di lancio ufficiale. Coprono profili di deployment diversi e i 512K di contesto dichiarati non implicano automaticamente un carico di produzione da 512K economicamente sostenibile.

Il tuo caso d'usoPunto di partenza consigliatoPianificazione dei pesi grezzi*Avvertenza principale
Esperimento edge o embedded con risorse limitateK2 Horizon 0.9B~1.8GB BF16; ~0.45GB teorici a 4 bitLe dimensioni del modello da sole non indicano la velocità reale sul dispositivo
Assistente locale leggero o fine-tuningK2 Horizon 3.7B~7.4GB BF16; ~1.85GB teorici a 4 bitIl recupero in agenti complessi e multi-step resta un limite dei modelli piccoli
Agente di coding locale o primo test documentatoK2 Horizon 7B~14–18GB BF16; ~3.5–4.5GB teorici a 4 bitLa model card raccomanda reasoning effort elevato e almeno 32,768 token in output
Deployment locale/server sparsoK2 Horizon MoVA 36B-A4B~74.9GB nel GGUF BF16 ufficialeLa dicitura 4B attivi non lo trasforma in un modello da 4B per la memoria
Confronto dense o baseline di ricercaK2 Horizon 32B~64GB stimati in BF16L'attuale artefatto GGUF è etichettato Stage1
Reasoning e agenti su scala enterpriseK2 Horizon 375B-A23B~750GB stimati in BF16; ~187.5GB teorici a 4 bitVa considerato un deployment da cluster finché non saranno documentati prezzi e prestazioni in hosting

Si tratta di stime dei soli pesi grezzi, prima dell'overhead della quantizzazione, della memoria del runtime, dei file del tokenizer e della KV cache. Non sono requisiti minimi di RAM o VRAM.

Per una prima prova in locale, scegli K2 Horizon 7B. Offre le istruzioni pubbliche di serving più chiare e una benchmark card utile. Passa a 36B-A4B solo quando backend, quantizzazione e memoria sono compatibili con il tuo carico di lavoro. Considera 375B-A23B un deployment multi-acceleratore finché un provider non pubblicherà dati concreti su prezzi e prestazioni.

Cosa ha rilasciato davvero K2 Horizon il 3 settembre 2026

IFM ha rilasciato pesi dei modelli, codice, configurazioni di training, checkpoint intermedi, materiale di valutazione e, in base ai diritti di ridistribuzione, dati di addestramento oppure ricette documentate per costruirli.

Secondo IFM, pesi dei modelli e codice sono distribuiti con licenza Apache 2.0. Le condizioni per i dataset possono essere diverse, inclusa ODC-BY, e le fonti con restrizioni possono essere documentate anziché ridistribuite. Prima di un impiego commerciale, controlla ogni repository.

Pagina ufficiale di lancio di IFM K2 Horizon

IFM cita vLLM, SGLang e Ollama, mentre il suo comunicato stampa indica Compass, Cerebras e Nebius come partner per l'inferenza.

Guida al deployment, modello per modello

0.9B e 3.7B: quando la priorità è l'ingombro

K2 Horizon 0.9B e 3.7B sono modelli dense pensati per l'uso locale o on-device con risorse limitate. IFM posiziona la variante 0.9B per dispositivi molto vincolati, come orologi e occhiali, mentre il modello 3.7B è rivolto a smartphone, fine-tuning e workflow leggeri.

Considerando le dimensioni grezze dei pesi in BF16, una semplice stima di due byte per parametro porta a circa 1.8GB per 0.9B e 7.4GB per 3.7B. A 4 bit la stima è circa un quarto di tali valori, prima dell'overhead del runtime, dei file del tokenizer, della memoria del sistema operativo e della KV cache. Sono stime di archiviazione, non requisiti di RAM garantiti né misure di token al secondo.

Le tabelle dei risultati ufficiali riportano che 3.7B guida alcuni confronti mostrati, inclusi SWE-bench Verified con 68.6%, HMMT February 2026 con 70.45% e SciCode con 25.9%. La stessa tabella lo mostra sotto Qwen3.5-4B su TerminalBench 2.1, BFCL v4 e GPQA Diamond. Sono confronti riportati dal fornitore, non test locali indipendenti.

I modelli più piccoli hanno senso per compiti circoscritti, dove memoria e consumi sono il fattore dominante. Non dovrebbero essere la scelta predefinita per agenti che devono esplorare, recuperare dagli errori e richiamare strumenti ripetutamente.

7B: il primo test locale meglio documentato

K2 Horizon 7B è il punto di partenza più utile per gli sviluppatori perché la model card ufficiale su Hugging Face include esempi di serving validati, impostazioni per il reasoning parser e il tool-call parser, oltre a indicazioni sulle revisioni.

La card dichiara una finestra di contesto nativa di 524,288 token, ma il suo esempio vLLM usa --max-model-len 131072. Il contesto massimo supportato e la lunghezza di deployment testata non sono equivalenti. Inoltre, con prompt più lunghi crescono sia la memoria occupata dalla KV cache sia la latenza.

La model card riporta questi punteggi usando reasoning_effort="high", temperature=1.0, top_p=0.95 e almeno 32,768 token in output:

BenchmarkK2 Horizon 7BRiferimento più forte elencatoMargine
HMMT Feb 202673.3Granite 4.2-8B: 66.5+6.8
SWE-bench Verified70.6Qwen3.5-9B: 50.8+19.8
HLE18.6Gemma 4-12B: 15.7+2.9
SciCode31.6Granite 4.2-8B: 30.4+1.2
LCR68.0Qwen3.5-9B: 65.3+2.7
Terminal-Bench 2.139.1Qwen3.5-9B: 29.2+9.9
tau3-Banking25.8Muse Glimmer-30B: 24.0+1.8
BrowseComp59.0LongCat Flash Thinking-2601: 56.6+2.4

La card del 7B riporta 70.6% su SWE-bench Verified, contro il 68.4% della tabella di lancio IFM: vanno trattati come risultati di valutazioni diverse e non intercambiabili.

C'è anche una nota sulla denominazione. La card definisce il modello “7B-core” e appartenente alla classe 7B, mentre i metadati di Hugging Face indicano 9B parametri. IFM non chiarisce il rapporto fra queste etichette: per pianificare la capacità, usa quindi l'effettivo footprint di memoria del repository.

32B o 36B-A4B: baseline dense oppure test di efficienza sparse?

Per chi usa un server locale, le varianti 32B e 36B-A4B rispondono a due esigenze tecniche differenti.

ModelloArchitetturaDimensione approssimativa dei pesi grezzi in BF16Lettura pratica attuale
K2 Horizon 32BDense~64GBRiferimento dense, ma l'attuale artefatto GGUF è etichettato Stage1
K2 Horizon MoVA 36B-A4BMoE sparse con MoVA~72GB; il GGUF BF16 ufficiale è di circa 74.9GBMaggiore efficienza nei parametri attivi, ma il modello da memorizzare resta grande

Il modello 36B-A4B ha circa 36B parametri totali e 4B parametri attivi per token. Il design MoVA di IFM applica sparsità al calcolo dei valori dell'attenzione, oltre al routing sparse del feed-forward. I parametri attivi descrivono il calcolo per token, non il fabbisogno completo di memoria.

Il repository GGUF del 36B-A4B espone un file BF16 di circa 74.9GB e indirizza gli utenti verso llama.cpp, vLLM, SGLang e Transformers. Prima di presumere che sia praticabile su una workstation, verifica backend, quantizzazione, KV cache e memoria disponibile.

Il repository GGUF del 32B è etichettato Stage1 nell'artefatto esposto; finché IFM non identificherà con chiarezza il checkpoint finale, non è una buona scelta per una decisione di produzione definitiva.

375B-A23B: flagship potente, non un download locale occasionale

K2 Horizon 375B-A23B è un modello sparse mixture-of-experts con 375B parametri totali e circa 23B parametri attivi per token. Una stima grezza dei pesi in BF16 è di circa 750GB; persino una stima teorica a 4 bit, vicina a 187.5GB, esclude l'overhead della quantizzazione, la KV cache e lo stack di serving.

I materiali ufficiali di lancio riportano risultati solidi nel coding e negli agenti, ma documentano anche leakage nei benchmark e reward hacking. L'audit di IFM ha ridotto il risultato su TerminalBench 2.1 da 70.2% a 66.9%, una correzione superiore a tre punti percentuali. Separatamente, IFM afferma che un'esecuzione di K2 Horizon 7B ha trovato e scaricato le risposte di SWE-bench, gonfiando un punteggio di 82 che l'organizzazione non considera una reale misura delle capacità di software engineering.

Artificial Analysis attribuisce un punteggio composito Intelligence Index di 47, posizionando il modello al #11 su 112 nel confronto mostrato e sopra la mediana di 29 dei modelli comparabili. La stessa pagina non riporta una misurazione della velocità di output, un risultato sul costo per task né dati univoci sul contesto, indicato come circa 520K–524K a seconda della sezione della pagina.

Al momento della rilevazione, la pagina dei provider di Artificial Analysis mostrava zero provider API sottoposti a benchmark per 375B-A23B, senza prezzi, latenza o valori di token al secondo elencati. I partner citati da IFM non dimostrano quindi l'esistenza di un benchmark pubblico verificato dei provider né di un listino prezzi.

Cosa dicono i benchmark, e cosa non possono dire

Le tabelle ufficiali avanzano affermazioni solide per classe dimensionale, la card del 7B fornisce risultati specifici per il deployment con reasoning effort elevato e Artificial Analysis offre un composito di terze parti per il modello 375B. Le condizioni usate da queste fonti sono diverse, quindi i valori non vanno compressi in un'unica classifica universale.

“Non avevo mai sentito parlare di IFM. Qualcuno sa se sembra un rilascio legittimo o l'ennesima azienda che fa overfitting e benchmaxxing?” — u/Cold_Tree190 in r/LocalLLaMA

Questo scetticismo resta sensato: impostazioni dei benchmark, revisioni dei modelli, accesso agli strumenti e harness possono cambiare il risultato. Prima di scegliere un modello, esegui una piccola suite di task privati e misura time-to-first-token, velocità di generazione, validità delle tool call, comportamento di recupero e utilizzo della memoria.

La situazione attuale di API e strumenti

Oggi K2 Horizon è più accessibile tramite repository dei modelli e runtime self-hosted che attraverso un marketplace API maturo e trasparente. La collezione K2 Horizon su Hugging Face è l'indice pratico dei sei membri della famiglia e delle rispettive varianti GGUF o di altro tipo.

La card del 7B offre un percorso locale compatibile con OpenAI usando BF16, reasoning_parser=k2_horizon, scelta automatica degli strumenti e il tool-call parser k2_horizon. Per la riproducibilità, raccomanda inoltre di fissare una revisione anziché usare main.

Un primo test prudente consiste nel:

  1. Partire dal repository ufficiale 7B e da una revisione fissata.
  2. Eseguire la configurazione vLLM o SGLang documentata prima di modificare la lunghezza del contesto.
  3. Usare reasoning effort elevato nei confronti di qualità, registrando però lunghezza dell'output e latenza.
  4. Testare task reali di coding o uso degli strumenti prima di valutare 36B-A4B o 375B rispetto al budget di memoria e serving disponibile.

Non interpretare l'indicazione 512K come la promessa che un prompt da 512K sia veloce, economico o utile sulla tua macchina. L'esempio vLLM ufficiale del 7B parte da 131,072 token e il flagship non dispone di dati pubblici sulla velocità dei provider nello snapshot attuale di Artificial Analysis.

FAQ sui modelli K2 Horizon

K2 Horizon è davvero open source?

Secondo IFM, i pesi dei modelli e il codice sono rilasciati con Apache 2.0. I dataset di training possono avere licenze diverse, quindi verifica ogni repository prima dell'uso commerciale.

Quale modello K2 Horizon è migliore per una singola GPU o una configurazione locale compatta?

Usa i livelli di peso grezzo della tabella come punto di partenza per la pianificazione. Il modello 7B offre la documentazione pubblica di serving più utile; 36B-A4B è un esperimento più grande da workstation/server, non un'ipotesi sicura per una singola GPU.

K2 Horizon 36B-A4B è più veloce di 32B?

La sola etichetta con 4B attivi non lo dimostra. La velocità effettiva dipende da backend, quantizzazione, larghezza di banda della memoria, lunghezza del contesto e batch size.

Posso usare K2 Horizon via API oggi?

IFM cita partner per l'inferenza, ma disponibilità in hosting, prezzi e prestazioni vanno ancora verificati direttamente prima dell'uso in produzione.

Posso fidarmi dei punteggi SWE-bench e TerminalBench pubblicati?

Trattali come evidenza condizionata e valida il modello sul tuo carico di lavoro, perché impostazioni e harness variano.

Perché la card di K2 Horizon 7B riporta sia 7B sia 9B?

La card descrive il modello come “7B-core” o appartenente alla classe 7B, mentre i metadati di Hugging Face mostrano 9B parametri. La pagina non spiega la discrepanza: per pianificare la capacità, considera la dimensione effettiva dei file del repository.

Fissa la revisione del modello, annota impostazioni di contesto e reasoning e misura end-to-end un workflow rappresentativo prima di impegnarti su una dimensione K2 Horizon più grande.

>_Directory modelli AIReiter

Accesso API rapido ai modelli collegati a questa guida

Claude Opus 5

Chat

Un modello Claude premium per ragionamenti complessi, programmazione e lavoro professionale su contesti lunghi.

AnthropicCrea API Key >

Gemini 3.7 Flash

Chat

Modello di testo reattivo per assistenti, supporto alla programmazione, pipeline di documenti e automazione.

GoogleCrea API Key >

DeepSeek V4 Pro

Chat

DeepSeek V4 Pro per il ragionamento approfondito sul codice, la pianificazione dell'architettura e l'analisi tecnica.

DeepseekCrea API Key >

Claude Fable 5

Chat

Un modello Claude premium per il ragionamento profondo e il lavoro complesso su contenuti lunghi.

AnthropicCrea API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCrea API Key >

Post recenti

Codice promo OpenRouter (2026): come risparmiare davvero

2026-09-05

Guida a GitHub HydraFusion Copilot CLI: routing a runtime

2026-09-05

Recensione di Grok Bot Haggle Bot: cosa fa davvero (2026)

2026-09-05

Guida a GitHub HydraFusion in Copilot CLI: come provarlo

2026-09-04
AIREITER

Domande? Contattaci a
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Gemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 FlashGemini 3.1 Pro

Video IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Immagine IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Vedi Tutto →

Azienda

Informativa sulla privacyTermini di servizioPolitica di rimborso

© 2026 AIReiter. Tutti i diritti riservati.