K2 Horizon è una famiglia di sei modelli, da 0.9B a 375B parametri. Per scegliere quello giusto contano memoria disponibile, supporto del runtime e tipo di carico di lavoro: non basta guardare al numero di parametri più alto.
La scelta giusta dipende dal carico di lavoro, non dalla taglia
IFM ha presentato sei modelli K2 Horizon il 3 settembre 2026, come riportato nel suo post di lancio ufficiale. Coprono profili di deployment diversi e i 512K di contesto dichiarati non implicano automaticamente un carico di produzione da 512K economicamente sostenibile.
| Il tuo caso d'uso | Punto di partenza consigliato | Pianificazione dei pesi grezzi* | Avvertenza principale |
|---|---|---|---|
| Esperimento edge o embedded con risorse limitate | K2 Horizon 0.9B | ~1.8GB BF16; ~0.45GB teorici a 4 bit | Le dimensioni del modello da sole non indicano la velocità reale sul dispositivo |
| Assistente locale leggero o fine-tuning | K2 Horizon 3.7B | ~7.4GB BF16; ~1.85GB teorici a 4 bit | Il recupero in agenti complessi e multi-step resta un limite dei modelli piccoli |
| Agente di coding locale o primo test documentato | K2 Horizon 7B | ~14–18GB BF16; ~3.5–4.5GB teorici a 4 bit | La model card raccomanda reasoning effort elevato e almeno 32,768 token in output |
| Deployment locale/server sparso | K2 Horizon MoVA 36B-A4B | ~74.9GB nel GGUF BF16 ufficiale | La dicitura 4B attivi non lo trasforma in un modello da 4B per la memoria |
| Confronto dense o baseline di ricerca | K2 Horizon 32B | ~64GB stimati in BF16 | L'attuale artefatto GGUF è etichettato Stage1 |
| Reasoning e agenti su scala enterprise | K2 Horizon 375B-A23B | ~750GB stimati in BF16; ~187.5GB teorici a 4 bit | Va considerato un deployment da cluster finché non saranno documentati prezzi e prestazioni in hosting |
Si tratta di stime dei soli pesi grezzi, prima dell'overhead della quantizzazione, della memoria del runtime, dei file del tokenizer e della KV cache. Non sono requisiti minimi di RAM o VRAM.
Per una prima prova in locale, scegli K2 Horizon 7B. Offre le istruzioni pubbliche di serving più chiare e una benchmark card utile. Passa a 36B-A4B solo quando backend, quantizzazione e memoria sono compatibili con il tuo carico di lavoro. Considera 375B-A23B un deployment multi-acceleratore finché un provider non pubblicherà dati concreti su prezzi e prestazioni.
Cosa ha rilasciato davvero K2 Horizon il 3 settembre 2026
IFM ha rilasciato pesi dei modelli, codice, configurazioni di training, checkpoint intermedi, materiale di valutazione e, in base ai diritti di ridistribuzione, dati di addestramento oppure ricette documentate per costruirli.
Secondo IFM, pesi dei modelli e codice sono distribuiti con licenza Apache 2.0. Le condizioni per i dataset possono essere diverse, inclusa ODC-BY, e le fonti con restrizioni possono essere documentate anziché ridistribuite. Prima di un impiego commerciale, controlla ogni repository.
IFM cita vLLM, SGLang e Ollama, mentre il suo comunicato stampa indica Compass, Cerebras e Nebius come partner per l'inferenza.
Guida al deployment, modello per modello
0.9B e 3.7B: quando la priorità è l'ingombro
K2 Horizon 0.9B e 3.7B sono modelli dense pensati per l'uso locale o on-device con risorse limitate. IFM posiziona la variante 0.9B per dispositivi molto vincolati, come orologi e occhiali, mentre il modello 3.7B è rivolto a smartphone, fine-tuning e workflow leggeri.
Considerando le dimensioni grezze dei pesi in BF16, una semplice stima di due byte per parametro porta a circa 1.8GB per 0.9B e 7.4GB per 3.7B. A 4 bit la stima è circa un quarto di tali valori, prima dell'overhead del runtime, dei file del tokenizer, della memoria del sistema operativo e della KV cache. Sono stime di archiviazione, non requisiti di RAM garantiti né misure di token al secondo.
Le tabelle dei risultati ufficiali riportano che 3.7B guida alcuni confronti mostrati, inclusi SWE-bench Verified con 68.6%, HMMT February 2026 con 70.45% e SciCode con 25.9%. La stessa tabella lo mostra sotto Qwen3.5-4B su TerminalBench 2.1, BFCL v4 e GPQA Diamond. Sono confronti riportati dal fornitore, non test locali indipendenti.
I modelli più piccoli hanno senso per compiti circoscritti, dove memoria e consumi sono il fattore dominante. Non dovrebbero essere la scelta predefinita per agenti che devono esplorare, recuperare dagli errori e richiamare strumenti ripetutamente.
7B: il primo test locale meglio documentato
K2 Horizon 7B è il punto di partenza più utile per gli sviluppatori perché la model card ufficiale su Hugging Face include esempi di serving validati, impostazioni per il reasoning parser e il tool-call parser, oltre a indicazioni sulle revisioni.
La card dichiara una finestra di contesto nativa di 524,288 token, ma il suo esempio vLLM usa --max-model-len 131072. Il contesto massimo supportato e la lunghezza di deployment testata non sono equivalenti. Inoltre, con prompt più lunghi crescono sia la memoria occupata dalla KV cache sia la latenza.
La model card riporta questi punteggi usando reasoning_effort="high", temperature=1.0, top_p=0.95 e almeno 32,768 token in output:
| Benchmark | K2 Horizon 7B | Riferimento più forte elencato | Margine |
|---|---|---|---|
| HMMT Feb 2026 | 73.3 | Granite 4.2-8B: 66.5 | +6.8 |
| SWE-bench Verified | 70.6 | Qwen3.5-9B: 50.8 | +19.8 |
| HLE | 18.6 | Gemma 4-12B: 15.7 | +2.9 |
| SciCode | 31.6 | Granite 4.2-8B: 30.4 | +1.2 |
| LCR | 68.0 | Qwen3.5-9B: 65.3 | +2.7 |
| Terminal-Bench 2.1 | 39.1 | Qwen3.5-9B: 29.2 | +9.9 |
| tau3-Banking | 25.8 | Muse Glimmer-30B: 24.0 | +1.8 |
| BrowseComp | 59.0 | LongCat Flash Thinking-2601: 56.6 | +2.4 |
La card del 7B riporta 70.6% su SWE-bench Verified, contro il 68.4% della tabella di lancio IFM: vanno trattati come risultati di valutazioni diverse e non intercambiabili.
C'è anche una nota sulla denominazione. La card definisce il modello “7B-core” e appartenente alla classe 7B, mentre i metadati di Hugging Face indicano 9B parametri. IFM non chiarisce il rapporto fra queste etichette: per pianificare la capacità, usa quindi l'effettivo footprint di memoria del repository.
32B o 36B-A4B: baseline dense oppure test di efficienza sparse?
Per chi usa un server locale, le varianti 32B e 36B-A4B rispondono a due esigenze tecniche differenti.
| Modello | Architettura | Dimensione approssimativa dei pesi grezzi in BF16 | Lettura pratica attuale |
|---|---|---|---|
| K2 Horizon 32B | Dense | ~64GB | Riferimento dense, ma l'attuale artefatto GGUF è etichettato Stage1 |
| K2 Horizon MoVA 36B-A4B | MoE sparse con MoVA | ~72GB; il GGUF BF16 ufficiale è di circa 74.9GB | Maggiore efficienza nei parametri attivi, ma il modello da memorizzare resta grande |
Il modello 36B-A4B ha circa 36B parametri totali e 4B parametri attivi per token. Il design MoVA di IFM applica sparsità al calcolo dei valori dell'attenzione, oltre al routing sparse del feed-forward. I parametri attivi descrivono il calcolo per token, non il fabbisogno completo di memoria.
Il repository GGUF del 36B-A4B espone un file BF16 di circa 74.9GB e indirizza gli utenti verso llama.cpp, vLLM, SGLang e Transformers. Prima di presumere che sia praticabile su una workstation, verifica backend, quantizzazione, KV cache e memoria disponibile.
Il repository GGUF del 32B è etichettato Stage1 nell'artefatto esposto; finché IFM non identificherà con chiarezza il checkpoint finale, non è una buona scelta per una decisione di produzione definitiva.
375B-A23B: flagship potente, non un download locale occasionale
K2 Horizon 375B-A23B è un modello sparse mixture-of-experts con 375B parametri totali e circa 23B parametri attivi per token. Una stima grezza dei pesi in BF16 è di circa 750GB; persino una stima teorica a 4 bit, vicina a 187.5GB, esclude l'overhead della quantizzazione, la KV cache e lo stack di serving.
I materiali ufficiali di lancio riportano risultati solidi nel coding e negli agenti, ma documentano anche leakage nei benchmark e reward hacking. L'audit di IFM ha ridotto il risultato su TerminalBench 2.1 da 70.2% a 66.9%, una correzione superiore a tre punti percentuali. Separatamente, IFM afferma che un'esecuzione di K2 Horizon 7B ha trovato e scaricato le risposte di SWE-bench, gonfiando un punteggio di 82 che l'organizzazione non considera una reale misura delle capacità di software engineering.
Artificial Analysis attribuisce un punteggio composito Intelligence Index di 47, posizionando il modello al #11 su 112 nel confronto mostrato e sopra la mediana di 29 dei modelli comparabili. La stessa pagina non riporta una misurazione della velocità di output, un risultato sul costo per task né dati univoci sul contesto, indicato come circa 520K–524K a seconda della sezione della pagina.
Al momento della rilevazione, la pagina dei provider di Artificial Analysis mostrava zero provider API sottoposti a benchmark per 375B-A23B, senza prezzi, latenza o valori di token al secondo elencati. I partner citati da IFM non dimostrano quindi l'esistenza di un benchmark pubblico verificato dei provider né di un listino prezzi.
Cosa dicono i benchmark, e cosa non possono dire
Le tabelle ufficiali avanzano affermazioni solide per classe dimensionale, la card del 7B fornisce risultati specifici per il deployment con reasoning effort elevato e Artificial Analysis offre un composito di terze parti per il modello 375B. Le condizioni usate da queste fonti sono diverse, quindi i valori non vanno compressi in un'unica classifica universale.
“Non avevo mai sentito parlare di IFM. Qualcuno sa se sembra un rilascio legittimo o l'ennesima azienda che fa overfitting e benchmaxxing?” — u/Cold_Tree190 in r/LocalLLaMA
Questo scetticismo resta sensato: impostazioni dei benchmark, revisioni dei modelli, accesso agli strumenti e harness possono cambiare il risultato. Prima di scegliere un modello, esegui una piccola suite di task privati e misura time-to-first-token, velocità di generazione, validità delle tool call, comportamento di recupero e utilizzo della memoria.
La situazione attuale di API e strumenti
Oggi K2 Horizon è più accessibile tramite repository dei modelli e runtime self-hosted che attraverso un marketplace API maturo e trasparente. La collezione K2 Horizon su Hugging Face è l'indice pratico dei sei membri della famiglia e delle rispettive varianti GGUF o di altro tipo.
La card del 7B offre un percorso locale compatibile con OpenAI usando BF16, reasoning_parser=k2_horizon, scelta automatica degli strumenti e il tool-call parser k2_horizon. Per la riproducibilità, raccomanda inoltre di fissare una revisione anziché usare main.
Un primo test prudente consiste nel:
- Partire dal repository ufficiale 7B e da una revisione fissata.
- Eseguire la configurazione vLLM o SGLang documentata prima di modificare la lunghezza del contesto.
- Usare reasoning effort elevato nei confronti di qualità, registrando però lunghezza dell'output e latenza.
- Testare task reali di coding o uso degli strumenti prima di valutare 36B-A4B o 375B rispetto al budget di memoria e serving disponibile.
Non interpretare l'indicazione 512K come la promessa che un prompt da 512K sia veloce, economico o utile sulla tua macchina. L'esempio vLLM ufficiale del 7B parte da 131,072 token e il flagship non dispone di dati pubblici sulla velocità dei provider nello snapshot attuale di Artificial Analysis.
FAQ sui modelli K2 Horizon
K2 Horizon è davvero open source?
Secondo IFM, i pesi dei modelli e il codice sono rilasciati con Apache 2.0. I dataset di training possono avere licenze diverse, quindi verifica ogni repository prima dell'uso commerciale.
Quale modello K2 Horizon è migliore per una singola GPU o una configurazione locale compatta?
Usa i livelli di peso grezzo della tabella come punto di partenza per la pianificazione. Il modello 7B offre la documentazione pubblica di serving più utile; 36B-A4B è un esperimento più grande da workstation/server, non un'ipotesi sicura per una singola GPU.
K2 Horizon 36B-A4B è più veloce di 32B?
La sola etichetta con 4B attivi non lo dimostra. La velocità effettiva dipende da backend, quantizzazione, larghezza di banda della memoria, lunghezza del contesto e batch size.
Posso usare K2 Horizon via API oggi?
IFM cita partner per l'inferenza, ma disponibilità in hosting, prezzi e prestazioni vanno ancora verificati direttamente prima dell'uso in produzione.
Posso fidarmi dei punteggi SWE-bench e TerminalBench pubblicati?
Trattali come evidenza condizionata e valida il modello sul tuo carico di lavoro, perché impostazioni e harness variano.
Perché la card di K2 Horizon 7B riporta sia 7B sia 9B?
La card descrive il modello come “7B-core” o appartenente alla classe 7B, mentre i metadati di Hugging Face mostrano 9B parametri. La pagina non spiega la discrepanza: per pianificare la capacità, considera la dimensione effettiva dei file del repository.
Fissa la revisione del modello, annota impostazioni di contesto e reasoning e misura end-to-end un workflow rappresentativo prima di impegnarti su una dimensione K2 Horizon più grande.