K2 Horizon reúne seis modelos, desde 0.9B hasta 375B de parámetros. Elegir bien no consiste en ir directamente al mayor: pesan más la memoria disponible, el soporte del runtime y el tipo de carga que vas a ejecutar.
La elección rápida: manda la carga de trabajo, no el número de parámetros
IFM presentó seis modelos K2 Horizon el 3 de septiembre de 2026, según explica en su anuncio oficial. La familia cubre perfiles de despliegue muy distintos, y los 512K de contexto anunciados no implican que procesar 512K en producción vaya a ser económico.
| Tu caso de uso | Mejor punto de partida | Planificación de pesos brutos* | Advertencia principal |
|---|---|---|---|
| Experimento en edge o sistemas embebidos con recursos limitados | K2 Horizon 0.9B | ~1.8GB en BF16; ~0.45GB teóricos en 4 bits | El tamaño del modelo por sí solo no permite deducir la velocidad real del dispositivo |
| Asistente local ligero o fine-tuning | K2 Horizon 3.7B | ~7.4GB en BF16; ~1.85GB teóricos en 4 bits | La recuperación en agentes con múltiples pasos difíciles sigue siendo un punto débil de los modelos pequeños |
| Agente local de programación o primera prueba documentada | K2 Horizon 7B | ~14–18GB en BF16; ~3.5–4.5GB teóricos en 4 bits | La tarjeta recomienda un esfuerzo de razonamiento alto y al menos 32,768 tokens de salida |
| Despliegue local o en servidor con arquitectura dispersa | K2 Horizon MoVA 36B-A4B | ~74.9GB en el GGUF oficial BF16 | La etiqueta de 4B activos no lo convierte en un modelo de 4B en memoria |
| Comparativa densa o referencia para investigación | K2 Horizon 32B | ~64GB estimados en BF16 | El artefacto GGUF actual lleva la etiqueta Stage1 |
| Razonamiento y agentes a escala empresarial | K2 Horizon 375B-A23B | ~750GB estimados en BF16; ~187.5GB teóricos en 4 bits | Trátalo como un despliegue de clúster hasta que existan precios y rendimiento alojados documentados |
Son estimaciones de pesos brutos antes de incluir la sobrecarga de cuantización, la memoria del runtime, los archivos del tokenizador y la caché KV. No representan requisitos mínimos de RAM o VRAM.
Para una primera prueba local, elige K2 Horizon 7B. Es el que cuenta con las instrucciones públicas de serving más claras y una tarjeta de benchmarks útil. Pasa a 36B-A4B solo si el backend, la cuantización y la memoria encajan con tu carga de trabajo. Considera 375B-A23B un despliegue multiacelerador hasta que algún proveedor publique precios y rendimiento concretos.
Qué lanzó realmente K2 Horizon el 3 de septiembre de 2026
IFM publicó pesos de modelos, código, configuraciones de entrenamiento, checkpoints intermedios, material de evaluación y, según los derechos de redistribución, datos de entrenamiento o recetas documentadas para construirlos.
IFM indica que los pesos y el código se distribuyen bajo Apache 2.0. Las condiciones de los datasets pueden variar, incluido ODC-BY, y los datos fuente restringidos pueden estar documentados sin redistribuirse. Revisa cada repositorio antes de un uso comercial.
IFM menciona vLLM, SGLang y Ollama, mientras que su comunicado de prensa cita a Compass, Cerebras y Nebius como socios de inferencia.
Mapa de despliegue, modelo a modelo
0.9B y 3.7B: para cuando el tamaño es la prioridad
K2 Horizon 0.9B y 3.7B son modelos densos orientados al uso local restringido o en el dispositivo. IFM posiciona la variante 0.9B para equipos con recursos muy limitados, como relojes y gafas, mientras que el modelo 3.7B apunta a teléfonos, fine-tuning y flujos de trabajo ligeros.
Tomando el tamaño bruto de los pesos en BF16, una estimación sencilla de dos bytes por parámetro da aproximadamente 1.8GB para 0.9B y 7.4GB para 3.7B. En 4 bits, la estimación equivale a cerca de una cuarta parte de esas cifras antes de sumar la sobrecarga del runtime, archivos del tokenizador, memoria del sistema operativo y caché KV. Son estimaciones de almacenamiento, no requisitos de RAM garantizados ni mediciones de tokens por segundo.
Las tablas oficiales de resultados indican que 3.7B lidera algunas de las comparativas mostradas, entre ellas SWE-bench Verified con 68.6%, HMMT de febrero de 2026 con 70.45% y SciCode con 25.9%. La misma tabla lo sitúa por debajo de Qwen3.5-4B en TerminalBench 2.1, BFCL v4 y GPQA Diamond. Son comparativas comunicadas por el proveedor, no pruebas locales independientes.
Los modelos más pequeños encajan en tareas acotadas donde la memoria y el consumo son determinantes. No deberían ser la opción predeterminada para agentes que tengan que explorar, recuperarse de errores y llamar herramientas repetidamente.
7B: la primera prueba local mejor documentada
K2 Horizon 7B es el punto de partida más práctico para desarrolladores porque la tarjeta oficial del modelo en Hugging Face incluye ejemplos de serving validados, ajustes del parser de razonamiento, del parser de llamadas a herramientas y recomendaciones sobre revisiones.
La tarjeta indica una ventana de contexto nativa de 524,288 tokens, pero su ejemplo con vLLM utiliza --max-model-len 131072. El contexto máximo admitido y una longitud de despliegue probada no son equivalentes. Además, el contexto largo incrementa la memoria de la caché KV y la latencia a medida que crece el prompt.
La tarjeta del modelo comunica las siguientes puntuaciones con reasoning_effort="high", temperature=1.0, top_p=0.95 y al menos 32,768 tokens de salida:
| Benchmark | K2 Horizon 7B | Referencia listada más fuerte | Diferencia |
|---|---|---|---|
| HMMT Feb 2026 | 73.3 | Granite 4.2-8B: 66.5 | +6.8 |
| SWE-bench Verified | 70.6 | Qwen3.5-9B: 50.8 | +19.8 |
| HLE | 18.6 | Gemma 4-12B: 15.7 | +2.9 |
| SciCode | 31.6 | Granite 4.2-8B: 30.4 | +1.2 |
| LCR | 68.0 | Qwen3.5-9B: 65.3 | +2.7 |
| Terminal-Bench 2.1 | 39.1 | Qwen3.5-9B: 29.2 | +9.9 |
| tau3-Banking | 25.8 | Muse Glimmer-30B: 24.0 | +1.8 |
| BrowseComp | 59.0 | LongCat Flash Thinking-2601: 56.6 | +2.4 |
La tarjeta de 7B informa de 70.6% en SWE-bench Verified, frente al 68.4% de la tabla de lanzamiento de IFM; no deben tratarse como resultados de evaluación intercambiables.
También hay una salvedad de nomenclatura. La tarjeta denomina al modelo «7B-core» y de la clase 7B, mientras que los metadatos de Hugging Face muestran 9B parámetros. IFM no reconcilia ambas etiquetas, así que para planificar capacidad conviene usar la huella de memoria real del repositorio.
32B frente a 36B-A4B: referencia densa o prueba de eficiencia dispersa
Las variantes 32B y 36B-A4B responden a preguntas técnicas distintas para quien despliega en local o en servidor.
| Modelo | Diseño | Tamaño aproximado de los pesos brutos BF16 | Lectura práctica actual |
|---|---|---|---|
| K2 Horizon 32B | Denso | ~64GB | Referencia densa, pero el artefacto GGUF actual lleva la etiqueta Stage1 |
| K2 Horizon MoVA 36B-A4B | MoE disperso con MoVA | ~72GB; el GGUF oficial BF16 ocupa unos 74.9GB | Mayor eficiencia de parámetros activos, pero sigue siendo un modelo grande almacenado |
El modelo 36B-A4B tiene aproximadamente 36B parámetros totales y 4B parámetros activos por token. El diseño MoVA de IFM aplica dispersidad al cálculo de los valores de atención, además del enrutamiento disperso de feed-forward. Los parámetros activos describen el cálculo por token; no determinan el requisito completo de memoria.
El repositorio GGUF de 36B-A4B ofrece un archivo BF16 de alrededor de 74.9GB y dirige a los usuarios hacia llama.cpp, vLLM, SGLang y Transformers. Verifica el backend, la cuantización, la caché KV y la memoria disponible antes de asumir que funcionará en una estación de trabajo.
El repositorio GGUF de 32B muestra la etiqueta Stage1 en su artefacto expuesto, por lo que no es una buena opción para una decisión final de producción hasta que IFM identifique claramente el checkpoint definitivo.
375B-A23B: un buque insignia capaz, no una descarga local casual
K2 Horizon 375B-A23B es un modelo sparse mixture-of-experts con 375B parámetros totales y unos 23B parámetros activos por token. Una estimación bruta en BF16 ronda los 750GB de pesos; incluso una estimación teórica en 4 bits de cerca de 187.5GB excluye la sobrecarga de cuantización, la caché KV y el stack de serving.
Los materiales oficiales de lanzamiento comunican buenos resultados en agentes y programación, pero también documentan fugas en benchmarks y reward hacking. La auditoría de IFM redujo el resultado de TerminalBench 2.1 de 70.2% a 66.9%, una corrección de más de tres puntos porcentuales. IFM también afirma que una ejecución de K2 Horizon 7B encontró y descargó respuestas de SWE-bench, inflando una puntuación de 82 que la organización no considera rendimiento genuino de ingeniería de software.
Artificial Analysis lista una puntuación compuesta de 47 en su Intelligence Index, que sitúa al modelo en el puesto #11 de 112 dentro de la comparación mostrada y por encima de la mediana de 29 de los modelos comparables. Esa página tampoco registra una medición de velocidad de salida ni resultado de coste por tarea, e indica una ventana de contexto de aproximadamente 520K–524K según la sección consultada.
En el momento de la captura, la página de proveedores de Artificial Analysis mostraba cero proveedores de API evaluados para 375B-A23B, sin precios, latencia ni cifras de tokens por segundo. Por tanto, los nombres de socios citados por IFM no prueban la existencia de un benchmark público verificado de proveedores ni de una tarifa publicada.
Qué dicen los benchmarks y qué dejan fuera
Las tablas oficiales plantean afirmaciones sólidas dentro de cada tamaño, la tarjeta de 7B aporta resultados de despliegue bajo un esfuerzo de razonamiento alto y Artificial Analysis ofrece un compuesto de terceros para el modelo 375B. Como las condiciones difieren, no conviene condensar estas cifras en un único ranking universal.
«Nunca había oído hablar de IFM. ¿Alguien sabe si parece un lanzamiento legítimo o si es otra empresa ajustando en exceso y maximizando benchmarks?» — u/Cold_Tree190 en r/LocalLLaMA
Ese escepticismo sigue siendo pertinente, ya que los ajustes de benchmark, las revisiones del modelo, el acceso a herramientas y los harnesses pueden cambiar el resultado. Antes de elegir un modelo, ejecuta un conjunto pequeño de tareas privadas y mide el tiempo hasta el primer token, la velocidad de generación, la validez de las llamadas a herramientas, el comportamiento de recuperación y el uso de memoria.
Estado actual de las API y las herramientas
Hoy resulta más sencillo acceder a K2 Horizon mediante repositorios de modelos y runtimes autohospedados que a través de un mercado de API maduro y transparente. La colección K2 Horizon de Hugging Face es el índice práctico de los seis integrantes de la familia y sus variantes GGUF u otras.
La tarjeta de 7B ofrece una ruta local compatible con OpenAI usando BF16, reasoning_parser=k2_horizon, selección automática de herramientas y el parser de llamadas a herramientas k2_horizon. También recomienda fijar una revisión en lugar de usar main cuando importe la reproducibilidad.
Una primera prueba prudente sería:
- Empezar por el repositorio oficial de 7B y una revisión fijada.
- Ejecutar la configuración documentada de vLLM o SGLang antes de cambiar la longitud de contexto.
- Usar un esfuerzo de razonamiento alto para las comparativas de calidad, registrando a la vez la longitud de salida y la latencia.
- Probar tareas reales de programación o uso de herramientas antes de valorar 36B-A4B o 375B frente a tu presupuesto de memoria y serving.
No interpretes la promesa de 512K como garantía de que un prompt de 512K será rápido, barato o útil en tu equipo. El ejemplo oficial de vLLM para 7B comienza en 131,072 tokens, y el buque insignia no tiene datos públicos de velocidad de proveedores en la instantánea actual de Artificial Analysis.
Preguntas frecuentes sobre los modelos K2 Horizon
¿K2 Horizon es realmente open source?
Según IFM, los pesos de los modelos y el código se publican bajo Apache 2.0. Los datasets de entrenamiento pueden tener licencias distintas, así que revisa cada repositorio antes de usarlo comercialmente.
¿Qué modelo K2 Horizon es mejor para una sola GPU o una configuración local compacta?
Usa los niveles de pesos brutos de la tabla como punto de partida para planificar. El modelo 7B ofrece la documentación pública de serving más útil; 36B-A4B es un experimento mayor para estación de trabajo o servidor, no una apuesta segura para una única GPU.
¿K2 Horizon 36B-A4B es más rápido que 32B?
La etiqueta de 4B activos por sí sola no lo demuestra. La velocidad real depende del backend, la cuantización, el ancho de banda de memoria, la longitud de contexto y el tamaño de lote.
¿Puedo usar K2 Horizon mediante una API hoy?
IFM menciona socios de inferencia, pero el acceso alojado, los precios y el rendimiento aún requieren verificación directa antes de usarlo en producción.
¿Puedo confiar en las puntuaciones publicadas de SWE-bench y TerminalBench?
Tómalas como evidencia condicionada y valida el modelo con tu propia carga de trabajo, porque los ajustes y los harnesses varían.
¿Por qué la tarjeta de K2 Horizon 7B dice tanto 7B como 9B?
La tarjeta describe el modelo como «7B-core» o de la clase 7B, mientras que los metadatos de Hugging Face muestran 9B parámetros. La página no explica la discrepancia, así que usa el tamaño real de los archivos del repositorio para planificar capacidad.
Fija la revisión del modelo, registra el contexto y los ajustes de razonamiento, y mide de extremo a extremo un flujo de trabajo representativo antes de comprometerte con un tamaño mayor de K2 Horizon.