El mejor LLM de código abierto para programar: una brecha de costo de 48x en nuestra prueba

Última actualización: 2026-07-17 10:09:21

Respuesta corta: GLM-5.2 es el LLM de código abierto más potente para programación en este momento — en uso prolongado, la calidad de sus resultados se sitúa cerca del nivel de Claude Sonnet, y es el modelo al que confiaríamos los problemas más difíciles. También es lento y consume muchos tokens, así que para agentes de codificación API rápidos elige Kimi K2.7 Code; para el menor coste, DeepSeek V4 Flash; y para tu propia GPU de 24GB, Qwen3.6-27B.

Ésa es la conclusión de proporcionar las mismas dos tareas de programación a cinco modelos insignia de código abierto, con Claude Opus 4.8 como referencia de código cerrado. Todos produjeron código correcto. Lo que los diferenciaba era cuántos tokens consumían para llegar allí, y esa diferencia llegó a ser de hasta 48 veces en costo.

Una nota sobre la redacción: casi todos estos son técnicamente modelos de pesos abiertos: los pesos son libres, los datos de entrenamiento no. Decimos "open source" porque ese es el término que la gente busca. La distinción solo importa para una respuesta de las FAQ a continuación.

Cómo probamos

Dos tareas, mismo prompt para todos los modelos, enviado el 17 de julio de 2026 con la configuración predeterminada:

  • Tarea 1: escribe una función para analizar duraciones con casos límite complicados (12 casos de prueba)
  • Tarea 2: corrige una función defectuosa para fusionar intervalos (6 casos de prueba)

Calificamos el código localmente y registramos tres números por ejecución: tasa de éxito, tokens de salida y tiempo de reloj. El costo es tokens multiplicados por el precio de lista de cada proveedor, que verificamos el mismo día. Dos tareas es una prueba, no un benchmark, pero es el tipo de solicitud rutinaria que enviarás cientos de veces.

Los resultados

Cada modelo aprobó cada caso de prueba. Así que la tabla de abajo trata sobre una sola cosa: eficiencia:

ModeloTokens de salida (ambas tareas)Tiempo de la tarea 1Costo
Kimi K2.7 Code2,18345.2s$0.0090
DeepSeek V4 Flash2,23116.7s$0.00066
DeepSeek V4 Pro2,52737.3s$0.0023
MiniMax M35,40936.7s$0.0067
GLM-5.27,13099.3s$0.0318
Claude Opus 4.8 (baseline)5398.1s
Output tokens used by each model to solve the same two coding tasks

La columna de tokens es la historia. GLM-5.2 y MiniMax M3 son modelos de "thinking": de forma predeterminada razonan extensamente antes de responder. Ese razonamiento se factura como salida. Para la misma función correcta, GLM-5.2 escribió 3x más tokens que Kimi K2.7 Code.

Empeora con un límite de tokens. Cuando limitamos las respuestas a 2.048 tokens, ambos modelos de razonamiento gastaron todo el presupuesto razonando y devolvieron ningún código en absoluto. Pagas, y no obtienes nada. GLM-5.2 necesitó un techo de 16.384 tokens antes de terminar, y sus dos intentos fallidos costaron por sí solos unos $0.045. Si usas un modelo de razonamiento dentro de un agente de codificación, aumenta max_tokens o desactiva el razonamiento para ediciones rutinarias.

Cost to complete both test tasks at official API prices

En comparación, Claude Opus 4.8 resolvió ambas tareas en 539 tokens. Los modelos abiertos han alcanzado al modelo en precisión; en brevedad, la referencia cerrada sigue estando 4 veces por delante.

Los mejores modelos de código de código abierto por nivel de implementación

Elige según dónde se ejecutará el modelo. Los precios son por 1M tokens, verificados el 2026-07-17.

El modelo más potente, si puedes esperar por él: GLM-5.2

En trabajos de programación difíciles y de varios pasos, la calidad de salida de GLM-5.2 es lo más cercano que un modelo abierto alcanza actualmente al nivel de Claude — lidera los benchmarks agénticos (SWE-Bench Pro, Terminal-Bench 2.1), y en nuestro propio uso prolongado es el que confiamos para los problemas que los demás manejan mal. Más en nuestra guía de la API de GLM-5.2.

El precio de esa calidad es la paciencia. Fue el modelo más lento y hambriento en nuestra prueba (99.3s y 5,695 tokens en la Tarea 1), y el servicio lento refleja más la capacidad limitada de GPU del lado del proveedor que al propio modelo. $1.40 in / $4.40 out, 1M context, plain MIT. Dale los problemas difíciles y un gran presupuesto de tokens; deriva las ediciones rápidas a otra parte.

Lo mejor para agentes de codificación API rápidos: Kimi K2.7 Code

El modelo abierto más eficiente en tokens que probamos: su corrección de errores tomó 259 tokens, con la concisión de Claude. También lidera el benchmark de finalización de tareas de Kilo con un 60.7%.

Precios: $0.95 de entrada / $4.00 de salida, $0.19 en aciertos de caché. La única limitación real es el contexto: 262K tokens, mientras que el resto de esta lista ofrece 1M. Para ver cómo se compara con su rival más cercano, consulta Kimi K2.7 Code vs GLM-5.2.

Kimi K2.7 Code official pricing page showing $0.95 input and $4.00 output per million tokens

Mejor valor: DeepSeek V4 Flash

$0.14 in / $0.28 out, con diferencia el modelo más barato aquí, y aun así superó todo lo que le lanzamos; fue el más rápido entre los modelos abiertos. Sus puntuaciones publicadas (79.0% SWE-Bench Verified, 91.6% LiveCodeBench) se sitúan a dos puntos de su hermano mayor. El contexto es de 1M tokens, la licencia es MIT estándar.

Empieza aquí. Sube a V4 Pro solo cuando el trabajo con varios archivos empiece a mostrar la diferencia.

DeepSeek official pricing docs showing V4 Flash and V4 Pro with OpenAI and Anthropic format endpoints

Mejor en una GPU de consumo de 24 GB: Qwen3.6-27B

Un denso 27B que obtiene un 77.2% en SWE-Bench Verified, puntuaciones casi de buque insignia de un modelo que cabe en una sola tarjeta de consumo, razón por la cual es la respuesta recurrente en los hilos de r/LocalLLaMA que empiezan con "Tengo 24GB de VRAM."

Su hermano más rápido, Qwen3-Coder-Next (80B en total, solo 3B activos por token, Apache 2.0), es la opción de velocidad de la comunidad: un usuario lo ejecutó a ~20 tokens/s en una sola RX 9070 XT con el contexto completo de 262K. Si prefieres llamarlo como una API, empieza en $0.30/$1.50 a través de Alibaba Cloud.

Mejor autoalojamiento con una sola GPU: Gemma 4 31B

Según la tarjeta del modelo de Google, el 31B cabe en una H100 de 80GB con un contexto de 256K, bajo Apache 2.0. La variante 12B funciona en 16GB de VRAM.

Una trampa de dimensionamiento: los modelos MoE publicitan pequeñas cantidades de parámetros "activos", pero aun así tienes que almacenar todos los pesos. DeepSeek V4 Flash activa 13B por token pero pesa 284B en total, unos 142GB incluso a 4 bits. Eso es un proyecto de múltiples GPU, no una sola tarjeta.

La mejor opción económica para largas ejecuciones autónomas: MiniMax M3

1M de contexto a $0.30/$1.20, diseñado para sesiones de agentes de varias horas — MiniMax ha demostrado una ejecución de investigación sin supervisión de 12 horas. Comparte la verbosidad del modelo de pensamiento que viste en la tabla de resultados, así que presupuesten los tokens en consecuencia. Cuando la calidad importa más que el costo en una ejecución larga, GLM-5.2 arriba es la mejora.

Lo que las clasificaciones no te dicen

Los números de referencia están ahora muy cerca: el AI Index de Stanford encontró que la brecha entre el modelo #1 y el #10 se redujo de 11.9% a 5.4% en un año. Tres cosas que las tablas de puntuación aún ocultan:

El costo por tarea supera al costo por token. El precio de salida de $4.40 de GLM-5.2 parece cercano a los $4.00 de Kimi. Tras contar los tokens reales, el mismo trabajo cuesta 3.5x más. Las estadísticas en vivo de Kilo muestran el caso extremo: DeepSeek V4 Pro promedia $15.91 por cada intento de benchmark completado sobre un precio de etiqueta de $0.87.

Mismo modelo, distinto entorno, distinto resultado. Un modelo dentro de un bucle de agente bien construido (herramientas estructuradas, reintentos, límites de tokens sensatos) se comporta de forma muy distinta al mismo modelo en una llamada de chat sin procesar. Nuestros fallos de GLM sin código fueron una interacción de configuración, no una carencia de capacidad.

Cada benchmark mide una tarea diferente. LiveCodeBench es generación algorítmica; DeepSeek V4 Pro lo gana con 93.5%, por encima de los resultados publicados de los modelos cerrados. SWE-Bench Verified es corrección de errores a nivel de repositorio; Claude Mythos 5 sigue liderando con 95.5%, mientras que los modelos abiertos están alrededor del 80%. Adapta el benchmark a tu trabajo real antes de confiar en un ranking.

Reemplazar una suscripción de Claude

Un desencadenante común para volverse open source: alcanzar los límites de suscripción de Claude a mitad de la jornada laboral. Las cuentas salen. Nuestra prueba de dos tareas costó $0.00066 en DeepSeek V4 Flash; unas pocas centenas de estas llamadas al día siguen estando por debajo de un dólar.

El cambio también requiere menos ajustes de infraestructura que antes. DeepSeek publica un endpoint compatible con Anthropic (api.deepseek.com/anthropic), por lo que Claude Code puede usarlo con un cambio de variable de entorno; la misma configuración funciona para GLM-5.2. Y si quieres reservar Claude para los problemas difíciles mientras enrutas el trabajo rutinario a modelos abiertos, plataformas como AIReiter ofrecen Claude al 20% del precio de lista a través de la misma interfaz compatible con Anthropic.

Kimi K3: el que hay que seguir

Moonshot lanzó Kimi K3 el 16 de julio de 2026, y en trabajo de frontend ya ha superado al modelo cerrado más fuerte: #1 en la tabla de clasificación de Frontend Code con 1,679 frente a los 1,631 de Claude Fable 5, y los primeros informes prácticos apuntan en la misma dirección.

No está clasificado aquí por una razón: los weights se abren el 27 de julio. Hasta entonces es una API cerrada en $3/$15. Una vez que lleguen, K3 se convertirá en el modelo de open-weight más grande lanzado hasta la fecha, y los números de frontend anteriores sugieren que competirá por el primer puesto de esta lista. Estamos siguiendo el lanzamiento de open-weights de K3 por separado.

Cómo elegir

1. ¿Dónde se ejecutará? Con menos de 16GB de VRAM: use una API (Gemma 4 12B cabe localmente, pero espere una caída real en la calidad). 24GB: Qwen3.6-27B. Un H100: Gemma 4 31B. API: DeepSeek V4 Flash hasta que demuestre ser insuficiente. 2. ¿Qué tipo de trabajo? Las ediciones rápidas favorecen modelos concisos: Kimi K2.7 Code o DeepSeek. Los problemas difíciles y las ejecuciones largas de agentes favorecen GLM-5.2 (o MiniMax M3 si el presupuesto es limitado), con generosos presupuestos de tokens. 3. ¿Restricciones de licencia? MIT (GLM, DeepSeek) y Apache 2.0 (Qwen, Gemma) no tienen condiciones. El MIT modificado de Kimi añade una regla de atribución que solo entra en vigor a una escala comercial muy grande.

Preguntas frecuentes

¿Cuál es el mejor LLM de código abierto para programar en 2026?

GLM-5.2 tiene el techo más alto — resultados casi del nivel de Claude Sonnet en problemas difíciles, a costa de la velocidad. Kimi K2.7 Code gana en eficiencia de tokens para agentes API, Qwen3.6-27B para hardware local, DeepSeek V4 Flash en costo.

¿Puedo ejecutar estos modelos localmente de forma gratuita?

Los pesos son gratis; el hardware no lo es. Un modelo de 27B necesita una GPU de 24GB, Gemma 4 31B requiere 80GB, y los buques insignia de un billón de parámetros son solo para API o clúster.

¿Cuál es la diferencia entre open source y open weight?

Open-weight significa pesos libres pero datos de entrenamiento y código privados, lo que describe casi todos los modelos aquí. Los modelos de código abierto completos (OpenCoder, StarCoder2, IBM Granite Code) publican todo, pero van por detrás en capacidad.

¿Hay algún LLM de código abierto tan bueno como Claude para programar?

En benchmarks algorítmicos, sí: el 93.5% de DeepSeek V4 Pro en LiveCodeBench supera las puntuaciones publicadas de modelos cerrados. En correcciones a nivel de repositorio, Claude sigue liderando (95.5% frente a ~80% en SWE-Bench Verified). En nuestra prueba, los modelos abiertos igualaron a Claude en precisión, pero usaron entre 4 y 13 veces más tokens.

¿Qué LLM de código abierto es mejor para C++ o lenguajes de nicho?

La serie K2 de Kimi tiene la reputación más sólida en lenguajes de nicho (Moonshot menciona específicamente Zig). Para C++, el consenso de la comunidad apunta a DeepSeek V4 Pro y Qwen3 Coder Next. Elijas lo que elijas, pruébalo en tu propia base de código; la calidad en lenguajes de nicho varía mucho más de lo que sugieren los benchmarks de Python.