El precio principal de Sonnet 5 es más bajo que el de Sonnet 4.6 ($2/$10 introductory through Aug 31, 2026, vs. Sonnet 4.6's $3/$15), y el propio gráfico de lanzamiento de Anthropic lo llama una "strict improvement" sobre Sonnet 4.6. Ejecutamos ambos modelos en la misma tarea con varios niveles de esfuerzo para ver qué significa eso en la práctica. Resultado: en nuestra prueba, Sonnet 5 costó más que Sonnet 4.6 en todos los niveles de esfuerzo que probamos — no menos. Esto es lo que encontramos y por qué.
Una tarea, ejecuciones únicas. Todo lo que aparece a continuación proviene de una sola tarea de programación, una ejecución por configuración de modelo/esfuerzo. Tome los números específicos como orientativos, no como un benchmark estadísticamente promediado — el prompt exacto y una muestra de la salida sin procesar de la API están en el apéndice si desea reproducirlo en su propia carga de trabajo.
¿Es realmente Sonnet 5 más barato que Sonnet 4.6? Lo probamos.
Les dimos a ambos modelos la misma tarea — construir un limitador de tasa token-bucket en Python con tests, ejecutar los tests, corregir cualquier cosa que falle — mediante la CLI de Claude Code (claude -p --model <id> --effort <level> --output-format json), por lo que el costo y la duración provienen directamente de la respuesta de la API. Ejecutado el 2026-07-01.
Configuración | Coste | Duración | Turnos | Resultado |
|---|---|---|---|---|
Sonnet 5, effort | $0.344 | 31.6s | 5 | 6/6 tests pass |
Sonnet 4.6, effort | $0.261 | 36.0s | 6 | 7/7 tests pass |
Sonnet 4.6, effort | $0.253 | 35.3s | 5 | 7/7 tests pass |
Sonnet 5, effort | $0.349 | 36.4s | 5 | 8/8 tests pass |
Sonnet 5 fue más rápido con un esfuerzo medium, pero costó más que Sonnet 4.6 en ambas de las configuraciones de Sonnet 4.6 que probamos, incluida Sonnet 4.6 ejecutándose con un nivel de esfuerzo más bajo. Esto es lo contrario de algunos informes anecdóticos de la comunidad que afirman que Sonnet 5 sale más barato que Sonnet 4.6 una vez que comparas niveles de esfuerzo equivalentes.
La causa probable: Sonnet 5 funciona con un nuevo tokenizador. La propia documentación de Anthropic indica que produce "aproximadamente un 30% más de tokens" que Sonnet 4.6 para el mismo texto, y pruebas independientes de Simon Willison encontraron que el contenido en inglés en particular llegaba a usar hasta ~1.4x más tokens. El precio de etiqueta más bajo de Sonnet 5 no compensó por completo eso en nuestra tarea de prueba, y después del 31 de agosto de 2026 —cuando expira el precio introductorio de Sonnet 5 y ambos modelos quedan en la misma tarifa de etiqueta de $3/$15— la diferencia del tokenizador por sí sola sugiere que es probable que Sonnet 5 cueste más para un trabajo equivalente en inglés, no lo mismo, en ausencia de otros cambios de precio. (Desglose completo por idioma en nuestra guía de precios de Sonnet 5.)
Qué más cambió, además del costo
En los benchmarks oficiales, Sonnet 5 presenta mejoras reales: 80.4% frente a 67.0% en Terminal-Bench 2.1, 63.2% frente a 58.1% en SWE-bench Pro, según la hoja de sistema de Claude Sonnet 5 de Anthropic (véase nuestra tabla completa de benchmarks, que incluye Opus 4.8). El gráfico del anuncio de lanzamiento de Anthropic describe a Sonnet 5 como una "mejora estricta" sobre Sonnet 4.6.
Al observar nuestras cuatro salidas de prueba, destacó una diferencia de comportamiento que la tabla comparativa no recoge: Sonnet 5 añadió cosas que no le pedimos. En ambos niveles de esfuerzo, usó en las pruebas un reloj falso parcheado con monkeypatch para evitar llamadas reales a time.sleep(), y con esfuerzo high añadió seguridad para hilos al limitador de velocidad sin que se le pidiera. Sonnet 4.6, en ambos niveles de esfuerzo, se mantuvo más cerca de la descripción literal de la tarea: usó time.sleep() real en las pruebas y, con esfuerzo medium, añadió una tabla resumen para facilitar la lectura, pero no agregó nada a la implementación real más allá de lo solicitado.
Eso coincide con los comentarios reales de los usuarios publicados dentro del primer día del lanzamiento de Sonnet 5: un hilo de r/claude lo describía como "una mejora objetiva respecto a Sonnet 4.6 en términos de razonamiento... pero también se siente MUCHO más tenso que 4.6". Nuestra prueba es una muestra de una sola tarea, pero "añade alcance no solicitado con más facilidad" es una versión concreta y específica de esa misma observación.
¿Deberías actualizar?
Actualiza si tu carga de trabajo es principalmente en chino (el cambio en el tokenizador apenas afecta el recuento de tokens en chino), o si estás haciendo trabajo agentic/con mucho uso de herramientas, donde las mejoras de Terminal-Bench y SWE-bench importan más que un aumento modesto en el costo.
Espera si tu carga de trabajo tiene alto volumen y está muy orientada al inglés, y Sonnet 4.6 ya cumple con tu estándar de calidad: vuelve a calcular tus propios costos en lugar de confiar en el precio de lista, especialmente una vez que cierre la ventana de precios de introducción el 31 de agosto de 2026.
En cualquier caso, no asumas que el modelo más nuevo y aparentemente más barato cueste automáticamente menos por tarea. En nuestra prueba no fue así.
Preguntas frecuentes
¿Es Sonnet 5 realmente una "mejora estricta" respecto a Sonnet 4.6, como dice Anthropic?
En los benchmarks de capacidades que Anthropic ha publicado, sí — no encontramos ninguno en el que Sonnet 4.6 lidere. En costo por tarea, nuestra prueba encontró lo contrario una vez que se tiene en cuenta el cambio en el tokenizador, así que la "mejora estricta" no se extiende a la eficiencia de costes para todas las cargas de trabajo.
¿Por qué Sonnet 5 se siente "más al límite" que Sonnet 4.6?
Anthropic no ha publicado detalles sobre esto. A partir de nuestras propias salidas de prueba, Sonnet 5 estaba más dispuesto a añadir alcance no solicitado (seguridad de hilos, una configuración de reloj de pruebas más defensiva) que Sonnet 4.6, que se mantuvo más cerca de la solicitud literal. Eso es coherente con — aunque más limitado que — la descripción de la comunidad.
¿Es Sonnet 5 el modelo predeterminado ahora? ¿Todavía puedo usar Sonnet 4.6?
Según el anuncio de lanzamiento de Anthropic, Sonnet 5 reemplazó a Sonnet 4.6 como la opción predeterminada para los usuarios Free y Pro en claude.ai. Los usuarios de Max, Team y Enterprise, junto con los usuarios de API, aún pueden seleccionar Sonnet 4.6 directamente.
¿Debería comparar Sonnet 5 con Sonnet 4.6 o con Opus 4.8?
Una decisión completamente diferente. Esta página trata sobre la mejora generacional; si estás eligiendo específicamente entre Sonnet 5 y Opus 4.8, ejecutamos un conjunto separado de pruebas cara a cara — consulta Sonnet 5 vs Opus 4.8: pruebas reales.
¿Es real la afirmación de que "el nivel de mayor esfuerzo es más barato" que la gente está publicando en línea?
No en nuestra prueba. Ejecutamos Sonnet 5 en medium y high frente a Sonnet 4.6 en low y medium, y Sonnet 5 costó más en cada combinación. Los informes anecdóticos individuales varían según la tarea: realiza tu propia comparación en tu carga de trabajo real antes de asumir un cruce específico de nivel de esfuerzo.
Apéndice: Prompt Exacto y Salida Cruda
La tarea que enviamos a ambos modelos:
Implementa un limitador de tasa token-bucket como una clase de Python `RateLimiter(capacity: int,
refill_rate: float)` con un método `allow() -> bool` que devuelve si una solicitud
está permitida en este momento, consumiendo un token si es así. Usa un reloj monótono, sin
dependencias externas. Guárdalo en limiter.py.
Luego escribe test_limiter.py con al menos 5 casos de prueba que cubran: ráfaga hasta la capacidad
pasa y luego bloquea, los tokens se rellenan con el tiempo (usa time.sleep o un reloj que se pueda simular),
la tasa de relleno se respeta (no un relleno completo instantáneo), la capacidad nunca se excede, y
la capacidad cero/negativa se maneja de forma sensata.
Ejecuta las pruebas con pytest y asegúrate de que todas pasen. Si alguna falla, corrige el código y
vuelve a ejecutar hasta que todas pasen. Informa la salida final de pytest.
La respuesta real de la API para la ejecución de Sonnet 5 (medium), recortada a los campos relevantes para el costo y el tiempo:
{
"duration_ms": 31616,
"num_turns": 5,
"stop_reason": "end_turn",
"total_cost_usd": 0.3438645,
"usage": {
"input_tokens": 4302,
"cache_creation_input_tokens": 60894,
"cache_read_input_tokens": 233420,
"output_tokens": 2172
}
}