Краткий ответ: GLM-5.2 — сейчас самая сильная open source LLM для кодинга: при длительном использовании качество её ответов приближается к уровню Claude Sonnet, и это модель, которую мы бы выбрали для самых сложных задач. Но она также медленная и прожорлива по токенам, поэтому для быстрых API-агентов для кодинга выбирайте Kimi K2.7 Code, для минимальной стоимости — DeepSeek V4 Flash, а для своей 24GB GPU — Qwen3.6-27B.
Это вывод, полученный при подаче тех же двух задач по программированию пяти флагманам с открытым исходным кодом, при этом Claude Opus 4.8 использовался как эталон закрытого исходного кода. Все они сгенерировали корректный код. Разница заключалась в том, сколько токенов они сожгли, чтобы добиться этого, и эта разница по стоимости достигала 48x.
Одно замечание о формулировке: почти все это технически open-weight models: веса доступны бесплатно, а обучающие данные — нет. Мы используем «open source», потому что именно этот термин люди ищут. Различие имеет значение только для одного ответа в FAQ ниже.
Как мы тестировали
Две задачи, один и тот же промпт для каждой модели, отправлены 17 июля 2026 года с настройками по умолчанию:
- Задача 1: написать функцию для разбора длительности с непростыми крайними случаями (12 тестовых случаев)
- Задача 2: исправить ошибочную функцию объединения интервалов (6 тестовых случаев)
Мы локально оценили код и для каждого запуска зафиксировали три показателя: процент успешного выполнения, количество выходных токенов и время по часам. Стоимость — это число токенов, умноженное на прайс-лист каждого поставщика, который мы проверили в тот же день. Две задачи — это скорее проба, а не бенчмарк, но это именно тот тип рутинного запроса, который вы будете отправлять сотни раз.
Результаты
Каждая модель прошла каждый тестовый случай. Поэтому таблица ниже посвящена одному: эффективности:
| Модель | Токены вывода (обе задачи) | Время для задачи 1 | Стоимость |
|---|---|---|---|
| Kimi K2.7 Code | 2,183 | 45.2s | $0.0090 |
| DeepSeek V4 Flash | 2,231 | 16.7s | $0.00066 |
| DeepSeek V4 Pro | 2,527 | 37.3s | $0.0023 |
| MiniMax M3 | 5,409 | 36.7s | $0.0067 |
| GLM-5.2 | 7,130 | 99.3s | $0.0318 |
| Claude Opus 4.8 (baseline) | 539 | 8.1s | — |
Столбец токенов — это и есть вся история. GLM-5.2 и MiniMax M3 — это «мыслящие» модели: по умолчанию они долго рассуждают перед ответом. Это рассуждение тарифицируется как output. Для той же корректной функции GLM-5.2 написал в 3 раза больше токенов, чем Kimi K2.7 Code.
С token cap всё становится ещё хуже. Когда мы ограничили ответы 2,048 tokens, обе thinking models потратили весь бюджет на reasoning и вернули вообще никакого code. Вы платите и не получаете ничего. GLM-5.2 потребовался потолок в 16,384 tokens, прежде чем он завершил работу, а его две неудачные попытки сами по себе стоили около $0.045. Если вы используете thinking model внутри coding agent, увеличьте max_tokens или отключите thinking для routine edits.
Для сравнения, Claude Opus 4.8 решил обе задачи за 539 токенов. Открытые модели догнали по корректности; по краткости закрытый базовый вариант всё ещё впереди в 4 раза.
Лучшие open source модели для кодирования по уровню развертывания
Выбирайте в зависимости от того, где будет работать модель. Цены указаны за 1 млн токенов, подтверждено 2026-07-17.
Самая сильная модель, если вы можете подождать её: GLM-5.2
В сложной, многошаговой работе по программированию качество результатов GLM-5.2 — самое близкое, чего сейчас достигает открытая модель до уровня Claude: она лидирует в агентных бенчмарках (SWE-Bench Pro, Terminal-Bench 2.1), а в нашем собственном длительном использовании это та модель, которой мы доверяем проблемы, с которыми остальные справляются хуже. Подробнее в нашем руководстве по API GLM-5.2.
Цена этого качества — терпение. Это была самая медленная и самая «прожорливая» модель в нашем тесте (99.3s и 5,695 tokens на Task 1), а низкая скорость обслуживания отражает скорее ограниченную GPU capacity со стороны поставщика, чем саму модель. $1.40 in / $4.40 out, 1M context, plain MIT. Давайте ей сложные задачи и большой token budget; быстрые правки направляйте куда-нибудь ещё.
Лучше всего для быстрых API-агентов кодирования: Kimi K2.7 Code
Самая экономичная по токенам открытая модель, которую мы тестировали: её исправление бага заняло 259 токенов, с лаконичностью, как у Claude. Она также лидирует в бенчмарке выполнения задач Kilo с результатом 60.7%.
Цена: $0.95 за вход / $4.00 за выход, $0.19 при попадании в кэш. Единственное реальное ограничение — контекст: 262K tokens, тогда как у остальных моделей из этого списка — 1M. Для сравнения с ближайшим конкурентом см. Kimi K2.7 Code vs GLM-5.2.
Лучшее соотношение цены и качества: DeepSeek V4 Flash
$0.14 на входе / $0.28 на выходе, безусловно, самая дешёвая модель здесь, и при этом она всё равно справилась со всем, что мы ей подбрасывали, оказавшись самой быстрой среди открытых моделей. Её опубликованные результаты (79.0% SWE-Bench Verified, 91.6% LiveCodeBench) находятся в пределах двух пунктов от её старшего брата. Контекст — 1M tokens, лицензия — обычная MIT.
Начните здесь. Переходите на V4 Pro только тогда, когда при работе с несколькими файлами начнет проявляться разница.
Лучше всего на потребительском GPU с 24 ГБ: Qwen3.6-27B
Плотная 27B-модель, которая показывает 77.2% на SWE-Bench Verified — результаты почти уровня флагмана от модели, помещающейся на одну потребительскую видеокарту, поэтому она и является повторяющимся ответом в ветках r/LocalLLaMA, начинающихся с «У меня 24GB VRAM».
Его более быстрый собрат Qwen3-Coder-Next (80B total, only 3B active per token, Apache 2.0) — это популярный в сообществе выбор для скорости: один пользователь запустил его примерно на ~20 tokens/s на одной RX 9070 XT при полном контексте 262K. Если вы предпочитаете вызывать его как API, цена начинается с $0.30/$1.50 через Alibaba Cloud.
Лучший вариант для самостоятельного размещения на одной GPU: Gemma 4 31B
Согласно карточке модели Google, версия 31B помещается на одном 80GB H100 с контекстом 256K, под лицензией Apache 2.0. Вариант 12B работает в 16GB VRAM.
Одна ловушка с размером: MoE-модели рекламируют маленькое число «активных» параметров, но вам всё равно нужно хранить все веса. DeepSeek V4 Flash активирует 13B на токен, но имеет 284B в сумме, то есть около 142GB даже при 4-bit. Это проект для нескольких GPU, а не для одной карты.
Лучший бюджетный выбор для длительных автономных запусков: MiniMax M3
Контекст 1M за $0.30/$1.20, созданный для многочасовых агентных сессий — MiniMax продемонстрировал 12-часовой автономный исследовательский запуск. Он разделяет многословность thinking-model, которую вы видели в таблице результатов, так что планируйте токены соответственно. Когда на длинном запуске качество важнее стоимости, GLM-5.2 выше — это апгрейд.
Что не рассказывают вам рейтинговые таблицы
Показатели бенчмарков теперь близки: AI Index Стэнфорда обнаружил, что разрыв между моделью №1 и №10 сократился с 11,9% до 5,4% за год. Три вещи, которые по-прежнему скрывают таблицы результатов:
Стоимость за задачу важнее стоимости за токен. Цена вывода GLM-5.2 в $4.40 выглядит близкой к $4.00 у Kimi. После реального подсчёта токенов та же работа обходится в 3.5 раза дороже. Живые статистические данные Kilo показывают крайний случай: DeepSeek V4 Pro в среднем стоит $15.91 за одну завершённую попытку бенчмарка при номинальной цене $0.87.
Та же модель, другой каркас, другой результат. Модель внутри хорошо построенного agent loop (структурированные tools, retries, разумные token limits) ведёт себя совсем не так, как та же модель в обычном chat call. Наши сбои GLM zero-code были результатом взаимодействия конфигураций, а не недостатком возможностей.
Каждый бенчмарк измеряет разную задачу. LiveCodeBench — это алгоритмическая генерация; DeepSeek V4 Pro лидирует в нём с 93,5%, опережая опубликованные результаты закрытых моделей. SWE-Bench Verified — это исправление ошибок на уровне репозитория; Claude Mythos 5 по-прежнему лидирует с 95,5%, тогда как открытые модели находятся примерно на уровне 80%. Соотнесите бенчмарк с вашей реальной работой, прежде чем доверять рейтингу.
Замена подписки Claude
Обычный триггер для перехода на open source: упереться в лимиты подписки Claude в середине рабочего дня. Математика сходится. Наш двухзадачный тест обошёлся в $0.00066 на DeepSeek V4 Flash; даже несколько сотен таких вызовов в день всё равно укладываются в доллар.
Переключение также требует меньше возни с подключением, чем раньше. DeepSeek публикует endpoint, совместимый с Anthropic (api.deepseek.com/anthropic), так что Claude Code может использовать его после изменения переменной окружения; та же настройка работает и для GLM-5.2. А если вы хотите оставить Claude для сложных задач, а рутинную работу направлять открытым моделям, платформы вроде AIReiter предоставляют Claude по цене 20% от прайса через тот же интерфейс, совместимый с Anthropic.
Kimi K3: тот, за кем стоит следить
Moonshot выпустила Kimi K3 16 июля 2026 года, и в работе над frontend она уже обошла сильнейшую закрытую модель: #1 в рейтинге Frontend Code с результатом 1,679 против 1,631 у Claude Fable 5, а первые практические отзывы указывают в том же направлении.
Он не указан здесь по одной причине: веса станут доступны 27 июля. До тех пор это закрытый API по $3/$15. Когда они появятся, K3 станет крупнейшей на сегодняшний день open-weight моделью, и приведённые выше фронтенд-метрики показывают, что она будет претендовать на верхние позиции этого списка. Мы отслеживаем релиз K3 open-weights отдельно.
Как выбрать
1. Где это будет работать? При менее чем 16 ГБ VRAM: используйте API (Gemma 4 12B поместится локально, но ожидайте заметного падения качества). 24 ГБ: Qwen3.6-27B. Один H100: Gemma 4 31B. API: DeepSeek V4 Flash, пока не окажется недостаточным. 2. Какой тип работы? Для быстрых правок лучше подходят краткие модели: Kimi K2.7 Code или DeepSeek. Для сложных задач и длительных запусков агентных сценариев лучше подходит GLM-5.2 (или MiniMax M3, если нужен более бюджетный вариант), с щедрыми бюджетами токенов. 3. Ограничения лицензии? MIT (GLM, DeepSeek) и Apache 2.0 (Qwen, Gemma) не накладывают ограничений. Изменённая MIT у Kimi добавляет правило атрибуции, которое вступает в силу только при очень большом коммерческом масштабе.
Часто задаваемые вопросы
Какой лучший open source LLM для программирования в 2026 году?
GLM-5.2 имеет самый высокий потолок — результаты почти уровня Claude Sonnet на сложных задачах, но ценой скорости. Kimi K2.7 Code выигрывает по эффективности токенов для API-агентов, Qwen3.6-27B — для локального оборудования, DeepSeek V4 Flash — по стоимости.
Могу ли я запускать эти модели локально бесплатно?
Веса бесплатны; оборудование — нет. Модели с 27B параметров нужна GPU с 24GB, Gemma 4 31B требует 80GB, а флагманы с триллионом параметров доступны только через API или кластер.
В чем разница между open source и open weight?
Open-weight означает свободные веса, но закрытые обучающие данные и код, что описывает почти каждую модель здесь. Полностью open source модели (OpenCoder, StarCoder2, IBM Granite Code) публикуют всё, но отстают по возможностям.
Есть ли open source LLM, столь же хорошая для программирования, как Claude?
На алгоритмических бенчмарках — да: 93.5% DeepSeek V4 Pro по LiveCodeBench превосходит опубликованные результаты закрытых моделей. На уровне исправлений в репозитории по-прежнему лидирует Claude (95.5% против ~80% на SWE-Bench Verified). В нашем тесте открытые модели сравнялись с Claude по корректности, но использовали в 4–13x больше токенов.
Какая open source LLM лучше всего подходит для C++ или нишевых языков?
Серия K2 от Kimi имеет самую сильную репутацию в узкоспециализированных языках (Moonshot отдельно упоминает Zig). Для C++ сообщество чаще всего рекомендует DeepSeek V4 Pro и Qwen3 Coder Next. Что бы вы ни выбрали, тестируйте на собственной кодовой базе; качество для узкоспециализированных языков варьируется гораздо сильнее, чем показывают бенчмарки по Python.
