Сегодня DeepSeek без лишнего шума обновила deepseek-v4-flash. В моём наборе из четырёх задач модель сравнялась с GLM-5.2 в трёх случаях, выиграла четвёртый и обошлась в 19 раз дешевле. Но по общим бенчмаркам GLM-5.2 всё ещё сильнее — а причина её провала на одной из моих задач кроется в ловушке, в которую легко попасть намеренно.
Речь о бюджете на рассуждения. Через endpoint, который я использовал, GLM-5.2 разворачивала длинную цепочку рассуждений даже для коротких запросов. На одной задаче с объёмной спецификацией она потратила 16 000 выходных токенов и так и не выдала ответ. Flash справилась с той же задачей за 2 525 токенов.
Что изменилось в обновлении deepseek-v4-flash 0731
В API-документации DeepSeek для deepseek-v4-flash теперь указана версия DeepSeek-V4-Flash-0731. Способ вызова не изменился, а алиас по-прежнему ведёт на свежую сборку. То есть код не сломается — но и явного сигнала о смене модели под этим именем вы не получите.
На странице с ценами для этого обновления нет записи в changelog, а в новостном индексе DeepSeek на момент проверки 2026-07-31 не было публикаций за июль 2026 года. Отсюда важный вывод для любых сравнений: опубликованный результат Flash относится к той сборке, которая была активна во время теста. Смотрите и на дату, и на вариант модели: «Flash Base», «Flash (Reasoning)» и «Flash (Reasoning, Max Effort)» — это три разные строки с разными результатами.
Та же страница документации подтверждает ключевые для сравнения характеристики: контекст 1M, максимальный вывод 384K, режим thinking включён по умолчанию, но доступен и non-thinking режим. Лимит параллельных запросов — 2 500 против 500 у Pro. Сейчас Responses API поддерживает только deepseek-v4-flash; поддержка deepseek-v4-pro запланирована на начало августа 2026 года.
Четыре одинаковые задачи: результаты без субъективных оценок
2026-07-31 я отправил обеим моделям идентичные промпты через OpenAI-совместимый relay. Thinking остался в настройке по умолчанию, max_tokens был выставлен на 8 000, если не указано иное. Результаты проверялись механически, а не «на глаз»: две задачи на код запускались на скрытых тестах — 6 и 8 соответственно; JSON сверялся со схемой по каждому ключу; в задаче на извлечение данных существовала ровно одна правильная строка.
| Задача | DeepSeek V4 Flash (0731) | GLM-5.2 |
|---|---|---|
| t1 — найти и исправить крайний случай при слиянии интервалов | 6/6 тестов, 5.0 с, 361 out | 6/6 тестов, 19.0 с, 990 out |
t2 — реализовать next_version() по спецификации из 8 правил | 8/8 тестов, 29.9 с, 2,525 out | ответ не получен |
| t3 — строгий JSON: точные ключи, без fence-блока | пройдено, 5.2 с, 327 out | пройдено, 11.2 с, 826 out |
| t4 — найти и объединить 3 факта из ~45K токенов | верно, 5.2 с, 172 out | верно, 9.7 с, 317 out |
В трёх задачах из четырёх — честная ничья. Обе модели нашли в t1 одну и ту же ошибку: строгое сравнение <, из-за которого не объединялись соприкасающиеся интервалы вроде (1,4) и (4,5). И обе предложили одинаковое исправление в один символ. Обе байт в байт выполнили требование к строгому JSON. В t4 обе правильно объединили секрет из записи 211 и правило из записи 1290, вернув quartz-mallard-90.
Выбивается t2, и здесь важна точность, а не победные заявления. GLM-5.2 не дала неверный ответ — она не дала никакого. При лимите 8 000 токенов модель потратила все 8 000 на рассуждения и через 110 с вернула пустой контент. Я повторил запуск с лимитом 16 000, чтобы исключить влияние своего ограничения: израсходовано 16 000 токенов, контент снова пустой, 214 с. Третья попытка с 24 000 завершилась ошибкой через 301 с. Flash сгенерировала функцию, прошедшую все восемь проверок, включая три случая, где нужно было выбросить ValueError.
Ограничения теста стоит назвать прямо: это n=1 на задачу и один relay endpoint, а не полноценный бенчмарк. В моём случае токены рассуждений тарифицируются внутри completion_tokens; официальный endpoint Z.ai может стримить или учитывать их иначе. По этим данным я готов защищать не точный коэффициент, а общую картину: GLM-5.2 тратит на задачу заметно больше токенов и реального времени.
В чём GLM-5.2 действительно сильнее
По метрикам, которыми обычно оценивают индустрию, GLM-5.2 — более сильная модель. Делать из моих результатов вывод, что дешёвая модель побеждает во всём, было бы неверно. Artificial Analysis ставит GLM-5.2 (max) 51 балл в Intelligence Index против 40 у DeepSeek V4 Flash (Reasoning, Max Effort): разрыв 11 баллов. При этом GLM заметно крупнее: 753B параметров всего и ~40B активных против 284B всего и 13B активных у Flash.
Опубликованные Z.ai показатели GLM-5.2 соответствуют флагманскому уровню: SWE-bench Pro 62.1%, Terminal-Bench 2.1 81.0, AIME 2026 99.2%, GPQA Diamond 91.2% и HLE with tools 54.7%. Это данные самого вендора, а у Flash по большинству этих тестов сопоставимых результатов нет.
Именно отсутствие пересечений — главный честный вывод по бенчмаркам. На сайте отслеживания моделей benchlm обе модели сравниваются, но победитель не называется: у пары нет ни одной полностью сопоставимой строки. Публичные показатели Flash взяты из набора для базовых моделей — MMLU 88.7%, HumanEval 69.5%, GSM8K 90.8%; GLM-5.2 оценивается по набору для агентного программирования.
Знания — единственная категория с пересечением, и там benchlm отдаёт преимущество GLM-5.2: 59.6 против 56.4. Когда на страницах сравнения встречаются противоречивые выводы по этой паре, обычно сравнивались разные варианты моделей и разные тестовые наборы. Ориентируйтесь на показатель, где совпадают вариант и дата с тем, что вы собираетесь вызывать.
Практики описывают разницу так же, как она проявилась в моём тесте. Вот цитата из ветки r/opencodeCLI, где обе модели запускали на одной задаче:
GLM 5.2 reasons hard on everything. V4 scales it, almost no wind-up on the simple fix, GLM 5.2 pulls ahead on anything that is not banally [simple] …
В одной фразе сформулирован весь компромисс: рассуждения GLM-5.2 помогают на сложных задачах, но на простых превращаются в чистые накладные расходы.
Разница в реальной цене больше, чем в прайс-листе
Начнём с базовых цен. Все они сверены с официальными страницами вендоров 2026-07-31.
| За 1M токенов | DeepSeek V4 Flash | GLM-5.2 | Во сколько GLM дороже |
|---|---|---|---|
| Входные токены, cache miss | $0.14 | $1.40 | 10.0x |
| Входные токены, cache hit | $0.0028 | $0.26 | 92.9x |
| Выходные токены | $0.28 | $4.40 | 15.7x |
| Максимальный вывод | 384K | 128K | — |
Теперь применим эти ставки к фактическому расходу токенов в четырёх задачах. Разрыв становится больше, чем 15.7x для выходных токенов: более дорогая модель ещё и генерирует больше текста.
| Задача | Flash: in→out | Стоимость Flash | GLM-5.2: in→out | Стоимость GLM-5.2 | Разница |
|---|---|---|---|---|---|
| t1 исправление бага | 165→361 | $0.000124 | 170→990 | $0.004594 | 37.0x |
| t2 реализация | 182→2,525 | $0.000732 | 196→16,000 | $0.070674 | 96.5x |
| t3 строгий JSON | 171→327 | $0.000116 | 177→826 | $0.003882 | 33.5x |
| t4 длинный контекст | 45,225→172 | $0.006380 | 44,164→317 | $0.063224 | 9.9x |
| Все четыре | 45,743→3,385 | $0.007352 | 44,707→18,133 | $0.142375 | 19.4x |
Все промпты отправлялись с холодным кешем, поэтому входные токены рассчитаны по тарифу cache miss. Чтобы воспроизвести любой результат, умножьте значения из этой таблицы на ставки из предыдущей.
У t4 разрыв минимальный — 9.9x. В задачах с преобладанием входных токенов определяющим становится 10-кратное различие входного тарифа, а многословность ответа уже почти не влияет. Это единственный тип нагрузки, где премия GLM-5.2 остаётся относительно ограниченной.
На странице цен DeepSeek указано, что API «soon adopt a peak/off-peak pricing policy»: коэффициент 2x для всех тарифицируемых позиций с 09:00 до 12:00 и с 14:00 до 18:00 по пекинскому времени (UTC+8). Дата вступления в силу будет объявлена позже. В эти часы преимущество Flash по стоимости вывода сократится примерно до 5x. В другую сторону работает cache hit: у Flash вход с кешированием стоит $0.0028 — в 93 раза дешевле $0.26 у GLM-5.2, поэтому повторное использование большого стабильного префикса увеличивает разрыв. Если же вас интересует именно кодинг, у Z.ai есть Coding Plan от $18/month с включённой GLM-5.2 и тарифом в половину ставки в непиковое время; это другая модель оплаты, не совпадающая с приведёнными выше расценками за токены.
Какую модель выбирать под разные нагрузки
| Нагрузка | Выбор | Почему |
|---|---|---|
| Массовые простые и средние правки кода | V4 Flash | На t1 тот же ответ, что у GLM-5.2, но в 3.8 раза быстрее и в 37 раз дешевле |
| Строгий формат и структурированный вывод в масштабе | V4 Flash | Байт-в-байт тот же результат за 1/34 цены |
| Извлечение данных из больших документов с длинным контекстом | V4 Flash | Тот же правильный ответ; разрыв в цене минимален, но всё равно составляет 9.9x |
| Сложное агентное программирование или код в нескольких файлах | GLM-5.2 | 51 против 40 в Intelligence Index, а её собственный набор тестов сфокусирован именно на агентных задачах |
Любая задача с жёстким max_tokens | V4 Flash | На t2 GLM-5.2 не вернула ничего при лимитах 8K и 16K |
| Вывод более 128K токенов за один вызов | V4 Flash | Максимум 384K против 128K у GLM-5.2 |
Считайте это стартовым правилом маршрутизации по стоимости, которое нужно проверить на собственных задачах, а не окончательным вердиктом: вывод основан на одном прогоне из четырёх задач. По умолчанию направляйте запросы в Flash, а на GLM-5.2 переводите тот поднабор, где цена ошибочного ответа выше, чем 19-кратная разница в расходах на токены. Если всё же используете GLM-5.2, оставляйте ей запас по лимиту: ограничение, щедрое для Flash, может обернуться платным отсутствием ответа.
Есть и то, чего это сравнение установить не может: после сегодняшнего выхода 0731 ещё не появилось независимой переоценки Flash. Поэтому разрыв 51 против 40 относится к апрельской сборке. Текущая разница в возможностях не измерена, и оценить её для своей нагрузки можно только собственными тестами на обоих алиасах.
FAQ
DeepSeek V4 Flash 0731 — это новая модель или обновление?
Это обновление существующей модели, а не новая модель. В документации DeepSeek указана версия DeepSeek-V4-Flash-0731 и сказано, что способ вызова не изменился. Поэтому deepseek-v4-flash продолжает вести на свежую сборку без изменений в вашем коде.
DeepSeek V4 Flash обошла GLM-5.2?
Не по общим возможностям: Artificial Analysis ставит GLM-5.2 (max) 51 балл против 40 у DeepSeek V4 Flash (Reasoning, Max Effort). Flash выиграла по стоимости каждой решённой задачи: в трёх из четырёх проверенных задач была ничья при общей цене в 19.4 раза ниже.
GLM-5.3 уже вышла?
Нет, по состоянию на 2026-07-31: GLM-5.2 остаётся самой новой моделью в собственной таблице цен Z.ai и списке моделей Coding Plan — строки с 5.3 нет ни там, ни там.
Что дешевле для задачи с контекстом 1M токенов?
DeepSeek V4 Flash: в 10 раз дешевле для входа без кеша и в 93 раза дешевле для входа с cache hit. Моя задача на извлечение данных из ~45K токенов стоила $0.006380 на Flash против $0.063224 на GLM-5.2.
Можно ли использовать обе модели в Claude Code?
Да, оба вендора документируют endpoint в формате Anthropic. DeepSeek указывает https://api.deepseek.com/anthropic рядом со своим базовым URL в формате OpenAI, а инструкция Z.ai для Claude Code предлагает установить ANTHROPIC_BASE_URL в https://api.z.ai/api/anthropic и сопоставить слоты Sonnet и Opus с glm-5.2[1m].
Читайте также
Источники
- DeepSeek Models & Pricing — примечание о версии 0731, цены, политика peak/off-peak; проверено 2026-07-31
- Z.ai pricing — тарифы GLM-5.2; проверено 2026-07-31
- Z.ai Coding Plan — уровни подписки и покрытие GLM-5.2; проверено 2026-07-31
- Z.ai: Claude Code setup — Anthropic-совместимый базовый URL и сопоставление моделей
- DeepSeek news index — проверено 2026-07-31: записи за июль 2026 года нет
- Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index, параметры
- benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — покрытие общих бенчмарков, оценки знаний
- r/opencodeCLI: DeepSeek V4 vs GLM 5.2 for coding — отчёт практикующего пользователя