AIREITER

AI-изображения

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5Еще

AI-видео

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1Еще

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5Еще
СкороSeedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
ДОКИ APIЦЕНЫ
БлогОбновленияLLM API GuideClaude API GuideKimi K3 API Guide
ШАБЛОНЫ
  • AIReiter
  • Блог
  • DeepSeek V4 Flash vs GLM-5.2: тест после обновления 0731

DeepSeek V4 Flash vs GLM-5.2: тест после обновления 0731

Последнее обновление: 2026-07-31 07:36:02

Сегодня DeepSeek без лишнего шума обновила deepseek-v4-flash. В моём наборе из четырёх задач модель сравнялась с GLM-5.2 в трёх случаях, выиграла четвёртый и обошлась в 19 раз дешевле. Но по общим бенчмаркам GLM-5.2 всё ещё сильнее — а причина её провала на одной из моих задач кроется в ловушке, в которую легко попасть намеренно.

Речь о бюджете на рассуждения. Через endpoint, который я использовал, GLM-5.2 разворачивала длинную цепочку рассуждений даже для коротких запросов. На одной задаче с объёмной спецификацией она потратила 16 000 выходных токенов и так и не выдала ответ. Flash справилась с той же задачей за 2 525 токенов.

Что изменилось в обновлении deepseek-v4-flash 0731

В API-документации DeepSeek для deepseek-v4-flash теперь указана версия DeepSeek-V4-Flash-0731. Способ вызова не изменился, а алиас по-прежнему ведёт на свежую сборку. То есть код не сломается — но и явного сигнала о смене модели под этим именем вы не получите.

Документация DeepSeek API с версией модели DeepSeek-V4-Flash-0731, контекстом 1M и максимальным выводом 384K

На странице с ценами для этого обновления нет записи в changelog, а в новостном индексе DeepSeek на момент проверки 2026-07-31 не было публикаций за июль 2026 года. Отсюда важный вывод для любых сравнений: опубликованный результат Flash относится к той сборке, которая была активна во время теста. Смотрите и на дату, и на вариант модели: «Flash Base», «Flash (Reasoning)» и «Flash (Reasoning, Max Effort)» — это три разные строки с разными результатами.

Та же страница документации подтверждает ключевые для сравнения характеристики: контекст 1M, максимальный вывод 384K, режим thinking включён по умолчанию, но доступен и non-thinking режим. Лимит параллельных запросов — 2 500 против 500 у Pro. Сейчас Responses API поддерживает только deepseek-v4-flash; поддержка deepseek-v4-pro запланирована на начало августа 2026 года.

Четыре одинаковые задачи: результаты без субъективных оценок

2026-07-31 я отправил обеим моделям идентичные промпты через OpenAI-совместимый relay. Thinking остался в настройке по умолчанию, max_tokens был выставлен на 8 000, если не указано иное. Результаты проверялись механически, а не «на глаз»: две задачи на код запускались на скрытых тестах — 6 и 8 соответственно; JSON сверялся со схемой по каждому ключу; в задаче на извлечение данных существовала ровно одна правильная строка.

ЗадачаDeepSeek V4 Flash (0731)GLM-5.2
t1 — найти и исправить крайний случай при слиянии интервалов6/6 тестов, 5.0 с, 361 out6/6 тестов, 19.0 с, 990 out
t2 — реализовать next_version() по спецификации из 8 правил8/8 тестов, 29.9 с, 2,525 outответ не получен
t3 — строгий JSON: точные ключи, без fence-блокапройдено, 5.2 с, 327 outпройдено, 11.2 с, 826 out
t4 — найти и объединить 3 факта из ~45K токеновверно, 5.2 с, 172 outверно, 9.7 с, 317 out

В трёх задачах из четырёх — честная ничья. Обе модели нашли в t1 одну и ту же ошибку: строгое сравнение <, из-за которого не объединялись соприкасающиеся интервалы вроде (1,4) и (4,5). И обе предложили одинаковое исправление в один символ. Обе байт в байт выполнили требование к строгому JSON. В t4 обе правильно объединили секрет из записи 211 и правило из записи 1290, вернув quartz-mallard-90.

Групповая столбчатая диаграмма времени выполнения задач в секундах: DeepSeek V4 Flash против GLM-5.2

Выбивается t2, и здесь важна точность, а не победные заявления. GLM-5.2 не дала неверный ответ — она не дала никакого. При лимите 8 000 токенов модель потратила все 8 000 на рассуждения и через 110 с вернула пустой контент. Я повторил запуск с лимитом 16 000, чтобы исключить влияние своего ограничения: израсходовано 16 000 токенов, контент снова пустой, 214 с. Третья попытка с 24 000 завершилась ошибкой через 301 с. Flash сгенерировала функцию, прошедшую все восемь проверок, включая три случая, где нужно было выбросить ValueError.

Ограничения теста стоит назвать прямо: это n=1 на задачу и один relay endpoint, а не полноценный бенчмарк. В моём случае токены рассуждений тарифицируются внутри completion_tokens; официальный endpoint Z.ai может стримить или учитывать их иначе. По этим данным я готов защищать не точный коэффициент, а общую картину: GLM-5.2 тратит на задачу заметно больше токенов и реального времени.

В чём GLM-5.2 действительно сильнее

По метрикам, которыми обычно оценивают индустрию, GLM-5.2 — более сильная модель. Делать из моих результатов вывод, что дешёвая модель побеждает во всём, было бы неверно. Artificial Analysis ставит GLM-5.2 (max) 51 балл в Intelligence Index против 40 у DeepSeek V4 Flash (Reasoning, Max Effort): разрыв 11 баллов. При этом GLM заметно крупнее: 753B параметров всего и ~40B активных против 284B всего и 13B активных у Flash.

Опубликованные Z.ai показатели GLM-5.2 соответствуют флагманскому уровню: SWE-bench Pro 62.1%, Terminal-Bench 2.1 81.0, AIME 2026 99.2%, GPQA Diamond 91.2% и HLE with tools 54.7%. Это данные самого вендора, а у Flash по большинству этих тестов сопоставимых результатов нет.

Именно отсутствие пересечений — главный честный вывод по бенчмаркам. На сайте отслеживания моделей benchlm обе модели сравниваются, но победитель не называется: у пары нет ни одной полностью сопоставимой строки. Публичные показатели Flash взяты из набора для базовых моделей — MMLU 88.7%, HumanEval 69.5%, GSM8K 90.8%; GLM-5.2 оценивается по набору для агентного программирования.

Знания — единственная категория с пересечением, и там benchlm отдаёт преимущество GLM-5.2: 59.6 против 56.4. Когда на страницах сравнения встречаются противоречивые выводы по этой паре, обычно сравнивались разные варианты моделей и разные тестовые наборы. Ориентируйтесь на показатель, где совпадают вариант и дата с тем, что вы собираетесь вызывать.

Практики описывают разницу так же, как она проявилась в моём тесте. Вот цитата из ветки r/opencodeCLI, где обе модели запускали на одной задаче:

GLM 5.2 reasons hard on everything. V4 scales it, almost no wind-up on the simple fix, GLM 5.2 pulls ahead on anything that is not banally [simple] …

В одной фразе сформулирован весь компромисс: рассуждения GLM-5.2 помогают на сложных задачах, но на простых превращаются в чистые накладные расходы.

Разница в реальной цене больше, чем в прайс-листе

Начнём с базовых цен. Все они сверены с официальными страницами вендоров 2026-07-31.

За 1M токеновDeepSeek V4 FlashGLM-5.2Во сколько GLM дороже
Входные токены, cache miss$0.14$1.4010.0x
Входные токены, cache hit$0.0028$0.2692.9x
Выходные токены$0.28$4.4015.7x
Максимальный вывод384K128K—
Строки цен в документации DeepSeek API: cache hit $0.0028, cache miss $0.14, выход $0.28 за 1M токенов Таблица цен Z.ai: GLM-5.2 — $1.4 за вход, $0.26 за кешированный вход, $4.4 за выход на 1M токенов

Теперь применим эти ставки к фактическому расходу токенов в четырёх задачах. Разрыв становится больше, чем 15.7x для выходных токенов: более дорогая модель ещё и генерирует больше текста.

ЗадачаFlash: in→outСтоимость FlashGLM-5.2: in→outСтоимость GLM-5.2Разница
t1 исправление бага165→361$0.000124170→990$0.00459437.0x
t2 реализация182→2,525$0.000732196→16,000$0.07067496.5x
t3 строгий JSON171→327$0.000116177→826$0.00388233.5x
t4 длинный контекст45,225→172$0.00638044,164→317$0.0632249.9x
Все четыре45,743→3,385$0.00735244,707→18,133$0.14237519.4x

Все промпты отправлялись с холодным кешем, поэтому входные токены рассчитаны по тарифу cache miss. Чтобы воспроизвести любой результат, умножьте значения из этой таблицы на ставки из предыдущей.

Столбчатая диаграмма отношения стоимости GLM-5.2 к стоимости DeepSeek V4 Flash по задачам: от 9.9x до 96.5x

У t4 разрыв минимальный — 9.9x. В задачах с преобладанием входных токенов определяющим становится 10-кратное различие входного тарифа, а многословность ответа уже почти не влияет. Это единственный тип нагрузки, где премия GLM-5.2 остаётся относительно ограниченной.

На странице цен DeepSeek указано, что API «soon adopt a peak/off-peak pricing policy»: коэффициент 2x для всех тарифицируемых позиций с 09:00 до 12:00 и с 14:00 до 18:00 по пекинскому времени (UTC+8). Дата вступления в силу будет объявлена позже. В эти часы преимущество Flash по стоимости вывода сократится примерно до 5x. В другую сторону работает cache hit: у Flash вход с кешированием стоит $0.0028 — в 93 раза дешевле $0.26 у GLM-5.2, поэтому повторное использование большого стабильного префикса увеличивает разрыв. Если же вас интересует именно кодинг, у Z.ai есть Coding Plan от $18/month с включённой GLM-5.2 и тарифом в половину ставки в непиковое время; это другая модель оплаты, не совпадающая с приведёнными выше расценками за токены.

Какую модель выбирать под разные нагрузки

НагрузкаВыборПочему
Массовые простые и средние правки кодаV4 FlashНа t1 тот же ответ, что у GLM-5.2, но в 3.8 раза быстрее и в 37 раз дешевле
Строгий формат и структурированный вывод в масштабеV4 FlashБайт-в-байт тот же результат за 1/34 цены
Извлечение данных из больших документов с длинным контекстомV4 FlashТот же правильный ответ; разрыв в цене минимален, но всё равно составляет 9.9x
Сложное агентное программирование или код в нескольких файлахGLM-5.251 против 40 в Intelligence Index, а её собственный набор тестов сфокусирован именно на агентных задачах
Любая задача с жёстким max_tokensV4 FlashНа t2 GLM-5.2 не вернула ничего при лимитах 8K и 16K
Вывод более 128K токенов за один вызовV4 FlashМаксимум 384K против 128K у GLM-5.2

Считайте это стартовым правилом маршрутизации по стоимости, которое нужно проверить на собственных задачах, а не окончательным вердиктом: вывод основан на одном прогоне из четырёх задач. По умолчанию направляйте запросы в Flash, а на GLM-5.2 переводите тот поднабор, где цена ошибочного ответа выше, чем 19-кратная разница в расходах на токены. Если всё же используете GLM-5.2, оставляйте ей запас по лимиту: ограничение, щедрое для Flash, может обернуться платным отсутствием ответа.

Есть и то, чего это сравнение установить не может: после сегодняшнего выхода 0731 ещё не появилось независимой переоценки Flash. Поэтому разрыв 51 против 40 относится к апрельской сборке. Текущая разница в возможностях не измерена, и оценить её для своей нагрузки можно только собственными тестами на обоих алиасах.

FAQ

DeepSeek V4 Flash 0731 — это новая модель или обновление?

Это обновление существующей модели, а не новая модель. В документации DeepSeek указана версия DeepSeek-V4-Flash-0731 и сказано, что способ вызова не изменился. Поэтому deepseek-v4-flash продолжает вести на свежую сборку без изменений в вашем коде.

DeepSeek V4 Flash обошла GLM-5.2?

Не по общим возможностям: Artificial Analysis ставит GLM-5.2 (max) 51 балл против 40 у DeepSeek V4 Flash (Reasoning, Max Effort). Flash выиграла по стоимости каждой решённой задачи: в трёх из четырёх проверенных задач была ничья при общей цене в 19.4 раза ниже.

GLM-5.3 уже вышла?

Нет, по состоянию на 2026-07-31: GLM-5.2 остаётся самой новой моделью в собственной таблице цен Z.ai и списке моделей Coding Plan — строки с 5.3 нет ни там, ни там.

Что дешевле для задачи с контекстом 1M токенов?

DeepSeek V4 Flash: в 10 раз дешевле для входа без кеша и в 93 раза дешевле для входа с cache hit. Моя задача на извлечение данных из ~45K токенов стоила $0.006380 на Flash против $0.063224 на GLM-5.2.

Можно ли использовать обе модели в Claude Code?

Да, оба вендора документируют endpoint в формате Anthropic. DeepSeek указывает https://api.deepseek.com/anthropic рядом со своим базовым URL в формате OpenAI, а инструкция Z.ai для Claude Code предлагает установить ANTHROPIC_BASE_URL в https://api.z.ai/api/anthropic и сопоставить слоты Sonnet и Opus с glm-5.2[1m].

Читайте также

  • DeepSeek V4 Flash vs DeepSeek V4 Pro
  • GLM-5.2 API

Источники

  • DeepSeek Models & Pricing — примечание о версии 0731, цены, политика peak/off-peak; проверено 2026-07-31
  • Z.ai pricing — тарифы GLM-5.2; проверено 2026-07-31
  • Z.ai Coding Plan — уровни подписки и покрытие GLM-5.2; проверено 2026-07-31
  • Z.ai: Claude Code setup — Anthropic-совместимый базовый URL и сопоставление моделей
  • DeepSeek news index — проверено 2026-07-31: записи за июль 2026 года нет
  • Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index, параметры
  • benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — покрытие общих бенчмарков, оценки знаний
  • r/opencodeCLI: DeepSeek V4 vs GLM 5.2 for coding — отчёт практикующего пользователя

>_Каталог моделей AIReiter

Быстрый API-доступ к моделям, связанным с этим гайдом

Kimi K3

Chat

Модель для рассуждений с длинным контекстом для программирования, письма, анализа и агентных рабочих процессов.

moonshotСоздать API Key >

Gemini 3.6 Flash

Chat

Быстрая модель Gemini для продвинутых рассуждений, программирования и agentic-задач.

GoogleСоздать API Key >

Claude Fable 5

Chat

Премиальная модель Claude для глубокого рассуждения и сложной объемной работы.

AnthropicСоздать API Key >

Claude Opus 4.8

Chat

Высокопроизводительная модель Claude для сложных задач, требующих глубоких рассуждений и профессиональной работы.

AnthropicСоздать API Key >

Claude Opus 5

Chat

Премиальная модель Claude для сложного анализа, программирования и профессиональной работы с длинным контекстом.

anthropicСоздать API Key >

Недавние статьи

Снижение цен на GPT-5.6: сколько теперь стоят Luna и Terra

2026-07-31

Invalid API Key: как разобраться с 401 и 403 до замены ключа

2026-07-31

Как исправить ошибку OpenRouter 429: лимит платформы или провайдера?

2026-07-31

B2B-разведка по рекламе: почему без HTML-парсера не обойтись и как пережить редизайн

2026-07-31
AIREITER

Есть вопросы? Свяжитесь с нами
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

AI-видео

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

AI-изображения

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

Блог

Посмотреть все →

Компания

Политика конфиденциальностиУсловия обслуживанияПолитика возврата

© 2026 AIReiter. Все права защищены.