AIREITER
DeepseekText Chat

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash API ниже официальных цен DeepSeek, без наценок в пиковые часы. Контекст 1M, нативная обработка изображений, топовые результаты в агентном кодинге. Попробуйте или вызовите API.

ВводОфициально $0.15 za 1 mln tokenovAIReiter $0.1127 za 1 mln tokenovВыводОфициально $0.60 za 1 mln tokenovAIReiter $0.4507 za 1 mln tokenovЧтение кэшаОфициально $0.003 za 1 mln tokenovAIReiter $0.0022 za 1 mln tokenov
Запустить через API

ВВОД

ВЫВОД

Example
Generated in
9.3 seconds
Входные Token
184
Выходные Token
1471
Tokens per second
158.17 tokens / second
Time to first token
-

Сведения о модели

Используйте тот же ключ модели в Playground, запросах API и внутренних рабочих процессах.

ID модели
deepseek-v4-1-flash
Провайдер
Deepseek
Протокол
OpenAI Chat Completions · Anthropic Messages
Окно контекста
1,000,000 токенов
Максимальный вывод
384,000 токенов
Входные Token
11.27 credits / 1 млн токенов
Выходные Token
45.07 credits / 1 млн токенов
Чтение кэша
0.225 credits / 1 млн токенов
Запись кэша
-

Что изменилось в DeepSeek V4.1 Flash

V4.1 Flash — это новое семейство моделей, а не дообученная V4 Flash. DeepSeek переработала архитектуру и обучила её с нуля на 45 триллионах мультимодальных токенов, и теперь уровень Flash опережает V4 Pro в большинстве бенчмарков для агентов.

Каузальный энкодер-декодер MoE

552B смесь экспертов (MoE), разделенная на 20-слойный энкодер и 20-слойный декодер. При чтении вашего промпта активно всего 8B параметров, а при генерации ответа — 16B, благодаря чему модель такого масштаба остается в ценовой категории Flash.

Агентный кодинг превосходит V4 Pro

DeepSeek заявляет о результатах Terminal-Bench 2.1 на уровне 90.6 против 82.7 у V4 Flash и 87.9 у V4 Pro, DeepSWE — 74.2 против 54.4 и 62.7, а также Codeforces на уровне 3471. В Terminal-Bench 3.0 произошел скачок с 7.6 до 30.0.

Зрение встроено изначально, а не надстроено

Новый энкодер DeepSeek-ViT обучался совместно с текстовой моделью с самого первого этапа предобучения. V4 Flash была исключительно текстовой, а её визуальная версия являлась экспериментом. Скриншоты, диаграммы и фотографии отправляются в том же запросе, что и промпт.

KV-кэш уменьшен вчетверо для контекста 1M

Сжатое разреженное внимание (compressed sparse attention) и хранение KV в формате FP4 сокращают глобальный кэш примерно до 890 байт на токен — около четверти от объема V4 Flash. Именно это позволяет контекстному окну в 1M токенов работать по ценам Flash со скоростью 214 токенов в секунду в независимых тестах.

DeepSeek V4.1 Flash против V4 Flash

В DeepSeek миграция уже выполнена: официальный идентификатор теперь deepseek-flash, а запросы с deepseek-v4-flash обслуживаются V4.1. На AIReiter обе модели разделены, поэтому вы можете зафиксировать любую из них.

Меньше активных параметров, выше результаты

V4 Flash активирует 13B параметров на каждом токене. V4.1 Flash активирует 8B на этапе prefill и 16B на этапе decode, при этом превосходя предшественника во всех бенчмарках для агентов, опубликованных DeepSeek. Не стоит воспринимать меньшее число параметров на этапе prefill как ухудшение.

Рассуждения теперь включены всегда

V4 Flash предлагала дискретные режимы рассуждений. V4.1 Flash использует непрерывное усилие рассуждения (reasoning effort) со значением high по умолчанию. На этом маршруте запрос с отключенным thinking всё равно вернет рассуждения; закладывайте max_tokens соответственно.

Ввод изображений встроен в базовую модель

Если раньше для скриншотов требовался отдельный vision-эндпоинт наряду с V4 Flash, то V4.1 Flash обрабатывает оба типа данных в одном вызове. Отправляйте изображения в виде base64 data URI в стандартном массиве content; этот маршрут не загружает удаленные URL изображений.

Официальная цена вывода удвоилась, кэша — нет

Официальная стоимость вывода выросла с $0.28 до $0.60 за миллион токенов. Входные токены при попадании в кэш остаются около $0.003. Нагрузки с длинным неизменным префиксом и короткими ответами стоят примерно столько же, сколько и раньше; генерация длинных ответов обойдется дороже.

Когда стоит остаться на V4 Flash

Если у вас зафиксирован тестовый набор (evaluation suite), клиент не умеет обрабатывать reasoning_content в циклах вызова инструментов или строгий лимит бюджета на токены вывода пока не позволяет перейти. В остальных случаях запускайте новые задачи на V4.1 Flash.

Цены на API DeepSeek V4.1 Flash

В прайс-листе DeepSeek указано $0,15 за ввод, $0,60 за вывод и $0,003 за ввод с попаданием в кэш на миллион токенов в непиковые часы, а в будние дни с 01:00 до 04:00 и с 06:00 до 10:00 UTC все три тарифа удваиваются. AIReiter предлагает единый фиксированный тариф круглосуточно: примерно на 25% ниже непикового прайса и на 62% ниже пикового.
01

Единый фиксированный тариф круглые сутки

Все три типа токенов тарифицируются примерно на четверть дешевле непикового тарифа DeepSeek. На этом маршруте нет пиковых окон, поэтому задача, запущенная в рабочее время по Пекину, стоит столько же, сколько и ночью. Актуальные тарифы приведены над плейграундом.

02

В чем реальная экономия

По сравнению с официальным пиковым тарифом цена AIReiter составляет около 38%. По сравнению с непиковым — около 75%. Если ваш трафик приходится в основном на дневное время в Европе или США (что совпадает с пиковыми часами DeepSeek), разница окажется еще больше, чем указано в заголовке.

03

Токены рассуждений тарифицируются как выходные

На этом маршруте рассуждения нельзя отключить, а V4.1 Flash генерирует много текста при высоком уровне reasoning. В независимых тестах зафиксировано примерно вдвое больше токенов вывода по сравнению с аналогичными моделями на том же наборе задач. Задавайте max_tokens с учетом рассуждений и ответа.

04

Попадания в кэш — самая дешевая категория

Входной токен с попаданием в кэш (cache-hit) стоит около 2% от стоимости токена без попадания (cache-miss). Для циклов агентов, повторно отправляющих один и тот же system prompt и схему инструментов на каждом шаге, чтение из кэша составляет основную часть счета, и именно здесь V4.1 Flash наиболее выгоден.

Когда стоит использовать DeepSeek V4.1 Flash, а когда нет

Сейчас DeepSeek позиционирует Flash выше V4 Pro по качеству, стоимости и скорости. Единственные оставшиеся причины выбрать другую модель — это воспроизведение фактических знаний и совместимость на стороне клиента, а не чистая производительность.
01

Используйте для написания кода и терминальных агентов

Правки нескольких файлов, циклы тестирования и исправления, разбор логов CI и задачи управления компьютером — именно здесь прирост производительности по сравнению с V4 Flash и V4 Pro наиболее заметен. Длинные трейсы вызовов инструментов помещаются в контекстное окно 1M без необходимости разбиения на части.

02

Используйте для скриншотов и графиков

OCR со снимка интерфейса, распознавание графиков или проверка отрисованной страницы могут быть отправлены прямо в том же запросе, что и вопрос по коду. Никакой второй модели, никаких дополнительных счетов.

03

Используйте V4 Pro только для совместимости

DeepSeek сохранил доступ к V4 Pro после выхода V4.1 Flash по просьбам клиентов, а не из-за более высоких результатов в бенчмарках. Оставайтесь на Pro, если этого требует контракт или зафиксированные пайплайны оценки.

04

Не используйте в качестве энциклопедии

Базовая модель отстает от V4 Pro в SimpleQA-Verified примерно на 13 пунктов. Для поиска фактов без retrieval дополняйте контекст модели собственными документами или выбирайте модель, оптимизированную для извлечения знаний.

05

Сравните цену с GLM-5.3 Flash

GLM-5.3 Flash — еще одна мультимодальная flash-модель на AIReiter с более дешевой стоимостью вывода. Выбирайте V4.1 Flash для циклов агентов или работы с репозиториями; выбирайте GLM-5.3 Flash для масштабного извлечения данных и классификации.

Вызов API DeepSeek V4.1 Flash

Песочница на этой странице и API используют один и тот же id модели. Главное правило интеграции, вызывающее сбои на стороне клиента, связано с обработкой рассуждений (reasoning) внутри циклов вызова инструментов.

01

Отправьте реальную задачу для агента в песочнице

Вставьте лог с ошибкой, diff и ваш вопрос. Следите за выходными токенами, включая рассуждения (reasoning), и оцените качество ответа перед интеграцией в рабочий процесс. Передача изображений доступна через API.

02

POST /api/v1/chat/completions

Используйте модель "deepseek-v4-1-flash", API-ключ AIReiter и стандартное тело запроса Chat Completions. Потоковая передача (streaming) поддерживается. Тот же id принимается и на эндпоинте /api/v1/messages, если ваш стек работает с форматом Anthropic Messages.

03

Передавайте reasoning_content обратно при использовании инструментов

Всякий раз, когда запрос содержит массив tools, каждое предыдущее сообщение ассистента должно содержать поле reasoning_content, включая шаги, где вызов инструментов не производился. Его отсутствие вернет ошибку HTTP 400. Это правило нарушило работу нескольких агентных фреймворков на V4, и оно по-прежнему актуально.

04

Прикрепляйте изображения в массиве content (API)

Используйте блок image_url с data URI в формате base64. Поддерживаются форматы PNG, JPEG, GIF и WebP. Загрузка изображений по удаленным URL на этом маршруте не выполняется, поэтому передавайте байты инлайн. Помещайте текстовую часть первой, если изображение служит контекстом к вопросу, а не его основным объектом.

Вопросы по API DeepSeek V4.1 Flash

Model id, цены, миграция с V4 Flash, ввод изображений и правило работы с reasoning, вызывающее ошибки.

/ 01

Какой id модели у DeepSeek V4.1 Flash API?

В AIReiter используйте deepseek-v4-1-flash. Внутренний ключ — chat-deepseek-v4-1-flash. Напрямую в DeepSeek официальный id — deepseek-flash, а старый id deepseek-v4-flash теперь также обслуживается моделью V4.1 Flash.

/ 02

Как тарифицируется DeepSeek V4.1 Flash?

В официальном прайс-листе DeepSeek указано $0,15 за ввод, $0,60 за вывод и $0,003 за ввод с попаданием в кэш на миллион токенов в непиковые часы, с удвоением всех трех тарифов в пиковые часы по будням. AIReiter предлагает единый фиксированный тариф в любое время: примерно на 25% ниже непикового прайса и на 62% ниже пикового. Текущие цены для данного маршрута отображаются над песочницей.

/ 03

V4.1 Flash лучше, чем V4 Pro?

В бенчмарках для агентов и кодинга, опубликованных DeepSeek, да: Terminal-Bench 2.1 — 90,6 против 87,9, а DeepSWE — 74,2 против 62,7. V4 Pro все еще лидирует в GPQA Diamond и в тестах на извлечение знаний. Сама DeepSeek теперь направляет новых пользователей на Flash.

/ 04

Чем отличается от V4 Flash?

Новая архитектура encoder-decoder с 8B–16B активных параметров вместо 13B, нативная поддержка ввода изображений, постоянно включенное рассуждение (reasoning), в четыре раза меньший размер KV-кэша для контекстного окна в 1M токенов и значительный прирост во всех агентных бенчмарках. Официальная базовая цена на выходные токены также выросла с $0.28 до $0.60.

/ 05

Можно ли отключить рассуждения (thinking)?

На этом маршруте — нет. Запросы с отключенным thinking все равно возвращают reasoning_content, а параметр reasoning_effort не передается дальше. Для контроля затрат используйте max_tokens и более лаконичные промпты.

/ 06

Принимает ли модель изображения?

Да, через API. Компьютерное зрение (Vision) является нативным в V4.1 Flash и проверено на этом маршруте. Передавайте PNG, JPEG, GIF или WebP в виде base64 data URI в объекте image_url; удаленные URL-адреса не загружаются. Песочница (playground) на этой странице пока поддерживает только текст.

/ 07

Почему цикл вызова инструментов (tool-calling) возвращает ошибку HTTP 400?

Вы убрали reasoning_content из предыдущего сообщения assistant. При наличии массива tools DeepSeek требует поле reasoning в каждом предыдущем ответе ассистента, даже в тех, где не было вызова инструментов. Сохраняйте его и передавайте обратно без изменений.

/ 08

Какие лимиты действуют на контекст и вывод?

В документации DeepSeek заявлено контекстное окно в 1M токенов и максимальный объем вывода в 384K. По умолчанию в playground установлено ограничение в 8192 токена на вывод; увеличьте его для длительных агентных сессий и помните, что reasoning-токены также учитываются в этом лимите.

/ 09

Какой эндпоинт следует вызывать?

POST https://aireiter.com/api/v1/chat/completions — основной контракт для этой модели. POST https://aireiter.com/api/v1/messages также работает с тем же id для клиентов в стиле Anthropic.

/ 10

Можно ли протестировать модель перед интеграцией?

Да. Песочница (playground) на этой странице использует тот же model id и маршрут, что и API, поэтому подсчет токенов и поведение модели здесь полностью соответствуют ответам API.