Что изменилось в DeepSeek V4.1 Flash
V4.1 Flash — это новое семейство моделей, а не дообученная V4 Flash. DeepSeek переработала архитектуру и обучила её с нуля на 45 триллионах мультимодальных токенов, и теперь уровень Flash опережает V4 Pro в большинстве бенчмарков для агентов.
Каузальный энкодер-декодер MoE
552B смесь экспертов (MoE), разделенная на 20-слойный энкодер и 20-слойный декодер. При чтении вашего промпта активно всего 8B параметров, а при генерации ответа — 16B, благодаря чему модель такого масштаба остается в ценовой категории Flash.
Агентный кодинг превосходит V4 Pro
DeepSeek заявляет о результатах Terminal-Bench 2.1 на уровне 90.6 против 82.7 у V4 Flash и 87.9 у V4 Pro, DeepSWE — 74.2 против 54.4 и 62.7, а также Codeforces на уровне 3471. В Terminal-Bench 3.0 произошел скачок с 7.6 до 30.0.
Зрение встроено изначально, а не надстроено
Новый энкодер DeepSeek-ViT обучался совместно с текстовой моделью с самого первого этапа предобучения. V4 Flash была исключительно текстовой, а её визуальная версия являлась экспериментом. Скриншоты, диаграммы и фотографии отправляются в том же запросе, что и промпт.
KV-кэш уменьшен вчетверо для контекста 1M
Сжатое разреженное внимание (compressed sparse attention) и хранение KV в формате FP4 сокращают глобальный кэш примерно до 890 байт на токен — около четверти от объема V4 Flash. Именно это позволяет контекстному окну в 1M токенов работать по ценам Flash со скоростью 214 токенов в секунду в независимых тестах.
DeepSeek V4.1 Flash против V4 Flash
В DeepSeek миграция уже выполнена: официальный идентификатор теперь deepseek-flash, а запросы с deepseek-v4-flash обслуживаются V4.1. На AIReiter обе модели разделены, поэтому вы можете зафиксировать любую из них.
Меньше активных параметров, выше результаты
V4 Flash активирует 13B параметров на каждом токене. V4.1 Flash активирует 8B на этапе prefill и 16B на этапе decode, при этом превосходя предшественника во всех бенчмарках для агентов, опубликованных DeepSeek. Не стоит воспринимать меньшее число параметров на этапе prefill как ухудшение.
Рассуждения теперь включены всегда
V4 Flash предлагала дискретные режимы рассуждений. V4.1 Flash использует непрерывное усилие рассуждения (reasoning effort) со значением high по умолчанию. На этом маршруте запрос с отключенным thinking всё равно вернет рассуждения; закладывайте max_tokens соответственно.
Ввод изображений встроен в базовую модель
Если раньше для скриншотов требовался отдельный vision-эндпоинт наряду с V4 Flash, то V4.1 Flash обрабатывает оба типа данных в одном вызове. Отправляйте изображения в виде base64 data URI в стандартном массиве content; этот маршрут не загружает удаленные URL изображений.
Официальная цена вывода удвоилась, кэша — нет
Официальная стоимость вывода выросла с $0.28 до $0.60 за миллион токенов. Входные токены при попадании в кэш остаются около $0.003. Нагрузки с длинным неизменным префиксом и короткими ответами стоят примерно столько же, сколько и раньше; генерация длинных ответов обойдется дороже.
Когда стоит остаться на V4 Flash
Если у вас зафиксирован тестовый набор (evaluation suite), клиент не умеет обрабатывать reasoning_content в циклах вызова инструментов или строгий лимит бюджета на токены вывода пока не позволяет перейти. В остальных случаях запускайте новые задачи на V4.1 Flash.
Цены на API DeepSeek V4.1 Flash
Единый фиксированный тариф круглые сутки
Все три типа токенов тарифицируются примерно на четверть дешевле непикового тарифа DeepSeek. На этом маршруте нет пиковых окон, поэтому задача, запущенная в рабочее время по Пекину, стоит столько же, сколько и ночью. Актуальные тарифы приведены над плейграундом.
В чем реальная экономия
По сравнению с официальным пиковым тарифом цена AIReiter составляет около 38%. По сравнению с непиковым — около 75%. Если ваш трафик приходится в основном на дневное время в Европе или США (что совпадает с пиковыми часами DeepSeek), разница окажется еще больше, чем указано в заголовке.
Токены рассуждений тарифицируются как выходные
На этом маршруте рассуждения нельзя отключить, а V4.1 Flash генерирует много текста при высоком уровне reasoning. В независимых тестах зафиксировано примерно вдвое больше токенов вывода по сравнению с аналогичными моделями на том же наборе задач. Задавайте max_tokens с учетом рассуждений и ответа.
Попадания в кэш — самая дешевая категория
Входной токен с попаданием в кэш (cache-hit) стоит около 2% от стоимости токена без попадания (cache-miss). Для циклов агентов, повторно отправляющих один и тот же system prompt и схему инструментов на каждом шаге, чтение из кэша составляет основную часть счета, и именно здесь V4.1 Flash наиболее выгоден.
Когда стоит использовать DeepSeek V4.1 Flash, а когда нет
Используйте для написания кода и терминальных агентов
Правки нескольких файлов, циклы тестирования и исправления, разбор логов CI и задачи управления компьютером — именно здесь прирост производительности по сравнению с V4 Flash и V4 Pro наиболее заметен. Длинные трейсы вызовов инструментов помещаются в контекстное окно 1M без необходимости разбиения на части.
Используйте для скриншотов и графиков
OCR со снимка интерфейса, распознавание графиков или проверка отрисованной страницы могут быть отправлены прямо в том же запросе, что и вопрос по коду. Никакой второй модели, никаких дополнительных счетов.
Используйте V4 Pro только для совместимости
DeepSeek сохранил доступ к V4 Pro после выхода V4.1 Flash по просьбам клиентов, а не из-за более высоких результатов в бенчмарках. Оставайтесь на Pro, если этого требует контракт или зафиксированные пайплайны оценки.
Не используйте в качестве энциклопедии
Базовая модель отстает от V4 Pro в SimpleQA-Verified примерно на 13 пунктов. Для поиска фактов без retrieval дополняйте контекст модели собственными документами или выбирайте модель, оптимизированную для извлечения знаний.
Сравните цену с GLM-5.3 Flash
GLM-5.3 Flash — еще одна мультимодальная flash-модель на AIReiter с более дешевой стоимостью вывода. Выбирайте V4.1 Flash для циклов агентов или работы с репозиториями; выбирайте GLM-5.3 Flash для масштабного извлечения данных и классификации.
Вызов API DeepSeek V4.1 Flash
Песочница на этой странице и API используют один и тот же id модели. Главное правило интеграции, вызывающее сбои на стороне клиента, связано с обработкой рассуждений (reasoning) внутри циклов вызова инструментов.
Отправьте реальную задачу для агента в песочнице
Вставьте лог с ошибкой, diff и ваш вопрос. Следите за выходными токенами, включая рассуждения (reasoning), и оцените качество ответа перед интеграцией в рабочий процесс. Передача изображений доступна через API.
POST /api/v1/chat/completions
Используйте модель "deepseek-v4-1-flash", API-ключ AIReiter и стандартное тело запроса Chat Completions. Потоковая передача (streaming) поддерживается. Тот же id принимается и на эндпоинте /api/v1/messages, если ваш стек работает с форматом Anthropic Messages.
Передавайте reasoning_content обратно при использовании инструментов
Всякий раз, когда запрос содержит массив tools, каждое предыдущее сообщение ассистента должно содержать поле reasoning_content, включая шаги, где вызов инструментов не производился. Его отсутствие вернет ошибку HTTP 400. Это правило нарушило работу нескольких агентных фреймворков на V4, и оно по-прежнему актуально.
Прикрепляйте изображения в массиве content (API)
Используйте блок image_url с data URI в формате base64. Поддерживаются форматы PNG, JPEG, GIF и WebP. Загрузка изображений по удаленным URL на этом маршруте не выполняется, поэтому передавайте байты инлайн. Помещайте текстовую часть первой, если изображение служит контекстом к вопросу, а не его основным объектом.
Вопросы по API DeepSeek V4.1 Flash
Model id, цены, миграция с V4 Flash, ввод изображений и правило работы с reasoning, вызывающее ошибки.
/ 01Какой id модели у DeepSeek V4.1 Flash API?
В AIReiter используйте deepseek-v4-1-flash. Внутренний ключ — chat-deepseek-v4-1-flash. Напрямую в DeepSeek официальный id — deepseek-flash, а старый id deepseek-v4-flash теперь также обслуживается моделью V4.1 Flash.
/ 02Как тарифицируется DeepSeek V4.1 Flash?
В официальном прайс-листе DeepSeek указано $0,15 за ввод, $0,60 за вывод и $0,003 за ввод с попаданием в кэш на миллион токенов в непиковые часы, с удвоением всех трех тарифов в пиковые часы по будням. AIReiter предлагает единый фиксированный тариф в любое время: примерно на 25% ниже непикового прайса и на 62% ниже пикового. Текущие цены для данного маршрута отображаются над песочницей.
/ 03V4.1 Flash лучше, чем V4 Pro?
В бенчмарках для агентов и кодинга, опубликованных DeepSeek, да: Terminal-Bench 2.1 — 90,6 против 87,9, а DeepSWE — 74,2 против 62,7. V4 Pro все еще лидирует в GPQA Diamond и в тестах на извлечение знаний. Сама DeepSeek теперь направляет новых пользователей на Flash.
/ 04Чем отличается от V4 Flash?
Новая архитектура encoder-decoder с 8B–16B активных параметров вместо 13B, нативная поддержка ввода изображений, постоянно включенное рассуждение (reasoning), в четыре раза меньший размер KV-кэша для контекстного окна в 1M токенов и значительный прирост во всех агентных бенчмарках. Официальная базовая цена на выходные токены также выросла с $0.28 до $0.60.
/ 05Можно ли отключить рассуждения (thinking)?
На этом маршруте — нет. Запросы с отключенным thinking все равно возвращают reasoning_content, а параметр reasoning_effort не передается дальше. Для контроля затрат используйте max_tokens и более лаконичные промпты.
/ 06Принимает ли модель изображения?
Да, через API. Компьютерное зрение (Vision) является нативным в V4.1 Flash и проверено на этом маршруте. Передавайте PNG, JPEG, GIF или WebP в виде base64 data URI в объекте image_url; удаленные URL-адреса не загружаются. Песочница (playground) на этой странице пока поддерживает только текст.
/ 07Почему цикл вызова инструментов (tool-calling) возвращает ошибку HTTP 400?
Вы убрали reasoning_content из предыдущего сообщения assistant. При наличии массива tools DeepSeek требует поле reasoning в каждом предыдущем ответе ассистента, даже в тех, где не было вызова инструментов. Сохраняйте его и передавайте обратно без изменений.
/ 08Какие лимиты действуют на контекст и вывод?
В документации DeepSeek заявлено контекстное окно в 1M токенов и максимальный объем вывода в 384K. По умолчанию в playground установлено ограничение в 8192 токена на вывод; увеличьте его для длительных агентных сессий и помните, что reasoning-токены также учитываются в этом лимите.
/ 09Какой эндпоинт следует вызывать?
POST https://aireiter.com/api/v1/chat/completions — основной контракт для этой модели. POST https://aireiter.com/api/v1/messages также работает с тем же id для клиентов в стиле Anthropic.
/ 10Можно ли протестировать модель перед интеграцией?
Да. Песочница (playground) на этой странице использует тот же model id и маршрут, что и API, поэтому подсчет токенов и поведение модели здесь полностью соответствуют ответам API.