deepseek-v4-flash-vision-exp добавляет поддержку изображений в линейку V4 Flash. Но слово experimental здесь не для красоты: приведённые данные о запуске не подтверждают надёжность модели для продакшена. Поэтому сначала проведите пилот с логированием и резервной моделью и только потом решайте, можно ли делать её основным решением.
Как выбрать способ работы с API за 30 секунд
DeepSeek V4 Flash Vision Exp подойдёт, если существующий сценарий на V4 Flash должен анализировать скриншоты, графики, документы или другие изображения через совместимый с OpenAI API интерфейс. Для задач, связанных с идентификацией личности, безопасностью и другими решениями с высокой ценой ошибки, заранее оставьте резервный вариант и отдельно проверьте качество именно на своей задаче.
| Ситуация | Оптимальный способ передачи | Почему |
|---|---|---|
| Небольшое локальное изображение для однократного запроса | Base64 data URL | Не нужен публичный хостинг |
| Изображение уже размещено в открытом доступе | Внешний URL | Небольшой размер запроса |
| Большой файл или повторное использование | Files API через file_id | Файл можно переиспользовать; для каждого переданного изображения допускается до 64 MiB |
| Нужно снизить детализацию для общей задачи | detail: "low" | Перед инференсом изображение уменьшается до 512 x 512 |
Точная строка модели — deepseek-v4-flash-vision-exp. В официальном журнале изменений DeepSeek называет её экспериментальной и указывает доступность на API-платформе с 21 августа 2026 года. В примечании к релизу заявлен паритет с V4 Flash по возможностям работы только с текстом и заметный рост результатов на агентских бенчмарках, где требуется визуальное понимание.
Как отправить одно изображение через Chat Completions
В совместимом с OpenAI запросе Chat Completions текст и изображение передаются в массиве content внутри сообщения user. Официальное руководство Vision описывает поведение этой модели; если отправить изображение обычной deepseek-v4-flash, API вернёт ошибку 400.
import base64
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
with open("chart.png", "rb") as image_file:
encoded = base64.b64encode(image_file.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the three trends from this chart."},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encoded}",
"detail": "original",
},
},
],
}
],
)
print(response.choices[0].message.content)
В Chat Completions изображения поддерживаются в сообщениях пользователя. Кладите картинку и инструкцию в один массив content — так модель получает визуальный контекст и задачу одновременно.
Какой способ передачи изображения выбрать
Base64 — для небольшого локального файла
Для локального изображения, которое нужно отправить один раз, проще всего использовать Base64. Публичный хостинг не понадобится, но закодированные данные учитываются в лимите тела запроса 48 MiB, а размер исходного изображения не должен превышать 32 MiB.
Этот вариант удобен для разовых загрузок от пользователя или воркера, но не для изображений, которые повторно используются в пакетной обработке.
Публичный URL — для уже размещённых файлов
Публичные URL по http или https уменьшают размер запроса. При этом ссылка должна быть доступна извне, не длиннее 8 192 символов, файл должен скачиваться за 60 секунд, а его размер — не превышать 32 MiB. Приватные, просроченные и внутренние URL могут не сработать ещё до того, как DeepSeek попытается получить изображение.
Files API — для повторного использования и больших файлов
Загрузите изображение через Files API, а затем передайте в запросе Vision полученный идентификатор:
{
"type": "file",
"file_id": "file-api-xxxxxxxxxxxxxxxx"
}
Размер файла, передаваемого через ссылку на него, может достигать 64 MiB на изображение. При этом одни и те же байты не придётся загружать заново для каждого запроса. Обратная сторона — отдельный этап загрузки и управление жизненным циклом файла. Храните полученный ID вместе с ключом, который его создал, и не воспринимайте его как публичную ссылку для общего доступа.
Files API — практичный выбор, если файл больше 32 MiB, запрос может превысить 48 MiB или несколько шагов агента должны изучить одно и то же изображение.
Настройте детализацию до того, как начнёте за неё платить
Поле detail доступно для входных данных image_url и частей изображений в Responses API. Описанное ниже поведение соответствует официальному руководству Vision от DeepSeek.
| Значение | Заявленное поведение | Когда использовать |
|---|---|---|
low | Уменьшает изображение до 512 x 512 | Достаточно понять компоновку, общую сцену или выполнить грубую классификацию |
high | Сохраняет исходное изображение | Важны мелкий текст или тонкие детали |
original | Сохраняет исходное изображение | Нужно явно указать обработку в полном качестве |
auto | Сейчас эквивалентно original | Вас устраивает текущее поведение по умолчанию |
Перед инференсом DeepSeek масштабирует изображения. В руководстве Vision указано, что на одно изображение приходится не более 384 image tokens, причём изображения считаются независимо друг от друга. Поэтому очень большой исходный файл не обязательно потребует пропорционально больше image tokens после масштабирования, хотя крупные файлы всё равно могут упереться в ограничения на размер загрузки и запроса.
На официальной странице Models & Pricing для deepseek-v4-flash-vision-exp указаны те же тарифы за токены, что и для V4 Flash: $0.007 за 1M токенов кэшированного ввода и $0.22 за 1M токенов ввода при промахе кэша в непиковые часы; в пиковые часы — $0.014 и $0.44 соответственно. Вывод стоит $0.66 в непиковое время и $1.32 в пиковое. Image tokens тарифицируются как входные токены, поэтому количество изображений и выбранная детализация должны учитываться в оценке стоимости.
Лимиты, из-за которых API действительно падает
| Ограничение | Лимит или поведение |
|---|---|
| Поддерживаемые форматы | JPEG, PNG, GIF, WebP |
| Максимальный размер тела запроса | 48 MiB |
| Максимальный размер изображения через Base64 или URL | 32 MiB |
Максимальный размер изображения через file_id Files API | 64 MiB |
| Максимальное число изображений в запросе | 600 |
Общий размер изображений без file_id | 64 MiB |
Общий размер изображений, включая file_id | 200 MiB |
| Максимальный размер стороны | 8 192 пикселя |
| Ограничение на размер стороны при 15 и более изображениях | 4 096 пикселей |
| Длина внешнего URL | 8 192 символа |
| Загрузка изображения по внешней ссылке | Должна завершиться за 60 секунд |
Особенно легко упустить два ограничения. Изображения принимает только deepseek-v4-flash-vision-exp, а блоки изображений в сообщениях system или assistant не поддерживаются в Chat Completions. Если отправить изображение модели без Vision, DeepSeek указывает для ошибки 400 сообщение This model does not support image.
Одна модель, три интерфейса API
DeepSeek описывает работу с моделью через три интерфейса в своём руководстве Vision:
| Интерфейс | Блок изображения | Где получить результат |
|---|---|---|
| Chat Completions | image_url в пользовательском массиве content | response.choices[0].message.content |
| Responses API | input_image вместе с input_text | response.output_text |
| Anthropic-compatible API | image по адресу https://api.deepseek.com/anthropic | Содержимое сообщения Anthropic |
Все три интерфейса поддерживают Base64, публичные URL и ссылки на файлы из Files API, но типы блоков у них разные. Не переносите блок Chat Completions в Responses API без изменений.
Что показывают данные о запуске — и чего они не доказывают
В журнале изменений от 21 августа DeepSeek приводит сильные результаты собственных бенчмарков: в частности, 83.9 на Terminal Bench 2.1 и 64.3 на Chartography при p0.95. Это результаты, заявленные поставщиком, а не независимая проверка. Кроме того, в примечании к релизу говорится, что текстовая V4 Flash игнорирует мультимодальные элементы в двух визуальных оценках.
Результаты стартовых бенчмарков предоставлены самой DeepSeek, поэтому перед переводом трафика в продакшен проверьте визуальные сценарии, критичные именно для вашего приложения.
Подходит ли модель для продакшена?
DeepSeek V4 Flash Vision Exp можно использовать в контролируемом пилоте для анализа скриншотов, извлечения данных из графиков, первичной обработки документов или работы агента, которому нужно видеть состояние интерфейса. Те же цены, что у Flash, и три способа передачи изображений делают оценку недорогой, а ограничение в 384 токена на изображение даёт понятную отправную точку для расчёта расходов.
Не делайте эту модель единственным бэкендом для проверки личности, решений по безопасности, медицинской интерпретации и других визуальных задач с серьёзными последствиями, пока она остаётся экспериментальной, а приведённые данные о запуске не подтверждают надёжность в таких сценариях. Подключите резервную модель за тем же интерфейсом и записывайте источник изображения, значение detail, расход входных и выходных токенов, задержку, повторы и успешность выполнения задачи.
До перевода трафика в продакшен проверьте как минимум:
- Мелкий текст на скриншотах при детализации
lowиoriginal. - Графики с подписями, легендами и плотной разметкой осей.
- Несколько изображений в одном запросе.
- Приватные и медленные URL изображений.
- Вызов инструментов после визуального анализа.
- Некорректные или неоднозначные запросы на идентификацию.
- Поведение резервного сценария после ошибки 400, тайм-аута или некорректного ответа с изображением.
FAQ по DeepSeek V4 Flash Vision Exp API
Как называется модель?
Используйте deepseek-v4-flash-vision-exp. В журнале изменений DeepSeek от 21 августа 2026 года она названа экспериментальной мультимодальной моделью, доступной на API-платформе.
Тарифицируется ли она так же, как V4 Flash?
Да. На странице с тарифами DeepSeek для Vision Exp и V4 Flash указаны одинаковые ставки за токены при попадании и промахе кэша, а также за вывод. Image tokens считаются входными токенами; после масштабирования на одно изображение приходится до 384 image tokens.
Умеет ли модель генерировать изображения?
В официальном руководстве Vision описано понимание изображений, а не их генерация. Считайте этот endpoint предназначенным только для анализа, пока DeepSeek отдельно не заявит поддержку генерации.
Почему запрос возвращает ошибку 400?
Проверьте строку модели, роль сообщения, тип блока контента, размер файла и формат изображения. Изображение, отправленное модели без поддержки Vision, или размещённое в неподдерживаемой роли сообщения, может вызвать документированную ошибку This model does not support image.