AIREITER

Руководство по DeepSeek V4 Flash Vision Exp API: лимиты и примеры

Последнее обновление: 2026-08-21 11:50:58

deepseek-v4-flash-vision-exp добавляет поддержку изображений в линейку V4 Flash. Но слово experimental здесь не для красоты: приведённые данные о запуске не подтверждают надёжность модели для продакшена. Поэтому сначала проведите пилот с логированием и резервной моделью и только потом решайте, можно ли делать её основным решением.

Руководство по DeepSeek Vision API с официальной документацией по обработке изображений

Как выбрать способ работы с API за 30 секунд

DeepSeek V4 Flash Vision Exp подойдёт, если существующий сценарий на V4 Flash должен анализировать скриншоты, графики, документы или другие изображения через совместимый с OpenAI API интерфейс. Для задач, связанных с идентификацией личности, безопасностью и другими решениями с высокой ценой ошибки, заранее оставьте резервный вариант и отдельно проверьте качество именно на своей задаче.

СитуацияОптимальный способ передачиПочему
Небольшое локальное изображение для однократного запросаBase64 data URLНе нужен публичный хостинг
Изображение уже размещено в открытом доступеВнешний URLНебольшой размер запроса
Большой файл или повторное использованиеFiles API через file_idФайл можно переиспользовать; для каждого переданного изображения допускается до 64 MiB
Нужно снизить детализацию для общей задачиdetail: "low"Перед инференсом изображение уменьшается до 512 x 512

Точная строка модели — deepseek-v4-flash-vision-exp. В официальном журнале изменений DeepSeek называет её экспериментальной и указывает доступность на API-платформе с 21 августа 2026 года. В примечании к релизу заявлен паритет с V4 Flash по возможностям работы только с текстом и заметный рост результатов на агентских бенчмарках, где требуется визуальное понимание.

Как отправить одно изображение через Chat Completions

В совместимом с OpenAI запросе Chat Completions текст и изображение передаются в массиве content внутри сообщения user. Официальное руководство Vision описывает поведение этой модели; если отправить изображение обычной deepseek-v4-flash, API вернёт ошибку 400.

import base64
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

with open("chart.png", "rb") as image_file:
    encoded = base64.b64encode(image_file.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Extract the three trends from this chart."},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:image/png;base64,{encoded}",
                        "detail": "original",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

В Chat Completions изображения поддерживаются в сообщениях пользователя. Кладите картинку и инструкцию в один массив content — так модель получает визуальный контекст и задачу одновременно.

Какой способ передачи изображения выбрать

Base64 — для небольшого локального файла

Для локального изображения, которое нужно отправить один раз, проще всего использовать Base64. Публичный хостинг не понадобится, но закодированные данные учитываются в лимите тела запроса 48 MiB, а размер исходного изображения не должен превышать 32 MiB.

Этот вариант удобен для разовых загрузок от пользователя или воркера, но не для изображений, которые повторно используются в пакетной обработке.

Публичный URL — для уже размещённых файлов

Публичные URL по http или https уменьшают размер запроса. При этом ссылка должна быть доступна извне, не длиннее 8 192 символов, файл должен скачиваться за 60 секунд, а его размер — не превышать 32 MiB. Приватные, просроченные и внутренние URL могут не сработать ещё до того, как DeepSeek попытается получить изображение.

Files API — для повторного использования и больших файлов

Загрузите изображение через Files API, а затем передайте в запросе Vision полученный идентификатор:

{
  "type": "file",
  "file_id": "file-api-xxxxxxxxxxxxxxxx"
}

Размер файла, передаваемого через ссылку на него, может достигать 64 MiB на изображение. При этом одни и те же байты не придётся загружать заново для каждого запроса. Обратная сторона — отдельный этап загрузки и управление жизненным циклом файла. Храните полученный ID вместе с ключом, который его создал, и не воспринимайте его как публичную ссылку для общего доступа.

Files API — практичный выбор, если файл больше 32 MiB, запрос может превысить 48 MiB или несколько шагов агента должны изучить одно и то же изображение.

Настройте детализацию до того, как начнёте за неё платить

Поле detail доступно для входных данных image_url и частей изображений в Responses API. Описанное ниже поведение соответствует официальному руководству Vision от DeepSeek.

ЗначениеЗаявленное поведениеКогда использовать
lowУменьшает изображение до 512 x 512Достаточно понять компоновку, общую сцену или выполнить грубую классификацию
highСохраняет исходное изображениеВажны мелкий текст или тонкие детали
originalСохраняет исходное изображениеНужно явно указать обработку в полном качестве
autoСейчас эквивалентно originalВас устраивает текущее поведение по умолчанию

Перед инференсом DeepSeek масштабирует изображения. В руководстве Vision указано, что на одно изображение приходится не более 384 image tokens, причём изображения считаются независимо друг от друга. Поэтому очень большой исходный файл не обязательно потребует пропорционально больше image tokens после масштабирования, хотя крупные файлы всё равно могут упереться в ограничения на размер загрузки и запроса.

На официальной странице Models & Pricing для deepseek-v4-flash-vision-exp указаны те же тарифы за токены, что и для V4 Flash: $0.007 за 1M токенов кэшированного ввода и $0.22 за 1M токенов ввода при промахе кэша в непиковые часы; в пиковые часы — $0.014 и $0.44 соответственно. Вывод стоит $0.66 в непиковое время и $1.32 в пиковое. Image tokens тарифицируются как входные токены, поэтому количество изображений и выбранная детализация должны учитываться в оценке стоимости.

Лимиты, из-за которых API действительно падает

ОграничениеЛимит или поведение
Поддерживаемые форматыJPEG, PNG, GIF, WebP
Максимальный размер тела запроса48 MiB
Максимальный размер изображения через Base64 или URL32 MiB
Максимальный размер изображения через file_id Files API64 MiB
Максимальное число изображений в запросе600
Общий размер изображений без file_id64 MiB
Общий размер изображений, включая file_id200 MiB
Максимальный размер стороны8 192 пикселя
Ограничение на размер стороны при 15 и более изображениях4 096 пикселей
Длина внешнего URL8 192 символа
Загрузка изображения по внешней ссылкеДолжна завершиться за 60 секунд

Особенно легко упустить два ограничения. Изображения принимает только deepseek-v4-flash-vision-exp, а блоки изображений в сообщениях system или assistant не поддерживаются в Chat Completions. Если отправить изображение модели без Vision, DeepSeek указывает для ошибки 400 сообщение This model does not support image.

Одна модель, три интерфейса API

DeepSeek описывает работу с моделью через три интерфейса в своём руководстве Vision:

ИнтерфейсБлок изображенияГде получить результат
Chat Completionsimage_url в пользовательском массиве contentresponse.choices[0].message.content
Responses APIinput_image вместе с input_textresponse.output_text
Anthropic-compatible APIimage по адресу https://api.deepseek.com/anthropicСодержимое сообщения Anthropic

Все три интерфейса поддерживают Base64, публичные URL и ссылки на файлы из Files API, но типы блоков у них разные. Не переносите блок Chat Completions в Responses API без изменений.

Что показывают данные о запуске — и чего они не доказывают

В журнале изменений от 21 августа DeepSeek приводит сильные результаты собственных бенчмарков: в частности, 83.9 на Terminal Bench 2.1 и 64.3 на Chartography при p0.95. Это результаты, заявленные поставщиком, а не независимая проверка. Кроме того, в примечании к релизу говорится, что текстовая V4 Flash игнорирует мультимодальные элементы в двух визуальных оценках.

Результаты стартовых бенчмарков предоставлены самой DeepSeek, поэтому перед переводом трафика в продакшен проверьте визуальные сценарии, критичные именно для вашего приложения.

Подходит ли модель для продакшена?

DeepSeek V4 Flash Vision Exp можно использовать в контролируемом пилоте для анализа скриншотов, извлечения данных из графиков, первичной обработки документов или работы агента, которому нужно видеть состояние интерфейса. Те же цены, что у Flash, и три способа передачи изображений делают оценку недорогой, а ограничение в 384 токена на изображение даёт понятную отправную точку для расчёта расходов.

Не делайте эту модель единственным бэкендом для проверки личности, решений по безопасности, медицинской интерпретации и других визуальных задач с серьёзными последствиями, пока она остаётся экспериментальной, а приведённые данные о запуске не подтверждают надёжность в таких сценариях. Подключите резервную модель за тем же интерфейсом и записывайте источник изображения, значение detail, расход входных и выходных токенов, задержку, повторы и успешность выполнения задачи.

До перевода трафика в продакшен проверьте как минимум:

  1. Мелкий текст на скриншотах при детализации low и original.
  2. Графики с подписями, легендами и плотной разметкой осей.
  3. Несколько изображений в одном запросе.
  4. Приватные и медленные URL изображений.
  5. Вызов инструментов после визуального анализа.
  6. Некорректные или неоднозначные запросы на идентификацию.
  7. Поведение резервного сценария после ошибки 400, тайм-аута или некорректного ответа с изображением.

FAQ по DeepSeek V4 Flash Vision Exp API

Как называется модель?

Используйте deepseek-v4-flash-vision-exp. В журнале изменений DeepSeek от 21 августа 2026 года она названа экспериментальной мультимодальной моделью, доступной на API-платформе.

Тарифицируется ли она так же, как V4 Flash?

Да. На странице с тарифами DeepSeek для Vision Exp и V4 Flash указаны одинаковые ставки за токены при попадании и промахе кэша, а также за вывод. Image tokens считаются входными токенами; после масштабирования на одно изображение приходится до 384 image tokens.

Умеет ли модель генерировать изображения?

В официальном руководстве Vision описано понимание изображений, а не их генерация. Считайте этот endpoint предназначенным только для анализа, пока DeepSeek отдельно не заявит поддержку генерации.

Почему запрос возвращает ошибку 400?

Проверьте строку модели, роль сообщения, тип блока контента, размер файла и формат изображения. Изображение, отправленное модели без поддержки Vision, или размещённое в неподдерживаемой роли сообщения, может вызвать документированную ошибку This model does not support image.