AIREITER

Обзор Liquid AI d1 API: открытые модели и цены хостинга

Последнее обновление: 2026-10-07 19:29:04

Если нужен быстрый старт, хостинговый API d1 остаётся самым беспроблемным вариантом: $0,04 за миллион входных токенов. Однако новые чекпойнты с открытыми весами делают локальный инференс вполне реалистичным — с важной оговоркой: по качеству между моделями на 3B и 600M параметров лежит заметная пропасть.

Три версии Liquid d1 — это разные продукты

Сейчас у Liquid AI есть три релевантных варианта: проприетарный хостинговый сервис d1, модель с открытыми весами d1-3B и экспериментальная open-weight-модель d1-omni-600M. Liquid AI не заявляла, что хостинговая модель идентична какому-либо из доступных для скачивания чекпойнтов. Поэтому результаты бенчмарков и данные о задержках нельзя переносить с одной модели на другую.

ВариантДоступ и ценаВходные данныеЗаявленный контекстДля чего подходит
Хостинговый d1Liquid API; $0,04 за 1 млн входных токенов, выходные токены не тарифицируютсяТекст и изображения напрямую через Liquid66K, согласно данным VercelБыстрая интеграция, почти нулевые расходы на инференс, без эксплуатации модели
d1-3BВесовые файлы доступны для скачивания; поминутной платы за токены нетТекст, JSON и изображения32 768 токеновЛучшее локальное качество, компьютерное зрение, оценка для production
d1-omni-600MЭкспериментальные веса доступны для скачивания; поминутной платы за токены нетТекст с изображением либо текст с аудио16 384 токенаКомпактное развёртывание, эксперименты с голосовыми командами, ограниченные edge-устройства

Все три модели отвечают на типизированные вопросы, а не генерируют текст. noul возвращает вероятность ответа «да», choice — вероятности для именованных вариантов, а score — позицию на упорядоченной шкале с учётом вероятностей. Это модели для маршрутизации, модерации, проверки, защитных ограничений и скоринга; чат- или coding-модель они не заменят.

Рекомендация проста: для пилота используйте хостинговый d1; выбирайте d1-3B, если данные должны оставаться локально или задержка не должна включать сетевой переход; а d1-omni-600M стоит считать экспериментальным вариантом, если только аудио или минимальный размер модели не являются решающими требованиями.

Что дешевле: API или локальный запуск

Liquid AI берёт за d1 API $0,04 за миллион входных токенов. Платы за выходные токены нет, поскольку сервис возвращает решения, а не сгенерированный текст. Обработка 100 миллионов входных токенов обойдётся в $4 до учёта возможных комиссий шлюза; миллиард токенов — в $40.

При цене $0,04 за миллион токенов самостоятельный хостинг редко выигрывает только по стоимости инференса. Локальный запуск имеет смысл ради приватности, офлайн-работы, задержки на устройстве, кастомизации или стабильно высокой загрузки.

У двух открытых чекпойнтов нет официальной цены хостинга за токены. На момент обзора их страницы Hugging Face не предлагали inference-провайдера, поэтому цену хостингового d1 нельзя выдавать за цену d1-3B или d1-omni-600M.

Изображения в хостинговом сервисе тоже считаются входными данными. Liquid AI указывает 1,5 токена на патч размером 32×32 пикселя: изображение 1024×1024 займёт 1 536 токенов ещё до текста вопроса. При ставке $0,04 за миллион токенов доля изображения стоит около $0,00006144; каждый вопрос тарифицируется как отдельный промпт и включает связанное с ним изображение.

Открытые веса не означают полной свободы и нулевой стоимости

Оба репозитория распространяются по лицензии Liquid AI lfm1.0, а не Apache 2.0 или MIT. В общих условиях ценообразования Liquid AI сказано, что её скачиваемые модели можно бесплатно использовать коммерчески, пока годовая выручка компании не превышает $10 миллионов. Крупным организациям стоит проверить актуальные коммерческие условия, а не делать выводы о разрешённом использовании только по формулировке «open-weight».

В бюджет локального запуска нужно заложить покупку GPU или устройства, простаивающие мощности, мониторинг, обновления и рабочее время команды. Счёт за хостинговый сервис переменный и очень небольшой; локальные расходы в основном фиксированы.

d1-3B выбирают за качество, omni — за компактность

В официальном анонсе Open d1 приведены результаты Decision Index v0.2.1: 48,57 у d1-3B и 15,95 у d1-omni-600M. Liquid AI прогнала обе модели через официальный оценщик, однако эти результаты не были официальными заявками в таблицу лидеров.

Столбчатая диаграмма со сравнением оценок Decision Index для Liquid AI d1-3B и d1-omni-600M

При этом меньшая модель не проваливается во всём. На семи публичных текстовых бенчмарках Liquid AI сообщает средние результаты 82,9 для d1-3B и 78,4 для d1-omni-600M. Omni оказалась впереди на Civil Comments — 95,8 против 93,0 — и PAWS-X — 79,5 против 76,9; на остальных пяти задачах из списка лидировала 3B. Но гораздо более широкий разрыв в Decision Index показывает: нескольких сильных классификационных сценариев недостаточно, чтобы считать чекпойнт 600M универсальной заменой 3B.

Характеристикаd1-3Bd1-omni-600M
Точное число параметров3,12B587M
Размер репозитория/весов в полной точностиРепозиторий 6,27 ГБ; веса 6,25 ГБМодель F32, около 0,6B параметров
Контекст32 76816 384, общий для всех модальностей
Лимит текста при работе с изображениемВ пределах контекста моделиТекст состояния и вопроса сокращается до 896 токенов при наличии изображений
АудиоНетОдин монофонический клип 16 кГц длительностью до 30 секунд
Изображение и аудио одновременноНеприменимоНе поддерживается; вызывает ValueError
Официальная таблица скоростиЕстьНет; ранний исследовательский релиз

В карточке модели d1-omni-600M указано, что она обучалась в float32. Float16 сохранил лучший ответ в 243 текстовых, 214 визуальных и 416 аудиостроках, тогда как при bfloat16 лучший ответ менялся в 0,8% текстовых строк и в 1,7% аудиострок. Иными словами, dtype здесь нужно валидировать: это не просто переключатель оптимизации.

Страница модели Liquid AI d1-3B с официальным репозиторием открытых весов

Локально модель запускается быстро, но валидация займёт время

В обеих карточках моделей доступны методы system_one для одного состояния и system_one_batch для упакованных запросов. Самый короткий путь к запуску d1-3B требует Transformers 5.14 или новее, PyTorch, TorchVision, Pillow и пользовательский код из репозитория.

  1. Установите указанные зависимости:
pip install "transformers>=5.14" torch torchvision pillow
  1. Загрузите модель, разрешив выполнение кода из удалённого репозитория:
import torch
from transformers import AutoModel

model_id = "LiquidAI/d1-3B"
device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.bfloat16 if device == "cuda" else torch.float32

model = AutoModel.from_pretrained(
    model_id,
    trust_remote_code=True,
    torch_dtype=dtype,
).to(device)
  1. Передавайте именованные решения, а не чат-промпт:
questions = {
    "queue": {
        "type": "choice",
        "instructions": "Which team should handle this ticket?",
        "criteria": {
            "billing": "Charges, invoices, and refunds",
            "technical": "Application or website faults",
            "fraud": "Suspected unauthorized use",
        },
    }
}

result = model.system_one(
    "I was charged twice this month; refund one charge.",
    questions,
)
print(result["answers"]["queue"])

Параметр trust_remote_code=True означает, что Python-код из репозитория выполняется в процессе сервинга. Перед production лучше закрепить проверенный коммит, а не загружать постоянно меняющуюся ветку. Репозиторий d1-3B также ссылается на квантизованные версии для совместимых рантаймов llama.cpp, Ollama и LM Studio; сторонний квантизованный артефакт — это отдельный вопрос цепочки поставки и точности по сравнению с официальными весами BF16.

В карточке d1-3B указано время прогретого вызова с одним вопросом: 8 мс на RTX 4090, 30 мс на Apple M5 Pro и 50 мс на Jetson Orin Nano. Обработка состояния на 3,4K токена заняла 102 мс, 640 мс и 1 640 мс на тех же устройствах. Значения для GPU — медианы 20 запусков; результат в 8 мс на 4090 получен с compiled CUDA graphs, а новая форма входа потребует накладных расходов на компиляцию или выбор ядра.

Для d1-omni-600M официальной таблицы скорости нет. В браузерном порте сообщалось примерно о 180 мс на комментарий при обработке четырёх решений:

«Я пока не тестировал её на других машинах, только на своём MBP M4 Pro». — u/FinancialAd1961 на Reddit

Этот результат на одном устройстве подтверждает работоспособность в браузере, но ничего не говорит о производительности в других браузерах, на других GPU, с иными квантизациями или размерами батча.

С API проще, но идентичность модели всё равно важна

Для прямого доступа к хостинговой модели используется идентификатор d1 и endpoint https://api.liquid.ai/decisions/v1/systemone. В Vercel модель называется liquid/d1; на её странице указаны контекст 66K и та же ставка $0,04 за миллион входных токенов. В октябрьском анонсе Liquid от 5 числа говорилось, что Vercel и OpenRouter на тот момент поддерживали только текст, тогда как прямой Liquid API принимал изображения.

Открытые чекпойнты используют локальные Python-методы с теми же концепциями решений, но схожесть интерфейсов не доказывает эквивалентность поведения. Их вероятности могут различаться достаточно сильно, чтобы конкретный случай пересёк порог автоматизации. Для каждой оценённой ветки фиксируйте точный ID модели, ревизию, dtype, вероятность и порог.

Поэтому миграцию стоит проводить в четыре этапа:

  1. Соберите размеченный набор из реального production-распределения, включая неоднозначные случаи и дорогостоящие ошибки.
  2. Пропустите через каждого кандидата одинаковые состояния, схему вопросов и критерии.
  3. Подбирайте пороги по стоимости ложноположительных и ложноотрицательных срабатываний, а не по общему баллу бенчмарка.
  4. Протестируйте победителя в теневом режиме, прежде чем разрешать разрушительные, финансовые, связанные с контролем доступа или безопасностью действия.

Какой Liquid d1 выбрать

Для большинства команд хостинговый API — рекомендация по умолчанию. Цена токенов слишком мала, чтобы небольшой пилот оправдывал отдельный проект по локальному сервингу, а вместе с API исчезают заботы о драйверах, квантизации, прогреве и планировании мощностей.

ТребованиеВыборПричина
Самый быстрый выход в productionХостинговый d1Управляемый endpoint и прозрачная тарификация входных данных
Данные не должны покидать устройство или сетьd1-3BСамый сильный открытый чекпойнт и локальное выполнение
Лучшее опубликованное качество решений среди открытых моделейd1-3B48,57 по Decision Index против 15,95
Классификация голосовых командd1-omni-600MЕдинственный вариант здесь с аудио, ограниченным 30 секундами
Самый компактный экспериментальный вариантd1-omni-600M587M параметров, но без официальной таблицы задержек
Открытые объяснения или генерация действийНи один из вариантовПосле этапа принятия решения добавьте генеративную модель

Выбирайте d1-3B вместо omni, если только размер модели 600M или аудиотракт не являются критически необходимыми. Пятикратное сокращение числа параметров выглядит привлекательно, но оно не отменяет разрыв в 32,62 пункта по Decision Index и экспериментальный статус omni.

FAQ по Liquid AI d1

Liquid AI d1 бесплатна?

Хостинговый сервис d1 стоит $0,04 за миллион входных токенов; плата за выходные токены не взимается. Открытые чекпойнты можно скачать без поминутной платы за токены, но на них по-прежнему распространяются коммерческие условия LFM 1.0 и расходы на локальные вычисления.

d1-3B и d1-omni-600M — это та же модель, что и в хостинговом d1 API?

Liquid AI не документировала идентичность ни одного из чекпойнтов хостинговому d1. Считайте их связанными, но отдельными продуктами: у них разные ID моделей, контексты, бенчмарки и способы развёртывания.

Можно ли запускать Liquid d1 через Ollama?

На странице d1-3B есть ссылки на квантизованные версии, рассчитанные на llama.cpp, Ollama, LM Studio и совместимые приложения. Прежде чем заменять официальный путь через Transformers, проверьте квантизатор, ревизию источника, поддержку decision API и точность.

Поддерживает ли d1-3B аудио?

Нет. d1-3B принимает текст, JSON и изображения. d1-omni-600M принимает текст с изображениями либо текст с одним аудиоклипом длительностью до 30 секунд, но не может принимать изображения и аудио в одном запросе.

Сколько VRAM нужно для локального d1?

Liquid публикует файл весов BF16 размером 6,25 ГБ для d1-3B, но не приводит единого требования к VRAM. На итоговый объём влияют накладные расходы рантайма, состояние image encoder, длина контекста, размер батча, точность и квантизация; измеряйте нужную конфигурацию, а не приравнивайте размер файла к пиковому потреблению VRAM.

Какой бы вариант вы ни выбрали, проверьте пороги вероятностей на размеченных production-данных до автоматизации решений с серьёзными последствиями.

Читайте также: обзор хостингового Liquid AI d1 API подробнее разбирает прямой endpoint, тарификацию изображений и типизированный контракт запросов.