AIREITER

Liquid AI d1 API im Test: Open Models versus Hosted-Preise

Zuletzt aktualisiert: 2026-10-07 19:21:45

Für einen schnellen Einstieg ist die gehostete API mit 0,04 $ pro Million Input-Token kaum zu schlagen. Die neuen Open-Weight-Checkpoints machen jedoch auch lokale Inferenz realistisch – wobei zwischen dem 3B- und dem 600M-Modell ein deutlicher Qualitätsunterschied liegt.

Drei d1-Varianten, drei unterschiedliche Einsatzzwecke

Liquid AI bietet aktuell drei relevante Optionen: den proprietär gehosteten Dienst d1, das Open-Weight-Modell d1-3B und das experimentelle Open-Weight-Modell d1-omni-600M. Liquid AI hat nicht erklärt, dass das gehostete Modell mit einem der herunterladbaren Checkpoints identisch ist. Benchmarks und Latenzwerte sollten deshalb stets dem Modell zugeordnet bleiben, auf dem sie gemessen wurden.

OptionZugang und PreisEingabenVeröffentlichter KontextGeeignet für
Gehostetes d1Liquid API; 0,04 $ pro 1 Mio. Input-Token, keine Gebühren für Output-TokenText und Bilder direkt über Liquid66K laut VercelSchnelle Integration, vernachlässigbare Inferenzkosten, kein Modellbetrieb
d1-3BHerunterladbare Weights; keine tokenbasierte ModellgebührText, JSON und Bilder32.768 TokenBeste lokale Qualität, Vision, Evaluierung für den Produktiveinsatz
d1-omni-600MHerunterladbare experimentelle Weights; keine tokenbasierte ModellgebührText plus Bild oder Text plus Audio16.384 TokenKleiner Footprint, Experimente mit Sprachbefehlen, eingeschränkte Edge-Geräte

Alle drei Modelle beantworten typisierte Fragen, statt Fließtext zu generieren. noul liefert eine Ja-Wahrscheinlichkeit, choice Wahrscheinlichkeiten für benannte Optionen und score eine wahrscheinlichkeitsgewichtete Position auf einer geordneten Skala. Damit eignen sie sich für Routing, Moderation, Prüfung, Guardrails und Scoring – nicht als Ersatz für ein Chat- oder Coding-Modell.

Die Empfehlung ist klar: Für einen Pilotversuch ist das gehostete d1 die beste Wahl. Wenn Daten lokal bleiben müssen oder die Latenz keinen Netzwerksprung enthalten soll, ist d1-3B die passende Option. d1-omni-600M bleibt ein Experiment, sofern nicht Audio oder der geringe Footprint die entscheidende Vorgabe sind.

API-Preis gegen lokale Kosten gerechnet

Die Liquid AI d1 API kostet 0,04 $ pro Million Input-Token. Output-Token werden nicht berechnet, weil der Dienst Entscheidungen und keinen generierten Text zurückgibt. 100 Millionen Input-Token kosten vor möglichen Gateway-Gebühren 4 $, eine Milliarde Input-Token 40 $.

Bei 0,04 $ pro Million Token lohnt sich Self-Hosting allein wegen der Inferenzkosten selten. Lokales Deployment ist vor allem für Datenschutz, Offline-Nutzung, Latenz direkt auf dem Gerät, Anpassungen oder dauerhaft hohe Auslastung sinnvoll.

Für die beiden offenen Checkpoints gibt es keinen offiziellen gehosteten Tokenpreis. Ihre Hugging-Face-Seiten zeigten zum Testzeitpunkt keinen Inference Provider. Der Preis des gehosteten d1 darf daher nicht als Preis für d1-3B oder d1-omni-600M ausgegeben werden.

Auch Bilder werden beim gehosteten Dienst als Input abgerechnet. Liquid AI nennt 1,5 Token pro 32×32-Pixel-Patch; ein Bild mit 1024×1024 Pixeln entspricht damit vor dem Fragetext 1.536 Token. Bei 0,04 $/M kostet allein der Bildanteil rund 0,00006144 $; jede Frage gilt als eigener Prompt und enthält das jeweils zugehörige Bild.

Open Weight heißt weder uneingeschränkt noch kostenlos

Beide Repositories nutzen die Lizenz lfm1.0 von Liquid AI, nicht Apache 2.0 oder MIT. Laut den allgemeinen Preisbedingungen von Liquid AI sind die herunterladbaren Modelle für kommerzielle Nutzung kostenlos, solange der Jahresumsatz des Unternehmens unter 10 Millionen $ liegt. Größere Unternehmen sollten die aktuellen kommerziellen Bedingungen prüfen, statt aus dem Begriff „Open Weight“ eine Nutzungserlaubnis abzuleiten.

Bei der lokalen Budgetplanung gehören Anschaffung von GPU oder Gerät, ungenutzte Kapazität, Monitoring, Updates und Personalzeit dazu. Die Hosted-Rechnung ist variabel und sehr klein, lokale Kosten sind überwiegend fix.

d1-3B liefert Qualität, omni spart Platz

In der offiziellen Ankündigung zu Open d1 nennt Liquid AI im Decision Index v0.2.1 einen Wert von 48,57 für d1-3B und 15,95 für d1-omni-600M. Liquid AI hat beide Modelle mit dem offiziellen Scorer ausgeführt; die Resultate waren jedoch keine offiziellen Leaderboard-Einreichungen.

Balkendiagramm zum Vergleich der Decision-Index-Werte von Liquid AI d1-3B und d1-omni-600M

Das kleinere Modell ist nicht durchgehend schwach. Über sieben öffentliche Text-Benchmarks berichtet Liquid AI Mittelwerte von 82,9 für d1-3B und 78,4 für d1-omni-600M. Omni lag bei Civil Comments (95,8 gegenüber 93,0) und PAWS-X (79,5 gegenüber 76,9) vorn, während 3B die übrigen fünf aufgeführten Aufgaben gewann. Der wesentlich größere Abstand im Decision Index zeigt: Einige starke Klassifikationsbereiche machen den 600M-Checkpoint nicht zu einem allgemeinen Ersatz für 3B.

Spezifikationd1-3Bd1-omni-600M
Detaillierte Parameterzahl3,12B587M
Repository-/Weight-Footprint in voller Präzision6,27 GB Repository; 6,25 GB WeightsF32-Modell, etwa 0,6B Parameter
Kontext32.76816.384, modalitätsübergreifend geteilt
Textbudget bei BildernInnerhalb des ModellkontextsStatus- und Fragetext mit Bildern auf 896 Token begrenzt
AudioNeinEin Mono-Clip mit 16 kHz, bis zu 30 Sekunden
Bild + Audio gleichzeitigNicht anwendbarNicht unterstützt; löst ValueError aus
Offizielle GeschwindigkeitstabelleJaNein; früher Research-Release

Die Model Card von d1-omni-600M erklärt, dass das Modell in Float32 trainiert wurde. Float16 bewahrte die Top-Antwort bei 243 Text-, 214 Bild- und 416 Audio-Zeilen, während bfloat16 die Top-Antwort bei 0,8 % der Textzeilen und 1,7 % der Audiozeilen veränderte. Der Datentyp ist damit eine Variable für die Validierung und nicht bloß ein Optimierungsschalter.

Liquid AI d1-3B-Modellseite mit dem offiziellen Open-Weight-Repository

Lokales Deployment: schnell eingerichtet, aufwendig validiert

Beide Model Cards stellen system_one für einen einzelnen Status und system_one_batch für gebündelte Anfragen bereit. Der kürzeste Weg zu d1-3B führt über Transformers 5.14 oder neuer, PyTorch, TorchVision, Pillow und den vom Repository bereitgestellten Custom Code.

  1. Die dokumentierten Abhängigkeiten installieren:
pip install "transformers>=5.14" torch torchvision pillow
  1. Das Modell mit aktiviertem Remote-Code aus dem Repository laden:
import torch
from transformers import AutoModel

model_id = "LiquidAI/d1-3B"
device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.bfloat16 if device == "cuda" else torch.float32

model = AutoModel.from_pretrained(
    model_id,
    trust_remote_code=True,
    torch_dtype=dtype,
).to(device)
  1. Benannte Entscheidungen statt eines Chat-Prompts übergeben:
questions = {
    "queue": {
        "type": "choice",
        "instructions": "Which team should handle this ticket?",
        "criteria": {
            "billing": "Charges, invoices, and refunds",
            "technical": "Application or website faults",
            "fraud": "Suspected unauthorized use",
        },
    }
}

result = model.system_one(
    "I was charged twice this month; refund one charge.",
    questions,
)
print(result["answers"]["queue"])

trust_remote_code=True bedeutet, dass Python-Code aus dem Repository im Serving-Prozess ausgeführt wird. Für den Produktiveinsatz sollte ein geprüfter Commit fest gepinnt werden, statt einen sich verändernden Branch zu laden. Das d1-3B-Repository verweist außerdem auf Quantisierungen für mit llama.cpp, Ollama und LM Studio kompatible Runtimes. Ein quantisiertes Community-Artefakt ist gegenüber den offiziellen BF16-Weights eine eigenständige Entscheidung zu Supply Chain und Genauigkeit.

Die Model Card von d1-3B nennt für warme Aufrufe 8 ms für eine Frage auf einer RTX 4090, 30 ms auf einem Apple M5 Pro und 50 ms auf einem Jetson Orin Nano. Ein Status mit 3,4K Token benötigte auf denselben Geräten 102 ms, 640 ms beziehungsweise 1.640 ms. Die GPU-Werte sind Mediane aus 20 Durchläufen; das 8-ms-Ergebnis auf der 4090 nutzte kompilierte CUDA Graphs. Bei einer neuen Eingabeform fallen Kompilierungs- oder Kernel-Selection-Overhead an.

Für d1-omni-600M gibt es keine offizielle Geschwindigkeitstabelle. Ein Browser-Port berichtete von ungefähr 180 ms pro Kommentar für vier Entscheidungen:

„I didn't test it against other machines yet, just my MBP M4 Pro.“ — u/FinancialAd1961 auf Reddit

Dieses Einzelgeräte-Ergebnis belegt die Browser-Tauglichkeit, nicht jedoch die Performance über verschiedene Browser, GPUs, Quantisierungen oder Batch-Größen hinweg.

Die API ist einfacher – die Modellidentität bleibt entscheidend

Der direkte Hosted-Zugang verwendet das Modell d1 unter https://api.liquid.ai/decisions/v1/systemone. Vercel nutzt liquid/d1; dort sind ein Kontext von 66K und derselbe Input-Preis von 0,04 $/M angegeben. In seiner Ankündigung vom 5. Oktober schrieb Liquid, dass Vercel und OpenRouter zu diesem Zeitpunkt nur Text unterstützten, während die direkte Liquid API Bilder akzeptierte.

Die offenen Checkpoints nutzen lokale Python-Methoden mit denselben Entscheidungskonzepten. Ähnliche Schnittstellen belegen jedoch keine Verhaltensgleichheit. Ihre Wahrscheinlichkeiten können so weit abweichen, dass ein Fall eine Automatisierungsschwelle überschreitet oder unterschreitet. Für jeden ausgewerteten Pfad sollten deshalb die exakte Modell-ID, Revision, der Datentyp, die Wahrscheinlichkeit und die Schwelle festgehalten werden.

Eine Migration sollte daher vier Schritte umfassen:

  1. Ein gelabeltes Set aus der tatsächlichen Produktionsverteilung erstellen, einschließlich mehrdeutiger und kostspieliger Fehlerfälle.
  2. Dieselben Statuswerte, dasselbe Frageschema und dieselben Kriterien durch jeden Kandidaten laufen lassen.
  3. Schwellenwerte anhand der Kosten von False Positives und False Negatives auswählen, nicht anhand eines globalen Benchmark-Scores.
  4. Den Gewinner im Shadow-Betrieb testen, bevor destruktive, finanzielle, zugriffssteuernde oder sicherheitsrelevante Aktionen erlaubt werden.

Welches Liquid d1 ist die richtige Wahl?

Für die meisten Teams ist die gehostete API die Standardempfehlung. Ihr Tokenpreis ist zu niedrig, um für einen kleinen Pilotversuch ein lokales Serving-Projekt zu rechtfertigen. Außerdem entfallen Treiber-, Quantisierungs-, Warm-up- und Kapazitätsaufwand.

AnforderungWahlGrund
Schnellster Weg in die ProduktionGehostetes d1Managed Endpoint und klar ausgewiesene Input-Preise
Daten dürfen Gerät oder Netzwerk nicht verlassend1-3BStärkster offener Checkpoint und lokale Ausführung
Beste veröffentlichte Entscheidungsqualität eines Open Modelsd1-3B48,57 im Decision Index gegenüber 15,95
Klassifikation von Sprachbefehlend1-omni-600MDie einzige Option hier mit Audio, begrenzt auf 30 Sekunden
Kleinster experimenteller Footprintd1-omni-600M587M Parameter, aber keine offizielle Latenztabelle
Offene Erklärungen oder generierte AktionenKeines davonNach der Entscheidungsstufe ein generatives Modell ergänzen

Wählen Sie d1-3B statt omni, sofern nicht der 600M-Footprint oder der Audio-Pfad unverzichtbar ist. Eine fünfmal geringere Parameterzahl ist attraktiv, hebt aber weder den Abstand von 32,62 Punkten im Decision Index noch den experimentellen Status von omni auf.

FAQ zu Liquid AI d1

Ist Liquid AI d1 kostenlos?

Der gehostete Dienst d1 kostet 0,04 $ pro Million Input-Token; Output-Token werden nicht berechnet. Die offenen Checkpoints lassen sich ohne tokenbasierte Gebühr herunterladen, allerdings gelten weiterhin die kommerziellen Bedingungen von LFM 1.0 und die Kosten für lokale Rechenleistung.

Sind d1-3B und d1-omni-600M das Modell der gehosteten d1 API?

Liquid AI hat keinen der beiden Checkpoints als identisch mit dem gehosteten d1 dokumentiert. Sie sollten als verwandte Produkte mit separaten Modell-IDs, Kontextfenstern, Benchmarks und Deployment-Pfaden behandelt werden.

Kann ich Liquid d1 mit Ollama ausführen?

Die d1-3B-Modellseite verlinkt Quantisierungen für llama.cpp, Ollama, LM Studio und kompatible Anwendungen. Prüfen Sie Quantizer, Quellrevision, Unterstützung der Decision API und Genauigkeit, bevor Sie den offiziellen Transformers-Pfad ersetzen.

Unterstützt d1-3B Audio?

Nein. d1-3B akzeptiert Text, JSON und Bilder. d1-omni-600M akzeptiert Text plus Bilder oder Text plus einen Audio-Clip mit bis zu 30 Sekunden, kann jedoch Bilder und Audio nicht in derselben Anfrage verarbeiten.

Wie viel VRAM benötigt lokales d1?

Liquid veröffentlicht für d1-3B eine BF16-Weight-Datei mit 6,25 GB, nennt aber keinen universellen VRAM-Bedarf. Runtime-Overhead, Zustand des Bild-Encoders, Kontextlänge, Batch-Größe, Präzision und Quantisierung verändern den Gesamtbedarf; die vorgesehene Konfiguration sollte gemessen werden, statt die Dateigröße mit dem Spitzenwert des VRAM gleichzusetzen.

Unabhängig vom gewählten Weg sollten Wahrscheinlichkeitsschwellen mit gelabelten Produktionsdaten validiert werden, bevor folgenreiche Entscheidungen automatisiert werden.

Weiterführend: Der Test der gehosteten Liquid AI d1 API behandelt den direkten Endpoint, die Bildabrechnung und den typisierten Request-Vertrag ausführlicher.