Wenn Ihre Workload ein Coding-Agent ist, der unter etwa 150K Tokens Kontext bleibt, ist Hy3 das intelligentere Modell und kostet pro Input-Token ungefähr dasselbe. Wenn Ihre Sessions lange laufen, Ihr Repo groß ist oder Sie in der Produktion eine hohe Concurrency benötigen, gewinnt DeepSeek V4 Flash bei drei Zahlen, mit denen Hy3 nicht mithalten kann: einem 1M-Token Context Window, einem dokumentierten Cache-Hit-Preis von $0.0028 und einer Concurrency-Grenze von 2,500 Requests. Das ist die Kurzversion der Entscheidung hy3 vs deepseek v4 flash. Die Grundlage dafür: Die Preise wurden am 14. Juli 2026 anhand der offiziellen DeepSeek-Dokumentation und der Live-Listings von OpenRouter geprüft, ergänzt durch Benchmark-Daten von Drittanbietern und Berichte von Entwicklern auf Hacker News und Reddit, die beide täglich einsetzen.
Zwei Modelle, zwei unterschiedliche Wetten
Tencent veröffentlichte am 6. Juli 2026 das finale Hy3 und aktualisierte damit die seit dem 23. April verfügbare Vorschauversion. Laut dieser Ankündigung handelt es sich um ein Mixture-of-Experts-Modell mit 295B Gesamtparametern und 21B aktiven Parametern, das um das herum aufgebaut ist, was Tencent als hybrides schnelles und langsames Denken bezeichnet: Das Modell entscheidet pro Anfrage, wie viel Reasoning es aufwenden soll. Der Kontext ist auf 256K Tokens begrenzt. Die Gewichte sind unter Apache 2.0 offen, und die API läuft auf Tencent Cloud TokenHub.
DeepSeek V4 Flash wurde im April 2026 als die schnelle Stufe der V4-Familie veröffentlicht. Es ist ebenfalls ein open-weights MoE (insgesamt 284B, 13B aktiv, laut Artificial Analysis), aber unter der MIT-Lizenz und auf ein anderes Ziel optimiert: 1M Tokens Kontext günstig bereitzustellen. Es unterstützt sowohl Thinking- als auch Non-Thinking-Modi (Thinking ist standardmäßig aktiviert) mit einer maximalen Ausgabe von 384K Tokens.
Die Parameterzahlen sehen ähnlich aus. Die Designziele sind es nicht. Hy3 investiert sein Budget in die Reasoning-Qualität pro Token; Flash investiert es in Kontextlänge, Cache-Effizienz und Durchsatz. Die meisten der praktischen Unterschiede unten lassen sich auf diese Aufteilung zurückführen.
| Spezifikation (überprüft 2026-07-14) | Hy3 | DeepSeek V4 Flash |
|---|---|---|
| Parameter | 295B gesamt / 21B aktiv | 284B gesamt / 13B aktiv |
| Kontextfenster | 256K | 1M (384K max. Ausgabe) |
| Reasoning | Hybrides schnelles/langsames Denken | Thinking- und Non-Thinking-Modi |
| Lizenz | Apache 2.0 | MIT |
| Veröffentlicht | 6. Juli 2026 (Vorschau 23. Apr.) | April 2026 |
| Offizielle API | Tencent Cloud TokenHub | api.deepseek.com (OpenAI + Anthropic formats) |
Was die Benchmarks tatsächlich zeigen
Im Artificial Analysis Intelligence Index v4.1 erzielt Hy3 41 gegenüber 37 für DeepSeek V4 Flash im Reasoning-Modus bei hohem Aufwand. Vier Punkte auf diesem Index sind ein echter Abstand, ungefähr die Distanz zwischen Flash und den Modellen eine Stufe darunter, aber es ist kein Klassenunterschied. Beide Modelle liegen im Bereich „sehr leistungsfähig, aber nicht an der Spitze“.
Zwei Vorbehalte, bevor Sie dieser Punktzahl zu viel Gewicht beimessen.
Erstens erzählen agentische Coding-Benchmarks eine deutlich härtere Geschichte über beide Modelle. Ein Kommentator im Hacker News Launch-Thread legte Hy3s DeepSWE-Ergebnis offen: 28 %, gegenüber 52 % für GPT-5.4 bei maximalem Aufwand. Keines der beiden chinesischen Modelle kommt beim agentischen Coding an die Spitze heran; sie konkurrieren miteinander, nicht mit den Bestplatzierten der Rangliste.
Zweitens: Behandeln Sie von den Anbietern veröffentlichte Benchmark-Tabellen beider Unternehmen mit der üblichen Skepsis. Hy3s Startwerte führten im HN-Thread sofort zu „benchmaxxed“-Vorwürfen, und die eigenen Tabellen von DeepSeek decken nur die Evals ab, die das Unternehmen ausgewählt hat. Auf die Zahlen von Drittanbietern oben würde ich mich stützen, und sie sagen: Hy3 ist etwas intelligenter, und der Abstand ist klein genug, dass Preis und Kontext die Entscheidung kippen können.
Preisgestaltung: Der Listenpreis ist eine Ablenkung
Zwei Preislisten, geprüft am 14. Juli 2026, und es lohnt sich, sie getrennt zu betrachten. DeepSeek veröffentlicht auf seiner API-Dokumentation exakte First-Party-Preise pro Token. Tencent veröffentlicht für das finale Hy3 keine entsprechende englische Preisliste — die Pressemitteilung setzt den Hy3-Preview-Eingang auf rund 0,18 $ pro Million Tokens auf TokenHub an — daher verwendet die Hy3-Spalte unten die von OpenRouter angegebenen Tarife, also einen Marktplatzpreis und keinen First-Party-Preis.
| Pro 1M Tokens | Hy3 (OpenRouter-Marktplatz) | DeepSeek V4 Flash (First-Party-API) |
|---|---|---|
| Eingabe | $0.14 | $0.14 (Cache-Miss) |
| Eingabe, zwischengespeichert | $0.035 | $0.0028 (Cache-Hit) |
| Ausgabe | $0.58 | $0.28 |
Eingabepreise sind identisch. Die Entscheidung liegt in den anderen beiden Zeilen.
Der Cache-Hit-Multiplikator
DeepSeeks Cache-Hit-Preis ist 50-mal günstiger als sein Cache-Miss-Preis und 12,5-mal günstiger als Hy3s gecachter Tarif auf OpenRouter. (Beachten Sie, dass die beiden Cache-Tarife nicht streng äquivalent sind — DeepSeeks ist ein First-Party-API-Preis, Hy3s ist das, was auch immer die zugrunde liegenden Anbieter von OpenRouter für Cache-Lesevorgänge berechnen — aber es sind die Tarife, die Sie heute tatsächlich zahlen würden.) Das ist wichtiger als jede andere Zahl auf dieser Seite, wenn Sie Agents ausführen. Eine Agenten-Schleife sendet bei jedem Durchlauf denselben wachsenden Kontext erneut — System-Prompt, Tool-Definitionen, Dateiinhalt, Gesprächsverlauf. In einer Sitzung mit 40 Durchläufen sind die allermeisten Ihrer Input-Tokens Wiederholungen. Bei einer Cache-Hit-Rate von 90 % sinkt der effektive Input-Preis von Flash von 0,14 $ auf etwa 0,017 $ pro eine Million Tokens. Hy3s sinkt auf etwa 0,045 $ — immer noch günstig, aber fast 3-mal mehr, und die Lücke wird größer, je länger Ihre Sitzungen laufen.
Output-Tokens sind der Punkt, an dem Hy3 teuer wird
Beide sind Reasoning-Modelle, was bedeutet, dass beide ihre Thinking-Tokens als Output abrechnen. Hy3s Output-Rate von 0,58 $ ist mehr als doppelt so hoch wie Flashs 0,28 $, sodass jede erweiterte Reasoning-Kette Hy3-Nutzern ungefähr doppelt so viel kostet. Flash hat außerdem ein Sicherheitsventil, das Hy3 fehlt: Wechseln Sie für mechanische Aufgaben (Formatierung, Extraktion, einfache Bearbeitungen) in den Non-Thinking-Modus und zahlen Sie nicht länger für Reasoning, das Sie nicht benötigen. Die deepseek-v4-flash-vs-deepseek-v4-pro-Analyse beschreibt, wie dieser Moduswechsel in der Praxis funktioniert.
Die kostenlose Stufe
Ein echter Hy3-Vorteil: OpenRouter führt eine tencent/hy3:free-Variante ohne Kosten auf, zwar mit Rate-Limit, aber echt. Zum Evaluieren des Modells, bevor man sich festlegt, ist das besser als Flash, das keine kostenlose API-Stufe hat. Hy3 Preview wird außerdem weiterhin mit $0.063/$0.21 gelistet — unter dem Preis der finalen Veröffentlichung — wenn Sie mit dem April-Checkpoint leben können.
Die Kontextfenster-Steuer
Hy3s 256K-Kontext klingt nach reichlich, bis man einen Agenten gegen eine echte Codebasis laufen lässt. Ein Reddit-Nutzer in r/hermesagent, der beide Modelle im selben Harness ausführte, bezeichnete Hy3 als „nahezu identisch, abgesehen von der Kontextgröße, also häufige Komprimierung“. Komprimierung ist mehr als nur ein Ärgernis: Jeder Komprimierungszyklus verbraucht Output-Tokens für die Zusammenfassung, wirft Details weg und macht deinen Prompt-Cache ungültig, was bedeutet, dass du die Cache-Miss-Rate bezahlst, um ihn neu aufzubauen.
Die Lücke wird strukturell, wenn man self-hostet. Das Sparse-Attention-Design der V4-Architektur (DeepSeek nennt den Mechanismus einen lightning indexer) macht seinen KV Cache deutlich leichter als die herkömmliche Attention von Hy3. Das sind Einzelberichte statt Benchmarks, aber die Zahlen in dem HN-Thread sind eindeutig: Ein Kommentator, der beide auf einem Paar DGX Sparks betreibt, berichtete, dass er 3M Tokens KV Cache zusammen mit DeepSeek V4 Flash unterbringen konnte, gegenüber ungefähr 130K Tokens bei Hy3, das auf FP4 quantisiert war. Ein anderer schätzte, dass Flashs voller 1M-Context, sobald llama.cpp den indexer vollständig unterstützt, nur etwa 6GB RAM benötigen sollte. Flash hat außerdem eine Erfolgsbilanz beim Überstehen aggressiver Quantisierung: Mehrere Nutzer im selben Thread berichten, dass es selbst bei 2-bit kohärent bleibt, ein Ergebnis, das für Hy3 bisher noch nicht demonstriert wurde.
Wenn Ihr Anwendungsfall deutlich unter 200K Tokens bleibt, kostet Sie dieser gesamte Abschnitt nichts, und Hy3s vier zusätzliche Intelligenzpunkte sind kostenlos. Falls nicht, summiert sich die Kontextsteuer: mehr Verdichtung, mehr Cache-Invalidierung, mehr Speicher pro Sitzung.
Feldberichte seit dem Start
Das nützlichste Signal, das ich gefunden habe, steht in keiner Benchmark-Tabelle. Es ist der Charakterunterschied, den Entwickler beschreiben, wenn sie beide Modelle in Coding Agents ausführen.
Ein Nutzer im selben Hacker-News-Thread, der nach der Kündigung seines Anthropic-Abonnements zu DeepSeek V4 Flash und Pro als tägliche Arbeitsmodelle gewechselt war und dann Hy3 ausprobierte, beschrieb Flash so: Die Geschwindigkeit ist großartig, aber es „baut oft ein völlig falsches mentales Modell auf und rennt in die falsche Richtung“, sodass regelmäßige Korrekturen und History-Compaction nötig sind. Hy3, so seine Erfahrung, „ist nicht so schnell, aber bislang scheint es deutlich zuverlässiger auf Kurs zu bleiben“ und verschlechtert sich mit wachsendem Kontext weniger stark. Andere im selben Thread lobten Hy3s Weltwissen und die Qualität der Prosa für seine Größe als besser als die von Flash.
Das Reddit-Bild tendiert bei reinem Coding-Output in die andere Richtung. Ein Vergleich derselben Aufgabe in r/LLMDevs reihte „DeepSeek V4 Flash > Hy3 > GLM“ ein, bezeichnete Hy3 aber dennoch als „vielversprechend für praktische Coding-Workflows“. In r/opencode ist die wiederkehrende Meinung, dass Flash für die tägliche Agentenarbeit „mehr als genug“ ist.
Es gibt auch eine operative Erfolgsbilanz, die man berücksichtigen sollte. Die Nachfrage beim Launch von Hy3 überstieg Tencents Serving-Kapazität: Nutzer im HN-Thread berichteten von starkem Rate Limiting, und jemand, der OpenRouters öffentliche Nutzungsrankings verfolgt, bemerkte, dass das Modell innerhalb eines Monats vom ersten auf den 8.–9. Platz fiel und den Rückgang direkt diesen Limits zuschrieb. DeepSeek hingegen dokumentiert für Flash in seiner offiziellen API eine Concurrent-Ceiling von 2.500 Requests – das Fünffache dessen, was für V4 Pro erlaubt ist. Für Produktions-Traffic hat einer dieser Anbieter veröffentlichte Kapazitätsgarantien, der andere eine Geschichte von Überlastung.
Wie man auswählt
- Agenten-Coding, Sitzungen unter ~150K Tokens: Hy3. Höhere Reasoning-Qualität, bleibt besser bei der Sache, und die Input-Kosten entsprechen dem Listenpreis von Flash. (150K statt der vollen 256K, weil der Agentenkontext schnell wächst und man Puffer braucht, bevor die Kompaktierung einsetzt.)
- Lange Sitzungen, große Repos, RAG über große Dokumente: Flash ist meist die bessere Wahl. Das 1M-Fenster plus 50x Cache-Rabatt ist eine andere Kostenklasse, und der Kompaktierungs-Overhead von Hy3 frisst seinen Intelligenzvorteil auf.
- Produktion-APIs mit hohem Volumen: Flash. Dokumentierte 2.500 Concurrent-Requests, stabile Serving-Historie und Non-Thinking-Mode für günstige Massencalls.
- Schreiben, Recherche, Aufgaben mit Weltwissen: Hy3. Community-Berichte und die AA-Knowledge-Evals sprechen in dieser Größenordnung beide dafür.
- Lokales Deployment: Flash für die meiste Hardware. Seine KV-Cache-Effizienz und Quantisierungs-Resilienz sind in der Praxis deutlich besser belegt; Tencents eigene Serving-Empfehlung für Hy3, zitiert im Launch-Thread, sind acht H20-Klasse-GPUs.
- Vor einer Bindung evaluieren: Die kostenlose OpenRouter-Tarifstufe von Hy3 kostet nichts zum Ausprobieren. Führe deine eigenen Aufgaben damit aus, bevor du einer Benchmark-Tabelle glaubst, einschließlich dieser hier.
Wo sie ausgeführt werden sollen
DeepSeek V4 Flash: Die offizielle API bietet sowohl Endpunkte im OpenAI-Format (api.deepseek.com) als auch im Anthropic-Format (api.deepseek.com/anthropic), was bedeutet, dass sie mit einer Änderung der Base-URL in Claude-kompatible Tools integriert werden kann. Beachten Sie die Migrationsfrist auf derselben Pricing-Seite: Die alten Modellnamen deepseek-chat und deepseek-reasoner werden am 24. Juli 2026 eingestellt und entsprechen jeweils dem Non-Thinking- und Thinking-Modus von Flash. OpenRouter bietet es für 0,09 $/0,18 $ an, etwas unter dem offiziellen Preis, allerdings ohne die Cache-Treffer-Preisgestaltung der offiziellen API.
Hy3: Tencent Cloud TokenHub ist der First-Party-Route. OpenRouter führt die finale Veröffentlichung, den günstigeren Preview-Checkpoint und die kostenlose Stufe. SiliconFlow hat Einführungsaktionen angeboten. Self-Hosting funktioniert unter Apache 2.0, wenn Sie die GPUs haben. Der Hy3 API setup guide führt durch das Erhalten eines Schlüssels und das erste Aufrufen.
FAQ
Ist Hy3 kostenlos nutzbar?
Teilweise. OpenRouter führt eine rate-limitierte tencent/hy3:free-Stufe ohne Kosten auf, und Tencents Verbraucherprodukte (Yuanbao, ima) nutzen Hy3 kostenlos. Der Produktions-API-Zugriff über TokenHub oder die kostenpflichtige Stufe von OpenRouter wird tokenbasiert abgerechnet.
Ist Hy3 dasselbe wie Tencent Hunyuan?
Ja — Hy3 ist die dritte Generation von Tencents Hunyuan-Modellreihe, die Tencent jetzt als „Tencent Hy“ vermarktet. Die Vorschau wurde am 23. April 2026 veröffentlicht, und die finale Version am 6. Juli 2026.
Was ist besser zum Programmieren, Hy3 oder DeepSeek V4 Flash?
Die Community-Ergebnisse sind nach Aufgabentyp aufgeteilt. Bei Reddit-Vergleichen derselben Aufgabe wurde Flashs Rohoutput höher eingestuft als der von Hy3, während Nutzer langer Agent-Sitzungen berichten, dass Hy3 verlässlicher auf Kurs bleibt. Kurze, klar abgegrenzte Aufgaben begünstigen Flashs Geschwindigkeit; mehrstündige Agent-Sitzungen, bei denen ein Abweichen teuer wird, sprechen für Hy3, solange Ihr Kontext bequem innerhalb seines 256K-Fensters bleibt.
Kann ich DeepSeek V4 Flash lokal ausführen?
Ja, und zwar praktischer als Hy3. Die Gewichte stehen unter MIT-Lizenz, der KV-Cache der Architektur ist ungewöhnlich leichtgewichtig, und Nutzer berichten von brauchbarer Qualität selbst bei 2-Bit-Quantisierung auf Maschinen mit etwa 96 GB RAM.
Warum ist der Preisvergleich zwischen hy3 und deepseek v4 flash so verwirrend?
Da es mindestens vier Preislisten gibt: Tencent TokenHub, die endgültigen und Vorschau-Angebote von OpenRouter für Hy3 sowie DeepSeeks offizielle API mit ihrer separaten Cache-Treffer-Rate. Vergleichen Sie den effektiven Preis für Ihr eigenes Traffic-Muster: Zwischengespeicherte Eingaben dominieren Agent-Workloads, und genau dort ist DeepSeeks Rate von 0,0028 $ schwer zu schlagen.
Kurz gesagt
Hy3 ist auf Grundlage der verfügbaren Drittanbieter-Nachweise das stärkere Modell; DeepSeek V4 Flash ist der stärkere Dienst. Für produktive API-Workloads ist Flash meine Standardwahl: Seine Cache-Ökonomie, das Kontextfenster und die veröffentlichte Parallelität wirken zusammen auf eine Weise, die ein Vorsprung von vier Punkten im Benchmark nicht ausgleichen kann. Greifen Sie zu Hy3, wenn die Reasoning-Qualität pro Prompt wichtiger ist als die Skalierung — und testen Sie zuerst den kostenlosen Tarif, da es nichts kostet, ihn mit Ihren eigenen Aufgaben zu vergleichen.
