Hy3 API-Leitfaden: Reasoning, Tool-Calls und langer Kontext

Zuletzt aktualisiert: 2026-07-14 06:45:03

Hy3 ist ein reines Text-MoE-Modell für Coding, Reasoning, Long-Context-Arbeit und Agents. Für eine erste Integration verwenden Sie einen gehosteten OpenAI-kompatiblen Endpunkt, senden eine normale Chat-Completions-Anfrage und bewerten den einen Workflow, den Sie tatsächlich automatisieren würden. Standardisieren Sie nicht darauf, bis es Ihrem Tool-Schema folgt und die Einschränkungen beibehält, die in Ihren langen Eingaben wichtig sind.

Anbieterdetails unten wurden am 14. Juli 2026 überprüft. DeepInfra dokumentiert das Modell an seinem OpenAI-kompatiblen Chat-Completions-Endpunkt als tencent/Hy3. SiliconFlow führt Hy3 ebenfalls auf unter derselben Modell-ID. Anbieterpreise, Limits und Aliase können sich ändern, daher sollten Sie die aktuelle Anbieterseite überprüfen, bevor Sie live gehen.

Beginnen Sie mit einem gehosteten Hy3-API-Aufruf

DeepInfra veröffentlicht diese minimale Anfrage für seinen gehosteten Hy3-Endpunkt. Ersetzen Sie das Token durch Ihr eigenes Provider-Token; fügen Sie es nicht in Browser-Code oder eine Client-App ein.

curl "https://api.deepinfra.com/v1/openai/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPINFRA_TOKEN" \
  -d '{
    "model": "tencent/Hy3",
    "messages": [
      {"role": "user", "content": "Gib drei API-Abnahmekontrollen zurück."}
    ]
  }'

Die Antwort verwendet das standardmäßige Chat-Completions-Format. Analysieren Sie die Antwort- und Abrechnungsfelder wie folgt:

{
  "id": "chatcmpl-...",
  "object": "chat.completion",
  "model": "tencent/Hy3",
  "choices": [{
    "message": {"role": "assistant", "content": "..."},
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 0,
    "completion_tokens": 0,
    "total_tokens": 0
  }
}

Lesen Sie choices[0].message.content für die Antwort und usage für die Token-Abrechnung. Fügen Sie "stream": true erst hinzu, nachdem eine nicht-streaming Anfrage funktioniert; DeepInfra dokumentiert Streaming als serverseitig gesendete Ereignisse, die mit [DONE] enden.

Die Anbieteroptionen in der Tabelle sind bewusst eng gefasst. Es handelt sich um verifizierte öffentliche Zugangswege, nicht um eine Preisrangliste.

Anbieter

Verifizierter Zugriffspunkt

Vor der Produktion zu bestätigen

DeepInfra

https://api.deepinfra.com/v1/openai/chat/completions; Modell tencent/Hy3; Standard- und Streaming-Beispiele sind dokumentiert

Aktueller Preis, Kontolimits, Tool-Support und Datenbedingungen

SiliconFlow

OpenAI-kompatible API; Modell tencent/Hy3

Aktueller Endpunkt, Preis, Ratenlimits und der API-Key-Bereich

OpenRouter

Am 14. Juli listete die Seite tencent/hy3:free und kennzeichnete die kostenlose Variante als bis zum 21. Juli endend

Ob der Alias noch verfügbar ist, seine Limits und der weitergeleitete Anbieter

Tencents Veröffentlichungsankündigung vom 6. Juli 2026 stellte Hy3 als ein Open-Weight-Mixture-of-Experts-Modell vor. Die offizielle Preisankündigung und die Model Card machen es zu einem Kandidaten für eine gehostete Bewertung, aber eine API-Seite ist kein Beleg dafür, dass es für eine Produktions-Workload geeignet ist.

Was Hy3 ist und was es nicht ist

Hy3 ist ein MoE-Modell mit 295B Parametern und 21B aktiven Parametern pro Token. Die offizielle Hy3 model card listet 192 Experten mit Top-8-Routing, ein 80-Schichten-Backbone, eine MTP-Schicht, ein Kontextfenster mit 256K Token und eine Apache-2.0-Lizenz auf.

Diese Zahlen beschreiben ein Textmodell, das für Schlussfolgerungen, Programmierung, lang andauernde Gespräche und Tool-using Agents entwickelt wurde. Sie machen Hy3 nicht zu einem Bild- oder OCR-Modell. Ein Workflow, dessen zentrale Eingabe eine gescannte Rechnung, ein Screenshot, ein Produktfoto oder ein Diagramm ist, benötigt zuerst ein Vision- oder OCR-Modell, bevor er Hy3 benötigt. Diese Grenze klar zu halten, verhindert einen häufigen Architekturfehler: ein leistungsfähiges Textmodell zu bitten, Informationen wiederherzustellen, die es nie erhalten hat.

Tencent positioniert Hy3 für Programmierung, Büroarbeit, Finanzmodellierung, Frontend-Arbeit und Spieleentwicklung. Betrachten Sie diese als mögliche Workloads, nicht als universelles Ranking.

Lies die Benchmark-Aussagen mit ihren Einschränkungen

Tencents Ankündigung zur Veröffentlichung berichtet von einer Blindbewertung mit 270 Experten, die Arbeitstätigkeiten ausführten, bei der Hy3 2,67 von 4 und GLM-5.1 2,51 von 4 erzielte. Dieselbe Quelle sagt, dass die SWE-Bench Verified-Genauigkeit von Hy3 über CodeBuddy-, Cline- und KiloCode-Scaffolds hinweg um weniger als vier Prozentpunkte variierte. Dies sind von Tencent berichtete Ergebnisse und keine unabhängige Garantie dafür, dass Hy3 in Ihrer Umgebung einen namentlich genannten Konkurrenten übertrifft.

Artificial Analysis ist ein weiterer Referenzpunkt für Messungen auf Modellebene. Lesen Sie Benchmark-Zahlen als Eingaben für die Modellauswahl, nicht als Ersatz für anwendungsspezifische Abnahmekriterien.

Wählen Sie den Denkmodus nach den Kosten eines Fehlers

Hy3 bietet in seinen offiziellen Serving-Beispielen no_think, low und high Reasoning-Aufwand an. Die Wahl sollte sich nach den Kosten einer falschen Antwort richten, nicht nach dem Prestige, ein Reasoning-Modell zu verwenden.

Arbeitslast

Beginnen mit

Was vor dem Eskalieren zu messen ist

Klassifizierung, Extraktion aus sauberem Text oder einfaches Routing

no_think

Richtiges Label oder Feldwerte, Latenz und Ausgabe-Tokens

Begrenzte Code-Änderungen, Zusammenfassungen mit mehreren Regeln oder eine Tool-Sequenz

low

Test-Bestandenquote, gültige Tool-Argumente und menschliche Bearbeitungen

Debugging über mehrere Dateien, Planung mit widersprüchlichen Einschränkungen oder numerisches Schlussfolgern

high

Abgeschlossene Aufgabenerate, Wiederholungen, Gesamtzahl der Tokens und Überprüfungszeit

Behalte „no-think“ für begrenzte Arbeit bei

no_think ist der standardmäßige Modus für direkte Antworten. Er ist die richtige Basis, wenn die Quelle bereits strukturiert ist, die Antwort eine bekannte Form hat und eine langsamere Antwort kein nützliches Denken hinzufügen würde. Ein Support-Workflow, der einen dokumentierten Status auswählt und eine Funktion aufruft, sollte zum Beispiel zuerst in diesem Modus getestet werden. Fügen Sie ein striktes JSON-Schema hinzu und lehnen Sie Antworten mit zusätzlichen Feldern ab, statt zu hoffen, dass eine längere Kette von Schlussfolgerungen einen unpräzisen Vertrag repariert.

Verwenden Sie niedriges oder hohes Reasoning, wenn ein Fehler die nächste Aktion verändert

Wechseln Sie zu low, wenn das Modell mehrere Regeln miteinander in Einklang bringen oder eine begrenzte Änderung am Code vornehmen muss. Reservieren Sie high für Arbeiten, bei denen eine schwache Zwischenentscheidung zu einem kostspieligen Wiederholungsversuch führt: das Diagnostizieren eines Fehlers über mehrere Dateien hinweg, die Wahl einer Reihenfolge von Operationen oder die Überprüfung von Berechnungen vor einem Tool-Aufruf.

Der Kompromiss ist messbar. Vergleichen Sie die gesamte abgeschlossene Aufgabe: Anfragelatenz, Anzahl der Ausgabetokens, Wiederholungen von Tool-Aufrufen, Testfehler und die Minuten, die ein Prüfer damit verbringt, die Antwort zu korrigieren. Ein Modus, der durchdachter wirkt, aber die Tokenzahl verdoppelt, ohne die Prüfungszeit zu verkürzen, ist nicht die bessere Produktionseinstellung.

Führen Sie einen vierteiligen API-Test durch, bevor Sie Hy3 einführen

Dieser Test erzeugt Belege für Ihr System statt eines generischen Modellurteils. Verwenden Sie reale, aber nicht sensible Aufgaben. Frieren Sie Prompts, Schemas und Bestehenskriterien ein, bevor Sie die Modelle ausführen, damit Sie die Zielvorgaben nicht nach dem Lesen einer Antwort verschieben.

Beweisen Sie den Anfragepfad mit einem minimalen selbst gehosteten Aufruf

Das folgende Beispiel folgt dem offiziellen selbst gehosteten, OpenAI-kompatiblen Serving-Muster von Hy3. Es verwendet einen lokalen vLLM-kompatiblen Endpunkt und den von diesem Server konfigurierten Modellnamen. Gehostete Modell-IDs sind anbieterspezifisch; verwenden Sie die obige Anbietertabelle für die verifizierten gehosteten IDs.

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy3",
    messages=[
        {"role": "user", "content": "List the acceptance checks for a JSON tool call."}
    ],
    temperature=0.9,
    top_p=1.0,
    extra_body={
        "chat_template_kwargs": {"reasoning_effort": "low"}
    },
)

print(response.choices[0].message.content)

Bringen Sie diesen trivialen Aufruf zum Laufen, bevor Sie einen komplexen Agenten bewerten. So wird ein Problem mit Authentifizierung, Endpunkt, Vorlage oder Modellnamen von einem Problem mit der Modellqualität getrennt. Protokollieren Sie für jeden Versuch den Provider, die Modellrevision, falls verfügbar, den Reasoning-Modus, den Zeitstempel, die Eingabetokens, die Ausgabetokens und die verstrichene Zeit.

Testen Sie strukturierte Ausgaben und Tool-Aufrufe mit Ihrem echten Schema

Tool-Calling sollte nicht als „das Modell hat eine plausible Aktion gewählt“ bewertet werden. Senden Sie ein explizites Schema und validieren Sie die zurückgegebenen Argumente in Ihrer Anwendung. Dies ist ein OpenAI-Style-Request-Fragment; bestätigen Sie die genaue Unterstützung der Tool-Parameter mit dem Anbieter, bevor Sie sich darauf verlassen.

{
  "model": "tencent/Hy3",
  "messages": [
    {"role": "user", "content": "Überprüfen Sie den Status des Vorfalls INC-1042."}
  ],
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "get_incident",
        "description": "Suche einen Vorfall anhand seiner Kennung nach.",
        "parameters": {
          "type": "object",
          "properties": {"incident_id": {"type": "string"}},
          "required": ["incident_id"],
          "additionalProperties": false
        }
      }
    }
  ]
}

Für diese Anfrage bedeutet eine korrekte Tool-Entscheidung einen get_incident-Aufruf, dessen incident_id genau INC-1042 ist. Ihr Code sollte ein fehlendes Feld, einen fehlerhaft formatierten JSON-Argument-String oder ein unerwartetes Tool ablehnen, bevor er das Downstream-System berührt. Prüfen Sie fünf Dinge:

  1. Das ausgewählte Tool ist für die Aufgabe zulässig.

  2. Jedes erforderliche Argument ist vorhanden und korrekt typisiert.

  3. IDs, Daten und Beträge stammen aus dem bereitgestellten Kontext, statt erfunden zu werden.

  4. Das Modell fragt nach einem fehlenden erforderlichen Wert, anstatt ihn zu raten.

  5. Ein Tool-Fehler führt zu einem begrenzten Reparatur- oder Eskalationspfad, nicht zu einer Schleife.

Führen Sie genügend Beispiele aus, um gültige Eingaben, mehrdeutige Anfragen, fehlende Felder und eine absichtlich fehlschlagende Tool-Antwort einzuschließen. Zuverlässiges JSON auf dem Happy Path ist nützlich; zuverlässiges Verhalten, wenn das System ein Argument ablehnt, ist das, was verhindert, dass ein Agent dem Bediener zusätzliche Arbeit verschafft.

Teste langen Kontext für die Beibehaltung von Einschränkungen, nicht die Überschriftenlänge

Hy3s 256K-Kontext ist nur dann wertvoll, wenn die relevanten Fakten in Ihrem Prompt-Format erhalten bleiben. Erstellen Sie einen Test aus einem repräsentativen Repository, einem Richtlinienpaket oder einem Kundenverlaufs-Thread. Platzieren Sie mehrere spezifische Einschränkungen an verschiedenen Stellen, fügen Sie realistische Ablenkungen hinzu und bitten Sie um eine Antwort, die diese Einschränkungen zitieren oder umformen muss.

Bewerte die exakte Retrieval-Genauigkeit, die Einhaltung jeder benannten Einschränkung, nicht unterstützte Behauptungen und die gesamten Anforderungskosten. Wiederhole dies anschließend mit aktivierter Produktions-Retrieval-Schicht. So wird sichtbar, ob ein Fehler dem Modell, dem Chunking, dem Retrieval-Ranking oder dem Prompt-Assembly-Code zuzuordnen ist. Das Durchreichen eines großen eingefügten Dokuments ist kein ausreichender Beweis, um Guardrails abzuschalten.

Testen Sie die Arbeitslast, die eine Migration rechtfertigen würde

Wählen Sie eine Aufgabe, bei der ein besseres Modellergebnis einen klaren geschäftlichen Nutzen hat: das Beheben eines fehlschlagenden Tests über mehrere Dateien hinweg, das Extrahieren von Verpflichtungen aus einer langen Richtlinie oder das Abschließen eines mehrstufigen internen Vorgangs mit Tools. Vergleichen Sie den aktuellen Produktionspfad und Hy3 unter derselben Zeitlimit- und Prüfregel.

Erfassen Sie die Abschlussrate von Aufgaben, die p50- und p95-Latenz, Eingabe- und Ausgabe-Token, die Anzahl der Tool-Wiederholungsversuche und die Korrekturzeit der Prüfer. Hier wird auch gemischtes Community-Feedback nützlich. Entscheiden Sie nicht anhand einer pauschalen Behauptung, dass Hy3 im Allgemeinen außergewöhnlich oder enttäuschend ist. Entscheiden Sie anhand der Aufgabe, für deren Automatisierung Sie tatsächlich bezahlen würden.

Gehostete API oder Self-Hosting?

Verwenden Sie zuerst eine gehostete API, wenn Sie das Modell evaluieren, der Traffic noch unsicher ist oder Ihr Team nicht bereits über die notwendige GPU-Kapazität verfügt. Dadurch verkürzt sich der Weg zu den oben genannten Tests, und die Verfügbarkeit des Anbieters bleibt von Ihrer Anwendungslogik getrennt.

Betreiben Sie Self-Hosting nur dann, wenn Sie einen konkreten Grund in Bezug auf Kontrolle, Datenschutz, Volumen oder Latenz haben und die Infrastruktur dafür vorhanden ist. Die offizielle Modellkarte empfiehlt acht H20-3e-GPUs oder andere GPUs mit großem Speicher für das Serving von Hy3, mit vLLM- oder SGLang-Rezepten. Das ist Tencents Empfehlung für den Produktionseinsatz, keine Behauptung, dass ein Verbraucher-Laptop eine gleichwertige Bereitstellung bietet. Vergleichen Sie die Kosten für GPU-Reservierungen, Upgrades, Monitoring, Batching und Bereitschaftsverantwortung mit der gehosteten Rechnung, bevor Sie Open Weights als kostenlose Infrastruktur betrachten.

Wählen Sie diesen Weg

Wenn er die bessere Wahl ist

Wichtigstes zu planendes Risiko

Hosted API

Schnelle Evaluierung, variable Nachfrage, kleines Plattformteam

Provider model IDs, limits, availability, and price can change

Self-hosted Hy3

Starker Bedarf an Datenkontrolle oder anhaltendes Volumen mit erfahrenen Betreibern

High memory hardware, serving complexity, capacity planning, and operational support

Preise und Verfügbarkeit können sich schneller ändern als die Gewichte

Tencent hat die Hy3 API-Preise veröffentlicht am 6. Juli mit 1 RMB pro Million Eingabe-Tokens, 4 RMB pro Million Ausgabe-Tokens und 0,25 RMB pro Million zwischengespeicherter Eingabe-Tokens. Verwenden Sie dies als datierten Referenzpunkt und bestätigen Sie dann den tatsächlichen Endpunktpreis, bevor Sie live gehen. Ein kostenloses Kontingent, ein Einführungsguthaben oder ein vorübergehender kostenloser Modellalias eines Anbieters ist eine Verfügbarkeit für ein Experiment, kein dauerhaftes Versprechen zu Stückkosten.

Für eine einfache Kostenprüfung verwenden 100 tägliche Anfragen mit 20K Eingabetokens und 1K Ausgabetokens 2M Eingabetokens und 0.1M Ausgabetokens. Beim von Tencent veröffentlichten Referenzpreis entspricht das 2.4 RMB pro Tag, also etwa 72 RMB für 30 Tage. Wenn alle 2M Eingabetokens für den Cache-Preis qualifizieren, ergibt sich mit derselben Rechnung 0.9 RMB pro Tag. Dies ist eine Schätzung nur auf Token-Basis: Sie schließt Anbieteraufschlag, Free-Tier-Limits, Wiederholungsversuche und jeden Kontext aus, den Ihre Anwendung hinzufügt.

Bei der Budgetierung eines Trials sollten der abgerufene Kontext, der System-Prompt, Tool-Definitionen, Wiederholungsversuche und die Ausgabe berücksichtigt werden, die durch die gewählte Reasoning-Einstellung erzeugt wird. Wählen Sie Hy3 nicht, wenn der zentrale Input visuell ist, eine leichtgewichtige lokale Bereitstellung eine harte Anforderung ist oder die Anwendung Tool-Argumente und nachgelagerte Seiteneffekte nicht validieren kann.

Für einen textlastigen Agenten, der ein großes Kontextfenster, konfigurierbares Reasoning und offene Gewichte benötigt, ist Hy3 ein vernünftiges Modell zum Evaluieren. Behalten Sie es nur, wenn es die Korrekturzeit bei akzeptablen Gesamtkosten reduziert.

FAQ

Ist Hy3 multimodal?

Nein. Hy3 ist ein Text-Eingabe-, Text-Ausgabe-Modell. Verwenden Sie ein Vision- oder OCR-Modell, wenn die Aufgabe mit Bildern, Scans oder Screenshots beginnt.

Was ist das Hy3-Kontextfenster?

Tencents Modellkarte gibt ein 256K-Token-Kontextfenster an. Ein langer Kontextbereich garantiert nicht, dass relevante Fakten abgerufen oder befolgt werden, daher sollte man dies mit repräsentativem Quellmaterial validieren.

Mit welchem Hy3-Reasoning-Modus sollte ich beginnen?

Beginnen Sie mit no_think für klar abgegrenzte, latenzkritische Aufgaben. Wechseln Sie erst zu low oder high, wenn die Kosten eines Fehlschlags und die gemessene Verbesserung die zusätzlichen Tokens und die zusätzliche Zeit rechtfertigen.

Kann ich Hy3 selbst hosten?

Ja. Tencent bietet Bereitstellungsanleitungen für vLLM und SGLang und empfiehlt acht GPUs mit großem Speicher für den Betrieb. Beim Self-Hosting sollte die Entscheidung auf Kapazität und Betrieb beruhen, nicht allein auf der Open-Weight-Lizenz.

Ist eine kostenlose Hy3-API ein dauerhaftes Preismodell?

Nein. Der kostenlose Zugang ist anbieterspezifisch und kann enden oder die Limits können sich ändern. Bestätigen Sie die aktuellen Bedingungen des Anbieters und den kostenpflichtigen Tarif, bevor Sie einen Produktionsworkflow verbindlich festlegen.