Hy3 API Kılavuzu: Akıl Yürütme, Araç Çağrıları ve Uzun Bağlam

Son Güncelleme: 2026-07-14 06:40:01

Hy3, kodlama, muhakeme, uzun bağlamlı çalışmalar ve ajanlar için yalnızca metin tabanlı bir MoE modelidir. İlk entegrasyon için, barındırılan bir OpenAI uyumlu uç nokta kullanın, normal bir Chat Completions isteği gönderin ve gerçekten otomatikleştireceğiniz tek iş akışını değerlendirin. Uzun girdilerinizde önemli olan araç şemanızı izleyip kısıtlamaları koruyana kadar onu standart hale getirmeyin.

Aşağıdaki sağlayıcı ayrıntıları 14 Temmuz 2026 tarihinde kontrol edildi. DeepInfra belgeleri modeli OpenAI uyumlu Chat Completions uç noktasında tencent/Hy3 olarak listeliyor. SiliconFlow da Hy3’ü listeliyor aynı model kimliği altında. Sağlayıcı fiyatları, limitleri ve takma adları değişebilir; bu yüzden yayınlamadan önce canlı sağlayıcı sayfasını doğrulayın.

Barındırılan bir Hy3 API çağrısıyla başlayın

DeepInfra, barındırılan Hy3 uç noktası için bu minimal isteği yayımlar. Belirteci kendi sağlayıcı belirtecinizle değiştirin; bunu tarayıcı koduna veya bir istemci uygulamasına koymayın.

curl "https://api.deepinfra.com/v1/openai/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPINFRA_TOKEN" \
  -d '{
    "model": "tencent/Hy3",
    "messages": [
      {"role": "user", "content": "Üç API kabul kontrolü döndür."}
    ]
  }'

Yanıt, standart Chat Completions yapısını kullanır. Yanıtı ve faturalandırma alanlarını şu şekilde ayrıştırın:

{
  "id": "chatcmpl-...",
  "object": "chat.completion",
  "model": "tencent/Hy3",
  "choices": [{
    "message": {"role": "assistant", "content": "..."},
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 0,
    "completion_tokens": 0,
    "total_tokens": 0
  }
}

Yanıt için choices[0].message.content değerini, token hesaplaması için ise usage değerini okuyun. "stream": true eklemeyi yalnızca akışsız bir istek çalıştıktan sonra yapın; DeepInfra, streaming’i [DONE] ile sona eren sunucu tarafından gönderilen olaylar olarak belgelendirir.

Tablodaki sağlayıcı seçenekleri bilinçli olarak sınırlıdır. Bunlar bir fiyat sıralaması değil, doğrulanmış genel erişim yollarıdır.

Sağlayıcı

Doğrulanmış erişim detayı

Üretime almadan önce ne doğrulanmalı

DeepInfra

https://api.deepinfra.com/v1/openai/chat/completions; model tencent/Hy3; standart ve akış örnekleri belgelenmiştir

Güncel fiyat, hesap limitleri, araç desteği ve veri koşulları

SiliconFlow

OpenAI uyumlu API; model tencent/Hy3

Güncel uç nokta, fiyat, hız sınırları ve API anahtarı kapsamı

OpenRouter

14 Temmuz'da, sayfasında tencent/hy3:free listelenmişti ve ücretsiz sürümün 21 Temmuz'da sona ereceği belirtilmişti

Takma adın hâlâ kullanılabilir olup olmadığı, limitleri ve yönlendirilen sağlayıcı

Tencent'in 6 Temmuz 2026 tarihli sürüm duyurusu, Hy3'ü açık ağırlıklı bir Mixture-of-Experts modeli olarak tanıttı. Resmî fiyatlandırma duyurusu ve model kartı onu barındırılan bir değerlendirme için aday haline getiriyor, ancak bir API sayfası bunun üretim iş yüküne uygun olduğunun kanıtı değildir.

Hy3 nedir ve ne değildir

Hy3, token başına 21B aktif parametreye sahip 295B parametreli bir MoE modelidir. Resmi Hy3 model kartı, top-8 yönlendirme, 80 katmanlı bir omurga, bir MTP katmanı, 256K token bağlam penceresi ve Apache 2.0 lisansıyla 192 uzman listeler.

Bu sayılar, akıl yürütme, kodlama, uzun süren görüşmeler ve araç kullanan ajanlar için tasarlanmış bir metin modelini tanımlar. Bunlar Hy3'ü bir görüntü veya OCR modeli yapmaz. Temel girdisi taranmış bir fatura, ekran görüntüsü, ürün fotoğrafı veya grafik olan bir iş akışının, Hy3'ten önce bir vision veya OCR modeline ihtiyacı vardır. Bu sınırı net tutmak, yaygın bir mimari hatayı önler: yetkin bir metin modelinden, hiç almadığı bilgiyi geri kazanmasını istemek.

Tencent, Hy3'ü kodlama, ofis işleri, finansal modelleme, frontend çalışmaları ve oyun geliştirme için konumlandırıyor. Bunları evrensel bir sıralama değil, aday iş yükleri olarak değerlendirin.

Karşılaştırma iddialarını sınırlarıyla birlikte okuyun

Tencent'in duyuru açıklaması, 270 uzmanın iş görevleri gerçekleştirdiği kör bir değerlendirmeyi bildiriyor; bu değerlendirmede Hy3 4 üzerinden 2,67 ve GLM-5.1 4 üzerinden 2,51 puan aldı. Aynı kaynak, Hy3'nin SWE-Bench Verified doğruluğunun CodeBuddy, Cline ve KiloCode scaffoldingleri arasında dört yüzde puanından daha az değiştiğini söylüyor. Bunlar Tencent tarafından bildirilen sonuçlardır; Hy3'nin sizin ortamınızda adı geçen bir rakibi geçeceğine dair bağımsız bir garanti değildir.

Artificial Analysis, model düzeyindeki ölçümler için başka bir referans noktasıdır. Benchmark sayılarını, uygulama düzeyindeki kabul kriterlerinin yerine geçecek bir alternatif olarak değil, model seçimi girdileri olarak okuyun.

Başarısızlık maliyetine göre muhakeme modunu seçin

Hy3, resmi sunum örneklerinde no_think, low ve high muhakeme çabasını sunar. Seçim, yanlış bir cevabın maliyetini takip etmelidir; bir muhakeme modeli kullanmanın prestijini değil.

İş yükü

Şununla başlayın

Yükseltmeden önce ne ölçülmeli

Sınıflandırma, temiz metinden çıkarım veya basit yönlendirme

no_think

Doğru etiket veya alan değerleri, gecikme ve çıktı tokenları

Sınırlı kod değişiklikleri, çok kurallı özetler veya tek bir araç dizisi

low

Test geçme oranı, geçerli araç argümanları ve insan düzenlemeleri

Çok dosyalı hata ayıklama, çelişkili kısıtlarla planlama veya sayısal akıl yürütme

high

Tamamlanan görev oranı, yeniden denemeler, toplam tokenlar ve inceleme süresi

Sınırlı işler için no-think’i koruyun

no_think varsayılan doğrudan yanıt modudur. Kaynak zaten yapılandırılmış olduğunda, yanıtın bilinen bir biçimi olduğunda ve daha yavaş bir yanıt yararlı bir akıl yürütme eklemeyeceğinde doğru başlangıç düzeyidir. Örneğin, belgelenmiş bir durumu seçen ve bir işlev çağıran bir destek iş akışı önce bu modda test edilmelidir. Sıkı bir JSON şeması ekleyin ve daha uzun bir akıl yürütme zincirinin belirsiz bir sözleşmeyi düzelteceğini ummak yerine fazladan alanlar içeren yanıtları reddedin.

Bir hata sonraki eylemi değiştirdiğinde düşük veya yüksek muhakeme kullanın

Model birkaç kuralı uzlaştırmak ya da koda sınırlı bir değişiklik yapmak zorunda olduğunda low değerine geçin. Zayıf bir ara kararın maliyetli bir yeniden denemeye yol açacağı işler için high değerini ayırın: dosyalar arasında bir hatayı teşhis etmek, işlem sırasını seçmek veya bir araç çağrısından önce hesaplamaları kontrol etmek.

Takas ölçülebilir. Tüm tamamlanmış görevi karşılaştırın: istek gecikmesi, çıktı token sayısı, araç çağrısı yeniden denemeleri, test hataları ve bir değerlendiricinin yanıtı düzeltmek için harcadığı dakikalar. Daha düşünceli görünse de token sayısını iki katına çıkarıp inceleme süresini azaltmayan bir mod, üretim için daha iyi bir ayar değildir.

Hy3’ü benimsemeden önce dört aşamalı bir API denemesi yapın

Bu deneme, genel bir model hükmü yerine sisteminiz için kanıt oluşturur. Gerçek ama hassas olmayan görevler kullanın. Modelleri çalıştırmadan önce promptları, şemaları ve geçme kriterlerini sabitleyin; böylece bir yanıtı okuduktan sonra hedefleri değiştirmiş olmazsınız.

İstek yolunu minimal bir self-hosted çağrıyla doğrulayın

Aşağıdaki örnek, Hy3’ün resmi self-hosted, OpenAI-compatible serving pattern’ini izler. Yerel bir vLLM-compatible endpoint ve bu sunucu tarafından yapılandırılan model adını kullanır. Hosted model ID’leri sağlayıcıya özeldir; doğrulanmış hosted ID’ler için yukarıdaki sağlayıcı tablosunu kullanın.

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy3",
    messages=[
        {"role": "user", "content": "Bir JSON tool call için kabul kontrollerini listele."}
    ],
    temperature=0.9,
    top_p=1.0,
    extra_body={
        "chat_template_kwargs": {"reasoning_effort": "low"}
    },
)

print(response.choices[0].message.content)

Bu önemsiz çağrıyı, karmaşık bir agent’ı değerlendirmeden önce çalışır hale getirin. Bu, bir authentication, endpoint, template veya model-name sorununu bir model-quality sorunundan ayırır. Her deneme için provider, varsa model revision, reasoning mode, timestamp, input tokens, output tokens ve geçen süreyi kaydedin.

Gerçek şemanızla yapılandırılmış çıktı ve araç çağrılarını test edin

Araç çağırma, "model makul bir eylem seçti" şeklinde değerlendirilemez. Açık bir şema gönderin ve döndürülen argümanları uygulamanızda doğrulayın. Bu, OpenAI tarzı bir istek parçasıdır; buna güvenmeden önce sağlayıcıyla tam araç parametresi desteğini doğrulayın.

{
  "model": "tencent/Hy3",
  "messages": [
    {"role": "user", "content": "INC-1042 olayının durumunu kontrol et."}
  ],
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "get_incident",
        "description": "Kimliğine göre bir olayı arayın.",
        "parameters": {
          "type": "object",
          "properties": {"incident_id": {"type": "string"}},
          "required": ["incident_id"],
          "additionalProperties": false
        }
      }
    }
  ]
}

Bu istek için, doğru araç kararı, incident_id değeri tam olarak INC-1042 olan bir get_incident çağrısı anlamına gelir. Kodunuz, downstream sisteme dokunmadan önce eksik bir alanı, hatalı biçimlendirilmiş bir JSON argüman dizesini veya beklenmeyen bir aracı reddetmelidir. Beş şeyi inceleyin:

  1. Seçilen araç göreve izinlidir.

  2. Gerekli her argüman mevcuttur ve doğru türde girilmiştir.

  3. Kimlikler, tarihler ve tutarlar icat edilmek yerine sağlanan bağlamdan alınır.

  4. Model, eksik zorunlu bir değeri tahmin etmek yerine bunu ister.

  5. Bir araç hatası, döngüye değil, sınırlandırılmış bir düzeltme veya eskalasyon yoluna yol açar.

Geçerli girdileri, belirsiz istekleri, eksik alanları ve kasıtlı olarak başarısız olan bir tool yanıtını içerecek kadar örnek çalıştırın. Mutlu yolda güvenilir JSON yararlıdır; sistem bir argümanı reddettiğinde güvenilir davranış ise bir agent’ın bir operatör için iş üretmesini engelleyen şeydir.

Kısıt korunumunu test etmek için uzun bağlam, başlık uzunluğu değil

Hy3'nin 256K bağlamı, ilgili gerçekler prompt formatınızda korunabildiğinde değerlidir. Temsilî bir depo, politika paketi veya müşteri geçmişi dizisinden bir test oluşturun. Farklı konumlara birkaç belirli kısıt ekleyin, gerçekçi dikkat dağıtıcılar ekleyin ve bu kısıtları alıntılaması veya dönüştürmesi gereken bir yanıt isteyin.

Kesin eşleşen retrieval, her adlandırılmış kısıta uyum, desteklenmeyen iddialar ve toplam istek maliyetini puanlayın. Ardından üretim retrieval katmanınız etkin durumdayken bunu tekrarlayın. Bu, bir başarısızlığın modele, chunking’e, retrieval sıralamasına veya prompt assembly koduna ait olup olmadığını ortaya çıkarır. Tek büyük yapıştırılmış belge geçirmek, guardrails’i kapatmak için yeterli kanıt değildir.

Geçişi haklı çıkaracak iş yükünü test edin

Daha iyi bir model çıktısının net bir iş değeri olduğu bir görev seçin: birkaç dosya arasında başarısız bir testi onarmak, uzun bir politikadan yükümlülükleri çıkarmak veya araçlarla çok adımlı bir iç işlemi tamamlamak. Aynı zaman aşımı ve inceleme kuralı altında mevcut üretim yolunu ve Hy3'ü karşılaştırın.

Tamamlanan görev oranını, p50 ve p95 gecikmeyi, giriş ve çıkış tokenlerini, araç yeniden deneme sayısını ve değerlendirici düzeltme süresini kaydedin. Karışık topluluk geri bildiriminin faydalı hale geldiği yer de burasıdır. Hy3’ün soyut olarak olağanüstü ya da hayal kırıklığı yarattığına dair bir iddiadan yola çıkarak karar vermeyin. Gerçekten otomatikleştirmek için para ödeyeceğiniz görevden yola çıkarak karar verin.

Barındırılan API mi yoksa kendi sunucunuzda barındırma mı?

Modeli değerlendirirken, trafik hâlâ belirsizken veya ekibinizin gerekli GPU kapasitesini zaten işletmediği durumlarda önce barındırılan bir API kullanın. Bu, yukarıdaki testlere giden yolu kısaltır ve sağlayıcı kullanılabilirliğini uygulama mantığınızdan ayrı tutar.

Yalnızca somut bir kontrol, gizlilik, hacim veya gecikme nedeniniz ve bunu destekleyecek altyapınız varsa self-host edin. Resmî model kartı, Hy3'ü sunmak için vLLM veya SGLang tarifleriyle birlikte sekiz H20-3e GPU ya da diğer yüksek bellekli GPU'ları öneriyor. Bu, Tencent'in üretim ortamı sunma önerisidir; bir tüketici dizüstü bilgisayarının eşdeğer bir dağıtım sağladığı anlamına gelmez. Açık ağırlıkları ücretsiz altyapı olarak görmeden önce, GPU rezervasyonları, yükseltmeler, izleme, toplu işleme ve nöbetçi sorumluluğunun maliyetini barındırılan faturayla karşılaştırın.

Bu yolu seçin

Daha uygun olduğu durum

Planlanması gereken temel risk

Hosted API

Hızlı değerlendirme, değişken talep, küçük platform ekibi

Sağlayıcı model ID'leri, limitler, kullanılabilirlik ve fiyat değişebilir

Self-hosted Hy3

Güçlü veri kontrolü ihtiyacı veya deneyimli operatörlerle sürdürülen yüksek hacim

Yüksek bellekli donanım, servis sunma karmaşıklığı, kapasite planlaması ve operasyonel destek

Fiyatlandırma ve kullanılabilirlik ağırlıklardan daha hızlı değişebilir

Tencent Hy3 API fiyatlandırmasını listeledi 6 Temmuz’da milyon giriş tokenı başına 1 RMB, milyon çıkış tokenı başına 4 RMB ve milyon önbelleğe alınmış giriş tokenı başına 0,25 RMB olarak. Bunu tarihli bir referans noktası olarak kullanın, ardından gönderim yapmadan önce gerçek endpoint fiyatını doğrulayın. Bir sağlayıcının ücretsiz katmanı, tanıtım kredisi veya geçici ücretsiz model takma adı, kalıcı bir birim maliyet taahhüdü değil, bir deney için kullanılabilirliktir.

Basit bir maliyet kontrolü için, 20K giriş tokeni ve 1K çıkış tokeni içeren 100 günlük istek, 2M giriş ve 0.1M çıkış tokeni kullanır. Tencent’in yayımladığı referans fiyata göre bu, günde 2.4 RMB, yani 30 gün için yaklaşık 72 RMB eder. Eğer 2M giriş tokeninin tamamı önbelleklenmiş fiyatlandırmaya uygunsa, aynı hesapla bu günde 0.9 RMB olur. Bu yalnızca token bazlı bir tahmindir: sağlayıcı ek ücretlendirmesi, ücretsiz katman sınırları, yeniden denemeler ve uygulamanızın eklediği her türlü bağlam dahil değildir.

Bir deneme için bütçe planlarken, alınan bağlamı, sistem istemini, araç tanımlarını, yeniden denemeleri ve seçilen akıl yürütme ayarı tarafından üretilen çıktıyı dahil edin. Ana girdi görsel olduğunda, hafif bir yerel dağıtım zorunlu bir gereklilik olduğunda veya uygulama araç argümanlarını ve sonraki yan etkileri doğrulayamıyorsa Hy3 seçmeyin.

Büyük bir bağlam penceresine, yapılandırılabilir akıl yürütmeye ve açık ağırlıklara ihtiyaç duyan metin ağırlıklı bir ajan için, Hy3 değerlendirilmesi makul bir modeldir. Yalnızca düzeltme süresini kabul edilebilir toplam maliyetle azalttığında onu kullanın.

SSS

Hy3 çok modlu mu?

Hayır. Hy3, metin girişi ve metin çıkışı olan bir modeldir. Görev görüntüler, taramalar veya ekran görüntüleriyle başlıyorsa bir vision veya OCR modelini kullanın.

Hy3 bağlam penceresi nedir?

Tencent'in model kartı 256K tokenlık bir bağlam penceresi listeliyor. Uzun bir bağlam sınırı, ilgili bilgilerin alınacağını veya takip edileceğini garanti etmez; bu nedenle bunu temsili kaynak materyalle doğrulayın.

Hangi Hy3 akıl yürütme modu ile başlamalıyım?

Sınırlı, gecikmeye duyarlı işler için no_think ile başlayın. Görevin başarısızlık maliyeti ve ölçülen iyileşme, ek tokenleri ve zamanı haklı çıkardıktan sonra yalnızca low veya high seviyesine geçin.

Hy3'ü kendi sunucumda barındırabilir miyim?

Evet. Tencent, vLLM ve SGLang dağıtım rehberliği sağlar ve hizmet sunumu için büyük belleğe sahip sekiz GPU önerir. Kendi kendine barındırma kararı yalnızca açık ağırlık lisansına göre değil, kapasite ve operasyon kararına göre verilmelidir.

Ücretsiz Hy3 API kalıcı bir fiyatlandırma planı mı?

Hayır. Ücretsiz erişim sağlayıcıya özeldir ve sonlandırılabilir veya limitleri değişebilir. Bir üretim iş akışına devam etmeden önce geçerli sağlayıcı koşullarını ve ücretli tarifeyi doğrulayın.