GLM-5.3’ü masaüstü ekran kartında çalıştırmayı düşünüyorsanız kısa cevap şu: Hayır. Güncel amiral gemisi modelinin ağırlıkları sunucu sınıfı belleğe ihtiyaç duyuyor. GLM-5.3-Flash giriş maliyetini düşürüyor, ancak o da hâlâ büyük ve çok GPU’lu bir model. Kuantize edilmiş bir checkpoint’i belleğe yükleyebilmek, akıcı çalışan bir kodlama ajanı sunabileceğiniz anlamına gelmiyor.
Donanım gereksinimi tek tabloda
Tam GLM-5.3 modeli için belgelenen yapı 8 GPU’lu FP8 topolojisi. 1 milyon token’lık tam bağlam hedefi ise 8× B200 üzerinde belgelenmiş durumda. Sparse MoE yönlendirmesi her token için parametrelerin yalnızca bir bölümünü etkinleştirse de 24 GB, 64 GB, 128 GB veya 192 GB belleğe sahip makineler tam model için pratik hedefler değil.
| Hedef | Yayımlanmış kanıt | Kanıt türü | Pratik karar |
|---|---|---|---|
| GLM-5.3 native FP8 | resmî vLLM tarifinde 8× H200 veya H20 | Resmî topoloji | Sunucu sınıfı ya da uzman bir iş istasyonu kurulumu. |
| GLM-5.3 BF16 | Ayrı BF16 checkpoint’i; vLLM tarifinde çok düğümlü sunum | Resmî dağıtım notu | Yalnızca değerlendirme veya üst seviye üretim kullanımı. |
| GLM-5.3 NVFP4 | Resmî vLLM tarifi, yaklaşık 465 GB boyutundaki Inferact/GLM-5.3-NVFP4 Blackwell checkpoint’ini listeliyor | Resmî tarifte listelenen topluluk checkpoint’i | Blackwell’e özel deney veya servis. |
| GLM-5.3 quantized | Bir topluluk 2-bit GGUF raporu yaklaşık 281 GB’lık dosya kullandı | Z.ai boyutlandırması değil, topluluk paketlemesi | Offload deneyi mümkün; normal bir masaüstü kurulumu değil. |
| GLM-5.3-Flash | Doğrulanmış bir profil, 175,6 GB’lık 4-bpw checkpoint’iyle 2× RTX PRO 6000 Blackwell 96GB kullanıyor | Topluluk doğrulaması | Yerel kullanım için gerçekçi GLM seçeneği; yine de çok GPU gerekiyor. |
Güncel Hugging Face model kartında toplam parametre sayısı 753.329.940.480, FP8 parametre sayısı 751.226.191.872 ve toplam safetensors dosya boyutu 755.643.409.571 byte olarak veriliyor. vLLM tarifi modeli yaklaşık 743B toplam ve 39B aktif parametre şeklinde yuvarlıyor. Bu rakamlar arasında küçük farklar var, ancak donanım sonucunu değiştirmiyor.
Ham ağırlık belleği hesabı
Aşağıdaki değerler KV cache, aktivasyonlar, çalışma zamanı tamponları ve bellek ayırıcı ek yükleri hesaba katılmadan yapılan aritmetik tahminlerdir. FP8 ve BF16 hesapları, güncel amiral gemisi modelinin yaklaşık 753B parametre ölçeğine dayanıyor; NVFP4 ve 2-bit değerleri ise belirli uygulamalardan alınmıştır.
| Gösterim | Yaklaşık ham ağırlık belleği | Pratik karşılığı |
|---|---|---|
| FP8 | ~753 GB | Yerel FP8 ve 8 GPU sınıfındaki dağıtım planıyla örtüşüyor. |
| BF16 | ~1,5 TB | Sunum ek yükleri hesaba katılmadan önce bile çok düğümlü sınıf belleği gerektirir. |
| NVFP4 | Listelenen topluluk checkpoint’i için ~465 GB | Resmî tarifteki Blackwell’e özel yol; Z.ai’ın varsayılan checkpoint’i değil. |
| 2-bit | Topluluk derlemelerinde yüzlerce GB | Offload veya yüksek bellekli deneyler için; 24 GB’lık dağıtım için değil. |
Ön sürüm donanım tavsiyelerine göre ne değişti?
GLM-5.3 deposu artık yerel FP8 dosyalarıyla birlikte erişilebilir durumda. Checkpoint bilgileri için güncel model kartını, topoloji ve başlatma seçenekleri için resmî vLLM tarifini, gerçek dağıtım deneyimi içinse topluluk raporlarını kullanın. Mevcut tarif, 1.048.576 token’lık bağlam penceresi sunuyor.
Parametre sayısına değil, bellek bütçesine göre seçim yapın
GLM-5.3’te ilk sınır ağırlık belleği, ikinci sınır ise bağlam belleği. Aktif parametre sayısının düşük olması hesaplama yükünü azaltıyor, ancak yönlendirilen uzmanları ve çalışma zamanı tamponlarını bellekte tutma ihtiyacını ortadan kaldırmıyor.
24–64 GB: Tam yerel GLM-5.3 çalıştırmayı planlamayın
Tek bir RTX 4090, RTX 5090 veya 24 GB sınıfındaki başka bir kart, güncel Hugging Face deposunda yaklaşık 756 GB safetensors dosyası bulunan amiral gemisi modelinin yerel FP8 checkpoint’ini taşıyamaz. 64 GB’lık bir iş istasyonu kartı bile ağırlık ayak izinin çok altında kalıyor.
CPU offload, kuantize edilmiş bir deneyi yüklemeyi mümkün kılabilir. Ancak etkileşimli bir kodlama servisi için bu, varsayılan çözümden çok hata ayıklama yoludur. Ajanın art arda yaptığı araç çağrılarını hâlâ kabul edilebilir bir hızda tamamlaması gerekir.
128–192 GB: Amiral gemisi için hayır; Flash için belirli bir yapılandırma gerekir
128 GB veya 192 GB birleşik belleğe sahip bir makine, amiral gemisi modelinin yerel FP8 gereksiniminin altında kalmaya devam ediyor. Flash içinse somut bir seçenek var: herkese açık doğrulanmış profil, sabitlenmiş EXL3/TR3 4-bpw checkpoint’ini 2× RTX PRO 6000 Blackwell 96GB GPU üzerinde çalıştırıyor.
Bu profil 175,6 GB checkpoint verisi, yaklaşık 220 GB boş depolama alanı, PCIe eşler arası iletişim ve sabitlenmiş bir çalışma zamanı kullanıyor. İstek başına 262.144 token sınırı bildiriliyor; ancak bu, sıradan sistem RAM’iyle elde edilmiş 192 GB’lık bir kurulum değil, iki ayrı GPU’dan oluşan bir dağıtım. Profil ayrıca bu özel Flash kurulumu için saniyede 171,7 token decode hızına ve 0,059 saniye medyan ilk token süresine ulaşıldığını bildiriyor.
2–4 yüksek bellekli GPU: Amiral gemisi yerine Flash’a bakın
İki veya dört yüksek bellekli kart, Flash için incelenmeye değer ilk aralık. Çünkü hassasiyet, çalışma zamanı, bağlam uzunluğu, batch boyutu ve görüntü girdileri bellek bütçesini değiştiriyor. Doğrulanmış iki GPU’lu profil metin, yapılandırılmış araçlar ve anlamsal görüntü girdisini destekliyor; video devre dışı, uç noktada yerleşik kimlik doğrulama yok ve birlikte gelen görme şablonu çok modlu doğrulama öncesinde geri alınabilir bir düzeltme gerektiriyor. Bunlar yalnızca sabitlenmiş bu tarif için geçerli; her Flash derlemesi veya amiral gemisi model için genellenmemeli.
8× H200 veya H20: Belgelenen FP8 amiral gemisi topolojisi
Resmî vLLM tarifi, standart yerel FP8 topolojisi olarak sekiz H200 veya H20 GPU’yu gösteriyor. Yapılandırmada sekiz yönlü tensor parallelism, FP8 KV cache, beş token’lık çoklu token tahmini, otomatik araç seçimi ve GLM’e özel akıl yürütme ile araç çağrısı ayrıştırıcıları kullanılıyor.
Bu, belgelenmiş topolojidir; belirli bir saniye başına token sonucu garantisi değildir. Gerçek aktarım hızı ara bağlantıya, bağlam uzunluğuna, batch boyutuna, eşzamanlı dizilere ve kullanılan sunum derlemesine bağlıdır. vLLM sayfası yapılandırmayı veriyor, ancak üretim ortamına ait ölçülmüş bir aktarım hızı sunmuyor.
8× B200: 1M bağlam hedefi önemliyse bunu kullanın
Resmî tarif, 1.048.576 token’lık tam bağlam yapılandırması için sekiz B200 GPU öneriyor. Buradaki ek bağlam doğrudan VRAM kararı anlamına geliyor: KV cache, aktif diziler ve bağlam uzunluğuyla büyüyor. Bu nedenle 32K veya 128K token’da çalışan bir dağıtım, aynı eşzamanlılıkla 1 milyon token’ı desteklemeyebilir.
Daha küçük bir --max-model-len değeriyle başlayın ve bu değeri yalnızca KV cache kullanımını ölçtükten sonra yükseltin. Büyük bir bağlam penceresi uzun depolar ve belgeler için değerli, ancak her isteği ekonomik veya düşük gecikmeli hâle getirmiyor.
Resmî tarifin belirtmediği ana makine gereksinimleri
vLLM tarifi GPU topolojisini ve başlatma seçeneklerini veriyor, ancak sistem RAM’i, güç, soğutma, depolama payı veya ağ için evrensel gereksinimler yayımlamıyor. Bu değerler checkpoint’e, çalışma zamanına, bağlam hedefine ve sağlayıcı platformuna göre değişir.
| Ana makine bileşeni | Toplanan kanıtların desteklediği sonuç |
|---|---|
| Model depolama alanı | Güncel amiral gemisi deposu 755,6 milyar byte safetensors dosyası bildiriyor; cache’ler ve geçici shard’lar için ek alan ayırın. |
| GPU ara bağlantısı | Tarif sekiz yönlü tensor parallelism gerektiriyor; yalnızca PCIe performansını varsaymak yerine kiralık veya sunucu platformunun topolojisini doğrulayın. |
| Sistem RAM’i | vLLM tarifinde evrensel bir resmî sayı yayımlanmıyor. Gerekli GPU belleği yerine sistem RAM’i değerini koymayın. |
| Güç ve soğutma | Evrensel bir resmî değer yayımlanmıyor. Donanım satın almadan önce platformun sekiz GPU’ya ait elektrik ve termal özelliklerini kontrol edin. |
| Yazılım | Resmî tarifte vLLM 0.28.0 veya üzeri ve Transformers 5.15.0 veya üzeri gösteriliyor; FP8 performansı için DeepGEMM gerekiyor. |
En sade resmî sunum yolu
Belgelenen dağıtım yolu vLLM 0.28.0 ve OpenAI uyumlu bir uç nokta kullanıyor. Bu yapı çok GPU’lu bir düğüm için tasarlanmış durumda; komutu daha küçük bir makineye kopyalamak model belleği gereksinimini ortadan kaldırmaz.
Belgelenen çalışma zamanını kurun
uv venv
source .venv/bin/activate
uv pip install "vllm==0.28.0" --torch-backend=auto
uv pip install "transformers>=5.15.0"
vLLM tarifi, FP8 performansı için DeepGEMM gerektiğini de belirtiyor. Ücretli bir düğüm kiralamadan önce güncel tarifi hedef GPU imajıyla karşılaştırın.
Yerel FP8 GLM-5.3’ü başlatın
vllm serve zai-org/GLM-5.3 \
--kv-cache-dtype fp8 \
--tensor-parallel-size 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 5 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--served-model-name glm-5.3
Bu seçeneklerin her birinin ayrı bir görevi var:
--tensor-parallel-size 8checkpoint’i sekiz GPU’ya dağıtır.--kv-cache-dtype fp8daha yüksek hassasiyetli bir cache’e kıyasla cache baskısını azaltır.- Beş token’lık MTP ayarı, belgelenen tarifteki spekülatif decode özelliğini etkinleştirir.
--tool-call-parser glm47ve--reasoning-parser glm45model çıktısını araç kullanımı ve akıl yürütme için biçimlendirir.--enable-auto-tool-choice, istemci araçları sağladığında sunucunun araçları otomatik olarak seçmesini sağlar.
Bir ajanı bağlamadan önce uç noktayı doğrulayın
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "glm-5.3",
"messages": [
{"role": "user", "content": "Write a Python function that reverses a linked list."}
],
"max_tokens": 256
}'
Başarılı bir yanıt, modelin yüklendiğini doğrular; araç kullanımını veya uzun bağlam davranışını değil. Resmî model kartı, başka bir OpenAI uyumlu yol olarak SGLang’i de belgeliyor. Ancak bu rehberde, GPU topolojisi ve başlatma seçenekleri özel bir tarifte belgelendiği için vLLM kullanılıyor.
Gizli bellek bütçesi: KV cache ve sürekli açık akıl yürütme
GLM-5.3 model kartı ile vLLM tarifi, düşünme özelliğini sürekli etkin kabul ediyor. Desteklenen akıl yürütme düzeyleri low, high ve max; desteklenen daha düşük bir ayar verilmediğinde varsayılan değer max.
Daha uzun akıl yürütme daha fazla çıktı token’ı tüketir. Kodlama ajanı da tekrarlanan araç çağrıları sırasında büyük depo öneklerini KV cache’te tutabilir. Model ağırlıkları değişmese bile eşzamanlı dizi sayısı arttıkça cache gereksinimi de katlanır.
Bu ayarları bir dağıtım kontrolü olarak kullanın:
- Low: Etkileşimli kodlama, kısa istekler ve gecikmeye duyarlı araçlarla başlamak için uygun.
- High: Daha fazla planlama gerektiren, ancak hâlâ etkileşimli yanıt bütçesi içinde kalan görevlerde kullanın.
- Max: Ek akıl yürütme token’larının karşılığını verdiği zor ve uzun soluklu görevler için ayırın.
Resmî tarif, tam bağlamlı B200 yapılandırması için --max-num-seqs 32 öneriyor ve FP8 cache ayarlarını kullanıyor. Bu değeri başlangıç noktası olarak değerlendirin: sunucunun belleği tükendiğinde eşzamanlılığı azaltın ve gerçek bir istek cache kesintisi yaşamadan bu aralığa ulaşana kadar 1 milyon token desteği iddia etmeyin.
API ne zaman daha mantıklı donanım seçimi olur?
Kendi sunucunuzu işletmek, geliştirici istek göndermese bile GPU kapasitesini rezerve eder. Trafiğin kesintili olduğu, eşzamanlılığın düşük kaldığı veya ekibin GLM-5.3’ü hâlâ değerlendirdiği durumlarda API, sekiz GPU’lu bir düğüm satın alma ya da sürekli kiralama zorunluluğunu ortadan kaldırır. Bunun karşılığında barındırılan veri işleme ve sağlayıcı bağımlılığı gelir.
Z.ai’ın güncel fiyatlandırma sayfasında GLM-5.3 için 1 milyon giriş token’ı başına 1,40 $, 1 milyon cache’lenmiş giriş token’ı başına 0,26 $ ve 1 milyon çıkış token’ı başına 4,40 $ fiyat veriliyor. GLM-5.3-Flash için liste fiyatı 1,50 $ / 0,03 $ / 0,50 $ olarak gösteriliyor; ayrıca 9 Eylül 2026’ya kadar geçerli yüzde 50’lik bir kampanya da listelenmiş. Bütçe oluştururken canlı faturalandırma sayfasını mutlaka kontrol edin.
| İş yükü | GLM-5.3 liste fiyatı hesabı | GLM-5.3-Flash liste fiyatı hesabı |
|---|---|---|
| 10M yeni giriş + 2M çıkış | 14,00 $ + 8,80 $ = 22,80 $ | 1,50 $ + 1,00 $ = 2,50 $ |
| 2M yeni giriş + 8M cache’lenmiş giriş + 2M çıkış | 2,80 $ + 2,08 $ + 8,80 $ = 13,68 $ | 0,30 $ + 0,24 $ + 1,00 $ = 1,54 $ |
Bunlar token maliyeti örnekleri; kendi sunucunuzu işletmek için başa baş noktası hesabı değil. Geçerli bir yerel karşılaştırma için düğümün saatlik fiyatı, sürdürülebilir saniye başına token hızı, kullanım oranı, elektrik, depolama, mühendislik zamanı ve başarısız ya da tekrarlanan ajan çalıştırmalarını hesaba katmanız gerekir. Fiyatlandırmanın katmanlarını açıklayan bir rehber için AIReiter’ın GLM-5.3-Flash API fiyatlandırma rehberine bakabilirsiniz.
Karar özeti şöyle:
- Amiral gemisi modele ihtiyacınız varsa, ancak talep düzensiz veya orta seviyedeyse barındırılan GLM-5.3 API’yi seçin.
- Daha düşük token maliyeti, çok modlu girdi veya daha küçük bir self-hosting hedefi amiral gemisi kapasitesinden önemliyse GLM-5.3-Flash’ı seçin.
- Gizlilik, kontrol veya sürekli yüksek kullanım sekiz GPU’lu kurulumu haklı çıkarıyorsa self-hosted amiral gemisi GLM-5.3’ü seçin.
GLM-5.3 donanım gereksinimleri SSS
GLM-5.3 tek bir RTX 4090, RTX 5090 veya 24 GB GPU’da çalışır mı?
Hayır, tam model olarak çalışmaz. Güncel yerel FP8 deposunda yaklaşık 756 GB safetensors dosyası bulunuyor. Bu nedenle 24 GB’lık bir kart, modeli normal sunum için taşımak yerine ancak aşırı bir offload veya kuantizasyon deneyine katılabilir.
128 GB veya 192 GB RAM yeterli mi?
Amiral gemisi modelinin yerel FP8 dağıtımı için yeterli değil. Doğrulanmış Flash profili iki ayrı 96 GB GPU, sabitlenmiş bir 4-bpw checkpoint’i ve ek depolama kullanıyor. Bu yapı, 192 GB belleğe sahip bir dizüstü bilgisayarla veya birleşik belleğe sahip bir iş istasyonuyla aynı şey değil.
GLM-5.3 ile GLM-5.3-Flash arasındaki fark ne?
Bunlar ayrı modeller. Amiral gemisi model kartında yaklaşık 753B toplam parametre raporlanırken, Z.ai, Flash’ı yerel çok modlu konumlandırmayla 320B toplam ve 18B aktif parametreye sahip bir model olarak tanımlıyor. Flash daha küçük ve daha ucuz, ancak 18B’lik bir masaüstü modeli değil; hâlâ sunucu sınıfında bir model.
Hangi hassasiyet seçilmeli?
Belgelenen sekiz GPU’lu topoloji elinizde varsa yerel FP8’i kullanın. Çok düğümlü bellek gereksinimi kabul edilebiliyorsa referans kalitesinde veya uzmanlaşmış değerlendirmeler için BF16 tercih edin. NVFP4’ü yalnızca desteklenen Blackwell donanımında değerlendirin ve listelenen NVFP4 checkpoint’inin orijinal varsayılan paket değil, topluluk tarafından yeniden kuantize edilmiş bir sürüm olduğunu unutmayın.
GLM-5.3’ü bir kodlama ajanına bağlayabilir miyim?
Evet. Resmî vLLM tarifi, OpenAI uyumlu bir uç noktanın yanı sıra araç çağrısı ve akıl yürütme ayrıştırıcılarını etkinleştiriyor. Bu arayüzü destekleyen istemciler, sunucuyu doğruladıktan sonra bağlanabilir. Ancak başarılı bir sohbet tamamlama yanıtının ajan uyumluluğunu kanıtladığını varsaymayın; kullandığınız harness’i, araç şemasını ve uzun oturum davranışını ayrıca test edin.
Sırada ne var?
Masaüstü veya 192 GB’ın altındaki bir ana makine için önce barındırılan API’yi deneyin. Temsili bir iş yüküyle belgelenen sekiz GPU’lu topolojiyi kiralayın ya da Flash’ı yüksek bellekli çok GPU’lu bir makinede değerlendirin. Self-hosting kararını ise kontrol ve gizlilik avantajlarının altyapı maliyetini haklı çıkardığını ölçümler gösterdikten sonra verin.