AIREITER
API DOKÜMANLARIFİYATLANDIRMA
ŞABLONLAR
  • AIReiter
  • Blog
  • Iris Search Agent İncelemesi: Pro Yerine Mini ile Başlayın

Iris Search Agent İncelemesi: Pro Yerine Mini ile Başlayın

Son Güncelleme: 2026-09-14 18:54:33

Iris'in açık ağırlıklı arama ajanları arasında güçlü bir aday olduğu açık, ancak burada bakılması gereken asıl sayı 88.6 değil. Iris-mini'de yalnızca bağlam yönetimini değiştirerek elde edilen 17.5 puanlık BrowseComp farkı, sistemin ne kadar belirleyici olduğunu gösteriyor. İlk denemeyi Iris-mini ve resmi harness ile yapın; Iris-pro ise çok düğümlü çıkarım altyapısını zaten işleten ekipler için daha mantıklı.

Tek tabloda Iris seçimi

Iris Search Agent için pratik öneri net: önce Iris-mini'yi değerlendirin. Iris-pro daha yüksek skorlar bildiriyor, fakat resmi başlangıç örneği çok daha geniş paralel altyapı gerektiriyor. Ayrıca 14 Eylül 2026 itibarıyla iki checkpoint için de barındırılan bir Hugging Face çıkarım sağlayıcısı bulunmuyor.

SoruIris-miniIris-pro
Temel modelQwen3.6-35B-A3BQwen3.5-397B-A17B
Toplam / etkin parametre35B / 3B397B / 17B
Bağlam penceresi256K256K
Resmi SGLang örneğiTP 4TP 8 + EP 8
BrowseComp, discard-all82.288.6
DeepSearchQA, discard-all86.992.9
LisansApache 2.0Apache 2.0
Barındırılan HF sağlayıcısıYokYok
En uygun kullanımTekrarlama, araştırma pilotları, harness geliştirmeGüçlü altyapıya sahip araştırma laboratuvarları

Kaynaklar: resmi Iris-mini model kartı, Iris-pro model kartı ve Iris deposu.

Ağırlıklar, model kartları ve Iris-Harness değerlendirme kodu herkese açık. Depoda veri oluşturma ve eğitim süreçleri için hâlâ “coming soon” ifadesi yer alıyor. Dolayısıyla Iris, açık değerlendirme harness'ine sahip açık ağırlıklı bir sürüm; henüz eksiksiz yayımlanmış bir eğitim tarifi değil.

Harness değişince benchmark manşeti de değişiyor

Iris benchmark skorlarını yalnızca checkpoint'lerin özelliği gibi okumak doğru değil. AllSpark, yayımlanan bir sonucun ajana ve onun harness'ine ait olduğunu açıkça belirtiyor; resmi ablation sonuçları da bunun nedenini gösteriyor.

Model ve ayarBrowseCompBrowseComp-ZHDeepSearchQAHLE
Iris-mini, yönetim yok64.772.381.043.2
Iris-mini, discard-all82.284.886.952.3
Iris-mini, discard-all + retry85.985.189.952.4
Iris-pro, yönetim yok72.676.886.450.8
Iris-pro, discard-all88.685.192.956.4
Iris-pro, discard-all + retry90.385.193.456.6

Resmi Iris GitHub README dosyasında discard-all, biriken bağlam belirli eşiği aştığında ajanın başlangıçtaki soruya dönmesi olarak tanımlanıyor. retry ise ayrıştırılabilir bir yanıt üretmeden sonlanan bölümü, elenen seçeneklerin kısa özeti korunarak yeniden başlatıyor.

Iris-mini'de discard-all, checkpoint değişmeden BrowseComp skorunu 64.7'den 82.2'ye çıkarıyor: yani 17.5 puan. Iris-pro tarafında aynı karşılaştırma 72.6'dan 88.6'ya, başka bir deyişle 16 puana ulaşıyor. Resmi konuşma biçimini, sıfırlama politikasını, arama araçlarını veya yanıt ayrıştırıcısını kullanmayan bir kurulum, duyurulan sistemi yeniden üretmiş sayılmaz.

Ana modeller arası tablolara da temkinli yaklaşmak gerekiyor. AllSpark, temel karşılaştırma değerlerinin her projenin herkese açık raporundan alındığını ve farklı bağlam yönetimi yapılandırmaları kullanmış olabileceklerini belirtiyor. Iris-mini, listelenen boyut sınıfında BrowseComp, BrowseComp-ZH ve HLE'de önde; ancak DeepSearchQA'da XYZ-Aquila-mini 89.5'e karşı 86.9 ile hâlâ lider. Iris-pro ise listelenen yaklaşık 400B'lik sistemlerde dört sütunun tamamında lider ya da ortak lider; fakat DeepSearchQA'da XYZ-Aquila-pro karşısındaki farkı yalnızca 0.4 puan.

Iris-mini mi, Iris-pro mu? Kararı altyapı yükü versin

İlk checkpoint olarak Iris-mini daha mantıklı, çünkü etkin parametre sayısı toplam modelin depolama ve bellek gereksinimini ortadan kaldırmıyor. MoE yönlendiricisi her adımda 35B parametrenin yaklaşık 3B'sini etkinleştiriyor; ancak tüm checkpoint'in yine de depolanması ve sunulması gerekiyor.

Resmi Iris-mini komutu dört yönlü tensor paralelliği ve 262,144 tokenlık bağlam kullanıyor:

python -m sglang.launch_server \
  --model-path AllSpark-Research/Iris-mini \
  --served-model-name Iris-mini \
  --port 21234 --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

Iris-pro için belgelenen yapılandırma --tp-size 8 --ep-size 8 kullanıyor. Resmi model kartı, 397B checkpoint'in birden fazla düğüm ya da büyük bir tek düğüm gerektirdiğini söylüyor. Bu, küçük bir yapılandırma farkı değil; doğrudan bir dağıtım uyarısı.

discard-all altında büyük model, mini sürüme göre BrowseComp'ta 6.4, DeepSearchQA'da ise 6.0 puan kazanıyor; BrowseComp-ZH farkıysa yalnızca 0.3 puan. Ekipler, sırf “pro” daha büyük diye altyapı sıçramasını kabul etmemeli. Bu artışın, değerlendirilen iş yükünde gerçekten karşılığı olmalı.

İki model kartında da ölçülmüş gecikme, çıktı hızı, VRAM kullanımı veya işletim maliyeti paylaşılmıyor. Bu eksikler, yanıt başına maliyet için sorumlu bir karşılaştırma yapmayı engelliyor. Parametre sayılarından hayali GPU tahminleri üretmek yerine sınırlı kapsamlı bir pilot çalıştırın.

Tekrarlanabilir ilk Iris değerlendirmesi

İlk Iris değerlendirmesi, chat-completions uç noktasına basit bilgi soruları göndermekten ibaret olmamalı; ajan akışının tamamı test edilmeli. Resmi harness; ajan döngüsünü, arama ve sayfa tarama araçlarını, bağlam stratejilerini, benchmark adaptörlerini ve değerlendiricileri içeriyor.

  1. Iris-mini'yi resmi ayrıştırıcılarla sunun. Yukarıdaki SGLang komutunu kullanın ve OpenAI uyumlu uç noktanın 21234 numaralı bağlantı noktasında erişilebilir olduğunu doğrulayın.
  2. Iris-Harness'ı kurun. Depo, ortam oluşturmak için uv kullanıyor.
  3. Benchmark verisini hazırlayın. Rastgele oluşturulmuş bir kopya yerine paketteki hazırlama betiğini çalıştırın.
  4. Dar bir benchmark dilimiyle başlayın. Resmi örnekte browsecomp:0:1 seçiliyor ve 131,072 tokenlık discard eşiği kullanılıyor.
  5. Tam yapılandırmayı kaydedin. Model revizyonunu, araç arka ucunu, eşiği, ayrıştırıcı sürümlerini ve retry politikasını her sonucun yanında saklayın.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py

bash scripts/run_eval.sh \
  --base-url http://127.0.0.1:21234/v1 \
  --llm-config iris-mini \
  --benchmarks "browsecomp:0:1" \
  --context-discard-threshold 131072

Iris, OpenAI function-calling arayüzünü kullanmak ve nihai yanıtları \boxed{} içine almak üzere eğitilmiş. Harness ayrıca önceki muhakemeyi sonraki turlara taşıyor. Bu protokolü genel amaçlı bir sohbet şablonuyla değiştirmek, sıradan metin üretimi normal görünse bile araç kullanımını veya değerlendirmeyi bozabilir.

Pilot için üç kabul kontrolü kullanın:

  • Yanıt kalitesi: Ajan, yalnızca nihai varlığı tahmin etmek yerine gerekli kanıta ulaşabiliyor mu?
  • Arama verimliliği: Kabul edilen her yanıt için kaç arama ve sayfa tarama çağrısı tüketiliyor?
  • Toparlanma davranışı: Bağlam silindiğinde veya bir bölüm yeniden denendiğinde ajan aynı başarısız yolu tekrar etmekten kaçınıyor mu?

Resmi sürüm herhangi bir üretim SLA'sı ya da barındırılan uç nokta sunmuyor. Bir benchmark'ın başarıyla yeniden üretilmesi, sistemin bilinen bir harness altında çalıştığını gösterir; sınırsız web araştırmasındaki güvenilirliğini göstermez.

Yayımlananlar ve tam yeniden üretimin önündeki eksikler

Mevcut Iris sürümü kapsamlı, fakat tamamlanmış değil. Geliştiriciler iki checkpoint'i de onay süreci olmadan indirebilir, Apache 2.0 altında ticari olarak kullanabilir, benchmark tablolarını inceleyebilir ve Iris-Harness'ı OpenAI uyumlu bir uç noktaya karşı çalıştırabilir.

Şu anda erişilebilirDepoda henüz yayımlanmayanlar
Iris-mini ve Iris-pro ağırlıklarıEksiksiz veri oluşturma süreci
Model yapılandırmaları ve sohbet şablonlarıEksiksiz eğitim süreci
Iris-Harness değerlendirme çerçevesiVeri kümesi boyutları ve karışım oranları
Arama, sayfa tarama, bağlam yönetimi ve değerlendirme koduTam yeniden üretim maliyeti
SGLang sunum örnekleriBağımsız üretim güvenilirliği çalışması

Makale; çok adımlı soruların bağlantı grafikleri üzerinden tersine kurulmasını, çalışma bütününde ve tek tek turlarda yörüngelerin filtrelenmesini, ayrıca denetimli ince ayarın canlı aramalı pekiştirmeli öğrenmeyle dönüşümlü uygulanmasını anlatıyor. Ancak deponun mevcut yayın durumu, dış ekiplerin eğitimi uçtan uca yeniden üretmeden önce çıkarımı ve değerlendirmeyi yeniden üretebileceği anlamına geliyor.

İlk topluluk tartışmaları da bu ayrımı yansıtıyor. Teknik haber hesabı sürümü şöyle özetledi:

“Weights + eval code are public. Training data and recipe come later.” — @Chinazhidx

Güven düzeyini burada tutmak doğru olur. Iris resmen yayımlandı, söylentiden ibaret değil; ancak en güçlü iddiaları, açıklanmış harness ayarlarıyla yapılacak bağımsız çalıştırmalarla hâlâ doğrulanmalı. Hugging Face sayfaları, 14 Eylül 2026 tarihinde kontrol edildiğinde Iris-mini için 335, Iris-pro için 685 aylık indirme gösteriyordu; indirme sayıları doğrulama değil, yalnızca etkinlik sinyalidir.

Iris Search Agent: Sık sorulan sorular

Iris bir model mi, eksiksiz bir arama ürünü mü?

Iris, açık ağırlıklı bir model ailesi ve bir değerlendirme harness'inden oluşuyor. Sürümde barındırılan tüketici odaklı bir arama uygulaması veya yönetilen API bulunmuyor.

Iris yerelde çalışabilir mi?

Evet, ancak “yerel” ifadesi dizüstü bilgisayarda rahatça çalışacağı anlamına gelmiyor. Resmi Iris-mini örneği dört yönlü tensor paralelliği kullanıyor; Iris-pro ise sekiz yönlü tensor ve sekiz yönlü expert paralelliği için belgelenmiş.

35B-A3B ne anlama geliyor?

Iris-mini yaklaşık 35B toplam parametreye ve her çıkarım adımında etkin olan 3B parametreye sahip. Seyrek etkinleştirme, tüm parametrelerin etkin olduğu duruma kıyasla hesaplama maliyetini azaltır; ancak tam checkpoint depolama ve sunum belleğini etkilemeye devam eder.

Iris tamamen açık kaynak mı?

Checkpoint'ler ve harness izin verici koşullarla herkese açık, ancak depoda veri oluşturma ve eğitim süreçleri hâlâ yakında gelecek olarak listeleniyor. Mevcut durum için en doğru tanım, “açık değerlendirme koduna sahip açık ağırlıklar” olur.

Iris'in bir API'si var mı?

Modeller, SGLang veya vLLM ile OpenAI uyumlu bir uç noktanın arkasında sunulabilir. Her iki model kartında da barındırılan bir Hugging Face çıkarım sağlayıcısı veya resmi yönetilen Iris API'si listelenmiyor.

Hangi Iris modelini kullanmalıyım?

Ölçülmüş iş yükü Iris-pro'nun ek benchmark performansını gerektirmedikçe ve ekipte uygun çok düğümlü ya da büyük düğümlü altyapı zaten bulunmadıkça, değerlendirme için Iris-mini kullanın.

Sıradaki adım: sabit bir harness ile mini pilotu

Iris-mini'yi indirin, resmi araç ve ayrıştırıcı protokolünü koruyun, ardından hedeflenen iş yüküne benzeyen küçük bir soru setiyle benchmark çalıştırın. Sonuçları karşılaştırmadan önce bağlam politikasını sabitleyin; çünkü discard-all veya retry ayarını değiştirmek, modelleri değiştirmekten daha büyük skor farkı yaratabilir.

Yalnızca pilot çalışma, dağıtım yükünü haklı çıkaracak bir kalite farkı tespit ederse Iris-pro'ya geçin. Açıkta kalan denge basit: Iris, açık ağırlıklı arama performansında alışılmadık derecede güçlü raporlanmış sonuçlar sunuyor; ancak tekrarlanabilir eğitim ayrıntıları ve üretim maliyetine ilişkin kanıtlar henüz mevcut değil.

>_AIReiter Model Dizini

Bu rehberle ilgili modellere hızlı API erişimi

Claude Opus 5

Chat

Karmaşık muhakeme, kodlama ve uzun bağlamlı profesyonel işler için premium bir Claude modeli.

AnthropicAPI Key oluştur >

Claude Fable 5

Chat

Derin muhakeme ve karmaşık uzun biçimli çalışmalar için premium bir Claude modeli.

AnthropicAPI Key oluştur >

Claude Fable 5.1

Chat

Uzun vadeli kodlama, araştırma ve bilgi çalışmaları için Mythos sınıfı model.

AnthropicAPI Key oluştur >

Claude Opus 4.8

Chat

Zorlu akıl yürütme ve profesyonel işler için yüksek yetenekli bir Claude modeli.

AnthropicAPI Key oluştur >

Claude Sonnet 5

Chat

İleri düzey muhakeme, kodlama ve günlük işler için dengeli bir Claude modeli.

AnthropicAPI Key oluştur >

Son yazılar

Rol Yapma İçin En İyi Yapay Zekâ Modeli: Tutarlılık, Hafıza ve API Erişimi

2026-09-15

Kling 3.0 API: Geçiş Rehberi, Hareket Kontrolü ve Kod

2026-09-15

Higgsfield ve Artlist karşılaştırması: Maliyet, lisans ve iş akışı

2026-09-14

Ücretsiz LLM API Anahtarı: 8 Kayıt Yolu ve Limitler (2026)

2026-09-13
AIREITER

Sorularınız mı var? Bize ulaşın
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

AI Video

AI Görsel

Blog

Tümünü Görüntüle →

Şirket

Gizlilik PolitikasıHizmet Şartlarıİade Politikası

© 2026 AIReiter. Tüm hakları saklıdır.