Iris'in açık ağırlıklı arama ajanları arasında güçlü bir aday olduğu açık, ancak burada bakılması gereken asıl sayı 88.6 değil. Iris-mini'de yalnızca bağlam yönetimini değiştirerek elde edilen 17.5 puanlık BrowseComp farkı, sistemin ne kadar belirleyici olduğunu gösteriyor. İlk denemeyi Iris-mini ve resmi harness ile yapın; Iris-pro ise çok düğümlü çıkarım altyapısını zaten işleten ekipler için daha mantıklı.
Tek tabloda Iris seçimi
Iris Search Agent için pratik öneri net: önce Iris-mini'yi değerlendirin. Iris-pro daha yüksek skorlar bildiriyor, fakat resmi başlangıç örneği çok daha geniş paralel altyapı gerektiriyor. Ayrıca 14 Eylül 2026 itibarıyla iki checkpoint için de barındırılan bir Hugging Face çıkarım sağlayıcısı bulunmuyor.
| Soru | Iris-mini | Iris-pro |
|---|---|---|
| Temel model | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| Toplam / etkin parametre | 35B / 3B | 397B / 17B |
| Bağlam penceresi | 256K | 256K |
| Resmi SGLang örneği | TP 4 | TP 8 + EP 8 |
BrowseComp, discard-all | 82.2 | 88.6 |
DeepSearchQA, discard-all | 86.9 | 92.9 |
| Lisans | Apache 2.0 | Apache 2.0 |
| Barındırılan HF sağlayıcısı | Yok | Yok |
| En uygun kullanım | Tekrarlama, araştırma pilotları, harness geliştirme | Güçlü altyapıya sahip araştırma laboratuvarları |
Kaynaklar: resmi Iris-mini model kartı, Iris-pro model kartı ve Iris deposu.
Ağırlıklar, model kartları ve Iris-Harness değerlendirme kodu herkese açık. Depoda veri oluşturma ve eğitim süreçleri için hâlâ “coming soon” ifadesi yer alıyor. Dolayısıyla Iris, açık değerlendirme harness'ine sahip açık ağırlıklı bir sürüm; henüz eksiksiz yayımlanmış bir eğitim tarifi değil.
Harness değişince benchmark manşeti de değişiyor
Iris benchmark skorlarını yalnızca checkpoint'lerin özelliği gibi okumak doğru değil. AllSpark, yayımlanan bir sonucun ajana ve onun harness'ine ait olduğunu açıkça belirtiyor; resmi ablation sonuçları da bunun nedenini gösteriyor.
| Model ve ayar | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini, yönetim yok | 64.7 | 72.3 | 81.0 | 43.2 |
Iris-mini, discard-all | 82.2 | 84.8 | 86.9 | 52.3 |
Iris-mini, discard-all + retry | 85.9 | 85.1 | 89.9 | 52.4 |
| Iris-pro, yönetim yok | 72.6 | 76.8 | 86.4 | 50.8 |
Iris-pro, discard-all | 88.6 | 85.1 | 92.9 | 56.4 |
Iris-pro, discard-all + retry | 90.3 | 85.1 | 93.4 | 56.6 |
Resmi Iris GitHub README dosyasında discard-all, biriken bağlam belirli eşiği aştığında ajanın başlangıçtaki soruya dönmesi olarak tanımlanıyor. retry ise ayrıştırılabilir bir yanıt üretmeden sonlanan bölümü, elenen seçeneklerin kısa özeti korunarak yeniden başlatıyor.
Iris-mini'de discard-all, checkpoint değişmeden BrowseComp skorunu 64.7'den 82.2'ye çıkarıyor: yani 17.5 puan. Iris-pro tarafında aynı karşılaştırma 72.6'dan 88.6'ya, başka bir deyişle 16 puana ulaşıyor. Resmi konuşma biçimini, sıfırlama politikasını, arama araçlarını veya yanıt ayrıştırıcısını kullanmayan bir kurulum, duyurulan sistemi yeniden üretmiş sayılmaz.
Ana modeller arası tablolara da temkinli yaklaşmak gerekiyor. AllSpark, temel karşılaştırma değerlerinin her projenin herkese açık raporundan alındığını ve farklı bağlam yönetimi yapılandırmaları kullanmış olabileceklerini belirtiyor. Iris-mini, listelenen boyut sınıfında BrowseComp, BrowseComp-ZH ve HLE'de önde; ancak DeepSearchQA'da XYZ-Aquila-mini 89.5'e karşı 86.9 ile hâlâ lider. Iris-pro ise listelenen yaklaşık 400B'lik sistemlerde dört sütunun tamamında lider ya da ortak lider; fakat DeepSearchQA'da XYZ-Aquila-pro karşısındaki farkı yalnızca 0.4 puan.
Iris-mini mi, Iris-pro mu? Kararı altyapı yükü versin
İlk checkpoint olarak Iris-mini daha mantıklı, çünkü etkin parametre sayısı toplam modelin depolama ve bellek gereksinimini ortadan kaldırmıyor. MoE yönlendiricisi her adımda 35B parametrenin yaklaşık 3B'sini etkinleştiriyor; ancak tüm checkpoint'in yine de depolanması ve sunulması gerekiyor.
Resmi Iris-mini komutu dört yönlü tensor paralelliği ve 262,144 tokenlık bağlam kullanıyor:
python -m sglang.launch_server \
--model-path AllSpark-Research/Iris-mini \
--served-model-name Iris-mini \
--port 21234 --tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
Iris-pro için belgelenen yapılandırma --tp-size 8 --ep-size 8 kullanıyor. Resmi model kartı, 397B checkpoint'in birden fazla düğüm ya da büyük bir tek düğüm gerektirdiğini söylüyor. Bu, küçük bir yapılandırma farkı değil; doğrudan bir dağıtım uyarısı.
discard-all altında büyük model, mini sürüme göre BrowseComp'ta 6.4, DeepSearchQA'da ise 6.0 puan kazanıyor; BrowseComp-ZH farkıysa yalnızca 0.3 puan. Ekipler, sırf “pro” daha büyük diye altyapı sıçramasını kabul etmemeli. Bu artışın, değerlendirilen iş yükünde gerçekten karşılığı olmalı.
İki model kartında da ölçülmüş gecikme, çıktı hızı, VRAM kullanımı veya işletim maliyeti paylaşılmıyor. Bu eksikler, yanıt başına maliyet için sorumlu bir karşılaştırma yapmayı engelliyor. Parametre sayılarından hayali GPU tahminleri üretmek yerine sınırlı kapsamlı bir pilot çalıştırın.
Tekrarlanabilir ilk Iris değerlendirmesi
İlk Iris değerlendirmesi, chat-completions uç noktasına basit bilgi soruları göndermekten ibaret olmamalı; ajan akışının tamamı test edilmeli. Resmi harness; ajan döngüsünü, arama ve sayfa tarama araçlarını, bağlam stratejilerini, benchmark adaptörlerini ve değerlendiricileri içeriyor.
- Iris-mini'yi resmi ayrıştırıcılarla sunun. Yukarıdaki SGLang komutunu kullanın ve OpenAI uyumlu uç noktanın 21234 numaralı bağlantı noktasında erişilebilir olduğunu doğrulayın.
- Iris-Harness'ı kurun. Depo, ortam oluşturmak için
uvkullanıyor. - Benchmark verisini hazırlayın. Rastgele oluşturulmuş bir kopya yerine paketteki hazırlama betiğini çalıştırın.
- Dar bir benchmark dilimiyle başlayın. Resmi örnekte
browsecomp:0:1seçiliyor ve 131,072 tokenlık discard eşiği kullanılıyor. - Tam yapılandırmayı kaydedin. Model revizyonunu, araç arka ucunu, eşiği, ayrıştırıcı sürümlerini ve retry politikasını her sonucun yanında saklayın.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py
bash scripts/run_eval.sh \
--base-url http://127.0.0.1:21234/v1 \
--llm-config iris-mini \
--benchmarks "browsecomp:0:1" \
--context-discard-threshold 131072
Iris, OpenAI function-calling arayüzünü kullanmak ve nihai yanıtları \boxed{} içine almak üzere eğitilmiş. Harness ayrıca önceki muhakemeyi sonraki turlara taşıyor. Bu protokolü genel amaçlı bir sohbet şablonuyla değiştirmek, sıradan metin üretimi normal görünse bile araç kullanımını veya değerlendirmeyi bozabilir.
Pilot için üç kabul kontrolü kullanın:
- Yanıt kalitesi: Ajan, yalnızca nihai varlığı tahmin etmek yerine gerekli kanıta ulaşabiliyor mu?
- Arama verimliliği: Kabul edilen her yanıt için kaç arama ve sayfa tarama çağrısı tüketiliyor?
- Toparlanma davranışı: Bağlam silindiğinde veya bir bölüm yeniden denendiğinde ajan aynı başarısız yolu tekrar etmekten kaçınıyor mu?
Resmi sürüm herhangi bir üretim SLA'sı ya da barındırılan uç nokta sunmuyor. Bir benchmark'ın başarıyla yeniden üretilmesi, sistemin bilinen bir harness altında çalıştığını gösterir; sınırsız web araştırmasındaki güvenilirliğini göstermez.
Yayımlananlar ve tam yeniden üretimin önündeki eksikler
Mevcut Iris sürümü kapsamlı, fakat tamamlanmış değil. Geliştiriciler iki checkpoint'i de onay süreci olmadan indirebilir, Apache 2.0 altında ticari olarak kullanabilir, benchmark tablolarını inceleyebilir ve Iris-Harness'ı OpenAI uyumlu bir uç noktaya karşı çalıştırabilir.
| Şu anda erişilebilir | Depoda henüz yayımlanmayanlar |
|---|---|
| Iris-mini ve Iris-pro ağırlıkları | Eksiksiz veri oluşturma süreci |
| Model yapılandırmaları ve sohbet şablonları | Eksiksiz eğitim süreci |
| Iris-Harness değerlendirme çerçevesi | Veri kümesi boyutları ve karışım oranları |
| Arama, sayfa tarama, bağlam yönetimi ve değerlendirme kodu | Tam yeniden üretim maliyeti |
| SGLang sunum örnekleri | Bağımsız üretim güvenilirliği çalışması |
Makale; çok adımlı soruların bağlantı grafikleri üzerinden tersine kurulmasını, çalışma bütününde ve tek tek turlarda yörüngelerin filtrelenmesini, ayrıca denetimli ince ayarın canlı aramalı pekiştirmeli öğrenmeyle dönüşümlü uygulanmasını anlatıyor. Ancak deponun mevcut yayın durumu, dış ekiplerin eğitimi uçtan uca yeniden üretmeden önce çıkarımı ve değerlendirmeyi yeniden üretebileceği anlamına geliyor.
İlk topluluk tartışmaları da bu ayrımı yansıtıyor. Teknik haber hesabı sürümü şöyle özetledi:
“Weights + eval code are public. Training data and recipe come later.” — @Chinazhidx
Güven düzeyini burada tutmak doğru olur. Iris resmen yayımlandı, söylentiden ibaret değil; ancak en güçlü iddiaları, açıklanmış harness ayarlarıyla yapılacak bağımsız çalıştırmalarla hâlâ doğrulanmalı. Hugging Face sayfaları, 14 Eylül 2026 tarihinde kontrol edildiğinde Iris-mini için 335, Iris-pro için 685 aylık indirme gösteriyordu; indirme sayıları doğrulama değil, yalnızca etkinlik sinyalidir.
Iris Search Agent: Sık sorulan sorular
Iris bir model mi, eksiksiz bir arama ürünü mü?
Iris, açık ağırlıklı bir model ailesi ve bir değerlendirme harness'inden oluşuyor. Sürümde barındırılan tüketici odaklı bir arama uygulaması veya yönetilen API bulunmuyor.
Iris yerelde çalışabilir mi?
Evet, ancak “yerel” ifadesi dizüstü bilgisayarda rahatça çalışacağı anlamına gelmiyor. Resmi Iris-mini örneği dört yönlü tensor paralelliği kullanıyor; Iris-pro ise sekiz yönlü tensor ve sekiz yönlü expert paralelliği için belgelenmiş.
35B-A3B ne anlama geliyor?
Iris-mini yaklaşık 35B toplam parametreye ve her çıkarım adımında etkin olan 3B parametreye sahip. Seyrek etkinleştirme, tüm parametrelerin etkin olduğu duruma kıyasla hesaplama maliyetini azaltır; ancak tam checkpoint depolama ve sunum belleğini etkilemeye devam eder.
Iris tamamen açık kaynak mı?
Checkpoint'ler ve harness izin verici koşullarla herkese açık, ancak depoda veri oluşturma ve eğitim süreçleri hâlâ yakında gelecek olarak listeleniyor. Mevcut durum için en doğru tanım, “açık değerlendirme koduna sahip açık ağırlıklar” olur.
Iris'in bir API'si var mı?
Modeller, SGLang veya vLLM ile OpenAI uyumlu bir uç noktanın arkasında sunulabilir. Her iki model kartında da barındırılan bir Hugging Face çıkarım sağlayıcısı veya resmi yönetilen Iris API'si listelenmiyor.
Hangi Iris modelini kullanmalıyım?
Ölçülmüş iş yükü Iris-pro'nun ek benchmark performansını gerektirmedikçe ve ekipte uygun çok düğümlü ya da büyük düğümlü altyapı zaten bulunmadıkça, değerlendirme için Iris-mini kullanın.
Sıradaki adım: sabit bir harness ile mini pilotu
Iris-mini'yi indirin, resmi araç ve ayrıştırıcı protokolünü koruyun, ardından hedeflenen iş yüküne benzeyen küçük bir soru setiyle benchmark çalıştırın. Sonuçları karşılaştırmadan önce bağlam politikasını sabitleyin; çünkü discard-all veya retry ayarını değiştirmek, modelleri değiştirmekten daha büyük skor farkı yaratabilir.
Yalnızca pilot çalışma, dağıtım yükünü haklı çıkaracak bir kalite farkı tespit ederse Iris-pro'ya geçin. Açıkta kalan denge basit: Iris, açık ağırlıklı arama performansında alışılmadık derecede güçlü raporlanmış sonuçlar sunuyor; ancak tekrarlanabilir eğitim ayrıntıları ve üretim maliyetine ilişkin kanıtlar henüz mevcut değil.