Iris 看起來是相當強勢的開放權重搜尋代理,但最該注意的數字不是 88.6,而是 Iris-mini 只改變上下文處理方式,BrowseComp 就能拉開 17.5 分的差距。建議先用 Iris-mini 搭配官方 harness 驗證;只有已具備多節點推論能力的團隊,才適合考慮 Iris-pro。
先看這張表:Iris 該怎麼選
實務上的建議很明確:先評估 Iris-mini。Iris-pro 的公布成績確實較高,但官方啟動範例需要多得多的平行運算基礎設施;而截至 2026 年 9 月 14 日,兩個 checkpoint 都沒有可用的託管 Hugging Face 推論供應商。
| 問題 | Iris-mini | Iris-pro |
|---|---|---|
| 基礎模型 | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| 總參數 / 活躍參數 | 35B / 3B | 397B / 17B |
| 上下文視窗 | 256K | 256K |
| 官方 SGLang 範例 | TP 4 | TP 8 + EP 8 |
BrowseComp,discard-all | 82.2 | 88.6 |
DeepSearchQA,discard-all | 86.9 | 92.9 |
| 授權 | Apache 2.0 | Apache 2.0 |
| 託管 HF 供應商 | 無 | 無 |
| 適合用途 | 重現實驗、研究試點、harness 開發 | 設備完善的研究實驗室 |
資料來源:官方 Iris-mini model card、Iris-pro model card 與 Iris repository。
權重、model card 與 Iris-Harness 評估程式碼均已公開。不過,repository 仍標示資料建構與訓練流程為「coming soon」。因此,Iris 是開放權重、具備開放評估 harness 的發布,還不能算是完整公開的訓練配方。
換了 harness,基準測試的標題數字就變了
Iris 的基準分數不能只當成 checkpoint 本身的屬性。AllSpark 明確表示,公開數字屬於代理系統及其 harness 的共同結果;官方消融實驗也直接說明了原因。
| 模型與設定 | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini,無管理機制 | 64.7 | 72.3 | 81.0 | 43.2 |
Iris-mini,discard-all | 82.2 | 84.8 | 86.9 | 52.3 |
Iris-mini,discard-all + retry | 85.9 | 85.1 | 89.9 | 52.4 |
| Iris-pro,無管理機制 | 72.6 | 76.8 | 86.4 | 50.8 |
Iris-pro,discard-all | 88.6 | 85.1 | 92.9 | 56.4 |
Iris-pro,discard-all + retry | 90.3 | 85.1 | 93.4 | 56.6 |
官方 Iris GitHub README 將 discard-all 定義為:當累積上下文超過門檻時,將對話重設回原始問題。retry 則會在單次任務結束卻未產生可解析答案時,重新啟動該回合,並保留一段簡短摘要,記錄已被排除的方向。
對 Iris-mini 而言,啟用 discard-all 後,BrowseComp 從 64.7 升至 82.2——在不更換 checkpoint 的前提下增加了 17.5 分。Iris-pro 的同項比較則由 72.6 升至 88.6,增加 16 分。若部署時省略官方對話格式、重設政策、搜尋工具或答案解析器,就不是在重現官方宣稱的系統。
跨模型的主要比較表也要審慎解讀。AllSpark 表示,基線數值來自各專案公開報告,可能採用了不同的上下文管理配置。Iris-mini 在所列同級模型中,於 BrowseComp、BrowseComp-ZH 與 HLE 領先;但 DeepSearchQA 仍由 XYZ-Aquila-mini 領先,分數是 89.5 比 86.9。Iris-pro 在列出的約 400B 級系統中,四個欄位都領先或並列第一;不過,它在 DeepSearchQA 對 XYZ-Aquila-pro 的優勢只有 0.4 分。
Iris-mini 還是 Iris-pro?先衡量部署成本
Iris-mini 是更合理的第一個 checkpoint,因為活躍參數較少,並不能抹去整體模型在儲存與記憶體上的需求。MoE router 每一步約啟用 35B 參數中的 3B,但完整 checkpoint 仍必須被儲存並提供服務。
官方 Iris-mini 指令採用四路 tensor parallelism,並設定 262,144-token 的上下文:
python -m sglang.launch_server \
--model-path AllSpark-Research/Iris-mini \
--served-model-name Iris-mini \
--port 21234 --tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
Iris-pro 文件中的配置使用 --tp-size 8 --ep-size 8。其 official model card 指出,397B checkpoint 需要多個節點,或是一台規格很高的大型單節點機器。這是部署門檻的警訊,不只是小幅設定差異。
在 discard-all 設定下,大型模型在 BrowseComp 比 mini 多 6.4 分,在 DeepSearchQA 多 6.0 分,但 BrowseComp-ZH 只多 0.3 分。團隊不該只因為「pro」較大,就接受基礎設施的大幅升級;增益必須對正在評估的工作負載有實際價值。
兩張 model card 都沒有公布實測延遲、吞吐量、VRAM 使用量或營運成本。缺少這些資訊,就無法負責任地比較每個答案的成本。與其從參數量推導臆測的 GPU 需求,不如先進行範圍受控的試點。
第一次評估 Iris,照這套可重現流程做
第一次評估 Iris,應該測試完整的代理執行路徑,而不是把冷知識問題丟進 chat-completions endpoint。官方 harness 已包含代理迴圈、搜尋與爬取工具、上下文策略、基準測試 adapter 與 grader。
- 以官方 parser 部署 Iris-mini。 使用上方的 SGLang 指令,確認 port 21234 上的 OpenAI-compatible endpoint 可正常連線。
- 安裝 Iris-Harness。 repository 使用
uv建立環境。 - 準備基準資料。 請執行內附的準備腳本,不要自行拼湊臨時資料副本。
- 先跑一小段基準資料。 官方範例選用
browsecomp:0:1,並設定 131,072-token 的 discard 門檻。 - 完整記錄配置。 每筆結果旁都應保留模型 revision、工具後端、門檻值、parser 版本與 retry 政策。
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py
bash scripts/run_eval.sh \
--base-url http://127.0.0.1:21234/v1 \
--llm-config iris-mini \
--benchmarks "browsecomp:0:1" \
--context-discard-threshold 131072
Iris 受訓時使用 OpenAI function-calling 介面,並以 \boxed{} 包住最終答案。harness 也會把先前的推理內容帶入後續回合。即使一般文字生成看似正常,若改用通用 chat template,工具使用或評分仍可能失效。
試點可採用三項驗收檢查:
- 答案品質:代理是否找回所需證據,而不只是猜中最終實體?
- 搜尋效率:每個被接受的答案,消耗了多少次搜尋與爬取呼叫?
- 復原能力:上下文被捨棄或任務重試後,代理能否避免重複走上同一條失敗路徑?
官方發布未提供 production SLA,也沒有託管 endpoint。成功重現基準分數,只能證明系統可在已知 harness 下運作,不能證明它在不受限制的網路研究場景中具備可靠性。
已公開的內容,以及仍無法完整重現的部分
目前的 Iris 發布內容不少,但仍不完整。開發者可免審核下載兩個 checkpoint,依 Apache 2.0 進行商業使用,查看基準表格,並透過 OpenAI-compatible endpoint 執行 Iris-Harness。
| 目前可取得 | repository 尚未公開 |
|---|---|
| Iris-mini 與 Iris-pro 權重 | 完整資料建構流程 |
| 模型配置與 chat template | 完整訓練流程 |
| Iris-Harness 評估框架 | 資料集規模與混合比例 |
| 搜尋、爬取、上下文管理與評分程式碼 | 完整重現成本 |
| SGLang 部署範例 | 獨立的生產可靠性研究 |
論文描述了如何從超連結圖反向建構多跳問題、在整段軌跡與個別回合層級篩選資料,以及交替進行 supervised fine-tuning 與即時搜尋 reinforcement learning。然而,依照 repository 目前的發布狀態,外部團隊能先重現推論與評估,還無法端到端重現訓練流程。
早期社群討論也反映了這項差異。一個技術新聞帳號如此概括這次發布:
「權重與 eval code 已公開。訓練資料與配方之後才會推出。」— @Chinazhidx
這是合適的信心程度。Iris 是正式發布,不是傳聞;但它最強的主張,仍須等待外部團隊在公開 harness 設定下實際執行驗證。2026 年 9 月 14 日查詢時,Hugging Face 頁面顯示 Iris-mini 每月下載數為 335,Iris-pro 為 685;下載數只能反映活躍度,不能視為驗證結果。
Iris Search Agent 常見問題
Iris 是模型,還是完整的搜尋產品?
Iris 是一個開放權重模型家族,加上一套評估 harness。這次發布不含託管的消費者搜尋應用程式,也沒有受管理的 API。
Iris 可以在本地執行嗎?
可以,但「本地」不代表筆電也能輕鬆跑。官方 Iris-mini 範例使用四路 tensor parallelism;Iris-pro 文件則採用八路 tensor 與八路 expert parallelism。
35B-A3B 代表什麼?
Iris-mini 約有 35B 總參數,每個推論步驟會啟用 3B 參數。稀疏啟用可降低相較於啟用全部參數的運算量,但完整 checkpoint 仍會影響儲存需求與服務記憶體。
Iris 算是完全開源嗎?
checkpoint 與 harness 已在寬鬆條款下公開,但 repository 仍將資料建構與訓練流程列為即將推出。目前最精確的描述是「開放權重,附帶開放評估程式碼」。
Iris 有 API 嗎?
模型可透過 SGLang 或 vLLM,部署在 OpenAI-compatible endpoint 後方。兩張 model card 均未列出託管 Hugging Face 推論供應商或官方受管理的 Iris API。
該用哪一個 Iris 模型?
除非實測工作負載顯示確實需要 Iris-pro 額外的基準效能,而且團隊已有合適的多節點或大型單節點基礎設施,否則應使用 Iris-mini 進行評估。
下一步:用固定 harness 試跑 mini
下載 Iris-mini,保留官方工具與 parser 協定,並以一小組貼近預定工作負載的問題進行測試。比較結果前,先固定上下文政策,因為調整 discard-all 或 retry 帶來的分數變動,可能比更換模型還大。
只有當試點發現的品質落差值得承擔部署成本時,才應轉向 Iris-pro。尚未解開的取捨很直接:Iris 展現了異常強勁的開放權重搜尋效能,但可重現的訓練細節與生產成本證據,目前都還未提供。