看 Iris,别只盯着 88.6 这个分数。更值得重视的是,Iris-mini 仅因调整上下文处理方式,BrowseComp 成绩就能相差 17.5 分。因此,更务实的起点是 Iris-mini 加官方 Harness;Iris-pro 则更适合已经具备多节点推理能力的团队。
一张表看清 Iris 该怎么选
对多数团队来说,Iris Search Agent 的选择并不复杂:先评估 Iris-mini。Iris-pro 的公开成绩更高,但官方启动示例所需的并行基础设施也高出许多;截至 2026 年 9 月 14 日,两个检查点都没有可用的托管 Hugging Face 推理服务商。
| 问题 | Iris-mini | Iris-pro |
|---|---|---|
| 基础模型 | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| 总参数量 / 激活参数量 | 35B / 3B | 397B / 17B |
| 上下文窗口 | 256K | 256K |
| 官方 SGLang 示例 | TP 4 | TP 8 + EP 8 |
BrowseComp,discard-all | 82.2 | 88.6 |
DeepSearchQA,discard-all | 86.9 | 92.9 |
| 许可证 | Apache 2.0 | Apache 2.0 |
| 托管 HF 服务商 | 无 | 无 |
| 适用场景 | 复现、研究试点、Harness 开发 | 基础设施充足的研究实验室 |
来源:官方 Iris-mini 模型卡、Iris-pro 模型卡及 Iris 仓库。
权重、模型卡和 Iris-Harness 评测代码均已公开。不过,仓库仍标注数据构建与训练流水线“coming soon”。换句话说,Iris 目前是开放权重、开放评测 Harness 的项目,还不是一套完整公开的训练方案。
换一套 Harness,基准分数就变了
Iris 的基准成绩不能被视为检查点本身的固有属性。AllSpark 明确表示,公开分数属于智能体与其 Harness 的组合;官方消融实验也直观说明了这一点。
| 模型与设置 | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini,不做管理 | 64.7 | 72.3 | 81.0 | 43.2 |
Iris-mini,discard-all | 82.2 | 84.8 | 86.9 | 52.3 |
Iris-mini,discard-all + retry | 85.9 | 85.1 | 89.9 | 52.4 |
| Iris-pro,不做管理 | 72.6 | 76.8 | 86.4 | 50.8 |
Iris-pro,discard-all | 88.6 | 85.1 | 92.9 | 56.4 |
Iris-pro,discard-all + retry | 90.3 | 85.1 | 93.4 | 56.6 |
官方 Iris GitHub README 对 discard-all 的定义是:运行中的上下文超过阈值后,重置回原始问题。retry 则会在一个回合因无法解析答案而结束时重启该回合,同时保留一份简短摘要,说明已被排除的方向。
对 Iris-mini 而言,仅启用 discard-all,BrowseComp 就从 64.7 升至 82.2,增加 17.5 分,检查点本身完全没变。Iris-pro 在相同对比下从 72.6 提升至 88.6,增幅为 16 分。如果部署时没有沿用官方对话格式、重置策略、搜索工具或答案解析器,那就不是在复现其宣传中的系统。
横向对比表同样需要谨慎解读。AllSpark 表示,基线数值来自各项目公开报告,采用的上下文管理配置可能不同。Iris-mini 在所列同级别模型中领跑 BrowseComp、BrowseComp-ZH 和 HLE,但在 DeepSearchQA 上仍落后于 XYZ-Aquila-mini,分别为 86.9 和 89.5。Iris-pro 在列出的约 400B 级系统中,在四项指标上领先或并列领先,不过它相对 XYZ-Aquila-pro 在 DeepSearchQA 上的优势仅有 0.4 分。
Iris-mini 还是 Iris-pro:先看部署成本
Iris-mini 是更合理的首个检查点,因为激活参数量较少,并不代表可以忽略完整模型的存储与显存需求。MoE 路由每一步大约只激活 35B 参数中的 3B,但完整检查点仍要存储并在线服务。
官方 Iris-mini 命令使用四路张量并行,并配置了 262,144 token 的上下文:
python -m sglang.launch_server \
--model-path AllSpark-Research/Iris-mini \
--served-model-name Iris-mini \
--port 21234 --tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
Iris-pro 的文档配置为 --tp-size 8 --ep-size 8。其官方模型卡指出,397B 检查点需要多节点或一台大型单节点机器。这不是小小的配置差异,而是明确的部署门槛提示。
在 discard-all 设置下,大模型相对 mini 在 BrowseComp 上高 6.4 分、在 DeepSearchQA 上高 6.0 分,但 BrowseComp-ZH 仅高 0.3 分。团队不该只因“pro”更大就接受基础设施的大幅升级;增益必须能在实际评估的工作负载中体现价值。
两张模型卡都没有公布实测延迟、吞吐量、VRAM 占用或运行成本。缺少这些数据,就无法负责任地比较单个答案的成本。与其根据参数量臆测 GPU 配置,不如先跑一次范围受控的试点。
如何做一次可复现的 Iris 初步评估
第一次评估 Iris,应测试完整的智能体链路,而不是把简单问答发到 chat-completions 端点。官方 Harness 包含智能体循环、搜索与抓取工具、上下文策略、基准适配器和评分器。
- 用官方解析器部署 Iris-mini。使用上方的 SGLang 命令,并确认端口 21234 上的 OpenAI 兼容端点可访问。
- 安装 Iris-Harness。该仓库使用
uv创建环境。 - 准备基准数据。运行内置的数据准备脚本,不要自行拼凑临时副本。
- 先从小范围基准开始。官方示例选择
browsecomp:0:1,并将丢弃阈值设为 131,072 token。 - 记录完整配置。每一组结果都应同时记录模型修订版本、工具后端、阈值、解析器版本和重试策略。
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py
bash scripts/run_eval.sh \
--base-url http://127.0.0.1:21234/v1 \
--llm-config iris-mini \
--benchmarks "browsecomp:0:1" \
--context-discard-threshold 131072
Iris 训练时使用 OpenAI function-calling 接口,并要求将最终答案包在 \boxed{} 中。Harness 还会把此前的推理内容带入后续轮次。若用通用聊天模板替换这一协议,即使普通文本生成看起来正常,工具调用或评分仍可能失效。
试点阶段可采用三项验收检查:
- 答案质量:智能体是否找回了所需证据,而不是仅仅猜对最终实体?
- 搜索效率:每个被接受的答案平均消耗多少次搜索和抓取调用?
- 恢复表现:上下文被丢弃或回合重试后,智能体能否避免重复走上同一条失败路径?
官方发布没有提供生产 SLA,也没有托管端点。成功复现基准成绩,只能证明系统能在已知 Harness 下运行;这并不等于它已在不受限制的 Web 研究任务中具备可靠性。
哪些已经开放,哪些仍无法完整复现
目前的 Iris 发布内容颇为充实,但仍不完整。开发者可以无需审批下载两个检查点,依据 Apache 2.0 将其用于商业用途,查看基准表,并通过 OpenAI 兼容端点运行 Iris-Harness。
| 现已提供 | 仓库尚未公开 |
|---|---|
| Iris-mini 和 Iris-pro 权重 | 完整的数据构建流水线 |
| 模型配置与聊天模板 | 完整训练流水线 |
| Iris-Harness 评测框架 | 数据集规模与混合比例 |
| 搜索、抓取、上下文管理与评分代码 | 完整复现成本 |
| SGLang 服务示例 | 独立的生产可靠性研究 |
论文介绍了从超链接图中逆向构造多跳问题、在完整运行轨迹和单轮两个层面进行筛选,以及交替进行监督微调和实时搜索强化学习的方法。不过,从仓库当前的发布状态来看,外部团队可以先复现推理与评估,却还无法端到端复现训练。
早期社区讨论也准确地区分了两者。一位技术新闻账号这样概括这次发布:
“Weights + eval code are public. Training data and recipe come later.” — @Chinazhidx
这正是合适的判断尺度。Iris 是正式发布的项目,并非传闻;但其最强的性能主张仍需由外部团队在公开 Harness 设置下复跑验证。2026 年 9 月 14 日查询时,Hugging Face 页面显示 Iris-mini 月下载量为 335,Iris-pro 为 685;下载量只能反映活跃度,不能作为验证依据。
Iris Search Agent 常见问题
Iris 是模型,还是完整的搜索产品?
Iris 是一个开放权重模型家族,加上一套评测 Harness。此次发布不包含面向消费者的托管搜索应用,也没有托管 API。
Iris 能在本地运行吗?
可以,但“本地”不等于笔记本友好。官方 Iris-mini 示例采用四路张量并行;Iris-pro 的文档则采用八路张量并行和八路专家并行。
35B-A3B 是什么意思?
Iris-mini 总参数量约为 35B,每个推理步骤激活约 3B 参数。稀疏激活降低了相对于全参数激活的计算量,但完整检查点仍会占用存储空间和服务显存。
Iris 是完全开源的吗?
检查点和 Harness 已在宽松条款下公开,但仓库仍将数据构建与训练流水线列为后续发布内容。目前最准确的描述是“开放权重,开放评测代码”。
Iris 有 API 吗?
可以通过 SGLang 或 vLLM 将模型部署在 OpenAI 兼容端点之后。两张模型卡均未列出托管 Hugging Face 推理服务商或官方托管 Iris API。
该选哪个 Iris 模型?
除非实测工作负载明确需要 Iris-pro 额外的基准性能,且团队已经具备适合的多节点或大型单节点基础设施,否则应使用 Iris-mini 进行评估。
下一步:用固定 Harness 试跑 mini
下载 Iris-mini,保留官方工具和解析器协议,然后用一小批接近目标工作负载的问题进行基准测试。比较结果前先固定上下文策略,因为改动 discard-all 或 retry 对分数的影响,可能比更换模型还大。
只有当试点明确发现质量缺口值得承担部署负担时,再迁移到 Iris-pro。尚未解决的取舍很直接:Iris 展现了异常强劲的公开权重搜索性能,但可复现的训练细节和生产成本证据目前仍未具备。