Iris si presenta come un solido search agent open-weight, ma il dato che conta davvero non è 88.6. È il salto di 17.5 punti su BrowseComp ottenuto modificando la gestione del contesto di Iris-mini. Il punto di partenza è Iris-mini con l'harness ufficiale; Iris-pro va preso in considerazione solo da team che gestiscono già inferenza multi-nodo.
La scelta tra i modelli Iris, a colpo d'occhio
Il consiglio operativo su Iris Search Agent è netto: valutare prima Iris-mini. Iris-pro dichiara risultati migliori, ma l'esempio di lancio ufficiale richiede molta più infrastruttura parallela; inoltre, al 14 settembre 2026 nessuno dei due checkpoint dispone di un provider di inferenza ospitato su Hugging Face.
| Domanda | Iris-mini | Iris-pro |
|---|---|---|
| Modello di base | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| Parametri totali / attivi | 35B / 3B | 397B / 17B |
| Finestra di contesto | 256K | 256K |
| Esempio SGLang ufficiale | TP 4 | TP 8 + EP 8 |
BrowseComp, discard-all | 82.2 | 88.6 |
DeepSearchQA, discard-all | 86.9 | 92.9 |
| Licenza | Apache 2.0 | Apache 2.0 |
| Provider HF ospitato | Nessuno | Nessuno |
| Ideale per | Riproduzione, progetti pilota di ricerca, sviluppo dell'harness | Laboratori di ricerca ben attrezzati |
Fonti: model card ufficiali di Iris-mini e Iris-pro, oltre al repository di Iris.
Pesi, model card e codice di valutazione Iris-Harness sono pubblici. Il repository indica ancora che le pipeline per la costruzione dei dati e l'addestramento sono “coming soon”: Iris è quindi open weight con un harness di valutazione aperto, ma non offre ancora una recipe di training completamente pubblicata.
I benchmark dipendono anche dall'harness
I risultati di Iris nei benchmark non vanno interpretati come una caratteristica dei soli checkpoint. AllSpark afferma esplicitamente che un punteggio pubblicato appartiene all'agente insieme al suo harness, e le ablation ufficiali chiariscono bene il motivo.
| Modello e configurazione | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini, nessuna gestione | 64.7 | 72.3 | 81.0 | 43.2 |
Iris-mini, discard-all | 82.2 | 84.8 | 86.9 | 52.3 |
Iris-mini, discard-all + retry | 85.9 | 85.1 | 89.9 | 52.4 |
| Iris-pro, nessuna gestione | 72.6 | 76.8 | 86.4 | 50.8 |
Iris-pro, discard-all | 88.6 | 85.1 | 92.9 | 56.4 |
Iris-pro, discard-all + retry | 90.3 | 85.1 | 93.4 | 56.6 |
Il README di Iris su GitHub definisce discard-all come il ripristino della domanda originale quando il contesto accumulato supera una soglia. Con retry, invece, un episodio concluso senza una risposta analizzabile riparte portandosi dietro un breve riepilogo delle ipotesi già escluse.
Su Iris-mini, discard-all porta BrowseComp da 64.7 a 82.2: 17.5 punti in più senza cambiare checkpoint. Per Iris-pro, il confronto equivalente passa da 72.6 a 88.6, con un guadagno di 16 punti. Una distribuzione che omette il formato conversazionale ufficiale, la politica di reset, gli strumenti di ricerca o il parser delle risposte non sta riproducendo il sistema pubblicizzato.
Anche le principali tabelle di confronto tra modelli richiedono prudenza. AllSpark segnala che i valori di riferimento provengono dai report pubblici dei rispettivi progetti e possono adottare configurazioni diverse per la gestione del contesto. Iris-mini guida la classe dimensionale elencata su BrowseComp, BrowseComp-ZH e HLE, ma XYZ-Aquila-mini resta avanti su DeepSearchQA, 89.5 contro 86.9. Iris-pro primeggia o pareggia con i sistemi elencati intorno ai 400B in tutte e quattro le colonne, sebbene il margine su DeepSearchQA rispetto a XYZ-Aquila-pro sia appena 0.4 punti.
Iris-mini o Iris-pro: la differenza è nell'infrastruttura
Iris-mini è il checkpoint più ragionevole da provare per primo, perché i parametri attivi non eliminano le esigenze di storage e memoria dell'intero modello. Il router MoE attiva circa 3B dei 35B parametri a ogni step, ma il checkpoint completo deve comunque essere archiviato e servito.
Il comando ufficiale per Iris-mini usa il parallelismo tensoriale su quattro unità e un contesto da 262,144 token:
python -m sglang.launch_server \
--model-path AllSpark-Research/Iris-mini \
--served-model-name Iris-mini \
--port 21234 --tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
La configurazione documentata di Iris-pro utilizza --tp-size 8 --ep-size 8. La sua model card ufficiale specifica che il checkpoint da 397B richiede più nodi oppure un singolo nodo di grandi dimensioni. Non è una piccola differenza di configurazione: è un vincolo concreto di deployment.
Con discard-all, il modello più grande guadagna 6.4 punti su mini in BrowseComp e 6.0 in DeepSearchQA, ma solo 0.3 in BrowseComp-ZH. Non basta che “pro” sia più grande per giustificare il salto infrastrutturale: il vantaggio deve essere rilevante per il carico di lavoro da valutare.
Nessuna delle due model card pubblica misure di latenza, throughput, utilizzo della VRAM o costo operativo. In assenza di questi dati non è possibile un confronto responsabile del costo per risposta. Meglio eseguire un pilota delimitato che trasformare il numero di parametri in stime GPU inventate.
Come avviare una prima valutazione riproducibile di Iris
Una prima valutazione di Iris deve mettere alla prova l'intero percorso dell'agente, non limitarsi a inviare domande banali a un endpoint chat-completions. L'harness ufficiale include il loop dell'agente, strumenti di ricerca e scraping, strategie di contesto, adattatori per i benchmark e valutatori.
- Servire Iris-mini con i parser ufficiali. Usare il comando SGLang riportato sopra e verificare che l'endpoint compatibile con OpenAI sia raggiungibile sulla porta 21234.
- Installare Iris-Harness. Il repository usa
uvper creare l'ambiente. - Preparare i dati del benchmark. Eseguire lo script di preparazione incluso invece di assemblarne una copia ad hoc.
- Partire da una porzione ridotta del benchmark. L'esempio ufficiale seleziona
browsecomp:0:1e una soglia di scarto del contesto pari a 131,072 token. - Registrare l'intera configurazione. Conservare revisione del modello, backend degli strumenti, soglia, versioni dei parser e politica di retry accanto a ogni risultato.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py
bash scripts/run_eval.sh \
--base-url http://127.0.0.1:21234/v1 \
--llm-config iris-mini \
--benchmarks "browsecomp:0:1" \
--context-discard-threshold 131072
Iris è addestrato a utilizzare l'interfaccia OpenAI per il function calling e a racchiudere le risposte finali in \boxed{}. L'harness trasferisce inoltre il ragionamento precedente nei turni successivi. Sostituire questo protocollo con un template chat generico può compromettere l'uso degli strumenti o la valutazione, anche se la generazione di testo ordinaria sembra funzionare normalmente.
Per un pilota, usare tre criteri di accettazione:
- Qualità della risposta: l'agente recupera le evidenze richieste, oppure si limita a indovinare l'entità finale?
- Efficienza della ricerca: quante chiamate di ricerca e scraping consuma ogni risposta accettata?
- Capacità di recupero: quando il contesto viene scartato o un episodio viene ritentato, l'agente evita di ripercorrere lo stesso percorso fallimentare?
Il rilascio ufficiale non fornisce alcuno SLA di produzione né un endpoint ospitato. Riprodurre con successo un benchmark dimostra che il sistema funziona con un harness noto; non dimostra la sua affidabilità nella ricerca web senza vincoli.
Cosa è già disponibile e cosa manca per una riproduzione completa
L'attuale rilascio di Iris è significativo, ma non completo. Gli sviluppatori possono scaricare entrambi i checkpoint senza un gate di approvazione, usarli commercialmente con licenza Apache 2.0, consultare le tabelle dei benchmark ed eseguire Iris-Harness contro un endpoint compatibile con OpenAI.
| Disponibile ora | Non ancora pubblicato nel repository |
|---|---|
| Pesi di Iris-mini e Iris-pro | Pipeline completa di costruzione dei dati |
| Configurazioni dei modelli e chat template | Pipeline completa di training |
| Framework di valutazione Iris-Harness | Dimensioni dei dataset e rapporti della miscela |
| Codice per ricerca, scraping, gestione del contesto e valutazione | Costo completo della riproduzione |
| Esempi di serving con SGLang | Studio indipendente sull'affidabilità in produzione |
Il paper descrive la ricostruzione inversa di domande multi-hop a partire da grafi di hyperlink, il filtraggio delle traiettorie a livello dell'intera esecuzione e del singolo turno, nonché l'alternanza fra supervised fine-tuning e reinforcement learning con ricerca live. Tuttavia, lo stato del rilascio nel repository implica che i team esterni possono riprodurre inferenza e valutazione prima di poter replicare il training dall'inizio alla fine.
Le prime discussioni della community riflettono proprio questa distinzione. Un account di notizie tecniche ha riassunto il rilascio così:
“Weights + eval code are public. Training data and recipe come later.” — @Chinazhidx
È il livello di fiducia più appropriato. Iris è stato rilasciato formalmente, non è un rumor, ma le sue affermazioni più forti richiedono ancora esecuzioni esterne con impostazioni dell'harness dichiarate. Al controllo del 14 settembre 2026, le pagine Hugging Face indicavano 335 download mensili per Iris-mini e 685 per Iris-pro; i download sono segnali di attività, non una validazione.
FAQ su Iris Search Agent
Iris è un modello o un prodotto di ricerca completo?
Iris è una famiglia di modelli open-weight accompagnata da un harness di valutazione. Il rilascio non comprende un'applicazione di ricerca per utenti finali ospitata né un'API gestita.
Iris può funzionare in locale?
Sì, ma “in locale” non significa adatto a un laptop. L'esempio ufficiale di Iris-mini usa il parallelismo tensoriale su quattro unità; Iris-pro è documentato con parallelismo tensoriale su otto unità e parallelismo degli esperti su otto unità.
Cosa significa 35B-A3B?
Iris-mini conta circa 35B parametri totali e 3B parametri attivi per ogni step di inferenza. L'attivazione sparsa riduce il calcolo rispetto all'attivazione di tutti i parametri, ma il checkpoint completo continua a incidere sullo storage e sulla memoria di serving.
Iris è completamente open source?
I checkpoint e l'harness sono pubblici con termini permissivi, ma il repository indica ancora come imminenti le pipeline di costruzione dei dati e training. Al momento, la definizione più precisa è “open weight con codice di valutazione aperto”.
Iris dispone di un'API?
I modelli possono essere serviti dietro un endpoint compatibile con OpenAI mediante SGLang o vLLM. Nessuna delle due model card elenca un provider di inferenza Hugging Face ospitato né un'API Iris ufficiale gestita.
Quale modello Iris dovrei usare?
Usare Iris-mini per la valutazione, a meno che un carico di lavoro misurato non richieda le prestazioni aggiuntive di Iris-pro nei benchmark e il team disponga già di un'infrastruttura multi-nodo o a nodo grande adeguata.
Prossimo passo: un pilota con Mini e harness fisso
Scaricare Iris-mini, mantenere il protocollo ufficiale per strumenti e parser, quindi misurare un piccolo set di domande simili al carico di lavoro previsto. Fissare la politica di contesto prima di confrontare i risultati, perché modificare discard-all o retry può spostare il punteggio più di un cambio di modello.
Passare a Iris-pro solo se il pilota rileva un divario qualitativo che giustifichi il suo peso sul deployment. Il compromesso ancora irrisolto è semplice: Iris offre prestazioni open-weight per la ricerca insolitamente forti nei risultati dichiarati, ma non sono ancora disponibili dettagli riproducibili sul training né dati sui costi in produzione.