Le chiffre à retenir avec Iris n’est pas 88.6, mais l’écart de 17.5 points sur BrowseComp obtenu en modifiant la gestion du contexte d’Iris-mini. L’agent de recherche open weight est prometteur, mais commencez par Iris-mini avec le harness officiel. Iris-pro se destine aux équipes qui exploitent déjà une inférence sur plusieurs nœuds.
Iris : le choix en un tableau
La recommandation pratique pour Iris Search Agent est simple : évaluez d’abord Iris-mini. Iris-pro affiche de meilleurs résultats, mais son exemple officiel de lancement exige une infrastructure parallèle bien plus lourde. Au 14 septembre 2026, aucun des deux checkpoints ne dispose d’un fournisseur d’inférence Hugging Face hébergé.
| Question | Iris-mini | Iris-pro |
|---|---|---|
| Modèle de base | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| Paramètres totaux / actifs | 35B / 3B | 397B / 17B |
| Fenêtre de contexte | 256K | 256K |
| Exemple SGLang officiel | TP 4 | TP 8 + EP 8 |
BrowseComp, discard-all | 82.2 | 88.6 |
DeepSearchQA, discard-all | 86.9 | 92.9 |
| Licence | Apache 2.0 | Apache 2.0 |
| Fournisseur HF hébergé | Aucun | Aucun |
| Usage le plus adapté | Reproduction, pilotes de recherche, développement de harness | Laboratoires de recherche bien équipés |
Sources : les fiches officielles d’Iris-mini et d’Iris-pro, ainsi que le dépôt Iris.
Les poids, les fiches de modèles et le code d’évaluation Iris-Harness sont publics. Le dépôt indique toujours que les pipelines de construction des données et d’entraînement arrivent « coming soon » : Iris est donc open weight avec un harness d’évaluation ouvert, mais pas encore une recette d’entraînement intégralement publiée.
Les scores changent avec le harness
Les résultats d’Iris aux benchmarks ne peuvent pas être attribués aux seuls checkpoints. AllSpark précise explicitement qu’un score publié est celui de l’agent et de son harness. Les ablations officielles montrent très concrètement pourquoi.
| Modèle et configuration | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini, sans gestion | 64.7 | 72.3 | 81.0 | 43.2 |
Iris-mini, discard-all | 82.2 | 84.8 | 86.9 | 52.3 |
Iris-mini, discard-all + retry | 85.9 | 85.1 | 89.9 | 52.4 |
| Iris-pro, sans gestion | 72.6 | 76.8 | 86.4 | 50.8 |
Iris-pro, discard-all | 88.6 | 85.1 | 92.9 | 56.4 |
Iris-pro, discard-all + retry | 90.3 | 85.1 | 93.4 | 56.6 |
Le README GitHub d’Iris définit discard-all comme un retour à la question initiale lorsque le contexte cumulé franchit un seuil. Avec retry, un épisode terminé sans réponse exploitable est relancé en conservant un bref résumé des pistes déjà écartées.
Pour Iris-mini, discard-all fait passer BrowseComp de 64.7 à 82.2, soit 17.5 points de plus sans changer de checkpoint. Pour Iris-pro, la même comparaison va de 72.6 à 88.6, un gain de 16 points. Un déploiement qui omet le format conversationnel officiel, la politique de réinitialisation, les outils de recherche ou le parseur de réponse ne reproduit pas le système mis en avant.
Les principaux tableaux inter-modèles demandent également de la prudence. AllSpark indique que les valeurs de référence proviennent des rapports publics de chaque projet et peuvent reposer sur des configurations différentes de gestion du contexte. Iris-mini domine les modèles de sa catégorie de taille listés sur BrowseComp, BrowseComp-ZH et HLE, mais XYZ-Aquila-mini reste devant sur DeepSearchQA, avec 89.5 contre 86.9. Iris-pro est en tête ou à égalité avec les systèmes d’environ 400B recensés dans les quatre colonnes, même si son avance sur XYZ-Aquila-pro dans DeepSearchQA ne dépasse que 0.4 point.
Iris-mini ou Iris-pro : choisissez selon la contrainte d’infrastructure
Iris-mini est le checkpoint le plus logique pour démarrer, car le nombre de paramètres actifs ne fait pas disparaître les besoins de stockage et de mémoire du modèle complet. Le routeur MoE active environ 3B des 35B paramètres à chaque étape, mais l’intégralité du checkpoint doit tout de même être stockée et servie.
La commande officielle d’Iris-mini utilise un parallélisme tensoriel sur quatre voies et un contexte de 262,144 tokens :
python -m sglang.launch_server \
--model-path AllSpark-Research/Iris-mini \
--served-model-name Iris-mini \
--port 21234 --tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
La configuration documentée pour Iris-pro utilise --tp-size 8 --ep-size 8. Sa fiche de modèle officielle précise que le checkpoint 397B demande plusieurs nœuds ou un unique nœud de grande capacité. Ce n’est pas une simple nuance de configuration : c’est un avertissement de déploiement.
Avec discard-all, le grand modèle gagne 6.4 points sur BrowseComp et 6.0 sur DeepSearchQA face à mini, mais seulement 0.3 sur BrowseComp-ZH. Il ne faut pas accepter ce saut d’infrastructure simplement parce que « pro » est plus gros. Le gain doit avoir un impact sur la charge de travail évaluée.
Aucune des deux fiches ne publie de mesures de latence, de débit, de consommation VRAM ou de coût d’exploitation. En l’absence de ces données, toute comparaison sérieuse du coût par réponse est impossible. Mieux vaut mener un pilote borné que transformer des comptes de paramètres en estimations GPU inventées.
Première évaluation d’Iris, de façon reproductible
Une première évaluation d’Iris doit tester toute la chaîne agent, et non envoyer des questions anecdotiques vers un endpoint de chat-completions. Le harness officiel intègre la boucle de l’agent, les outils de recherche et de scraping, les stratégies de contexte, les adaptateurs de benchmarks et les évaluateurs.
- Servez Iris-mini avec les parseurs officiels. Utilisez la commande SGLang ci-dessus et vérifiez que l’endpoint compatible OpenAI répond sur le port 21234.
- Installez Iris-Harness. Le dépôt s’appuie sur
uvpour créer l’environnement. - Préparez les données du benchmark. Exécutez le script de préparation fourni plutôt que de constituer une copie ad hoc.
- Commencez par un segment réduit du benchmark. L’exemple officiel sélectionne
browsecomp:0:1avec un seuil d’abandon de contexte de 131,072 tokens. - Consignez toute la configuration. Conservez la révision du modèle, le backend des outils, le seuil, les versions des parseurs et la politique de retry avec chaque résultat.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py
bash scripts/run_eval.sh \
--base-url http://127.0.0.1:21234/v1 \
--llm-config iris-mini \
--benchmarks "browsecomp:0:1" \
--context-discard-threshold 131072
Iris est entraîné à utiliser l’interface de function calling d’OpenAI et à encadrer ses réponses finales dans \boxed{}. Le harness reporte aussi le raisonnement antérieur dans les tours suivants. Remplacer ce protocole par un template de chat générique peut casser l’usage des outils ou la notation, même si la génération de texte ordinaire paraît fonctionner normalement.
Pour un pilote, retenez trois critères d’acceptation :
- Qualité des réponses : l’agent retrouve-t-il les éléments de preuve nécessaires, au lieu de simplement deviner l’entité finale ?
- Frugalité de la recherche : combien d’appels de recherche et de scraping sont consommés par réponse validée ?
- Comportement de récupération : après un abandon du contexte ou un nouvel essai d’épisode, l’agent évite-t-il de reproduire la même piste en échec ?
La sortie officielle ne fournit ni SLA de production ni endpoint hébergé. Reproduire avec succès un benchmark établit que le système fonctionne avec un harness connu ; cela ne prouve pas sa fiabilité sur de la recherche web sans restriction.
Ce qui est disponible, et ce qui manque pour une reproduction complète
La sortie actuelle d’Iris est conséquente, mais incomplète. Les développeurs peuvent télécharger les deux checkpoints sans validation préalable, les utiliser commercialement sous Apache 2.0, examiner les tableaux de benchmarks et exécuter Iris-Harness face à un endpoint compatible OpenAI.
| Disponible dès maintenant | Pas encore publié dans le dépôt |
|---|---|
| Poids d’Iris-mini et d’Iris-pro | Pipeline complet de construction des données |
| Configurations des modèles et templates de chat | Pipeline complet d’entraînement |
| Framework d’évaluation Iris-Harness | Tailles des jeux de données et ratios de mélange |
| Code de recherche, scraping, gestion de contexte et notation | Coût complet de reproduction |
| Exemples de serving SGLang | Étude indépendante de fiabilité en production |
L’article décrit une rétroconstruction de questions multi-sauts à partir de graphes d’hyperliens, le filtrage des trajectoires au niveau de l’exécution complète et de chaque tour, ainsi qu’une alternance entre fine-tuning supervisé et apprentissage par renforcement avec recherche active. Mais l’état de publication du dépôt signifie que les équipes externes peuvent reproduire l’inférence et l’évaluation avant de pouvoir reproduire l’entraînement de bout en bout.
Les premiers échanges dans la communauté illustrent bien cette distinction. Un compte d’actualité technique a résumé la sortie ainsi :
« Les poids et le code d’évaluation sont publics. Les données d’entraînement et la recette arriveront plus tard. » — @Chinazhidx
C’est le bon niveau de confiance à adopter. Iris est bien publié, ce n’est pas une rumeur, mais ses affirmations les plus fortes doivent encore être vérifiées par des exécutions externes avec des réglages de harness divulgués. Lors de la vérification du 14 septembre 2026, les pages Hugging Face affichaient 335 téléchargements mensuels pour Iris-mini et 685 pour Iris-pro ; les téléchargements signalent une activité, pas une validation.
FAQ sur Iris Search Agent
Iris est-il un modèle ou un produit de recherche complet ?
Iris est une famille de modèles open weight accompagnée d’un harness d’évaluation. La sortie ne comprend ni application de recherche grand public hébergée, ni API managée.
Peut-on exécuter Iris en local ?
Oui, mais « local » ne signifie pas compatible avec un laptop. L’exemple officiel d’Iris-mini repose sur un parallélisme tensoriel sur quatre voies ; Iris-pro est documenté avec un parallélisme tensoriel sur huit voies et un parallélisme expert sur huit voies.
Que signifie 35B-A3B ?
Iris-mini compte environ 35B paramètres au total, dont 3B actifs à chaque étape d’inférence. L’activation sparse réduit le calcul par rapport à l’activation de tous les paramètres, mais le checkpoint complet pèse toujours sur le stockage et la mémoire de serving.
Iris est-il entièrement open source ?
Les checkpoints et le harness sont publics sous des conditions permissives, mais le dépôt présente encore les pipelines de construction des données et d’entraînement comme à venir. « Open weight avec code d’évaluation ouvert » est la description la plus précise à ce stade.
Iris propose-t-il une API ?
Les modèles peuvent être servis derrière un endpoint compatible OpenAI avec SGLang ou vLLM. Aucun fournisseur d’inférence Hugging Face hébergé ni API Iris managée officielle n’est indiqué sur les fiches des deux modèles.
Quel modèle Iris utiliser ?
Utilisez Iris-mini pour l’évaluation, sauf si une charge de travail mesurée exige le supplément de performances d’Iris-pro et que l’équipe dispose déjà d’une infrastructure adaptée, multi-nœuds ou sur un grand nœud.
Prochaine étape : un pilote mini avec un harness figé
Téléchargez Iris-mini, conservez le protocole officiel des outils et des parseurs, puis évaluez un petit ensemble de questions représentatives de la charge de travail visée. Figez la politique de contexte avant de comparer les résultats : modifier discard-all ou retry peut déplacer le score davantage qu’un changement de modèle.
Ne passez à Iris-pro que si le pilote met en évidence un écart de qualité qui justifie son poids de déploiement. Le compromis reste clair : Iris affiche des performances open weight de recherche exceptionnellement fortes sur le papier, mais les détails reproductibles de l’entraînement et les données sur les coûts en production ne sont pas encore disponibles.