AIREITER
DOCS APITARIFS
MODÈLES
  • AIReiter
  • Blog
  • Test d’Iris Search Agent : commencez par Mini, pas Pro

Test d’Iris Search Agent : commencez par Mini, pas Pro

Dernière mise à jour: 2026-09-14 18:55:44

Le chiffre à retenir avec Iris n’est pas 88.6, mais l’écart de 17.5 points sur BrowseComp obtenu en modifiant la gestion du contexte d’Iris-mini. L’agent de recherche open weight est prometteur, mais commencez par Iris-mini avec le harness officiel. Iris-pro se destine aux équipes qui exploitent déjà une inférence sur plusieurs nœuds.

Iris : le choix en un tableau

La recommandation pratique pour Iris Search Agent est simple : évaluez d’abord Iris-mini. Iris-pro affiche de meilleurs résultats, mais son exemple officiel de lancement exige une infrastructure parallèle bien plus lourde. Au 14 septembre 2026, aucun des deux checkpoints ne dispose d’un fournisseur d’inférence Hugging Face hébergé.

QuestionIris-miniIris-pro
Modèle de baseQwen3.6-35B-A3BQwen3.5-397B-A17B
Paramètres totaux / actifs35B / 3B397B / 17B
Fenêtre de contexte256K256K
Exemple SGLang officielTP 4TP 8 + EP 8
BrowseComp, discard-all82.288.6
DeepSearchQA, discard-all86.992.9
LicenceApache 2.0Apache 2.0
Fournisseur HF hébergéAucunAucun
Usage le plus adaptéReproduction, pilotes de recherche, développement de harnessLaboratoires de recherche bien équipés

Sources : les fiches officielles d’Iris-mini et d’Iris-pro, ainsi que le dépôt Iris.

Les poids, les fiches de modèles et le code d’évaluation Iris-Harness sont publics. Le dépôt indique toujours que les pipelines de construction des données et d’entraînement arrivent « coming soon » : Iris est donc open weight avec un harness d’évaluation ouvert, mais pas encore une recette d’entraînement intégralement publiée.

Les scores changent avec le harness

Les résultats d’Iris aux benchmarks ne peuvent pas être attribués aux seuls checkpoints. AllSpark précise explicitement qu’un score publié est celui de l’agent et de son harness. Les ablations officielles montrent très concrètement pourquoi.

Modèle et configurationBrowseCompBrowseComp-ZHDeepSearchQAHLE
Iris-mini, sans gestion64.772.381.043.2
Iris-mini, discard-all82.284.886.952.3
Iris-mini, discard-all + retry85.985.189.952.4
Iris-pro, sans gestion72.676.886.450.8
Iris-pro, discard-all88.685.192.956.4
Iris-pro, discard-all + retry90.385.193.456.6

Le README GitHub d’Iris définit discard-all comme un retour à la question initiale lorsque le contexte cumulé franchit un seuil. Avec retry, un épisode terminé sans réponse exploitable est relancé en conservant un bref résumé des pistes déjà écartées.

Pour Iris-mini, discard-all fait passer BrowseComp de 64.7 à 82.2, soit 17.5 points de plus sans changer de checkpoint. Pour Iris-pro, la même comparaison va de 72.6 à 88.6, un gain de 16 points. Un déploiement qui omet le format conversationnel officiel, la politique de réinitialisation, les outils de recherche ou le parseur de réponse ne reproduit pas le système mis en avant.

Les principaux tableaux inter-modèles demandent également de la prudence. AllSpark indique que les valeurs de référence proviennent des rapports publics de chaque projet et peuvent reposer sur des configurations différentes de gestion du contexte. Iris-mini domine les modèles de sa catégorie de taille listés sur BrowseComp, BrowseComp-ZH et HLE, mais XYZ-Aquila-mini reste devant sur DeepSearchQA, avec 89.5 contre 86.9. Iris-pro est en tête ou à égalité avec les systèmes d’environ 400B recensés dans les quatre colonnes, même si son avance sur XYZ-Aquila-pro dans DeepSearchQA ne dépasse que 0.4 point.

Iris-mini ou Iris-pro : choisissez selon la contrainte d’infrastructure

Iris-mini est le checkpoint le plus logique pour démarrer, car le nombre de paramètres actifs ne fait pas disparaître les besoins de stockage et de mémoire du modèle complet. Le routeur MoE active environ 3B des 35B paramètres à chaque étape, mais l’intégralité du checkpoint doit tout de même être stockée et servie.

La commande officielle d’Iris-mini utilise un parallélisme tensoriel sur quatre voies et un contexte de 262,144 tokens :

python -m sglang.launch_server \
  --model-path AllSpark-Research/Iris-mini \
  --served-model-name Iris-mini \
  --port 21234 --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

La configuration documentée pour Iris-pro utilise --tp-size 8 --ep-size 8. Sa fiche de modèle officielle précise que le checkpoint 397B demande plusieurs nœuds ou un unique nœud de grande capacité. Ce n’est pas une simple nuance de configuration : c’est un avertissement de déploiement.

Avec discard-all, le grand modèle gagne 6.4 points sur BrowseComp et 6.0 sur DeepSearchQA face à mini, mais seulement 0.3 sur BrowseComp-ZH. Il ne faut pas accepter ce saut d’infrastructure simplement parce que « pro » est plus gros. Le gain doit avoir un impact sur la charge de travail évaluée.

Aucune des deux fiches ne publie de mesures de latence, de débit, de consommation VRAM ou de coût d’exploitation. En l’absence de ces données, toute comparaison sérieuse du coût par réponse est impossible. Mieux vaut mener un pilote borné que transformer des comptes de paramètres en estimations GPU inventées.

Première évaluation d’Iris, de façon reproductible

Une première évaluation d’Iris doit tester toute la chaîne agent, et non envoyer des questions anecdotiques vers un endpoint de chat-completions. Le harness officiel intègre la boucle de l’agent, les outils de recherche et de scraping, les stratégies de contexte, les adaptateurs de benchmarks et les évaluateurs.

  1. Servez Iris-mini avec les parseurs officiels. Utilisez la commande SGLang ci-dessus et vérifiez que l’endpoint compatible OpenAI répond sur le port 21234.
  2. Installez Iris-Harness. Le dépôt s’appuie sur uv pour créer l’environnement.
  3. Préparez les données du benchmark. Exécutez le script de préparation fourni plutôt que de constituer une copie ad hoc.
  4. Commencez par un segment réduit du benchmark. L’exemple officiel sélectionne browsecomp:0:1 avec un seuil d’abandon de contexte de 131,072 tokens.
  5. Consignez toute la configuration. Conservez la révision du modèle, le backend des outils, le seuil, les versions des parseurs et la politique de retry avec chaque résultat.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py

bash scripts/run_eval.sh \
  --base-url http://127.0.0.1:21234/v1 \
  --llm-config iris-mini \
  --benchmarks "browsecomp:0:1" \
  --context-discard-threshold 131072

Iris est entraîné à utiliser l’interface de function calling d’OpenAI et à encadrer ses réponses finales dans \boxed{}. Le harness reporte aussi le raisonnement antérieur dans les tours suivants. Remplacer ce protocole par un template de chat générique peut casser l’usage des outils ou la notation, même si la génération de texte ordinaire paraît fonctionner normalement.

Pour un pilote, retenez trois critères d’acceptation :

  • Qualité des réponses : l’agent retrouve-t-il les éléments de preuve nécessaires, au lieu de simplement deviner l’entité finale ?
  • Frugalité de la recherche : combien d’appels de recherche et de scraping sont consommés par réponse validée ?
  • Comportement de récupération : après un abandon du contexte ou un nouvel essai d’épisode, l’agent évite-t-il de reproduire la même piste en échec ?

La sortie officielle ne fournit ni SLA de production ni endpoint hébergé. Reproduire avec succès un benchmark établit que le système fonctionne avec un harness connu ; cela ne prouve pas sa fiabilité sur de la recherche web sans restriction.

Ce qui est disponible, et ce qui manque pour une reproduction complète

La sortie actuelle d’Iris est conséquente, mais incomplète. Les développeurs peuvent télécharger les deux checkpoints sans validation préalable, les utiliser commercialement sous Apache 2.0, examiner les tableaux de benchmarks et exécuter Iris-Harness face à un endpoint compatible OpenAI.

Disponible dès maintenantPas encore publié dans le dépôt
Poids d’Iris-mini et d’Iris-proPipeline complet de construction des données
Configurations des modèles et templates de chatPipeline complet d’entraînement
Framework d’évaluation Iris-HarnessTailles des jeux de données et ratios de mélange
Code de recherche, scraping, gestion de contexte et notationCoût complet de reproduction
Exemples de serving SGLangÉtude indépendante de fiabilité en production

L’article décrit une rétroconstruction de questions multi-sauts à partir de graphes d’hyperliens, le filtrage des trajectoires au niveau de l’exécution complète et de chaque tour, ainsi qu’une alternance entre fine-tuning supervisé et apprentissage par renforcement avec recherche active. Mais l’état de publication du dépôt signifie que les équipes externes peuvent reproduire l’inférence et l’évaluation avant de pouvoir reproduire l’entraînement de bout en bout.

Les premiers échanges dans la communauté illustrent bien cette distinction. Un compte d’actualité technique a résumé la sortie ainsi :

« Les poids et le code d’évaluation sont publics. Les données d’entraînement et la recette arriveront plus tard. » — @Chinazhidx

C’est le bon niveau de confiance à adopter. Iris est bien publié, ce n’est pas une rumeur, mais ses affirmations les plus fortes doivent encore être vérifiées par des exécutions externes avec des réglages de harness divulgués. Lors de la vérification du 14 septembre 2026, les pages Hugging Face affichaient 335 téléchargements mensuels pour Iris-mini et 685 pour Iris-pro ; les téléchargements signalent une activité, pas une validation.

FAQ sur Iris Search Agent

Iris est-il un modèle ou un produit de recherche complet ?

Iris est une famille de modèles open weight accompagnée d’un harness d’évaluation. La sortie ne comprend ni application de recherche grand public hébergée, ni API managée.

Peut-on exécuter Iris en local ?

Oui, mais « local » ne signifie pas compatible avec un laptop. L’exemple officiel d’Iris-mini repose sur un parallélisme tensoriel sur quatre voies ; Iris-pro est documenté avec un parallélisme tensoriel sur huit voies et un parallélisme expert sur huit voies.

Que signifie 35B-A3B ?

Iris-mini compte environ 35B paramètres au total, dont 3B actifs à chaque étape d’inférence. L’activation sparse réduit le calcul par rapport à l’activation de tous les paramètres, mais le checkpoint complet pèse toujours sur le stockage et la mémoire de serving.

Iris est-il entièrement open source ?

Les checkpoints et le harness sont publics sous des conditions permissives, mais le dépôt présente encore les pipelines de construction des données et d’entraînement comme à venir. « Open weight avec code d’évaluation ouvert » est la description la plus précise à ce stade.

Iris propose-t-il une API ?

Les modèles peuvent être servis derrière un endpoint compatible OpenAI avec SGLang ou vLLM. Aucun fournisseur d’inférence Hugging Face hébergé ni API Iris managée officielle n’est indiqué sur les fiches des deux modèles.

Quel modèle Iris utiliser ?

Utilisez Iris-mini pour l’évaluation, sauf si une charge de travail mesurée exige le supplément de performances d’Iris-pro et que l’équipe dispose déjà d’une infrastructure adaptée, multi-nœuds ou sur un grand nœud.

Prochaine étape : un pilote mini avec un harness figé

Téléchargez Iris-mini, conservez le protocole officiel des outils et des parseurs, puis évaluez un petit ensemble de questions représentatives de la charge de travail visée. Figez la politique de contexte avant de comparer les résultats : modifier discard-all ou retry peut déplacer le score davantage qu’un changement de modèle.

Ne passez à Iris-pro que si le pilote met en évidence un écart de qualité qui justifie son poids de déploiement. Le compromis reste clair : Iris affiche des performances open weight de recherche exceptionnellement fortes sur le papier, mais les détails reproductibles de l’entraînement et les données sur les coûts en production ne sont pas encore disponibles.

>_Répertoire des modèles AIReiter

Accès API rapide aux modèles liés à ce guide

Claude Opus 5

Chat

Un modèle Claude premium pour le raisonnement complexe, le codage et le travail professionnel à long contexte.

AnthropicCréer une API Key >

Claude Fable 5

Chat

Un modèle Claude premium pour le raisonnement approfondi et le travail long et complexe.

AnthropicCréer une API Key >

Claude Fable 5.1

Chat

Modèle de classe Mythos pour le codage à long terme, la recherche et le travail intellectuel.

AnthropicCréer une API Key >

Claude Opus 4.8

Chat

Un modèle Claude hautement performant pour les tâches de raisonnement exigeantes et le travail professionnel.

AnthropicCréer une API Key >

Claude Sonnet 5

Chat

Un modèle Claude équilibré pour le raisonnement avancé, le codage et le travail quotidien.

AnthropicCréer une API Key >

Articles récents

Meilleur modèle d’IA pour le roleplay : cohérence, mémoire et accès API

2026-09-15

API Kling 3.0 : migration, Motion Control et code

2026-09-15

Higgsfield face à Artlist : coûts, licences et workflows comparés

2026-09-14

Clé API LLM gratuite : 8 façons de s’inscrire et leurs limites (2026)

2026-09-13
AIREITER

Des questions ? Contactez-nous à
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Vidéo IA

Image IA

Blog

Voir tout →

Entreprise

Politique de confidentialitéConditions d'utilisationPolitique de remboursement

© 2026 AIReiter. Tous droits réservés.