Цифра 88.6 выглядит впечатляюще, но при оценке Iris она не должна быть главной. Куда важнее другое: смена стратегии работы с контекстом у Iris-mini дает на BrowseComp прирост в 17.5 пункта. Начинать знакомство стоит с Iris-mini и официального harness, а Iris-pro имеет смысл оставлять командам, уже готовым к инференсу на нескольких узлах.
Коротко: какой Iris выбирать
Практическая рекомендация для Iris Search Agent проста: сначала тестируйте Iris-mini. Iris-pro показывает более высокие результаты, но в официальном примере запуска требует заметно более серьезной параллельной инфраструктуры. Кроме того, по состоянию на September 14, 2026 для обоих чекпойнтов нет hosted-провайдера инференса на Hugging Face.
| Вопрос | Iris-mini | Iris-pro |
|---|---|---|
| Базовая модель | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| Всего / активных параметров | 35B / 3B | 397B / 17B |
| Контекстное окно | 256K | 256K |
| Официальный пример SGLang | TP 4 | TP 8 + EP 8 |
BrowseComp, discard-all | 82.2 | 88.6 |
DeepSearchQA, discard-all | 86.9 | 92.9 |
| Лицензия | Apache 2.0 | Apache 2.0 |
| Hosted HF provider | Нет | Нет |
| Оптимальное применение | Воспроизведение, исследовательские пилоты, разработка harness | Хорошо оснащенные исследовательские лаборатории |
Источники: официальные страницы моделей Iris-mini и Iris-pro, а также репозиторий Iris.
Веса, карточки моделей и код оценки Iris-Harness доступны публично. При этом в репозитории по-прежнему указано, что пайплайны подготовки данных и обучения появятся «coming soon». Поэтому Iris — это open-weight-модель с открытым harness для оценки, но пока не полностью опубликованный рецепт обучения.
Без harness бенчмарки Iris читаются иначе
Результаты Iris в бенчмарках нельзя воспринимать как свойство одних лишь чекпойнтов. AllSpark прямо отмечает: опубликованный показатель относится к агенту вместе с его harness. Официальные абляции хорошо показывают, почему это важно.
| Модель и настройка | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini, без управления контекстом | 64.7 | 72.3 | 81.0 | 43.2 |
Iris-mini, discard-all | 82.2 | 84.8 | 86.9 | 52.3 |
Iris-mini, discard-all + retry | 85.9 | 85.1 | 89.9 | 52.4 |
| Iris-pro, без управления контекстом | 72.6 | 76.8 | 86.4 | 50.8 |
Iris-pro, discard-all | 88.6 | 85.1 | 92.9 | 56.4 |
Iris-pro, discard-all + retry | 90.3 | 85.1 | 93.4 | 56.6 |
В официальном README Iris на GitHub режим discard-all описан как возврат к исходному вопросу после того, как накопленный контекст превышает заданный порог. retry перезапускает эпизод, завершившийся без разбираемого ответа, но переносит краткое резюме уже исключенных вариантов.
У Iris-mini включение discard-all поднимает BrowseComp с 64.7 до 82.2 — это 17.5 пункта без смены чекпойнта. У Iris-pro аналогичное сравнение дает рост с 72.6 до 88.6, то есть 16 пунктов. Если при развертывании убрать официальный формат диалога, политику сброса, поисковые инструменты или парсер ответа, получится уже не та система, для которой заявлены результаты.
К сводным таблицам с другими моделями тоже стоит относиться осторожно. AllSpark сообщает, что базовые значения взяты из публичных отчетов соответствующих проектов и могут использовать разные конфигурации управления контекстом. Iris-mini лидирует в своей указанной размерной категории по BrowseComp, BrowseComp-ZH и HLE, однако в DeepSearchQA впереди остается XYZ-Aquila-mini: 89.5 против 86.9. Iris-pro лидирует или делит лидерство среди перечисленных систем примерно 400B по всем четырем колонкам, хотя его преимущество над XYZ-Aquila-pro в DeepSearchQA составляет лишь 0.4 пункта.
Iris-mini или Iris-pro: решает цена развертывания
Iris-mini — разумный первый чекпойнт, поскольку малое число активных параметров не отменяет требований к хранению и памяти для полной модели. MoE-маршрутизатор задействует около 3B из 35B параметров на шаг, но весь чекпойнт все равно необходимо хранить и обслуживать.
Официальная команда для Iris-mini использует четырехсторонний tensor parallelism и контекст на 262,144 токена:
python -m sglang.launch_server \
--model-path AllSpark-Research/Iris-mini \
--served-model-name Iris-mini \
--port 21234 --tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
Документированная конфигурация Iris-pro использует --tp-size 8 --ep-size 8. В его официальной карточке модели указано, что чекпойнту 397B требуется несколько узлов либо один крупный узел. Это не незначительная разница в настройках, а прямое предупреждение о сложности развертывания.
В режиме discard-all старшая модель прибавляет к результату mini 6.4 пункта на BrowseComp и 6.0 на DeepSearchQA, но лишь 0.3 на BrowseComp-ZH. Переход на более тяжелую инфраструктуру не стоит оправдывать одним только размером версии «pro»: прирост должен быть значим для проверяемой рабочей нагрузки.
Ни в одной карточке модели не опубликованы измеренные задержки, пропускная способность, использование VRAM или стоимость эксплуатации. Без этих данных нельзя ответственно сравнить стоимость одного ответа. Вместо расчетов по числу параметров с выдуманными оценками GPU лучше провести ограниченный пилот.
Как провести первую воспроизводимую оценку Iris
Первое тестирование Iris должно проверять полный путь агента, а не сводиться к вопросам викторины через endpoint chat completions. Официальный harness включает цикл работы агента, инструменты поиска и скрейпинга, стратегии управления контекстом, адаптеры бенчмарков и проверяющие модули.
- Поднимите Iris-mini с официальными парсерами. Используйте команду SGLang выше и убедитесь, что OpenAI-совместимый endpoint доступен на порту 21234.
- Установите Iris-Harness. В репозитории для создания окружения используется
uv. - Подготовьте данные бенчмарка. Запустите входящий в комплект скрипт подготовки, а не собирайте произвольную копию вручную.
- Начните с узкого среза бенчмарка. Официальный пример выбирает
browsecomp:0:1и порог сброса контекста в 131,072 токена. - Фиксируйте всю конфигурацию. Сохраняйте рядом с каждым результатом ревизию модели, backend инструментов, порог, версии парсеров и политику повторных попыток.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py
bash scripts/run_eval.sh \
--base-url http://127.0.0.1:21234/v1 \
--llm-config iris-mini \
--benchmarks "browsecomp:0:1" \
--context-discard-threshold 131072
Iris обучена работать через интерфейс OpenAI function calling и оборачивать финальные ответы в \boxed{}. Harness также переносит предыдущее рассуждение в последующие ходы. Замена этого протокола универсальным chat template может нарушить вызов инструментов или оценивание, даже если обычная генерация текста внешне работает нормально.
Для пилота используйте три критерия приемки:
- Качество ответа: находит ли агент нужные подтверждения, а не просто угадывает итоговую сущность?
- Экономность поиска: сколько вызовов поиска и скрейпинга расходуется на один принятый ответ?
- Поведение при восстановлении: не повторяет ли агент один и тот же неудачный маршрут после сброса контекста или перезапуска эпизода?
Официальный релиз не предусматривает production SLA и не предлагает hosted endpoint. Успешное воспроизведение бенчмарка подтверждает работоспособность системы в известной конфигурации harness, но не доказывает надежность при неограниченном исследовании веба.
Что уже опубликовано, а чего не хватает для полного воспроизведения
Текущий релиз Iris содержателен, но не завершен. Разработчики могут скачать оба чекпойнта без approval gate, коммерчески использовать их по Apache 2.0, изучить таблицы бенчмарков и запустить Iris-Harness с OpenAI-совместимым endpoint.
| Доступно сейчас | Пока не опубликовано в репозитории |
|---|---|
| Веса Iris-mini и Iris-pro | Полный пайплайн подготовки данных |
| Конфигурации моделей и chat templates | Полный пайплайн обучения |
| Фреймворк оценки Iris-Harness | Размеры датасетов и пропорции смеси |
| Код поиска, скрейпинга, управления контекстом и оценивания | Полная стоимость воспроизведения |
| Примеры обслуживания через SGLang | Независимое исследование production-надежности |
В статье описаны обратное построение многошаговых вопросов из графов гиперссылок, фильтрация траекторий как на уровне целого прогона, так и на уровне отдельных ходов, а также чередование supervised fine-tuning с reinforcement learning на живом поиске. Но текущий статус релиза в репозитории означает, что внешние команды могут воспроизвести инференс и оценку раньше, чем обучение от начала до конца.
Первые обсуждения в сообществе отражают именно это различие. Один технический новостной аккаунт так подытожил релиз:
«Weights + eval code are public. Training data and recipe come later.» — @Chinazhidx
Именно такой уровень уверенности здесь уместен. Iris — официальный релиз, а не слух, но его наиболее сильные заявления еще должны подтвердить независимые прогоны с раскрытыми настройками harness. При проверке September 14, 2026 страницы Hugging Face показывали 335 ежемесячных загрузок Iris-mini и 685 — Iris-pro; счетчики загрузок отражают активность, а не валидацию.
FAQ по Iris Search Agent
Iris — это модель или готовый поисковый продукт?
Iris — семейство моделей с открытыми весами и harness для оценки. В релиз не входит hosted-потребительское поисковое приложение или управляемый API.
Можно ли запустить Iris локально?
Да, но «локально» не означает, что модель подойдет для ноутбука. В официальном примере Iris-mini используется четырехсторонний tensor parallelism, а для Iris-pro документированы восьмисторонние tensor и expert parallelism.
Что означает 35B-A3B?
У Iris-mini около 35B параметров всего и 3B активных параметров на каждом шаге инференса. Разреженная активация снижает вычислительные затраты по сравнению с активацией всех параметров, но полный чекпойнт по-прежнему влияет на требования к хранению и памяти сервинга.
Iris полностью open source?
Чекпойнты и harness опубликованы на разрешительных условиях, однако пайплайны подготовки данных и обучения в репозитории все еще отмечены как будущие. Самое точное текущее описание — «open weight с открытым кодом оценки».
У Iris есть API?
Модели можно обслуживать через OpenAI-совместимый endpoint с помощью SGLang или vLLM. Ни на одной карточке модели не указан ни hosted-провайдер инференса Hugging Face, ни официальный управляемый API Iris.
Какую модель Iris использовать?
Для оценки выбирайте Iris-mini, если только измеренная рабочая нагрузка не требует дополнительной производительности Iris-pro, а у команды уже нет подходящей инфраструктуры из нескольких узлов или одного крупного узла.
Следующий шаг: пилот Iris-mini с фиксированным harness
Скачайте Iris-mini, сохраните официальный протокол инструментов и парсеров и проверьте на небольшом наборе вопросов, похожих на целевую рабочую нагрузку. До сравнения результатов зафиксируйте политику работы с контекстом: изменение discard-all или retry способно сдвинуть оценку сильнее, чем замена модели.
Переходите к Iris-pro только если пилот выявит разрыв в качестве, оправдывающий сложность развертывания. Компромисс пока очевиден: Iris демонстрирует необычно высокие заявленные результаты для поисковой модели с открытыми весами, но воспроизводимые детали обучения и данные о production-стоимости еще недоступны.