AIREITER
ДОКИ APIЦЕНЫ
ШАБЛОНЫ
  • AIReiter
  • Блог
  • Обзор Iris Search Agent: начните с Mini, а не Pro

Обзор Iris Search Agent: начните с Mini, а не Pro

Последнее обновление: 2026-09-14 18:58:13

Цифра 88.6 выглядит впечатляюще, но при оценке Iris она не должна быть главной. Куда важнее другое: смена стратегии работы с контекстом у Iris-mini дает на BrowseComp прирост в 17.5 пункта. Начинать знакомство стоит с Iris-mini и официального harness, а Iris-pro имеет смысл оставлять командам, уже готовым к инференсу на нескольких узлах.

Коротко: какой Iris выбирать

Практическая рекомендация для Iris Search Agent проста: сначала тестируйте Iris-mini. Iris-pro показывает более высокие результаты, но в официальном примере запуска требует заметно более серьезной параллельной инфраструктуры. Кроме того, по состоянию на September 14, 2026 для обоих чекпойнтов нет hosted-провайдера инференса на Hugging Face.

ВопросIris-miniIris-pro
Базовая модельQwen3.6-35B-A3BQwen3.5-397B-A17B
Всего / активных параметров35B / 3B397B / 17B
Контекстное окно256K256K
Официальный пример SGLangTP 4TP 8 + EP 8
BrowseComp, discard-all82.288.6
DeepSearchQA, discard-all86.992.9
ЛицензияApache 2.0Apache 2.0
Hosted HF providerНетНет
Оптимальное применениеВоспроизведение, исследовательские пилоты, разработка harnessХорошо оснащенные исследовательские лаборатории

Источники: официальные страницы моделей Iris-mini и Iris-pro, а также репозиторий Iris.

Веса, карточки моделей и код оценки Iris-Harness доступны публично. При этом в репозитории по-прежнему указано, что пайплайны подготовки данных и обучения появятся «coming soon». Поэтому Iris — это open-weight-модель с открытым harness для оценки, но пока не полностью опубликованный рецепт обучения.

Без harness бенчмарки Iris читаются иначе

Результаты Iris в бенчмарках нельзя воспринимать как свойство одних лишь чекпойнтов. AllSpark прямо отмечает: опубликованный показатель относится к агенту вместе с его harness. Официальные абляции хорошо показывают, почему это важно.

Модель и настройкаBrowseCompBrowseComp-ZHDeepSearchQAHLE
Iris-mini, без управления контекстом64.772.381.043.2
Iris-mini, discard-all82.284.886.952.3
Iris-mini, discard-all + retry85.985.189.952.4
Iris-pro, без управления контекстом72.676.886.450.8
Iris-pro, discard-all88.685.192.956.4
Iris-pro, discard-all + retry90.385.193.456.6

В официальном README Iris на GitHub режим discard-all описан как возврат к исходному вопросу после того, как накопленный контекст превышает заданный порог. retry перезапускает эпизод, завершившийся без разбираемого ответа, но переносит краткое резюме уже исключенных вариантов.

У Iris-mini включение discard-all поднимает BrowseComp с 64.7 до 82.2 — это 17.5 пункта без смены чекпойнта. У Iris-pro аналогичное сравнение дает рост с 72.6 до 88.6, то есть 16 пунктов. Если при развертывании убрать официальный формат диалога, политику сброса, поисковые инструменты или парсер ответа, получится уже не та система, для которой заявлены результаты.

К сводным таблицам с другими моделями тоже стоит относиться осторожно. AllSpark сообщает, что базовые значения взяты из публичных отчетов соответствующих проектов и могут использовать разные конфигурации управления контекстом. Iris-mini лидирует в своей указанной размерной категории по BrowseComp, BrowseComp-ZH и HLE, однако в DeepSearchQA впереди остается XYZ-Aquila-mini: 89.5 против 86.9. Iris-pro лидирует или делит лидерство среди перечисленных систем примерно 400B по всем четырем колонкам, хотя его преимущество над XYZ-Aquila-pro в DeepSearchQA составляет лишь 0.4 пункта.

Iris-mini или Iris-pro: решает цена развертывания

Iris-mini — разумный первый чекпойнт, поскольку малое число активных параметров не отменяет требований к хранению и памяти для полной модели. MoE-маршрутизатор задействует около 3B из 35B параметров на шаг, но весь чекпойнт все равно необходимо хранить и обслуживать.

Официальная команда для Iris-mini использует четырехсторонний tensor parallelism и контекст на 262,144 токена:

python -m sglang.launch_server \
  --model-path AllSpark-Research/Iris-mini \
  --served-model-name Iris-mini \
  --port 21234 --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

Документированная конфигурация Iris-pro использует --tp-size 8 --ep-size 8. В его официальной карточке модели указано, что чекпойнту 397B требуется несколько узлов либо один крупный узел. Это не незначительная разница в настройках, а прямое предупреждение о сложности развертывания.

В режиме discard-all старшая модель прибавляет к результату mini 6.4 пункта на BrowseComp и 6.0 на DeepSearchQA, но лишь 0.3 на BrowseComp-ZH. Переход на более тяжелую инфраструктуру не стоит оправдывать одним только размером версии «pro»: прирост должен быть значим для проверяемой рабочей нагрузки.

Ни в одной карточке модели не опубликованы измеренные задержки, пропускная способность, использование VRAM или стоимость эксплуатации. Без этих данных нельзя ответственно сравнить стоимость одного ответа. Вместо расчетов по числу параметров с выдуманными оценками GPU лучше провести ограниченный пилот.

Как провести первую воспроизводимую оценку Iris

Первое тестирование Iris должно проверять полный путь агента, а не сводиться к вопросам викторины через endpoint chat completions. Официальный harness включает цикл работы агента, инструменты поиска и скрейпинга, стратегии управления контекстом, адаптеры бенчмарков и проверяющие модули.

  1. Поднимите Iris-mini с официальными парсерами. Используйте команду SGLang выше и убедитесь, что OpenAI-совместимый endpoint доступен на порту 21234.
  2. Установите Iris-Harness. В репозитории для создания окружения используется uv.
  3. Подготовьте данные бенчмарка. Запустите входящий в комплект скрипт подготовки, а не собирайте произвольную копию вручную.
  4. Начните с узкого среза бенчмарка. Официальный пример выбирает browsecomp:0:1 и порог сброса контекста в 131,072 токена.
  5. Фиксируйте всю конфигурацию. Сохраняйте рядом с каждым результатом ревизию модели, backend инструментов, порог, версии парсеров и политику повторных попыток.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py

bash scripts/run_eval.sh \
  --base-url http://127.0.0.1:21234/v1 \
  --llm-config iris-mini \
  --benchmarks "browsecomp:0:1" \
  --context-discard-threshold 131072

Iris обучена работать через интерфейс OpenAI function calling и оборачивать финальные ответы в \boxed{}. Harness также переносит предыдущее рассуждение в последующие ходы. Замена этого протокола универсальным chat template может нарушить вызов инструментов или оценивание, даже если обычная генерация текста внешне работает нормально.

Для пилота используйте три критерия приемки:

  • Качество ответа: находит ли агент нужные подтверждения, а не просто угадывает итоговую сущность?
  • Экономность поиска: сколько вызовов поиска и скрейпинга расходуется на один принятый ответ?
  • Поведение при восстановлении: не повторяет ли агент один и тот же неудачный маршрут после сброса контекста или перезапуска эпизода?

Официальный релиз не предусматривает production SLA и не предлагает hosted endpoint. Успешное воспроизведение бенчмарка подтверждает работоспособность системы в известной конфигурации harness, но не доказывает надежность при неограниченном исследовании веба.

Что уже опубликовано, а чего не хватает для полного воспроизведения

Текущий релиз Iris содержателен, но не завершен. Разработчики могут скачать оба чекпойнта без approval gate, коммерчески использовать их по Apache 2.0, изучить таблицы бенчмарков и запустить Iris-Harness с OpenAI-совместимым endpoint.

Доступно сейчасПока не опубликовано в репозитории
Веса Iris-mini и Iris-proПолный пайплайн подготовки данных
Конфигурации моделей и chat templatesПолный пайплайн обучения
Фреймворк оценки Iris-HarnessРазмеры датасетов и пропорции смеси
Код поиска, скрейпинга, управления контекстом и оцениванияПолная стоимость воспроизведения
Примеры обслуживания через SGLangНезависимое исследование production-надежности

В статье описаны обратное построение многошаговых вопросов из графов гиперссылок, фильтрация траекторий как на уровне целого прогона, так и на уровне отдельных ходов, а также чередование supervised fine-tuning с reinforcement learning на живом поиске. Но текущий статус релиза в репозитории означает, что внешние команды могут воспроизвести инференс и оценку раньше, чем обучение от начала до конца.

Первые обсуждения в сообществе отражают именно это различие. Один технический новостной аккаунт так подытожил релиз:

«Weights + eval code are public. Training data and recipe come later.» — @Chinazhidx

Именно такой уровень уверенности здесь уместен. Iris — официальный релиз, а не слух, но его наиболее сильные заявления еще должны подтвердить независимые прогоны с раскрытыми настройками harness. При проверке September 14, 2026 страницы Hugging Face показывали 335 ежемесячных загрузок Iris-mini и 685 — Iris-pro; счетчики загрузок отражают активность, а не валидацию.

FAQ по Iris Search Agent

Iris — это модель или готовый поисковый продукт?

Iris — семейство моделей с открытыми весами и harness для оценки. В релиз не входит hosted-потребительское поисковое приложение или управляемый API.

Можно ли запустить Iris локально?

Да, но «локально» не означает, что модель подойдет для ноутбука. В официальном примере Iris-mini используется четырехсторонний tensor parallelism, а для Iris-pro документированы восьмисторонние tensor и expert parallelism.

Что означает 35B-A3B?

У Iris-mini около 35B параметров всего и 3B активных параметров на каждом шаге инференса. Разреженная активация снижает вычислительные затраты по сравнению с активацией всех параметров, но полный чекпойнт по-прежнему влияет на требования к хранению и памяти сервинга.

Iris полностью open source?

Чекпойнты и harness опубликованы на разрешительных условиях, однако пайплайны подготовки данных и обучения в репозитории все еще отмечены как будущие. Самое точное текущее описание — «open weight с открытым кодом оценки».

У Iris есть API?

Модели можно обслуживать через OpenAI-совместимый endpoint с помощью SGLang или vLLM. Ни на одной карточке модели не указан ни hosted-провайдер инференса Hugging Face, ни официальный управляемый API Iris.

Какую модель Iris использовать?

Для оценки выбирайте Iris-mini, если только измеренная рабочая нагрузка не требует дополнительной производительности Iris-pro, а у команды уже нет подходящей инфраструктуры из нескольких узлов или одного крупного узла.

Следующий шаг: пилот Iris-mini с фиксированным harness

Скачайте Iris-mini, сохраните официальный протокол инструментов и парсеров и проверьте на небольшом наборе вопросов, похожих на целевую рабочую нагрузку. До сравнения результатов зафиксируйте политику работы с контекстом: изменение discard-all или retry способно сдвинуть оценку сильнее, чем замена модели.

Переходите к Iris-pro только если пилот выявит разрыв в качестве, оправдывающий сложность развертывания. Компромисс пока очевиден: Iris демонстрирует необычно высокие заявленные результаты для поисковой модели с открытыми весами, но воспроизводимые детали обучения и данные о production-стоимости еще недоступны.

>_Каталог моделей AIReiter

Быстрый API-доступ к моделям, связанным с этим гайдом

Claude Opus 5

Chat

Премиальная модель Claude для сложного анализа, программирования и профессиональной работы с длинным контекстом.

AnthropicСоздать API Key >

Claude Fable 5

Chat

Премиальная модель Claude для глубокого рассуждения и сложной объемной работы.

AnthropicСоздать API Key >

Claude Fable 5.1

Chat

Модель класса Mythos для долгосрочных задач программирования, исследований и работы со знаниями.

AnthropicСоздать API Key >

Claude Opus 4.8

Chat

Высокопроизводительная модель Claude для сложных задач, требующих глубоких рассуждений и профессиональной работы.

AnthropicСоздать API Key >

Claude Sonnet 5

Chat

Сбалансированная модель Claude для продвинутого рассуждения, программирования и повседневной работы.

AnthropicСоздать API Key >

Недавние статьи

Лучшая AI-модель для ролевых игр: постоянство персонажа, память и API

2026-09-15

Kling 3.0 API: миграция, Motion Control и код

2026-09-15

Higgsfield против Artlist: сравниваем стоимость, лицензии и рабочие процессы

2026-09-14

Бесплатный API-ключ для LLM: 8 способов получить доступ и их лимиты (2026)

2026-09-13
AIREITER

Есть вопросы? Свяжитесь с нами
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

AI-видео

AI-изображения

Блог

Посмотреть все →

Компания

Политика конфиденциальностиУсловия обслуживанияПолитика возврата

© 2026 AIReiter. Все права защищены.