AIREITER
DOCS APIPREÇOS
TEMPLATES
  • AIReiter
  • Blog
  • Análise do Iris Search Agent: comece pelo Mini, não pelo Pro

Análise do Iris Search Agent: comece pelo Mini, não pelo Pro

Última Atualização: 2026-09-14 18:55:45

O Iris se apresenta como um agente de busca open-weight forte, mas o número mais importante não é 88,6. É o salto de 17,5 pontos no BrowseComp obtido apenas ao mudar a gestão de contexto do Iris-mini. Comece pelo Iris-mini com o harness oficial e deixe o Iris-pro para equipes que já operam inferência em múltiplos nós.

A escolha entre os modelos Iris, resumida

A recomendação prática para o Iris Search Agent é direta: avalie primeiro o Iris-mini. O Iris-pro divulga resultados melhores, mas seu exemplo oficial de lançamento exige uma infraestrutura paralela bem mais robusta. Além disso, nenhum dos dois checkpoints tinha um provedor de inferência hospedada no Hugging Face em 14 de setembro de 2026.

PerguntaIris-miniIris-pro
Modelo-baseQwen3.6-35B-A3BQwen3.5-397B-A17B
Parâmetros totais / ativos35B / 3B397B / 17B
Janela de contexto256K256K
Exemplo oficial com SGLangTP 4TP 8 + EP 8
BrowseComp, discard-all82,288,6
DeepSearchQA, discard-all86,992,9
LicençaApache 2.0Apache 2.0
Provedor hospedado no HFNenhumNenhum
Mais indicado paraReprodução, pilotos de pesquisa e desenvolvimento de harnessLaboratórios de pesquisa bem equipados

Fontes: os model cards oficiais do Iris-mini e do Iris-pro, além do repositório do Iris.

Os pesos, os model cards e o código de avaliação Iris-Harness são públicos. O repositório ainda informa que os pipelines de construção de dados e treinamento estão “coming soon”. Portanto, o Iris disponibiliza pesos abertos e um harness de avaliação aberto, mas ainda não oferece uma receita de treinamento completamente publicada.

Os benchmarks mudam junto com o harness

Não dá para tratar os resultados de benchmark do Iris como propriedades exclusivas dos checkpoints. A AllSpark afirma explicitamente que um número publicado pertence ao agente e ao seu harness — e as ablações oficiais deixam claro o motivo.

Modelo e configuraçãoBrowseCompBrowseComp-ZHDeepSearchQAHLE
Iris-mini, sem gestão64,772,381,043,2
Iris-mini, discard-all82,284,886,952,3
Iris-mini, discard-all + retry85,985,189,952,4
Iris-pro, sem gestão72,676,886,450,8
Iris-pro, discard-all88,685,192,956,4
Iris-pro, discard-all + retry90,385,193,456,6

O README do Iris no GitHub define discard-all como o retorno à pergunta original quando o contexto acumulado ultrapassa um limite. Já retry reinicia um episódio que terminou sem uma resposta analisável, carregando um resumo curto do que foi descartado.

No Iris-mini, discard-all eleva o BrowseComp de 64,7 para 82,2 — 17,5 pontos sem trocar o checkpoint. No Iris-pro, a mesma comparação leva o resultado de 72,6 a 88,6, um ganho de 16 pontos. Uma implantação que deixa de lado o formato oficial de conversa, a política de reset, as ferramentas de busca ou o parser de respostas não está reproduzindo o sistema divulgado.

As tabelas principais de comparação entre modelos também pedem cautela. A AllSpark informa que os valores de referência vieram dos relatórios públicos de cada projeto e podem empregar configurações distintas de gestão de contexto. O Iris-mini lidera sua faixa de tamanho listada em BrowseComp, BrowseComp-ZH e HLE, mas o XYZ-Aquila-mini segue à frente no DeepSearchQA: 89,5 contra 86,9. O Iris-pro lidera ou empata com os sistemas de aproximadamente 400B relacionados nas quatro colunas, embora sua vantagem no DeepSearchQA sobre o XYZ-Aquila-pro seja de apenas 0,4 ponto.

Iris-mini ou Iris-pro: a infraestrutura decide

O Iris-mini é o checkpoint mais sensato para começar, pois os parâmetros ativos não eliminam as exigências de armazenamento e memória do modelo total. O roteador MoE ativa cerca de 3B dos 35B parâmetros a cada etapa, mas o checkpoint completo ainda precisa ser armazenado e servido.

O comando oficial do Iris-mini usa paralelismo de tensor em quatro vias e contexto de 262.144 tokens:

python -m sglang.launch_server \
  --model-path AllSpark-Research/Iris-mini \
  --served-model-name Iris-mini \
  --port 21234 --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

A configuração documentada do Iris-pro usa --tp-size 8 --ep-size 8. Seu model card oficial afirma que o checkpoint de 397B exige múltiplos nós ou um nó único de grande porte. É um alerta de implantação, não uma mera diferença de configuração.

Com discard-all, o modelo maior abre 6,4 pontos sobre o mini no BrowseComp e 6,0 no DeepSearchQA, mas somente 0,3 no BrowseComp-ZH. Equipes não deveriam assumir o salto de infraestrutura apenas porque o modelo “pro” é maior. O ganho precisa importar para a carga de trabalho avaliada.

Nenhum dos model cards publica medições de latência, throughput, uso de VRAM ou custo operacional. Sem esses dados, não é possível fazer uma comparação responsável de custo por resposta. Rode um piloto delimitado, em vez de transformar contagens de parâmetros em estimativas inventadas de GPUs.

Como fazer a primeira avaliação reproduzível do Iris

A primeira avaliação do Iris deve testar o caminho completo do agente, não enviar perguntas triviais a um endpoint de chat completions. O harness oficial inclui o loop do agente, ferramentas de busca e raspagem, estratégias de contexto, adaptadores de benchmark e avaliadores.

  1. Sirva o Iris-mini com os parsers oficiais. Use o comando SGLang acima e confirme que o endpoint compatível com OpenAI responde na porta 21234.
  2. Instale o Iris-Harness. O repositório usa uv para criar o ambiente.
  3. Prepare os dados de benchmark. Execute o script de preparação incluído, em vez de montar uma cópia improvisada.
  4. Comece por uma fatia pequena do benchmark. O exemplo oficial seleciona browsecomp:0:1 e um limite de descarte de 131.072 tokens.
  5. Registre a configuração completa. Mantenha a revisão do modelo, o backend das ferramentas, o limite, as versões dos parsers e a política de retry junto de cada resultado.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py

bash scripts/run_eval.sh \
  --base-url http://127.0.0.1:21234/v1 \
  --llm-config iris-mini \
  --benchmarks "browsecomp:0:1" \
  --context-discard-threshold 131072

O Iris é treinado para usar a interface de function calling da OpenAI e envolver as respostas finais em \boxed{}. O harness também leva o raciocínio anterior para os turnos seguintes. Substituir esse protocolo por um template genérico de chat pode comprometer o uso de ferramentas ou a avaliação, mesmo quando a geração de texto comum parece normal.

Use três critérios de aceitação no piloto:

  • Qualidade da resposta: O agente recupera as evidências necessárias ou apenas acerta a entidade final por palpite?
  • Eficiência de busca: Quantas chamadas de busca e raspagem são consumidas por resposta aceita?
  • Comportamento de recuperação: Ao descartar o contexto ou repetir um episódio, o agente evita refazer o mesmo caminho que falhou?

O lançamento oficial não oferece SLA de produção nem endpoint hospedado. Reproduzir um benchmark com sucesso mostra que o sistema funciona sob um harness conhecido; isso não comprova confiabilidade em pesquisa web sem restrições.

O que já foi publicado — e o que ainda impede a reprodução completa

O lançamento atual do Iris é relevante, mas incompleto. Desenvolvedores podem baixar ambos os checkpoints sem aprovação prévia, usá-los comercialmente sob a Apache 2.0, inspecionar as tabelas de benchmark e executar o Iris-Harness contra um endpoint compatível com OpenAI.

Disponível agoraAinda não publicado no repositório
Pesos do Iris-mini e do Iris-proPipeline completo de construção de dados
Configurações dos modelos e templates de chatPipeline completo de treinamento
Framework de avaliação Iris-HarnessTamanhos dos datasets e proporções da mistura
Código de busca, raspagem, gestão de contexto e avaliaçãoCusto completo de reprodução
Exemplos de serving com SGLangEstudo independente de confiabilidade em produção

O artigo descreve a reconstrução reversa de perguntas multi-hop a partir de grafos de hyperlinks, a filtragem de trajetórias no nível da execução inteira e de turnos individuais, além da alternância entre ajuste fino supervisionado e reinforcement learning com busca ao vivo. No entanto, o status de lançamento do repositório significa que equipes externas conseguem reproduzir inferência e avaliação antes de reproduzir o treinamento de ponta a ponta.

As primeiras discussões da comunidade refletem essa distinção. Uma conta de notícias técnicas resumiu o lançamento assim:

“Pesos + código de avaliação são públicos. Os dados e a receita de treinamento chegam depois.” — @Chinazhidx

Esse é o nível certo de confiança. O Iris foi lançado formalmente, não é um rumor, mas suas alegações mais fortes ainda exigem execuções externas com configurações de harness divulgadas. As páginas do Hugging Face mostravam 335 downloads mensais do Iris-mini e 685 do Iris-pro quando foram verificadas em 14 de setembro de 2026; contagens de download sinalizam atividade, não validação.

Perguntas frequentes sobre o Iris Search Agent

O Iris é um modelo ou um produto de busca completo?

O Iris é uma família de modelos open-weight com um harness de avaliação. O lançamento não inclui uma aplicação de busca para consumidores hospedada nem uma API gerenciada.

É possível executar o Iris localmente?

Sim, mas “localmente” não significa que seja adequado para um notebook. O exemplo oficial do Iris-mini usa paralelismo de tensor em quatro vias; o Iris-pro é documentado para paralelismo de tensor em oito vias e de especialistas em oito vias.

O que significa 35B-A3B?

O Iris-mini tem cerca de 35B parâmetros totais e 3B de parâmetros ativos por etapa de inferência. A ativação esparsa reduz o processamento em relação à ativação de todos os parâmetros, mas o checkpoint completo ainda afeta o armazenamento e a memória de serving.

O Iris é totalmente open source?

Os checkpoints e o harness são públicos sob termos permissivos, mas o repositório ainda lista os pipelines de construção de dados e treinamento como futuros lançamentos. “Pesos abertos com código aberto de avaliação” é a descrição mais precisa no momento.

O Iris tem API?

Os modelos podem ser servidos por trás de um endpoint compatível com OpenAI usando SGLang ou vLLM. Nenhum provedor de inferência hospedada do Hugging Face nem API oficial gerenciada do Iris é listado em qualquer um dos model cards.

Qual modelo Iris devo usar?

Use o Iris-mini para avaliação, a menos que uma carga de trabalho medida exija o desempenho adicional do Iris-pro em benchmarks e a equipe já tenha uma infraestrutura adequada com múltiplos nós ou nós de grande porte.

Próximo passo: pilote o mini com um harness fixo

Baixe o Iris-mini, preserve o protocolo oficial de ferramentas e parsers e avalie um conjunto pequeno de perguntas parecido com a carga de trabalho pretendida. Defina a política de contexto antes de comparar resultados, pois alterar discard-all ou retry pode mudar a pontuação mais do que trocar de modelo.

Avance para o Iris-pro apenas se o piloto identificar uma lacuna de qualidade que justifique seu peso operacional. A troca ainda em aberto é simples: o Iris oferece desempenho open-weight de busca excepcional nos resultados divulgados, mas detalhes reproduzíveis de treinamento e evidências sobre custo em produção ainda não estão disponíveis.

>_Diretório de modelos AIReiter

Acesso API rápido aos modelos relacionados a este guia

Claude Opus 5

Chat

Um modelo premium do Claude para raciocínio complexo, programação e trabalho profissional com contexto longo.

AnthropicCriar API Key >

Claude Fable 5

Chat

Um modelo premium Claude para raciocínio profundo e trabalhos complexos de longo formato.

AnthropicCriar API Key >

Claude Fable 5.1

Chat

Modelo de classe Mythos para programação de longo prazo, pesquisa e trabalho intelectual.

AnthropicCriar API Key >

Claude Opus 4.8

Chat

Um modelo Claude de alta capacidade para raciocínio exigente e trabalho profissional.

AnthropicCriar API Key >

Claude Sonnet 5

Chat

Um modelo Claude equilibrado para raciocínio avançado, programação e trabalho do dia a dia.

AnthropicCriar API Key >

Posts recentes

Melhor modelo de IA para roleplay: consistência, memória e acesso por API

2026-09-15

API do Kling 3.0: guia de migração, Motion Control e código

2026-09-15

Higgsfield vs Artlist: custos, licenciamento e fluxo de trabalho

2026-09-14

Chave de API gratuita para LLM: 8 caminhos de cadastro e limites (2026)

2026-09-13
AIREITER

Dúvidas? Entre em contato em
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Vídeo IA

Imagem IA

Blog

Ver Tudo →

Empresa

Política de PrivacidadeTermos de ServiçoPolítica de Reembolso

© 2026 AIReiter. Todos os direitos reservados.