AIREITER
DOCS APIPRECIOS
PLANTILLAS
  • AIReiter
  • Blog
  • Análisis de Iris Search Agent: empieza con Mini, no con Pro

Análisis de Iris Search Agent: empieza con Mini, no con Pro

Última actualización: 2026-09-14 18:55:07

Iris pinta muy bien como agente de búsqueda con pesos abiertos, pero la cifra que realmente importa no es 88.6. Es el salto de 17.5 puntos en BrowseComp que logra Iris-mini solo al cambiar cómo gestiona el contexto. Empieza por Iris-mini y el harness oficial; deja Iris-pro para equipos que ya operan inferencia en varios nodos.

La decisión sobre Iris, resumida en una tabla

La recomendación práctica con Iris Search Agent es clara: evalúa primero Iris-mini. Iris-pro publica mejores resultados, pero su ejemplo oficial de lanzamiento exige una infraestructura paralela muy superior. Además, a fecha del 14 de septiembre de 2026, ninguno de los dos checkpoints cuenta con un proveedor de inferencia alojada en Hugging Face.

PreguntaIris-miniIris-pro
Modelo baseQwen3.6-35B-A3BQwen3.5-397B-A17B
Parámetros totales / activos35B / 3B397B / 17B
Ventana de contexto256K256K
Ejemplo oficial de SGLangTP 4TP 8 + EP 8
BrowseComp, discard-all82.288.6
DeepSearchQA, discard-all86.992.9
LicenciaApache 2.0Apache 2.0
Proveedor HF alojadoNingunoNinguno
Mejor encajeReproducción, pilotos de investigación, desarrollo de harnessesLaboratorios de investigación bien equipados

Fuentes: las fichas oficiales de los modelos Iris-mini e Iris-pro, y el repositorio de Iris.

Los pesos, las fichas de los modelos y el código de evaluación Iris-Harness son públicos. El repositorio aún indica que las canalizaciones de construcción de datos y entrenamiento llegarán “próximamente”, así que Iris ofrece pesos abiertos y un harness de evaluación abierto, pero todavía no una receta de entrenamiento publicada al completo.

El benchmark cambia cuando cambia el harness

Los resultados de Iris en benchmarks no deben leerse como una propiedad exclusiva de los checkpoints. AllSpark afirma expresamente que una cifra publicada pertenece al agente y a su harness, y las ablaciones oficiales explican el motivo.

Modelo y configuraciónBrowseCompBrowseComp-ZHDeepSearchQAHLE
Iris-mini, sin gestión64.772.381.043.2
Iris-mini, discard-all82.284.886.952.3
Iris-mini, discard-all + retry85.985.189.952.4
Iris-pro, sin gestión72.676.886.450.8
Iris-pro, discard-all88.685.192.956.4
Iris-pro, discard-all + retry90.385.193.456.6

El README de Iris en GitHub define discard-all como un reinicio a la pregunta original cuando el contexto acumulado supera un umbral. retry reinicia un episodio que terminó sin una respuesta analizable, pero conserva un breve resumen de las vías que ya se descartaron.

En Iris-mini, discard-all eleva BrowseComp de 64.7 a 82.2: 17.5 puntos sin tocar el checkpoint. En Iris-pro, la misma comparación pasa de 72.6 a 88.6, una mejora de 16 puntos. Un despliegue que prescinda del formato de conversación oficial, la política de reinicio, las herramientas de búsqueda o el parser de respuestas no está reproduciendo el sistema anunciado.

Las tablas principales entre modelos también exigen cautela. AllSpark indica que los valores de referencia proceden de los informes públicos de cada proyecto y pueden utilizar configuraciones distintas de gestión de contexto. Iris-mini lidera su clase de tamaño listada en BrowseComp, BrowseComp-ZH y HLE, pero XYZ-Aquila-mini sigue por delante en DeepSearchQA, 89.5 frente a 86.9. Iris-pro lidera o empata con los sistemas listados de alrededor de 400B en las cuatro columnas, aunque su ventaja en DeepSearchQA sobre XYZ-Aquila-pro es de solo 0.4 puntos.

Iris-mini o Iris-pro: la infraestructura manda

Iris-mini es el checkpoint lógico para empezar, porque los parámetros activos no eliminan las necesidades de almacenamiento y memoria del modelo completo. El router MoE activa unos 3B de los 35B parámetros en cada paso, pero el checkpoint íntegro sigue teniendo que almacenarse y servirse.

El comando oficial de Iris-mini utiliza paralelismo tensorial a cuatro vías y un contexto de 262,144 tokens:

python -m sglang.launch_server \
  --model-path AllSpark-Research/Iris-mini \
  --served-model-name Iris-mini \
  --port 21234 --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

La configuración documentada de Iris-pro emplea --tp-size 8 --ep-size 8. Su ficha oficial del modelo señala que el checkpoint de 397B requiere varios nodos o un único nodo de gran tamaño. No es una diferencia menor de configuración, sino una advertencia de despliegue.

Con discard-all, el modelo grande suma 6.4 puntos frente a mini en BrowseComp y 6.0 en DeepSearchQA, pero apenas 0.3 en BrowseComp-ZH. Los equipos no deberían asumir ese salto de infraestructura solo porque “pro” sea más grande. La mejora tiene que ser relevante para la carga de trabajo que se está evaluando.

Ninguna de las fichas de modelo publica mediciones de latencia, rendimiento, uso de VRAM ni coste operativo. Sin esos datos, no es posible hacer una comparación responsable de coste por respuesta. Ejecuta un piloto acotado en lugar de convertir el número de parámetros en estimaciones inventadas de GPU.

Cómo hacer una primera evaluación reproducible de Iris

La primera evaluación de Iris debe recorrer el flujo completo del agente, no limitarse a enviar preguntas triviales a un endpoint de chat completions. El harness oficial incluye el bucle del agente, herramientas de búsqueda y scraping, estrategias de contexto, adaptadores de benchmarks y evaluadores.

  1. Sirve Iris-mini con los parsers oficiales. Usa el comando de SGLang anterior y verifica que el endpoint compatible con OpenAI responde en el puerto 21234.
  2. Instala Iris-Harness. El repositorio utiliza uv para crear el entorno.
  3. Prepara los datos del benchmark. Ejecuta el script de preparación incluido en vez de montar una copia ad hoc.
  4. Empieza con una porción reducida del benchmark. El ejemplo oficial selecciona browsecomp:0:1 y un umbral de descarte de 131,072 tokens.
  5. Registra toda la configuración. Guarda junto a cada resultado la revisión del modelo, el backend de herramientas, el umbral, las versiones de los parsers y la política de reintentos.
git clone https://github.com/AllSpark-Research/Iris.git
cd Iris/Iris-Harness
uv sync
uv run python data/prepare_data.py

bash scripts/run_eval.sh \
  --base-url http://127.0.0.1:21234/v1 \
  --llm-config iris-mini \
  --benchmarks "browsecomp:0:1" \
  --context-discard-threshold 131072

Iris está entrenado para utilizar la interfaz de function calling de OpenAI y encerrar las respuestas finales en \boxed{}. El harness también arrastra razonamiento previo a turnos posteriores. Sustituir ese protocolo por una plantilla genérica de chat puede romper el uso de herramientas o la evaluación, incluso si la generación de texto normal parece funcionar.

Aplica tres comprobaciones de aceptación en el piloto:

  • Calidad de respuesta: ¿El agente recupera la evidencia necesaria, en vez de limitarse a adivinar la entidad final?
  • Eficiencia de búsqueda: ¿Cuántas llamadas de búsqueda y scraping consume cada respuesta aceptada?
  • Capacidad de recuperación: Cuando se descarta el contexto o se reintenta un episodio, ¿el agente evita repetir la misma ruta fallida?

El lanzamiento oficial no ofrece ningún SLA de producción ni un endpoint alojado. Reproducir con éxito un benchmark demuestra que el sistema funciona bajo un harness conocido; no demuestra su fiabilidad en investigación web sin restricciones.

Qué se ha publicado y qué impide aún una reproducción completa

El lanzamiento actual de Iris es importante, pero incompleto. Los desarrolladores pueden descargar ambos checkpoints sin pasar por una aprobación, utilizarlos comercialmente bajo Apache 2.0, revisar las tablas de benchmarks y ejecutar Iris-Harness contra un endpoint compatible con OpenAI.

Disponible ahoraAún no publicado en el repositorio
Pesos de Iris-mini e Iris-proCanalización completa de construcción de datos
Configuraciones de modelos y plantillas de chatCanalización completa de entrenamiento
Marco de evaluación Iris-HarnessTamaños de datasets y proporciones de mezcla
Código de búsqueda, scraping, gestión de contexto y evaluaciónCoste completo de reproducción
Ejemplos de serving con SGLangEstudio independiente de fiabilidad en producción

El paper describe la reconstrucción inversa de preguntas multi-hop a partir de grafos de hipervínculos, el filtrado de trayectorias tanto a nivel de ejecución completa como de turnos individuales, y la alternancia entre ajuste fino supervisado y aprendizaje por refuerzo con búsqueda en directo. Sin embargo, el estado de publicación del repositorio implica que los equipos externos pueden reproducir la inferencia y la evaluación antes de poder reproducir el entrenamiento de principio a fin.

Las primeras conversaciones de la comunidad reflejan esa diferencia. Una cuenta de noticias técnicas resumió el lanzamiento así:

“Los pesos y el código de evaluación son públicos. Los datos y la receta de entrenamiento llegarán más adelante.” — @Chinazhidx

Ese es el nivel de confianza adecuado. Iris está lanzado formalmente, no es un rumor, pero sus afirmaciones más ambiciosas aún necesitan ejecuciones externas con ajustes de harness divulgados. Las páginas de Hugging Face mostraban 335 descargas mensuales para Iris-mini y 685 para Iris-pro al consultarlas el 14 de septiembre de 2026; las descargas son señales de actividad, no una validación.

Preguntas frecuentes sobre Iris Search Agent

¿Iris es un modelo o un producto de búsqueda completo?

Iris es una familia de modelos con pesos abiertos junto a un harness de evaluación. El lanzamiento no incluye una aplicación de búsqueda para consumidores alojada ni una API gestionada.

¿Puede ejecutarse Iris en local?

Sí, pero “local” no significa que sea apto para un portátil. El ejemplo oficial de Iris-mini usa paralelismo tensorial a cuatro vías; Iris-pro está documentado para paralelismo tensorial a ocho vías y paralelismo de expertos a ocho vías.

¿Qué significa 35B-A3B?

Iris-mini tiene unos 35B parámetros totales y 3B parámetros activos por paso de inferencia. La activación dispersa reduce el cómputo frente a activar todos los parámetros, pero el checkpoint completo sigue afectando al almacenamiento y a la memoria de serving.

¿Es Iris completamente open source?

Los checkpoints y el harness son públicos bajo términos permisivos, pero el repositorio sigue listando las canalizaciones de construcción de datos y entrenamiento como futuras. La descripción actual más precisa es “pesos abiertos con código de evaluación abierto”.

¿Iris tiene API?

Los modelos pueden servirse detrás de un endpoint compatible con OpenAI mediante SGLang o vLLM. Ninguna de las fichas de modelo lista un proveedor de inferencia alojada en Hugging Face ni una API oficial gestionada de Iris.

¿Qué modelo de Iris debería usar?

Usa Iris-mini para evaluar, salvo que una carga de trabajo medida requiera el rendimiento adicional de Iris-pro en benchmarks y el equipo ya disponga de una infraestructura adecuada de varios nodos o nodos de gran tamaño.

Siguiente paso: un piloto con mini y un harness fijo

Descarga Iris-mini, conserva el protocolo oficial de herramientas y parsers, y somete a benchmark un conjunto pequeño de preguntas parecidas a la carga de trabajo prevista. Fija la política de contexto antes de comparar resultados: cambiar discard-all o retry puede mover más la puntuación que cambiar de modelo.

Pasa a Iris-pro solo si el piloto identifica una brecha de calidad que justifique su carga de despliegue. La disyuntiva pendiente es sencilla: Iris ofrece un rendimiento de búsqueda con pesos abiertos inusualmente alto según sus resultados publicados, pero todavía no hay detalles reproducibles del entrenamiento ni evidencia sobre costes de producción.

>_Directorio de modelos AIReiter

Acceso API rápido a modelos relacionados con esta guía

Claude Opus 5

Chat

Un modelo premium de Claude para razonamiento complejo, programación y trabajo profesional con contexto largo.

AnthropicCrear API Key >

Claude Fable 5

Chat

Un modelo premium de Claude para razonamiento profundo y trabajo complejo de formato largo.

AnthropicCrear API Key >

Claude Fable 5.1

Chat

Modelo de clase Mythos para programación, investigación y trabajo de conocimiento de largo alcance.

AnthropicCrear API Key >

Claude Opus 4.8

Chat

Un modelo Claude de alta capacidad para tareas que exigen razonamiento y trabajo profesional.

AnthropicCrear API Key >

Claude Sonnet 5

Chat

Un modelo Claude equilibrado para razonamiento avanzado, programación y trabajo diario.

AnthropicCrear API Key >

Publicaciones recientes

Mejor modelo de IA para roleplay: consistencia, memoria y acceso por API

2026-09-15

API de Kling 3.0: guía de migración, Motion Control y código

2026-09-15

Higgsfield frente a Artlist: comparación de costes, licencias y flujo de trabajo

2026-09-14

Clave API gratuita para LLM: 8 formas de registrarse y sus límites (2026)

2026-09-13
AIREITER

¿Preguntas? Contáctanos en
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Video IA

Imagen IA

Blog

Ver todo →

Compañía

Política de privacidadTérminos de servicioPolítica de reembolso

© 2026 AIReiter. Todos los derechos reservados.