AIREITER

AstaBrief 8B vs OpenScholar vs PaperQA2: comparación de flujos de trabajo

Última actualización: 2026-10-02 19:17:34

AstaBrief 8B, OpenScholar y PaperQA2 suelen aparecer en las mismas listas de herramientas de IA científica, pero cada uno entra en juego en un punto distinto del proceso de investigación. OpenScholar es la opción más sólida por defecto para sintetizar literatura amplia con respaldo bibliográfico; PaperQA2 resulta más práctico para trabajar con una colección controlada de PDF; y AstaBrief 8B es el redactor de informes orientado a la velocidad que conviene añadir cuando la recuperación de información ya está resuelta. Esta diferencia importa bastante más que la etiqueta del tamaño del modelo.

Tres sistemas, tres puntos de partida

SistemaParte deAlcance de la recuperaciónResultado principalPrimer uso recomendado
AstaBrief 8BUna pregunta de investigación y fragmentos recuperadosLo proporciona el flujo de trabajo Asta/ScholarQA o tu propia canalizaciónUn informe rápido con citasGenerar un informe rápidamente después de recuperar la información
OpenScholarUna pregunta científicaOpenScholar DataStore, recuperadores, rerankers y otras fuentes de recuperaciónSíntesis extensa respaldada por citasBuscar y sintetizar información de una literatura amplia
PaperQA2Una pregunta y un directorio o corpus de documentosIndexación local, búsqueda por metadatos, embeddings, reranking y búsqueda agénticaRespuesta basada en evidencias con citas integradasPlantear preguntas repetibles sobre documentos controlados

Los corpus integrados más grandes cambian tiempo de preparación por mayor amplitud de descubrimiento; los archivos aportados por el usuario sacrifican amplitud a cambio de un mayor control sobre las evidencias.

AstaBrief 8B: generación rápida de informes cuando la recuperación ya está hecha

AstaBrief 8B es un modelo compacto de generación de informes publicado por Ai2. El anuncio oficial describe como entrada una pregunta de investigación y fragmentos de literatura recuperados, no un servicio independiente para buscar artículos. El modelo se distribuye con una licencia Apache 2.0, y Ai2 también publicó los datos de entrenamiento y un flujo de ejemplo para generar informes a partir de los PDF de los propios investigadores.

Ai2 informa de que la canalización completa de Asta promedió 51.1 segundos en el modo Fast, frente a 178.5 segundos en el modo Thinking, es decir, unas 3.5× más rápida en esa comparación. Es una medición de la canalización completa, no una promesa universal sobre la velocidad de inferencia en cualquier despliegue local.

AstaBrief encaja bien en canalizaciones que ya proporcionan pasajes recuperados, identificadores de cita estables y un paso de revisión para comprobar que cada afirmación está respaldada. No conviene tratarlo como un sustituto independiente del datastore y la pila de recuperación de OpenScholar: si faltan fragmentos, el redactor no puede recuperar artículos que nunca recibió.

Para conocer mejor la instalación y el despliegue local, consulta nuestra reseña de AstaBrief 8B y guía de despliegue local.

OpenScholar: un flujo amplio para sintetizar literatura científica

OpenScholar utiliza OpenScholar DataStore, un corpus de 45 millones de artículos de acceso abierto y 236 millones de embeddings de pasajes, junto con recuperadores entrenados, rerankers, generación respaldada por citas y un bucle de retroalimentación (Nature).

OpenScholar es el mejor punto de partida cuando la pregunta se parece a alguna de estas:

  • “¿Qué dice la literatura en varios subcampos?”
  • “Compara métodos en un área de investigación amplia y cambiante.”
  • “Encuentra los artículos relevantes antes de redactar la síntesis.”

El artículo de Nature señala que la configuración de recuperación combinada alcanzó 49.6 de corrección y 47.6 de F1 de citas en su ablación de informática, por encima de la recuperación basada solo en la web y de la basada solo en Semantic Scholar. Un datastore amplio, un recuperador, un reranker y un bucle de retroalimentación requieren más infraestructura que un modelo pequeño de generación de informes; ejecutar un checkpoint 8B sin esos componentes no reproduce el sistema completo.

PaperQA2: la mejor opción para un conjunto local de documentos controlado

PaperQA2 está diseñado en torno a la investigación basada en documentos. Su flujo de trabajo puede analizar PDF, Markdown, HTML, archivos de Office, código fuente, imágenes y tablas; recuperar pasajes candidatos; crear resúmenes contextuales; volver a ordenar las evidencias; y generar una respuesta con citas. El paquete admite modelos locales y proveedores compatibles con LiteLLM, aunque sus valores predeterminados documentados utilizan modelos y embeddings alojados.

PaperQA2 permite indicar un directorio, crear un índice reutilizable y ajustar el modelo, los embeddings, el número de evidencias y los límites de fuentes. El repositorio documenta un valor predeterminado de 10 pasajes de evidencia y 5 fuentes máximas por respuesta, mientras que su configuración de alta calidad utiliza más evidencias y tiene un coste mayor.

Por eso PaperQA2 resulta especialmente interesante para:

  • Los PDF privados o no publicados de un laboratorio.
  • Un conjunto de evidencias específico de un proyecto.
  • Preguntas repetidas sobre la misma colección de documentos.
  • Flujos de trabajo que necesitan figuras de PDF, tablas, metadatos o referencias a páginas.

La contrapartida es que depende del proveedor y de la configuración. PaperQA2 es de código abierto, pero la calidad y el coste finales dependen del LLM elegido, el modelo de embeddings, el analizador, el corpus y los ajustes. El repositorio oficial no promete un precio fijo por pregunta.

“La configuración predeterminada utiliza modelos de OpenAI y una base de datos vectorial NumPy, pero el paquete está diseñado para admitir LLM, modelos de embeddings, almacenes vectoriales y servidores locales alternativos.” — FutureHouse, documentación de PaperQA2

La misma tarea de investigación, flujos de trabajo diferentes

Para descubrir literatura en un campo desconocido: elige OpenScholar

Empieza con OpenScholar cuando todavía no sepas qué artículos deberían formar parte de la respuesta. Su gran datastore abierto y su canalización especializada de recuperación están pensados para localizar y sintetizar evidencias de muchos artículos.

Para la biblioteca privada de un proyecto: elige PaperQA2

Usa PaperQA2 cuando el límite de las evidencias sea el directorio del proyecto. Indexa los artículos, mantén estable el conjunto de fuentes y ajusta el número de pasajes de evidencia y de fuentes finales. Así, un revisor puede inspeccionar el corpus exacto utilizado para elaborar la respuesta.

Para generar rápidamente un informe después de recuperar la información: elige AstaBrief 8B

Usa AstaBrief después de que otro componente haya realizado el trabajo de descubrimiento. Es la opción más limpia cuando importan más la latencia, el control local o el volumen de informes que construir un sistema completo de búsqueda bibliográfica.

Para una pila híbrida: recupera con OpenScholar y redacta con AstaBrief

Reúne las evidencias con un recuperador y un reranker especializados en literatura científica, pasa los fragmentos seleccionados a AstaBrief 8B y ejecuta una comprobación independiente del respaldo de cada afirmación antes de publicar. Así combinas el descubrimiento de OpenScholar con la ruta compacta de generación de AstaBrief, aunque introduces una responsabilidad de integración que ningún componente por separado elimina.

Lo que demuestra realmente el benchmark publicado

Las versiones de los artículos de OpenScholar en Nature y PMC ofrecen la comparación más clara, dentro del mismo benchmark, con PaperQA2. En ScholarQABench, la puntuación publicada para varias publicaciones en la rúbrica Scholar-CS fue de 51.1 para OpenScholar-8B y 45.6 para PaperQA2. PaperQA2 obtuvo una ligera ventaja en F1 de citas en esa tabla: 48.0 frente a 47.9 de OpenScholar-8B. El artículo estima el coste de PaperQA2 en $0.30–$2.30 por pregunta, frente a $0.003 para OpenScholar-8B según los supuestos de coste del propio artículo.

Resultado publicado en ScholarQABenchOpenScholar-8BPaperQA2
Puntuación de la rúbrica Scholar-CS51.145.6
F1 de citas de Scholar-CS47.948.0
Coste estimado por pregunta$0.003$0.30–$2.30

Estas cifras no constituyen una clasificación universal. El artículo evaluó PaperQA2 utilizando OpenScholar DataStore porque el datastore propio de PaperQA2 no era público. Además, la evaluación se realizó con un modelo y una configuración concretos. Y, sobre todo, la comparación publicada no incluye AstaBrief 8B en la misma configuración de ScholarQABench. Los resultados de velocidad y calidad publicados para AstaBrief proceden de evaluaciones centradas en Asta realizadas por Ai2, así que no permiten establecer su posición frente a OpenScholar y PaperQA2.

El artículo también señala que las respuestas de PaperQA2 presentaban una alta precisión de citas, pero a menudo se apoyaban en uno o pocos artículos, lo que reducía la cobertura y la organización de múltiples publicaciones. La precisión de las citas y la cobertura de la literatura son objetivos distintos.

Una regla práctica para elegir

Tu prioridadOpción recomendadaMotivo
Descubrir literatura desconocida a gran escalaOpenScholarLa recuperación y la síntesis están integradas
Mantener el conjunto de evidencias dentro de una carpeta localPaperQA2El corpus, el índice y los ajustes están bajo control del usuario
Generar rápidamente un informe a partir de evidencias proporcionadasAstaBrief 8BGeneración compacta de informes en un solo paso
Ejecutar el sistema detrás de un firewall con pesos abiertosAstaBrief 8B u OpenScholar-8BArtefactos de modelo abiertos; la pila que los rodea sigue siendo importante
Auditar cada afirmación frente a un pasaje conocidoPaperQA2 o una solución híbridaLa indexación local y los controles explícitos sobre las evidencias facilitan la revisión
Minimizar el coste cuando la inferencia local sea viableOpenScholar-8B; prueba AstaBrief por separadoLas cifras de coste publicadas no son directamente comparables

Antes de confiar en cualquiera de los tres, comprueba los límites de recuperación, el respaldo de las citas, la cobertura de la literatura, el alcance de las afirmaciones y la reproducibilidad del corpus y de la configuración.

Preguntas frecuentes

¿AstaBrief 8B sustituye a OpenScholar?

No. AstaBrief 8B es principalmente un modelo de generación de informes que consume fragmentos recuperados, mientras que OpenScholar incluye un datastore científico, recuperación, reranking y un flujo de retroalimentación automática. AstaBrief puede sustituir parte de la capa de generación, pero no reemplaza automáticamente toda la pila de descubrimiento.

¿AstaBrief 8B recupera artículos por sí solo?

La descripción oficial de AstaBrief presenta el modelo como un sistema que recibe una pregunta de investigación y fragmentos de literatura recuperados. La recuperación la proporciona el flujo de trabajo Asta/ScholarQA que lo rodea o una canalización independiente que construyas.

¿Cuál ofrece mayor precisión en las citas?

La tabla publicada de ScholarQABench concede a PaperQA2 una ventaja marginal en F1 de citas frente a OpenScholar-8B, 48.0 frente a 47.9, mientras que OpenScholar-8B obtiene una puntuación superior en la rúbrica Scholar-CS, 51.1 frente a 45.6. Esa comparación no incluye un resultado de AstaBrief en el mismo benchmark.

¿Puede PaperQA2 ejecutarse completamente en local?

PaperQA2 admite servidores de modelos locales, embeddings locales, índices locales y colecciones de documentos locales. Un despliegue completamente local seguirá dependiendo del analizador, el modelo de embeddings, la calidad del LLM, el hardware y la configuración que elijas.

¿Cuál es mejor para una revisión sistemática?

Ninguno debería sustituir un protocolo de revisión registrado, la selección humana y la verificación de las citas. Para descubrir literatura, OpenScholar es el mejor punto de partida para búsquedas amplias; para una biblioteca de evidencias predefinida, PaperQA2 ofrece un control más estricto del corpus; AstaBrief resulta útil para redactar una vez reunido el conjunto de evidencias.

En una sola frase: elige OpenScholar cuando lo más difícil sea encontrar la literatura adecuada, PaperQA2 cuando el reto sea controlar un corpus conocido y AstaBrief 8B cuando la recuperación ya esté resuelta y el cuello de botella sea la latencia de generación del informe.