AIREITER

AstaBrief 8B vs OpenScholar vs PaperQA2: comparação de fluxos de trabalho

Última Atualização: 2026-10-02 19:17:53

AstaBrief 8B, OpenScholar e PaperQA2 costumam aparecer na mesma lista de ferramentas de IA para pesquisa científica, mas cada um entra em uma etapa diferente do trabalho. OpenScholar é a melhor opção padrão para sínteses amplas da literatura com suporte de citações; PaperQA2 é mais prático para trabalhar com uma coleção controlada de PDFs; e AstaBrief 8B é o gerador de relatórios focado em velocidade, ideal depois que a recuperação de conteúdo já está resolvida. Essa diferença importa mais do que os rótulos de tamanho dos modelos.

Três sistemas, três pontos de partida

SistemaComeça comEscopo da recuperaçãoPrincipal resultadoMelhor uso inicial
AstaBrief 8BUma pergunta de pesquisa e trechos recuperadosFornecido pelo fluxo Asta/ScholarQA ou pelo seu próprio pipelineUm relatório rápido com citaçõesGerar rapidamente um relatório depois da recuperação
OpenScholarUma pergunta científicaOpenScholar DataStore, recuperadores, rerankers e outras fontes de recuperaçãoSíntese extensa com suporte de citaçõesPesquisar e sintetizar uma literatura ampla
PaperQA2Uma pergunta e um diretório ou corpus de documentosIndexação local, busca por metadados, embeddings, reranking e busca agênticaResposta baseada em evidências com citações no textoFazer perguntas repetidas sobre documentos controlados

Corpora integrados maiores trocam tempo de preparação por uma descoberta mais ampla; arquivos fornecidos pelo usuário fazem o caminho inverso, reduzindo o alcance em favor de um controle maior sobre as evidências.

AstaBrief 8B: otimizado para gerar relatórios rapidamente depois da recuperação

O AstaBrief 8B é um modelo compacto de geração de relatórios lançado pela Ai2. O anúncio oficial descreve como entrada uma pergunta de pesquisa acompanhada de trechos de literatura recuperados — não um serviço independente de busca de artigos. O modelo está disponível sob uma licença Apache 2.0, e a Ai2 também publicou os dados de treinamento e um fluxo de exemplo para gerar relatórios a partir dos PDFs dos próprios pesquisadores.

A Ai2 informa que o pipeline completo do Asta levou, em média, 51.1 segundos no modo Fast, contra 178.5 segundos no modo Thinking — cerca de 3.5× mais rápido nessa comparação. Essa é uma medição do pipeline, não uma promessa universal de velocidade de inferência para qualquer implantação local.

O AstaBrief se encaixa bem em pipelines que já fornecem passagens recuperadas, IDs de citação estáveis e uma etapa de revisão do suporte às afirmações. Ele não deve ser tratado como substituto independente do datastore e da camada de recuperação do OpenScholar: se os trechos estiverem incompletos, o gerador não terá como recuperar artigos que nunca recebeu.

Para ver em mais detalhes a instalação e a implantação local, confira nossa análise do AstaBrief 8B e o guia de implantação local.

OpenScholar: um fluxo de trabalho para sínteses amplas da literatura

O OpenScholar usa o OpenScholar DataStore, um corpus com 45 milhões de artigos de acesso aberto e 236 milhões de embeddings de passagens, além de recuperadores treinados, rerankers, geração com citações e um ciclo de autofeedback (Nature).

O OpenScholar é o melhor ponto de partida quando a pergunta se parece com uma destas:

  • “O que a literatura diz sobre diferentes subáreas?”
  • “Como comparar métodos em uma área de pesquisa ampla e em constante mudança?”
  • “Quais são os artigos relevantes antes de escrever a síntese?”

O artigo da Nature relata que a configuração combinada de recuperação alcançou 49.6 de correção e 47.6 de F1 de citação no estudo de ablação em ciência da computação, superando a recuperação somente na web e a baseada apenas no Semantic Scholar. Um datastore amplo, recuperador, reranker e ciclo de feedback exigem mais infraestrutura do que um modelo pequeno de geração de relatórios; executar um checkpoint 8B sem esses componentes não reproduz o sistema completo.

PaperQA2: a melhor opção para um conjunto local de documentos sob controle

O PaperQA2 foi criado em torno de pesquisas fundamentadas em documentos. Seu fluxo pode analisar PDFs, Markdown, HTML, arquivos do Office, código-fonte, imagens e tabelas; recuperar passagens candidatas; criar resumos contextuais; reordenar as evidências; e produzir uma resposta com citações. O pacote é compatível com modelos locais e provedores compatíveis com LiteLLM, embora os padrões documentados usem modelos e embeddings hospedados.

Com o PaperQA2, você pode apontar o sistema para um diretório, criar um índice reutilizável e ajustar o modelo, o embedding, a quantidade de evidências e os limites de fontes. O repositório documenta um padrão de 10 passagens de evidência e 5 fontes máximas por resposta, enquanto a configuração de alta qualidade usa mais evidências e custa mais.

Isso torna o PaperQA2 uma opção atraente para:

  • PDFs privados ou ainda não publicados de um laboratório.
  • Um conjunto de evidências específico de um projeto.
  • Perguntas recorrentes sobre a mesma coleção de documentos.
  • Fluxos que precisam de figuras, tabelas, metadados ou referências de página dos PDFs.

A contrapartida é a dependência do provedor e da configuração. O PaperQA2 é open source, mas a qualidade e o custo finais dependem do LLM escolhido, do modelo de embeddings, do parser, do corpus e das configurações. O repositório oficial não promete um preço fixo único por pergunta.

“A configuração padrão usa modelos da OpenAI e um banco de dados vetorial NumPy, mas o pacote foi projetado para aceitar LLMs, modelos de embeddings, armazenamentos vetoriais e servidores locais alternativos.” — FutureHouse, documentação do PaperQA2

A mesma tarefa de pesquisa, fluxos diferentes

Para descobrir conteúdo em uma área desconhecida: escolha o OpenScholar

Comece pelo OpenScholar quando você ainda não sabe quais artigos devem entrar na resposta. Seu grande datastore aberto e o pipeline especializado de recuperação foram desenvolvidos para encontrar e sintetizar evidências em muitos artigos.

Para uma biblioteca privada de projeto: escolha o PaperQA2

Use o PaperQA2 quando o diretório do projeto define o limite das evidências. Indexe os artigos, mantenha o conjunto de fontes estável e ajuste a quantidade de passagens de evidência e de fontes finais. Assim, um revisor pode inspecionar exatamente o corpus usado na resposta.

Para gerar rapidamente um relatório depois da recuperação: escolha o AstaBrief 8B

Use o AstaBrief depois que outro componente tiver feito o trabalho de descoberta. Ele é a escolha mais direta quando latência, controle local ou volume de relatórios importam mais do que construir um sistema completo de busca na literatura.

Para uma arquitetura híbrida: recupere com OpenScholar e escreva com AstaBrief

Reúna as evidências com um recuperador e um reranker acadêmicos, envie os trechos selecionados ao AstaBrief 8B e faça uma verificação separada do suporte às afirmações antes da publicação. Essa combinação une a descoberta no estilo OpenScholar à geração compacta do AstaBrief, mas cria uma responsabilidade de integração que nenhum componente isolado elimina.

O que o benchmark publicado realmente comprova

As versões na Nature e no PMC do artigo sobre o OpenScholar oferecem a comparação mais clara, dentro do mesmo benchmark, com o PaperQA2. No ScholarQABench, a pontuação multiartigos reportada no rubric Scholar-CS foi de 51.1 para o OpenScholar-8B e 45.6 para o PaperQA2. O PaperQA2 teve uma ligeira vantagem em F1 de citação nessa tabela: 48.0 contra 47.9 do OpenScholar-8B. O artigo estima o custo do PaperQA2 em $0.30–$2.30 por pergunta, contra $0.003 do OpenScholar-8B, de acordo com as premissas de custo do estudo.

Resultado publicado no ScholarQABenchOpenScholar-8BPaperQA2
Pontuação no rubric Scholar-CS51.145.6
F1 de citação no Scholar-CS47.948.0
Custo estimado por pergunta$0.003$0.30–$2.30

Esses números não formam um ranking universal. O artigo avaliou o PaperQA2 usando o OpenScholar DataStore porque o datastore próprio do PaperQA2 não era público. A avaliação também usou um modelo e uma configuração específicos. Mais importante: a comparação publicada não inclui o AstaBrief 8B na mesma configuração do ScholarQABench. Os resultados de velocidade e qualidade reportados para o AstaBrief vêm das avaliações focadas no Asta realizadas pela Ai2, portanto não permitem estabelecer sua posição em relação ao OpenScholar e ao PaperQA2.

O artigo também observa que as respostas do PaperQA2 apresentaram alta precisão de citação, mas muitas vezes se basearam em apenas um ou poucos artigos, reduzindo a cobertura e a organização de informações provenientes de vários trabalhos. Precisão das citações e cobertura da literatura são objetivos diferentes.

Uma regra prática para escolher

Sua restriçãoEscolha recomendadaPor quê
Descobrir literatura desconhecida em grande escalaOpenScholarRecuperação e síntese estão integradas
Manter o conjunto de evidências dentro de uma pasta localPaperQA2Corpus, índice e configurações ficam sob controle do usuário
Produzir rapidamente um relatório a partir de evidências fornecidasAstaBrief 8BGeração compacta de relatório em uma passagem
Executar atrás de um firewall com pesos abertosAstaBrief 8B ou OpenScholar-8BArtefatos de modelo abertos; a infraestrutura ao redor continua sendo importante
Auditar cada afirmação com base em uma passagem conhecidaPaperQA2 ou uma arquitetura híbridaIndexação local e controles explícitos de evidência facilitam a revisão
Minimizar custos quando a inferência local for viávelOpenScholar-8B; teste o AstaBrief separadamenteOs valores de custo publicados não são diretamente comparáveis

Antes de confiar em qualquer um dos três, verifique o limite da recuperação, o suporte das citações, a cobertura da literatura, o escopo das afirmações e a reprodutibilidade do corpus e das configurações.

FAQ

O AstaBrief 8B substitui o OpenScholar?

Não. O AstaBrief 8B é principalmente um modelo de geração de relatórios que recebe trechos recuperados, enquanto o OpenScholar inclui um datastore científico, recuperação, reranking e um fluxo de autofeedback. O AstaBrief pode substituir parte da camada de geração, mas não automaticamente toda a infraestrutura de descoberta.

O AstaBrief 8B recupera artigos por conta própria?

A descrição oficial do AstaBrief apresenta o modelo como um sistema que recebe uma pergunta de pesquisa e trechos de literatura recuperados. A recuperação é fornecida pelo fluxo Asta/ScholarQA ao redor do modelo ou por um pipeline separado criado por você.

Qual deles tem a melhor precisão de citação?

A tabela publicada do ScholarQABench dá ao PaperQA2 uma vantagem marginal em F1 de citação sobre o OpenScholar-8B, 48.0 contra 47.9, enquanto o OpenScholar-8B obtém uma pontuação maior no rubric Scholar-CS, 51.1 contra 45.6. Essa comparação não traz um resultado do AstaBrief no mesmo benchmark.

O PaperQA2 pode funcionar totalmente localmente?

O PaperQA2 oferece suporte a servidores de modelos locais, embeddings locais, índices locais e coleções de documentos locais. Uma implantação totalmente local ainda depende do parser, do modelo de embeddings, da qualidade do LLM, do hardware e da configuração escolhida.

Qual é o melhor para uma revisão sistemática?

Nenhum deles deve substituir um protocolo de revisão registrado, a triagem humana e a verificação das citações. Para descoberta, o OpenScholar é o melhor ponto de partida para uma busca ampla; para uma biblioteca de evidências predefinida, o PaperQA2 oferece um controle mais rígido do corpus; e o AstaBrief é útil para redigir depois que o conjunto de evidências foi montado.

Em uma linha: escolha o OpenScholar quando encontrar a literatura certa for o maior desafio, o PaperQA2 quando controlar um corpus conhecido for o mais difícil e o AstaBrief 8B quando a recuperação já estiver resolvida e a latência dos relatórios for o gargalo.