AstaBrief 8B, OpenScholar e PaperQA2 costumam aparecer na mesma lista de ferramentas de IA para pesquisa científica, mas cada um entra em uma etapa diferente do trabalho. OpenScholar é a melhor opção padrão para sínteses amplas da literatura com suporte de citações; PaperQA2 é mais prático para trabalhar com uma coleção controlada de PDFs; e AstaBrief 8B é o gerador de relatórios focado em velocidade, ideal depois que a recuperação de conteúdo já está resolvida. Essa diferença importa mais do que os rótulos de tamanho dos modelos.
Três sistemas, três pontos de partida
| Sistema | Começa com | Escopo da recuperação | Principal resultado | Melhor uso inicial |
|---|---|---|---|---|
| AstaBrief 8B | Uma pergunta de pesquisa e trechos recuperados | Fornecido pelo fluxo Asta/ScholarQA ou pelo seu próprio pipeline | Um relatório rápido com citações | Gerar rapidamente um relatório depois da recuperação |
| OpenScholar | Uma pergunta científica | OpenScholar DataStore, recuperadores, rerankers e outras fontes de recuperação | Síntese extensa com suporte de citações | Pesquisar e sintetizar uma literatura ampla |
| PaperQA2 | Uma pergunta e um diretório ou corpus de documentos | Indexação local, busca por metadados, embeddings, reranking e busca agêntica | Resposta baseada em evidências com citações no texto | Fazer perguntas repetidas sobre documentos controlados |
Corpora integrados maiores trocam tempo de preparação por uma descoberta mais ampla; arquivos fornecidos pelo usuário fazem o caminho inverso, reduzindo o alcance em favor de um controle maior sobre as evidências.
AstaBrief 8B: otimizado para gerar relatórios rapidamente depois da recuperação
O AstaBrief 8B é um modelo compacto de geração de relatórios lançado pela Ai2. O anúncio oficial descreve como entrada uma pergunta de pesquisa acompanhada de trechos de literatura recuperados — não um serviço independente de busca de artigos. O modelo está disponível sob uma licença Apache 2.0, e a Ai2 também publicou os dados de treinamento e um fluxo de exemplo para gerar relatórios a partir dos PDFs dos próprios pesquisadores.
A Ai2 informa que o pipeline completo do Asta levou, em média, 51.1 segundos no modo Fast, contra 178.5 segundos no modo Thinking — cerca de 3.5× mais rápido nessa comparação. Essa é uma medição do pipeline, não uma promessa universal de velocidade de inferência para qualquer implantação local.
O AstaBrief se encaixa bem em pipelines que já fornecem passagens recuperadas, IDs de citação estáveis e uma etapa de revisão do suporte às afirmações. Ele não deve ser tratado como substituto independente do datastore e da camada de recuperação do OpenScholar: se os trechos estiverem incompletos, o gerador não terá como recuperar artigos que nunca recebeu.
Para ver em mais detalhes a instalação e a implantação local, confira nossa análise do AstaBrief 8B e o guia de implantação local.
OpenScholar: um fluxo de trabalho para sínteses amplas da literatura
O OpenScholar usa o OpenScholar DataStore, um corpus com 45 milhões de artigos de acesso aberto e 236 milhões de embeddings de passagens, além de recuperadores treinados, rerankers, geração com citações e um ciclo de autofeedback (Nature).
O OpenScholar é o melhor ponto de partida quando a pergunta se parece com uma destas:
- “O que a literatura diz sobre diferentes subáreas?”
- “Como comparar métodos em uma área de pesquisa ampla e em constante mudança?”
- “Quais são os artigos relevantes antes de escrever a síntese?”
O artigo da Nature relata que a configuração combinada de recuperação alcançou 49.6 de correção e 47.6 de F1 de citação no estudo de ablação em ciência da computação, superando a recuperação somente na web e a baseada apenas no Semantic Scholar. Um datastore amplo, recuperador, reranker e ciclo de feedback exigem mais infraestrutura do que um modelo pequeno de geração de relatórios; executar um checkpoint 8B sem esses componentes não reproduz o sistema completo.
PaperQA2: a melhor opção para um conjunto local de documentos sob controle
O PaperQA2 foi criado em torno de pesquisas fundamentadas em documentos. Seu fluxo pode analisar PDFs, Markdown, HTML, arquivos do Office, código-fonte, imagens e tabelas; recuperar passagens candidatas; criar resumos contextuais; reordenar as evidências; e produzir uma resposta com citações. O pacote é compatível com modelos locais e provedores compatíveis com LiteLLM, embora os padrões documentados usem modelos e embeddings hospedados.
Com o PaperQA2, você pode apontar o sistema para um diretório, criar um índice reutilizável e ajustar o modelo, o embedding, a quantidade de evidências e os limites de fontes. O repositório documenta um padrão de 10 passagens de evidência e 5 fontes máximas por resposta, enquanto a configuração de alta qualidade usa mais evidências e custa mais.
Isso torna o PaperQA2 uma opção atraente para:
- PDFs privados ou ainda não publicados de um laboratório.
- Um conjunto de evidências específico de um projeto.
- Perguntas recorrentes sobre a mesma coleção de documentos.
- Fluxos que precisam de figuras, tabelas, metadados ou referências de página dos PDFs.
A contrapartida é a dependência do provedor e da configuração. O PaperQA2 é open source, mas a qualidade e o custo finais dependem do LLM escolhido, do modelo de embeddings, do parser, do corpus e das configurações. O repositório oficial não promete um preço fixo único por pergunta.
“A configuração padrão usa modelos da OpenAI e um banco de dados vetorial NumPy, mas o pacote foi projetado para aceitar LLMs, modelos de embeddings, armazenamentos vetoriais e servidores locais alternativos.” — FutureHouse, documentação do PaperQA2
A mesma tarefa de pesquisa, fluxos diferentes
Para descobrir conteúdo em uma área desconhecida: escolha o OpenScholar
Comece pelo OpenScholar quando você ainda não sabe quais artigos devem entrar na resposta. Seu grande datastore aberto e o pipeline especializado de recuperação foram desenvolvidos para encontrar e sintetizar evidências em muitos artigos.
Para uma biblioteca privada de projeto: escolha o PaperQA2
Use o PaperQA2 quando o diretório do projeto define o limite das evidências. Indexe os artigos, mantenha o conjunto de fontes estável e ajuste a quantidade de passagens de evidência e de fontes finais. Assim, um revisor pode inspecionar exatamente o corpus usado na resposta.
Para gerar rapidamente um relatório depois da recuperação: escolha o AstaBrief 8B
Use o AstaBrief depois que outro componente tiver feito o trabalho de descoberta. Ele é a escolha mais direta quando latência, controle local ou volume de relatórios importam mais do que construir um sistema completo de busca na literatura.
Para uma arquitetura híbrida: recupere com OpenScholar e escreva com AstaBrief
Reúna as evidências com um recuperador e um reranker acadêmicos, envie os trechos selecionados ao AstaBrief 8B e faça uma verificação separada do suporte às afirmações antes da publicação. Essa combinação une a descoberta no estilo OpenScholar à geração compacta do AstaBrief, mas cria uma responsabilidade de integração que nenhum componente isolado elimina.
O que o benchmark publicado realmente comprova
As versões na Nature e no PMC do artigo sobre o OpenScholar oferecem a comparação mais clara, dentro do mesmo benchmark, com o PaperQA2. No ScholarQABench, a pontuação multiartigos reportada no rubric Scholar-CS foi de 51.1 para o OpenScholar-8B e 45.6 para o PaperQA2. O PaperQA2 teve uma ligeira vantagem em F1 de citação nessa tabela: 48.0 contra 47.9 do OpenScholar-8B. O artigo estima o custo do PaperQA2 em $0.30–$2.30 por pergunta, contra $0.003 do OpenScholar-8B, de acordo com as premissas de custo do estudo.
| Resultado publicado no ScholarQABench | OpenScholar-8B | PaperQA2 |
|---|---|---|
| Pontuação no rubric Scholar-CS | 51.1 | 45.6 |
| F1 de citação no Scholar-CS | 47.9 | 48.0 |
| Custo estimado por pergunta | $0.003 | $0.30–$2.30 |
Esses números não formam um ranking universal. O artigo avaliou o PaperQA2 usando o OpenScholar DataStore porque o datastore próprio do PaperQA2 não era público. A avaliação também usou um modelo e uma configuração específicos. Mais importante: a comparação publicada não inclui o AstaBrief 8B na mesma configuração do ScholarQABench. Os resultados de velocidade e qualidade reportados para o AstaBrief vêm das avaliações focadas no Asta realizadas pela Ai2, portanto não permitem estabelecer sua posição em relação ao OpenScholar e ao PaperQA2.
O artigo também observa que as respostas do PaperQA2 apresentaram alta precisão de citação, mas muitas vezes se basearam em apenas um ou poucos artigos, reduzindo a cobertura e a organização de informações provenientes de vários trabalhos. Precisão das citações e cobertura da literatura são objetivos diferentes.
Uma regra prática para escolher
| Sua restrição | Escolha recomendada | Por quê |
|---|---|---|
| Descobrir literatura desconhecida em grande escala | OpenScholar | Recuperação e síntese estão integradas |
| Manter o conjunto de evidências dentro de uma pasta local | PaperQA2 | Corpus, índice e configurações ficam sob controle do usuário |
| Produzir rapidamente um relatório a partir de evidências fornecidas | AstaBrief 8B | Geração compacta de relatório em uma passagem |
| Executar atrás de um firewall com pesos abertos | AstaBrief 8B ou OpenScholar-8B | Artefatos de modelo abertos; a infraestrutura ao redor continua sendo importante |
| Auditar cada afirmação com base em uma passagem conhecida | PaperQA2 ou uma arquitetura híbrida | Indexação local e controles explícitos de evidência facilitam a revisão |
| Minimizar custos quando a inferência local for viável | OpenScholar-8B; teste o AstaBrief separadamente | Os valores de custo publicados não são diretamente comparáveis |
Antes de confiar em qualquer um dos três, verifique o limite da recuperação, o suporte das citações, a cobertura da literatura, o escopo das afirmações e a reprodutibilidade do corpus e das configurações.
FAQ
O AstaBrief 8B substitui o OpenScholar?
Não. O AstaBrief 8B é principalmente um modelo de geração de relatórios que recebe trechos recuperados, enquanto o OpenScholar inclui um datastore científico, recuperação, reranking e um fluxo de autofeedback. O AstaBrief pode substituir parte da camada de geração, mas não automaticamente toda a infraestrutura de descoberta.
O AstaBrief 8B recupera artigos por conta própria?
A descrição oficial do AstaBrief apresenta o modelo como um sistema que recebe uma pergunta de pesquisa e trechos de literatura recuperados. A recuperação é fornecida pelo fluxo Asta/ScholarQA ao redor do modelo ou por um pipeline separado criado por você.
Qual deles tem a melhor precisão de citação?
A tabela publicada do ScholarQABench dá ao PaperQA2 uma vantagem marginal em F1 de citação sobre o OpenScholar-8B, 48.0 contra 47.9, enquanto o OpenScholar-8B obtém uma pontuação maior no rubric Scholar-CS, 51.1 contra 45.6. Essa comparação não traz um resultado do AstaBrief no mesmo benchmark.
O PaperQA2 pode funcionar totalmente localmente?
O PaperQA2 oferece suporte a servidores de modelos locais, embeddings locais, índices locais e coleções de documentos locais. Uma implantação totalmente local ainda depende do parser, do modelo de embeddings, da qualidade do LLM, do hardware e da configuração escolhida.
Qual é o melhor para uma revisão sistemática?
Nenhum deles deve substituir um protocolo de revisão registrado, a triagem humana e a verificação das citações. Para descoberta, o OpenScholar é o melhor ponto de partida para uma busca ampla; para uma biblioteca de evidências predefinida, o PaperQA2 oferece um controle mais rígido do corpus; e o AstaBrief é útil para redigir depois que o conjunto de evidências foi montado.
Em uma linha: escolha o OpenScholar quando encontrar a literatura certa for o maior desafio, o PaperQA2 quando controlar um corpus conhecido for o mais difícil e o AstaBrief 8B quando a recuperação já estiver resolvida e a latência dos relatórios for o gargalo.