AIREITER

AstaBrief 8B vs OpenScholar vs PaperQA2 : comparaison des workflows

Dernière mise à jour: 2026-10-02 19:17:46

AstaBrief 8B, OpenScholar et PaperQA2 figurent souvent dans les mêmes sélections d’outils d’IA scientifique. Pourtant, ils n’interviennent pas au même moment dans le workflow de recherche. OpenScholar est le meilleur choix par défaut pour produire une synthèse bibliographique large et étayée par des citations ; PaperQA2 convient davantage à l’analyse d’une collection contrôlée de PDF ; AstaBrief 8B est le générateur de rapports rapide à ajouter une fois la recherche documentaire déjà opérationnelle. Cette différence compte davantage que le simple nombre de paramètres.

Trois systèmes, trois points de départ

SystèmePoint de départPérimètre de rechercheRésultat principalPremier usage recommandé
AstaBrief 8BUne question de recherche et des extraits déjà récupérésFourni par le workflow Asta/ScholarQA environnant ou par votre propre pipelineUn rapport rapide avec citationsGénérer rapidement un rapport après la recherche documentaire
OpenScholarUne question scientifiqueOpenScholar DataStore, retrievers, rerankers et autres sources documentairesUne synthèse longue étayée par des citationsRechercher et synthétiser un vaste corpus scientifique
PaperQA2Une question et un répertoire ou corpus documentaireIndexation locale, recherche par métadonnées, embeddings, reranking et recherche agentiqueUne réponse fondée sur les preuves, avec citations intégréesPoser des questions récurrentes sur un corpus contrôlé

Les corpus intégrés plus vastes demandent davantage de préparation, mais offrent une meilleure couverture pour la découverte. Les fichiers fournis par l’utilisateur réduisent cette couverture en échange d’un contrôle accru sur les sources.

AstaBrief 8B : un générateur de rapports rapide, une fois la recherche effectuée

AstaBrief 8B est un modèle compact de génération de rapports publié par Ai2. L’annonce officielle le présente comme un système recevant une question de recherche et des extraits de littérature récupérés, plutôt que comme un service autonome de recherche bibliographique. Le modèle est distribué sous une licence Apache 2.0. Ai2 a également publié les données d’entraînement ainsi qu’un exemple de workflow pour générer des rapports à partir des PDF des chercheurs.

Ai2 indique que le pipeline Asta complet affichait une moyenne de 51.1 secondes en mode Fast, contre 178.5 secondes en mode Thinking, soit environ 3.5× plus rapide dans cette comparaison. Il s’agit d’une mesure du pipeline, et non d’une promesse universelle de vitesse d’inférence pour tous les déploiements locaux.

AstaBrief s’intègre bien aux pipelines qui fournissent déjà les passages pertinents, des identifiants de citation stables et une étape de vérification du lien entre les affirmations et leurs sources. Il ne faut pas le considérer comme un remplacement autonome du datastore et de la pile de recherche d’OpenScholar : si des extraits importants manquent, le générateur ne pourra pas retrouver les articles qui ne lui ont jamais été transmis.

Pour approfondir l’installation et le déploiement local, consultez notre test d’AstaBrief 8B et notre guide de déploiement local.

OpenScholar : un workflow complet pour synthétiser une vaste littérature

OpenScholar s’appuie sur l’OpenScholar DataStore, un corpus de 45 millions d’articles en accès libre et de 236 millions d’embeddings de passages, ainsi que sur des retrievers, rerankers, un système de génération avec citations et une boucle d’auto-évaluation (Nature).

OpenScholar constitue le meilleur point de départ lorsque la question ressemble à l’une des suivantes :

  • « Que dit la littérature sur plusieurs sous-domaines ? »
  • « Comment comparer des méthodes dans un domaine de recherche vaste et en évolution ? »
  • « Quels sont les articles pertinents avant de rédiger la synthèse ? »

L’article publié dans Nature indique que la configuration de recherche combinée a obtenu 49.6 en exactitude et 47.6 en citation F1 dans son ablation en informatique, devant les recherches limitées au Web ou à Semantic Scholar. Un datastore étendu, un retriever, un reranker et une boucle de feedback demandent davantage d’infrastructure qu’un petit modèle de génération de rapports ; lancer un checkpoint 8B sans ces composants ne permet donc pas de reproduire le système complet.

PaperQA2 : le meilleur choix pour un corpus documentaire local et maîtrisé

PaperQA2 est conçu autour de la recherche fondée sur les documents. Son workflow peut analyser des PDF, des fichiers Markdown, HTML et Office, du code source, des images et des tableaux ; récupérer les passages candidats ; créer des résumés contextuels ; reranker les éléments de preuve ; puis produire une réponse accompagnée de citations. Le package prend en charge les modèles locaux et les fournisseurs compatibles avec LiteLLM, même si ses réglages documentés par défaut utilisent des modèles et des embeddings hébergés.

PaperQA2 permet de lui indiquer un répertoire, de créer un index réutilisable et d’ajuster le modèle, les embeddings, le nombre d’éléments de preuve et les limites de sources. Le dépôt documente une configuration par défaut de 10 passages de preuve et de 5 sources maximum pour la réponse, tandis que son réglage haute qualité utilise davantage de preuves et coûte plus cher.

PaperQA2 est donc particulièrement adapté aux cas suivants :

  • Les PDF privés ou non publiés d’un laboratoire.
  • Un ensemble de preuves propre à un projet.
  • Des questions récurrentes sur la même collection de documents.
  • Les workflows qui doivent exploiter les figures, tableaux, métadonnées ou références de page des PDF.

Le revers de la médaille tient à la dépendance au fournisseur et à la configuration. PaperQA2 est open source, mais la qualité finale et le coût dépendent du LLM choisi, du modèle d’embeddings, du parseur, du corpus et des réglages. Le dépôt officiel ne promet pas de tarif fixe par question.

« La configuration par défaut utilise des modèles OpenAI et une base de données vectorielle NumPy, mais le package est conçu pour prendre en charge d’autres LLM, modèles d’embeddings, bases vectorielles et serveurs locaux. » — FutureHouse, documentation de PaperQA2

Une même tâche de recherche, des workflows différents

Pour explorer largement un domaine inconnu : choisissez OpenScholar

Commencez par OpenScholar lorsque vous ne savez pas encore quels articles doivent figurer dans la réponse. Son vaste datastore ouvert et sa pipeline de recherche spécialisée sont conçus pour trouver puis synthétiser des preuves issues de nombreux articles.

Pour une bibliothèque documentaire privée : choisissez PaperQA2

Utilisez PaperQA2 lorsque le périmètre des preuves se limite au répertoire du projet. Indexez les articles, conservez un ensemble de sources stable et ajustez le nombre de passages de preuve ainsi que le nombre de sources finales. Le réviseur peut alors contrôler le corpus exact utilisé pour produire la réponse.

Pour rédiger rapidement un rapport après la recherche : choisissez AstaBrief 8B

Utilisez AstaBrief une fois qu’un autre composant a effectué le travail de découverte. C’est le choix le plus simple lorsque la latence, le contrôle local ou le débit de génération des rapports comptent davantage que la construction d’un système complet de recherche bibliographique.

Pour une architecture hybride : recherchez avec OpenScholar, rédigez avec AstaBrief

Rassemblez les preuves avec un retriever et un reranker scientifiques, transmettez les extraits sélectionnés à AstaBrief 8B, puis effectuez une vérification distincte du soutien apporté à chaque affirmation avant publication. Cette approche combine la découverte façon OpenScholar avec le chemin de génération compact d’AstaBrief, mais elle ajoute une responsabilité d’intégration qu’aucun composant ne peut éliminer.

Ce que les benchmarks publiés démontrent réellement

Les versions Nature et PMC de l’article consacré à OpenScholar fournissent la comparaison la plus claire entre PaperQA2 et OpenScholar sur un même benchmark. Dans ScholarQABench, le score multi-articles rapporté selon le rubric Scholar-CS était de 51.1 pour OpenScholar-8B et de 45.6 pour PaperQA2. Dans ce tableau, PaperQA2 affichait un léger avantage en citation F1, avec 48.0 contre 47.9 pour OpenScholar-8B. L’article estime le coût de PaperQA2 à $0.30–$2.30 par question, contre $0.003 pour OpenScholar-8B selon les hypothèses de coût retenues.

Résultats publiés dans ScholarQABenchOpenScholar-8BPaperQA2
Score selon le rubric Scholar-CS51.145.6
Citation F1 de Scholar-CS47.948.0
Coût estimé par question$0.003$0.30–$2.30

Ces chiffres ne constituent pas un classement universel. L’article a évalué PaperQA2 avec l’OpenScholar DataStore, car le datastore propre à PaperQA2 n’était pas public. L’évaluation reposait également sur un modèle et une configuration particuliers. Surtout, la comparaison publiée n’inclut pas AstaBrief 8B dans la même configuration ScholarQABench. Les résultats de vitesse et de qualité rapportés pour AstaBrief proviennent d’évaluations centrées sur Asta menées par Ai2 ; ils ne permettent donc pas d’établir son classement face à OpenScholar et PaperQA2.

L’article souligne également que les réponses de PaperQA2 affichaient une grande précision des citations, mais s’appuyaient souvent sur un seul article ou quelques articles seulement, ce qui réduisait la couverture et l’organisation multi-articles. La précision des citations et la couverture de la littérature sont deux objectifs distincts.

Une règle simple pour choisir

Votre contrainteChoix recommandéPourquoi
Découvrir une littérature inconnue à grande échelleOpenScholarLa recherche et la synthèse sont intégrées
Conserver les preuves dans un dossier localPaperQA2Le corpus, l’index et les réglages restent sous le contrôle de l’utilisateur
Produire rapidement un rapport à partir de preuves fourniesAstaBrief 8BGénération de rapport compacte en un seul passage
Déployer derrière un pare-feu avec des poids ouvertsAstaBrief 8B ou OpenScholar-8BArtefacts de modèles ouverts ; la pile environnante reste déterminante
Auditer chaque affirmation par rapport à un passage connuPaperQA2 ou une architecture hybrideL’indexation locale et le contrôle explicite des preuves facilitent la vérification
Réduire les coûts lorsque l’inférence locale est possibleOpenScholar-8B ; testez AstaBrief séparémentLes chiffres de coût publiés ne sont pas directement comparables

Avant de faire confiance à l’un de ces trois systèmes, vérifiez le périmètre de recherche, le soutien apporté aux citations, la couverture de la littérature, la portée des affirmations ainsi que la reproductibilité du corpus et des réglages.

FAQ

AstaBrief 8B peut-il remplacer OpenScholar ?

Non. AstaBrief 8B est avant tout un modèle de génération de rapports qui consomme des extraits déjà récupérés, tandis qu’OpenScholar intègre un datastore scientifique, la recherche, le reranking et un workflow d’auto-évaluation. AstaBrief peut remplacer une partie de la couche de génération, mais pas automatiquement toute la pile de découverte.

AstaBrief 8B récupère-t-il lui-même les articles ?

La description officielle d’AstaBrief présente le modèle comme recevant une question de recherche et des extraits de littérature déjà récupérés. La recherche est assurée par le workflow Asta/ScholarQA environnant ou par un pipeline distinct que vous construisez.

Lequel offre la meilleure précision des citations ?

Le tableau publié de ScholarQABench donne à PaperQA2 un léger avantage en citation F1 sur OpenScholar-8B, avec 48.0 contre 47.9, tandis qu’OpenScholar-8B obtient un meilleur score au rubric Scholar-CS, 51.1 contre 45.6. Cette comparaison ne contient aucun résultat AstaBrief réalisé sur le même benchmark.

PaperQA2 peut-il fonctionner entièrement en local ?

PaperQA2 prend en charge les serveurs de modèles locaux, les embeddings locaux, les index locaux et les collections de documents locales. Un déploiement entièrement local dépend toutefois du parseur, du modèle d’embeddings, de la qualité du LLM, du matériel et de la configuration choisis.

Lequel convient le mieux à une revue systématique ?

Aucun de ces outils ne doit remplacer un protocole de revue enregistré, le filtrage humain et la vérification des citations. Pour la découverte, OpenScholar constitue le meilleur point de départ pour une recherche large ; pour une bibliothèque de preuves prédéfinie, PaperQA2 offre un contrôle plus strict du corpus ; AstaBrief est utile pour rédiger une fois l’ensemble des preuves réuni.

En une phrase : choisissez OpenScholar lorsque le plus difficile est de trouver la bonne littérature, PaperQA2 lorsque le principal défi consiste à contrôler un corpus connu, et AstaBrief 8B lorsque la recherche est déjà résolue et que la latence de génération des rapports devient le goulot d’étranglement.