AstaBrief 8B, OpenScholar et PaperQA2 figurent souvent dans les mêmes sélections d’outils d’IA scientifique. Pourtant, ils n’interviennent pas au même moment dans le workflow de recherche. OpenScholar est le meilleur choix par défaut pour produire une synthèse bibliographique large et étayée par des citations ; PaperQA2 convient davantage à l’analyse d’une collection contrôlée de PDF ; AstaBrief 8B est le générateur de rapports rapide à ajouter une fois la recherche documentaire déjà opérationnelle. Cette différence compte davantage que le simple nombre de paramètres.
Trois systèmes, trois points de départ
| Système | Point de départ | Périmètre de recherche | Résultat principal | Premier usage recommandé |
|---|---|---|---|---|
| AstaBrief 8B | Une question de recherche et des extraits déjà récupérés | Fourni par le workflow Asta/ScholarQA environnant ou par votre propre pipeline | Un rapport rapide avec citations | Générer rapidement un rapport après la recherche documentaire |
| OpenScholar | Une question scientifique | OpenScholar DataStore, retrievers, rerankers et autres sources documentaires | Une synthèse longue étayée par des citations | Rechercher et synthétiser un vaste corpus scientifique |
| PaperQA2 | Une question et un répertoire ou corpus documentaire | Indexation locale, recherche par métadonnées, embeddings, reranking et recherche agentique | Une réponse fondée sur les preuves, avec citations intégrées | Poser des questions récurrentes sur un corpus contrôlé |
Les corpus intégrés plus vastes demandent davantage de préparation, mais offrent une meilleure couverture pour la découverte. Les fichiers fournis par l’utilisateur réduisent cette couverture en échange d’un contrôle accru sur les sources.
AstaBrief 8B : un générateur de rapports rapide, une fois la recherche effectuée
AstaBrief 8B est un modèle compact de génération de rapports publié par Ai2. L’annonce officielle le présente comme un système recevant une question de recherche et des extraits de littérature récupérés, plutôt que comme un service autonome de recherche bibliographique. Le modèle est distribué sous une licence Apache 2.0. Ai2 a également publié les données d’entraînement ainsi qu’un exemple de workflow pour générer des rapports à partir des PDF des chercheurs.
Ai2 indique que le pipeline Asta complet affichait une moyenne de 51.1 secondes en mode Fast, contre 178.5 secondes en mode Thinking, soit environ 3.5× plus rapide dans cette comparaison. Il s’agit d’une mesure du pipeline, et non d’une promesse universelle de vitesse d’inférence pour tous les déploiements locaux.
AstaBrief s’intègre bien aux pipelines qui fournissent déjà les passages pertinents, des identifiants de citation stables et une étape de vérification du lien entre les affirmations et leurs sources. Il ne faut pas le considérer comme un remplacement autonome du datastore et de la pile de recherche d’OpenScholar : si des extraits importants manquent, le générateur ne pourra pas retrouver les articles qui ne lui ont jamais été transmis.
Pour approfondir l’installation et le déploiement local, consultez notre test d’AstaBrief 8B et notre guide de déploiement local.
OpenScholar : un workflow complet pour synthétiser une vaste littérature
OpenScholar s’appuie sur l’OpenScholar DataStore, un corpus de 45 millions d’articles en accès libre et de 236 millions d’embeddings de passages, ainsi que sur des retrievers, rerankers, un système de génération avec citations et une boucle d’auto-évaluation (Nature).
OpenScholar constitue le meilleur point de départ lorsque la question ressemble à l’une des suivantes :
- « Que dit la littérature sur plusieurs sous-domaines ? »
- « Comment comparer des méthodes dans un domaine de recherche vaste et en évolution ? »
- « Quels sont les articles pertinents avant de rédiger la synthèse ? »
L’article publié dans Nature indique que la configuration de recherche combinée a obtenu 49.6 en exactitude et 47.6 en citation F1 dans son ablation en informatique, devant les recherches limitées au Web ou à Semantic Scholar. Un datastore étendu, un retriever, un reranker et une boucle de feedback demandent davantage d’infrastructure qu’un petit modèle de génération de rapports ; lancer un checkpoint 8B sans ces composants ne permet donc pas de reproduire le système complet.
PaperQA2 : le meilleur choix pour un corpus documentaire local et maîtrisé
PaperQA2 est conçu autour de la recherche fondée sur les documents. Son workflow peut analyser des PDF, des fichiers Markdown, HTML et Office, du code source, des images et des tableaux ; récupérer les passages candidats ; créer des résumés contextuels ; reranker les éléments de preuve ; puis produire une réponse accompagnée de citations. Le package prend en charge les modèles locaux et les fournisseurs compatibles avec LiteLLM, même si ses réglages documentés par défaut utilisent des modèles et des embeddings hébergés.
PaperQA2 permet de lui indiquer un répertoire, de créer un index réutilisable et d’ajuster le modèle, les embeddings, le nombre d’éléments de preuve et les limites de sources. Le dépôt documente une configuration par défaut de 10 passages de preuve et de 5 sources maximum pour la réponse, tandis que son réglage haute qualité utilise davantage de preuves et coûte plus cher.
PaperQA2 est donc particulièrement adapté aux cas suivants :
- Les PDF privés ou non publiés d’un laboratoire.
- Un ensemble de preuves propre à un projet.
- Des questions récurrentes sur la même collection de documents.
- Les workflows qui doivent exploiter les figures, tableaux, métadonnées ou références de page des PDF.
Le revers de la médaille tient à la dépendance au fournisseur et à la configuration. PaperQA2 est open source, mais la qualité finale et le coût dépendent du LLM choisi, du modèle d’embeddings, du parseur, du corpus et des réglages. Le dépôt officiel ne promet pas de tarif fixe par question.
« La configuration par défaut utilise des modèles OpenAI et une base de données vectorielle NumPy, mais le package est conçu pour prendre en charge d’autres LLM, modèles d’embeddings, bases vectorielles et serveurs locaux. » — FutureHouse, documentation de PaperQA2
Une même tâche de recherche, des workflows différents
Pour explorer largement un domaine inconnu : choisissez OpenScholar
Commencez par OpenScholar lorsque vous ne savez pas encore quels articles doivent figurer dans la réponse. Son vaste datastore ouvert et sa pipeline de recherche spécialisée sont conçus pour trouver puis synthétiser des preuves issues de nombreux articles.
Pour une bibliothèque documentaire privée : choisissez PaperQA2
Utilisez PaperQA2 lorsque le périmètre des preuves se limite au répertoire du projet. Indexez les articles, conservez un ensemble de sources stable et ajustez le nombre de passages de preuve ainsi que le nombre de sources finales. Le réviseur peut alors contrôler le corpus exact utilisé pour produire la réponse.
Pour rédiger rapidement un rapport après la recherche : choisissez AstaBrief 8B
Utilisez AstaBrief une fois qu’un autre composant a effectué le travail de découverte. C’est le choix le plus simple lorsque la latence, le contrôle local ou le débit de génération des rapports comptent davantage que la construction d’un système complet de recherche bibliographique.
Pour une architecture hybride : recherchez avec OpenScholar, rédigez avec AstaBrief
Rassemblez les preuves avec un retriever et un reranker scientifiques, transmettez les extraits sélectionnés à AstaBrief 8B, puis effectuez une vérification distincte du soutien apporté à chaque affirmation avant publication. Cette approche combine la découverte façon OpenScholar avec le chemin de génération compact d’AstaBrief, mais elle ajoute une responsabilité d’intégration qu’aucun composant ne peut éliminer.
Ce que les benchmarks publiés démontrent réellement
Les versions Nature et PMC de l’article consacré à OpenScholar fournissent la comparaison la plus claire entre PaperQA2 et OpenScholar sur un même benchmark. Dans ScholarQABench, le score multi-articles rapporté selon le rubric Scholar-CS était de 51.1 pour OpenScholar-8B et de 45.6 pour PaperQA2. Dans ce tableau, PaperQA2 affichait un léger avantage en citation F1, avec 48.0 contre 47.9 pour OpenScholar-8B. L’article estime le coût de PaperQA2 à $0.30–$2.30 par question, contre $0.003 pour OpenScholar-8B selon les hypothèses de coût retenues.
| Résultats publiés dans ScholarQABench | OpenScholar-8B | PaperQA2 |
|---|---|---|
| Score selon le rubric Scholar-CS | 51.1 | 45.6 |
| Citation F1 de Scholar-CS | 47.9 | 48.0 |
| Coût estimé par question | $0.003 | $0.30–$2.30 |
Ces chiffres ne constituent pas un classement universel. L’article a évalué PaperQA2 avec l’OpenScholar DataStore, car le datastore propre à PaperQA2 n’était pas public. L’évaluation reposait également sur un modèle et une configuration particuliers. Surtout, la comparaison publiée n’inclut pas AstaBrief 8B dans la même configuration ScholarQABench. Les résultats de vitesse et de qualité rapportés pour AstaBrief proviennent d’évaluations centrées sur Asta menées par Ai2 ; ils ne permettent donc pas d’établir son classement face à OpenScholar et PaperQA2.
L’article souligne également que les réponses de PaperQA2 affichaient une grande précision des citations, mais s’appuyaient souvent sur un seul article ou quelques articles seulement, ce qui réduisait la couverture et l’organisation multi-articles. La précision des citations et la couverture de la littérature sont deux objectifs distincts.
Une règle simple pour choisir
| Votre contrainte | Choix recommandé | Pourquoi |
|---|---|---|
| Découvrir une littérature inconnue à grande échelle | OpenScholar | La recherche et la synthèse sont intégrées |
| Conserver les preuves dans un dossier local | PaperQA2 | Le corpus, l’index et les réglages restent sous le contrôle de l’utilisateur |
| Produire rapidement un rapport à partir de preuves fournies | AstaBrief 8B | Génération de rapport compacte en un seul passage |
| Déployer derrière un pare-feu avec des poids ouverts | AstaBrief 8B ou OpenScholar-8B | Artefacts de modèles ouverts ; la pile environnante reste déterminante |
| Auditer chaque affirmation par rapport à un passage connu | PaperQA2 ou une architecture hybride | L’indexation locale et le contrôle explicite des preuves facilitent la vérification |
| Réduire les coûts lorsque l’inférence locale est possible | OpenScholar-8B ; testez AstaBrief séparément | Les chiffres de coût publiés ne sont pas directement comparables |
Avant de faire confiance à l’un de ces trois systèmes, vérifiez le périmètre de recherche, le soutien apporté aux citations, la couverture de la littérature, la portée des affirmations ainsi que la reproductibilité du corpus et des réglages.
FAQ
AstaBrief 8B peut-il remplacer OpenScholar ?
Non. AstaBrief 8B est avant tout un modèle de génération de rapports qui consomme des extraits déjà récupérés, tandis qu’OpenScholar intègre un datastore scientifique, la recherche, le reranking et un workflow d’auto-évaluation. AstaBrief peut remplacer une partie de la couche de génération, mais pas automatiquement toute la pile de découverte.
AstaBrief 8B récupère-t-il lui-même les articles ?
La description officielle d’AstaBrief présente le modèle comme recevant une question de recherche et des extraits de littérature déjà récupérés. La recherche est assurée par le workflow Asta/ScholarQA environnant ou par un pipeline distinct que vous construisez.
Lequel offre la meilleure précision des citations ?
Le tableau publié de ScholarQABench donne à PaperQA2 un léger avantage en citation F1 sur OpenScholar-8B, avec 48.0 contre 47.9, tandis qu’OpenScholar-8B obtient un meilleur score au rubric Scholar-CS, 51.1 contre 45.6. Cette comparaison ne contient aucun résultat AstaBrief réalisé sur le même benchmark.
PaperQA2 peut-il fonctionner entièrement en local ?
PaperQA2 prend en charge les serveurs de modèles locaux, les embeddings locaux, les index locaux et les collections de documents locales. Un déploiement entièrement local dépend toutefois du parseur, du modèle d’embeddings, de la qualité du LLM, du matériel et de la configuration choisis.
Lequel convient le mieux à une revue systématique ?
Aucun de ces outils ne doit remplacer un protocole de revue enregistré, le filtrage humain et la vérification des citations. Pour la découverte, OpenScholar constitue le meilleur point de départ pour une recherche large ; pour une bibliothèque de preuves prédéfinie, PaperQA2 offre un contrôle plus strict du corpus ; AstaBrief est utile pour rédiger une fois l’ensemble des preuves réuni.
En une phrase : choisissez OpenScholar lorsque le plus difficile est de trouver la bonne littérature, PaperQA2 lorsque le principal défi consiste à contrôler un corpus connu, et AstaBrief 8B lorsque la recherche est déjà résolue et que la latence de génération des rapports devient le goulot d’étranglement.