AIREITER

AstaBrief 8B vs OpenScholar vs PaperQA2:科研文献工作流对比

最后更新: 2026-10-02 19:19:16

AstaBrief 8B、OpenScholar 和 PaperQA2 经常被放进同一份科研 AI 工具清单,但它们切入研究流程的阶段并不相同。如果你需要覆盖广泛文献并生成有引用支撑的综述,OpenScholar 是更稳妥的默认选择;如果手头已经有一批受控 PDF,PaperQA2 更实用;而 AstaBrief 8B 更像是检索环节完成后,用来快速写报告的工具。相比模型参数规模,这种定位差异更值得关注。

三个系统,三种起点

系统起点检索范围主要输出最适合的第一步
AstaBrief 8B研究问题加上已检索到的文献摘录由周边的 Asta/ScholarQA 工作流或你自己的流水线提供快速生成的带引用报告检索完成后快速生成报告
OpenScholar一个科研问题OpenScholar DataStore、检索器、重排序器及其他检索来源长篇、带引用支撑的综合分析跨大范围文献进行检索和综合
PaperQA2一个问题加上文档目录或语料库本地索引、元数据搜索、嵌入、重排序和智能体式搜索基于证据并带行内引用的回答围绕受控文档集合反复提问

内置语料库越大,通常越需要投入准备时间,但能带来更广的发现范围;用户自行提供文件则牺牲部分广度,换来更强的证据控制力。

AstaBrief 8B:检索完成后,快速生成报告

AstaBrief 8B 是 Ai2 发布的一款紧凑型报告生成模型。官方公告将它描述为接收研究问题和检索到的文献摘录,而不是独立完成论文搜索的服务。该模型采用 Apache 2.0 模型许可证,Ai2 还发布了训练数据,以及一个基于研究人员自有 PDF 生成报告的示例工作流。

Ai2 的数据显示,完整 Asta 流水线在 Fast 模式下平均耗时51.1 秒,而 Thinking 模式为178.5 秒,在这项对比中约快3.5 倍。这里说的是整条流水线的测量结果,并不意味着任何本地部署都能达到同样的推理速度。

AstaBrief 适合这样的流水线:检索段落已经准备好,引用 ID 稳定,并且有独立的论断—证据支持检查环节。它不能被当成 OpenScholar 数据存储和检索栈的独立替代品——如果某篇论文从未被提供,报告生成模型也无法凭空找回它。

如果想进一步了解安装和本地部署,可以查看我们的 AstaBrief 8B 评测与本地部署指南。

OpenScholar:面向大范围文献综合的工作流

OpenScholar 使用 OpenScholar DataStore,其中包含4500 万篇开放获取论文和2.36 亿个段落嵌入,并配套训练好的检索器、重排序器、基于引用的生成机制,以及自反馈循环(Nature)。

遇到下面这类问题时,OpenScholar 更适合作为起点:

  • “跨多个子领域来看,现有文献得出了什么结论?”
  • “如何比较一个规模庞大且不断变化的研究领域中的不同方法?”
  • “先找出相关论文,再撰写综合分析。”

Nature 论文报告称,在其计算机科学消融实验中,组合检索配置取得了49.6 的正确性得分和47.6 的引用 F1,优于仅使用网页检索或仅使用 Semantic Scholar 的方案。大规模数据存储、检索器、重排序器和反馈循环,需要的基础设施显然比一个小型报告模型更多;只运行一个 8B 检查点,并不能复现完整系统。

PaperQA2:受控本地文档集的合适选择

PaperQA2围绕文档驱动的研究场景设计。它可以解析 PDF、Markdown、HTML、Office 文件、源代码、图片和表格,检索候选段落,生成上下文摘要,对证据重新排序,并最终输出带引用的回答。该软件包支持本地模型和兼容 LiteLLM 的服务商,但文档中的默认配置使用托管模型和嵌入模型。

使用 PaperQA2 时,你可以指定一个目录,建立可重复使用的索引,并调整模型、嵌入模型、证据数量和来源上限。仓库文档给出的默认值是10 个证据段落和最多 5 个回答来源;高质量配置会使用更多证据,成本也更高。

因此,PaperQA2 特别适合以下场景:

  • 实验室的私有或尚未发表的 PDF。
  • 围绕某个项目整理的证据包。
  • 针对同一批文档反复提出问题。
  • 需要读取 PDF 图表、表格、元数据或页码引用的工作流。

代价在于,它对服务商和配置较为依赖。PaperQA2 虽然是开源项目,但最终质量和成本取决于所选 LLM、嵌入模型、解析器、语料库及具体设置。官方仓库并没有承诺一个固定的单题价格。

“默认配置使用 OpenAI 模型和 NumPy 向量数据库,但该软件包从设计上支持替代的 LLM、嵌入模型、向量存储和本地服务器。”——FutureHouse,PaperQA2 文档

同一个研究任务,三种不同工作流

需要在陌生领域进行广泛发现:选 OpenScholar

如果你还不知道哪些论文应该纳入答案,就从 OpenScholar 开始。它的大型开放数据存储和专用检索流水线,正是为跨大量论文发现并综合证据而设计的。

面向私有项目文库:选 PaperQA2

如果证据边界就是项目目录中的文件,使用 PaperQA2。建立论文索引,固定来源集合,再调整证据段落数和最终来源数。这样一来,审阅者可以检查答案实际使用的完整语料库。

检索完成后快速写报告:选 AstaBrief 8B

当另一个组件已经完成文献发现工作后,再使用 AstaBrief。相比搭建完整的文献检索系统,如果你更在意延迟、本地控制或报告吞吐量,它会是更直接的选择。

混合技术栈:用 OpenScholar 检索,用 AstaBrief 写作

先通过学术检索器和重排序器整理证据,再把筛选后的摘录交给 AstaBrief 8B,并在发布前单独执行论断—证据支持检查。这样可以结合 OpenScholar 式的文献发现能力和 AstaBrief 紧凑的生成路径,但同时也会带来额外的集成责任,没有哪个单一组件能替你消除这一点。

已发布基准到底能说明什么

Nature和PMC版本的 OpenScholar 论文,提供了与 PaperQA2 最清晰的同基准对比。在 ScholarQABench 上,论文报告的多论文Scholar-CS 评分标准得分为:OpenScholar-8B 51.1,PaperQA2 45.6。在同一张表中,PaperQA2 的引用 F1 略高,达到48.0,OpenScholar-8B 为47.9。论文估算 PaperQA2 的单题成本为0.30–2.30 美元,而 OpenScholar-8B 在论文成本假设下为0.003 美元。

已发布的 ScholarQABench 结果OpenScholar-8BPaperQA2
Scholar-CS 评分标准得分51.145.6
Scholar-CS 引用 F147.948.0
预估单题成本$0.003$0.30–$2.30

这些数字并不是适用于所有场景的排行榜。由于 PaperQA2 自有的数据存储并未公开,论文使用了 OpenScholar DataStore 对 PaperQA2 进行评估。评测还采用了特定模型和配置。更重要的是,已发布的对比并未在同一套 ScholarQABench 设置下纳入 AstaBrief 8B。AstaBrief 的速度和质量结果来自 Ai2 面向 Asta 的专项评测,因此不能据此确定它在 OpenScholar 和 PaperQA2 之间的排名。

论文还指出,PaperQA2 的回答通常具有较高的引用准确性,但经常只依赖一篇或少数几篇论文,因此在覆盖范围和多论文组织方面有所不足。引用精确度和文献覆盖度是两个不同目标。

一套可靠的选择规则

你的约束推荐选择原因
大规模发现未知文献OpenScholar检索和综合能力已经整合在一起
将证据集合限制在本地文件夹内PaperQA2语料库、索引和设置均由用户控制
根据已提供的证据快速生成报告AstaBrief 8B紧凑的单轮报告生成
在防火墙后使用开放权重模型AstaBrief 8B 或 OpenScholar-8B模型产物开放,但周边技术栈仍然重要
根据已知段落审计每一条论断PaperQA2 或混合方案本地索引和明确的证据控制有助于审阅
本地推理可行,并希望尽量降低成本OpenScholar-8B;单独测试 AstaBrief已发布的成本数据无法直接比较

在真正信任这三个系统中的任何一个之前,都应核查检索边界、引用支撑、文献覆盖范围、论断范围,以及语料库和设置是否具备可复现性。

常见问题

AstaBrief 8B 能替代 OpenScholar 吗?

不能。AstaBrief 8B 主要是一个接收检索摘录并生成报告的模型,而 OpenScholar 则包含科研数据存储、检索、重排序和自反馈工作流。AstaBrief 可以替代生成层的一部分,但不会自动替代完整的文献发现技术栈。

AstaBrief 8B 会自己检索论文吗?

AstaBrief 的官方描述是:模型接收一个研究问题和已检索到的文献摘录。检索工作由周边的 Asta/ScholarQA 工作流提供,或者由你自行搭建的独立流水线完成。

哪个系统的引用准确率最高?

已发布的 ScholarQABench 表格显示,PaperQA2 的引用 F1 略高于 OpenScholar-8B,分别为 48.0 和 47.9;而在 Scholar-CS 评分标准上,OpenScholar-8B 得分更高,分别为 51.1 和 45.6。该对比中没有 AstaBrief 的同基准结果。

PaperQA2 能完全在本地运行吗?

PaperQA2 支持本地模型服务器、本地嵌入、本地索引和本地文档集合。但要实现完全本地部署,仍取决于你选择的解析器、嵌入模型、LLM 质量、硬件和具体配置。

哪个系统最适合系统综述?

任何一个系统都不应取代注册的综述方案、人工筛选和引用核查。如果重点是文献发现,OpenScholar 更适合作为广泛检索的起点;如果已经有预先确定的证据库,PaperQA2 能提供更严格的语料库控制;AstaBrief 则适合在证据集合整理完成后辅助起草。

如果只用一句话概括:当最难的是找到正确文献时,选OpenScholar;当最难的是控制已知语料库时,选PaperQA2;当检索已经解决、报告生成延迟成为瓶颈时,选AstaBrief 8B。