AIREITER

AstaBrief 8B、OpenScholar 與 PaperQA2:研究工作流程比較

最近更新: 2026-10-02 19:20:35

AstaBrief 8B、OpenScholar 與 PaperQA2 常被放進同一份科學 AI 工具清單,但三者切入研究工作的起點其實不同。若要廣泛搜尋並產出有引用依據的文獻綜整,OpenScholar 是最穩妥的預設選擇;面對一批受控的 PDF,PaperQA2 更實用;AstaBrief 8B 則是檢索流程已經到位後,用來快速撰寫報告的工具。比起模型參數量,先弄清楚這個差異更重要。

三套系統,三種工作起點

系統起始輸入檢索範圍主要輸出最適合的第一個用途
AstaBrief 8B研究問題與已檢索的文獻摘錄由周邊的 Asta/ScholarQA 工作流程或自行建立的 pipeline 提供快速產出的引用式報告檢索完成後快速生成報告
OpenScholar科學問題OpenScholar DataStore、檢索器、重排序器及其他檢索來源具引用依據的長篇文獻綜整跨大量文獻進行搜尋與綜整
PaperQA2問題與文件目錄或語料庫在地索引、 metadata 搜尋、embeddings、重排序及 agentic search附有內文引用、以證據為基礎的回答針對受控文件集合反覆提問

內建語料庫越大,通常越能擴大探索範圍,但前置準備時間也會增加;自行提供檔案則能換來更高的證據掌控度,代價是涵蓋面較窄。

AstaBrief 8B:檢索完成後,專注於快速生成報告

AstaBrief 8B 是 Ai2 推出的精簡型報告生成模型。官方公告將它描述為接收研究問題與已檢索的文獻摘錄,而不是一套能獨立搜尋論文的服務。模型採用 Apache 2.0 模型授權,Ai2 也一併公開了訓練資料,以及一套使用研究人員自有 PDF 產出報告的範例工作流程。

Ai2 表示,完整 Asta pipeline 在 Fast 模式下平均耗時51.1 秒,Thinking 模式則為178.5 秒,在這項比較中約快了3.5 倍。這是整套 pipeline 的測量結果,不能直接視為任何本機部署都能達到的通用推論速度。

AstaBrief 適合已經能提供檢索段落、穩定引用 ID,以及主張與證據支援檢查的 pipeline。它不應被視為 OpenScholar datastore 與檢索堆疊的獨立替代品:如果關鍵段落根本沒有被送入,報告生成器也不可能找回從未提供的論文。

如果想深入了解安裝與本機部署,請參考我們的 AstaBrief 8B 評測與本機部署指南。

OpenScholar:面向廣泛文獻綜整的工作流程

OpenScholar 使用 OpenScholar DataStore,收錄4,500 萬篇開放取用論文與2.36 億個段落 embeddings,並結合訓練過的檢索器、重排序器、具引用依據的生成,以及自我回饋迴圈(Nature)。

遇到以下類型的問題時,OpenScholar 是更好的起點:

  • 「跨越數個子領域後,文獻目前怎麼說?」
  • 「比較一個規模大且持續變動的研究領域中的不同方法。」
  • 「先找出相關論文,再撰寫綜整。」

Nature 論文指出,在電腦科學消融實驗中,整合檢索設定達到49.6 correctness與47.6 citation F1,表現優於僅使用網路及僅使用 Semantic Scholar 的檢索方式。廣泛的 datastore、檢索器、重排序器與回饋迴圈,所需基礎設施自然比小型報告模型更多;只執行 8B checkpoint,並不等於重現完整系統。

PaperQA2:受控在地文件集合的理想選擇

PaperQA2 是以文件為依據的研究工具。它能解析 PDF、Markdown、HTML、Office 檔案、原始碼、圖片與表格,接著找出候選段落、建立上下文摘要、重新排序證據,最後產生附引用的回答。套件支援本機模型與相容於 LiteLLM 的服務商,不過文件所列的預設設定使用的是託管模型與 embeddings。

PaperQA2 允許你指定一個目錄、建立可重複使用的索引,並調整模型、embedding、證據數量與來源上限。儲存庫文件列出的預設值為10 個證據段落與最多 5 個回答來源;高品質設定則會使用更多證據,成本也更高。

因此,PaperQA2 特別適合以下情境:

  • 實驗室的私人或尚未公開 PDF。
  • 特定專案整理出的證據資料集。
  • 針對同一份文件集合反覆提問。
  • 需要處理 PDF 圖表、表格、metadata 或頁碼參照的工作流程。

代價是對服務商與設定的依賴。PaperQA2 雖然是開放原始碼,但最終品質與成本仍取決於所選的 LLM、embedding 模型、解析器、語料庫與各項設定。官方儲存庫並未承諾固定的單題價格。

「預設設定使用 OpenAI 模型與 NumPy 向量資料庫,但這套件的設計支援替代的 LLM、embedding 模型、向量資料庫與本機伺服器。」— FutureHouse,PaperQA2 文件

同一項研究任務,三種不同工作流程

面向陌生領域進行廣泛探索:選 OpenScholar

如果你還不知道哪些論文應該納入答案,先從 OpenScholar 開始。它的大型開放 datastore 與專門設計的檢索 pipeline,就是為了跨大量論文找出並綜整證據。

面向私人專案文件庫:選 PaperQA2

如果證據範圍就是專案目錄,使用 PaperQA2。建立論文索引、維持穩定的來源集合,再調整證據段落與最終來源的數量。審閱者也能直接檢查回答所使用的確切語料庫。

檢索完成後快速產出報告:選 AstaBrief 8B

當另一個元件已經完成探索工作後,再交給 AstaBrief。若延遲、本機控制或報告產量,比建立一整套完整的文獻搜尋系統更重要,它會是最俐落的選擇。

混合式堆疊:用 OpenScholar 檢索,再用 AstaBrief 撰寫

先透過學術檢索器與重排序器整理證據,再把選出的摘錄交給 AstaBrief 8B,出版前另行執行主張與證據支援檢查。這種做法結合了 OpenScholar 式的探索能力與 AstaBrief 精簡的生成流程,但也帶來整合責任,沒有任何單一元件能替你消除這項工作。

已發表的基準測試,實際能證明什麼?

OpenScholar 論文的 Nature 與 PMC 版本,提供了 PaperQA2 最清楚的同基準比較。在 ScholarQABench 上,已公布的多論文 Scholar-CS rubric 分數為:OpenScholar-8B 51.1 分,PaperQA2 45.6 分。在該表格中,PaperQA2 的 citation-F1 略高,為48.0 對 OpenScholar-8B 的 47.9。論文估算 PaperQA2 的成本為每題 $0.30–$2.30,而 OpenScholar-8B 在論文採用的成本假設下為$0.003。

已發表的 ScholarQABench 結果OpenScholar-8BPaperQA2
Scholar-CS rubric 分數51.145.6
Scholar-CS citation F147.948.0
估計每題成本$0.003$0.30–$2.30

這些數字不是適用所有情境的排行榜。論文使用 OpenScholar DataStore 評估 PaperQA2,因為 PaperQA2 自己的 datastore 並未公開;評估也採用了特定模型與設定。更重要的是,這項已發表的比較並未在相同的 ScholarQABench 設定中納入 AstaBrief 8B。AstaBrief 公布的速度與品質結果來自 Ai2 針對 Asta 所做的評估,因此不能用來判定它相對於 OpenScholar 與 PaperQA2 的排名。

論文也指出,PaperQA2 的回答雖然引用準確度高,但往往只依賴一篇或少數幾篇論文,因而降低了涵蓋度與多論文組織能力。引用精確度與文獻涵蓋範圍是兩個不同目標。

一套可靠的選擇規則

你的限制條件建議選擇原因
大規模探索未知文獻OpenScholar檢索與綜整已整合在同一套流程
將證據集合限制在本機資料夾內PaperQA2語料庫、索引與設定都由使用者控制
根據已提供的證據快速產出報告AstaBrief 8B精簡、單次完成的報告生成
在防火牆後使用開放權重模型AstaBrief 8B 或 OpenScholar-8B模型資產開放;但周邊堆疊仍然重要
逐一根據已知段落稽核每項主張PaperQA2 或混合式方案在地索引與明確的證據控制有助於審查
在可行本機推論的前提下壓低成本OpenScholar-8B;另行測試 AstaBrief已公布的成本數字不能直接比較

在信任這三套系統之前,先確認檢索邊界、引用支援、文獻涵蓋度、主張範圍,以及語料庫與設定是否能重現。

常見問題

AstaBrief 8B 能取代 OpenScholar 嗎?

不能。AstaBrief 8B 主要是消化檢索摘錄、生成報告的模型;OpenScholar 則包含科學 datastore、檢索、重排序與自我回饋工作流程。AstaBrief 可以取代生成層的一部分,但不會自動取代完整的文獻探索堆疊。

AstaBrief 8B 會自行檢索論文嗎?

官方對 AstaBrief 的描述,是讓模型接收研究問題與已檢索的文獻摘錄。檢索工作由周邊的 Asta/ScholarQA 工作流程提供,或由你自行建立的獨立 pipeline 負責。

哪一套的引用準確度最好?

已公布的 ScholarQABench 表格顯示,PaperQA2 的 citation-F1 略高於 OpenScholar-8B,為 48.0 對 47.9;但 OpenScholar-8B 在 Scholar-CS rubric 上得分較高,為 51.1 對 45.6。該比較沒有 AstaBrief 的同基準結果。

PaperQA2 能完全在本機執行嗎?

PaperQA2 支援本機模型伺服器、本機 embeddings、本機索引與本機文件集合。不過,完整的本機部署仍取決於你選擇的解析器、embedding 模型、LLM 品質、硬體與設定。

哪一套最適合系統性文獻回顧?

任何一套都不應取代已註冊的回顧研究計畫、人工篩選與引用查核。若著重探索,OpenScholar 是較好的廣泛搜尋起點;若已有預先定義的證據資料庫,PaperQA2 能提供更嚴格的語料庫控制;AstaBrief 則適合在證據集合完成後協助起草內容。

一句話總結:當「找到正確文獻」最困難時選OpenScholar;當「控制已知語料庫」最困難時選PaperQA2;而當檢索已經解決、報告延遲成為瓶頸時,選AstaBrief 8B。