AstaBrief 8B、OpenScholar 與 PaperQA2 常被放進同一份科學 AI 工具清單,但三者切入研究工作的起點其實不同。若要廣泛搜尋並產出有引用依據的文獻綜整,OpenScholar 是最穩妥的預設選擇;面對一批受控的 PDF,PaperQA2 更實用;AstaBrief 8B 則是檢索流程已經到位後,用來快速撰寫報告的工具。比起模型參數量,先弄清楚這個差異更重要。
三套系統,三種工作起點
| 系統 | 起始輸入 | 檢索範圍 | 主要輸出 | 最適合的第一個用途 |
|---|---|---|---|---|
| AstaBrief 8B | 研究問題與已檢索的文獻摘錄 | 由周邊的 Asta/ScholarQA 工作流程或自行建立的 pipeline 提供 | 快速產出的引用式報告 | 檢索完成後快速生成報告 |
| OpenScholar | 科學問題 | OpenScholar DataStore、檢索器、重排序器及其他檢索來源 | 具引用依據的長篇文獻綜整 | 跨大量文獻進行搜尋與綜整 |
| PaperQA2 | 問題與文件目錄或語料庫 | 在地索引、 metadata 搜尋、embeddings、重排序及 agentic search | 附有內文引用、以證據為基礎的回答 | 針對受控文件集合反覆提問 |
內建語料庫越大,通常越能擴大探索範圍,但前置準備時間也會增加;自行提供檔案則能換來更高的證據掌控度,代價是涵蓋面較窄。
AstaBrief 8B:檢索完成後,專注於快速生成報告
AstaBrief 8B 是 Ai2 推出的精簡型報告生成模型。官方公告將它描述為接收研究問題與已檢索的文獻摘錄,而不是一套能獨立搜尋論文的服務。模型採用 Apache 2.0 模型授權,Ai2 也一併公開了訓練資料,以及一套使用研究人員自有 PDF 產出報告的範例工作流程。
Ai2 表示,完整 Asta pipeline 在 Fast 模式下平均耗時51.1 秒,Thinking 模式則為178.5 秒,在這項比較中約快了3.5 倍。這是整套 pipeline 的測量結果,不能直接視為任何本機部署都能達到的通用推論速度。
AstaBrief 適合已經能提供檢索段落、穩定引用 ID,以及主張與證據支援檢查的 pipeline。它不應被視為 OpenScholar datastore 與檢索堆疊的獨立替代品:如果關鍵段落根本沒有被送入,報告生成器也不可能找回從未提供的論文。
如果想深入了解安裝與本機部署,請參考我們的 AstaBrief 8B 評測與本機部署指南。
OpenScholar:面向廣泛文獻綜整的工作流程
OpenScholar 使用 OpenScholar DataStore,收錄4,500 萬篇開放取用論文與2.36 億個段落 embeddings,並結合訓練過的檢索器、重排序器、具引用依據的生成,以及自我回饋迴圈(Nature)。
遇到以下類型的問題時,OpenScholar 是更好的起點:
- 「跨越數個子領域後,文獻目前怎麼說?」
- 「比較一個規模大且持續變動的研究領域中的不同方法。」
- 「先找出相關論文,再撰寫綜整。」
Nature 論文指出,在電腦科學消融實驗中,整合檢索設定達到49.6 correctness與47.6 citation F1,表現優於僅使用網路及僅使用 Semantic Scholar 的檢索方式。廣泛的 datastore、檢索器、重排序器與回饋迴圈,所需基礎設施自然比小型報告模型更多;只執行 8B checkpoint,並不等於重現完整系統。
PaperQA2:受控在地文件集合的理想選擇
PaperQA2 是以文件為依據的研究工具。它能解析 PDF、Markdown、HTML、Office 檔案、原始碼、圖片與表格,接著找出候選段落、建立上下文摘要、重新排序證據,最後產生附引用的回答。套件支援本機模型與相容於 LiteLLM 的服務商,不過文件所列的預設設定使用的是託管模型與 embeddings。
PaperQA2 允許你指定一個目錄、建立可重複使用的索引,並調整模型、embedding、證據數量與來源上限。儲存庫文件列出的預設值為10 個證據段落與最多 5 個回答來源;高品質設定則會使用更多證據,成本也更高。
因此,PaperQA2 特別適合以下情境:
- 實驗室的私人或尚未公開 PDF。
- 特定專案整理出的證據資料集。
- 針對同一份文件集合反覆提問。
- 需要處理 PDF 圖表、表格、metadata 或頁碼參照的工作流程。
代價是對服務商與設定的依賴。PaperQA2 雖然是開放原始碼,但最終品質與成本仍取決於所選的 LLM、embedding 模型、解析器、語料庫與各項設定。官方儲存庫並未承諾固定的單題價格。
「預設設定使用 OpenAI 模型與 NumPy 向量資料庫,但這套件的設計支援替代的 LLM、embedding 模型、向量資料庫與本機伺服器。」— FutureHouse,PaperQA2 文件
同一項研究任務,三種不同工作流程
面向陌生領域進行廣泛探索:選 OpenScholar
如果你還不知道哪些論文應該納入答案,先從 OpenScholar 開始。它的大型開放 datastore 與專門設計的檢索 pipeline,就是為了跨大量論文找出並綜整證據。
面向私人專案文件庫:選 PaperQA2
如果證據範圍就是專案目錄,使用 PaperQA2。建立論文索引、維持穩定的來源集合,再調整證據段落與最終來源的數量。審閱者也能直接檢查回答所使用的確切語料庫。
檢索完成後快速產出報告:選 AstaBrief 8B
當另一個元件已經完成探索工作後,再交給 AstaBrief。若延遲、本機控制或報告產量,比建立一整套完整的文獻搜尋系統更重要,它會是最俐落的選擇。
混合式堆疊:用 OpenScholar 檢索,再用 AstaBrief 撰寫
先透過學術檢索器與重排序器整理證據,再把選出的摘錄交給 AstaBrief 8B,出版前另行執行主張與證據支援檢查。這種做法結合了 OpenScholar 式的探索能力與 AstaBrief 精簡的生成流程,但也帶來整合責任,沒有任何單一元件能替你消除這項工作。
已發表的基準測試,實際能證明什麼?
OpenScholar 論文的 Nature 與 PMC 版本,提供了 PaperQA2 最清楚的同基準比較。在 ScholarQABench 上,已公布的多論文 Scholar-CS rubric 分數為:OpenScholar-8B 51.1 分,PaperQA2 45.6 分。在該表格中,PaperQA2 的 citation-F1 略高,為48.0 對 OpenScholar-8B 的 47.9。論文估算 PaperQA2 的成本為每題 $0.30–$2.30,而 OpenScholar-8B 在論文採用的成本假設下為$0.003。
| 已發表的 ScholarQABench 結果 | OpenScholar-8B | PaperQA2 |
|---|---|---|
| Scholar-CS rubric 分數 | 51.1 | 45.6 |
| Scholar-CS citation F1 | 47.9 | 48.0 |
| 估計每題成本 | $0.003 | $0.30–$2.30 |
這些數字不是適用所有情境的排行榜。論文使用 OpenScholar DataStore 評估 PaperQA2,因為 PaperQA2 自己的 datastore 並未公開;評估也採用了特定模型與設定。更重要的是,這項已發表的比較並未在相同的 ScholarQABench 設定中納入 AstaBrief 8B。AstaBrief 公布的速度與品質結果來自 Ai2 針對 Asta 所做的評估,因此不能用來判定它相對於 OpenScholar 與 PaperQA2 的排名。
論文也指出,PaperQA2 的回答雖然引用準確度高,但往往只依賴一篇或少數幾篇論文,因而降低了涵蓋度與多論文組織能力。引用精確度與文獻涵蓋範圍是兩個不同目標。
一套可靠的選擇規則
| 你的限制條件 | 建議選擇 | 原因 |
|---|---|---|
| 大規模探索未知文獻 | OpenScholar | 檢索與綜整已整合在同一套流程 |
| 將證據集合限制在本機資料夾內 | PaperQA2 | 語料庫、索引與設定都由使用者控制 |
| 根據已提供的證據快速產出報告 | AstaBrief 8B | 精簡、單次完成的報告生成 |
| 在防火牆後使用開放權重模型 | AstaBrief 8B 或 OpenScholar-8B | 模型資產開放;但周邊堆疊仍然重要 |
| 逐一根據已知段落稽核每項主張 | PaperQA2 或混合式方案 | 在地索引與明確的證據控制有助於審查 |
| 在可行本機推論的前提下壓低成本 | OpenScholar-8B;另行測試 AstaBrief | 已公布的成本數字不能直接比較 |
在信任這三套系統之前,先確認檢索邊界、引用支援、文獻涵蓋度、主張範圍,以及語料庫與設定是否能重現。
常見問題
AstaBrief 8B 能取代 OpenScholar 嗎?
不能。AstaBrief 8B 主要是消化檢索摘錄、生成報告的模型;OpenScholar 則包含科學 datastore、檢索、重排序與自我回饋工作流程。AstaBrief 可以取代生成層的一部分,但不會自動取代完整的文獻探索堆疊。
AstaBrief 8B 會自行檢索論文嗎?
官方對 AstaBrief 的描述,是讓模型接收研究問題與已檢索的文獻摘錄。檢索工作由周邊的 Asta/ScholarQA 工作流程提供,或由你自行建立的獨立 pipeline 負責。
哪一套的引用準確度最好?
已公布的 ScholarQABench 表格顯示,PaperQA2 的 citation-F1 略高於 OpenScholar-8B,為 48.0 對 47.9;但 OpenScholar-8B 在 Scholar-CS rubric 上得分較高,為 51.1 對 45.6。該比較沒有 AstaBrief 的同基準結果。
PaperQA2 能完全在本機執行嗎?
PaperQA2 支援本機模型伺服器、本機 embeddings、本機索引與本機文件集合。不過,完整的本機部署仍取決於你選擇的解析器、embedding 模型、LLM 品質、硬體與設定。
哪一套最適合系統性文獻回顧?
任何一套都不應取代已註冊的回顧研究計畫、人工篩選與引用查核。若著重探索,OpenScholar 是較好的廣泛搜尋起點;若已有預先定義的證據資料庫,PaperQA2 能提供更嚴格的語料庫控制;AstaBrief 則適合在證據集合完成後協助起草內容。
一句話總結:當「找到正確文獻」最困難時選OpenScholar;當「控制已知語料庫」最困難時選PaperQA2;而當檢索已經解決、報告延遲成為瓶頸時,選AstaBrief 8B。