AstaBrief 8B、OpenScholar、PaperQA2は、科学分野向けAIの候補として一括りにされがちです。しかし実際には、研究ワークフローの異なる地点からスタートするシステムです。幅広い文献を引用付きでまとめるならOpenScholar、管理下にあるPDFコレクションを扱うならPaperQA2、検索基盤がすでに整っていてレポートを素早く生成したいならAstaBrief 8Bが向いています。 モデルサイズの違いよりも、どこまでを担当するツールなのかを見極めることが重要です。
3つのシステムは、出発点がそれぞれ違う
| システム | 入力の起点 | 検索範囲 | 主な出力 | 最初に適した用途 |
|---|---|---|---|---|
| AstaBrief 8B | 研究上の問いと、検索済みの抜粋 | 周辺のAsta/ScholarQAワークフロー、または独自パイプラインが用意 | 引用付きの高速レポート | 検索後のレポートを素早く生成する |
| OpenScholar | 科学分野の問い | OpenScholar DataStore、検索器、再ランキングモデル、その他の検索ソース | 長文の引用付き文献統合 | 幅広い文献を検索・統合する |
| PaperQA2 | 質問と、文書ディレクトリまたはコーパス | ローカルインデックス、メタデータ検索、埋め込み、再ランキング、エージェント型検索 | 根拠に基づく引用付き回答 | 管理下の文書群に繰り返し質問する |
大規模な組み込みコーパスは、文献発見の幅と引き換えに準備時間が増えます。一方、手元のファイルを使う方式は、検索範囲が狭くなる代わりに根拠を厳密に管理できます。
AstaBrief 8B:検索済みの情報からレポートを素早く仕上げる
AstaBrief 8Bは、Ai2が公開したコンパクトなレポート生成モデルです。公式発表では、入力は研究上の問いと検索済み文献の抜粋とされており、単独で論文を探す検索サービスとして位置付けられているわけではありません。モデルはApache 2.0モデルライセンスで提供され、研究者が保有するPDFからレポートを作成するための学習データとサンプルワークフローもAi2から公開されています。
Ai2の報告によると、Astaのパイプライン全体の平均処理時間は、Fastモードで51.1秒、Thinkingモードで178.5秒でした。この比較では約3.5倍高速です。ただし、これはパイプライン単位の測定値であり、あらゆるローカル環境で同じ推論速度が得られることを意味しません。
AstaBriefは、検索済みの文章、安定した引用ID、主張と根拠を確認する工程がすでに用意されているパイプラインに適しています。OpenScholarのデータストアや検索基盤を単独で置き換えるものと考えるべきではありません。必要な抜粋が渡されなければ、検索結果に含まれなかった論文をレポート生成側で見つけることはできないからです。
インストールやローカルデプロイの詳細は、AstaBrief 8Bのレビューとローカルデプロイガイドも参照してください。
OpenScholar:広範な文献を探して統合するワークフロー
OpenScholarは、4,500万本のオープンアクセス論文と2億3,600万件のパッセージ埋め込みを収録するOpenScholar DataStoreを基盤に、学習済みの検索器、再ランキングモデル、引用付き生成、自己フィードバックループを組み合わせています(Nature)。
次のような問いから始めるなら、OpenScholarが有力な出発点です。
- 「複数のサブフィールドにまたがる文献は、何を示しているのか?」
- 「広く、変化の速い研究領域で手法を比較したい」
- 「統合レポートを書く前に、関連論文を見つけたい」
Nature論文によると、コンピューターサイエンスのアブレーションでは、検索を組み合わせた構成が49.6のcorrectnessと47.6のcitation F1を記録し、ウェブ検索のみ、Semantic Scholarのみの構成を上回りました。大規模なデータストア、検索器、再ランキング、フィードバックループを動かすには、小規模なレポートモデルより多くのインフラが必要です。8Bチェックポイントだけを実行しても、システム全体を再現したことにはなりません。
PaperQA2:管理下のローカル文書群に強い
PaperQA2は、文書を根拠に回答する研究ワークフローを中心に設計されています。PDF、Markdown、HTML、Officeファイル、ソースコード、画像、表を解析し、候補となる文章を検索、文脈付き要約を作成し、根拠を再ランキングしたうえで引用付きの回答を生成できます。ローカルモデルとLiteLLM互換プロバイダーにも対応していますが、ドキュメントに記載されたデフォルト設定では、ホスト型モデルと埋め込みモデルが使われます。
PaperQA2では、文書ディレクトリを指定して再利用可能なインデックスを作成し、モデル、埋め込み、根拠の件数、ソース数の上限を調整できます。リポジトリに記載されたデフォルトは根拠パッセージ10件、回答に使うソース最大5件です。高品質設定では、より多くの根拠を使う分、コストも増えます。
そのため、PaperQA2は次のような用途に向いています。
- 研究室内の非公開PDFや未発表資料。
- プロジェクト専用のエビデンスセット。
- 同じ文書コレクションに対して繰り返し質問する運用。
- PDF内の図、表、メタデータ、ページ参照を扱うワークフロー。
一方で、プロバイダーと設定への依存は残ります。PaperQA2自体はオープンソースですが、最終的な品質とコストは、選択したLLM、埋め込みモデル、パーサー、コーパス、各種設定によって変わります。公式リポジトリも、質問1件あたりの固定価格を提示していません。
「デフォルト設定ではOpenAIのモデルとNumPyベクトルデータベースを使いますが、代替LLM、埋め込みモデル、ベクトルストア、ローカルサーバーにも対応できるよう設計されています」— FutureHouse、PaperQA2ドキュメント
同じ研究課題でも、選ぶワークフローは変わる
未知の分野を広く調べるなら:OpenScholar
回答に含めるべき論文がまだ分からないなら、OpenScholarから始めましょう。大規模なオープンデータストアと専門化された検索パイプラインは、多数の論文から根拠を探し出し、統合するために作られています。
非公開のプロジェクトライブラリなら:PaperQA2
根拠の範囲をプロジェクトのディレクトリ内に限定したいなら、PaperQA2を使います。論文をインデックス化し、ソースセットを固定したうえで、根拠パッセージ数と最終的なソース数を調整できます。回答に使われたコーパスをレビュアーが確認できる点も利点です。
検索後のレポートを素早く作るなら:AstaBrief 8B
文献の発見を別のコンポーネントに任せられるなら、AstaBriefを使います。レイテンシ、ローカルでの制御、レポート生成量を、完全な文献検索システムの構築より重視する場合に適した選択肢です。
ハイブリッド構成なら:OpenScholarで検索し、AstaBriefで執筆
学術向けの検索器と再ランキングモデルで根拠を集め、選んだ抜粋をAstaBrief 8Bに渡し、公開前に別工程で主張と根拠の対応を確認します。OpenScholarのような文献発見力とAstaBriefのコンパクトな生成経路を組み合わせられますが、統合部分の設計と検証は別途必要です。
公開ベンチマークから読み取れること
Nature版とPMC版のOpenScholar論文には、PaperQA2との同一ベンチマーク比較として最も明確な結果が掲載されています。ScholarQABenchの複数論文タスクにおけるScholar-CS rubricスコアは、OpenScholar-8Bが51.1、PaperQA2が45.6でした。一方、citation F1はPaperQA2がわずかに上回り、OpenScholar-8Bの47.9に対して48.0です。論文では、PaperQA2の推定コストを質問1件あたり$0.30–$2.30、OpenScholar-8Bを論文のコスト前提で$0.003としています。
| 公開済みのScholarQABench結果 | OpenScholar-8B | PaperQA2 |
|---|---|---|
| Scholar-CS rubricスコア | 51.1 | 45.6 |
| Scholar-CS citation F1 | 47.9 | 48.0 |
| 質問1件あたりの推定コスト | $0.003 | $0.30–$2.30 |
ただし、これらの数値を普遍的なランキングと見なすことはできません。PaperQA2の独自データストアは公開されていなかったため、論文ではOpenScholar DataStoreを使って評価しています。また、評価には特定のモデルと設定が使われています。特に重要なのは、公開された比較に同じScholarQABench環境でのAstaBrief 8Bの結果が含まれていないことです。AstaBriefの速度と品質に関する結果はAi2のAsta向け評価から得られたものであり、OpenScholarやPaperQA2に対する順位を示すものではありません。
論文ではさらに、PaperQA2の回答は引用の正確性が高い一方、1本または少数の論文に依存することが多く、文献のカバレッジや複数論文の整理では不利になったと説明しています。引用の精度と、文献を幅広くカバーすることは別の目標です。
迷ったときの選び方
| 重視する条件 | おすすめ | 理由 |
|---|---|---|
| 未知の文献を広い範囲から探す | OpenScholar | 検索と統合が一体化している |
| 根拠をローカルフォルダー内に限定する | PaperQA2 | コーパス、インデックス、設定を利用者が管理できる |
| 渡した根拠から素早くレポートを作る | AstaBrief 8B | コンパクトなワンパス型レポート生成 |
| オープンウェイトでファイアウォール内に構築する | AstaBrief 8BまたはOpenScholar-8B | オープンなモデル成果物を使える。ただし周辺のスタックも重要 |
| すべての主張を既知の文章と照合する | PaperQA2またはハイブリッド構成 | ローカルインデックスと明示的な根拠管理がレビューを助ける |
| ローカル推論が可能な環境でコストを抑える | OpenScholar-8B。AstaBriefは別途検証 | 公開されているコスト数値は直接比較できない |
3つのいずれを使う場合も、検索対象の境界、引用の裏付け、文献のカバレッジ、主張の範囲、コーパスと設定の再現性を確認してから結果を信頼するようにしましょう。
FAQ
AstaBrief 8BはOpenScholarの代わりになりますか?
いいえ。AstaBrief 8Bは主に、検索済みの抜粋を受け取ってレポートを生成するモデルです。一方のOpenScholarは、科学文献向けデータストア、検索、再ランキング、自己フィードバックのワークフローを含みます。AstaBriefが置き換えられるのは生成部分の一部であり、文献発見の仕組み全体ではありません。
AstaBrief 8Bだけで論文を検索できますか?
AstaBriefの公式説明では、モデルは研究上の問いと検索済み文献の抜粋を受け取るものとされています。検索は周辺のAsta/ScholarQAワークフロー、または利用者が構築した別のパイプラインが担当します。
引用の正確性が最も高いのはどれですか?
公開されたScholarQABenchの表では、citation F1はPaperQA2がOpenScholar-8Bをわずかに上回り、48.0対47.9でした。一方、Scholar-CS rubricではOpenScholar-8Bが51.1対45.6で上回っています。この比較には、同じベンチマークで評価されたAstaBriefの結果はありません。
PaperQA2は完全にローカルで動かせますか?
PaperQA2は、ローカルモデルサーバー、ローカル埋め込み、ローカルインデックス、ローカルの文書コレクションに対応しています。ただし完全なローカル構成の品質は、選択するパーサー、埋め込みモデル、LLMの性能、ハードウェア、設定に左右されます。
システマティックレビューに最適なのはどれですか?
いずれも、登録済みのレビュー計画、人によるスクリーニング、引用確認の代わりにはなりません。文献発見ならOpenScholarが幅広い検索の出発点として適しており、あらかじめ定めたエビデンスライブラリを使うならPaperQA2のほうがコーパスを厳密に管理できます。AstaBriefは、根拠となる文献群を集めた後の草稿作成に役立ちます。
結論を一文でまとめるなら、適切な文献を見つけることが最大の課題ならOpenScholar、既知のコーパスを管理することが最大の課題ならPaperQA2、検索が解決済みでレポート生成の速度がボトルネックならAstaBrief 8Bを選ぶのがよいでしょう。